演講 Session 2: Frameworks & Dev Platforms
Agent 的學習,是把資訊壓縮成一個可執行的推理結構
Nilou Salehi — Associate Professor, UC Berkeley
模型在做的、harness 在做的,本質是同一件事——把大量資訊壓縮成可執行的形式;而對那些必須高度一致、可解釋、長期跑的企業流程,最適合的可執行形式是一張由 agent 自己搭建的 reasoning graph。
TL;DR
- 統一視角:我們這些年在解的問題其實只有一個——壓縮資訊。模型在做的是這件事,harness 在做的也是這件事:把大量資訊壓成一個可執行的格式(transformer 是可執行的,它預測下一個 token)。
- 接下來的關鍵題:會出現愈來愈多做這件事的架構,所以第一個要解的問題是——流程有哪些類型,每一類的最佳架構 / harness 是什麼。
- Reasoning graph:一張由 agent 組成的圖。最底層負責連接原始資料所在的各種系統並理解資料,中間層負責推理,最上層負責在對的時間採取對的行動;從底到頂的任一條路徑就是一條可能的推理路徑。適用於「需要反覆執行且要求極高一致性」的流程。
- 由 agent 來建圖:這張圖不該由人手寫,而是由一個 architect agent 建出來,形成「agent 與 harness 之間的 handshake」——而且每建一次就變得更會建(compounding intelligence 進到模型權重裡)。
- 戰績(invoice matching):baseline agent harness 即使用 Fable 也只做對約 40%;他們的 reasoning graph 做到 99.9% 準確率,96% 的案例還能正確解釋決策理由;某 Fortune 500 客戶單張發票處理成本從 5 美元 → 1.5 美元 → 本週的 10 美分。
重點整理
一切都是壓縮(約 00:44)
Salehi 的開場命題很簡潔:我們多年來在解的那個問題,就是壓縮資訊。因為說到底,模型做的就是這件事,harness 做的也是這件事——我們只是不斷找出新方法,把大量資訊壓縮成一個可執行的格式。transformer 模型就是可執行的,它執行的方式是預測下一個 token。
接下來幾年會出現愈來愈多、以更複雜方式做這件事的架構。所以首先要解的問題是:流程有哪些種類,而每一種流程的最佳架構或 harness 是什麼?
Reasoning graph:一張由 agent 構成的圖(約 00:44–00:46)
她分享團隊做得很成功的一種:reasoning graph——圖上的每一個圓圈都是一個 agent。他們發現對於需要反覆執行、且要求極高一致性的流程,這是非常好的架構。
分層結構是:
- 最底層:一層 agent 只做一件事——連接到原始資料所在的各個系統,並理解那些原始資料。
- 中間層:負責推理的 agent。
- 最上層:在對的時間採取對的行動的 agent。
任何一條從底層走到頂層的路徑,就是一條可能的推理路徑。她也指出當天其他場次出現過同一個想法的不同變體——這些路徑可以平行跑,也可以用各種方式最佳化。
那麼,這張圖怎麼生出來?必須由 agent 來做。她預期未來會愈來愈常看到「agent 與 harness 之間的 handshake」:那個 agent 被訓練成非常懂得怎麼和特定 harness 協作;而不同架構會擅長不同類型的流程。
他們投入最多的是一個 architect agent,負責處理那些必須高度一致且可解釋的流程——財務流程、供應鏈,或任何公司需要一遍又一遍跑下去的東西:非確定性、仍需要智能,但必須高度一致並且說得出理由。
成果:一致性非常高——在某些例子或 benchmark 上,連 Fable 都只能做到約 40–70% 準確率,他們可以穩定超過 95%;速度也很快。而且整個 harness 的生成過程沒有寫任何 custom code,全部是 architect agent 與這個 harness 協作的產物,所以新的 use case 幾週就能上線。
她認為這個架構最重要的部分是 compounding intelligence,而且它累積在模型的權重裡:architect 每接一個新 use case、為它建一張 reasoning graph 並學會怎麼建,它就更會建。
案例:invoice matching(約 00:47–00:49)
她挑了一個具體流程說明:發票比對。
超大型企業每個月要處理數百萬張發票,而決策看似很簡單——付,或不付。難點在兩邊都不能鬆:他們會收到一定比例的詐欺發票,所以不能全付;但也不能拖太久,因為沒有按時付款會影響整條供應鏈。
流程本身是:收到發票 → 比對到採購單(PO)→ 正規化 → 處理大量例外。例外多到令人頭痛:單位不同、幣別不同、某些地區有稅。她說有一個例子她印象特別深刻也覺得特別好笑——如果貨品是液體,發票金額比採購單少最多 5% 是可以接受的,但只限夏季,因為會蒸發掉一些,你也拿它沒辦法。
所以 agent 必須持續學習:這不是一次性的 one-shot learning,也不是在單一 session 裡發生的事,而是一個橫跨數週數月的長程流程;每遇到一個例外,就得從中學到東西。
數字:
- 一個 baseline agent harness,即使用 Fable,也只做對約 40%。
- 他們的 architect agent 為這個流程建出的 reasoning graph——包含大量 agent、它們的接線、各自的 instruction、每個 agent 該用哪個模型、每個 agent 自己的長期記憶——這些工程決策全部由 agent 做。
- 結果在真實資料上達到 99.9% 準確率,第一版圖一週內就上線,而且 96% 的案例不只給出正確決策,還能正確解釋這個決策為什麼成立。
- 成本:某 Fortune 500 客戶單張發票的處理成本從 5 美元降到 1.5 美元,而就在本週再降到 10 美分。
結語:能把學到的東西壓縮成一個可重複使用的結構,就能做到這種級別的進展。
金句
"The whole problem that we're all solving and have been solving for years now is compressing information."(約 00:44)
整場演講的第一句,也是它的全部論點。
"If it's liquid, it's okay if the amount on the invoice is up to 5% less than what was on the purchase order — but only during summers, because some of it evaporates and there's nothing you can do."(約 00:47)
一個很好笑但很真實的例子,說明為什麼企業流程沒辦法一次學完:規則本身就是這樣長出來的。
提到的專案與資源 / Projects & Resources
| 名稱 Name | 說明 | Description | 備註 Notes |
|---|---|---|---|
| Across AI | 講者自述其共同創辦的公司,主打企業級 reasoning graph 架構 | The company she co-founded, built around enterprise reasoning-graph architecture | 字幕作 "Across AI";公開資料顯示為 UC Berkeley I School 與 USC 教授共同創辦 |
| Reasoning graph | 分層的 agent 圖:資料理解層 → 推理層 → 行動層;任一底到頂路徑為一條推理路徑 | Layered graph of agents — data understanding, reasoning, action — where any bottom-to-top path is a reasoning path | 由 architect agent 自動生成 / generated by the architect agent |
| Architect agent | 為特定流程自動建構 reasoning graph(含接線、instruction、選模型、長期記憶)的 agent | Agent that builds the reasoning graph for a process: wiring, instructions, model choice per agent, long-term memory | 每建一次就更會建 / improves with each use case |
逐字稿勘誤 / Transcript Corrections
| 字幕原文 Heard as | 應為 Should be |
|---|---|
| professor Neu / My name is Nio | Nilou Salehi |
| Across AI(字幕正確) | — |
| transforming model | transformer model |
| oneshot | one-shot |
待確認 / To Verify
- 職稱衝突:她在台上自述為 Across AI 的 co-founder and CEO;而 2024–2025 年的公開資料顯示 Across AI 由 UC Berkeley 的 Niloufar Salehi(co-founder / CPO)、USC 的 Afshin Nikzad(CTO)與 Steven Mih(CEO)共同創辦。角色可能已變動,需查證。frontmatter 依官網議程列 UC Berkeley 職稱。/ Title conflict: on stage she introduced herself as co-founder and CEO of Across AI, while public 2024–2025 material lists her as co-founder/CPO with Steven Mih as CEO. Roles may have changed; the frontmatter follows the official agenda.
- 議程姓名為 "Nilou Salehi",公開學術資料多作 Niloufar Salehi。/ The agenda uses "Nilou Salehi"; academic sources generally use Niloufar Salehi.
- 「even Fable can only hit about 40 to 70%」所指的 benchmark 未在台上點名。/ The benchmark behind the "even Fable only hits 40–70%" claim was not named.
- 99.9% 準確率與 96% 可解釋率的評估設定(資料量、切分方式)未說明。/ The evaluation setup behind the 99.9% accuracy and 96% explanation figures was not described.