兩天議程,一次讀完

每日統整重點

把四個舞台、兩天的內容收斂成幾條反覆出現的主軸,每條主軸都列出背後的相關演講——點任何一個引用都會進到該場的完整筆記。

8 月 1 日(六)

第一天把技術棧從算力底層一路走到研究前沿,貫穿全場的主旋律是:模型能力本身已不是瓶頸,瓶頸移到了環境、驗證與控制權的設計。

算力天花板下的基礎設施

DeSantis 開場定調「約束驅動創新」:電力、晶片與供應鏈的限制形塑了 AI 系統問題的樣貌。基礎設施這條線從加速運算、給 agent 的實驗記錄本,一路到 Stoica 指出 coding agent 的兩個根本缺口、光子運算,以及「Kubernetes 到底適不適合 agent 形狀的工作負載」。

軟體工程被重寫:從寫程式到設計環境

全天最明確的共識:人的工作已經從「寫程式」變成「設計 agent 所處的環境」。Steinberger 跑 20 小時的 loop、同時開 64 個 sub-agent;Lopopolo 主張要能像 prompt 資深工程師一樣懶散地 prompt agent;Catasta 的北極星是把 prompting 整個廢掉;Nexus 舞台上 Cognition 分享訓練 coding agent 的 RL 教訓,Yutori 則主張 computer-use 模型會 agent 化整個 web 而非 API。

安全:連考場都成了攻擊面

Dawn Song 的 keynote 是全天資安線的錨點:agent 的彈性就是攻擊面,OpenAI–Hugging Face 沙盒逃逸事件證明連評估基礎設施本身都會被打穿,出路是自動化 red teaming 加上可證明安全的程式碼。Zaremba 把安全重新框成「火」式的 resilience——是生態系而非銀彈;Nexus 資安場次則從 runtime guardrails、供應鏈攻擊一路談到 agent 叛變。

機器人與世界模型:模擬是新的基礎建設

Levine 論證 robot foundation models,Jim Fan 描繪機器人的終局;Fidler 把模擬分成三個世代——美術手刻、NeRF 重建、生成式世界模型,而生成式這代在一年內從「5 秒影片跑 5 分鐘」進化到消費級顯卡即時。Sony AI 的桌球機器人與 Waymo 的實體自主性教訓,把「可信任」拉回物理世界。

AI for Science 的分進合擊

Nexus 整個上午都在談科學發現:Buehler 的 multi-agent swarms 與大型推理模型、Zou 談 agent 的集體智慧、Princeton 的 LabOS AI-XR co-scientist(看得見、能與人並肩工作)、Rose Yu 的 agentic co-scientists,以及 Goodfire 主張從超人 AI 身上把科學「學回來」。

RSI 與長視野:興奮與剎車並存

第一天對「遞迴自我改進」的態度是興奮與剎車並存:Song×Sekhon 的對談為「Foom」除魅,Vinyals 指出 RSI 會被「評估與 ideation 其實很難」卡住,Tworek 盤點長視野 agent 的機會與失敗模式,Ng 則在壓軸對談裡捍衛「AGI 還要數十年」的定義與 open models。

8 月 2 日(日)

第二天轉向落地:企業治理、評估方法學,以及把 agent 放進金融、科學與生產系統的實務。全天的主旋律是「先量測、再放權」。

治理是企業採用的瓶頸

Ironclad CTO 開場定框:AI 採用的限速器是組織,不是技術。Google Cloud 談 agent governance、HubSpot 解釋現成 AI 為何撞牆、Credo AI 提出「掙來的自主權」——把 can/may/act 的授權階梯直接編譯進 harness、Dan Klein 對比超智慧與超可靠,Salesforce 則把人留在迴圈裡。

評估成為主戰場

兩個舞台各排了一整個場次談評估:Atlas 上有 Agent Arena 的真實世界因果評估、benchmark 的藝術與科學、evals-first 與 spec-driven agents;Compass 則有 DigitalOcean 的「偏好 > benchmark」、企業部署前的入職考、ScarfBench 的企業 Java 遷移與 Hex 的「分數根本不重要」。共同判詞:benchmark 分數不等於生產環境的可靠度。

前沿研究:個人化 agent 與科學發現

Socher 提出 Eureka Machine——用於科學的遞迴超智慧;Ed Chi 描繪個人化通用 agent 的未來;Periodic Labs 用「實驗 × LLM × 理論」找量子材料;Babuschkin 主張個人 AI 需要持續學習。數學場次把視野拉得更遠:從稀疏獎勵的長視野任務到 unit distance conjecture。

信任、深偽與人

Compass 的安全場把「信任」談了一輪:Bregler 講配上新工具的 agent 如何反制深偽並補上脈絡、受監管領域的可信 agent、ARIA 的「機器速度下的 agent 社會」、Lawrence 的 viable systems 與判斷力,以及 computer-use agent 的持續學習與安全拉鋸。

Agentic 經濟:錢包、銀行與新創

Circle 描繪 agent 直接交易的經濟需要什麼支付軌道、Wells Fargo 重新想像銀行、Capital One 分享企業前沿,金融座談則衡量「錢以 agent 速度移動」時規則怎麼變——最後由 12 家新創的 spotlight 為峰會收尾。

把 agent 開進生產環境

系統這條線非常具體:Nvidia 用 agent 蓋生產 AI 系統的教訓、Postman 從 demo 走到可靠基礎設施、Factory 的軟體工廠、SK hynix 的 rack 級共享記憶體 KV cache 分離式 serving——還有 Invoca 的提醒:「agentic AI 是一個偽裝成技術突破的 UX 問題」。