主題演講 Session 2: Robotics & World Models
真實世界中值得信任的 Agent:物理自主性給 Agentic AI 時代的教訓
Vincent Vanhoucke — Distinguished Engineer, Waymo
Waymo 就是一家 agentic AI 公司,只是它的 agent 是四個輪子的金屬塊;而機器人領域二十年來踩過的坑——可靠度的「九」要靠重新設計系統換來、Level 3 是最難受的位置、逐步最佳化必然漂移——現在正一模一樣地打在 agentic AI 身上,而共同的解方是你得先有一個世界模型。
TL;DR
- Waymo 是一家 agentic AI 公司:數千個 agent 在真實世界執行超長 horizon 的任務直到完成,服務付費客戶,完全自主,目前在 11 個城市。目標是「成為世界上最值得信任的駕駛」。
- 信任不只等於安全:一致性、可重複性、可預測性——這些正好也是我們信任 agent 的因素。
- 可靠度是一場「九的遊戲」:從 99% 走到 99.9% 再到 99.999%,每多一個九通常要換一個不同的解法,不是把模型調好一點就能換來,而是要為那個可靠度等級重新設計整個系統。
- Level 3 是個怪物:人機交替負責的混合狀態對認知負荷、安全與生產力都很糟;而且 Level 2 和 Level 4 是完全不同的物種,你不可能從 L2「逐步升級」到 L4——這在 coding agent 上完全重演。
- 逐步最佳化會漂移(dagger problem):多步系統若只最小化每一步的誤差,誤差會高度相關,最後系統跑到完全不對的地方。這正是要做長 horizon 規劃與 RL 的理由。
- Waymo World Model:以 Google DeepMind 的 Genie 3 為底座,適配到 Waymo 的相機與光達,做到 realism、controllability、generalization 三件事,支撐長 horizon 的閉環評估與模擬。
- 對虛擬 agent 開發者的一問:「你的世界模型是什麼?」你有沒有對自己環境的高保真模擬?那是長 horizon 規劃與韌性的關鍵。
重點整理
Waymo 就是 agentic AI(約 00:29–00:31)
開場他就把定位講清楚:「我想這群人不需要我介紹 Waymo,但如果你不知道——Waymo 是一家 agentic AI 公司,只是我們的 agent 是又大又漂亮的金屬塊,有四個輪子,在你家附近開來開去。」
現況:數千個 agent 在真實世界運作,執行非常長 horizon 的任務直到完成,服務真實的付費客戶,完全自主。目前 11 個城市,計畫擴張到更多美國城市與海外。
目標是「autonomy at scale」與「成為世界上最值得信任的駕駛」。他特別強調 trust 不只是安全:還包括一致性、可重複性、可預測性——「而這些正好是我們信任 agentic agent 的同一批因素。」
他也給出這場演講的整體立場:physical AI 和 agentic AI 之間有大量可對應之處。「如果我跟做機器人的朋友聊,他們看今天 agentic AI 的世界會會心一笑,因為我們過去 20 年在機器人裡遇到的所有難題,在 agentic AI 裡全部再現一次。」核心都是同一件事:怎麼做出一個既有足夠 affordance 去做有趣的事、又能被信任、能在真實世界穩定一致地演進的系統。
鏡頭一:工業自動化——「九的遊戲」(約 00:32–00:33)
工業自動化的本質,是把一堆「大多時候能work、但偶爾會失敗」的零件串成產線,並讓整體達到極高的可靠度、安全性、自主性,而且要撐住很長的時間尺度與規模。
他只挑一個教訓講:這一切是一場「九的遊戲」(a game of nines)。
在某個規模下,99% 的可重複性你可以將就;一旦放大,你就需要 99.9%、99.999%,以此類推。而每多一個九,通常意味著你需要一個不同的解法。
關鍵在於:你多賺到的那一個九,不是靠把系統改好一點、換個更好的模型、把錯誤率壓低一點換來的;你必須為你要的那個可靠度等級重新設計你的系統。
鏡頭二:自主性等級——Level 3 是個怪物(約 00:33–00:35)
自駕有 L0–L5 五個等級,從無自動化、駕駛輔助,一路到 Waymo 所在的 L4 高度自動化。他指出 coding agent / AI agent 有完全一樣的分級光譜:從你自己手寫每一行程式,到「直接 YOLO,讓 agent 全部寫」。
兩個從自駕搬過來的教訓:
- Level 3 是個怪物,而且待起來很不舒服——對認知負荷很糟、對安全很糟、對生產力很糟。「當大家從 code completion 走向 agent 時,我們在 agentic AI 裡也看到同一件事:有時候人在負責、有時候 agent 在負責,這兩者之間的介面非常難受。」
- L2 和 L4 是完全不同的物種:設計決策不同、做法不同,你沒辦法從 L2 一路「畢業」到 L4,你得徹底重新思考整個系統。 同理,今天的 agentic 系統並不是舊的 code completion 系統的加強版。
鏡頭三:動態系統——長 horizon 需要不同的獎勵(約 00:35–00:37)
控制理論在機器人領域研究的是非線性動態系統,而 agentic 系統本質上是極度非線性的動態系統。他認為那套數學未必能直接搬,但概念與思考方式——observability、controllability、stability、realizability(最後這個是「你到底做不做得到這個任務」)——高度相關。
這裡的教訓是:如果你要最佳化閉環行為(也就是長 horizon),你需要的獎勵系統跟最佳化開環時完全不同。
在機器人領域這叫 dagger problem(其他領域另有名字):多步系統若只想最小化每一步的誤差,最後可能犯下高度相關的錯誤,系統跑到跟你想去的地方完全不同的位置。「一次最佳化一步,一直都行不通。」這正是要做長 horizon 規劃、要做 reinforcement learning、要用不同目標函數看待長 horizon 任務的理由。
他們的解法是:仍然一次最佳化一步,但同時去「想像未來」——把長 horizon 攤開,夢出「如果我採取這個行動,長期會長成什麼樣」。這就是 world model 進場的地方。
Waymo World Model:realism、controllability、generalization(約 00:37–00:43)
Waymo 做了自己的世界模型,名字叫 Waymo World Model——「我們非常有創意」(全場笑)。它讓他們能在閉環中、以很好的保真度評估與模擬更長 horizon 的系統行為。
1. Realism(真實性) 起點是一個很好的影片生成模型——Google DeepMind 的 Genie 3。「它有某種物理概念,但它是所有的物理概念:它能處理 Minecraft 的物理,也能處理真實世界的物理。」但 Waymo 要的是真實世界的物理,不是電玩物理;視覺也要真實世界的視覺,不是電玩視覺。所以他們把模型 fine-tune 並適配到 Waymo 的使用情境:接上 Waymo 車上的所有相機,並把光達(lidar)的生成能力嫁接到模型上。他展示了一段 30 秒、完全由世界模型想像出來的場景 rollout。
2. Controllability(可控性) 「你要能想像反事實事件,要能夢出『如果我採取任意一個行動,會發生什麼』。」所以不必照著真實世界實際發生的走:本來右轉,可以改成左轉或直行,而模型仍然算出高保真度的畫面。控制的層次有三種:
- 語言控制:同一個場景改成早上/晚上、改天氣(多雲、起霧)、改物件外觀與整體環境條件。
- 細粒度控制:把某台車從一個車道移到另一個車道,看會發生什麼——模型可以被所有車輛、所有行人、所有車道幾何條件化。
- (加上行駛動作本身的控制。)
3. Generalization(泛化) 「如果我們只能模擬今天在真實世界看得到的資料,那有點用,但世界模型真正發光的時刻,是你能外插到你從未觀察過、甚至永遠不想觀察到的情境。」
他用大象講了一個很好的例子:Waymo 從沒在路上遇過大象。
- 什麼都不做、只用 Waymo 資料訓練 → 你要大象,模型完全給不出大象。
- 稍微調整以提升泛化與世界知識 → 它會非常努力想給你大象,然後以很好笑的方式失敗:你會拿到一台「長得像大象的卡車」,因為它很懂卡車,又對大象的外觀有點概念,但兩者兜不起來。
- 做對了 → 路上出現一頭貨真價實的大象,而且光達從沒看過大象,卻能生成非常合理的光達點雲。
其他外插情境:開過一場大火(從沒經歷過,但並非完全不可能)、金門大橋下雪、有人穿著萬聖節裝扮走過——最後這個其實非常寫實:「每年萬聖節我們都會看到穿著裝扮、有時還處於各種醉態的人在路上走。」
而這正是為什麼語意理解攸關安全:系統必須認出「你在路上看到的這個東西其實是一個人,而且是非常脆弱的用路人」,而不是「一團在街上移動的隨機色塊」。「相當大一部分的安全性,其實來自我們理解場景的語意,而我們得有辦法驗證這一點。」
結尾:對虛擬 agent 開發者的提問(約 00:43)
「physical AI 是把 agentic AI 推到下一個前沿。機器人、自動化、自主性領域有大量教訓可以套用到非物理的 agent 上。」
然後是給全場的那一問:
「我想問在座做 virtual agent 的各位:你的世界模型是什麼? 你對你的環境有沒有一個非常好的高保真模擬?因為那是你能做長 horizon 規劃、能把韌性與長程自主性建進系統裡的關鍵。」
金句
"Waymo is an agentic AI company — except our agents are, you know, big beautiful hunks of metal that have four wheels and are driving around in your neighborhood."(約 00:29)
整場的定位句,也是他後面所有類比的授權書。
"Every nine that you earn is not earned by just improving your system a little bit, getting a better model or reducing the error rate. You have to redesign your system for the level of reliability that you want."(約 00:33)
對「再調一調模型就能上線」最直接的反駁。
"Level three is a weird beast. Level three is not a very pleasant place to be. It's very bad for cognitive load. It's very bad for safety. It's very bad for productivity."(約 00:34)
半自動的交接介面在自駕與 coding agent 上是同一種痛。
"I want to ask the audience that is working on virtual agents: what is your world model?"(約 00:43)
整場演講收在這一問。
提到的專案與資源 / Projects & Resources
| 名稱 Name | 說明 | Description | 備註 Notes |
|---|---|---|---|
| Waymo World Model | Waymo 的生成式世界模型,支撐長 horizon 閉環模擬與評估,可生成相機與光達輸出 | Waymo's generative world model for closed-loop long-horizon simulation and evaluation, generating both camera and lidar | 2026 年 2 月發表 / announced Feb 2026 — waymo.com/blog |
| Genie 3 | Google DeepMind 的通用世界模型,Waymo World Model 的底座 | Google DeepMind's general-purpose world model; the base for the Waymo World Model | 2025 年 8 月發表 / introduced Aug 2025 |
| DAgger problem | 多步系統只最小化每步誤差會產生相關誤差與漂移 | Minimizing per-step error in multi-step systems yields correlated errors and drift | 機器人領域用語,他明說其他領域另有名字 / robotics terminology; he notes other fields name it differently |
| SAE Levels of Autonomy (L0–L5) | 自駕分級,Waymo 位於 L4;他用來類比 coding agent 的自主光譜 | Driving autonomy levels; Waymo operates at L4, used as an analogy for the coding-agent autonomy spectrum |
逐字稿勘誤 / Transcript Corrections
| 字幕原文 Heard as | 應為 Should be |
|---|---|
| Vincent Vanoke / Van Hooke | Vincent Vanhoucke |
| Whimo / Whimo car | Waymo |
| Gen3 | Genie 3 |
| LAR | lidar |
| aentic AI / genetic systems | agentic AI / agentic systems |
| dagger problem | DAgger problem |
| code compression systems | code completion systems |
| deres from | derives from |
待確認 / To Verify
- 「11 個城市」是演講當下的營運城市數,官方數字可能已更動,引用時建議標註時間點。/ The "11 cities" figure is as of the talk; the official count may have changed — cite with a date.
- 他提到的 Genie 3 相關細節(例如 Waymo 對光達生成的後訓練方式)講中只帶過「grafted lidar generative capabilities onto the model」,實作細節未展開。/ He only said lidar generation was "grafted onto the model"; the post-training details were not covered.
- 他提到 Google 早年的桌球機器人影片「Vincent 也參與其中」(由 Peter Stone 在前一場提及),該工作的正式名稱未在台上點名。/ The early Google table-tennis robot work he was part of (referenced by Peter Stone in the prior talk) was never named on stage.