演講 Session 4: Robotics & World Models
機器人基礎模型
Sergey Levine — Co-Founder, Physical Intelligence; Professor, UC Berkeley
機器人做不到「我今晚有客人要來」這種指令,不是因為動作不夠好,而是因為缺少把陌生工作拆解成熟悉步驟的「思考」——而這個思考不一定要用語言,用影像當中介思考往往更貼合物理世界。
TL;DR
- 真正的落差在「prompt 的層級」:研究界的 benchmark 任務是「把玉米放進鍋子」這種 atomic task,但人真正想下的指令是「我今晚有客人要來」——那是一整份工作,需要 grounding、規劃與跨情境泛化。
- Test-time compute 對機器人有第二個好處:除了「想久一點解更難的題」,它還能把陌生問題拆成訓練分佈內的熟悉片段(「我沒抓過這個東西,但我在 web-scale 預訓練時定位過影像中的物體」);再用 RL 優化這些 thought,讓拆解出來的子指令是機器人真的做得到的。
- 思考不必用語言:煮菜照食譜適合語言,攀岩則否。Physical Intelligence 的 π0.7 在決策流程中內建輕量 world model,同時用語言與影像思考再落地成動作——沒訓練過的氣炸鍋也能靠「口頭教學」學會操作。
重點整理
問題:從 atomic task 到 whole job(約 02:12)
開場是個玩笑:他前一晚下班回家很累,請最愛的 LLM 幫忙打掃、摺衣服、做晚餐——結果 LLM 只回了一堆「你應該自己動手做」的建議。他想要的是坐在機器人裡、真的能動手的 embodied foundation model。
Robot foundation model 是個年輕但成長極快的領域。Physical Intelligence 做了兩年多,已有像是機器人連續 13 小時用義式咖啡機沖咖啡、在工廠組裝紙箱這樣的成果;學界與其他公司也有很多好結果。但他刻意不做成果展示,而是聚焦一個技術問題:既然結果這麼好,為什麼我們身邊還沒有能聽任意 prompt 做事的機器人?
答案在 prompt 的層級。研究用的任務長這樣:「put the corn in the pot」(來自 bridge dataset),機器人做到了,但那不是我們要的。我們要的是「我今晚有客人要來」——這句話指定的是一整份工作而非一個原子任務,而且它高度依賴脈絡:機器人要知道你是誰、你家長什麼樣,才知道這句話該怎麼解讀。中間有大量 grounding 與問題拆解。
Test-time compute 與用 RL 優化 thought(約 02:14–02:17)
Test-time compute 在 LLM 世界的作用大家都熟:多生成 token、想更久,解更難的題。但它還有個比較不明顯的好處:把不熟悉的問題拆成熟悉的片段。機器人可以說:「你要我拿起這個東西,我沒做過;但我在 web-scale 預訓練裡定位過影像中的物體,那就先定位再說。」
範例是一個刻意設計來隔離這個問題的研究級任務:「讓藍色積木成為盤子上唯一的東西」。盤子上現在放著壽司(玩具壽司)。正確的反應不只要有效,還要語意上合理——不能把壽司丟到桌上,那不衛生;壽司該進一個語意適當的容器。模型的 reasoning trace 不只處理了這件事,還判斷出壽司對它來說可能是陌生物體,於是決定輸出空間座標而不是直接依賴 action head,藉此吸收視覺上的 distribution shift。執行時 thinking trace 每幾秒依現場狀況更新一次。
Thinking model 最強的時候是 thought 被 RL 優化過的時候。這裡 RL 扮演雙重角色:它會改寫任務描述,把它變成更接近機器人訓練分佈的樣子。做法是提出多組不同的文字指令來拆解高階 prompt,選機器人最可能成功的那一組。
例子:命令機器人「把鎚子放到盤子上」——高度 out-of-distribution。用現成的 vision-language model(這裡是 Gemini),它不知道機器人會什麼、不會什麼,就直接說「好啊,把鎚子放到盤子上」,機器人不知道鎚子是什麼、怎麼放,結果失敗。經過 RL 之後,模型會把任務「餵到嘴邊」:「往左移一點,對準鎚子」——到這一步再說「放到盤子上」,就只剩一種做法,做對的機率大增。RL 在這裡填補的是 distribution gap。
多模態思考與 π0.7(約 02:17–02:20)
照食譜煮菜適合用語言逐步思考;但攀岩時你不會想「我要把手臂往左移 37 公分」,你是用空間、用「等一下看起來會是什麼樣子」在思考。所以機器人基礎模型也可以用別的模態思考。早期一個研究工作是:把指令拆解成中介影像而非文字——想像「往目標推進一步之後畫面會長怎樣」,那張圖就是 thought,以它為條件再產生動作就容易多了。這招之所以有效,是因為影像生成可以在網路規模資料上預訓練,學會語言與影像的對應,機器人才有辦法「想像」子步驟。
最後是 Physical Intelligence 近期的大規模工作:π0.7,一個大型 vision-language-action 模型,在決策流程中內建輕量 world model,先用語言與影像推理任務,再把這一切落地成動作。
Demo:Lucy 教機器人使用氣炸鍋——刻意沒有拿氣炸鍋訓練過,是完全沒見過的家電。直接叫它「氣炸這顆地瓜」,它會成功,但很慢、摸索很久。若給一點額外監督就會可靠得多,而關鍵是:這個監督不是動作。Lucy 用講話的方式一步步口頭教學,產生的是「影像 + 語言」的新資料,動作全部是機器人自己做的、不是 ground truth。這批資料只用來 fine-tune 思考流程——本質上是在教機器人怎麼想。教完之後,螢幕上會同時看到模型自己生成的語言 thought 與影像 thought,任務就做得相當流暢了。
Takeaways(約 02:20)
- 思考 / 推理模型能讓機器人泛化得更好、聽懂更複雜的 prompt。長期來看這很重要,因為我們最終會想下這種指令:「你是管家機器人,晚上六點打掃、準備晚餐、星期六洗衣服。」——那就是一句 prompt,而機器人可能要花好幾週才能完整執行完。
- 思考不必是文字。物理世界很複雜,該用哪個模態就用哪個。
- 甚至可以同時用多個模態,在對的抽象層級上思考:照食譜煮菜用語言,搞懂新家電則需要想像手該放哪裡去按按鈕、開容器。
- 這同時給了兩件事:解更難問題的方法,以及把其他模態中的知識更有效地轉移進來的方法。
金句
"Why is it that with all these really nice results, we aren't seeing robots that can follow arbitrary prompts all around us today?"(約 02:12:30)
整場演講的問題意識——不是問「還能做出什麼 demo」,而是問「為什麼 demo 沒有變成日常」。
"Break down an unfamiliar problem into more familiar steps."(約 02:15)
Test-time compute 對機器人真正的價值:不只是想更久,而是把 out-of-distribution 拉回 in-distribution。
"The thinking doesn't have to be in text. The physical world is complex and you should use the right modality for the job."(約 02:20:30)
對「一切都用語言 chain-of-thought」的直接反駁。
提到的專案與資源 / Projects & Resources
| 名稱 Name | 說明 | Description | 備註 Notes |
|---|---|---|---|
| Physical Intelligence | 講者共同創辦的公司,做通用機器人基礎模型,已投入兩年多 | The company he co-founded, building general-purpose robot foundation models; over two years in | 例:機器人連續 13 小時操作義式咖啡機、工廠組裝紙箱 / e.g. 13 hours straight on an espresso machine, box assembly in a factory |
| π0.7 (pi 0.7) | 大型 VLA 模型,決策流程內建輕量 world model,同時用語言與影像思考 | Large VLA model with a lightweight world model in the decision loop; reasons in language and images | 演講中的主要新成果 / the talk's headline result;氣炸鍋 demo 出自此模型 |
| bridge dataset | 「put the corn in the pot」示範任務的來源資料集 | Source dataset for the "put the corn in the pot" demo task | 研究級平台,用來對比「原子任務 vs 整份工作」/ research-grade, used to contrast atomic tasks with whole jobs |
| Gemini | 現成 VLM,用來對照「未經 RL 優化的 thought」失敗案例 | Off-the-shelf VLM used as the un-optimized-thought baseline in the hammer example |
逐字稿勘誤 / Transcript Corrections
| 字幕原文 Heard as | 應為 Should be |
|---|---|
| Sergey Lavine / Lavine | Sergey Levine |
| PIO7 / pi 07 | π0.7 (pi 0.7) |
| physical intelligence(小寫) | Physical Intelligence(公司名 / company name) |
| bmanual | bimanual |
| multimmodal / multimodal | multimodal |
| webcale | web-scale |
待確認 / To Verify
- Demo 中示範口頭教學的 "Lucy" 為 Physical Intelligence 團隊成員,全名與職稱未在演講中提及。/ "Lucy," who coaches the robot in the air-fryer demo, is a Physical Intelligence team member; full name and title were not stated.
- 早期「以中介影像作為 thought」的指令跟隨工作,演講中未點名論文標題。/ The earlier instruction-following work that decomposes instructions into intermediate images was not named by paper title.