演講 Session 2: Robotics & World Models

用世界模型擴展人行道自主性

Bolei Zhou — Associate Professor, UCLA; Chief AI Scientist, Coco Robotics

8 月 1 日(六) · Atlas Stage · 01:04:45–01:13:53 · 下午場直播

人行道自主性的瓶頸不是模型不夠多,而是沒辦法在部署前公平評估它們;而解法是把真實世界的影片當成「原始碼」,重建成可互動的模擬環境,再從一支影片長出多個「數位表親」來訓練與評估。

TL;DR

  • 人行道自主性比道路自主性更難的地方在於約束:單一 RGB 相機、有限算力與電力,卻要處理各種天候光照、與行人及動物做社交合宜的互動(例:繞過躺在人行道上的狗而不踩到牠的尾巴)。
  • 評估才是瓶頸:sidewalk foundation model 已經很多(他的實驗室與其他實驗室都有),但部署前要怎麼公平比較? 他們先做了 SidewalkBench(建在 NVIDIA Omniverse / Isaac Sim 上),但圖形引擎的視覺真實感不足,仍有 scene-to-real gap。
  • 解法是把真實影片當原始碼:Vid2Sim(CVPR)把人行道影片重建成 Gaussian splatting,再放進物理引擎,得到資料驅動的模擬;在其中用 RL 訓練後可零樣本遷移到真實世界,因為訓練與部署之間沒有視覺落差
  • 一支影片不能只長出一個環境:UrbanVerse 從單支影片抽出 scene graph,替換不同物件實例,產生多個digital cousins(相對於一對一的 digital twin);同時釋出 10 萬個帶正確尺度的 3D 資產
  • 成果:FlowPilot 用單一 RGB 相機輸出 waypoint 完成真實人行道導航;並且能跨載體遷移而不必微調——已在足式機器人上驗證,正在推進輪足機器人與電動輪椅。「未來我們不只能自主外送食物,也能自主載送人。」

重點整理

問題:人行道自主性是另一種自主性(約 01:05–01:07)

他先開了個玩笑:台上前面幾位分別來自 UC Berkeley、UC San Diego,加上他的 UCLA——「不如來辦一個 UC AI Summit?」

接著把場景拉開:大家熟悉的是道路自主性(前一位講者剛談過),全尺寸車輛在城市裡跑;但都市環境裡還有另一種自主性,他稱為 sidewalk autonomy。Coco Robotics 是一家做最後一哩食物外送的新創,有數百台機器人在跑這個任務。

跟道路自主性相比,人行道的處境更雜:

  • 要非常小心地在人行道上導航、避開障礙物碰撞;
  • 要處理所有天候與光照條件;
  • 人行道本來就是為人設計的,所以機器人必須與行人、動物等動態 agent 做社交合宜的互動。他放了自己很喜歡的一段影片:一隻狗躺在人行道上,機器人必須非常小心地繞過去、不能壓到狗的尾巴,同時完成導航任務。

而且機器人工作在算力與電力受限的環境:「我們只被允許用單一 RGB 相機來做導航。」

瓶頸:模型很多,但沒辦法在部署前評估(約 01:07–01:09)

近年人行道導航的 AI 模型不少,主要靠模仿學習從人類示範中學,他的實驗室與其他實驗室都貢獻了一些;這些模型訓練在影片示範上,跨條件泛化得不錯。

但問題來了:面對這麼多不同的 sidewalk foundation model,真實世界部署前要怎麼 benchmark 它們?

他們的第一步是 SidewalkBench:在模擬中評估導航策略,環境用 NVIDIA Omniverse 與 Isaac Sim 建。它能比較不同模型如何與人互動、如何避免碰撞。但仔細看就會發現,圖形引擎建出來的模擬仍然缺乏視覺真實感——跟真實部署之間存在 scene-to-real gap,而這個 gap 會讓評估不公平。

解法一:把真實影片當原始碼(Vid2Sim)(約 01:09–01:10)

他們的解法是從真實世界影片建構世界模擬:「我們想把真實世界影片當成 source code,用它來建這個評估 benchmark。」

Vid2Sim(發表於 CVPR)的流程:拿一段在人行道上行走的影片 → 從影片建 Gaussian splatting 重建 → 把 splat 放進物理引擎 → 得到資料驅動的模擬環境 → 在其中訓練與評估人行道機器人。

他放的 demo 顯示用強化學習在其中訓練 agent,訓練完的模型可以零樣本遷移到真實世界——原因很直接:訓練環境與部署環境之間幾乎沒有視覺落差。 有了這種環境,就能評估各種人行道導航策略在不同情況下的表現。

解法二:從一支影片長出多個環境(UrbanVerse)(約 01:10–01:12)

但這種影片重建有個限制:一支影片只能重建出一個環境。理想上我們希望從同一支影片產生多種變化。

這是 UrbanVerse 的動機:從單支影片產生多個 digital cousins。他把兩個概念分清楚:digital twin 是一支影片對應一個模擬環境;digital cousins 則是同一來源長出的多種變體。做法是用電腦視覺技術從輸入影片中抽出 scene graph,再替換不同的物件實例,就能生出不同版本的環境,每個都能拿來訓練與評估。

UrbanVerse 已公開釋出,同時釋出一個大規模 3D 資產庫:10 萬個帶有正確尺度的資產

他們也建了用模擬做後訓練的流程:先用影片以模仿學習訓練模型,再把模型放進模擬環境中做後訓練,提升它的互動性與反事實推理能力

成果:FlowPilot 與跨載體遷移(約 01:12–01:13)

累積這些進展後的近期成果是 FlowPilot:在真實世界用單一 RGB 相機完成人行道導航。機器人只有一台 RGB 相機,模型輸出 waypoint,控制器執行下一個點。展示中機器人能處理困難的人行道場景——避開障礙物、與行人適當互動。

另一個他認為很令人興奮的方向是跨載體(cross-embodiment)遷移或部署:既然有了人行道導航的 foundation model,他們的研究能在不微調的情況下把模型遷移到不同的機器人本體。示範影片顯示模型在足式機器人上運作良好;還有許多進行中的研究要遷移到其他人行道機器人,例如輪足機器人電動輪椅

他的結語:「所以未來我們不只能自主外送食物,我們也能在人行道上自主載送人。」benchmark 與程式碼都已在他們的網頁上釋出。

金句

"We want to use real world videos as a source code to build up this evaluation benchmark."(約 01:09)

把影片當「原始碼」,是整場方法論的核心比喻。

"There is no visual gap between the training environment and the deployment."(約 01:10)

零樣本遷移為什麼成立的一句話解釋。

"In the future, not only we can autonomously deliver the food, we can also autonomously deliver the people on the sidewalk."(約 01:13)

跨載體遷移的終點:從外送包裹到載送人。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
SidewalkBench 人行道視覺導航的模擬 benchmark,建於 Omniverse / Isaac Sim Simulation benchmark for sidewalk visual navigation, built on Omniverse / Isaac Sim arXiv 2606.16953
Vid2Sim 從單目影片重建可互動 3D 模擬環境,支援 RL 訓練與零樣本 sim2real Real2sim pipeline turning monocular video into interactive 3D simulation for RL navigation CVPR 2025;arXiv 2501.06693 — metadriverse.github.io/vid2sim
UrbanVerse 從單支影片抽 scene graph 產生多個 digital cousins;附 10 萬件 3D 資產 Scene-graph extraction from a single video to produce many digital cousins; ships 100k 3D assets 資產庫另稱 UrbanVerse-100K / asset library also referred to as UrbanVerse-100K
FlowPilot 單目 RGB、無地圖的人行道導航策略,輸出 waypoint Mapless monocular sidewalk navigation policy emitting waypoints 在 Coco Robotics 平台上做真實世界驗證 / validated on Coco Robotics hardware — vail-ucla.github.io/FlowPilot
Coco Robotics 最後一哩食物外送機器人公司,數百台機器人在營運 Last-mile food delivery robot company running hundreds of robots 講者任 Chief AI Scientist / he serves as Chief AI Scientist
NVIDIA Omniverse / Isaac Sim SidewalkBench 的模擬底層 The simulation stack underneath SidewalkBench 逐字稿誤聽為 "media omniverse and isoxaxing"

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Ble Joe / Blet / Boley Joe Bolei Zhou
Koko robotics Coco Robotics
sidework foundation models sidewalk foundation models
media omniverse and isoxaxing NVIDIA Omniverse and Isaac Sim
V2 Vid2Sim
gion splants / gshian splatting Gaussian splatting / Gaussian splats
urban versse UrbanVerse
flow pilot FlowPilot
lagged robots legged robots
social professor associate professor
last male delivery last-mile delivery

待確認 / To Verify

  • Vid2Sim 的發表年份:講者說「last year… published at the CVPR」,但外部資料顯示為 CVPR 2025,與「去年」的口語表述需再對照。/ He said "last year… published at CVPR", but external sources list it as CVPR 2025 — reconcile with the spoken timeline.
  • UrbanVerse 資產庫「10 萬個資產」的正式名稱與釋出授權條款。/ The formal name and licensing of the "100,000 assets" library.
  • 跨載體遷移「不需微調」的具體評估數據,台上未給。/ No quantitative results were given for the zero-fine-tuning cross-embodiment claim.
  • 他提到「我的實驗室貢獻了一些模型」但未點名是哪些 sidewalk foundation model。/ He referenced models from his own lab without naming them.

GitHub 上的 Markdown 原始檔 ↗