演講 Session 1: AI for Science

LabOS:看得見人、也與人協作的 AI-XR 共同科學家

Mengdi Wang — Professor, Princeton

8 月 1 日(六) · Nexus Stage · 01:03:11–01:11:25 · 上午場直播

AI 擴張的真正瓶頸不是假設,是驗證——實體實驗沒有 checkpoint、沒有 log、無法回溯,所以 Mengdi Wang 的解法是讓 AI 戴上智慧眼鏡進實驗室,把每一個實體動作變成可觀測、可除錯的環境。

註:本場因時間超時被主持人中斷,最後一頁投影片是倉促帶過的。

TL;DR

  • 瓶頸在驗證,不在假設。這也是為什麼這麼多 AI 公司在拼命建 trace data 與 RL environment——AI 要更快擴張,得先有辦法擴張「環境」與「驗證」。但這件事在科學裡難得要命。
  • 可重現性危機的數字很難看:Nature 的調查顯示 70% 的生醫論文無法被他人重現,50% 連原作者自己都重現不出來,而且橫跨化學、生物、物理、地球環境各領域。原因很簡單:實體實驗沒有 checkpoint(訓練模型有,agent workflow 也有,在無塵室裡沒有)、沒有 log 可以 debug、也沒辦法回頭改 harness。
  • AI 讓科學變慢而不是變快:她引用同事的部落格——最近一次 NeurIPS 有 4 萬份投稿,論文與 agent 都爆量,但驗證沒有同步加速,結果是訊噪比更差,在滿坑滿谷 AI 生成內容裡更難撈到有用資訊。
  • LabOS 的賭注:把多模態推理 AI 藏在智慧眼鏡後面,讓實驗室裡的每個動作、每次狀態改變都被 AI 觀測到,即時抓錯、把實體流程數位化、故障排除、給提示。搭配機器人做的端到端奈米製造迷你實驗室,把物理博士生原本要三個月的工作壓到一週,並開放成 API 讓任何人送 job 進去重現實驗。

重點整理

驗證,而不是假設,才是 AI 擴張的瓶頸(約 01:03–01:07)

前幾位講者已經談了 AI agent 在數位空間的大量進展。她把科學研究拆成幾個階段:hypothesize(讓模型思考、推理、往深處挖)、computation(用代理模型模擬、找出最佳候選)、以及最後的 validation / verification

她的主張很直接:驗證已經成為擴張任何 AI 模型的主要瓶頸。這正是為什麼現在這麼多 AI 公司與新創在積極打造新的 trace data 與新的 RL environment。如果有辦法擴張環境與驗證,AI 就能跑得快得多——但在科學裡,這件事難得要命。

她現場丟了一個問題:隨便挑一篇 Nature 上的化學或生物論文,可重現的比例是多少?台下猜 5%、30%。答案來自 Nature 自己做的調查:70% 的生醫論文無法被其他人重現,50% 甚至連原作者自己都重現不出來,而且這在化學、生物、物理、地球環境等領域都成立。

原因不在人不努力,而在驗證本身的結構。當有人在實驗檯或無塵室裡跑一個實驗:

  • 沒有 checkpoint。訓練模型有 checkpoint,agent workflow 可以回溯,實體實驗兩者都沒有。
  • 沒有 log,無從 debug,也無從改進 harness。

她的同事幾個月前寫了一篇部落格,結論是:有了 AI,科學沒有變快,反而變慢了。理由是最近一次 NeurIPS 收到 4 萬份投稿——論文太多了;而真正提供新知識與新資訊的是驗證,驗證卻沒有被加速。於是論文更多、agent 更多,訊噪比反而更糟,在大量 AI 生成內容裡撈出有用資訊變得更難。

回到驗證問題:我們可以有各種很炫的模型,告訴我們幾百萬個新穎假設,但瓶頸永遠會在實驗室裡。而做實驗的科學家同事把整個職涯、好幾年時間投在實體實驗室裡,即使拚盡全力,這整條 workflow 仍然非常容易出錯。

所以真正的大哉問是:我們要怎麼把每一間科學實驗室都變成一個可驗證的環境(verifiable environment)?

一邊是 AI 跑得飛快——每家前沿實驗室與新創都有 AI co-scientist;另一邊是科學家在實驗檯與無塵室裡,要花好幾個月甚至好幾年才能驗證一個假設。中間缺了關鍵的一塊。

LabOS:把實體實驗室變成可觀測環境(約 01:07–01:11)

LabOS 是一個 AI-XR agent:一個藏在智慧眼鏡後面的多模態推理 AI。她放的第一個例子是一位從印度來訪的大學部實習生,在 LabOS 協助下幾乎第一天就能執行進階的基因體工程實驗

系統提供的東西是:讓科學實驗室裡每一個動作、每一次狀態改變都變成 AI 可觀測的,同時建立多層串流系統,讓 AI 能即時協助人類研究者——抓錯、把實體流程數位化、故障排除、在事情不對勁時給出指引與提示。

第二個例子(她強調「這不是動畫」)是與 Princeton Quantum Institute 同事合作的端到端迷你機器人實驗室,用來自動化單原子層 graphene 元件的奈米製造。多模態 agent 在電腦裡跑 auto research,而實際的量測、製造、tape-out 與所有顯微影像都由機器人完成。成果是:原本物理博士生要花三個月的工作,現在一週完成。她的同事正把這套系統開放成 API,任何人都可以送 job 進去重現實驗、測試新假設——目標是規模化。

(被主持人以時間為由中斷後的最後一頁)他們正在 pilot 的 LabOS 是一套讓人類研究者與機器人並肩工作的系統:每一條實體 workflow 都會被數位化,每一條 trace 都被收集並交由 AI 推理;而且這套系統設計成能跨科學領域通用——從生物實驗室、化學實驗室,到無塵室與奈米設施。

金句

"70% of biomedical research papers are not reproducible by others, and 50% are not even reproducible by the same authors."(約 01:05:21)

這不是態度問題,是驗證沒有基礎建設的必然結果。

"With AI, science is not faster. Science is actually getting slower."(約 01:06:28)

假設端加速、驗證端沒動,結果是訊噪比崩壞。

"How do we turn every scientific lab into a verifiable environment?"(約 01:07)

整場演講的問題陳述。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
LabOS AI-XR co-scientist:智慧眼鏡背後的多模態推理 AI,即時觀測並輔助實體實驗 AI-XR co-scientist: multimodal reasoning AI behind smart glasses that observes and assists physical experiments in real time 對應論文 arXiv:2510.14861 / bioRxiv 2025.10.16.679418;Stanford–Princeton 合作(Le Cong × Mengdi Wang)/ Stanford–Princeton collaboration
迷你機器人奈米製造實驗室 / mini robotic nanofab lab 自動化單原子層 graphene 元件製造:量測、製造、tape-out、顯微影像全由機器人執行 Automates one-atom-thin graphene device fabrication end to end — measurement, fabrication, tape-out, microscopy 與 Princeton Quantum Institute 同事合作;三個月 → 一週;將開放為 API / with Princeton Quantum Institute colleagues; 3 months → 1 week; being released as an API
Nature 可重現性調查 / Nature reproducibility survey 70% 生醫論文他人無法重現、50% 原作者也無法重現 70% of biomedical papers not reproducible by others; 50% not reproducible by their own authors 演講中僅稱「a survey run by researchers and Nature」/ described only as "a survey run by researchers and Nature"

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Mangdi Wang Mengdi Wang
lab OS LabOS
Europe submission NeurIPS submissions
clean rooms(字幕正確) clean rooms
nanop fabrication nanofabrication
graphing devices graphene devices
purity students PhD students
AI co-cientists AI co-scientists

待確認 / To Verify

  • 實習生姓名:字幕作 "Simmeran",拼寫未確認。/ The intern's name, transcribed as "Simmeran", is unverified.
  • 同事的部落格(主張「有了 AI 科學反而變慢」)作者與連結未提及。/ The colleague's blog arguing science is getting slower with AI was neither named nor linked.
  • NeurIPS 4 萬份投稿的年度未指明(字幕作 "the most recent Europe submission")。/ The year of the 40,000-submission NeurIPS cycle wasn't specified.
  • Nature 可重現性調查的年份與正式出處未提供(公開常引的是 2016 年 Nature 的 1,576 人調查)。/ The year and citation for the Nature reproducibility survey weren't given (the commonly cited one is Nature's 2016 survey of 1,576 researchers).
  • 開放為 API 的那位 Princeton 同事姓名與服務名稱未提及。/ The Princeton colleague releasing the API, and the service's name, weren't mentioned.

GitHub 上的 Markdown 原始檔 ↗