主題演講 Session 3: AI for Math

AI 面對長程與稀疏獎勵任務的未來

Sergei Gukov — Executive Director, American Institute of Mathematics; John D. MacArthur Professor of Theoretical Physics and Mathematics, Caltech

8 月 2 日(日) · Atlas Stage · 00:50:15–01:05:46 · 下午場直播

數學是最誠實的 AI benchmark,而真正擋在「AI 能量產解決硬數學問題」前面的不是知識而是長程 + 稀疏獎勵這對組合;過去十年的解法(curiosity、world model、harness)只給你幾倍到十倍,但這類問題需要的是好幾個數量級——所以下一階段的關鍵不再是 data stack,而是 reward stack。

TL;DR

  • 數學是天然的 benchmark,而且有清楚的難度階梯:小學 → 中學 → 高中 → 大學(AI 目前穩定表現大約在這裡,關鍵字是「穩定」)→ 研究所資格考 → 值得一篇博士論文的問題 → 專業研究問題 → 連研究數學家都不知道怎麼下手的問題 → Millennium Prize。本場問的是:AI 能不能可靠地爬到最頂端?換句話說,能不能得到 artificial superintelligence?
  • 三個實例:hypercube 裡的最長蛇(snake-in-the-box,他們在九維打破長期紀錄)、David Eisenbud 出的交換代數難題(需要階層式多 agent 架構才解得掉)、開放 60 年的 Andrews–Curtis 猜想(像是搜尋圖沒被明確給出的魔術方塊)。他強調:你可以拿 Fable 或 AlphaEvolve 直接去打第一題,什麼也不會發生
  • 真正的瓶頸是 long horizon × sparse reward。硬數學問題需要推理不是 100 步,而是 10 萬步、1000 億步;即使每步保真度極高,長程仍會崩。需要的不是 30% 改善,而是好幾個數量級。
  • 已知手段都不夠:exploration / curiosity 模組能把稀疏獎勵變稠密、能生成 subgoal;world model 有幫助;harness 有幫助——但都只是幾倍到 10 倍,不是十億倍。而且沒有任何一個 Millennium Prize 問題被解掉。
  • 系統的上限是 evaluator 的上限。evaluator 一旦設下 guardrail 與判準,agent 就會很快學會 hack 它——因為原問題實在太難,hack 比解題容易得多。CoastRunners 的船、DeepMind 疊樂高翻面騙相機、Palisade Research 的西洋棋直接移除引擎,都在數學問題上重演。
  • 新論點:過去大家說「data is everything」;隨著資料耗盡進入新時代,tools 與 harness 是新的 action space,而取代 data stack 的是 reward stack

重點整理

數學作為 AI 的難度階梯(約 00:50–00:52)

他開場就把這場定位為前兩場 benchmark/eval 場次的自然延伸:數學本來就是 benchmark AI 系統的天然方式

難度階梯由低到高:小學、中學、高中、大學——AI 目前穩定表現大致落在大學這一層,他刻意強調 consistent 這個關鍵字:能高保真、可靠地一再解出來,才算數。往上,作為職業數學家他看到的階梯還很長:各種硬資格考的研究所題目、解出來就能拿博士學位的問題、然後是專業數學研究,其中還包含研究數學家自己也完全不知道怎麼解的問題,而這一層自身還有分級,最高處大概是 Millennium Prize 問題。

本場的問題就是:AI 系統能不能可靠地達到那個最高層?他直白地說,你可以把這場想成是在問「我們能不能得到 artificial superintelligence?」它還沒到,但問題是:還有多遠?瓶頸在哪裡?

好處是這件事很好 benchmark——已經有網站列出約一百個未解的硬數學問題,其中包含所有 Millennium Prize 問題,還有很多其他的。

三個實例(約 00:52–00:56)

問題一:hypercube 裡的最長蛇(snake-in-the-box)。 這是他自己半年前才知道的問題,敘述極簡單卻名列硬問題清單:想像一個每邊長 2 的立方體,推廣到 D 維,你能塞進去的最長的「蛇」有多長? 他當時猜想低維應該早被數學家與電腦科學家算掉了,高維或許 AI 有機會。結果他們建的系統連九維的長期紀錄都打破了。這題敘述簡單,卻連結到密碼學、量子計算等領域。

他在這裡放了一句對整場很重要的話:數學的好處是你可以拿任何系統來試。例如你可以直接拿 Fable 或 AlphaEvolve 去打——他們試過,什麼也沒發生,就是解不出來

問題二:交換代數。 這題來自 Berkeley 的 David Eisenbud 教授,他推薦這是交換代數裡一個真正困難的問題:尋找同時具備兩個性質的 monomial ideals。分別滿足其中一個性質都很容易,一旦要同時滿足,就是大海撈針——在分佈圖上機率直接掉到零。

他們掙扎了一陣,設計了非常多套系統。問題的階層結構很明顯:有兩個步驟,應該外包給 AI 系統的兩個不同元件。但即使你已經知道要用某種 multi-agent 系統或 HRL,仍然需要大量迭代才能找到真正能用的那一套架構。最後他們解掉了。

問題三:Andrews(–Curtis)猜想。 群論中一個開放 60 年的問題。這題非常像魔術方塊——事實上群論裡很多問題都像魔術方塊:給你一個狀態,agent 的目標是找到通往目標狀態的路徑(魔術方塊的目標狀態就是每面同色)。差別在於搜尋圖並沒有被明確給出,而且問題本身問的是:任何狀態是否都能到達目標狀態? 這就是它的 CS 表述。他們在這題上也取得進展,相關論文發表於 ICML、ICLR、NeurIPS。

他強調:這些論文雖然是在推進數學,但每一篇都需要設計帶各種巧思的 AI 系統。這題的關鍵洞見之一是資料分佈:在魔術方塊裡你可以隨機打亂來生成訓練資料,但這個問題的資料分佈是雙峰(bimodal)的——打亂與隨機搜尋只會給你目標狀態附近的初階資料,而有些狀態距離目標是超指數遠的。問題是:你要怎麼訓練 RL 去抵達另一個峰?

實驗室定位:long horizon 與 sparse reward(約 00:56–00:58)

到這裡他才做正式自我介紹:他在 Caltech 帶一個專注於解數學問題的實驗室——但真正的專注點是為長程與稀疏獎勵問題打造 AI 系統與工具

因為前述三題的共同點,也是任何真正困難的數學問題的共同特徵,是:系統必須推理非常非常多步。即使你的每步保真度很高,跑 100 步也可能失敗;而這些問題需要的是 10 萬步、1000 億步。這裡需要的不是 30% 的改善,而是好幾個數量級的改善

長程與稀疏獎勵各自都難,兩者結合就成了所有這些數學問題的惡名昭彰的瓶頸

其他同時具備這兩種特性的領域:Atari 遊戲、coding、機器人、自駕運輸。

已知有效的手段: - exploration / curiosity 模組——把稀疏獎勵問題轉成較稠密的信號,逐步探索並生成 subgoal 與 subtask。 - learning world models——很有幫助,但同樣只給你幾倍或 10 倍,不是十億倍。 - 各種 harness——大家(包括他們)都在用各種方式嘗試。

到目前為止,沒有任何一個 Millennium Prize 問題被解決,問題仍然開放。

還有幾個懸而未決的爭論:LLM 是不是正確的底層框架?它們是在推理,還是只是擅長檢索? 這個泛化問題是最惱人的問題之一。另一個是 RL 作為相當核心的組成——它讓系統更穩健、在 post-training alignment 等階段改善表現,但這樣就夠了嗎?我們還不知道。

SWE-bench 與遊戲給的旁證(約 00:58–01:01)

SWE-bench:coding agent 現在相當好,表現大致落在 70–80%。但如果問剩下那 20% 的瓶頸是什麼,答案正是長程任務:當 agent 必須修跨越好幾個 Git repo、散落在不同檔案裡的 bug 時,它會迷失。特別是在長程情況下,它知道有好幾個元件,但要定位到底哪裡出錯、哪裡失敗,就成了難題

電玩的類比:回到 DeepMind 2013 年提出的 DQN,它在 Montezuma's Revenge 上慘敗,這款遊戲後來成了整個 AI / RL 社群的執念,大家想設計出能打好它的演算法。這變成一段近乎十年的旅程,許多團隊嘗試、許多團隊失敗,直到 2018–2019 年左右才得到好的信號,現在當然已經解決。他特別點出:2015–2018 這段期間我們有了 AlphaGo、AlphaZero、MuZero,而這些模型在這款遊戲上都表現不好,因為它是稀疏獎勵問題的絕佳例子。

這正好說明了為數學設計 AI 系統是什麼感覺:你會試很多東西,而幾乎全部都會失敗,尤其當你的問題真的很難、真的是長程稀疏獎勵問題時。

研究迴圈為何無法自動化(約 01:01–01:03)

他們實驗室的研究迴圈跟任何 AI 實驗室一樣:設計 AI → 部署 → 看 W&B 曲線 → 看訊號在哪 → 最重要的是分析它為什麼失敗 → 帶進下一輪實作,如此循環。

原則上這整件事可以被完全自動化——但目前不行。他明確指出用 AlphaEvolve 或其他工具都做不到,原因很簡潔:這種等級的演算法開發與發現本身就是一個稀疏獎勵問題。不像 coding(現在的 agent 已經相當好),現有 agent 並不擅長發現真正跳出框架的新演算法

而瓶頸典型地落在評估上:你的系統只會跟你的 evaluator 一樣好。實務上會發生的是:你的 evaluator 設下某些 guardrail、判準與條件,而 agent 很快就學會 hack 它們——原因很單純,你想解的原問題實在太難,做 hack 或其他退化行為容易得多。

他舉的三個經典例子在數學問題上一模一樣地重演: - OpenAI 的 CoastRunners 賽船學會在原地繞圈撿平庸的獎勵,而不是完成比賽。 - DeepMind 的樂高堆疊挑戰:機械手臂很快發現把積木翻面騙過相機、讓高度看起來增加一點,就能拿到獎勵,比真的堆起來容易。 - 獎勵竄改(reward tampering):Palisade Research 的西洋棋例子——AI 系統學會直接把對手引擎移除來贏棋。

從 data stack 到 reward stack(約 01:03–01:05)

他表示自己非常興奮,因為我們正處在一個點上:硬數學問題可能不再是一題一題地被攻克(像他前面舉的三個例子那樣),而是量產式地被解決。也就是說,可以有一個超智慧,可靠地解掉幾乎任何他這位在職數學家解不掉的問題。要達成這件事,就必須解鎖長程與稀疏獎勵的能力。

他給了整場最有結構性的一段觀察:過去幾年大家都會說資料就是一切——你需要乾淨的資料,資料就是全部。而現在我們正在耗盡資料、進入新時代,對這一代新的 AI 系統來說,各種工具與 harness 將成為新的 action space,而取代 data stack 的是 reward stack。 把引擎導向正確方向、做出可靠的 subgoal 分解,正是長程任務所需要的。

其他工程挑戰:讓多個 agent 組隊工作數天甚至數月會很有用,而這需要不同的 AI agent 彼此對話——就像全球資訊網早期的網際網路協定那樣。

結尾:四年後的 Fields Medal(約 01:05)

他以樂觀作結。一週前的國際數學家大會(ICM)頒出四面 Fields Medal;ICM 每四年舉辦一次,他比喻成世界盃足球賽。他希望四年後我們會看到一面 Fields Medal 頒給「AI + 人類」

金句

"You can think about this talk as: can we get artificial superintelligence? It hasn't come yet, but our question is how far and what are the bottlenecks?"(約 00:51)

把「AI for math」的題目直接拉高成 ASI 的可測量代理問題。

"Even if you have very high fidelity, it can fail over 100 steps, but 100,000 and 100 billion steps — that's actually what we need for these problems."(約 00:57)

這句話解釋了為什麼「再加 30% 準確率」對硬數學問題沒有意義。

"Your system is going to be just as good as evaluator."(約 01:02)

evaluator 設下的判準就是天花板;而 agent 學會 hack 它,只是因為原問題太難。

"What replaces data stack is now reward stack."(約 01:04)

整場最有引用價值的一句:資料時代的下一頁是獎勵設計。

"I hope that four years from now we'll see a Fields Medal awarded to AI plus human."(約 01:05)

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Snake-in-the-box(hypercube 最長蛇) 在 D 維超立方體中尋找最長的 induced path Finding the longest induced path (snake) in the D-dimensional hypercube 他們在九維打破長期紀錄;連結至密碼學與量子計算 / record beaten in dimension 9; connects to cryptography and quantum computation
Eisenbud 交換代數問題 尋找同時具備兩個性質的 monomial ideals Finding monomial ideals with two properties simultaneously 由 UC Berkeley 的 David Eisenbud 提出;需階層式多元件架構 / posed by David Eisenbud; needed a hierarchical multi-component system
Andrews–Curtis 猜想 群論中開放 60 年的問題,結構類似魔術方塊路徑搜尋 60-year-old group theory problem, structurally a Rubik's-Cube-style pathfinding search 資料分佈為雙峰,是 RL 訓練的核心難點 / bimodal data distribution is the core RL difficulty
AlphaEvolve 拿來測試 snake-in-the-box 的系統之一 One of the systems they threw at snake-in-the-box 與 Fable 一樣解不出來 / like Fable, it doesn't solve it
Montezuma's Revenge / DQN 稀疏獎勵的經典 benchmark,DQN(2013)慘敗 Canonical sparse-reward benchmark; DQN (2013) failed on it AlphaGo / AlphaZero / MuZero 時期(2015–2018)也未解決 / unsolved through the AlphaGo–MuZero era
CoastRunners(OpenAI) reward hacking 經典案例:賽船繞圈撿分不完賽 Classic reward-hacking case: the boat farms rewards instead of finishing the race
DeepMind Lego stacking 機械手臂翻轉積木騙過相機以取得高度獎勵 Robotic arm flips the block to fool the camera into reading increased height
Palisade Research 西洋棋案例 reward tampering:AI 移除對手引擎以取勝 Reward tampering: the AI removes the opposing engine to win
未解硬數學問題清單網站 列出約 100 個未解問題,含全部 Millennium Prize 問題 A site listing ~100 unsolved hard math problems including all Millennium Prize problems 網址未在字幕中出現,待確認 / URL not captured in the transcript

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Sergey Gukov Sergei Gukov(官網議程用字)/ per the official agenda
Andrews' conjecture Andrews–Curtis conjecture
this session on sound science 字幕誤聽;語意為本場 AI for Math session / mis-transcription; he means the AI for Math session
Coast Runners boat CoastRunners(OpenAI 的 reward hacking 案例)/ OpenAI's reward-hacking example
W and B curves Weights & Biases (W&B) curves
reward tempering reward tampering
David Eisenbud 正確,無需更正 / correct as heard

待確認 / To Verify

  • 列出約 100 個未解硬數學問題的網站網址(投影片有,字幕沒有)。/ The URL of the site listing ~100 unsolved hard problems (on the slide, not in the transcript).
  • 他們在 snake-in-the-box 九維取得的具體長度數值與是否已發表。/ The specific dimension-9 length they achieved and whether it's published.
  • Eisenbud 交換代數問題的解是否已發表、發表於何處。/ Whether the Eisenbud commutative-algebra result is published and where.
  • ICML / ICLR / NeurIPS 三處論文的完整標題(字幕僅提到會議名)。/ Full titles of the ICML / ICLR / NeurIPS papers — only the venues were named.
  • SWE-bench「70–80%」是指哪個時間點的哪個榜單。/ Which SWE-bench leaderboard and date the 70–80% figure refers to.
  • 「一週前 ICM 頒出四面 Fields Medal」的具體屆次與得主(講者未點名)。/ Which ICM and which medalists — none were named.

GitHub 上的 Markdown 原始檔 ↗