演講 Session 3: AI for Math

Unit Distance 猜想與 AI for Math

Lijie Chen — Researcher, OpenAI

8 月 2 日(日) · Atlas Stage · 01:05:55–01:17:43 · 下午場直播

推翻 Erdős 1946 年 unit distance 猜想的不是為數學特訓的模型,而是一個沒有 harness、只給一個 prompt 的通用推理模型;它的優勢不是深度,而是同時精通兩個相距很遠的數學領域——這正是人類數學家最貴的能力。

TL;DR

  • 結果本身:約兩個月前 OpenAI 宣布模型推翻了 Erdős 的 unit distance 猜想——構造出單位距離對數超過線性的點集。原猜想問的是:平面上 n 個相異點,距離恰為 1 的點對數是否至多大約線性多。
  • 產出方式才是重點:由一個沒有為數學特訓的通用推理模型(基本上就是一版 ChatGPT)在一次硬數學問題的評估中發現;沒有 harness——一個 prompt,模型持續思考、視需要用工具(可存取網頁與終端機),最後給出答案。
  • 構造的性質:Erdős 原構造是 n×n 網格加上精心挑選的縮放;新構造是在 L(i) 這個數域上的網格,其中 L 是精心設計的高次實數域。模型在思路中自己講明了直覺:代數量的次數與高度可以極大,而這反而是好事。
  • 能力來源:成功率隨 test-time compute 單調上升;看 CoT 可見模型會自省「這個方向沒進展 / 我剛剛錯了」並自我修正。
  • 他對難度的評估:這個結果約值「頂尖人類的 6 小時」——但前提是這個人已經精通全部數學。證明本身不深,難在要同時是很好的代數數論學家與很好的離散幾何學家;而學會一個新領域要兩年。AI 的獨特優勢就在跨領域廣度,而不是單點深度。

重點整理

問題與結果(約 01:06–01:08)

他開場自嘲這是「比較像昨天的新聞」——投影片是幾週前做的,期間他們又發布了 10 項數學重大未解問題的新證明,但這個發現仍值得回顧。

Unit distance 問題敘述極簡單:平面(二維歐氏空間)上任意 n 個相異點,距離大約為 1 的點對最多能有多少?猜想是至多大約線性多。這是 Paul Erdős 在 1946 年提出的,是離散幾何的核心問題之一。

約兩個月前他們宣布:OpenAI 的模型推翻了這個猜想,構造出點對數超過線性的例子。

這個發現是怎麼產生的(約 01:08–01:09)

這一段是整場最值得記下的部分:

  • 由一個通用推理模型達成,不是為數學特別訓練的;它完全通用,基本上就是一版 ChatGPT。
  • 發現於一次模型評估過程中——他們拿非常難的數學問題來測模型,因為現在大多數數學 benchmark 都已飽和,必須找難題才能測出能力。
  • 完全沒有 harness:就是給模型一個 prompt,它持續思考、可能用一些工具,然後得到最終答案。模型能存取網頁與終端機,所以可以自己查前人做過什麼。

新舊構造的差別(約 01:09–01:10)

  • Erdős 原構造:一個 n×n 網格,配上精心挑選的縮放,讓其中很多點對距離恰為 1。
  • 新構造:更複雜——是在有理數上的網格,並在數域 L(i) 中工作,其中 L 是一個精心設計的高次實數域

他沒有深入細節,但引了模型自己在思路中寫下的直覺:這些代數對象的次數與高度可以極其巨大,而那其實可以是件好事——模型正是據此挑出了讓構造成立的那個數域。

Test-time compute 與自我修正(約 01:10–01:11)

拿到解之後,他們回頭研究成功率與投入的 test-time compute 的關係:投入越多 test-time compute,解對的機率越高。想更久,確實更可能找到正確解。

而從 CoT 可以看到:模型能自省——意識到自己在某個方向沒有進展、或發現自己犯了錯,然後自我修正並繼續。

如何衡量 AI 的進展(約 01:11–01:13)

他引用 METR 的圖:x 軸是年份,y 軸是「該時點 agent 能可靠完成的任務,換算成人類需要多少時間」。這條線大約每 6 個月翻倍——不過他也指出 METR 的圖主要落在 coding 領域。

換到數學上做同樣的刻度: - 約兩年前,模型能解 AIME——大致等於一位很好的高中生 20 分鐘。 - 一年後,能解 IMO 問題——難得多,約等於頂尖高中生 90 分鐘。 - 再一年後,能解離散幾何中的長年未解問題

6 小時的但書:AI 的優勢是廣度而非深度(約 01:13–01:15)

那 unit distance 這個結果換算成多少人類時間?他的估計是約頂尖人類的 6 小時——但前提是這個人已經精通全部數學

理由是:這個證明並不深。它的難處在於需要從一個相距很遠的領域取出想法、套回離散幾何。你必須同時是很好的代數數論學家與很好的離散幾何學家;如果兩邊都很強,大概一兩天就能推到結論。真正的挑戰是精通兩個相距很遠的領域——因為學會一個新領域大概要兩年。

所以 AI 在這裡有非常獨特的優勢:對所有數學領域都有廣泛熟悉度,而且在許多子領域都有相當水準。這種例子對已經具備正確專長的人來說不需要多少時間,但對必須先學該領域的人就完全是另一回事。unit distance 的進展反映的是「想更久」× 「更好的領域知識」兩種強度相乘的效果。

他也給了誠實的但書:有些數學結果需要數學家在單一主題上深耕數年,而 AI 是否已經到那個程度,還不清楚

接著:unit distance 之後他們發布了 5.6,數學推理非常強,過去兩週已有大量公開結果;而且就在前一天又宣布了 10 項數學與理論計算機科學不同領域的新結果。

他對後果的看法(約 01:15–01:17)

  • AI 特別擅長連結相距很遠的研究領域,unit distance 本身就是例子。數學家會因此被賦能去使用他們較不熟悉領域的想法,因為 AI 能找到相關概念並解釋得很好。
  • 數學從來就不只是解題。他強調:OpenAI 這個 unit distance 解答中最重要的人類輸入,其實是 Paul Erdős——是他提出了這個敘述簡單、解答卻極深的漂亮問題。AI 找到解,而人類理解了它。 證明發布後,世界各地不同團隊已有至少五、六項後續工作。
  • 因為現在很容易找到例子,「該問哪些深刻問題」這件事的迭代會變得容易得多
  • 類比:精確計算曾經是數學很大一部分,計算機與電腦解放了數學家;而自從有了 Codex、AlphaCode 這類 coding 模型,程式設計師反而花更多時間寫程式,因為能做的事變多了。他預期數學家也一樣會被賦能去做更多數學——不必再做繁瑣計算,可以專注在高層次的想法,或單純享受過程。

金句

"This is achieved by a general reasoning model which is not trained specifically for math. It's completely general. It's basically a version of ChatGPT."(約 01:08)

這場最重要的一句:突破來自通用能力,不是為數學客製的系統。

"Essentially there's no harness. You just give the model one prompt and then it keeps thinking about things and maybe use some tools and then it arrives at the final answer."(約 01:08)

在一場滿是 harness 與 orchestration 的峰會上,這句話格外醒目。

"The challenge is really to master two distinct areas. So, in that sense, AI has this very unique advantage here."(約 01:14)

AI 的優勢不是比人聰明,而是不需要花兩年學一個新領域。

"The most important human input to the OpenAI solution to unit distance is actually Paul Erdős, who really posed this beautiful question."(約 01:16)

提問仍然是人類的工作;AI 找到解,人類理解它。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Erdős unit distance 問題 平面上 n 點中距離為 1 的點對數上界問題,1946 年提出 Upper bound on unit-distance pairs among n points in the plane; posed 1946 離散幾何核心問題;現已被推翻 / a central discrete-geometry question, now disproved
OpenAI 的 unit distance 證明 通用推理模型在評估中發現的反例構造 The counterexample construction found by a general reasoning model during an eval 無 harness、單一 prompt、可存取網頁與終端機 / no harness, one prompt, web and terminal access
METR time-horizon 圖 以「agent 能可靠完成的任務所需人類時間」衡量 AI 進展 Progress measured as the human time-length of tasks agents can reliably complete 講者稱約每 6 個月翻倍,主要為 coding 領域 / he cites ~6-month doubling, mostly coding
AIME / IMO 用來替數學能力進展做人類時間刻度 Used as human-time yardsticks for math capability progress 分別約 20 分鐘與 90 分鐘頂尖高中生時間 / ~20 and ~90 minutes of top high-schooler time
5.6 unit distance 之後發布、數學推理非常強的模型版本 The model version released after unit distance, very strong at mathematical reasoning 完整名稱待確認 / full model name to verify
Codex / AlphaCode 用來類比「工具讓從業者做更多而非更少」 Used to argue tools make practitioners do more, not less

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Lisha Lijie Chen
Meter(那張圖) METR
Alpha Code AlphaCode
Paul Erdős(字幕拼寫不一) Paul Erdős
the algebraic variation algebraic 對象的 degree 與 height(字幕殘缺)/ garbled; refers to the degree and height of the algebraic objects
we released 5.6 so we released 5.6(「so」為口癖)/ "so" is a filler word

待確認 / To Verify

  • 「5.6」的完整模型名稱與發布日期(字幕僅有版本號)。/ Full name and release date of the model referred to as "5.6".
  • METR 圖的翻倍週期:講者說每 6 個月,METR 公開的數字通常引用為約 7 個月,需核對他引用的是哪一版。/ METR's doubling period: he says 6 months; the commonly cited published figure is ~7 months — check which version of the plot he showed.
  • 「前一天宣布的 10 項數學與理論計算機科學結果」的公告來源。/ Source for the ten results announced "yesterday".
  • 新構造中 L(i) 與高次實數域的精確敘述(講者刻意略過細節)。/ Precise statement of the L(i) construction — he deliberately skipped the details.
  • 「至少五、六項後續工作」的具體論文。/ The specific follow-up papers he referred to.

GitHub 上的 Markdown 原始檔 ↗