演講 Session 4: Agent Evaluation & Benchmarks

更好的 Eval 如何透過加速科學發現帶來豐盛

Scott Clark — Co-Founder & CEO, Distributional

8 月 2 日(日) · Compass Stage · 02:54:38–03:00:54 · 下午場直播

黑箱最佳化器最棒的一點是它會最佳化你給它的任何 eval,最糟的一點是它會盲目地最佳化你給它的任何 eval——所以加速科學的瓶頸從來不是最佳化能力,而是懂物理、懂科研流程、懂假說驗證的 eval。

TL;DR

  • 他定義的 abundance 是科幻式的生活品質提升:更好的科學發現 → 新材料、更高效的能源 → 更好的醫藥、更高效的交通。他明確劃清界線:這件事不是關於淘汰更多白領工作,而是關於改善人的生活品質。
  • 20 年的個人主線是「調參數」:從蛋白質摺疊、量子力學模擬到 metagenome assembly,每個問題最後都卡在同一件事——東西做好了,然後要調。研究生熬夜在高維空間裡轉旋鈕換一篇好一點的論文,他們戲稱 grad student descent。他愛上了 Bayesian optimization,做成博論核心,再做成第一家新創 SigOpt
  • 最佳化解決了,信任沒有:SigOpt 幫客戶把某個數字推上去,客戶回頭說「另一個數字掉了」。黑箱最佳化器會盲目最佳化你給的任何 eval——只要 1% 交易是詐欺,「全部判定非詐欺」就有 99% 準確率。
  • Distributional 的兩次轉向是誠實的失敗紀錄:先用最複雜的統計檢定去解 chaos 與 non-stationarity(「糟透的點子,因為沒人喜歡寫測試,大家的資料也不夠,而且反正都在 YOLO 把模型丟進 production」),再轉去做 analytics 抓 unknown unknown——結論是「eval 是個好點子,但它比較像一個 feature,談不上產品,更談不上一家新創」。
  • 現在的答案是 bespoke evals:懂物理、懂科研流程、懂假說驗證的客製化 eval,讓「what-if 機器」的飛輪越轉越快——把他當年要花六個月的事情壓縮到六小時。NeurIPS 時開源,目前私測中。

重點整理

什麼是 abundance,以及為什麼是現在(約 02:55–02:56)

Scott Clark 是 Distributional 的共同創辦人兼 CEO,同時在打造 Talaria Scientific。他開場先定義題目裡的 abundance:

透過 AI 帶來的豐盛,是更好的科學發現——帶來新材料、更高效的能源,進而帶來更好的醫藥、更高效的移動方式。「基本上就是活在科幻小說般的未來。」

他刻意把這件事和另一種敘事切開:「這比較不是關於我們怎麼淘汰更多白領工作、讓大家失業,而是關於我們怎麼改善人的生活品質。」

他說,他相信我們第一次真正有能力有意義地用 AI 加速科學發現——過去幾個月解鎖了相當多能力。而這是他 20 年來的執念。

Grad student descent:20 年的同一個問題(約 02:56–02:57)

從大學到博士,他解過的每一個問題、合作過的每一個團隊——蛋白質摺疊、量子力學模擬、metagenome assembly——最後都撞上同一堵牆:你做出了很棒的東西,然後你得去調它。 各種旋鈕、槓桿、hyperparameter。把圖表和 benchmark 弄好看一點,你就有一篇好一點的論文。

他們戲稱這叫 grad student descent:因為通常就是研究生在深夜裡,於高維空間中手動轉旋鈕,只為換一篇稍微好一點的論文。

當然有人用聰明的方法:simulated annealing、genetic algorithms、local methods。而他愛上的是 Bayesian optimization——它成了他博士論文的核心,後來也成了他第一家 AI 新創的核心。

SigOpt:把最佳化做成生意(約 02:57–02:58)

SigOpt 創立於 2014 年,目標就是解決參數調校問題。七年間他們合作過:

  • Netflix——調推薦系統
  • American Express——調詐欺偵測系統
  • OpenAI——在它還是非營利實驗室的早期,調它們早期的 RL 系統
  • 一兆美元規模的避險基金
  • 數百位學者透過免費方案調自己的論文,從材料設計到藥物發現

2020 年他把公司賣給 Intel,在那裡從晶片設計一路調到「benchmaxxing MLPerf」——「那時候大家都在對它 overfit。」

目標是「為真正重要的問題做規模化最佳化」。他的評語是:「它運作得非常好——除了它不行的時候。」

黑箱最佳化器的兩面(約 02:58–02:59)

問題在於:它會精準地照你告訴它的去做。 客戶常常回頭說:「對,你把那個數字弄上去了,但另一個數字掉下來了。」

他給了全場最鋒利的對句:

黑箱最佳化器最棒的一點,是它會最佳化你給它的任何 eval。而黑箱最佳化器最糟的一點,是它會盲目地最佳化你給它的任何 eval。

例子:如果你的交易裡只有 1% 是詐欺,那麼「宣稱沒有任何交易是詐欺」就能得到 99% 準確率——一個非常「準確」的詐欺偵測系統。

而且,我們離「把這些系統設定成完全自主」還很遠。他不認為我們近期能直接下指令說「目標:解決穩定核融合侷限問題」「解決癌症」。而且就算模型真的給出了答案,我們要怎麼信任它?

這就是硬幣的兩面:你需要最佳化這些系統,你也需要能信任它們。

Distributional 的兩次轉向(約 02:59–03:00)

信任這一面,就是他創立 Distributional 的初衷。

第一版:他打算用最複雜的數學方式解決它——大型統計檢定,把 chaos 和 non-stationarity 一起解掉。他的自評很直接:「這是個糟透的點子,因為沒有人喜歡測試。他們沒有那些資料,而且反正大家都在 YOLO 把模型丟進 production。」

於是他 pivot 了——「你就是這樣做的嘛,失敗了就 pivot」——轉向 analytics:去抓那些偷偷溜過你系統的 eval,從行為中找出模式,好指認出「這是一個 unknown unknown」。

但他對這條路也給了誠實的判決:「eval 是個很好的點子,但它比較像一個 feature,談不上是產品,更談不上是一家新創。」

現在的答案:bespoke evals(約 03:00)

所以他現在把過去 20 年學到的一切,用來攻擊那個科學問題:我們要怎麼加速科學? 而聚焦點在於「真正重要的東西」——

打造 bespoke evals:懂物理的 eval、懂科學研究流程的 eval、懂得怎麼做假說驗證的 eval。 有了它,你就能把那台「what-if 機器」的飛輪轉得越來越快——把他研究所時代要花六個月的事,壓縮成六小時。

他們公開地在做這件事:NeurIPS 時會開源,目前有 private beta。他歡迎任何在做計算科學相關工作的人找他聊。

金句

"The very best thing about a black-box optimizer is it will optimize any eval you give it. And the very worst thing about a black-box optimizer is it will blindly optimize any eval you give it."(約 02:58)

整場的軸心:最佳化器的品質上限,就是你的 eval 的品質上限。

"You could make a really accurate fraud detection system if only 1% of your transactions are fraud by saying nothing's fraud. 99% accuracy right there."(約 02:58)

最省力的 benchmark 破解法,也是最好的反面教材。

"This was a terrible idea because nobody likes tests. They didn't have the data and everybody was just YOLOing models into production anyway."(約 02:59)

創業者對自己第一版產品的誠實驗屍。

"The eval is a really good idea, but it's more of a feature, let alone a product, let alone a startup."(約 02:59)

在一場以 eval 為主題的 session 裡,這句話格外有份量。

"Doing what I did in grad school that used to take six months in six hours instead."(約 03:00)

他對加速科學的具體度量。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Talaria Scientific 他目前打造的計算科學 agentic 系統,搭配懂物理與科研流程的 bespoke evals His current venture: an agentic system for computational science paired with bespoke, physics-aware evals 將於 NeurIPS 開源,目前 private beta / open sourcing at NeurIPS, private beta now
Distributional 他共同創辦的公司,從統計檢定轉向 AI 行為 analytics His company; pivoted from statistical testing to AI behavioral analytics
SigOpt 2014 年創立的 Bayesian optimization 新創,2020 年由 Intel 收購 Bayesian optimization startup founded 2014, acquired by Intel in 2020 客戶含 Netflix、American Express、早期 OpenAI / customers included Netflix, American Express, and early OpenAI
Bayesian optimization 他博論與第一家新創的核心方法 The core method of his thesis and first startup 與 simulated annealing、genetic algorithms 等並列比較 / contrasted with simulated annealing and genetic algorithms
MLPerf 他形容 Intel 時期「大家都在對它 overfit」的 benchmark The benchmark he says everyone was overfitting to during his Intel years

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Taria Scientific Talaria Scientific
SIGOPT / Sigopt SigOpt
AMX American Express (AmEx)
Beijian optimization Bayesian optimization
benchmaxing MLF benchmaxxing MLPerf
recommener systems recommender systems
non-stationerity non-stationarity
stable confu stable fusion containment stable fusion containment
Nurips NeurIPS
evolves evals
yoloing YOLOing

待確認 / To Verify

  • Talaria Scientific 的開源專案名稱與 NeurIPS 釋出的確切時間點。/ The name of the Talaria Scientific open-source project and the exact NeurIPS release timing.
  • 「約一兆美元規模的避險基金」為口頭說法,確切口徑不明。/ The "roughly a trillion dollars' worth of hedge funds" figure was spoken loosely; the exact basis is unclear.
  • SigOpt 服務 OpenAI 早期 RL 系統的公開紀錄。/ A public record of SigOpt's work on OpenAI's early RL systems.
  • bespoke evals 的具體設計(如何「懂物理」、如何做 hypothesis validation)在演講中未展開。/ The concrete design of the bespoke evals — how they "know physics" and perform hypothesis validation — was not detailed on stage.

GitHub 上的 Markdown 原始檔 ↗