演講 Session 4: Agent Evaluation & Benchmarks
更好的 Eval 如何透過加速科學發現帶來豐盛
Scott Clark — Co-Founder & CEO, Distributional
黑箱最佳化器最棒的一點是它會最佳化你給它的任何 eval,最糟的一點是它會盲目地最佳化你給它的任何 eval——所以加速科學的瓶頸從來不是最佳化能力,而是懂物理、懂科研流程、懂假說驗證的 eval。
TL;DR
- 他定義的 abundance 是科幻式的生活品質提升:更好的科學發現 → 新材料、更高效的能源 → 更好的醫藥、更高效的交通。他明確劃清界線:這件事不是關於淘汰更多白領工作,而是關於改善人的生活品質。
- 20 年的個人主線是「調參數」:從蛋白質摺疊、量子力學模擬到 metagenome assembly,每個問題最後都卡在同一件事——東西做好了,然後要調。研究生熬夜在高維空間裡轉旋鈕換一篇好一點的論文,他們戲稱 grad student descent。他愛上了 Bayesian optimization,做成博論核心,再做成第一家新創 SigOpt。
- 最佳化解決了,信任沒有:SigOpt 幫客戶把某個數字推上去,客戶回頭說「另一個數字掉了」。黑箱最佳化器會盲目最佳化你給的任何 eval——只要 1% 交易是詐欺,「全部判定非詐欺」就有 99% 準確率。
- Distributional 的兩次轉向是誠實的失敗紀錄:先用最複雜的統計檢定去解 chaos 與 non-stationarity(「糟透的點子,因為沒人喜歡寫測試,大家的資料也不夠,而且反正都在 YOLO 把模型丟進 production」),再轉去做 analytics 抓 unknown unknown——結論是「eval 是個好點子,但它比較像一個 feature,談不上產品,更談不上一家新創」。
- 現在的答案是 bespoke evals:懂物理、懂科研流程、懂假說驗證的客製化 eval,讓「what-if 機器」的飛輪越轉越快——把他當年要花六個月的事情壓縮到六小時。NeurIPS 時開源,目前私測中。
重點整理
什麼是 abundance,以及為什麼是現在(約 02:55–02:56)
Scott Clark 是 Distributional 的共同創辦人兼 CEO,同時在打造 Talaria Scientific。他開場先定義題目裡的 abundance:
透過 AI 帶來的豐盛,是更好的科學發現——帶來新材料、更高效的能源,進而帶來更好的醫藥、更高效的移動方式。「基本上就是活在科幻小說般的未來。」
他刻意把這件事和另一種敘事切開:「這比較不是關於我們怎麼淘汰更多白領工作、讓大家失業,而是關於我們怎麼改善人的生活品質。」
他說,他相信我們第一次真正有能力有意義地用 AI 加速科學發現——過去幾個月解鎖了相當多能力。而這是他 20 年來的執念。
Grad student descent:20 年的同一個問題(約 02:56–02:57)
從大學到博士,他解過的每一個問題、合作過的每一個團隊——蛋白質摺疊、量子力學模擬、metagenome assembly——最後都撞上同一堵牆:你做出了很棒的東西,然後你得去調它。 各種旋鈕、槓桿、hyperparameter。把圖表和 benchmark 弄好看一點,你就有一篇好一點的論文。
他們戲稱這叫 grad student descent:因為通常就是研究生在深夜裡,於高維空間中手動轉旋鈕,只為換一篇稍微好一點的論文。
當然有人用聰明的方法:simulated annealing、genetic algorithms、local methods。而他愛上的是 Bayesian optimization——它成了他博士論文的核心,後來也成了他第一家 AI 新創的核心。
SigOpt:把最佳化做成生意(約 02:57–02:58)
SigOpt 創立於 2014 年,目標就是解決參數調校問題。七年間他們合作過:
- Netflix——調推薦系統
- American Express——調詐欺偵測系統
- OpenAI——在它還是非營利實驗室的早期,調它們早期的 RL 系統
- 約 一兆美元規模的避險基金
- 數百位學者透過免費方案調自己的論文,從材料設計到藥物發現
2020 年他把公司賣給 Intel,在那裡從晶片設計一路調到「benchmaxxing MLPerf」——「那時候大家都在對它 overfit。」
目標是「為真正重要的問題做規模化最佳化」。他的評語是:「它運作得非常好——除了它不行的時候。」
黑箱最佳化器的兩面(約 02:58–02:59)
問題在於:它會精準地照你告訴它的去做。 客戶常常回頭說:「對,你把那個數字弄上去了,但另一個數字掉下來了。」
他給了全場最鋒利的對句:
黑箱最佳化器最棒的一點,是它會最佳化你給它的任何 eval。而黑箱最佳化器最糟的一點,是它會盲目地最佳化你給它的任何 eval。
例子:如果你的交易裡只有 1% 是詐欺,那麼「宣稱沒有任何交易是詐欺」就能得到 99% 準確率——一個非常「準確」的詐欺偵測系統。
而且,我們離「把這些系統設定成完全自主」還很遠。他不認為我們近期能直接下指令說「目標:解決穩定核融合侷限問題」「解決癌症」。而且就算模型真的給出了答案,我們要怎麼信任它?
這就是硬幣的兩面:你需要最佳化這些系統,你也需要能信任它們。
Distributional 的兩次轉向(約 02:59–03:00)
信任這一面,就是他創立 Distributional 的初衷。
第一版:他打算用最複雜的數學方式解決它——大型統計檢定,把 chaos 和 non-stationarity 一起解掉。他的自評很直接:「這是個糟透的點子,因為沒有人喜歡測試。他們沒有那些資料,而且反正大家都在 YOLO 把模型丟進 production。」
於是他 pivot 了——「你就是這樣做的嘛,失敗了就 pivot」——轉向 analytics:去抓那些偷偷溜過你系統的 eval,從行為中找出模式,好指認出「這是一個 unknown unknown」。
但他對這條路也給了誠實的判決:「eval 是個很好的點子,但它比較像一個 feature,談不上是產品,更談不上是一家新創。」
現在的答案:bespoke evals(約 03:00)
所以他現在把過去 20 年學到的一切,用來攻擊那個科學問題:我們要怎麼加速科學? 而聚焦點在於「真正重要的東西」——
打造 bespoke evals:懂物理的 eval、懂科學研究流程的 eval、懂得怎麼做假說驗證的 eval。 有了它,你就能把那台「what-if 機器」的飛輪轉得越來越快——把他研究所時代要花六個月的事,壓縮成六小時。
他們公開地在做這件事:NeurIPS 時會開源,目前有 private beta。他歡迎任何在做計算科學相關工作的人找他聊。
金句
"The very best thing about a black-box optimizer is it will optimize any eval you give it. And the very worst thing about a black-box optimizer is it will blindly optimize any eval you give it."(約 02:58)
整場的軸心:最佳化器的品質上限,就是你的 eval 的品質上限。
"You could make a really accurate fraud detection system if only 1% of your transactions are fraud by saying nothing's fraud. 99% accuracy right there."(約 02:58)
最省力的 benchmark 破解法,也是最好的反面教材。
"This was a terrible idea because nobody likes tests. They didn't have the data and everybody was just YOLOing models into production anyway."(約 02:59)
創業者對自己第一版產品的誠實驗屍。
"The eval is a really good idea, but it's more of a feature, let alone a product, let alone a startup."(約 02:59)
在一場以 eval 為主題的 session 裡,這句話格外有份量。
"Doing what I did in grad school that used to take six months in six hours instead."(約 03:00)
他對加速科學的具體度量。
提到的專案與資源 / Projects & Resources
| 名稱 Name | 說明 | Description | 備註 Notes |
|---|---|---|---|
| Talaria Scientific | 他目前打造的計算科學 agentic 系統,搭配懂物理與科研流程的 bespoke evals | His current venture: an agentic system for computational science paired with bespoke, physics-aware evals | 將於 NeurIPS 開源,目前 private beta / open sourcing at NeurIPS, private beta now |
| Distributional | 他共同創辦的公司,從統計檢定轉向 AI 行為 analytics | His company; pivoted from statistical testing to AI behavioral analytics | |
| SigOpt | 2014 年創立的 Bayesian optimization 新創,2020 年由 Intel 收購 | Bayesian optimization startup founded 2014, acquired by Intel in 2020 | 客戶含 Netflix、American Express、早期 OpenAI / customers included Netflix, American Express, and early OpenAI |
| Bayesian optimization | 他博論與第一家新創的核心方法 | The core method of his thesis and first startup | 與 simulated annealing、genetic algorithms 等並列比較 / contrasted with simulated annealing and genetic algorithms |
| MLPerf | 他形容 Intel 時期「大家都在對它 overfit」的 benchmark | The benchmark he says everyone was overfitting to during his Intel years |
逐字稿勘誤 / Transcript Corrections
| 字幕原文 Heard as | 應為 Should be |
|---|---|
| Taria Scientific | Talaria Scientific |
| SIGOPT / Sigopt | SigOpt |
| AMX | American Express (AmEx) |
| Beijian optimization | Bayesian optimization |
| benchmaxing MLF | benchmaxxing MLPerf |
| recommener systems | recommender systems |
| non-stationerity | non-stationarity |
| stable confu stable fusion containment | stable fusion containment |
| Nurips | NeurIPS |
| evolves | evals |
| yoloing | YOLOing |
待確認 / To Verify
- Talaria Scientific 的開源專案名稱與 NeurIPS 釋出的確切時間點。/ The name of the Talaria Scientific open-source project and the exact NeurIPS release timing.
- 「約一兆美元規模的避險基金」為口頭說法,確切口徑不明。/ The "roughly a trillion dollars' worth of hedge funds" figure was spoken loosely; the exact basis is unclear.
- SigOpt 服務 OpenAI 早期 RL 系統的公開紀錄。/ A public record of SigOpt's work on OpenAI's early RL systems.
- bespoke evals 的具體設計(如何「懂物理」、如何做 hypothesis validation)在演講中未展開。/ The concrete design of the bespoke evals — how they "know physics" and perform hypothesis validation — was not detailed on stage.