演講 Session 4: Agent Evaluation & Benchmarks
資料 Benchmark:一切都是編的,分數也不重要
Grace Tang — AI @ Hex
好的 frontier benchmark 有一個共同點——題目對 agent 和對人類都是真的難;但資料分析領域的公開 benchmark 大多是選擇題、Kaggle 練習題和規格不清的偽問題,和分析師的日常工作幾乎無關,所以 Hex 自己蓋了一間完全虛構、但夠髒夠真的公司 Shorelane 來測。
TL;DR
- 論點只有一句:agent 應該在「與最終部署環境同等真實」的環境裡被測試。而資料分析是 frontier benchmark 裡被模型化得最差的領域之一。
- 三個公開 benchmark 的具體病灶:DSBench 的「真實資料任務」其實是財務建模選擇題和 Kaggle 的 Scrabble 拼字謎題;Spider 2 的英文描述過度規定,實質是把英文翻成 WHERE 子句的翻譯/指令遵循任務,不是分析;DABstep 的「哪個國家詐欺最多」根本沒說是看詐欺率還是詐欺量——規格不清,而真正的分析師會給你一張圖。
- Hex 的做法是 Shorelane:一間完全合成的公司,帶著真實企業會有的語意陷阱、髒資料、schema migration 與不完整的文件;任務是分析師日常會接到的工單,評分看的是整條思考鏈、工具使用效率、以及分析本身。
重點整理
好的 frontier benchmark 長什麼樣(約 02:44–02:45)
Grace Tang 在 Hex 做 AI research。Hex 是 AI 資料分析平台,她大部分時間在想辦法讓 LLM 把資料分析與資料科學做得更好——「這件事真的很難」——因此 eval 與實驗佔了他們思考的很大一塊。
她的開場是一句吐槽:最近每次看到新的公開資料 benchmark,感受都一樣——「一切都是編的,分數也不重要。」
她的主張很簡單,也呼應了當天很多講者:我們應該在「與最終部署同等真實」的環境裡測試 agent。 而她要說明的是:資料領域在 frontier benchmarking 裡被模型化得特別差。
先看好的長什麼樣。她舉了三個例子:從零重建一個常見 codebase(沒有網路,只有文件)、經營一間販賣機生意最後直接看你賺多少、以及那種看似簡單卻困難、人類只有約 30% 能解的網路搜尋題。
這些優秀的 frontier benchmark 有什麼共同點?它們測的是我們真正在乎 agent 能做到的真實世界行為;而且題目對 agent 難,對人也難。
資料分析領域的三個反例(約 02:45–02:47)
DSBench:去年 OpenAI 用 DSBench 宣布他們的 agent 在「真實資料任務」上大幅超越人類表現。那些「真實任務」實際上是什麼?一堆關於財務建模的選擇題——「你能寫出這段 SQL 嗎?」「你該用哪個 Excel 公式?」——再加上一堆公開的 Kaggle 專案,包括一個 Scrabble 拼字謎題。她的評語:「資料分析師會告訴你,他們的日常工作不長這樣。如果你的工作長這樣,我很遺憾。」
Spider 2(她提到 Scale 的 Emily 稍早也講過 text-to-SQL):主要問題是它其實沒在測分析。仔細看,那些英文描述非常具體、非常規定性,你基本上是在把英文對應成 WHERE 子句——這是翻譯任務或指令遵循任務。而且外部知識的策展也不夠嚴謹——「連運動項目都搞錯了。」
DABstep:一個很知名的資料集。題目看起來很直接:選擇題,「詐欺最多的國家是哪個?」問題是,你真的把資料拉出來看,會發現這題根本規格不清——它沒說你要看的是詐欺率還是詐欺量。而真正的分析師產出的可能是一張圖表,而那張圖可以說更完整、也更正確。
她補了一句避免誤會:「我不想踩別人的成果,他們投入了很多心力。」但整體而言,同樣的主題一再浮現(她列了九項,多到念不完):不真實、評分過於嚴苛、不是紮根在現實裡的。
Shorelane:自己蓋一間夠髒的公司(約 02:47–02:48)
於是 Hex 建了 Shorelane。她一開口就自嘲呼應講題:「Shorelane 完全是編出來的,分數一樣不重要。我不是說我們解決了這個問題,但它挺酷的,而且我們試著處理了前面那些真實性問題。」
Shorelane Commerce 是一間完全合成的 B2B SaaS 公司,帶著真實企業裡會出現的語意陷阱。它很髒:有 schema migration,有不完整的文件。
任務端則是讓 agent 處理現實中分析師或分析 agent 真的會接到的工單。評分看三件事:整條思考鏈(train of thinking)、工具使用效率、以及實際進行的分析本身。
沒講完的下半題(約 02:48)
她最後拋出一個因時間不足而只能點到為止的問題:這些 eval 仍然是被凍結在某個時間點的。我們要怎麼讓資料分析(agent)從自己的錯誤中學習?
更多內容在 hex.tech;她也提到職缺頁面歡迎接洽。
金句
"We should be testing these agents in environments that have the same level of realism as their eventual deployments."(約 02:44)
整場的論點。
"What do all of these great frontier benchmarks have in common? … The problems are hard for agents and they're hard for people as well."(約 02:45)
好 benchmark 的判準,一句話。
"Data analysts will tell you that this is not what their work looks like on the day-to-day. If this is what your work looks like, I'm sorry."(約 02:46)
全場笑點,但也是對 DSBench「真實任務」最直接的反駁。
"These evals are still suspended in a moment in time. How can we allow data analytics to learn from their mistakes?"(約 02:48)
她留下的開放問題:靜態 eval 之後呢?
提到的專案與資源 / Projects & Resources
| 名稱 Name | 說明 | Description | 備註 Notes |
|---|---|---|---|
| Shorelane / Shorelane Commerce | Hex 建構的完全合成公司環境,用於資料分析 agent 評估 | Hex's fully synthetic company environment for evaluating data analytics agents | Hex 部落格另有更詳細的環境描述(合成 Snowflake warehouse、注入的資料品質問題、每日推進的時鐘)/ Hex's blog describes the environment in more detail |
| DSBench | 資料科學 benchmark,被點名任務不真實 | Data science benchmark, criticized for unrealistic tasks | OpenAI 曾用它宣稱超越人類表現 / cited by OpenAI to claim superhuman performance |
| Spider 2 | text-to-SQL benchmark,被點名實質是翻譯/指令遵循任務 | Text-to-SQL benchmark, criticized as a translation / instruction-following task | |
| DABstep | 資料分析 benchmark,被點名題目規格不清 | Data analytics benchmark, criticized as underspecified | |
| Hex | AI 資料分析平台 | AI data analytics platform | hex.tech |
逐字稿勘誤 / Transcript Corrections
| 字幕原文 Heard as | 應為 Should be |
|---|---|
| a random set(主持人誤讀下一位講者) | Arindam Sett(下一場講者 / next speaker) |
| hex.te | hex.tech |
| evolves | evals |
| sellable by humans | solvable by humans |
| B2B SAS | B2B SaaS |
| dabstep | DABstep |
| spider 2 | Spider 2 |
待確認 / To Verify
- 她舉的三個「好 benchmark」中,第一個(從零重建 codebase、無網路只有文件)的正式名稱——字幕聽作 "program bench",未能確認。/ The first of her three "good benchmark" examples (rebuild a codebase from scratch, no internet, docs only) — captions give "program bench"; name unconfirmed.
- 販賣機經營 benchmark 與「人類僅約 30% 可解」的網路搜尋 benchmark 的正式名稱(演講中未點名)。/ Formal names of the vending-machine business benchmark and the web-search benchmark humans solve ~30% of the time — not named on stage.
- 她投影片上「九項主題」的完整清單(她說太多念不完)。/ The full list of the nine recurring themes on her slide, which she skipped reading aloud.
- Shorelane 的公開程度:是否開源、是否有公開 leaderboard。/ Whether Shorelane is open-sourced or has a public leaderboard.
- 她稱 Shorelane Commerce 為「B2B SaaS」,Hex 部落格則描述為 B2B2C 辦公用品平台,說法需核對。/ She called Shorelane Commerce a "B2B SaaS" company; Hex's blog describes it as a B2B2C office-supplies platform — the descriptions need reconciling.