演講 Session 4: Agent Evaluation & Benchmarks

資料 Benchmark:一切都是編的,分數也不重要

Grace Tang — AI @ Hex

8 月 2 日(日) · Compass Stage · 02:43:39–02:49:08 · 下午場直播

好的 frontier benchmark 有一個共同點——題目對 agent 和對人類都是真的難;但資料分析領域的公開 benchmark 大多是選擇題、Kaggle 練習題和規格不清的偽問題,和分析師的日常工作幾乎無關,所以 Hex 自己蓋了一間完全虛構、但夠髒夠真的公司 Shorelane 來測。

TL;DR

  • 論點只有一句:agent 應該在「與最終部署環境同等真實」的環境裡被測試。而資料分析是 frontier benchmark 裡被模型化得最差的領域之一
  • 三個公開 benchmark 的具體病灶:DSBench 的「真實資料任務」其實是財務建模選擇題和 Kaggle 的 Scrabble 拼字謎題;Spider 2 的英文描述過度規定,實質是把英文翻成 WHERE 子句的翻譯/指令遵循任務,不是分析;DABstep 的「哪個國家詐欺最多」根本沒說是看詐欺率還是詐欺量——規格不清,而真正的分析師會給你一張圖。
  • Hex 的做法是 Shorelane:一間完全合成的公司,帶著真實企業會有的語意陷阱、髒資料、schema migration 與不完整的文件;任務是分析師日常會接到的工單,評分看的是整條思考鏈、工具使用效率、以及分析本身

重點整理

好的 frontier benchmark 長什麼樣(約 02:44–02:45)

Grace Tang 在 Hex 做 AI research。Hex 是 AI 資料分析平台,她大部分時間在想辦法讓 LLM 把資料分析與資料科學做得更好——「這件事真的很難」——因此 eval 與實驗佔了他們思考的很大一塊。

她的開場是一句吐槽:最近每次看到新的公開資料 benchmark,感受都一樣——「一切都是編的,分數也不重要。」

她的主張很簡單,也呼應了當天很多講者:我們應該在「與最終部署同等真實」的環境裡測試 agent。 而她要說明的是:資料領域在 frontier benchmarking 裡被模型化得特別差。

先看好的長什麼樣。她舉了三個例子:從零重建一個常見 codebase(沒有網路,只有文件)、經營一間販賣機生意最後直接看你賺多少、以及那種看似簡單卻困難、人類只有約 30% 能解的網路搜尋題。

這些優秀的 frontier benchmark 有什麼共同點?它們測的是我們真正在乎 agent 能做到的真實世界行為;而且題目對 agent 難,對人也難。

資料分析領域的三個反例(約 02:45–02:47)

DSBench:去年 OpenAI 用 DSBench 宣布他們的 agent 在「真實資料任務」上大幅超越人類表現。那些「真實任務」實際上是什麼?一堆關於財務建模的選擇題——「你能寫出這段 SQL 嗎?」「你該用哪個 Excel 公式?」——再加上一堆公開的 Kaggle 專案,包括一個 Scrabble 拼字謎題。她的評語:「資料分析師會告訴你,他們的日常工作不長這樣。如果你的工作長這樣,我很遺憾。」

Spider 2(她提到 Scale 的 Emily 稍早也講過 text-to-SQL):主要問題是它其實沒在測分析。仔細看,那些英文描述非常具體、非常規定性,你基本上是在把英文對應成 WHERE 子句——這是翻譯任務或指令遵循任務。而且外部知識的策展也不夠嚴謹——「連運動項目都搞錯了。」

DABstep:一個很知名的資料集。題目看起來很直接:選擇題,「詐欺最多的國家是哪個?」問題是,你真的把資料拉出來看,會發現這題根本規格不清——它沒說你要看的是詐欺率還是詐欺量。而真正的分析師產出的可能是一張圖表,而那張圖可以說更完整、也更正確

她補了一句避免誤會:「我不想踩別人的成果,他們投入了很多心力。」但整體而言,同樣的主題一再浮現(她列了九項,多到念不完):不真實、評分過於嚴苛、不是紮根在現實裡的。

Shorelane:自己蓋一間夠髒的公司(約 02:47–02:48)

於是 Hex 建了 Shorelane。她一開口就自嘲呼應講題:「Shorelane 完全是編出來的,分數一樣不重要。我不是說我們解決了這個問題,但它挺酷的,而且我們試著處理了前面那些真實性問題。」

Shorelane Commerce 是一間完全合成的 B2B SaaS 公司,帶著真實企業裡會出現的語意陷阱。它很髒:有 schema migration,有不完整的文件

任務端則是讓 agent 處理現實中分析師或分析 agent 真的會接到的工單。評分看三件事:整條思考鏈(train of thinking)、工具使用效率、以及實際進行的分析本身。

沒講完的下半題(約 02:48)

她最後拋出一個因時間不足而只能點到為止的問題:這些 eval 仍然是被凍結在某個時間點的。我們要怎麼讓資料分析(agent)從自己的錯誤中學習?

更多內容在 hex.tech;她也提到職缺頁面歡迎接洽。

金句

"We should be testing these agents in environments that have the same level of realism as their eventual deployments."(約 02:44)

整場的論點。

"What do all of these great frontier benchmarks have in common? … The problems are hard for agents and they're hard for people as well."(約 02:45)

好 benchmark 的判準,一句話。

"Data analysts will tell you that this is not what their work looks like on the day-to-day. If this is what your work looks like, I'm sorry."(約 02:46)

全場笑點,但也是對 DSBench「真實任務」最直接的反駁。

"These evals are still suspended in a moment in time. How can we allow data analytics to learn from their mistakes?"(約 02:48)

她留下的開放問題:靜態 eval 之後呢?

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Shorelane / Shorelane Commerce Hex 建構的完全合成公司環境,用於資料分析 agent 評估 Hex's fully synthetic company environment for evaluating data analytics agents Hex 部落格另有更詳細的環境描述(合成 Snowflake warehouse、注入的資料品質問題、每日推進的時鐘)/ Hex's blog describes the environment in more detail
DSBench 資料科學 benchmark,被點名任務不真實 Data science benchmark, criticized for unrealistic tasks OpenAI 曾用它宣稱超越人類表現 / cited by OpenAI to claim superhuman performance
Spider 2 text-to-SQL benchmark,被點名實質是翻譯/指令遵循任務 Text-to-SQL benchmark, criticized as a translation / instruction-following task
DABstep 資料分析 benchmark,被點名題目規格不清 Data analytics benchmark, criticized as underspecified
Hex AI 資料分析平台 AI data analytics platform hex.tech

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
a random set(主持人誤讀下一位講者) Arindam Sett(下一場講者 / next speaker)
hex.te hex.tech
evolves evals
sellable by humans solvable by humans
B2B SAS B2B SaaS
dabstep DABstep
spider 2 Spider 2

待確認 / To Verify

  • 她舉的三個「好 benchmark」中,第一個(從零重建 codebase、無網路只有文件)的正式名稱——字幕聽作 "program bench",未能確認。/ The first of her three "good benchmark" examples (rebuild a codebase from scratch, no internet, docs only) — captions give "program bench"; name unconfirmed.
  • 販賣機經營 benchmark 與「人類僅約 30% 可解」的網路搜尋 benchmark 的正式名稱(演講中未點名)。/ Formal names of the vending-machine business benchmark and the web-search benchmark humans solve ~30% of the time — not named on stage.
  • 她投影片上「九項主題」的完整清單(她說太多念不完)。/ The full list of the nine recurring themes on her slide, which she skipped reading aloud.
  • Shorelane 的公開程度:是否開源、是否有公開 leaderboard。/ Whether Shorelane is open-sourced or has a public leaderboard.
  • 她稱 Shorelane Commerce 為「B2B SaaS」,Hex 部落格則描述為 B2B2C 辦公用品平台,說法需核對。/ She called Shorelane Commerce a "B2B SaaS" company; Hex's blog describes it as a B2B2C office-supplies platform — the descriptions need reconciling.

GitHub 上的 Markdown 原始檔 ↗