演講 Session 3: Agentic AI Foundational Capabilities

用 AI 處理資料,用資料餵養 AI

Dan Roth — Chief AI Scientist, Oracle; Professor, UPenn

8 月 1 日(六) · Plenary Stage · 01:23:44–01:36:24 · 下午場直播

通用資料已經被模型吞完了,真正有價值的企業、醫療、政府資料會永遠留在模型外面且不斷變動——所以 agent 底下那層「語意資料層」才是勝負關鍵;而現在連問「歐洲男子網球選手獎金排名」這種小問題,前沿模型都會漏人、算錯、前後不一致。

TL;DR

  • 通用資料的時代結束了:模型供應商已經吞掉了大部分通用資料,但企業、金融機構、政府單位、醫療中心、個人的資料會留在模型之外,而且是動態的。GenAI 的關鍵用例之一,將是協調並支撐對外部資料的存取與使用
  • 「AI for data」只是上半場,「data for AI」才是重點:agent 需要存取的資料種類極多(設計文件、ticket、歷代軟體的往來討論、trajectory、操作紀錄、tool-use traces)。資料的品質、結構與治理,決定了 AI 實際能做到什麼。
  • 檢索能用是個迷思:「試著搜尋你自己的 email,然後告訴我它到底能不能用。」檢索只有在查詢與文件詞面夠接近時才有效,而這通常不會發生——所以需要跨知識來源的語意資料層
  • 絕對數字比排行榜誠實:Oracle 團隊在 Spider 2 與 Archer 上都名列前茅,但Archer 的絕對成績約 55%、Spider 2 只有 70 出頭——離「能可靠存取與使用資料」還很遠。
  • 網球範例把問題攤開:前沿模型能自己規劃、跨結構化/非結構化/網路資料取材、調和衝突資訊、輸出漂亮表格——但排序沒排好、漏掉 Carlos Alcaraz、兩名選手的獎金精確到美元完全相同;提醒它補上 Alcaraz 之後,Andrey Rublev 整個消失了,金額也悄悄變動。
  • 真正的結論不是「模型不行」,而是「失敗不可見」:網球錯了無所謂,但同樣的查詢換成公司財務分析呢?visibility of failure 沒解決,這類系統就沒辦法可靠、一致地使用。

重點整理

換檔:從模型談到資料(約 01:23–01:25)

他刻意換個主題:談資料——我們怎麼使用資料、怎麼存取資料。他真正興奮的是 GenAI 對資料的承諾:讓我們從那個混亂的世界——各種型態、各種表示法的資料,人得先學會領域知識、學會資料怎麼被表示、把資料從一種格式轉成另一種、還要搞懂怎麼融合異質資料——搬到一個乾淨得多的世界:用我們自己的概念、自己的術語、自己的指標,直接在概念層次上操作資料。

而讓這件事更令人興奮的是一個事實:世界上大量的資料會一直待在語言模型之外。語言模型已經吞掉了很多資料——這也是我們今天有強大 agent 的原因——但通用資料已經沒有了,大部分都已經被模型供應商吸收完畢。可是外面還有非常多資料:企業的資料、金融機構的資料、政府單位、個人、醫療中心的資料;這些資料會留在模型外面,而且是動態的。

所以問題變成:我們怎麼處理這些外部資料? 他認為 GenAI 的關鍵用例之一,就是協調並支撐外部資料的存取與使用。這對人類消費資料成立,對 agent 使用資料更重要——想想你的 coding agent:要開發 coding agent,它得存取大量資料,從設計文件、ticket,到關於前幾代軟體發生過什麼事的往來討論;它得存取知識來源並對其做點什麼。

為什麼「靠檢索做決策」比想像中難(約 01:25–01:28)

可靠地支撐那些依賴「取回資料再使用資料」的決策,是極度困難的——比我們以為的難得多。 原因很多:

  • 資訊檢索本身。「有一個迷思是資訊檢索已經能用了——但你試著搜尋自己的 email,然後告訴我它到底能不能用。」
  • 理解資訊需求、理解被儲存的資料、實際使用資料——在今天的世界裡全都極具挑戰性。

多數時候我們想的是 AI for data:AI 怎麼幫我們(人)使用資料。「別問 AI 能為你做什麼」——我們真正在乎的是 data for AI,因為要開發 agent,agent 得存取大量不同種類的資料。

所以 AI 與企業資料的關係不是一維的:AI 解鎖你既有資料的價值,但你資料的品質、結構與治理,反過來決定了 AI 實際能做到什麼。同時理解方程式的兩邊非常重要,這就是「能用的 AI」和「不能用的 AI」之間的差別

agent 底下那層資料層至關重要,也極難建造。 想想 agentic 能力需要什麼資料:各式各樣的文件類型,加上 trajectory data、operation data、tool-use traces——你的 agent 要真的做到你要它做的事,這些都得有。

難在哪:核心困難與底層要求(約 01:28–01:31)

核心困難:

  • 檢索:除非你表達資訊的方式和你在乎的文件詞面上夠接近,否則檢索不會work——而這通常不會發生。這就必須發展跨知識來源的語意資料層(semantic data layer):一方面把資料的表示拉近到資訊被表達的方式,另一方面讓你不必在意資料來自哪個來源
  • 結構化:NL to SQL、NL 到其他形式化表示。這個轉換非常困難,部分原因是它同時也依賴檢索
  • 多知識來源:要讓 agent 用資料,就得讓它存取多個知識來源,而每個來源都需要各自的專業知識
  • 富文件(rich documents):論文、圖表、影片、影像越存越多,而這些富資料內部的資訊,除非你做點什麼去暴露它,否則你的檢索根本看不到;還有一些前處理,你的 agent 可能做、也可能不做。
  • 規劃:怎麼存取資料、用什麼順序存取、怎麼用一個來源去過濾另一個來源——這是非常有挑戰性的問題(下一節的網球例子就是為此)。
  • 衝突資訊:想想你的檔案系統或 email,裡面有多少互相矛盾的資料?而我們希望存取資料的 agent 能好好處理這件事。
  • 推理:很多情況下超出通用模型的能力範圍

在這些核心困難之下,還有一層:治理、政策執行、可靠性、一致性、可稽核性——只要你想在企業、醫療中心這類場景使用大規模資料,這些非處理不可。加上最佳化:第一代我們不太在意成本,但現在得在意——什麼時候離線處理資料、什麼時候在 runtime 處理、怎麼快取運算、怎麼利用 query log 與歷史紀錄,全都是很難的問題。

NL2SQL:排行榜第一,但絕對分數才是重點(約 01:31)

他挑一個切面深入:NL2SQL。先來個「厚臉皮的置入」——Oracle 的一些團隊參加 Spider 2Archer 等競賽,表現非常好,在排行榜上名列前茅。

但比置入更重要的是絕對成績:Archer 大約 55%,Spider 2 只有 70 出頭——這意味著我們距離「能好好存取與使用資料」還非常遠

網球範例:漂亮的表格,和藏在裡面的四個錯(約 01:31–01:35)

他自己是網球迷,所以拿網球當例子。幾週前他丟給一個頂尖模型一個問題:「給我一份歐洲男子網球選手的清單,按網球收入排序。只算網球收入。」

這問題其實非常複雜:模型得知道誰是選手、他們來自哪個國家、那個國家算不算歐洲、2025 年他們打了哪些賽事、每一站賺了多少錢。模型確實把思路攤開給他看——去了哪些來源、查了哪些表格、讀了哪些文字段落——最後給出一張漂亮的表。

先別急著挑錯,想想這有多酷:這正是那個承諾——我只用自然語言表達資訊需求,模型就自己設計了計畫、存取多個結構化與非結構化來源與網路、用參數知識判斷國家歸屬、調和了外面大量互相矛盾的資訊、彙總並整理成一張表。 漂亮。

然後看細節:

  1. 兩筆排序錯了。這是最讓他意外的錯誤,因為模型應該去呼叫工具來正確排序才對。
  2. 有人不見了——模型把 Carlos Alcaraz 給忘了
  3. 另外有兩位選手的收入精確到美元完全相同。他們賺的是數百萬美元等級,卻精確到個位數美元一模一樣——不可能發生,顯然是錯的

為什麼會這樣? 因為模型必須跨知識來源最佳化存取路徑。它可以先產生選手清單、再判斷是不是歐洲國家、再查打了哪些賽事、每站賺多少;也可以從賽事清單下手,看每站誰打了、賺多少。賽事數量遠少於選手,所以也許後者才是對的做法——但另一方面,賽事的資料比較雜訊多。 所以做對這件事,真的取決於你對資料與領域的理解;在網球這個領域還算可能,在大多數領域就是不可能。所以雖然 agent 做這件事比我們快,它們容易出錯、成本又高

最關鍵的是接下來這一步:他提醒模型忘了 Carlos Alcaraz,模型把 Alcaraz 加了進去——但仔細看會發現其他東西也變了:排在第七的 Andrey Rublev 從新清單裡完全消失了;金額也有些微變動;某個原本超過六百萬的人,現在變成不到六百萬前後不一致。

而他真正想指出的是:這是網球,誰在乎呢?而且他自己知道正確答案,所以他有能力檢查對錯但如果同樣一個問題問的是你公司的財務分析,或任何其他敏感資訊呢? 這時候 visibility of failure(失敗的可見性) 就變得極其重要。不解決這件事,我們就沒辦法可靠、一致地使用這類系統。

收尾(約 01:35–01:36)

真實世界的資料是多模態、時序性、多語言、異質的,要把裡面的資訊解鎖出來還有非常多工作要做。而同時理解方程式的兩邊——AI for human consumption over data(用 AI 幫人使用資料)與 data for agent consumption(把資料備妥給 agent 使用)——正是「能用的 AI」和「令人失望的 AI」之間的差別。

金句

"There is a myth that information retrieval works, but you know, try to search your email and tell me whether it does work."(約 01:26)

一句話戳破 RAG 時代最常見的前提假設。

"Ask what AI can do for you — but really we care about data for AI."(約 01:26)

演講標題的雙關,也是他的立場:重點在後半句。

"While AI unlocks value from the data you already have, the quality, the structure, the governance of your data really determines what AI can actually do."(約 01:27)

企業導入 AI 的實際天花板不在模型,而在資料層。

"This is tennis — really, who cares. … But if this was the same question that you ask about your financial analysis of your company, the notion of visibility of failure is really important."(約 01:35)

整場演講的真正論點:問題不是模型會錯,而是你不知道它錯了。

"AI for human consumption over data, and data for agent consumption, is really the difference between AI that works and AI that disappoints."(約 01:36)

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Spider 2 真實企業級 text-to-SQL benchmark;演講中絕對成績「70 出頭」 Real-world enterprise text-to-SQL benchmark; absolute score cited as "low 70s" Oracle 團隊於 Spider 2.0-Lite 排行榜居首 / Oracle leads the Spider 2.0-Lite leaderboard
Archer 雙語 NL2SQL 評測挑戰;演講中絕對成績「約 55%」 Bilingual NL2SQL evaluation challenge; absolute score cited as "~55%" 與公開報導的英文執行準確率 54.96% 相符 / matches the publicly reported 54.96% English execution accuracy
語意資料層 / Semantic data layer 跨知識來源的表示層,讓查詢不必詞面對齊、也不必在意資料來源 Cross-source representation layer removing both lexical-match dependence and source awareness 他點名的核心必要建設 / the core piece he says must be built
網球獎金排名範例 / Tennis prize-money example 用一個頂尖模型的真實輸出展示規劃、衝突調和與四類錯誤 A real frontier-model output demonstrating planning, conflict reconciliation, and four classes of error 模型名稱未公開 / model not named

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
UPEN UPenn (University of Pennsylvania)
Genai GenAI
Alcarez / Carlos Alcarez Carlos Alcaraz
Andre Rublev Andrey Rublev
Archer H Archer(疑為 "Archer, uh" 的誤聽 / likely a mis-hearing of "Archer, uh")
NL2 to SQL NL2SQL
noted one-dimensional not one-dimensional
multimodel multimodal
department(panel 段) deployment

待確認 / To Verify

  • 網球查詢所使用的「top model」未具名。/ The "top model" used for the tennis query was not named.
  • 「17 different types of documentation」為口語約數還是指某個明確清單,無法從逐字稿判斷。/ Unclear whether "the 17 different types of documentation" refers to a specific enumeration or is rhetorical.
  • Spider 2「低 70 幾」對應的是哪個子集(Spider 2.0-Lite / Snow / full),演講未說明。/ Which Spider 2 subset the "low 70s" refers to (Lite / Snow / full) was not specified.
  • 字幕中的 "Archer H" 是否指 Archer 的某個 hard 子集,需看投影片確認。/ Whether "Archer H" denotes an Archer hard subset — check the slides.

GitHub 上的 Markdown 原始檔 ↗