座談 Session 1: Enterprise AI

座談:企業 AI

Aaron Jacobson (moderator); Rao Surapaneni; Adarsh Hiremath; Duncan Lennox; Anahita Tafvizi; Surojit Chatterjee — Aaron Jacobson — GP, NEA;Rao Surapaneni — VP/GM AI Search & Specialized AI, Google Cloud;Adarsh Hiremath — Co-CEO, Mercor;Duncan Lennox — Chief Product & Technology Officer, HubSpot;Anahita Tafvizi — Chief Data & AI Officer, Snowflake;Surojit Chatterjee — Founder/CEO, Ema

8 月 2 日(日) · Plenary Stage · 01:04:30–01:36:00 · 上午場直播

五位講者對「企業 agent 採用率目前低於 10%」大致同意,但一致認為卡點已經不是技術而是組織——衡量 ROI 要從 workflow 層級的縮短時間切入而非 token 用量,信任要靠可驗證性而非承諾建立,而模型層會被商品化,所以架構上真正該投資的是「能隨時換模型」的那一層。

座談成員

講者 單位 視角
Aaron Jacobson(主持) GP, NEA 創投,投資 AI 基礎設施 / 資安 / 開發工具
Rao Surapaneni Google Cloud 超大型雲端與治理
Adarsh Hiremath Mercor 評估與資料
Duncan Lennox HubSpot 自建與交付 SaaS 產品
Anahita Tafvizi Snowflake 資料平台 + 自家 customer zero
Surojit Chatterjee Ema AI 員工,服務 Fortune 2000

主題一:企業 AI 的現況——Gartner 說今天不到 10%、2030 年超過 80%,同意嗎?(約 01:06–01:11)

  • Duncan Lennox:「聽起來八九不離十。」過去一兩年很多企業做了大量試點與實驗、也許有一兩個 agent 上了 production,但在廣度與深度上都難以 scale。原因是要 scale 需要的遠不只一個好模型。他對 2030 年的 80% 抱持樂觀:「你能感覺到加速正在啟動。」
  • Rao Surapaneni:承認自己看到的是自我選擇過的樣本。他觀察到:已經把資料治理與資安姿態搞定的組織,移動速度明顯更快。其餘的卡點常常在「怎麼訓練員工使用」或「怎麼讓內部法遵團隊理解哪裡可以接受風險」。採用程度隨風險容忍度而異。
  • Anahita Tafvizi:給了一條時間軸——2025 是實驗年(這東西到底行不行?幻覺率多少?準確度如何?結果能不能信?);2026 是證明 ROI 的一年,而且是規模化的 ROI;今年剩下的時間會走向真正的業務轉型。她同意方向,但強調「70% 還是 90% 其實不重要」,而且 agent 數量根本不是對的指標——該問的是最終拿到的真實業務價值。
  • Adarsh Hiremath:「到目前為止企業 AI 採用是令人失望的,但這個趨勢會非常快改變,2026 已經看得到。」兩個原因:(1) 意願問題——過去十年自動化與業務轉型換過各種包裝(BPO、task mining、process mining),留下一座失敗試點的墳場,所以高階主管天然抱持懷疑;(2) 能力問題——模型直到最近才夠好。真正的轉折是從 chat 用例的模型,變成能當同事的模型:要管理多個利害關係人、多個資料源,交付有經濟價值的工作產出,而不是當個人助理。
  • Surojit Chatterjee:先拆定義——「有大量 token maxing,很多人拿 AI 當個人助理,那不該算是企業採用,因為那些專案不是失敗就是 ROI 很低。」如果看的是真正端到端的工作流自動化,10% 大概是對的,但成長速度遠超他的預期;Fortune 2000 現在有真實的胃口。他甚至認為 80% 可能早於 2030 就到。第二點也是他最強的論點:卡住的地方已經不是技術了——「大約 70% 的原因是組織性的:變革管理、資安、對未知的恐懼。」

主題二:成功長什麼樣子?ROI 怎麼量?(約 01:11–01:15)

  • Anahita Tafvizi:ROI 只有兩種——幫客戶多賺錢,或幫客戶少花錢。但要打到損益表底線極其困難,因為單一 workflow 的改善要傳導到 bottom line 需要時間。所以大家改用領先指標:早期是採用率與 token 消耗(她直白承認那不是好指標,呼應 Surojit 的 token maxing),現在越來越多人量的是 workflow 長度有沒有縮短。她給了三個 Snowflake 內部的實例:
  • 季度報表:兩週 → 48 小時
  • 財報準備:數週 → 幾小時
  • 客戶會議準備:數週 → 幾分鐘
  • Duncan Lennox:「新老闆跟舊老闆其實是同一個」——回到 outcome。在 go-to-market 旅程上把具體業務結果定義清楚:漏斗頂端多一個合格 lead、成交一筆案子、成功解決一張客服工單。清楚的 outcome 一方面決定該建什麼 agent,一方面天然變成一個指標;量不出來就談不上衡量成功。

(此段中 Anahita 的麥克風故障中斷,主持人先轉給 Duncan,修好後再轉回。)

主題三:為什麼失敗?Gartner 說 50% 的 GenAI 專案會失敗(約 01:15–01:18)

  • Adarsh Hiremath:兩個原因。(1) 對 AI 表現的信心不足——大多數企業沒有真正 agentic 的評估(task、trajectory、context、artifact、verifier 五件套),所以在進 production 之前根本不知道 agent 有沒有在做你要的事。(2) 不能把軟體丟過牆就走人——必須配套變革管理與文化轉型。這也是為什麼各實驗室開始自建 deployment 團隊、配 FTE 與顧問夥伴:當一家公司的文化不是 AI-forward、technology-forward,做業務轉型真的非常難。他預期端到端、全棧式的部署服務會推高採用與試點成功率。
  • Surojit Chatterjee(實例):一家全球專業服務公司,25 萬名員工、65 個國家,導入 Ema 的 AI 員工覆蓋整個 hire-to-retire 流程——招募、入職、ITSM、薪資問答與薪資處理等約 70 個用例,3–4 個月完成。成效:
  • HR ops 團隊從 約 1,000 人縮減到約 500 人
  • 員工問題解決時間從 5 天 → 平均 5 到 10 秒
  • 員工滿意度 +20%

但最有意思的是那個反直覺的數字:即使 AI agent 已經回答完、工單已經結案,仍有 30% 的員工會再去問一次人類。做完調查與焦點團體後發現原因是員工不信任 agent 真的做得到,想要人類再確認一次。他的結論:最大的變革管理成本,是教育員工採用新系統與新流程,而不是回頭用舊的。(該客戶為 Wipro,由其 CHRO 告知。)

主題四:AI 值得信任嗎?(約 01:18–01:20)

  • Rao Surapaneni:「值得信任,但同時要 trust but verify。」他的類比是寫程式之所以變得驚人,是因為你能用程式化的方式驗證,甚至再派一個 agent 去驗證;凡是「能生成也能驗證」的場景,採用就加速。他的業務例子:某客戶的目標是「業務團隊只做銷售,銷售前後的一切都要能自動化」——研究、會議準備摘要都交給 AI,甚至用 NotebookLM 生成 podcast 讓業務在開車去客戶端的路上聽;會後再自動更新 CRM。他補了一句常被忽略的:這也關乎人自己的旅程——先看到足夠的價值,才願意承擔一點風險去信任內容。
  • Duncan Lennox:兩面看。一面是模型再厲害也只是權重與程式碼,長年做 trust & safety 與資安的那套做法全部適用,包括「不同結果需要不同的信任等級」。另一面他點出一個被低估的難題:雲端或行動這類過去的技術轉型,你至少能把腦袋繞過來理解它是什麼;這一次難得多。所以當大家說「所有路都通往高品質 eval」——他 100% 同意——但 eval 不是 QA 與測試覆蓋率的新版本;怎麼寫好 eval、什麼叫高品質的 golden set,是一整套需要學的技能。如何幫人們跨過這個學習曲線,才是關鍵。

主題五:什麼在 work?用例與架構(約 01:20–01:26)

用例的共識落在「定義清楚的工作流」:

  • Surojit Chatterjee:客服、員工體驗與員工支援;財務營運(發票處理、AP);資料抽取——任何文件密集的用例。進到大型企業後,他們會回頭要求更多相鄰領域。
  • Anahita Tafvizi:同意客服(高度定義良好的工作流)與財務(月結、季結是必須照走的流程,高度可自動化);再加上 go-to-market——業務是營收的驅動者,效率提升直接推高 top line;行銷因為預算龐大。跨產業、跨垂直、跨職能都看得到。
  • Rao Surapaneni:一端是員工生產力——在對的時間找到對的資訊,而且不只是「呈現資訊」,是把動作完成(從「這項福利的政策是什麼」到「幫我完成報名」),用 Gemini Enterprise 大量自動化;另一端是 CIO 往深處走——把某個角色的每一項任務都自動化,現在他們開始直接量測業務成果:業務能不能談更多場、能不能更快成交。

架構的共識是:不要押單一模型。

  • Surojit Chatterjee:「模型層會被商品化,開源模型正在追上。」Ema 用 EmaFusion 融合 100 多個模型(前沿與開源都有),客戶直接受益;他認為某種形式的 model fusion 正在成為標準架構選擇

Anahita Tafvizi 另外補了「信任」的兩個支柱(這段是本場最實作導向的內容之一):

  1. 準確度。「如果我問 agent『我的 Q1 營收是多少』,正確答案只有一個——而這對一個本質上非確定性的技術來說,一點都不 trivial。」要用對的 guardrail、對的 eval、對的定義,確保每一次都拿到準確答案;否則企業不會讓員工用 agent 取代人力去問基本問題。她的對照組很銳利:dashboard 預設就有這個準確度。
  2. 治理。特別是 data agent:當你把財務資料、員工薪酬資料、績效資料的存取開放給整個組織,怎麼確保每個業務 AE 只看得到他該看的那部分營收?怎麼確保每個主管只看得到自己下屬的資料、看不到同儕的? 她說這兩點是企業 AI 採用的不可協商項

主題六:資料與 sovereign AI——該不該把資料交給模型廠商?(約 01:26–01:31)

主持人引用 Palantir 執行長近期的說法:AI 模型公司對多數企業構成威脅。

  • Adarsh Hiremath:先談一個更根本的點——每一家企業定義上都是特異的(idiosyncratic)。「同一個領域的兩家公司,比方 McKinsey 和 Bain,各自有讓自己特別的流程;如果兩者一模一樣,其中一家就不會存在了。」因此 AI 部署最難的部分,是把公司獨有的祕方——工作流、流程、組織脈絡——編碼進模型權重或 harness。他的例子:AI 當然能審履歷,但你不能直接派一個 agent 去審,除非它知道這家公司的人才哲學、這家公司的 hiring manager 怎麼篩履歷。

至於哪些資料可以分享:他們協助企業把所謂commodity workflow 交給實驗室——例如 IT 職能,若要讓 agent 熟練穿行整個 IT stack,Mercor 會匿名化、清洗身分,放進對實驗室訓練有用的 RL 環境。對一般公司來說這通常是零成本方案,因為變現後可以替他們創造七到八位數的收益。開放權重方面:私有模型與開源模型各有適合的用例,唯一能判斷哪個對的方法就是 eval。 - Rao Surapaneni(被點名代表模型廠商回應「該不該相信 Google」):先開了個玩笑「你當然可以完全相信 Google」,然後給了一個實質論點——企業資料未必要進到模型裡。你可以放在 prompt、放在 context;「最好的 context 是能把事情做完的最小 context」。所以在主權環境裡使用前沿模型,同時保有完整控制,是完全可行的;而且企業合約層面,他們看不到客戶的資料,「這對我們是不可侵犯的」。

他也對「開源就解決一切」潑了冷水:開源模型消除的是訓練成本,推論成本仍然存在,而且相較 CPU 與傳統工作負載,邊際成本高得多。所以企業要自問:我願不願意投入這筆 capex?願不願意投入人力與能力去長期經營?開源不解決所有問題,還要一併想商業面與組織專業能力。

主題七:開放 vs 封閉,五年後誰贏?(約 01:31–01:36)

  • Duncan Lennox:企業真正在意的是信任與可靠度。從工程系統(甚至業務系統)的角度看,那意味著關鍵路徑上不要有任何單點故障。所以答案必然是混用,並且要在工具上變得更成熟,以確保鏈路上沒有單點故障。
  • Anahita Tafvizi:Snowflake 兩者都做,未來也是兩者的組合。前沿模型目前更創新、領先一步,在推技術邊界;開源模型帶來更好的成本、更多競爭(進而帶動創新),以及更好的可稽核性與對底層的可見度。不同工作流需要不同的模型——「單純摘要一封 email,大概不需要最強的推理模型」;但某些任務就是需要。所以未來是同時提供兩者,並幫客戶動態路由;Snowflake 就是在做這件事,讓客戶能在 query 層級為特定用例挑選最適模型。
  • Surojit Chatterjee(收尾):「我同意 Anahita。問題不是 open source vs closed source,而是:你能不能換模型?」而且是——換模型時,你需不需要換掉整個 stack?它會不會散架?要不要全部重寫? 正確的建法是讓自己隨時能換模型,或在 agentic orchestrator 底下放一個 model blender / model selector,這樣就能吃到模型世界的所有創新,而不必等整個 agent 層重新訓練。「不管你怎麼實作,我認為那會是未來的核心架構。」

金句

"There's a lot of token maxing … I don't think that should be considered enterprise adoption, because a lot of those projects are failing or low ROI."(Surojit Chatterjee,約 01:10)

先把「採用」的定義釘死,再談數字——本場最有用的一次概念清理。

"It's not so much technical anymore … about 70% of the reason is organizational. It's change management, it's security, InfoSec, fear of the unknown."(Surojit Chatterjee,約 01:11)

整場座談最一致的判斷:瓶頸換位置了。

"If I ask an agent what was my Q1 revenue, there's only one correct answer — and this is not a trivial solution to a non-deterministic technology by nature."(Anahita Tafvizi,約 01:25)

一句話講清楚企業資料 agent 的核心難題;她的對照組是「dashboard 預設就有這個準確度」。

"30% of the requests, the employees actually ask a human again even though AI agents already answered or resolved the issue … apparently employees didn't trust agents can actually do it."(Surojit Chatterjee,約 01:18)

技術做到了、信任還沒到——變革管理的成本被具體量化成一個數字。

"The best context is the smallest context that gets the job done."(Rao Surapaneni,約 01:28)

對 sovereign AI 焦慮最實用的回應:資料不必進模型。

"Even for two companies in the same space — McKinsey and Bain — each of them have their own processes that make them special. If they were exactly one to one the same, then neither of them would exist."(Adarsh Hiremath,約 01:27)

為什麼企業 AI 不可能靠通用模型直接吃下:公司的特異性就是它存在的理由。

"It's not open source versus closed source. The question is: can you change your model?"(Surojit Chatterjee,約 01:35)

把 open vs closed 的辯論重新框成一個架構問題。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
EmaFusion Ema 的模型融合層,調度 100+ 個前沿與開源模型 Ema's model-fusion layer orchestrating 100+ frontier and open-source models Surojit 認為 model fusion 正成為標準架構 / he calls model fusion an emerging standard
Gemini Enterprise Google Cloud 企業 agent 平台,用於員工生產力與流程自動化 Google Cloud's enterprise agent platform for productivity and workflow automation 見 Rao 的演講筆記 / see Rao's talk notes
NotebookLM Google 產品;客戶用它把會議準備資料轉成 podcast 給業務在車上聽 Google product; a customer turns meeting-prep material into a podcast for reps to listen to en route Rao 的信任案例 / from Rao's trust example
APEX(Mercor) Mercor 前沿 benchmark,agentic eval 五件套的來源 Mercor's frontier benchmark; source of the five-part agentic eval structure 見 Adarsh 的演講筆記 / see Adarsh's talk notes
Snowflake 動態模型路由 讓客戶在 query 層級為特定用例挑選最適模型 Query-level dynamic routing so customers pick the right model per use case Anahita 描述的 Snowflake 產品方向 / Snowflake's direction as she describes it
Wipro Surojit 舉的導入實例:25 萬員工、65 國、~70 個 HR/IT 用例 The deployment case he cites: 250K employees, 65 countries, ~70 HR/IT use cases 由該公司 CHRO 提供數據 / figures from their CHRO
Gartner 預測 今日 <10% 企業部署 agentic AI,2030 年 >80%;50% GenAI 專案失敗 Gartner: <10% of businesses have agentic AI today, >80% by 2030; 50% of GenAI projects fail 主持人引用作為討論起點 / cited by the moderator as the framing

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Anahita Tavvisi / Anita Anahita Tafvizi
Serji Chatterjet / Serjet / Sergey / Serg / so rigid Surojit Chatterjee
Emma / Emma fusion Ema / EmaFusion
Ralph / Ra Rao Surapaneni
Dar / Adar / DAR Adarsh Hiremath
Merkor / Ror Mercor
Instaart Instacart
Palenter / palunteer co Palantir CEO
McKenzie / Bane McKinsey / Bain
holination hallucination
IOI ROI
BO BPO
infosc InfoSec
well-definfined well-defined
notebook LM NotebookLM
geni projects GenAI projects

待確認 / To Verify

  • Gartner「今日不到 10%、2030 年超過 80%」與「50% GenAI 專案失敗」兩則預測的原始報告出處。/ Source reports behind the two Gartner figures the moderator cites.
  • Palantir 執行長「AI 模型公司對多數企業構成威脅」的原話出處與時間。/ Original source and date for the Palantir CEO's claim about model companies threatening enterprises.
  • Surojit 提到 Ema 內部「40–50% 的工作使用開源模型」——主持人轉述,講者未直接確認數字。/ The "40–50% open source" figure was the moderator's paraphrase; the speaker did not confirm it directly.
  • Wipro 案例的公開案例研究連結(員工數、縮編幅度、滿意度提升等數字)。/ A public case study for the Wipro deployment figures.

GitHub 上的 Markdown 原始檔 ↗