座談 Session 4: Agentic AI in Finance & Legal

座談:金融與法務領域的 Agentic AI

Nikhil Chandhok、Faraz Shafiq(主持:Matt Carbonara) — Nikhil Chandhok — Chief Product & Technology Officer, Circle / Faraz Shafiq — Head of AI, Wells Fargo(主持:Matt Carbonara — Investor, Mayfield)

8 月 2 日(日) · Plenary Stage · 02:32:19–02:59:07 · 下午場直播

金融與法務不是「更難的 agent 應用」,而是驗證成本結構完全不同的應用——可驗證的任務(寫程式)早就自動化了,而信貸決策要五年後才知道對錯;這條驗證軸線決定了什麼會先被 agent 吃掉、什麼會最後才被吃掉。

TL;DR

  • Verifier's Law 是這場的核心框架(Shafiq):容易驗證的任務就是 agentic 流程的沃土。數獨很難解但很好驗證;寫程式有 QA 和測試可以馬上跑。反過來,難驗證的東西 lead time 就長——自駕很難完全驗證某個當下車子做得對不對;而信用卡或貸款核准的決定是今天做的,驗證可能是五年後那個人違約時才發生
  • 金融法務其實早就在用 agent(Chandhok):因為大家都在用 coding agent,而 coding agent 有很棒的性質——可驗證、可測試。你可以讀程式碼、可以跑測試套件。財務與法務可以做一樣的事,但失敗成本高太多:SOX 合規、準備財報(「我們下週就要財報」)不能出錯,對 agent 的檢視強度會非常驚人。「我們不想只因為 agent 犯了錯就被監管機關叫去問話——他們會究責我們,不是究責 agent。」
  • 房貸是 1,100 步的流程(Shafiq):所以不可能是一個 agent、也不可能全是自建。真正的難題不是協定(A2A 很好用,協定通常不是問題),而是該為哪個任務抓哪些資料、以及 ServiceNow agent 怎麼跟 Salesforce agent 跟自建 agent 交換正確的 context
  • Eval 的異質性比想像更細(Chandhok):早上有講者說「每個組織對 eval 都很 idiosyncratic」,他要修正成「組織內每個 team 都很 idiosyncratic」。他們的做法是把模型、harness、以及輸入以外的變數全部鎖死,再加上 shadowing——讓 agent 跟合規分析師同時處理同一筆 inbound,比對兩邊決策,跑成 RL 迴圈。
  • 問錯問題是企業最大的浪費(Shafiq):主管常說「我們有這個大流程,能不能用 AI 讓它更簡單更快更自動?」——這通常是錯的問法。對的問法是:用 AI 的「art of the possible」是什麼、能不能重新想像整個體驗,然後從現況倒推過去。他點名一個裂縫:開發者和 PM 個別都說自己效率提升 30%,但那常常沒有轉譯成工作流層級的提升
  • 「不會再有 individual contributor」(Shafiq):Wells Fargo 有 20 萬名員工、大多數是 IC,而 IC 會變成 agent 的管理者。IC 習慣端到端擁有工作、不習慣委派;現在你仍然擁有這份工作,但你在委派它。他們正在和 HR 合作推「每個人都會是管理者」這件事。
  • 護城河在「硬物理」(Chandhok):純軟體生意會很難防守(他認為這是廣泛共識)。Circle 的賭注是網路生意優於軟體生意——USDC 是穩定幣網路、上面有 Circle Payments Network、還在建 Arc 這條區塊鏈;加上「生意的硬物理」:Arc 有硬的運算問題,發行穩定幣要受 OCC 監理與檢查。軟體是加速器,不是護城河本身。

重點整理

主持人開場:Mayfield 的位置(約 02:32)

Matt Carbonara 先自我定位:Mayfield 是一支 57 年的創投,正在投第 19、20 號基金,總部在灣區;歷史上投過 700 家以上公司,其中 125 家上市、250 家被併購。他強調 Mayfield 是「people first」——公司是創業者建的,建公司是馬拉松不是短跑,起伏來時他們不會恐慌。投資階段從 seed / inception 到 Series B,範圍上下貫穿整個 stack:從半導體、光學、交換、模型,到基礎設施軟體、資安、雲、開發工具,一路到應用層。

他給這場的題目:我們剛剛談的這些 agent,要怎麼用在法務與金融這種高風險領域?

主題一:高風險領域的 agent 有什麼不一樣(約 02:32–02:36)

Chandhok 的第一個觀察是:所有他知道的金融與法務組織今天都已經在用 agent 了——因為他們在用 coding agent。而 coding agent 有一個很棒的性質:

可驗證性與可測試性。 你可以進去讀程式碼,判斷它是不是太囉唆、夠不夠囉唆、有沒有設計文件;你可以對它跑一整套測試。

金融與法務可以做一樣的事,但失敗成本高太多。他舉自家的例子:如果是 SOX 合規,或有個 agent 的工作是把財報準備好(「我知道這件事是因為我們下週就要財報」),這是不能出錯的,對那個 agent 的檢視強度會非常驚人。因此三件事的門檻同時被拉到極高:

  1. agent 決策過程的可稽核性
  2. agent 能碰到的資料來源
  3. 輸出的可驗證性

他的判斷是:這些會是最後才被自動化的流程之一——因為公司的存續取決於它把財務做對的能力,以及讓法律暴露面維持在恰當範圍的能力。這在其他職能同樣成立,比如合規:「我們不想只因為 agent 犯了錯就被監管機關叫去問話。他們會究責我們,不是究責 agent。」

Shafiq 補上一個他認為非常重要的框架——Verifier's Law:

容易驗證的任務,就是 agentic 流程的沃土。想想數獨——很難解,但非常容易驗證

所以寫程式很適合(有 QA、有測試,可以很快驗);而難驗證的東西會更難解、lead time 更長。自駕就是這樣:很難完全驗證那台車在那個當下做的是不是對的事。銀行更極端:

有人來申請信用卡或貸款,某些情況下我們手上資料不多。如果我們根據現有資訊做了錯誤的決定,而那個人違約——那可能是五年後的事。給信用的決定是今天做的,驗證在五年後。這變得非常難。

所以他們的篩選邏輯是:哪些任務真的成熟到 agent 可以超越人類「一直做對」的機率? 那些就是他們會優先動手的。

主題二:自建 vs 外購,以及 agent 之間怎麼連(約 02:36–02:38)

Carbonara 追問:這套判斷對自建 agent 和外購 agent 是一樣的嗎?

Shafiq 的答案是混合:模型與智慧本身大體上是一樣的,但 Wells Fargo 有別人沒有的 IP 與資料,所以在某些事情上自建 agent 有優勢。同時,現成 agent 開箱即用的能力已經強到不用它才不合理;真正的變數是經濟性——一旦成本下來,它們會變得無所不在。

他認為更大的問題是 agent 之間怎麼連接:

我舉的房貸流程,是銀行裡一個大約 1,100 步的巨大複雜流程。它不會是一個 agent,也不會是一堆自建 agent 而已,而是很多東西的組合。而且不能出現「這個 agent 做得很好但另一個不行」的情況,因為它們得互相對話與連接

尤其在長時間運行的系統上:「你下一個 prompt、拿到一個回應,那很容易,那你會做對。但當你要的東西橫跨數小時、數天、數週,context 就開始變得曖昧不明。」

主題三:給創業者的兩個缺口(約 02:38–02:39)

Carbonara 問:那些耗時長、難驗證的事,是不是創業機會?

Shafiq 直接點名兩個:

  1. Agentic harness——「這個概念聽起來太簡單了:一個把所有東西兜在一起、坐在 agent 上面的 harness。但它極難做好,尤其是長時間運行的流程。」這是他們正在積極尋找的東西。
  2. 跨 agent 的 context 交換——他強調這些是產業級的問題,不是 Wells Fargo 的問題。協定層面其實還好:「A2A 是個很棒的協定,很多組織也在標準 SDK 上面建,協定通常不是問題所在。」問題在於:

要為哪個任務抓哪些資料?一個 ServiceNow agent 要怎麼跟 Salesforce agent、跟自建 agent 協作,交換正確的 context 與正確的資訊? 這非常難做。這是一個很大很大的機會。

主題四:可靠度怎麼量、什麼時候可以上線(約 02:39–02:42)

Chandhok 說這件事一定因 use case 而異。他引用當天早上一場關於 eval 的演講——講者說各組織對 eval 都非常 idiosyncratic;他要把顆粒度再切細:

我會說在組織內部,每個 team 對 eval 都是 idiosyncratic 的。要量什麼、怎麼量、什麼叫「好」,得一個流程一個流程地定義。

Circle 現在正在建可規模化 eval 的框架。他也提醒 eval 會因為各種理由壞掉:model drift、資料問題、各式各樣的東西都會讓 agent 的表現改變。所以在已經導入的地方,他們的做法是把模型、harness、以及輸入以外的所有變數都鎖死

另外他們用一種他稱為 shadowing 的做法:

agent 跟人坐在一起——合規分析師接到一筆 inbound,他在做判斷、看資料;我們同時看 agent 會怎麼做,然後評估兩邊差異,把它跑成一個 reinforcement learning 迴圈。

至於 KPI,他坦承還很模糊。他們在試「token 花費對應到什麼程度的自動化」,但目前刻意不去省 token:讓人盡量用,看能換到多少生產力。而生產力通常以三種形式出現——每個人產出更多、少數地方直接是營收(規模還小)、或是明顯的成本節省 / 把原本做 X 的人力挪去做 Y。「以上皆是。但沒有什麼 rule of thumb 可以說 KPI 或 eval 就該這樣做。」

主題五:工程資源該怎麼分配,以及企業最常問錯的問題(約 02:42–02:46)

Carbonara 問:模型、harness、工作流整合、context、memory——這些工程投入要怎麼權衡?

Shafiq 說這正是他花最多時間的地方。他先對比傳統產品開發生命週期:有個想法 → 在 Word 或 PowerPoint 上來回迭代 → 找工程做 Figma 或原型 → 進入開發流程,套架構樣式、做弱點與風險評估。「非常古老、非常仰賴人、非常線性。」

在 agentic 世界他看到兩條路:

  • 技術選擇:memory、基礎設施、要部署在自家雲還是公有雲……
  • 商業選擇——而這才是關鍵。

他在這裡給了另一個創業訊號:做 frontier intelligence 的公司真的就那幾家,但會有一大批公司在做「讓它在企業裡真的能運轉的那台引擎」,因為企業需要的是安全、治理、合規。

然後是他最強的一句批評:

主管通常會說:「我們有這個很大的流程,你能不能用 AI 讓它更簡單、更快、更好、更自動化?」——這通常是錯的做法。 對的做法是問:用 AI 的 art of the possible 是什麼?我們能不能重新想像整個體驗?然後再想辦法從現在的流程走到那裡。

他把這稱為企業裡的裂縫,並補上一個他和 Chandhok 在後台聊到的觀察:你去問開發者或 PM,每個人都說自己效率提升了大約 30%——寫程式比以前快多了。但在某些情況下,那並沒有轉譯成工作流層級的提升

缺口在流程工程:理解領域、理解特定資料、理解 use case,然後倒推回什麼才是對的架構。因為架構本身正在變成這裡面比較容易的那個因子

主題六:組織設計——人與 agent 的比例(約 02:46–02:50)

Chandhok 說 Circle 正在推讓員工自行發布 agent 的能力,同時建一個 agent gateway:你知道公司裡有哪些 agent、可以在 Slack 裡找到它們並跟它們對話。

但他不認為這是組織設計問題:

我不覺得未來會有「專案上的負責人不是人類」這件事。人可以去調用公司裡眾多 agent 中的任何一個、去查 agent gateway——「公司裡有哪些 agent?有什麼財務 agent?有什麼行銷 agent?」——然後把它們組合成某種解法。我不把它想成 org design 問題,就像我不會告訴我的下屬他們能開幾個 Google Doc。 他們是在為我們創造成果。

他的焦點因此是三件基礎設施:能自行發布、能取得資料以便自行發布、有正確的 ACL 讓你能自行發布,再加上把 agent 之間的溝通搞定。

至於組織會不會變:他認為組織會更有生產力(這是大家共同的體感),也可能重組,因為職能 A 與職能 B 之間的界線正在變模糊。真正被問的問題是團隊怎麼組:PM 要不要多做一點 product marketing?product marketing 要不要多做品牌?BD 要不要多做產品?「連業務電話上該有誰都是問題——也許是我們的 agent 上線去做筆記。這類效率正在被摸索。但如果講的是老派麥肯錫那種 org design,我們沒在想這件事。」

Shafiq 從另一個角度回答「大規模導入 agent 最大的挑戰」。撇開技術挑戰,他丟出一個很有意思的推論:

不會再有 individual contributor 了。 我們銀行有 20 萬名員工,絕大多數是 IC。這代表什麼?代表 IC 現在會變成 agent 的管理者

而問題在於:IC 通常不習慣委派——他們習慣端到端擁有一件事、完全負責。但現在你拿到一份工作,你用 ChatGPT 或 Claude 或任何模型去做,你仍然擁有這份工作,但你在委派它,而這會成為未來主流的工作方式。

所以他們現在正在做的一件事,是強調每個人都會是管理者:

就像你給人回饋一樣,你需要有機制去給你的 agent 回饋、去讓你的 agent 成長、從它身上得到更多。這件事非常新,因為playbook 根本還不存在——你不習慣一個沒有 IC、全是管理者的世界。

他說他們正在和 HR 團隊合作,想清楚要怎麼推這件事。

主題七:智慧被民主化之後,護城河在哪(約 02:50–02:56)

Carbonara 提到近幾週的討論:智慧正在民主化,連開源模型都越來越逼近 frontier——那使用這些技術的組織,長期的護城河在哪?

Chandhok 先自嘲:「我們比 Wells Fargo 小太多了」(他估計 Wells 的工程組織至少大他們兩個數量級)。然後給了兩層答案:

第一層是速度,他用噴射背包比喻:

你本來就在跟某個人賽跑,而現在你突然可以穿上噴射背包。如果你能駕馭它,你就能取得領先。他們會追上來——他們也會穿上他們的噴射背包。所以第一件事是確保我和我的組織比別人更早把噴射背包穿上

第二層是生意的形狀。他同意很多東西會被商品化,而且「純軟體的生意會很難防守,我認為這是廣泛共識」。但 Circle 手上有一些硬東西:

我們是一家由網路組成的公司。USDC 是核心產品,我們把它當成一個穩定幣網路;上面有支付網路,叫 Circle Payments Network;我們還在建一條新的區塊鏈叫 Arc——它也是網路,因為你需要 validator、需要參與者對齊誘因。

他的主張是:網路生意優於軟體生意,而軟體是這些網路生意的賦能者——問題變成「怎麼用軟體去建構軟體賦能的網路」。此外還有他稱為「生意的硬物理」的部分:Arc 那邊是硬的運算問題;發行穩定幣本身也很複雜——你受 OCC 特許、要接受檢查。他們的策略就是把這些硬物理做到極好,並持續進入同樣是硬物理的鄰接領域,再把軟體當作上面的加速器。

Shafiq 接著把「非技術瓶頸」講得更白:

銀行業會有很驚人的改變,而其中很多根本不是技術挑戰。24/7 交易——為什麼交易在美東時間下午四點就結束?答案大部分不是技術性的。技術上要啟用完全不是大問題,是監管機關要確保資金流動受到規範、要保護消費者。

跨境即時到帳同樣如此:「技術上我可以讓錢立刻到位,但如果另一家銀行要兩天才結帳,這兩天的差額誰付?錢沒到的時候怎麼辦?」所以是監管要追上來,而新的 use case 會隨著更好的監管一起出現。

他也呼應 Chandhok 那句話,但做了一個他覺得有必要的澄清:

軟體那一面會讓我們把生意的「硬體」那一面做得非常好。而我說 hardware 時,我指的不是 GPU——我知道這是一場 agentic AI 研討會,但我們還有 4,000 家分行。我們仍然相信人與人連結的價值:有人只講西班牙語,他走進來跟一位理專用西班牙語談,一起把他的財務教育計畫做出來。

他認為這些不會消失,改變的是它們被交付與被消費的方式。最後他給了一個模型層的預測:今天由 LLM 主導、大家談的是 token 成本;最終會是 small language model 與 fine-tuned model,因為那會變得像按一個按鈕一樣簡單——重點會從 LLM 移到垂直專用的 AI,而新的 use case 會從那裡長出來。

收尾:五年後會被自動化、但今天你想不到的工作流(約 02:56–02:59)

Shafiq 的答案是 underwriting(核保 / 核貸):

核保是任何銀行的核心,不管是收入驗證還是房貸驗證,而且是個非常古老的流程。人們會送來各式各樣的文件——你可能拍了一張角度不對、又剛好有光打進來的水電帳單,於是就得有人把它退回去。這是一個非常複雜的多模態問題。

他認為這在接下來幾年會變成基本盤;目前卡住的是算力挑戰與經濟性還不到位。他也重申模型層的走向(LLM → small language model / fine-tuned model),並補了一句「再加上量子,等那個算力可用的時候」。

Chandhok 的答案則轉了個彎:

我是 AGI-pilled 的,所以我相信我們會從自己的臥室窗戶看到 AGI。到那個時候,我憑什麼說什麼是解不了的?

但他接著給了本場最好的收尾:

那可能是一個裝滿天才的資料中心,但人類是拜占庭式的(Byzantine)。人類非常獨特、非常難協調。所以對那些裝滿天才的資料中心來說,這段日子可能會很寂寞,因為我們其他人還在想辦法互相協調。我們有非常好的模型,但我很驚訝要說服人們去做一件事需要花多少力氣,即使那件事客觀上對他們有好處。有沒有人試過叫爸媽吃藥?或叫小孩吃藥?那客觀上對他們好,他們就是不吃。

人類社會還沒準備好直接聽這些裝滿天才的資料中心的。這是我的結論。我希望那些資料中心存在,我也很高興它們在這裡——但在此刻與我們想像的那個未來之間,我們還有一大堆問題要解

金句

"Tasks that are easy to verify are going to be ripe for agentic processes. ... Same thing in banking: the decision to give them credit was today; the verification is five years down the road."(約 02:35,Faraz Shafiq)

Verifier's Law 決定了自動化的順序。

"We don't want to get hauled in by regulators just because our agent made a mistake. They're going to hold us responsible, not the agent."(約 02:34,Nikhil Chandhok)

責任不會因為執行者是 agent 而轉移。

"I would say within organizations, each team is idiosyncratic about evals."(約 02:40,Nikhil Chandhok)

Eval 的異質性比「每個組織不一樣」還要細一層。

"Can you use AI and make it simpler, faster, better, more automated? And that is typically the wrong approach."(約 02:44,Faraz Shafiq)

正確的問法是「art of the possible 是什麼」,然後倒推。

"There are not going to be any individual contributors. ... The ICs now will be managers of agents."(約 02:49,Faraz Shafiq)

20 萬人的銀行對組織的判斷。

"It may be a data center full of geniuses, but humans are Byzantine. ... It may be very lonely for those data centers full of geniuses while the rest of us try to coordinate."(約 02:58,Nikhil Chandhok)

模型能力不是瓶頸,人類協調才是。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Verifier's Law 「容易驗證的任務適合 agentic 流程」的原則,Shafiq 用它排自動化順序 The principle that easily verified tasks are ripe for agentic processes; Shafiq uses it to order automation 講者未指名出處 / no source cited by the speaker
A2A (Agent2Agent) 講者稱為「很棒的協定」;他認為協定不是瓶頸 Called "a great one" by Shafiq; protocols aren't the bottleneck in his view
Circle Payments Network 建在 USDC 穩定幣網路之上的支付網路 Payments network layered on the USDC stablecoin network
Arc Circle 正在建的區塊鏈,需 validator 與參與者對齊誘因 The blockchain Circle is building; requires validators and aligned participants Chandhok 稱其含「硬運算」問題
Agent gateway (Circle) 讓員工自行發布 agent、在 Slack 中查找與呼叫 Lets employees self-publish agents and find/invoke them in Slack 導入中 / being rolled out
Shadowing agent 與人同時處理同一筆案件,比對後跑 RL 迴圈 Agent and human work the same case; the comparison feeds an RL loop Circle 的 eval 做法
房貸流程(~1,100 步) Shafiq 全場的主要例子 Shafiq's running example of a ~1,100-step process faraz-shafiq--reimagining-banking-in-the-ai-era.md
OCC 美國貨幣監理署;發行穩定幣須受其特許與檢查 Office of the Comptroller of the Currency; stablecoin issuance requires its charter and exams

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Nquille / Nikil / Nichol / Nikl Nikhil (Chandhok)
far / Faras Faraz (Shafiq)
verifiers law Verifier's Law
sedukco / sudukco Sudoku
socks compliance SOX compliance
Mckenzie McKinsey
the OC the OCC
Service Now ServiceNow
generic agents(主持人提問) agentic agents
AGI build AGI-pilled

待確認 / To Verify

  • Verifier's Law 講者未指明出處;若要引用需回查該詞的原始提出者與定義。/ Shafiq cited "Verifier's Law" without attribution; trace the original formulation before citing.
  • Chandhok 引用「早上一場關於 eval 的演講」,未指名講者或場次。/ Chandhok referenced a morning talk on evals without naming the speaker or session.
  • 「房貸約 1,100 步」「Wells Fargo 20 萬名員工」「4,000 家分行」「Mayfield 700+ 投資 / 125 IPO / 250 併購」皆為口述數字,未附出處。/ The ~1,100 steps, 200,000 employees, 4,000 branches, and Mayfield's 700+/125/250 figures are all as spoken, with no sources given.
  • 「開發者與 PM 個別聲稱效率提升約 30%」為 Shafiq 的觀察,非引用研究。/ The "~30% more efficient" figure is Shafiq's observation, not a cited study.
  • Chandhok 說 Wells Fargo 的工程組織「至少大兩個數量級」是現場口語估計。/ Chandhok's "two orders of magnitude" comparison was an offhand estimate.

GitHub 上的 Markdown 原始檔 ↗