演講 Session 4: Secure Agentic AI

保護 AI Agent:從風險評估、執行期防護到自我改進與認證

Bo Li — Co-Founder and CEO, Virtue AI; UIUC

8 月 1 日(六) · Nexus Stage · 02:47:22–03:00:48 · 下午場直播

AI 安全是所有 AI 應用的「最後一哩」,而這一哩可以拆成三個桶子——先用 red teaming 做壓力測試找出弱點,再從「修模型本體」與「掛上可即插即用的 AI firewall」兩路防護,最後讓 guardrail 帶上可證明的保證。

TL;DR

  • 三桶子框架:(1) risk assessment / red teaming——AI 版的 pentest,先壓力測試出弱點;(2) fundamental protection——把安全原則訓進模型與 workflow,而不是丟一段 system prompt 然後祈禱它會照做;(3) guardrails——可即插即用的「AI 版防火牆」,從 prompt 層一路涵蓋到 MCP 層、tool call 與 tool trajectory。
  • DTap(DecodingTrust-Agent Platform):超過 50 個一對一打造的模擬環境、涵蓋 14 個領域,並附一個會自己找攻擊策略的 red-teaming agent。唯一沒開源的就是那個 red-teaming agent——避免被測 agent 對攻擊策略過擬合。判定用 verifiable judge(直接檢查狀態:交易真的發生了嗎?檔案真的被刪了嗎?),不依賴不確定的 LLM judge。
  • 風險分類的兩條原則:法規遵循面(OWASP Top 10、NIST、MITRE、FINRA、EU AI Act)與 use case 面(hallucination、data exfiltration、misuse⋯);再加上依 agent 類型分(computer use、tool use)——因為通用的安全合規 agentic system 幾乎不可能存在,只能分領域做深。

重點整理

開場:身分、最後一哩,與真實世界的代價(約 02:47–02:50)

Bo Li 自我介紹為 UIUC 教授,研究 AI safety 與 security,同時是 Virtue AI 的共同創辦人兼 CEO——該公司為金融、醫療、零售等企業提供統一的 AI 安全與合規平台。他也提到當時的新聞:Virtue AI 剛加入 Meta Superintelligence Labs,延續為大規模個人化 agent 提供 trust layer、治理與可觀測性的使命。

他的核心立場是:AI safety 與 security 一直是所有 AI 應用——尤其是 agent 與 multi-agent 系統——最重要的「最後一哩」。如果無法有足夠信心解決這些問題,就很難有信心把 agentic 系統部署到真實世界。

他列的高層次攻擊面包含 prompt injection、jailbreak、資料外洩、hallucination,以及企業特別在意的品牌風險。右半邊是真實案例:

  • OpenAI Atlas 這類瀏覽器 agent 可以被攻擊、被誤導去購買非預期的商品。
  • 幾個月前一個客服型 agent,幸好是白帽先發現——該 agent 可被誘導洩漏整個客戶資料庫,潛在損失達數千億美元量級。
  • 交易市場與金融場景也有大量類似案例。

好消息是法規、政策,以及學界、業界與合規社群正在匯流;但他直言,離終點還很遠

三個桶子:red teaming、fundamental protection、guardrails(約 02:50–02:54)

他把這個很大的題目壓縮成三個桶子:

1. Risk assessment(red teaming)——他直接類比:red teaming 之於 AI,就是 pentest 之於軟體。不論 AI 應用由哪種模型或 agent 驅動、落在金融或醫療或自動駕駛哪個領域,理解一個系統的第一步就是壓力測試:開發不同的 skill set、自主環境、red teaming 策略與演算法,壓出弱點,才談得上後續的解法或治理。

2. Fundamental protection——假設 red teaming 已經給出完整的弱點清單,接下來是怎麼保護。第一條路是從根本修模型:讓模型不只是現在這種機率性、資料驅動的模型,而是具備真正的推理,以及一個能注入並確保 AI 安全原則的基礎元件。這樣像 EU AI Act、金融的 FINRA 這類政策,才能被確保會被遵守——而不是「丟進 system prompt,然後不知道 agent 會不會、什麼時候會照做,不確定性非常高」。他承認這條路從修模型到修 agentic workflow 都極具挑戰,但已有大量活躍研究。

3. Guardrails——如果想立刻用、立刻部署,能不能有一個可即插即用、傳統資安意義上的防火牆——只是給 AI 系統用的?這一層要從多個角度提供防護:prompt 層 → MCP 層(檢查 MCP 程式碼的漏洞)→ tool call 與 tool trajectory,如此才能理解意圖、理解漏洞,並在輸出端閉環,做到端到端。

這三者合起來,就是他認為當前保護、治理與確保 agentic 系統安全的整體架構。

Red teaming 的兩個難題與 DTap(約 02:54–02:59)

他把最多時間給了第一桶子,並先問兩個高層次問題:風險評估的規則與視角是什麼(因為這個空間非常大)?以及如何為 agentic 系統提供一個全面的 red teaming 平台與策略?

先看攻擊面。一個 agentic 系統 = 核心 LLM + 工具 + 環境,而環境正是高度脆弱的那一塊:

  • agent 與網站互動時,網站可以埋 injection——可見的(如評論內容)與不可見的(如隱藏表單)都行,他們有多篇論文證明只要與環境互動就相當危險;
  • 換成資料庫環境就是 SQL injection;所有傳統漏洞都會在前沿 agentic 模型上重演一次;
  • 更別提 agent 的供應鏈,以及核心模型本身的漏洞。

風險分類的兩條原則:

  1. 法規遵循原則——列出 OWASP Top 10、NIST、MITRE、FINRA(金融專用)、EU AI Act 等框架,依此提供全面的風險評估。
  2. Use case 驅動——他們有一篇 NeurIPS best paper 從使用情境角度拆解 hallucination、data exfiltration、misuse 等,勾勒出這個漏洞空間的地景。
  3. 再加上依 agent 類型分:通用的安全合規 agentic 系統極難做到,所以退一步分 sector(如 computer use、tool use),在各自領域裡做更全面、更深入的分析與防護。

接著是主角:DecodingTrust-Agent Platform(DTap)。他強調 除了 red-teaming agent 之外全部開源,論文也已上線;不開源攻擊 agent 的理由是避免被測 agent 對這些攻擊策略過擬合。DTap 的獨特之處有三:

  1. 環境。要為 agent 做 red teaming 就需要 sandbox,而這個 sandbox 與現行 agent sandbox 不同——現行 sandbox 裡通常只有檔案系統,但真實 agent 要連外部 MCP 工具,而一連上外部 MCP 工具,所有漏洞就都可能發生。DTap 內含超過 50 個一對一打造的環境,可在其中做可控的 tool injection、environment injection 等測試。
  2. Red-teaming agent。提供全面的攻擊策略——tool injection、skill injection、prompt injection 及其組合——並搭配 verifiable judge:直接查驗狀態,確認 agent 是否真的做出了交易、是否真的刪了檔案,因此不需要依賴不確定的 LLM judge
  3. 14 個領域。他反問:我們憑什麼說 50 個環境夠、100 個夠、5000 個夠?所以要從領域切入——涵蓋 14 個領域,每個領域都去看該領域自身的政策(金融、醫療等),讓風險評估依循領域政策設計。

有了這個框架,就能評估不同 agentic framework × 模型組合的 helpfulness 與 safety。他特別點出:這是兩個獨立的成分,不同組合的安全地景可能完全不同,所以平台的價值在於能透過 ablation study 理解各成分的貢獻。

防護與認證:ShieldAgent(約 02:59–03:00)

時間所剩無幾,他快速帶過防護端的代表作 ShieldAgent:流程是依不同的法規原則與政策抽取出規則,轉成 action graph;這麼做的好處不只是「有個看起來不錯的模型」,而是多了一個能提供 certification 的元件——意思是在 runtime 就能提供帶有一定保證等級(guarantees)的 guardrail 防護,因為背後有 action graph 分析與認證。數字上也明顯更好。

收尾他把視角拉遠:希望長期而言,從 agentic 系統的「群體」角度,能看到類似網際網路那樣的演進趨勢——如果社群一起把安全這最後一步解決,就能看到可信 agentic 系統的廣泛採用

註:講題中的 self-improvement 部分因時間不足未展開,現場內容集中在 risk assessment、guardrails 與 certification 三塊。

金句

"Red teaming is a pentest for AI models, for agents, for multi-agent."(約 02:51)

一句話定位 red teaming 在安全流程中的位置。

"…rather than just say give it as a system prompt — and we don't know when and whether the agent will follow that, which is quite of high uncertainty."(約 02:52)

為什麼「把政策寫進 prompt」不算合規機制。

"The moment you connect to the external MCP tools, all the vulnerabilities could happen."(約 02:57)

現行 agent sandbox 只有檔案系統,這正是它作為 red teaming 環境不夠用的原因。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Virtue AI 講者共同創辦的公司,為企業提供統一 AI 安全與合規平台;演講時剛加入 Meta Superintelligence Labs His company; unified AI security and compliance platform for enterprises; had just joined Meta Superintelligence Labs https://www.virtueai.com/
DTap(DecodingTrust-Agent Platform) 可控且可互動的 agent red teaming 平台:14 領域、50+ 環境、附 red-teaming agent 與 verifiable judge Controllable, interactive red-teaming platform for AI agents: 14 domains, 50+ environments, red-teaming agent, verifiable judge 論文 arXiv:2605.04808;程式碼 https://github.com/AI-secure/DecodingTrust-Agent;red-teaming agent 未開源 / the red-teaming agent itself is not released
ShieldAgent 從法規政策抽取規則、轉為 action graph,提供帶認證保證的 runtime guardrail Extracts rules from regulatory policy into an action graph, giving runtime guardrails with certification-backed guarantees 論文 arXiv:2503.22738,ICML 2025
法規框架 / Regulatory frameworks OWASP Top 10、NIST、MITRE、FINRA、EU AI Act——風險評估的合規面依據 OWASP Top 10, NIST, MITRE, FINRA, EU AI Act — the compliance axis of risk categorization
OpenAI Atlas 被舉為真實案例:瀏覽器 agent 可被誤導購買非預期商品 Cited as a real-world case: a browser agent misled into unintended purchases 字幕聽為 "open Atlas"

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Professor Boly / Bowie / Bully / Bo Bo Li
Virtual AI Virtue AI
University of Illinois Urbana Champagne University of Illinois Urbana-Champaign (UIUC)
ASFT security / AS50 security AI safety & security
decoding trust agent / DTAP DecodingTrust-Agent Platform (DTap)
shield agent ShieldAgent
guario / guaral guardrail
CQ injections SQL injections
fenor FINRA
OAPS top 10 OWASP Top 10
nest / MITER NIST / MITRE
nibb best paper NeurIPS best paper
two injection / two calls / two trajectories tool injection / tool calls / tool trajectories
MCB2s MCP tools
open Atlas OpenAI Atlas
promising model probabilistic model(依上下文 / from context)

待確認 / To Verify

  • 「we have a NeurIPS best paper talking about from the use case perspective」——確切是哪一篇(DecodingTrust 或其後續),需查證。/ Which NeurIPS best paper he referred to (DecodingTrust or a successor).
  • 幾個月前那個「service-style agent 洩漏整個客戶資料庫、潛在損失數千億美元」的案例未指名公司或事件。/ The customer-service agent breach (white-hat discovered, hundreds-of-billions potential loss) was not named.
  • ShieldAgent 的 certification 「保證等級」具體是什麼形式的保證(機率性 vs 形式化),演講因時間不足未展開。/ What form the ShieldAgent certification guarantee takes (probabilistic vs. formal) — skipped for time.
  • 講題中的 self-improvement 部分現場未涵蓋。/ The self-improvement portion of the title was not delivered.

GitHub 上的 Markdown 原始檔 ↗