演講 Session 4: Secure Agentic AI

Agentic AI 的安全與資安

John A McDermid — Director, Centre for Assuring Autonomy, Institute for Safe Autonomy, University of York

8 月 1 日(六) · Nexus Stage · 03:25:50–03:37:55 · 下午場直播

在 cyber-physical 系統裡,safety 與 security 傳統上被分開評估,但 agentic AI 讓攻擊面同時擴張到訓練管線與物理環境;用 structural causal world model 把兩者接起來後會發現——單獨都安全的兩個攻擊,只要改變發生順序就能組合成致命結果。

TL;DR

  • Safety ≠ Security,但不能再分開做:講者做了 40 年軟體密集系統的 safety(定義是「對人、環境的物理傷害」),他的訊息很直接——資安圈與安全圈必須坐下來談,否則會部署出在物理世界造成災難的系統。
  • AI 把攻擊面往兩個方向撐開:一邊是訓練管線、prompt、context 等傳統 IT 面向;另一邊是物理環境本身——貼紙貼在停止標誌上就能讓感知模型讀成「速限 45 mph」(實驗室 93%、真實世界 83%)。
  • SCWM(structural causal world model):四層結構——ontology(世界中重要的事物,如浪高)→ 不確定性建模 → 不確定性邊界 → 底層可用形式化方法驗證演算法行為。攻擊被建模成對因果圖的 intervention,再沿圖傳播到 safety metric。
  • 複合攻擊案例(無人水面載具):對遠端操控中心做 DoS(數位)+ 用 UAV 在攝影機前擋一張圖(物理)。兩者單獨發生都安全,合起來就是一艘自主航行、卻看不見前方油輪的船。
  • 最反直覺的發現:safety 與 security 都不太處理事件的時間順序,但時序本身就能繞過防禦——你可能把單一 agent 做安全了,改變事件順序卻能瓦解整個 agentic ecosystem 的安全性。

重點整理

背景:York 的 Centre for Assuring Autonomy(約 03:26–03:27)

講者做軟體密集系統的 safety 大約 40 年,這裡的 safety 指的是對人與環境的物理傷害;過去九到十年主持自主系統保證(assurance of autonomous systems)的研究計畫,近年逐步涵蓋 AI 乃至 agentic AI——儘管 agentic AI 目前在安全關鍵系統中部署還不多。

中心規模已接近 100 人(faculty、研究員與博士生),領域橫跨海事、自動駕駛與 AI 在醫療照護的應用。這場演講以海事為例,因為它最能呈現問題的本質。(插曲:投影片的逐步動畫沒有正常運作,他大半場是「繞著投影片講」。)

為什麼要把 safety 與 security 一起做(約 03:28–03:29)

傳統上 safety 與 security 是各自獨立評估的。但在 cyber-physical 系統裡,網路攻擊會級聯穿過技術系統、穿過感知系統,最後造成不安全的結果——safety 圈稱之為 hazard(威脅到人員或設備物理安全的狀態)。

導入 AI 之後,safety 與 security 的問題同時被改寫:攻擊面大幅擴張,除了作業系統之外還多了訓練管線;而如果系統有物理實體,物理環境本身也是威脅面的一部分

他借用了別人的一個經典例子(明確聲明不是他們的研究):有人訓練一個 AI 演算法去找感知系統的弱點,然後印出貼紙貼在停止標誌上,讓感知邏輯判定那是「速限 45 mph」的標誌——實驗室準確率 93%,真實世界 83%。

SCWM:把 security 綁進因果世界模型(約 03:29–03:30、03:33–03:35)

Safety 的基礎是因果模型。他的團隊因此建構世界模型來表示這些因果結構,稱為 structural causal world models(SCWM)。他特別區分:AI 圈很關注「自動學出世界模型」,而 SCWM 是我們自己明確描述的,並且把 security 綁進這個結構裡。

SCWM 有四層:

  1. Ontology:描述在這個工作場景中重要的世界事物。例如「浪高」——因為波浪施加在船體上的力會改變其操縱性。
  2. 不確定性建模:同一件事在特定情境下無法精確計算,例如你算不出浪與船體交互作用的確切波形,因此海況如何影響船的運動存在不確定性。
  3. 不確定性邊界:上述不確定性被映射成一組 bound。
  4. 底層驗證:喜歡形式化方法的人可以在這層驗證演算法行為——「我可以設定不確定性的邊界,並在這些已知邊界內安全運作」。

安全事件如何進入這個模型:把攻擊視為對因果依賴圖的 intervention。實際上你會建出所有相關因素的因果依賴圖(他在投影片上只 highlight 四個節點),security 事件擾動這些關係,再沿著圖傳播到最終的 safety metric 偏差。

本例關心的 metric 是 closest point of approach(最近會遇距離)time to closest approach(抵達最近會遇點的時間)。距離越小越危險;時間則取決於船有多大、多靈活——船越笨重,你就得越早預測到最近會遇點,才有足夠時間操舵。

案例:無人水面載具的複合攻擊(約 03:30–03:33)

情境(他強調是與真實系統高度相似的代表性模擬,不是真實系統本身):一艘 unmanned surface vessel,依 IMO(International Maritime Organization)定義屬於 degree three 自主等級——大致上遠端操控,但必要時可在無遠端介入下自主運作。

他們建了模擬:感知用 YOLO 物件偵測器,加上一個他們稱為 dropout protection module(DPM) 的模組——當船失去與遠端操控中心的通訊(例如遭到 jamming)時,就回退到完全自主功能。另外還有 AIS(向其他船舶廣播自身位置的系統),它是可以被 spoof 的。

複合攻擊由兩部分組成:

  1. 數位攻擊:對遠端操控中心發動 DoS,使其無法再控制該船。直接效果是船上的 DPM 接手,自主續行原本協議好的航路。
  2. 物理攻擊:放飛一架 UAV,在船載攝影機前擺一張影像,使系統要嘛完全偵測不到來船,要嘛把它誤判成需要不同閃避動作的其他東西。

關鍵在於:

  • 只發生 (1) → 安全。船回退到 DPM,繼續安全航行。
  • 只發生 (2) → 安全。遠端操作員有資料回傳,會發現異常並採取適當行動。
  • (1)+(2) 同時發生 → 不安全狀態。船在自主航行,卻不知道前方有油輪、不會採取閃避動作,於是進入碰撞航線。

他用一張圖展示兩個初始攻擊如何沿系統傳播:攻擊會降低對他船位置的估計品質,在影像攻擊的情況下甚至直接改變船的「信念」(前方到底有什麼),最後表現為 closest point of approach 與 time to closest approach 這兩個 safety metric 的劣化。

結論:新的分析方法,以及被忽略的時序(約 03:36–03:37)

總結三點:

  1. AI 在 cyber-physical 系統中帶來新挑戰:攻擊面大幅擴張,包含訓練資料、prompt、context(若用 LLM)等。
  2. 物理攻擊面同樣真實:spoofing 影像是最明顯的一種,但同樣的手法可以在其他電磁頻域進行。
  3. 時序是盲點:safety 領域(以及某種程度上 security 領域)通常不太處理事件的時間順序;而他們做這個分析正是要顯示,時序可以繞過防禦——「我可能已經讓某個 agent 安全了,但只要改變事件的時間順序,我就能瓦解整個 agentic 生態系的 safety 與 security。」

因此需要新的、整合 safety 與 security 的分析方法。SCWM 是其中一種可能途徑,他們目前正把世界模型延伸到涵蓋agent 與人類之間的共享理解(在有對話式介面的場合)。

他給資安聽眾的臨別訊息:如果你做 security,請來找我們做 safety 的人聊——這兩件事的交界處有新的挑戰,不一起看,我們就會部署出進入物理世界後產生極不樂見後果的系統。

金句

"I may have might have made one agent secure but actually by changing the time ordering of events I can actually undermine the safety and security of the agentic ecosystem."(約 03:36:58)

單點安全不等於系統安全,而時序是最容易被漏掉的那一維。

"If you work on security, please come and talk to we guys who do safety — there's new challenges that arise at the interaction of those two issues."(約 03:37:20)

整場演講的核心呼籲。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Centre for Assuring Autonomy (CfAA), University of York 自主系統保證研究中心,近 100 人,涵蓋海事、自駕、醫療 Assurance research centre for autonomous systems, ~100 people, maritime / automotive / healthcare 講者為 Director
Structural Causal World Models (SCWM) 四層因果世界模型,將 security 攻擊建模為對因果圖的 intervention Four-layer causal world model; security attacks modeled as interventions on the causal graph 對應論文 "Structural Causal World Models for Safety Assurance of AI-based Autonomy"(2026)/ see the 2026 paper of the same name
Dropout Protection Module (DPM) 模擬船失去與遠端操控中心通訊時,回退到完全自主運作的模組 Module that falls back to fully autonomous operation when comms to the remote operating center drop 他們模擬系統中的元件 / component of their simulation
YOLO 模擬中使用的物件偵測器 Object detector used in the simulation
AIS (Automatic Identification System) 船舶向他船廣播位置的系統,可被 spoof Vessel position broadcast system; spoofable
IMO degree three autonomy 講者定義為「大致遠端操控,必要時可無遠端介入自主運作」 Speaker's gloss: largely remotely operated, able to operate autonomously without remote interaction if necessary IMO MASS 官方分級用語需另行核對(見待確認)/ cross-check against official IMO MASS wording (see To Verify)

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
John McDermad / McDermott John A McDermid
center of assuring autonomy Centre for Assuring Autonomy
SCWM(字幕作 "structure causal world models") structural causal world models
Gentic AI / aentic agentic AI
mclassified misclassified
Swifting images spoofing images
submarine security thread models(主持人語) maritime security threat models

待確認 / To Verify

  • 停止標誌貼紙攻擊的 93%(lab)/ 83%(real world)數字與原始論文出處未指名,建議核對。/ The 93% lab / 83% real-world figures for the stop-sign sticker attack were given without a citation.
  • IMO 對 MASS(Maritime Autonomous Surface Ships)degree three 的官方定義用語,與講者口述的描述是否一致,需比對 IMO 文件。/ Whether the speaker's gloss of "degree three autonomy" matches IMO's official MASS degree definitions.
  • 他提到正在延伸 SCWM 以納入「agent 與人類的共享理解」,此延伸工作是否已有公開論文。/ Whether the SCWM extension covering shared human–agent understanding has been published.

GitHub 上的 Markdown 原始檔 ↗