演講 Session 4: Secure Agentic AI
Agentic AI 的安全與資安
John A McDermid — Director, Centre for Assuring Autonomy, Institute for Safe Autonomy, University of York
在 cyber-physical 系統裡,safety 與 security 傳統上被分開評估,但 agentic AI 讓攻擊面同時擴張到訓練管線與物理環境;用 structural causal world model 把兩者接起來後會發現——單獨都安全的兩個攻擊,只要改變發生順序就能組合成致命結果。
TL;DR
- Safety ≠ Security,但不能再分開做:講者做了 40 年軟體密集系統的 safety(定義是「對人、環境的物理傷害」),他的訊息很直接——資安圈與安全圈必須坐下來談,否則會部署出在物理世界造成災難的系統。
- AI 把攻擊面往兩個方向撐開:一邊是訓練管線、prompt、context 等傳統 IT 面向;另一邊是物理環境本身——貼紙貼在停止標誌上就能讓感知模型讀成「速限 45 mph」(實驗室 93%、真實世界 83%)。
- SCWM(structural causal world model):四層結構——ontology(世界中重要的事物,如浪高)→ 不確定性建模 → 不確定性邊界 → 底層可用形式化方法驗證演算法行為。攻擊被建模成對因果圖的 intervention,再沿圖傳播到 safety metric。
- 複合攻擊案例(無人水面載具):對遠端操控中心做 DoS(數位)+ 用 UAV 在攝影機前擋一張圖(物理)。兩者單獨發生都安全,合起來就是一艘自主航行、卻看不見前方油輪的船。
- 最反直覺的發現:safety 與 security 都不太處理事件的時間順序,但時序本身就能繞過防禦——你可能把單一 agent 做安全了,改變事件順序卻能瓦解整個 agentic ecosystem 的安全性。
重點整理
背景:York 的 Centre for Assuring Autonomy(約 03:26–03:27)
講者做軟體密集系統的 safety 大約 40 年,這裡的 safety 指的是對人與環境的物理傷害;過去九到十年主持自主系統保證(assurance of autonomous systems)的研究計畫,近年逐步涵蓋 AI 乃至 agentic AI——儘管 agentic AI 目前在安全關鍵系統中部署還不多。
中心規模已接近 100 人(faculty、研究員與博士生),領域橫跨海事、自動駕駛與 AI 在醫療照護的應用。這場演講以海事為例,因為它最能呈現問題的本質。(插曲:投影片的逐步動畫沒有正常運作,他大半場是「繞著投影片講」。)
為什麼要把 safety 與 security 一起做(約 03:28–03:29)
傳統上 safety 與 security 是各自獨立評估的。但在 cyber-physical 系統裡,網路攻擊會級聯穿過技術系統、穿過感知系統,最後造成不安全的結果——safety 圈稱之為 hazard(威脅到人員或設備物理安全的狀態)。
導入 AI 之後,safety 與 security 的問題同時被改寫:攻擊面大幅擴張,除了作業系統之外還多了訓練管線;而如果系統有物理實體,物理環境本身也是威脅面的一部分。
他借用了別人的一個經典例子(明確聲明不是他們的研究):有人訓練一個 AI 演算法去找感知系統的弱點,然後印出貼紙貼在停止標誌上,讓感知邏輯判定那是「速限 45 mph」的標誌——實驗室準確率 93%,真實世界 83%。
SCWM:把 security 綁進因果世界模型(約 03:29–03:30、03:33–03:35)
Safety 的基礎是因果模型。他的團隊因此建構世界模型來表示這些因果結構,稱為 structural causal world models(SCWM)。他特別區分:AI 圈很關注「自動學出世界模型」,而 SCWM 是我們自己明確描述的,並且把 security 綁進這個結構裡。
SCWM 有四層:
- Ontology:描述在這個工作場景中重要的世界事物。例如「浪高」——因為波浪施加在船體上的力會改變其操縱性。
- 不確定性建模:同一件事在特定情境下無法精確計算,例如你算不出浪與船體交互作用的確切波形,因此海況如何影響船的運動存在不確定性。
- 不確定性邊界:上述不確定性被映射成一組 bound。
- 底層驗證:喜歡形式化方法的人可以在這層驗證演算法行為——「我可以設定不確定性的邊界,並在這些已知邊界內安全運作」。
安全事件如何進入這個模型:把攻擊視為對因果依賴圖的 intervention。實際上你會建出所有相關因素的因果依賴圖(他在投影片上只 highlight 四個節點),security 事件擾動這些關係,再沿著圖傳播到最終的 safety metric 偏差。
本例關心的 metric 是 closest point of approach(最近會遇距離) 與 time to closest approach(抵達最近會遇點的時間)。距離越小越危險;時間則取決於船有多大、多靈活——船越笨重,你就得越早預測到最近會遇點,才有足夠時間操舵。
案例:無人水面載具的複合攻擊(約 03:30–03:33)
情境(他強調是與真實系統高度相似的代表性模擬,不是真實系統本身):一艘 unmanned surface vessel,依 IMO(International Maritime Organization)定義屬於 degree three 自主等級——大致上遠端操控,但必要時可在無遠端介入下自主運作。
他們建了模擬:感知用 YOLO 物件偵測器,加上一個他們稱為 dropout protection module(DPM) 的模組——當船失去與遠端操控中心的通訊(例如遭到 jamming)時,就回退到完全自主功能。另外還有 AIS(向其他船舶廣播自身位置的系統),它是可以被 spoof 的。
複合攻擊由兩部分組成:
- 數位攻擊:對遠端操控中心發動 DoS,使其無法再控制該船。直接效果是船上的 DPM 接手,自主續行原本協議好的航路。
- 物理攻擊:放飛一架 UAV,在船載攝影機前擺一張影像,使系統要嘛完全偵測不到來船,要嘛把它誤判成需要不同閃避動作的其他東西。
關鍵在於:
- 只發生 (1) → 安全。船回退到 DPM,繼續安全航行。
- 只發生 (2) → 安全。遠端操作員有資料回傳,會發現異常並採取適當行動。
- (1)+(2) 同時發生 → 不安全狀態。船在自主航行,卻不知道前方有油輪、不會採取閃避動作,於是進入碰撞航線。
他用一張圖展示兩個初始攻擊如何沿系統傳播:攻擊會降低對他船位置的估計品質,在影像攻擊的情況下甚至直接改變船的「信念」(前方到底有什麼),最後表現為 closest point of approach 與 time to closest approach 這兩個 safety metric 的劣化。
結論:新的分析方法,以及被忽略的時序(約 03:36–03:37)
總結三點:
- AI 在 cyber-physical 系統中帶來新挑戰:攻擊面大幅擴張,包含訓練資料、prompt、context(若用 LLM)等。
- 物理攻擊面同樣真實:spoofing 影像是最明顯的一種,但同樣的手法可以在其他電磁頻域進行。
- 時序是盲點:safety 領域(以及某種程度上 security 領域)通常不太處理事件的時間順序;而他們做這個分析正是要顯示,時序可以繞過防禦——「我可能已經讓某個 agent 安全了,但只要改變事件的時間順序,我就能瓦解整個 agentic 生態系的 safety 與 security。」
因此需要新的、整合 safety 與 security 的分析方法。SCWM 是其中一種可能途徑,他們目前正把世界模型延伸到涵蓋agent 與人類之間的共享理解(在有對話式介面的場合)。
他給資安聽眾的臨別訊息:如果你做 security,請來找我們做 safety 的人聊——這兩件事的交界處有新的挑戰,不一起看,我們就會部署出進入物理世界後產生極不樂見後果的系統。
金句
"I may have might have made one agent secure but actually by changing the time ordering of events I can actually undermine the safety and security of the agentic ecosystem."(約 03:36:58)
單點安全不等於系統安全,而時序是最容易被漏掉的那一維。
"If you work on security, please come and talk to we guys who do safety — there's new challenges that arise at the interaction of those two issues."(約 03:37:20)
整場演講的核心呼籲。
提到的專案與資源 / Projects & Resources
| 名稱 Name | 說明 | Description | 備註 Notes |
|---|---|---|---|
| Centre for Assuring Autonomy (CfAA), University of York | 自主系統保證研究中心,近 100 人,涵蓋海事、自駕、醫療 | Assurance research centre for autonomous systems, ~100 people, maritime / automotive / healthcare | 講者為 Director |
| Structural Causal World Models (SCWM) | 四層因果世界模型,將 security 攻擊建模為對因果圖的 intervention | Four-layer causal world model; security attacks modeled as interventions on the causal graph | 對應論文 "Structural Causal World Models for Safety Assurance of AI-based Autonomy"(2026)/ see the 2026 paper of the same name |
| Dropout Protection Module (DPM) | 模擬船失去與遠端操控中心通訊時,回退到完全自主運作的模組 | Module that falls back to fully autonomous operation when comms to the remote operating center drop | 他們模擬系統中的元件 / component of their simulation |
| YOLO | 模擬中使用的物件偵測器 | Object detector used in the simulation | |
| AIS (Automatic Identification System) | 船舶向他船廣播位置的系統,可被 spoof | Vessel position broadcast system; spoofable | |
| IMO degree three autonomy | 講者定義為「大致遠端操控,必要時可無遠端介入自主運作」 | Speaker's gloss: largely remotely operated, able to operate autonomously without remote interaction if necessary | IMO MASS 官方分級用語需另行核對(見待確認)/ cross-check against official IMO MASS wording (see To Verify) |
逐字稿勘誤 / Transcript Corrections
| 字幕原文 Heard as | 應為 Should be |
|---|---|
| John McDermad / McDermott | John A McDermid |
| center of assuring autonomy | Centre for Assuring Autonomy |
| SCWM(字幕作 "structure causal world models") | structural causal world models |
| Gentic AI / aentic | agentic AI |
| mclassified | misclassified |
| Swifting images | spoofing images |
| submarine security thread models(主持人語) | maritime security threat models |
待確認 / To Verify
- 停止標誌貼紙攻擊的 93%(lab)/ 83%(real world)數字與原始論文出處未指名,建議核對。/ The 93% lab / 83% real-world figures for the stop-sign sticker attack were given without a citation.
- IMO 對 MASS(Maritime Autonomous Surface Ships)degree three 的官方定義用語,與講者口述的描述是否一致,需比對 IMO 文件。/ Whether the speaker's gloss of "degree three autonomy" matches IMO's official MASS degree definitions.
- 他提到正在延伸 SCWM 以納入「agent 與人類的共享理解」,此延伸工作是否已有公開論文。/ Whether the SCWM extension covering shared human–agent understanding has been published.