演講 Session 1: AI Safety

Agent 的社會:從位元到原子,以機器速度建立信任

Alex Obadia — Programme Director, Advanced Research & Invention Agency (ARIA)

8 月 2 日(日) · Compass Stage · 00:34:57–00:45:11 · 上午場直播

英國 ARIA 用 £50M 的 Scaling Trust 計畫,押注在「不同主人的 agent 如何在對抗環境下、以機器速度、無需中介地互相協調」——並且刻意把這套基礎設施做成開源公共財,因為他們認為技術單一化(monoculture)會讓人類整體對衝擊更脆弱。

TL;DR

  • ARIA 是什麼:英國版 DARPA,「差別是我們沒有那個 D」——不碰國防,其他都做。成立三年、約 16 個計畫,每個約 £50–70M,涵蓋製造、更好的晶片、從免疫系統不同部位切入的疫苗、神經科技等。
  • Scaling Trust 要解的問題:資助能讓 agent 協調的研究與基礎設施。協調具體指三件事:找到交易或互動的對手方、進行複雜的協商、以及執行協議。前提設定是對抗性的 multi-agent / multi-principal 環境——不是單一擁有者底下的多 agent,而是不同擁有者、代表不同主體的 agent 互動。
  • 關鍵設計立場:要程式化(因為要跑在機器速度上,所以規模化時不放人在迴圈裡)、要人人可用、要沒有中介(明確的目標是限制基礎設施裡的系統性咽喉點),而且要橫跨數位與實體世界(agent 也可以是具身的)。技術上押注 programmable cryptography 與安全硬體的近期進展。
  • Agent 能做人做不到的事:兩個 agent 可以靠安全硬體進入一個「房間」,互相揭露資訊,並承諾若交易不成就從記憶中刪除該資訊——人類只能用 NDA 近似,agent 可以程式化地做到。
  • 為什麼堅持開源與 plurality:避免滑向 monoculture。理由不是「多元本身好」,而是單一化會讓人類在文化與技術上都對衝擊更不具韌性,並隨時間侵蝕我們的能動性
  • 計畫三塊:協調堆疊(數位 + 實體,已資助包含 Berkeley 在內的首批團隊)、支撐堆疊的基礎理論(自主協定生成、formal AI security、把密碼學根信任搬到實體世界)、以及一個開放給大眾的大型測試場,做成競賽,紅隊也互相競爭。

重點整理

ARIA 與 Scaling Trust 的框架(約 00:35–00:37)

ARIA(Advanced Research + Invention Agency)是英國的 R&D 資助機構,資助全球的 R&D 登月計畫。對照 DARPA 最好懂,不同在於:

The difference with DARPA is we don't have the D. So we don't do anything defence related, but we do everything else.

特徵:以影響力為導向、高風險胃納、每個計畫追一個雄心目標,單一計畫規模約 £50–70M。成立三年,目前約 16 個計畫,橫跨製造、晶片、疫苗(從免疫系統的不同部位切入)、神經科技等領域。Obadia 是 Programme Director,負責其中的 Scaling Trust

他也直說這場演講的目的有兩層:告訴大家 ARIA 正在資助什麼、以及想聽聽現場對這個 thesis 的意見(他在 Q&A 前明講「如果有任何質疑,我很樂意聽」)。

Scaling Trust 目前是£50M、為期三年的計畫。要資助的是讓 agent 能協調的研究與基礎設施,而「協調」被拆成三個具體能力:

  1. agent 能不能找到需要交易、或非交易目的互動的對手方?
  2. 能不能進行足夠複雜的協商?
  3. 能不能執行協議?

「安全地」做這些事之所以重要,是因為他們設定的場景是對抗性環境下的 multi-agent、multi-principal 系統——這裡他劃了一條清楚的界線:不是單一擁有者底下的多 agent 系統,而是不同擁有者、代表不同主體(principal)的 agent 彼此互動。所以其中一些 agent 可能是敵對的,可能存在資訊不對稱,可能目標不同。

四個設計約束(約 00:38–00:39)

  • 程式化(programmatically):因為希望這件事在機器速度上運作,所以規模化之後不會、也不打算把人放在迴圈裡
  • 人人可用、沒有中介:他說這其實是一個關於未來系統拓樸的主張——要限制這套基礎設施裡存在的系統性咽喉點(systemic choke points)
  • 橫跨數位與實體:他們把 agent 也視為可具身的,所以基礎設施必須延伸到實體世界,讓包含實體元素的互動也能安全進行。
  • 技術賭注:密碼學與安全硬體的新進展,特別是被稱為 programmable cryptography 的趨勢,加上安全硬體與技術堆疊其他部分的最新發展。他明說這些進展鬆動了前一場演講(Gondara)提到的那些張力——至少 trade-off 空間變了,我們可以落在空間中不同的點上。

為什麼值得做:新市場,以及只有 agent 做得到的事(約 00:39–00:40)

他先承認現狀:今天的 agent 堆疊還不夠成熟,把 agent 放出去替我們做事非常困難,而且前面幾場已經看過各種攻擊的分類法。

但他對兩件事很興奮:

(1) 新市場。 類比是密碼學在現代數位社會的落地——它間接讓電子商務這類東西得以存在,我們今天的數位社會就站在那些建構元件之上。如果協調基礎設施能延伸到實體世界,可能會長出延伸到實體世界的新市場。

(2) agent 獨有的能力。 他給的例子非常具體:

兩個 agent 可以靠安全硬體進入一個所謂的「房間」。它們可以彼此揭露資訊,並且承諾:如果這筆交易沒談成,就把資訊從記憶裡刪掉。這是我們人類只能用 NDA 之類的東西去近似的事,但 agent 可以程式化地做到。

開源、plurality,與對 monoculture 的警戒(約 00:40–00:41)

價值上的堅持有三:開源、對所有人開放、沒有中介。目標是讓多個模型、多種心智能夠共存——這個概念一般被放在 pluralism / plurality 的脈絡下討論。

他要避免的是滑向 monoculture:所有人都用同一套堆疊,而且我們的偏好也間接被塑造成同一個樣子,社會的多樣性因此減少。他特別強調這個論證不是「為了多元而多元」:

我們認為那會讓我們作為人類,在文化上與技術上都更不具備抵禦衝擊的韌性,而且隨著時間侵蝕我們的能動性

正因如此,他們認為這套東西應該以公共財的形式被建造,而這也是 ARIA 願意用 grant 而非其他形式資助的理由。

計畫的三層結構(約 00:41–00:44)

第一層:協調堆疊(coordination stack)。 分數位與實體兩側,已經資助了第一批團隊:

  • 數位側,包含 Berkeley 的團隊,研究方向如:agent 如何推理安全性、如何自主生成協定、如何與複雜的安全系統互動,以及 agent 如何進行複雜的協商推理
  • 實體側,例如更容易被 agent 互動、且具防篡改性的新型感測器——而且已經有人在嘗試破解它們。

第二層:支撐堆疊的基礎理論。 他的判斷很直接:

我們看到的很多研究,如果你是從理論計算機科學和資安這些領域出身,會覺得非常經驗性

所以他們要確保那個(可能是由經驗性方式收斂出來的)堆疊,底下有理論支撐——把既有的形式化安全思維應用到 AI 這個目前抗拒被完全形式化的新領域。他點名了幾個興奮的方向:autonomous protocol generation、formal AI security、以及把密碼學概念搬到實體世界(他提到量子密碼學與 physically unclonable function 這類把信任根從傳統密碼學換到實體世界的嘗試)。

第三層:開放的大型測試場。 即使有了堆疊、也有理論保證「沒有一個逼近中的不可能性結果、我們不是在完全的黑暗中工作」,這仍然需要被測試——因為這終究是 multi-agent、multi-principal 系統,堆疊必須被壓力測試。

  • 任何人都可以提交自己的 agent;可以測他們的堆疊,也可以帶自己的堆疊來。
  • 做成競賽:參賽者競爭勝出,而紅隊也在競爭誰是最好的紅隊
  • 要量測的是:在對抗壓力下,安全 agentic 協調的 state of the art 到哪裡
  • 同時要看會湧現出什麼:「我們人類可以決定需要什麼樣的堆疊,但正如我們多次看到的,湧現行為有時會揭露 agent 獨有的新能力」——所以測試場本身與任務都必須夠開放式(open-ended)
  • 對這條 AI safety 軌道最相關的一點:理解存在哪些失效模式。很多這類行為會是 out of distribution,而理解失效模式有助於釐清需要什麼樣的安全要求,也許還有監管

最後的計畫近況:已經資助了一些團隊,並正與 Google DeepMind、Cooperative AI Foundation、Schmidt Sciences 合作一個於 8 月 8 日截止的徵案,資助標的包含他提到的沙盒與測試場等。

金句

"The difference with DARPA is we don't have the D."(約 00:36)

一句話講完 ARIA 的定位。

"We don't care about the single owner multi-agent systems. This is about different owner, different agents that are representing different principals."(約 00:37)

整個計畫最關鍵的問題設定:真正困難的是「不同主人的 agent」。

"Two agents can enter a quote-unquote room using secure hardware … they can commit to deleting the information from their memory if the deal doesn't go through. These are things that as humans we can only approximate with, for example, NDAs."(約 00:40)

不是「agent 做得比人快」,而是「agent 做得到人做不到的事」。

"We want to avoid a slide towards monoculture … it makes us as humanity less resilient to shocks both culturally and technologically, and erodes our agency over time."(約 00:41)

把 plurality 從價值觀主張轉成韌性論證。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
ARIA (Advanced Research + Invention Agency) 英國 R&D 資助機構,資助全球登月型研究;約 16 個計畫,每個 £50–70M UK R&D funding agency backing moonshots worldwide; ~16 programmes at £50–70M each 成立三年;不做國防 / three years old, no defence work
Scaling Trust £50M、三年期計畫,資助 agent 安全協調的研究與基礎設施 £50M three-year programme funding research and infrastructure for secure agent coordination 官網另有 Scaling Trust Arena(競賽平台)之名,演講中未點名
開放測試場 / open test bed 開放公眾提交 agent 的大型競賽式測試場,紅隊同場競技 Public competition-style test bed; anyone can submit agents, red teams compete too 演講中稱 "a massive test bed that is open to the public"
Programmable cryptography 講者押注的密碼學趨勢,與安全硬體共同鬆動安全 / 自主的 trade-off The cryptography trend he's betting on, which with secure hardware shifts the security/autonomy trade-off 明確回應前一場 Gondara 提到的性質衝突
Physically unclonable functions 把信任根從傳統密碼學搬到實體世界的方向之一 One route to swapping cryptographic roots of trust into physical substrates 與量子密碼學並列提及
合作徵案 / joint call 與 Google DeepMind、Cooperative AI Foundation、Schmidt Sciences 合作,8 月 8 日截止 Joint call with Google DeepMind, Cooperative AI Foundation, Schmidt Sciences; closes 8 August 資助沙盒與測試場等

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Alex Oadia Alex Obadia
Arya ARIA
Deep Mind Google DeepMind
"50 million pound … so about $7 million" £50M 約合 $67M(字幕金額錯誤)/ caption figure is wrong
texonomy taxonomy
erodess erodes
physically inclinable functions physically unclonable functions
multi- aent multi-agent
principles(指 multi-principal 那段) principals

待確認 / To Verify

  • £50M 的美元換算:講者說「50 million pound, so about $7 million」——£50M 約合 $67M,字幕或口誤其一;金額以 £50M 為準。/ £50M ≈ $67M, not $7M; take the sterling figure as authoritative.
  • 測試場的正式名稱:演講中只稱 "a massive test bed";ARIA 官方資料另有 Scaling Trust Arena 的名稱,但講者未在台上使用,故不併入內文。/ He only said "test bed"; ARIA materials refer to a Scaling Trust Arena, but he did not use the name on stage.
  • 已獲資助的 Berkeley 團隊名稱與 PI:講者只說 "some teams at Berkeley",未點名。/ He said "some teams at Berkeley" without naming them.
  • ARIA 計畫總數:講者說 "about 16 programmes so far",為口頭近似值。/ "About 16" was a spoken approximation.

GitHub 上的 Markdown 原始檔 ↗