演講 Session 1: AI Safety

掙來的自主權:為 Agentic 企業打造 Governance as Code

Eric Aldana — Head of Product, Credo AI(代 Navrina Singh 上台 / standing in for Navrina Singh, CEO & Founder, Credo AI)

8 月 2 日(日) · Compass Stage · 00:56:24–01:02:20 · 上午場直播

企業從來不會讓一個新人第一天就擁有全部權限——實習工程師與交易員都是沿著「掙來的授權階梯」往上爬;但 agent 幾乎在部署當下就拿到全部權限,這是一個設計錯誤,而修法是把治理計畫直接編譯進 agent 的 harness。

TL;DR

  • 安全與治理是同一份工作:在不同圈子裡它們常被當成兩個學科,但核心任務相同——確保 AI 系統的行動符合其背後的人的意圖。而在大型企業裡,「意圖」從來不是一個人的決定,它是工程師、業務負責人、法遵與法務、把要求寫進採購合約的客戶、以及訂出有真實罰則的標準的監管與稽核方之間的協調問題。治理就是這些意圖被調和並被強制落到系統行為上的過程。
  • 失落的階梯:企業讓人自主決策的權限是掙來的——實習工程師從有限的 production 權限開始,交易員要掙來自己的投資額度。這些階梯是企業花了多年試錯建起來的,但對 agent 而言這個階梯基本上還不存在
  • can / may / act 三層心智模型:can(capability,模型與其工具技術上做得到什麼,靠 benchmark 衡量)、may(authority,在此時此地、以它能取用的資料與工具,它被允許做什麼——可界定範圍、可撤銷)、act(autonomy,它不需要等人就能行使的那部分授權)。
  • 現有工具都只覆蓋 can:security 問的是「攻擊者能不能讓 agent 做壞事」,observability 問的是「它有沒有把工作做好」——兩者都在 can 這一層,沒有人在處理 may
  • 落點是 agent 的 harness:不是 evaluation harness,而是治理用的 harness——把治理計畫編成版本化、可設定的程式碼,以 skills、hooks、guidance、managed settings 的形式直接裝在 agent 執行的地方,而不是放在 MCP、API gateway 或 proxy 上。

重點整理

Credo AI 的視角:治理是誰的問題(約 00:56–00:58)

Credo AI 是 AI 治理平台,服務對象是大型企業與政府機關裡對 AI 負責的人——他強調這不只是建構 AI 的人,更是那些必須決定哪些 AI 系統夠安全、夠可信,可以建、可以買、可以在組織內部署的人。

在 AI safety 這條軌道上,他先做了一個接合:

看你混哪個圈子、用哪一本術語解碼環,safety 和 governance 常被當成分開的學科。但在核心上,我認為它們做的是同一份工作——確保 AI 系統的行動方式符合其背後那些人的意圖。

而在大型企業裡,「意圖」本身就是一個協調問題,至少牽涉五方:

  • 工程師——建這個系統的人
  • 業務負責人——定義要解決什麼問題
  • 法遵與法務——決定組織可以接受哪些行動
  • 客戶——現在會把要求直接寫進採購合約
  • 監管者與稽核者——寫出帶有真實罰則的標準

所以治理,就是組織裡這些不同意圖被調和、然後被強制落實到 AI 系統實際行為上的方式

缺失的那把梯子(約 00:58–00:59)

他的核心比喻:大型企業讓一個人在有後果的決策上自主行動時,那份權限是透過某種結構掙來的

  • 每個實習工程師都從有限的 production 存取權開始,隨著資歷上升才逐步取得更多。
  • 投資公司的每個交易員,都必須掙來自己能投資多少的額度

這些掙來的授權階梯(ladders of earned authority),是組織花了多年試錯才建立起來的。而:

對 agent 來說,這個階梯在很大程度上還不存在許多 agent 在部署的那一刻就拿到了完整權限——而這是一個設計錯誤,也是我今天想談的東西。

一句話結論:

Capability 可能來自模型,但 autonomy 必須從企業那裡掙得。

use case 這個治理單位被 agent 溶解了(約 00:59)

Credo AI 六年來出貨 AI 治理流程與工具,治理的單位一直是 use case——一個 AI 工具,加上它被部署進去的脈絡。例如「一個回答員工公司政策問題的 chatbot」:你可以在它周圍畫出一條非常清楚的邊界。

但 agent 把這條邊界溶解了。

對一個能自己規劃步驟的 agent 來說,什麼叫做一個 use case?它該有哪些 connector 的存取權?哪些資料來源?

當 use case 本身模糊掉,你用來治理它的參數也會跟著模糊掉。這個壓力逼出了新的心智模型。

can / may / act(約 00:59–01:00)

  • can — capability:這個模型與它的工具技術上做得到什麼。Capability 是被 benchmark 出來的。
  • may — authority:這個 agent 在此時此地、以它能取用的資料與工具,被允許做什麼。Authority 是被界定範圍、且可撤銷的(scoped and revocable)。
  • act — autonomy:它不需要等一個人就能行使的那部分授權。

在這個框架下,他下了那句關鍵論斷:

Autonomy 不只是模型的屬性。它是一種企業層級的許可,透過證據掙來

接著是這套框架真正的診斷價值——現有的工具堆疊全都停在 can 這一層:

  • Security 問的是:攻擊者能不能讓這個 agent 做壞事?
  • Observability 問的是:它有沒有把自己的工作做好?

這些系統都是必要的,但它們講的都是 can 那一層——agent 能做什麼、做得好不好。它們沒有一個真正在處理 may。

治理系統要做的三件事,以及落點:agent 的 harness(約 01:00–01:02)

一套 AI / agentic 治理系統要能:

  1. Compose(組合):吃進 AI 系統與其所在組織的完整脈絡,產出一份治理計畫——有哪些風險、要套哪些控制。
  2. Conduct(執行):把計畫實際跑起來,無論是透過 evaluation 還是 guardrail
  3. Enforce / 留存證據:把所有這些檢查留下紀錄

而 Credo AI 正在思考的落地方式,是直接透過 agent 的 harness——也就是坐在 agent 與它能碰到的系統之間的那段 runtime 程式碼。他特別澄清:

這不是 evaluation harness,而是一個治理用的 harness(a governing one)

做法是把 compose 出來的治理計畫,嵌進一組版本化、可設定的程式碼,由 harness 強制執行。形式上是 skills、hooks、guidance、managed settings,而且直接安裝在 agent 執行的地方——不是 MCP、也不是 API gateway 或 proxy

他用一個被治理的 Claude Code session 當例子:

  • agent 想讀取一個已核准的 repo → 系統放行
  • agent 想打開一個 credential store設定直接擋下
  • 出現一個風險超過門檻的相依套件升級給 code owner 處理

而每一道檢查最終都必須被浮現出來,這也是透過同一份設定達成的。

收尾回到那把梯子:

我們說 agent 沒有的那把「掙得自主權」的梯子——這就是它。一個讓企業能集體決定 agent 可以做什麼、在 agent 行動的地方強制執行這些決定、並且保留證據的系統。

金句

"Capability might come from the model, but autonomy must be earned from the enterprise."(約 00:58)

整場的主軸句,也是講題的展開。

"Many agents receive full authority the moment they're deployed, and that is a design error."(約 00:58)

把「權限給太多」從營運疏失重新定性為設計錯誤

"None of them are really addressing the may piece."(約 01:00)

security 與 observability 的共同盲區診斷。

"A system where the enterprise can collectively decide what the agents can do, enforce those decisions where the agents act, and keep the proof."(約 01:02)

Governance as code 的一句話規格。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Credo AI AI 治理平台,服務大型企業與政府機關中對 AI 負責的角色 AI governance platform for those accountable for AI in large enterprises and government agencies 講者稱已出貨 AI 治理流程與工具約六年
can / may / act 治理 agent 的三層心智模型:capability / authority / autonomy Three-layer mental model for governing agents: capability, authority, autonomy 講者提出的核心框架
compose / conduct / enforce 治理系統要做的三件事:產出治理計畫、執行、留存證據 The three jobs of a governance system: produce a plan, execute it, keep the record 逐字稿在此處破碎,第三項名稱待確認
Governing harness 把治理計畫編成版本化程式碼,以 skills / hooks / guidance / managed settings 裝在 agent 執行處 Governance plan compiled into versioned code as skills, hooks, guidance, and managed settings at the agent's runtime 明確排除 MCP、API gateway、proxy 作為落點
被治理的 Claude Code session 示範案例:核准 repo 放行、credential store 阻擋、高風險相依升級給 code owner Worked example: approved repo allowed, credential store blocked, risky dependency escalated to the code owner

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Credto Aai / Credo AAI / CTOAI Credo AI
Nina Singh / Deina Navrina Singh
governis code governance as code
cloud code session Claude Code session
credential score credential store
business owner ers business owners

待確認 / To Verify

  • 治理系統三件事的第三項名稱:逐字稿在此嚴重破碎(「keep a record of all of those different enforce」),compose 與 conduct 明確,第三項推測為 enforce,需核對投影片。/ The captions break down here; compose and conduct are clear, the third is inferred as "enforce" and needs the slides.
  • 「skills、hooks、guidance、managed settings」:這些名稱與 Claude Code 的既有機制高度吻合,但講者是否指 Credo AI 自有的抽象層、還是直接沿用 harness 原生機制,台上未說明。/ These names map closely onto existing Claude Code mechanisms; whether he meant Credo AI's own abstraction or the harness's native primitives was not stated.
  • 產品名稱:講者全程未點名任何 Credo AI 產品或功能的正式名稱,只描述方法。/ No Credo AI product or feature name was given on stage.

GitHub 上的 Markdown 原始檔 ↗