演講 Session 1: AI Safety
掙來的自主權:為 Agentic 企業打造 Governance as Code
Eric Aldana — Head of Product, Credo AI(代 Navrina Singh 上台 / standing in for Navrina Singh, CEO & Founder, Credo AI)
企業從來不會讓一個新人第一天就擁有全部權限——實習工程師與交易員都是沿著「掙來的授權階梯」往上爬;但 agent 幾乎在部署當下就拿到全部權限,這是一個設計錯誤,而修法是把治理計畫直接編譯進 agent 的 harness。
TL;DR
- 安全與治理是同一份工作:在不同圈子裡它們常被當成兩個學科,但核心任務相同——確保 AI 系統的行動符合其背後的人的意圖。而在大型企業裡,「意圖」從來不是一個人的決定,它是工程師、業務負責人、法遵與法務、把要求寫進採購合約的客戶、以及訂出有真實罰則的標準的監管與稽核方之間的協調問題。治理就是這些意圖被調和並被強制落到系統行為上的過程。
- 失落的階梯:企業讓人自主決策的權限是掙來的——實習工程師從有限的 production 權限開始,交易員要掙來自己的投資額度。這些階梯是企業花了多年試錯建起來的,但對 agent 而言這個階梯基本上還不存在。
- can / may / act 三層心智模型:can(capability,模型與其工具技術上做得到什麼,靠 benchmark 衡量)、may(authority,在此時此地、以它能取用的資料與工具,它被允許做什麼——可界定範圍、可撤銷)、act(autonomy,它不需要等人就能行使的那部分授權)。
- 現有工具都只覆蓋 can:security 問的是「攻擊者能不能讓 agent 做壞事」,observability 問的是「它有沒有把工作做好」——兩者都在 can 這一層,沒有人在處理 may。
- 落點是 agent 的 harness:不是 evaluation harness,而是治理用的 harness——把治理計畫編成版本化、可設定的程式碼,以 skills、hooks、guidance、managed settings 的形式直接裝在 agent 執行的地方,而不是放在 MCP、API gateway 或 proxy 上。
重點整理
Credo AI 的視角:治理是誰的問題(約 00:56–00:58)
Credo AI 是 AI 治理平台,服務對象是大型企業與政府機關裡對 AI 負責的人——他強調這不只是建構 AI 的人,更是那些必須決定哪些 AI 系統夠安全、夠可信,可以建、可以買、可以在組織內部署的人。
在 AI safety 這條軌道上,他先做了一個接合:
看你混哪個圈子、用哪一本術語解碼環,safety 和 governance 常被當成分開的學科。但在核心上,我認為它們做的是同一份工作——確保 AI 系統的行動方式符合其背後那些人的意圖。
而在大型企業裡,「意圖」本身就是一個協調問題,至少牽涉五方:
- 工程師——建這個系統的人
- 業務負責人——定義要解決什麼問題
- 法遵與法務——決定組織可以接受哪些行動
- 客戶——現在會把要求直接寫進採購合約
- 監管者與稽核者——寫出帶有真實罰則的標準
所以治理,就是組織裡這些不同意圖被調和、然後被強制落實到 AI 系統實際行為上的方式。
缺失的那把梯子(約 00:58–00:59)
他的核心比喻:大型企業讓一個人在有後果的決策上自主行動時,那份權限是透過某種結構掙來的。
- 每個實習工程師都從有限的 production 存取權開始,隨著資歷上升才逐步取得更多。
- 投資公司的每個交易員,都必須掙來自己能投資多少的額度。
這些掙來的授權階梯(ladders of earned authority),是組織花了多年試錯才建立起來的。而:
對 agent 來說,這個階梯在很大程度上還不存在。許多 agent 在部署的那一刻就拿到了完整權限——而這是一個設計錯誤,也是我今天想談的東西。
一句話結論:
Capability 可能來自模型,但 autonomy 必須從企業那裡掙得。
use case 這個治理單位被 agent 溶解了(約 00:59)
Credo AI 六年來出貨 AI 治理流程與工具,治理的單位一直是 use case——一個 AI 工具,加上它被部署進去的脈絡。例如「一個回答員工公司政策問題的 chatbot」:你可以在它周圍畫出一條非常清楚的邊界。
但 agent 把這條邊界溶解了。
對一個能自己規劃步驟的 agent 來說,什麼叫做一個 use case?它該有哪些 connector 的存取權?哪些資料來源?
而當 use case 本身模糊掉,你用來治理它的參數也會跟著模糊掉。這個壓力逼出了新的心智模型。
can / may / act(約 00:59–01:00)
- can — capability:這個模型與它的工具技術上做得到什麼。Capability 是被 benchmark 出來的。
- may — authority:這個 agent 在此時此地、以它能取用的資料與工具,被允許做什麼。Authority 是被界定範圍、且可撤銷的(scoped and revocable)。
- act — autonomy:它不需要等一個人就能行使的那部分授權。
在這個框架下,他下了那句關鍵論斷:
Autonomy 不只是模型的屬性。它是一種企業層級的許可,透過證據掙來。
接著是這套框架真正的診斷價值——現有的工具堆疊全都停在 can 這一層:
- Security 問的是:攻擊者能不能讓這個 agent 做壞事?
- Observability 問的是:它有沒有把自己的工作做好?
這些系統都是必要的,但它們講的都是 can 那一層——agent 能做什麼、做得好不好。它們沒有一個真正在處理 may。
治理系統要做的三件事,以及落點:agent 的 harness(約 01:00–01:02)
一套 AI / agentic 治理系統要能:
- Compose(組合):吃進 AI 系統與其所在組織的完整脈絡,產出一份治理計畫——有哪些風險、要套哪些控制。
- Conduct(執行):把計畫實際跑起來,無論是透過 evaluation 還是 guardrail。
- Enforce / 留存證據:把所有這些檢查留下紀錄。
而 Credo AI 正在思考的落地方式,是直接透過 agent 的 harness——也就是坐在 agent 與它能碰到的系統之間的那段 runtime 程式碼。他特別澄清:
這不是 evaluation harness,而是一個治理用的 harness(a governing one)。
做法是把 compose 出來的治理計畫,嵌進一組版本化、可設定的程式碼,由 harness 強制執行。形式上是 skills、hooks、guidance、managed settings,而且直接安裝在 agent 執行的地方——不是 MCP、也不是 API gateway 或 proxy。
他用一個被治理的 Claude Code session 當例子:
- agent 想讀取一個已核准的 repo → 系統放行。
- agent 想打開一個 credential store → 設定直接擋下。
- 出現一個風險超過門檻的相依套件 → 升級給 code owner 處理。
而每一道檢查最終都必須被浮現出來,這也是透過同一份設定達成的。
收尾回到那把梯子:
我們說 agent 沒有的那把「掙得自主權」的梯子——這就是它。一個讓企業能集體決定 agent 可以做什麼、在 agent 行動的地方強制執行這些決定、並且保留證據的系統。
金句
"Capability might come from the model, but autonomy must be earned from the enterprise."(約 00:58)
整場的主軸句,也是講題的展開。
"Many agents receive full authority the moment they're deployed, and that is a design error."(約 00:58)
把「權限給太多」從營運疏失重新定性為設計錯誤。
"None of them are really addressing the may piece."(約 01:00)
security 與 observability 的共同盲區診斷。
"A system where the enterprise can collectively decide what the agents can do, enforce those decisions where the agents act, and keep the proof."(約 01:02)
Governance as code 的一句話規格。
提到的專案與資源 / Projects & Resources
| 名稱 Name | 說明 | Description | 備註 Notes |
|---|---|---|---|
| Credo AI | AI 治理平台,服務大型企業與政府機關中對 AI 負責的角色 | AI governance platform for those accountable for AI in large enterprises and government agencies | 講者稱已出貨 AI 治理流程與工具約六年 |
| can / may / act | 治理 agent 的三層心智模型:capability / authority / autonomy | Three-layer mental model for governing agents: capability, authority, autonomy | 講者提出的核心框架 |
| compose / conduct / enforce | 治理系統要做的三件事:產出治理計畫、執行、留存證據 | The three jobs of a governance system: produce a plan, execute it, keep the record | 逐字稿在此處破碎,第三項名稱待確認 |
| Governing harness | 把治理計畫編成版本化程式碼,以 skills / hooks / guidance / managed settings 裝在 agent 執行處 | Governance plan compiled into versioned code as skills, hooks, guidance, and managed settings at the agent's runtime | 明確排除 MCP、API gateway、proxy 作為落點 |
| 被治理的 Claude Code session | 示範案例:核准 repo 放行、credential store 阻擋、高風險相依升級給 code owner | Worked example: approved repo allowed, credential store blocked, risky dependency escalated to the code owner |
逐字稿勘誤 / Transcript Corrections
| 字幕原文 Heard as | 應為 Should be |
|---|---|
| Credto Aai / Credo AAI / CTOAI | Credo AI |
| Nina Singh / Deina | Navrina Singh |
| governis code | governance as code |
| cloud code session | Claude Code session |
| credential score | credential store |
| business owner ers | business owners |
待確認 / To Verify
- 治理系統三件事的第三項名稱:逐字稿在此嚴重破碎(「keep a record of all of those different enforce」),compose 與 conduct 明確,第三項推測為 enforce,需核對投影片。/ The captions break down here; compose and conduct are clear, the third is inferred as "enforce" and needs the slides.
- 「skills、hooks、guidance、managed settings」:這些名稱與 Claude Code 的既有機制高度吻合,但講者是否指 Credo AI 自有的抽象層、還是直接沿用 harness 原生機制,台上未說明。/ These names map closely onto existing Claude Code mechanisms; whether he meant Credo AI's own abstraction or the harness's native primitives was not stated.
- 產品名稱:講者全程未點名任何 Credo AI 產品或功能的正式名稱,只描述方法。/ No Credo AI product or feature name was given on stage.