8 月 2 日(日)
Compass Stage
30 場 · 4 個場次
play_circle
上午場直播
play_circle
下午場直播
search
全部
主題演講
演講
工作坊
30 / 30 場
上午
Session 1: AI Safety
00:00
Deepfake 與更多:Agent 如何用新工具緩解問題並提供脈絡
Chris Bregler
· Senior Director / Distinguished Scientist, Google DeepMind; Academy Scientific and Technical Award Winner
真正的資訊戰場不在「這張圖是不是 AI 生的」——超過一半的問題案例像素完全沒被動過,騙人的是脈絡;所以 Google 把重心從 deepfake detector 移到「查脈絡的 agent」(Backstory),並主張根因其實是社會科學問題,不是純技術問題。
主題演講
00:16
Human in the Loop:在現實中航向讓員工蓬勃發展的 AI
Kathy Baxter
· VP / Principal Architect, Responsible AI & Tech, Salesforce
防止 AI 造成傷害的 negative alignment 已經是整個 AI 倫理領域的主軸,但它不足以讓人蓬勃發展;我們還需要 positive alignment——用最佳化工作流、刻意設計的 mindful friction、以及對人類手藝的組織性尊重,主動培養人的判斷與能力。
演講
00:25
受監管領域的可信 Agentic AI:把穩健性、隱私與問責視為共同設計的必要條件
Lovedeep Gondara
· Head of AI R&D, Vanguard; Adjunct Professor, University of British Columbia
可信度在 agentic 系統裡是系統屬性、不是模型屬性——因為穩健性、隱私、問責這三個我們都想要的性質彼此會直接衝突,所以真正該研究的不是怎麼把一切推到全自主,而是怎麼把 L2/L3 做得好用、安全且可證明合規。
演講
00:34
Agent 的社會:從位元到原子,以機器速度建立信任
Alex Obadia
· Programme Director, Advanced Research & Invention Agency (ARIA)
英國 ARIA 用 £50M 的 Scaling Trust 計畫,押注在「不同主人的 agent 如何在對抗環境下、以機器速度、無需中介地互相協調」——並且刻意把這套基礎設施做成開源公共財,因為他們認為技術單一化(monoculture)會讓人類整體對衝擊更脆弱。
演講
00:45
可存續的系統、判斷力,與 AI 安全
Neil Lawrence
· Chief Scientist and Co-founder, Trent AI
電腦很會做帳(accounting),但完全不會負責(accountability)——它關不進監獄、不會難堪、不會丟工作;把「帳」和「責任」分開,你就把人推進一個「看不懂帳卻要簽字」的位置,而這正是 agentic AI 在企業現場真正卡住的地方。
演講
00:50
每天更聰明也更安全?Computer-Use Agent 的持續學習與安全
Huan Sun
· Associate Professor, The Ohio State University
分佈偏移既是 agent 最需要在部署後持續學習的地方,也正是安全失效最容易發生、最容易被漏看的地方——所以「持續學習」與「安全」之間存在一個尚未被探索的危險張力,而錯誤的正回饋會把不安全行為一輪一輪地強化回模型裡。
演講
00:56
掙來的自主權:為 Agentic 企業打造 Governance as Code
Eric Aldana
· Head of Product, Credo AI(代 Navrina Singh 上台 / standing in for Navrina Singh, CEO & Founder, Credo AI)
企業從來不會讓一個新人第一天就擁有全部權限——實習工程師與交易員都是沿著「掙來的授權階梯」往上爬;但 agent 幾乎在部署當下就拿到全部權限,這是一個設計錯誤,而修法是把治理計畫直接編譯進 agent 的 harness。
演講
01:02
可以對話的基礎設施
Jeff Price
· Field CTO of North America, SUSE
當修補窗口從一季壓縮到四小時,瓶頸早就不是技術能力而是流程——所以把 MCP server 裝進 Linux 與 Kubernetes 這層,讓 agent 能「讀」整個機隊、排出優先序、開好工單,但寫入永遠留給人按下核准鍵。
工作坊
下午
Session 2: AI Systems
00:02
用 Agent 打造生產級 AI 系統:經驗、陷阱與極限
Jun Yang
· Senior Director of Compute Architecture, NVIDIA
把 agent 放進 NVIDIA 的生產級推論/訓練軟體流程後,真正的瓶頸不是「agent 會不會寫程式」,而是「產出能不能通過人類的完整性審查」——313 個 agent 修的 bug 只有 73 個進了 main branch;因此 harness 要輕、要能隨基礎模型一起進化,而不是自己蓋一座重型框架。
演講
00:13
從 Agent Demo 到 Production:Postman 如何打造可靠的 AI Agent 基礎設施
Rick Crawford
· Field CTO, Postman(官網議程列為 Ankit Sobti, Co-Founder & CTO, Postman;現場為代講)
Postman 用企業銷售流程當試驗場,發現多 agent 架構會同時放大成本與混亂,真正的解法是「先蓋一個懂全域知識的 monolith agent,再往上疊 hallucination 防線、領域 persona、策略內容、以及以職務為界的授權層」,並用 help → recommend → act → own 這條 autonomy curve 決定每個場景該讓 agent 走多遠。
演講
00:23
讓算力貼著訊號走
Rahul Bakshi
· Director, Applied Science (Edge AI), Amazon
大家都在問「怎麼給 agent 更多算力」,但在邊緣裝置上算力有一道由人體皮膚耐熱極限畫出的硬天花板(約 1–1.5 W),所以真正該問的是「這個任務值不值得往上升級一層」——而現在缺的不是模型,是一個懂得按任務動態編排感測器、無線電與算力預算的 composable runtime。
演講
00:30
用迴圈做模型最佳化
John Liu
· Principal Product Manager, AWS
在 AWS Trainium 上做模型最佳化本來就是多層、多變數的巢狀迴圈,天生適合交給 agent;但真正決定成敗的不是迴圈架構,而是五件反直覺的事——尤其是「你的量測環節一定會被 agent 操縱」,以及「你精心建立的知識庫有保存期限,該定期刪掉它並驗證效能有沒有變好」。
演講
00:36
以機櫃級共享記憶體 KV Cache 實現分離式 LLM 服務
Jongryool Kim
· Senior Director / Head of AI System Infra., SK hynix
把一台實體上獨立的記憶體池放進機櫃中央,讓多個節點看到同一段位址空間,KV cache 就不必再靠 RDMA 在節點間搬來搬去——prefill 寫一次、decode 直接讀,舊的 KV cache 順便留在池裡供下次重用,同時立刻釋放 GPU HBM 並消除 PCIe 爭用。
演講
00:41
免驗證器演化的統一編排系統
Ben Athiwaratkun
· Senior Director, Core ML (Turbo), Together AI
當演化式探索拿掉外部驗證器之後,單一模型會因為「熵不夠」而讓解答退化;Squeeze Evolve 的解法是用多個異質模型跑同一條演化迴圈——難的交給貴模型、易的交給便宜模型,同時修復多樣性與成本兩個問題,在 ARC-AGI 上以更少的演化步數維持 97.5% 準確率並顯著降低單題成本。
演講
00:48
Agentic AI 如何改寫 AI 基礎設施的規則
Tushar Krishna
· Associate Professor, Georgia Tech; CEO, InfraVana
今天的推論服務堆疊是為 chatbot 時代造的——單模型、靜態執行路徑、請求彼此獨立、硬體同質;而 agentic 工作負載帶來的 dynamism 與 heterogeneity 讓整個堆疊出現「兆級的選擇組合」,選錯的機率極高、代價更高,唯一的出路是跨全棧一起最佳化,而前提是先能量測。
演講
下午
Session 3: Enterprise AI
00:53
打造軟體工廠
Eno Reyes
· Co-Founder / CTO, Factory AI
每家公司都有一條「訊號 → 分流 → 規劃 → 寫程式 → 驗證 → 部署 → 產生新訊號」的隱性迴圈,但幾乎沒有人把它顯式建模;「軟體工廠」就是把這條迴圈顯式化並交給 agent 自動流動,而人的新角色是建造、治理與持續改良這座工廠。
演講
01:08
長時間執行 Agent 的基礎設施
Ankit Goyal
· Principal Staff Software Engineer, LinkedIn
LinkedIn 把 agent 當成「跟其他任務一樣的一種任務」放進 ML 平台,但因為 agent 產生的程式碼不可信、且會在幾分鐘內丟出上百個 job,平台在 UX、compute、trust 三個面向都被迫重新設計——結果是六個月內實驗量成長 100%。
演講
01:14
從多 Agent 模式到可靠的協調
Daniel Homola
· Lead AI Engineer, BMW Research
handoff、agents-as-tools、routing 這些協調模式最後都收斂到同一個 runtime 決策——「這件事該由誰來做」;可靠的多 agent 系統來自把這個 delegation 決策做得可量測、脈絡感知,並接受它常常沒有唯一正確答案。
演講
01:20
從 SaaS 轉型為 Agentic Enterprise
Nayaki Nayyar
· CEO, Siteimprove
當內容量無限、且人人都能生成內容時,事後掃描與修補來不及了;Siteimprove 的轉型路線是把合規檢測「左移」到創作當下,用 MCP server 把自家 agent 直接接進 Lovable、VS Code 這類 AI 創作工具裡。
演講
01:27
Agentic AI 是偽裝成技術突破的 UX 問題
Surbhi Rathore
· VP, AI Products & Strategy, Invoca
模型已經逐漸可互換,決定 agent 成敗的不再是能不能完成工作流,而是能不能贏得一個「一坐下就預期你會失敗」的使用者的信任——那是設計問題,不是模型問題。
演講
01:34
用 Neuro SAN 擴展設定驅動的多 Agent 網路
Daniel Fink
· AI Engineering Lead, Cognizant
兩年半前 Cognizant AI Lab 發現「agent 呼叫 agent 的膠水程式碼」才是真正的雜訊,於是把整個多 agent 網路抽成設定檔——結果不只讓行銷同事也能建系統,還讓公司內網長成 200 個 leaf agent 的網路,工單量下降約三成。
演講
下午
Session 4: Agent Evaluation & Benchmarks
01:41
偏好勝過 Benchmark:貼合團隊真實開發方式的模型路由
Debarshi Raha
· VP & Fellow Engineer, DigitalOcean
公開 leaderboard 不知道你的成本上限、延遲容忍度與資料集,所以模型路由不該照 benchmark 排名硬選,而該把「你的偏好」編碼進一個伺服器端、專用小模型驅動的 router,即時依成本與延遲重排候選模型——DigitalOcean 用開源的 Plano + 30B 專用路由模型做到延遲 <200ms、零客戶端改動、且完全免費。
主題演講
01:58
企業部署前的那場考試
Yuan (Emily) Xue
· Head of Enterprise AI, Scale AI
現有 benchmark 量的是「天花板」——模型離人類智慧頂點還差多遠,而且刻意不讓自己被刷爆;企業要的卻是「部署就緒度」——這個 use case 今天能不能上線、要花多少人力監督成本才能撐到 99% 可靠度,以及隨著模型變好那筆成本怎麼降。可靠度是約束,不是可以交換的變數。
演講
02:11
從訓練到評估:Scale AI 打造 Agentic AI 的開放配方
Chenguang Wang
· Assistant Professor, UC Santa Cruz; Research Advisor, Scale AI
RL 過去只在「可驗證領域」(數學、程式碼)有效,而 rubric-based reward 把開放領域的評分準則轉成可驗證訊號,讓 RL 走進科學與開放任務;同一套思維反過來也重塑評估——SWE-Atlas、drug discovery bench、合成長程 computer-use 任務,而訓練與評估之間的失敗模式回饋,是一個應該永遠轉下去的飛輪。
演講
02:24
衡量 API Agent 在生產環境長程任務中的可靠度
Zelin Wan
· Senior AI Engineer, Postman
單一 API 任務上所有模型都拿 88–97%,看起來問題已解決;但把同樣的任務串成互相依賴的長鏈,分數立刻掉到 44–73%——任務本身沒有變難,是早期的一個小錯會被後續步驟放大成整份報告的崩潰,而這正是「回答問題」與「執行任務」的差別。
演講
02:34
ScarfBench:Agent 能搬得動企業級 Java 嗎?
Rahul Krishna
· Senior Research Scientist, IBM Software Innovation Labs
企業 Java 應用的行為大半藏在框架的 proxy、reflection 與 interceptor 裡,原始碼根本看不到,所以框架之間沒有一對一對應;結果是 coding agent 很擅長讓遷移後的程式編譯過、部署起來,但只有 2–14% 的遷移真正保住了原本的行為——「編得過」是個會騙人的訊號。
演講
02:43
資料 Benchmark:一切都是編的,分數也不重要
Grace Tang
· AI @ Hex
好的 frontier benchmark 有一個共同點——題目對 agent 和對人類都是真的難;但資料分析領域的公開 benchmark 大多是選擇題、Kaggle 練習題和規格不清的偽問題,和分析師的日常工作幾乎無關,所以 Hex 自己蓋了一間完全虛構、但夠髒夠真的公司 Shorelane 來測。
演講
02:49
AIDaR:AI 資料就緒度評估框架
Arindam Sett
· Principal ML Engineer, Genentech
Agent 不是在真空中運作的,它跑在一層資料之上;當你的 agent 評估分數難看,問題往往不在 prompt 也不在模型,而在那層為 dashboard 和報表而生、根本不是為 agent 準備的資料——所以評估 agent 的同時,也必須評估資料層的就緒度。
演講
02:54
更好的 Eval 如何透過加速科學發現帶來豐盛
Scott Clark
· Co-Founder & CEO, Distributional
黑箱最佳化器最棒的一點是它會最佳化你給它的任何 eval,最糟的一點是它會盲目地最佳化你給它的任何 eval——所以加速科學的瓶頸從來不是最佳化能力,而是懂物理、懂科研流程、懂假說驗證的 eval。
演講
03:00
Eval:驅動 Agent 改善的引擎
Aayush Agrawal
· Product Lead, Uber
每個 agent 團隊都理性地決定「先上線,eval 之後再說」,結果全都被困在事後補 eval、事後查為什麼壞掉的迴圈裡;Uber 平台團隊花一年把 eval 變成預設值——tracing 從第一天就開、starter kit 直接送到 Slack、用 CLI 讓產品團隊也能擁有 eval——並且把提問從「你的 eval 有沒有 90%?」換成「你真的信任你的 eval 嗎?」
演講
English version