8 月 2 日(日)
Atlas Stage
14 場 · 3 個場次
play_circle
上午場直播
play_circle
下午場直播
search
全部
主題演講
演講
工作坊
14 / 14 場
上午
Session 1: Enterprise AI
00:00
AI 採用的速率限制器來自組織,不是技術
Sunita Verma
· Chief Technology Officer, Ironclad
企業導入 AI 卡住,不是因為技術不夠好,而是因為技能落差、流程與文化沒跟著改;Ironclad 的解法是「全員同時賦能 + 把教育當基礎設施 + 把流程從瀑布式改成前期共同定規格」,九個月內把工程速度換了一個檔次。
主題演講
00:18
會自我最佳化的 Agent
Ori Goshen
· Co-Founder & CEO, AI21 Labs
Agent 上了生產線之後,真正的瓶頸是「在前沿以合理成本運作」;而模型、檢索、scaling、模型組合、執行策略構成的組態空間大到人工搜不完,所以最佳化必須自動化、可觀測,而且能在新模型出現時自動重新適配。
演講
00:35
一人獨角獸的企業版
Rene Pajta
· Chief Architect Cloud & AI, Microsoft
一萬人組織版的「一人獨角獸」不是把人減到一個,而是每個人都變成有自己 agent 團隊的決策者;而卡住這件事的不是模型,是「公司自身的智慧」——那才是唯一的護城河,其餘(模型、harness、connector)都該用買的。
演講
00:46
評測 Agent 的藝術與科學
Vincent Sunn Chen
· VP & Founding Member, Snorkel AI
我們量測 AI 的能力已經被開發 AI 的能力甩開,而「vibe code 一個 benchmark 換一則漂亮推文」的 bench slop 正在惡化這件事;真正能留下來的 benchmark 需要一個對前沿的下注、一份給社群的路線圖、以及近乎偏執的任務品質控管——Snorkel 的 Senior SWE-Bench 就是照這套原則做的。
演講
00:59
超級智慧 vs. 超級可靠
Dan Klein
· Professor, UC Berkeley; Co-founder & CTO, Scaled Cognition
智慧是多面向的,而各面向並沒有同速前進——廣度、可塑性、流暢度衝上天,精確可驗證的控制與可解釋性卻嚴重落後;做 demo 只需要前者,出貨產品需要後者,這正是那條「最後一哩」始終跨不過去的結構性原因。
演講
01:12
從助理到 AI 員工:設計「擁有一個角色」而非「擁有一項任務」的 Agent
Anushka Pathak, Soham Shah, Eric Victorson
· Product Manager / ML Engineer / Software Engineer, Ema
Assistant 是被動、無狀態、由使用者自己扛治理責任的;Ema 主張把 agent 設計成「AI 員工」——由事件與排程主動觸發、以受限權限直接改寫真實系統狀態、跨天跨系統保有記憶、治理內建——而落地時的瓶頸從來不是 agent 能不能做完整份工作,是與它協作的人類。
工作坊
下午
Session 2: Agent Evaluation & Benchmarks
00:00
Agent Arena:在真實世界中對 agent 做因果評估
Anastasios N Angelopoulos
· Co-Founder/CEO, LLMArena
靜態 benchmark 會被 overfit、又跟 production 有分佈落差,唯一不能作弊的裁判是現實世界;Arena 用「每週數百萬筆真實 agentic traces + 隨機化模型做因果推論」,把 treatment effect 而不是分數,做成 agent 排行榜。
演講
00:13
準備好迎接 general agent 了嗎?來測測看
Michal Shmueli-Scheuer
· Distinguished Engineer, AI Benchmarking and Evaluation, IBM Research
Bitter Lesson 說通用終將勝過專用,agent 也不例外;但要證明一個 agent 真的「通用」,得先解決 agent 介面、環境介面、研究者介面三重標準化問題——IBM 用一層 Unified Protocol 中介層(Exgentic)做到不改 agent 也不改 benchmark 的任意組合評估,結果顯示 general agent 已能與各任務榜首的 domain-specific agent 打成平手。
演講
00:27
打造可靠的 agent:以 eval 為先的方法
Priya Ponnapalli
· SVP of Engineering, Enterprise AI, Scale AI
企業級 agent 用的是隨機性技術、卻要交付確定性的商業結果,「大致正確」等於責任風險;Scale 的解法是把評估切成 L0 商業成果 → L1 任務成功 → L2 元件 → L3 診斷四層,彼此獨立但因果相連,並把 eval 當成客戶真正的長期資產。
演講
00:39
Spec 驅動的 agent:階層式規格、工具設計與基於軌跡的評估
Srijith Rajamohan
· Head of AI Research, Redis
替 Redis Query Engine 建診斷 agent 的實戰經驗——真正把指標推動的不是換更強的模型,而是重組工具(setup vs discretionary)與知識(診斷 playbook = router + handbooks);而且大多數失敗模式只有看軌跡才看得見,看最終答案完全看不出來。
演講
下午
Session 3: AI for Math
00:50
AI 面對長程與稀疏獎勵任務的未來
Sergei Gukov
· Executive Director, American Institute of Mathematics; John D. MacArthur Professor of Theoretical Physics and Mathematics, Caltech
數學是最誠實的 AI benchmark,而真正擋在「AI 能量產解決硬數學問題」前面的不是知識而是長程 + 稀疏獎勵這對組合;過去十年的解法(curiosity、world model、harness)只給你幾倍到十倍,但這類問題需要的是好幾個數量級——所以下一階段的關鍵不再是 data stack,而是 reward stack。
主題演講
01:05
Unit Distance 猜想與 AI for Math
Lijie Chen
· Researcher, OpenAI
推翻 Erdős 1946 年 unit distance 猜想的不是為數學特訓的模型,而是一個沒有 harness、只給一個 prompt 的通用推理模型;它的優勢不是深度,而是同時精通兩個相距很遠的數學領域——這正是人類數學家最貴的能力。
演講
01:17
數學與軟體工程中的語意對齊模型
Vijay Ganesh
· Professor, Georgia Institute of Technology
在 autoformalization 這種「跨模態但語意必須相等」的任務上,與其把模型做大,不如把 semantic alignment 這個性質直接訓進 embedding 空間——語意相同的物件靠近、不同的遠離——他們用這招做出比前沿模型小 1000 倍卻在所有測試 benchmark 上更強的模型。
演講
01:30
Omnigent:AI agent 的 meta harness
Aravind Segu
· Software Engineer, Databricks
採用 agent 很容易,營運它們很難;Databricks 的答案是在 harness 之上再加一層開源的 meta harness——session 存在 server、執行在 runner,於是同一個 session 可以跨 harness 組合、跨人協作、被政策治理,而且關掉筆電也不會停。
工作坊
English version