演講 Session 2: AI Systems

Agentic AI 如何改寫 AI 基礎設施的規則

Tushar Krishna — Associate Professor, Georgia Tech; CEO, InfraVana

8 月 2 日(日) · Compass Stage · 00:48:03–00:53:01 · 下午場直播

今天的推論服務堆疊是為 chatbot 時代造的——單模型、靜態執行路徑、請求彼此獨立、硬體同質;而 agentic 工作負載帶來的 dynamism 與 heterogeneity 讓整個堆疊出現「兆級的選擇組合」,選錯的機率極高、代價更高,唯一的出路是跨全棧一起最佳化,而前提是先能量測。

TL;DR

  • 現有推論堆疊是 chatbot 時代的產物:一次跑一個模型、為靜態執行路徑最佳化、假設每個請求彼此獨立、硬體基本同質(GPU)。Agentic 工作負載打破了每一條假設。
  • 兩個不可逆的趨勢:dynamism 與 heterogeneity。前者是多模型、tool call、動態波動的需求、互相依賴的任務、以及工作流層級的最佳化;後者是 CPU 加上各種為不同任務段最佳化的專用硬體。而 agentic 工作流的運算量比非 agentic 高出 10 到 100 倍——所以中間那層軟體堆疊只會更關鍵。
  • 兆級選擇 + 快速演化的元件 = 幾乎一定會選錯。一端是 agent 應用在意的 end-to-end SLO,另一端是資料中心的 infra 目標,中間是跨層相依的巨大選擇空間。他的結論:只優化堆疊的一部分不會有用,唯一的路是跨全棧最佳化——而 "you can't optimize what you cannot measure",所以 benchmark 與模擬工具(Chakra、ASTRA-sim)是前置條件。

重點整理

Tokenomics:軟體堆疊為什麼變成瓶頸(約 00:48:03–00:49:30)

Tushar Krishna 開場先自嘲:「現在是 1:45,官方上這個 session 已經該結束了,但我身為教授的超能力就是能在 5 分鐘內衝完任意數量的投影片。」

他的框架是 tokenomics 的新時代(約 00:48:35):我們把 AI 工作流餵進 AI 系統,產出的是 token。於是大家開始在意 tokens per second、tokens per watt、tokens per dollar。在這個生態裡,一端是工作流、另一端是硬體,而夾在中間的軟體堆疊,對 token efficiency 變得極其關鍵

問題是,今天在外面跑的那些推論服務堆疊,基本上都是為 chatbot 時代打造的(約 00:49:02),特徵很一致:

  • 通常一次只跑一個模型;
  • 針對靜態執行路徑做最佳化;
  • 假設每個請求彼此獨立;
  • 大量 kernel 層最佳化;
  • 硬體基本上是同質的(絕大多數是 GPU)。

Agent 改變了什麼:兩個不可逆的趨勢(約 00:49:30–00:50:30)

  1. Dynamism(約 00:49:33):多個模型、tool call、動態波動的需求、互相依賴的任務,以及大量工作流層級的最佳化機會。
  2. Heterogeneity(約 00:49:49):他特別點名前面幾位講者也談得很好——現在已經大量使用 CPU 處理任何非 LLM 的部分,除此之外還有各式各樣為任務不同段落而特化、最佳化的硬體。

再加上一個放大係數(約 00:50:11):他引用前一天 Google 的一場演講,agentic 工作流的運算量比非 agentic 工作流高出 10 到 100 倍。所以中間那層軟體堆疊只會更加關鍵

兆級的選擇空間,以及「量不到就優化不了」(約 00:50:30–00:52:30)

把整件事拆開看:從 workload 一路往下到 model layer、software、hardware,每一層都有大量的選擇與最佳化機會。抽象之後,一端是 end-to-end 的 SLO(agent 應用在意什麼就是什麼),另一端是資料中心高效運作所需的 infra 層目標

於是你面對的是:跨層相依的空間、兆級的選擇、多樣的 SLO、以及快速演化中的元件(約 00:51:00)。他的判斷很直接——在這種條件下選錯幾乎是必然的,選錯的機率非常高,而選錯的代價更高。

那要怎麼在這麼複雜的生態裡榨出 token efficiency?他引用那句名言:「you can't optimize what you cannot measure」(約 00:51:22)。過去多年,他與學術界和產業界密切合作,把 AI 系統從硬體到軟體到工作負載的端到端堆疊摸清楚;也與 benchmark 與標準化組織合作制定 API,讓各種 benchmark 與工具可以互換使用,並因此獲得廣泛採用。他特別點名兩個成果:

  • Chakra(約 00:51:51):與 MLCommons 一起啟動的計畫,幾週前剛在 MLSys 發表——這是一套針對分散式 AI 平台的 benchmark 方法論
  • ASTRA-sim(約 00:52:02):研究分散式 AI 網路的模擬平台

而從 hyperscaler、硬體廠商、OEM 到測試廠商,一路合作下來反覆浮現的同一個結論是:取得效率的唯一方法是跨全棧最佳化;只優化堆疊的一部分不會有用。

收尾:InfraVana(約 00:52:30–00:53:01)

這也帶到他個人現在最興奮的事:他們剛創立 InfraVana,做的是一個自動化、同時感知 agent 與硬體的全棧最佳化器。他說相對於目前市面上最先進的推論框架,已經看到大幅的加速,更多細節等他們走出 stealth 再說。

最後他歡迎大家在會場找他或寫信,並「正式宣布這個 session 結束」。

金句

"You can't optimize what you cannot measure."(約 00:51:22)

他整套 benchmark / 模擬工作的出發點,也是為什麼 Chakra 與 ASTRA-sim 是前置條件而不是副產品。

"It's kind of almost inevitable that you would go wrong when you pick something, and the chances of going wrong are actually very high and the cost of going wrong is even higher."(約 00:51:05)

兆級選擇空間裡,「選對」不是靠經驗,而必須靠系統化的搜尋與量測。

"The only way to get efficiency is optimizing across the stack — optimizing just parts of the stack will not work."(約 00:52:15)

從 hyperscaler 到 OEM 一致回饋的結論,也是 InfraVana 的立論基礎。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Chakra (MLCommons) 分散式 AI 平台的 benchmark 方法論,以標準化 execution trace 為核心 Benchmarking methodology for distributed AI platforms, built on standardized execution traces 已查證:MLCommons Chakra,2026 年 5 月 MLSys 發表(arXiv 2605.11333)
ASTRA-sim 研究分散式 AI 網路的開源模擬平台,原生支援 Chakra trace Open-source simulator for distributed AI networks, with native support for Chakra traces 已查證:Georgia Tech 主導的分散式 AI 模擬器
InfraVana 講者新創:自動化、agent 與硬體雙感知的全棧最佳化器 His new company: an automated, agent-aware and hardware-aware full-stack optimizer 演講時仍在 stealth,公開資料有限 / still in stealth, little public information
Tokenomics 用來描述「工作流進、token 出」的新時代與其指標體系 Framing for the "workflows in, tokens out" era and its metrics tokens/second、tokens/watt、tokens/dollar

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Duchar Krishna Tushar Krishna
Infana / Infraana InfraVana
tokconomics tokenomics
hetrogenity heterogeneity
Astrasim ASTRA-sim
MLS MLSys
SLOs's SLOs
cross-d dependent cross-dependent

待確認 / To Verify

  • 「agentic 工作流比非 agentic 多 10–100 倍運算量」的來源:講者說是前一天 Google 的一場演講,未指明講者或場次。/ Source for the 10–100× compute claim — he attributed it to a Google talk the previous day without naming the speaker or session.
  • 「已看到相對於 state-of-the-art 推論框架的大幅加速」未給具體數字或對照對象。/ No concrete numbers or named baselines for InfraVana's claimed speedups.
  • 演講中提到「幾週前在 MLSys 發表 Chakra」——需確認指的是 Chakra 的哪一版或哪一篇成果。/ Which Chakra release or paper the MLSys mention refers to.

GitHub 上的 Markdown 原始檔 ↗