演講 Session 1: Foundational Capabilities

用 Diffusion LLM 重新定義 Token 效率的前沿

Aditya Grover — Co-Founder/CTO, Inception Labs

8 月 1 日(六) · Atlas Stage · 00:41:15–00:53:30 · 上午場直播

AI 的每一次大躍進都來自「把某件事平行化」——先是 GPU 平行化矩陣乘法,再是 Transformer 平行化訓練,而下一步是用 diffusion 平行化生成本身;當智慧本身已不稀缺,真正的新貨幣是 intelligence per watt。

TL;DR

  • 一條主線貫穿整個 AI 史:平行化。 90 年代末硬體能平行跑矩陣乘法 → Transformer 讓訓練能平行(擺脫 RNN / LSTM「每一塊錢算力能學多少」的瓶頸)→ diffusion 在視覺取代 GAN → 現在把同樣的想法搬到文字,平行化解碼
  • 文字難做 diffusion,是因為 diffusion 是為連續模態發明的:影像有很自然的加噪與去噪數學;文字是離散的,「什麼叫加噪、什麼叫原則性的去噪」本身就很難定義並規模化訓練。
  • Mercury 的商業意義是「速度買到什麼」:在 Artificial Analysis 的圖上,Mercury 和同量級的速度優化模型(Claude Haiku、GPT-5 mini)品質相當,但快得多;而 Mercury 2 能做 reasoning,卻仍比 GPT-4.1 這類非 reasoning 模型更快——等於可以把 reasoning 模型部署在原本只能放非 reasoning 模型的位置。

重點整理

主線:平行化是 AI 的第一性原理(約 00:42–00:44)

Grover 開場說,他要接續前面幾場演講的元素,定義他認為的「generative AI 的新基礎」:某種極快、極有效率、建立在 diffusion 之上的東西。而所有這些進展的核心,是一個信念:平行化是計算機科學的基本概念,是 AI 的基本概念,也會是指向未來的基本信念。

三個轉捩點:

  1. 1990 年代末:硬體終於能夠平行執行一個非常簡單卻基本的運算——矩陣乘法。這是今日 generative AI 世界的決定性時刻。
  2. Transformer:架構層面的平行化,讓 AI 模型能平行訓練。這讓我們從 RNN / LSTM 那個「每花一塊錢算力能學到多少」被根本卡死的世界,進入能訓練巨型語言模型的新時代。
  3. 演算法層面:視覺領域的 diffusion 取代了當時主流的 GAN,成為高效率、高保真生成影像與影片的主流做法。

而最新的一波,是把同樣的想法帶進文字。

為什麼文字很難,以及 Mercury 怎麼做(約 00:44–00:46)

  • 根本困難:diffusion 是為連續模態發明的。影像有非常自然的「加噪」概念,以及對應的、數學上有依據的原則性去噪理論。文字是離散的,這讓「什麼是好的加噪 / 去噪定義,而且能在規模上訓練」變得根本地困難。
  • Inception 的做法:不像今天幾乎所有語言模型那樣一次生成一個 token(底下那條 autoregressive 路線),而是設計出一套對文字去噪的方式:從一段完全是亂碼的東西開始,送進神經網路(架構可以是任意的,他們用 Transformer),訓練它修掉輸入裡的雜訊。這樣模型能在文字中找到結構,並在短得多的時間內生成連貫內容——因為它是平行預測所有被去噪的 token

Text diffusion 的時間線(約 00:46–00:48)

  • 2019:denoising diffusion 在影像上起飛,Midjourney 以及 Google、OpenAI 等實驗室做出大規模高品質影像生成的示範。
  • 接下來數年:整個研究社群的努力,最後在他其中一位共同創辦人的實驗室做出突破——第一個在文字上達到 GPT-2 同等水準的 diffusion 模型
  • 2024:GPT-2 早就不是語言模型的成功標準了,於是他們決定成立 Inception,把這個想法真正做到規模。
  • 幾個月後:推出 Mercury,第一個商業規模的 diffusion language model,能做程式碼編輯與生成、數學解題、常識推理等任務,而且極快。這也吸引了學界與業界許多知名人物的注意。
  • 再幾個月後:Google、Nvidia、Alibaba 等實驗室紛紛跟進推出自己的 diffusion LLM 計畫。
  • 2026 年稍早:推出第二代 Mercury 2,這一代具備 reasoning 能力。而且 diffusion 的 reasoning 看起來跟 autoregressive LLM 的 reasoning 非常不一樣

用 Artificial Analysis 的圖說話(約 00:48–00:49)

X 軸是速度(tokens per second,越右越好),Y 軸是 Artificial Analysis 定義的品質指數(涵蓋一系列 agentic benchmark)。比較對象是各家實驗室速度優化區間的 SOTA 模型——Claude Haiku 系列、GPT-5 mini 這類。

結論:Mercury 在同量級模型中拿到相當的品質,但快得多,因為它是平行去噪 token,徹底脫離逐字生成的典範。

三個落地案例:速度到底買到什麼(約 00:49–00:53)

  • 語音 / 客服 agent:你在意的不只是智慧,還有回應時間——尤其 time to first token 對客服語音應用極度關鍵。Mercury 定義了一條不同的前沿:在極短的 first-token 延遲下拿到很好的智慧。更關鍵的是,Mercury 2 能做 reasoning,卻仍比目前多數語音公司在生產環境用的 GPT-4.1(非 reasoning 模型)更快——「這就是速度買到的東西:你可以把 reasoning 模型部署在原本只放得下非 reasoning 模型的地方。」
  • 硬體註腳:他們所有部署都在 Nvidia 硬體上,速度優勢純粹來自 diffusion 與平行生成。因此像 Cerebras、Groq 這類新硬體的加速效果,理論上可以與 text diffusion 疊加
  • 搜尋:除了速度還在意成本;他展示準確率對速度、準確率對成本兩張圖,結論同樣是「能真正上生產的模型必須在三者間取得好的組合」,而 Mercury 在這個空間也取得很好的平衡。
  • Coding:「我已經無法想像沒有 coding agent 的生活。」但主 agent 往往極度囉唆、吃掉大量 token,而那並不總是你需要的。要把 token 經濟壓到可持續,Augment Code 這類公司把 Mercury 與 Opus 這種重量級模型搭配使用,取得延遲與成本的良好平衡。

結語:新的貨幣是 intelligence per watt(約 00:53)

「如果你看智慧的前沿,我們已經到了一個對很多應用來說智慧夠好的階段。現在真正重要的,是當我們替周遭所有人創造價值時,要開始思考一種新的貨幣:intelligence per watt。而 diffusion LLM 看起來是重新定義那條前沿的一個很好的賭注。」

金句

"Parallelization is a fundamental concept for computer science, fundamental concept for AI, and a fundamental belief that will also guide towards the future."(約 00:42)

整場的主軸,也是他把 GPU、Transformer、diffusion 串成一條線的方式。

"Mercury 2 can do reasoning and still be faster than a GPT [4.1] model. So that's what speed buys you — you can actually deploy reasoning models at the speed of, or even better than, non-reasoning models."(約 00:51)

這句話最精準地說明了「快」的商業價值:不是省時間,是解鎖原本放不進去的能力。

"The new currency of intelligence per watt — and diffusion LLMs seem like a really good bet to redefining that frontier."(約 00:53)

收尾金句。

提到的專案與資源 / Projects & Resources

名稱 Name 說明 Description 備註 Notes
Mercury 第一個商業規模的 diffusion language model The first commercial-scale diffusion language model Inception Labs;arXiv 2506.17298
Mercury 2 第二代,加入 reasoning 能力;仍比非 reasoning 模型快 Second generation, adds reasoning while staying faster than non-reasoning models 2026 年稍早推出 / launched earlier in 2026
Artificial Analysis 提供速度 vs. 品質指數比較圖的第三方評測機構 Third-party benchmark source for the speed-vs-quality chart 品質指數涵蓋多項 agentic benchmark
Augment Code 把 Mercury 與 Opus 等重量級模型搭配使用的 coding agent 公司 Coding-agent company pairing Mercury with heavyweight models like Opus 用於降低延遲與成本
Cerebras / Groq 講者提到可與 text diffusion 疊加的加速硬體 Accelerator hardware he suggests could stack with text diffusion Inception 自身部署全在 Nvidia 硬體上
GPT-4.1 / GPT-5 mini / Claude Haiku 速度優化區間的對照模型 Comparison models in the speed-optimized regime

逐字稿勘誤 / Transcript Corrections

字幕原文 Heard as 應為 Should be
Adit Grover / Adita Aditya Grover
the fusion LLMs / diffusion LMS diffusion LLMs
auto reggressive autoregressive
den noiseise / dnoising / D noiseis denoise / denoising
GPD 2 / GPD 5 minis / GPD 4.1 GPT-2 / GPT-5 mini / GPT-4.1
claude haikus Claude Haiku
Grock Groq
quality index by artificial analysis Artificial Analysis quality index
augment code Augment Code
zero(句尾) (自動字幕雜訊,非內容)/ caption noise, not content

待確認 / To Verify

  • 「2019 年 denoising diffusion 起飛,像 Midjourney 這樣的公司…」——Midjourney 成立於 2021,講者的時間點與公司舉例可能是口誤或簡化,需對照投影片。/ He dated denoising diffusion's takeoff to 2019 and cited Midjourney, which was founded in 2021 — likely a simplification; check the slide.
  • 「其中一位共同創辦人的實驗室做出與 GPT-2 同等水準的文字 diffusion 模型」——他未點名是哪位共同創辦人與哪篇論文(Inception 共同創辦人為 Stefano Ermon、Aditya Grover、Volodymyr Kuleshov)。/ He didn't name which co-founder's lab or which paper achieved GPT-2 parity.
  • Artificial Analysis 圖表的擷取日期與模型版本未標示。/ The snapshot date and model versions behind the Artificial Analysis chart weren't stated.
  • Augment Code 案例中「Opus」的具體版本未說明。/ The specific Opus version in the Augment Code case study wasn't stated.

GitHub 上的 Markdown 原始檔 ↗