论文链接:DiffusionGemma Technical Report 发表时间:2026年8月 机构:DiffusionGemma Team(Google,含 Bobak Shahriari 等) 领域标签:LLM 架构 / 离散扩散 / 高效推理

一、论文背景:AR LLM 的顺序瓶颈

什么是自回归(AR)LLM? 当前主流 LLM(GPT、Gemini、Llama、Qwen 等)都基于自回归——生成第 N 个 token 必须先生成完前 N-1 个 token,再根据前缀预测第 N 个。每生成一个 token 就要一次完整的前向传播。

AR 的瓶颈在哪? 顺序解码意味着生成速度和生成长度成正比。即便用投机解码(speculative decoding,让小模型先猜、大模型批量验证),本质还是顺序的。生成 1000 个 token 要做约 1000 次前向传播——这是 AR 架构的固有瓶颈。

什么是离散扩散模型? 扩散模型(如 Stable Diffusion)在图像领域很成功——从纯噪声开始,逐步去噪成清晰图像,每次精炼整张图。把同样的思路用到文本:从"掩码/噪声 token 块"开始,并行精炼整块 token。图像扩散一次精炼整张图,文本扩散一次精炼一整块 token。

文本扩散为什么难? 文本是离散的(token 是符号,不是连续像素),不能像图像那样直接加高斯噪声。所以需要离散扩散——用掩码/替换作为"噪声",迭代去掩码/纠错。

DiffusionGemma 的机会:如果能把一个已经很强的 AR LLM(Gemma 4)转化为离散扩散模型,就能同时获得"扩散的并行速度"+“AR 的语言能力”。

二、论文定位和关联工作

高效 LLM 推理的路线:

路线代表思路局限
投机解码Medusa/EAGLE小模型猜+大模型批量验证仍顺序,加速有限
MoE 稀疏激活Mixtral/Qwen MoE只激活部分专家解码仍顺序
连续/并行解码各种并行解码多 token 并行训练从头成本高
离散扩散 LLMSEDD/Diffusion-LM掩码+迭代去噪从头训练,能力弱
DiffusionGemmaAR→扩散微调复用 AR 能力+扩散速度—

关键区别:DiffusionGemma 不从头训练,而是用极少计算(<10% 预算)把已有 AR MoE 转化为扩散模型,既省训练成本又保留语言能力。

三、问题定义:并行精炼 vs 顺序解码

AR 生成的本质约束:生成 token $t$ 需要完整前缀 $t_{严格的时序依赖,无法并行。

扩散生成的本质解放:把生成分成块(DiffusionGemma 用 256 token 块),从"全部掩码/噪声"开始,整块并行精炼——每个位置可以同时被"去噪",因为精炼依赖的是"整块的当前状态"而非"严格的前缀"。

形式化:AR 是 $p(x_t | x_{

四、问题解法:两阶段训练

4.1 基础模型

基于 Gemma 4 MoE:3.8B 激活参数、25.2B 总参数。

4.2 阶段一:SFT 教双向去噪

AR 模型是因果的(只看左边),扩散需要双向(看整块)。SFT 用掩码语言建模目标,教模型从"部分掩码的 token 块"恢复完整块——让模型学会双向去噪能力。

4.3 阶段二:RL + 采样器蒸馏

  • RL:用任务奖励(如答案正确性)优化生成质量。
  • 采样器蒸馏:把高效采样器的行为蒸馏进模型,让模型本身更适合少步精炼。
  • 两项联合,同时提升质量和推理效率。

4.4 计算高效

整个两阶段训练用不到原 AR 模型 10% 的总训练 token 预算——这是"AR→扩散"转化的关键经济优势。

4.5 混合能力保留

  • 保留 thinking mode(推理模式)
  • 多模态输入
  • 长上下文
  • 仍能 AR 生成(仅轻微性能下降)——为混合扩散-AR 解码铺路

五、评估指标与实验证据

5.1 速度-能力新帕累托前沿

指标数值
每 forward pass 生成 token 数约 20
单张 H100 输出速度约 1500 tokens/秒
训练成本<原 AR 模型 10% token 预算

这个结果的意义:约 1500 tokens/秒显著快于即便是配了 SOTA 投机解码的 AR 模型。每 forward pass 约 20 token 意味着扩散精炼在并行性上赢了 AR 的"每 pass 1 token"。

5.2 能力保留

  • 全评估套件上保持与 AR 基线可比的能力(论文称确立速度-能力新帕累托前沿,即同等能力下更快、同等速度下更强)。
  • AR 生成能力保留(仅轻微下降)——证明扩散微调没有"摧毁"AR 能力。

5.3 实验设计的证明力

关键对比是"DiffusionGemma vs Gemma4 AR + SOTA 投机解码":两者用相同基础模型,唯一区别是生成范式。DiffusionGemma 显著更快——证明速度提升来自"扩散并行精炼"这个架构差异,而非模型规模/数据。

六、效果优势的根源解释

baseline(AR)的根本局限:AR 的 token 间严格时序依赖是数学上的——$p(x_t|x_{

DiffusionGemma 的根本性改变:它把生成从"严格时序"改成"整块并行条件"。每个 token 的精炼依赖"整块的当前状态",而非"严格前缀",所以整块可以同时更新。这是对 AR 瓶颈的架构级突破。

因果链:方法差异(AR→扩散,整块并行精炼)→ 机制变化(每 forward pass 产出 20 token 而非 1)→ 指标提升(1500 tokens/秒,新帕累托前沿)。

为什么 SFT+RL 而非从头训练? 从头训练离散扩散 LLM 需要海量计算,且语言能力弱。复用 AR 模型的语言先验,只教"双向去噪"+用 RL 补质量,是计算高效的路径(<10% 预算)。这本质上是"用少量计算迁移范式",而非"重新学语言"。

为什么保留 AR 能力重要? 这为"混合扩散-AR 解码"铺路——扩散负责快速生成主体,AR 负责需要严格时序的部分(如代码、数学)。两种范式在同一模型里共存,是未来 LLM 架构的可能方向。

七、必要知识反推

领域知识层:

  • AR LLM 的顺序解码瓶颈与投机解码的局限。
  • 离散扩散模型(掩码/替换作为噪声,迭代去噪)。

方法论知识层:

  • AR→扩散的转化——这是创造性节点:不从头训练,复用 AR 先验。
  • 双向注意力 vs 因果注意力的区别。
  • RL + 采样器蒸馏的联合优化。

工程知识层:

  • 块级(256 token)精炼的实现。
  • MoE 在扩散框架下的激活管理。

知识融合的关键节点:把"图像扩散的并行精炼"迁移到"文本生成的块级精炼",并发现"AR 模型的语言能力可以被迁移到扩散框架"——这是跨模态范式迁移的精彩案例。

八、论文中可以提取的通用性灵感

灵感一:复用强基线的先验,而非从头训练新范式

  • 核心思想:当一个新范式(扩散)在某领域(图像)证明了价值,迁移到新领域(文本)时,复用已有强模型(AR LLM)的先验比从头训练高效得多。
  • 论文证据:<10% 训练预算完成 AR→扩散转化,保留语言能力。
  • 推广场景:(1) 新架构(SSM/Mamba)从 Transformer 迁移先验;(2) 新模态(视频/3D)从图像迁移;(3) 蒸馏中的教师先验复用。

灵感二:架构瓶颈只能靠架构突破

  • 核心思想:顺序依赖是 AR 的数学瓶颈,工程优化(投机解码)只能缓解;真正的加速需要架构级改变(并行精炼)。
  • 论文证据:扩散并行精炼每 pass 20 token,远超 AR+投机解码。
  • 推广场景:(1) 任何有"顺序依赖瓶颈"的系统(编译、渲染、流水线);(2) 用并行范式替代顺序范式的通用思路。

灵感三:混合范式共存是未来方向

  • 核心思想:不同生成范式(扩散+AR)各有优势,让它们在同一模型里共存,按场景调用,可能优于"单一范式"。
  • 论文证据:DiffusionGemma 保留 AR 能力,为混合解码铺路。
  • 推广场景:(1) 混合 SSM+Attention 架构;(2) 混合规则+学习系统;(3) 混合检索+生成。

本精读基于 DiffusionGemma Technical Report 撰写,覆盖 Abstract、两阶段训练方法、速度-能力帕累托前沿结果、混合能力保留分析。