论文链接:Unlocking Lossless Speedups in LLMs via Discrete Diffusion 发表时间:2026年9月3日(arXiv:2609.04010,HF Daily Papers 当日第一,112 赞;代码与 checkpoint 已开源) 机构:MBZUAI 基础模型研究院 + Cerebras Systems + UIUC + Cornell Tech + Harvard(企业+高校合作) 领域标签:cs.LG / LLM 推理加速 / 离散扩散 / 投机解码
一、论文背景
LLM 的能力来自下一个词预测(NTP),但自回归结构决定了每步只能生成一个 token。随着推理链越来越长(智能体工作流、RL rollout),顺序解码成为时延与成本的主要瓶颈。解码过程通常是访存受限(memory-bound)的——权重和 KV 状态的搬运限制了速度,GPU 并行算力大量闲置。
现有三条加速路线各有硬伤:
- 投机解码(speculative decoding,EAGLE-3/DFlash):无损,但需要单独训练、维护一个 draft 模型;且在大 batch 下系统变成计算受限,验证开销吃掉收益——加速消失。draft 与 verify 还要维护两套 KV cache,峰值内存更高。
- 扩散语言模型(d-LLM,DiffusionGemma/Mercury 2 等):原生并行生成,但有损——相对同规模 AR 模型质量有差距;更致命的是大 batch 下加速同样消失(论文引用证据:两个开源 d-LLM 在大 batch 下比各自的基座 AR 还慢)。
- 多 token 预测(MTP,Medusa 类):要改架构加预测头,且实测慢于好的投机解码。
一个常被忽略的评测陷阱:以往论文喜欢在"batch=1"下报告 d-LLM 加速。但智能体负载(并行 agent、分支轨迹、工具调用重试)天然产生并发请求,batch=1 的延迟优势掩盖了大 batch 下的坍缩。实用的加速必须在真实 batch 下评测——这是本文立论的出发点。
二、论文定位和关联工作
| 谱系 | 代表 | 局限 | 与 Uno 的关系 |
|---|---|---|---|
| 投机解码 | EAGLE-3(0.40B AR drafter)、DFlash(1.05B 扩散 drafter) | 独立 draft 模型、双 KV cache、大 batch 收益缩水 | Uno 免独立 draft、单 KV cache、全 batch 区间严格更快 |
| 自投机/混合 | TiDAR、Sahoo et al. 2025 | 修改基座权重 → 有损;加速限于小 batch | Uno 冻结 AR 权重,分布严格不变 |
| 扩散 LLM | DiffusionGemma-26B、Nemotron-Labs-Diffusion-14B、Mercury 2 | 有损 + 大 batch 加速消失 | Uno 继承 AR 质量,加速无损 |
| MTP | Medusa、Gloeckle et al. | 改架构、实测慢于投机解码 | 正交,可组合(作者留作未来工作) |
| 并发工作 | OPDLM、FLARE、I-DLM | 微调基座权重 → 有损 | Uno 保持无损并实测更快的 TPF |
定位结论:Uno 是第一个同时做到「无损 + 全 batch 区间加速 + 无独立 draft 模型 + 可 drop-in 到现有开源权重 LLM」的方法,填补了投机解码与扩散 LLM 之间的空白地带。
三、问题定义
具体问题:给定一个训练好的 AR 模型,如何让它在输出分布严格不变的前提下,每步并行生成多个 token,且加速在从 batch=1 到最大可容纳 batch 的全区间保持?
抽象化:学习一个与 AR 分布 p_θAR 耦合的并行草稿分布 p_draft,使得拒绝采样验证后保留的期望接受前缀长度最大化,同时草稿与验证的额外算力开销最小化。
形式化要点:
- 输出分布必须等于 p_θAR(lossless 的严格定义);
- 每迭代两次前向(draft + verify),TPF(tokens-per-forward)上界为 (B+1)/2;
- 约束:不新增独立 draft 模型、共享 KV cache、适配器参数量远小于 draft 模型。
四、问题解法
4.1 参数解耦:AR 通路 + 扩散通路
每个 Transformer 层的每个权重矩阵都配一个 rank-128 LoRA 适配器(α=256),即扩散权重 θ_Δ。两条通路:
- 验证通路:θ_AR(原始 NTP 权重,训练全程冻结)——决定输出质量与分布;
- 草稿通路:θ_AR + θ_Δ ——只在噪声位置启用适配器(gated LoRA:干净 token 位置关闭适配器),单次前向同时得到教师 logits(干净区)与学生 logits(噪声区)。
LoRA 耦合是关键设计:草稿分布与验证分布共享全部基座参数,天然贴近——这直接决定拒绝采样接受率;相比 DFlash 的 1.05B 独立 drafter,Uno 只加 0.35B 参数。
4.2 Diffusion Distillation(扩散蒸馏阶段)
冻结 θ_AR,只在 7B token 上训练 θ_Δ(不到 AR 预训练 23T token 的万分之三!),损失为两项:
- L_DCD(块级单步一致性蒸馏):把多步去噪轨迹压缩成单步——从全噪声块 z1 直接映射到干净块 x(b),KL 蒸馏到 θ_AR 在相同上下文下的 AR 分布;块因果注意力掩码让干净前文 x(<b) 对噪声块可见;
- L_TV(全变差损失):最小化草稿与验证分布的逐位置 TV 距离——按 Leviathan et al. 的推论,这直接提升连续 token 被接受的期望长度(接受率就是加速)。
消融发现:L_TV 单独训练 TPF 2.39,L_DCD+L_TV 2.23——把 L_DCD 权重降到 0.01 后达 2.40。接受长度主要靠 TV 损失驱动,蒸馏损失只做正则。
4.3 Ψ-Spec 采样器
- Linear 采样器(系统吞吐最优):每位置从边际分布直接采一个候选序列,B=4 时大 batch 下吞吐最高;
- Tree 采样器(单请求最优):小 batch 下有闲置算力,每位置采 top-K、按 log-prob 剪枝保留 top-V 条前缀,树注意力并行验证;(B,K,V)=(16,32,32);
- 无损保证:第一个 token 直接从 θ_AR 采样(必然接受),后续 token 经标准拒绝采样修正——输出分布严格等于 AR 模型;
- 额外红利:TPF 下界为 1——即使草稿全被拒,每迭代仍产出 2 token(首 token + 替换 token);
- 推理时扩展新轴:增加去噪步数 T 可以在固定上下文长度下提升草稿质量(常规 test-time scaling 要拉长思维链)。
4.4 两种训练体制
- 仅加速推理:任意开源权重 LLM + 蒸馏出适配器即可(UnoQwen:Qwen3-8B 基座 + OpenThoughts3 数据 14.7B token 训练,4 节点×8 H200×32 小时);
- 加速 RL 训练:SFT 后、RL 前做蒸馏,适配器在 RL rollout 时加速采样;RL 只更新 θ_AR。实验发现:RL 之后适配器仍保留加速(TPF 仅降 6%)——AR 权重漂移没有破坏草稿-验证耦合,这是一个令人惊讶的鲁棒性结果。
五、评估指标与实验证据
评测协议创新:1K/8K 吞吐测试(固定 1024 输入 + 8192 输出),并约束各方法在相同平均 TPF 下运行——排除"生成更短思维链虚高吞吐"的干扰。这本身是对领域评测实践的方法论纠偏。
自研 8B Uno(23T token 从零训练):
| 指标 | 数值 | 对比 |
|---|---|---|
| 最大加速 | 3×(batch=1, Tree) | — |
| 最大 batch(64)加速 | 1.5× | 基座 AR 能容纳的最大 batch |
| SWE-bench Verified | 68.4% | DiffusionGemma 18.7%、Nemotron-Labs-Diff 0.8% |
| τ²-Telecom / Terminal-Bench v2.1 / AA-LCR | 90.1 / 39.6 / 68.0 | DiffusionGemma 68.1 / 14.7 / 19.7 |
| 系统吞吐 | 5255 toks/s | Mercury 2(闭源,Blackwell 硬件)报告 1197,约 4.6× |
UnoQwen(Qwen3-8B 增强,开源可复现):
| 指标 | UnoQwen | EAGLE-3 | DFlash |
|---|---|---|---|
| 平均接受长度 τ(系统最优) | 3.89 | 2.08 | 2.07 |
| 系统吞吐(toks/s) | 5733 | 4944 | 5351 |
| 单请求吞吐(toks/s) | 445(2.5×) | 284 | 370 |
| 峰值内存(GiB) | 122.2 | 130.0 | 130.1 |
| 额外参数 | 0.35B | 0.40B | 1.05B |
与有损方法对比(表 3):AIME-24 上 UnoQwen 76.7%(TPF 4.01)vs SDAR 10.0%、Fast-dLLM v2 63.3%、LLaDA2.1-Flash 63.3%——有损方法在数学上崩得最惨。
指标如何证明论点:① 全 batch 区间 Pareto 占优(图 2)直接回应"大 batch 加速消失"的行业痛点;② 质量表覆盖智能体(τ²、Terminal-Bench、SWE-bench)+ 数学 + 代码 + 长上下文四类,证明加速不牺牲智能体能力(恰恰是 d-LLM 最弱的区域);③ 40% RL 端到端训练加速 + RL 后加速保持,把方法价值从推理延伸到训练。
六、效果优势的根源解释
投机解码为什么在大 batch 输:大 batch 下推理从访存受限转为计算受限,验证更多候选的算力机会成本飙升;且独立 drafter 的分布与验证器耦合弱(接受率低)、双 KV cache 推高内存。Uno 的 LoRA 耦合让草稿分布天然贴近验证分布(τ=3.89 vs EAGLE-3 的 2.08——接受长度几乎翻倍),单 KV cache + 0.35B 参数把验证的边际成本压到最低。
d-LLM 为什么质量差:有损的根源是 AR→扩散微调修改了基座权重,输出分布整个换掉;且扩散模型对思维链式长推理的支持弱(SWE-bench 18.7% 的断崖)。Uno 把质量天花板钉死在原 AR 模型上——扩散通路只负责"猜下一块",猜错了有 AR 验证兜底。
RL 后加速保持的机理:适配器学到的是"在 θ_AR 附近的多 token 修正场"而非特定任务分布;RL 更新θ_AR 后,虽然接受率略降(-6%),但 LoRA 的低秩结构保证了草稿分布仍在验证分布的邻域内。
反事实:换成独立全参数 drafter(DFlash 路线)——接受长度不升反降且参数×3、内存更高;换成微调基座(有损路线)——智能体基准崩塌,RL 管线还要为扩散 rollout 重写算法。
七、必要知识反推
领域知识层:
- 自回归分解与投机解码的拒绝采样修正(Leviathan et al. 框架:TV 距离与接受率的关系);
- 离散扩散的插值前向过程、均匀态 vs 掩码扩散的取舍(Uno 选均匀态:原生自校正、少步生成、更好的推理时扩展);
- 访存受限 vs 计算受限下并行策略的边界。
方法论知识层:
- 参数解耦(质量通路/速度通路)作为架构设计模式——训练管线完全复用现有 NTP 资产;
- 一致性蒸馏的多步→单步压缩 + 任务对齐损失(TV)的组合配方;
- gated LoRA 单次前向实现"同一模型两个视图"(教师/学生、干净/噪声位置分别路由)。
工程知识层:
- 树注意力 + 候选剪枝的并行验证实现;
- Nano-vLLM/SGLang 的采样器集成;
- 吞吐评测协议的标准化(固定输入输出长度 + 等效 TPF 约束)。
八、论文中可以提取的通用性灵感
“冻结质量、旁路加速"的解耦模式
- 核心思想:当系统需要在不破坏已有能力的前提下提速,把质量关键参数冻结,用低秩旁路承载加速逻辑,靠耦合结构保证一致性。
- 推广场景:Agent harness 优化(冻结主策略、旁路学习快速草稿路径)、编译器优化(语义保持的快速路径)、记忆系统(冻结检索质量、加速召回通路)。
接受率是被优化对象,不是副产品
- 核心思想:任何"提案-验证"系统里,直接优化提案与验证器的分布距离(TV)比优化提案质量(KL)更直接决定吞吐。
- 推广场景:多 Agent 协作中的提议-审核机制设计、代码评审 Agent 的补丁预筛、数据流水线的预过滤。
评测协议即方法论贡献
- 核心思想:领域通行评测(batch=1 报告)可能系统性误导设计决策;提出反映真实负载(并发)的协议本身就是贡献。
- 推广场景:Agent 评测的并发压力测试、长时程任务的成本归一化报告。
训练成本的非对称预算
- 核心思想:23T token 学质量、7B token 学速度——当加速模块与质量模块解耦后,后者可以用极小预算完成,且对数据分布不敏感(OpenThoughts 训练的适配器在通用基准上同样有效)。
- 推广场景:技能库的廉价学习(SkillOpt 方向:技能适配器的小数据快速习得)、领域适配的预算分配。