- 论文链接:https://arxiv.org/abs/2608.26374
- 代码:原文未提供开源 URL
- 发表时间:2026 年 8 月 26 日(arXiv:2608.26374v1)
- 机构:华为诺亚方舟实验室蒙特利尔研究中心(三位共同一作,纯企业研究)
一、论文背景
掩码扩散语言模型(Masked Diffusion Language Model,DLM)是自回归 LLM 之外的一条生成路线:模型在一个全 [MASK] 的画布上迭代去噪,每步按预测分布更新若干掩码位,逐步把掩码变成文本。与自回归的从左到右分解不同,DLM 支持任意顺序生成与并行细化,LLaDA、Dream 等大规模模型已展示出可观的竞争力。
但去噪式生成给解码成本带来了一个自回归模型没有的问题:画布有多长,就得精修多长。标准解码通常遵循 any-order autoregressive(AOAR)模式:选一个任务无关的最大长度 Lmax(两个模型的原始评估统一用 Lmax=1024),按固定去噪调度跑到所有掩码被填满或步数预算耗尽。问题在于很多 prompt 真正需要的 token 数远小于 1024——一道简单算术题可能只写 200 个 token,但解码器仍要在 824 个多余位置上做完整的去噪调度。论文点破了一个容易被忽视的事实:DLM 推理开销的主要来源不是去噪规则本身,而是保守的全局长度预算与实例真实长度之间的错配。
与自回归模型"生成到 [EOS] 自然停止"不同,DLM 的画布长度在开始前就要定死,所以长度选择是 DLM 特有的、绕不开的问题。本文聚焦于此:对给定 prompt,应该生成多少个新 token?
作者的答案出人意料地优雅:这个问题在数学上就是生存分析(survival analysis)——医学统计里研究"病人何时死亡"的经典框架。序列在每个位置要么"存活"(还没结束)要么"事件发生"(在此处出现 [EOS]),逐位置问"还没结束的条件下,此刻结束的概率是多少",正是离散时间危险率(hazard)的定义。
二、论文定位和关联工作
本文属于 DLM 推理时效率优化方向,免训练、即插即用。Related Work 把邻近工作切成三块,定位清晰:
扩散语言模型主线。从 Austin 等(2021)的离散状态空间结构化去噪,到 LLaDA、Dream 等迭代去掩码的大模型。这条线主要关注生成质量与规模扩展,“长度预测与免训练解码策略"长期缺位,典型解码器仍假设保守的固定最大长度与固定精修步数。
DLM 长度控制。最接近的是 DAEDAL(Li 等,2026):从短画布出发反复扩长度重跑模型,用尾部窗口的平均 [EOS] 置信度加手工阈值判断当前长度是否够用——本质是对候选长度的迭代搜索,需要多次额外前向;且其停止规则依赖 [EOS] 能被足够早地推成 argmax,这在 base 模型上往往不成立,只适用于 instruct 模型。本文改为在长画布上一次前向、软 [EOS] 概率、闭式期望,base/instruct 通用,无长度循环、无逐任务阈值。另一线 Prophet 研究"答案早收敛”:模型常在最后精修步之前就内部确定答案,用 top-2 候选差距决定何时一次性提交剩余 token——它解决的是固定画布上"何时停止精修",与本文"序列本身该多长"正交可叠加。
去掩码调度与架构加速。EB-Sampler、SlowFast 等自适应调度器改变"每步精修哪些 token",dLLM-cache、Fast-dLLM 做缓存与并行化解码。这些方法都作用于固定长度画布,与本文正交;原则上都能与长度预测器组合进一步提速。
三、问题定义
形式化:初始序列 x⁽⁰⁾ = [x₁:P, [MASK], …, [MASK]],prompt 占前 P 位,后 T 个掩码位是生成区。每步去噪 s,模型输出 logits z⁽ˢ⁾ = f_θ(x⁽ˢ⁾, t_s),逐位置 softmax 得 p⁽ˢ⁾_{i,v}。
问题:在开始完整解码之前,无训练地估计该样本的理想生成长度 L(1 ≤ L ≤ T),并把它用作解码预算,使得(1)任务精度相对用足够大 Lmax 的基线无统计显著变化;(2)解码时间(秒/样本)显著下降。
约束条件决定了解法形态:不修改模型参数、不改去噪调度、不引入任何训练,只能利用模型本身已有的输出信号。可用信息只有一次前向传播得到的 [EOS] 概率序列——这也是论文的核心赌注:初始步 logits 的文本质量虽然极差,但其 [EOS] 概率已包含足够的长度信息。
四、问题解法
方法四步(算法 1):
第一步:单次前向取危险率。 对长掩码画布跑一次模型(初始扩散时间),取候选生成位 t = P+1, …, P+T 的 [EOS] 概率 p_t = softmax(z⁽⁰⁾t)[[EOS]]。把相对位置 k 的危险率定义为 h_k = P(L=k | L≥k, prompt),假设模型训练充分、拟合数据分布,则可插件式估计 **h_k ≈ p{P+k}**。
第二步:均场近似构生存曲线。 借用变分推断中的均场式假设:给定 prompt 后各位置的 [EOS] 事件条件独立。于是存活到第 k 步的概率为连乘 S(k) = ∏ᵢ₌₁ᵏ(1−hᵢ),S(0)=1;恰在第 k 位终止的概率 π_k = P(L=k) ≈ h_k·S(k−1)。这一步把逐位置的边际 [EOS] 概率"编织"成一条完整的长度分布曲线。
第三步:恒等式闭式求期望。 期望长度 E[L] = Σ k·π_k = Σ_{k=1}^{T} S(k−1)——期望等于生存概率之和,这是生存分析的标准恒等式(附录 A 给出三行证明:把整数 k 写成 k 个 1 求和、交换求和次序,内和恰为尾概率 P(L≥j)=S(j−1))。至此,长度预测被压缩成一次前向 + O(T) 次乘加,零参数零训练。
第四步:截断-裁剪-取整。 截断期望 ŜL 限制在 [1, T] 内并四舍五入得整数 L̂,作为该样本的最大新 token 数交给标准解码器。
值得注意的是方法的自洽性:它完全不动解码规则,只是把 Lmax 从全局常数换成逐样本的 L̂;若预测偏长,退化为小号的保守预算(仍正确),若偏短则可能截断(精度损失风险由实验回答)。
五、评估指标与实验证据
设置:LLaDA-8B-Base 与 Dream-7B-Base(训练方式显著不同的两个模型),BBH/GSM8K/MATH/HumanEval/MBPP 五个推理与代码基准,标准 LM Evaluation Harness 协议(BBH 3-shot、GSM8K 5-shot strict match、MATH 4-shot、HumanEval 0-shot pass@1、MBPP 3-shot pass@1),单加速器、batch 1。指标:解码秒/样本与任务精度(含标准差)。
主结果一:Base 模型解码加速(表 1)
| 任务 | LLaDA 基线 | LLaDA 本文(加速比) | Dream 基线 | Dream 本文(加速比) |
|---|---|---|---|---|
| BBH | 73 s | 14 s(5.2×) | 56.3 s | 10.5 s(5.4×) |
| GSM8K | 91 s | 16 s(5.2×) | 81.4 s | 12.3 s(6.6×) |
| MATH | 76 s | 23 s(3.3×) | 64.5 s | 16.1 s(4.0×) |
| HumanEval | 54 s | 9 s(6.0×) | 53.0 s | 16.6 s(3.2×) |
| MBPP | 80 s | 26 s(3.1×) | 64.8 s | 16.6 s(3.9×) |
两个训练方式迥异的模型上加速比区间一致(3.1-6.6×),说明收益来自通用机制而非特定模型的小技巧。
主结果二:精度不变(表 2) 全部 10 个(模型×任务)配置中,加长度预测前后的精度差异全部落在标准差内:如 LLaDA GSM8K 69.9±1.3 → 70.0±1.3、BBH 49.5±0.6 → 51.8±0.6(反而微升)、MATH 31.6±0.6 → 31.0±0.6;Dream 各项同样持平。即"裁掉尾部冗余精修步"没有付出可测的质量代价。
消融一:固定均值长度(表 3,回答"是不是只要短就行") 若把逐样本预测换成数据集级固定长度 L̄(即所有样本用均值预算),多数任务掉分:BBH 上 LLaDA −3.2±0.7、Dream −2.7±0.6,GSM8K −2.8/−2.6。原因是预测长度的样本方差极大——BBH 上 LLaDA 为 537±204 token(变异系数约 38%)、Dream 482±176;即便精心筛选的标准基准内部长度差异也很大。长答案样本被均值截断即掉分,证明逐样本自适应是必要的。
消融二:与 DAEDAL 对比(instruct 模型,表 4-5) 在 DAEDAL 可用的 instruct 模型上:LLaDA-Instruct GSM8K 本文 28 s(3.2×)vs DAEDAL 41 s(1.8×);Dream-Instruct GSM8K 本文 11 s(7.3×)vs DAEDAL 22 s(3.6×);8 个配置中本文加速比全面占优(3.4-7.3× vs 1.1-3.6×),精度两者都不降。且 base 模型上 DAEDAL 因 [EOS] 早期不能成为 argmax 而不可用,本文用软概率对 base/instruct 通用。
消融三:预测器步数漂移(表 6,回答"初始步信息够吗") 用第 2/5/7/10 去噪步重算期望长度,与第 0 步估计的偏差很小:BBH 第 2 步仅 0.5±2.3 token,GSM8K 各步 3.8-4.2±4.2-6.3,最大漂移约 ±10 token 以内。终止信号在早期解码中不发生实质漂移,单次估计即可靠——这是"初始 logits 虽烂但长度信息已就位"这一核心赌注的直接验证。
六、效果优势的根源解释
因果链:方法差异(逐样本生存长度预测 vs 全局固定 Lmax)→ 机制变化(画布长度贴合实例真实长度,冗余精修步被裁掉,FLOPs 随画布长度近似线性下降)→ 指标提升(3.1-7.3× 加速,精度不动)。
更细的三层机制拆解:
- 开销错配是根源。 固定 Lmax=1024 下,解码器对每个样本都执行完整去噪调度,而真实长度(如 GSM8K 均值约 278 token)远小于 1024;被浪费的精修步集中在真实结束位置之后的画布尾部。本文不加速任何一步,只是让画布不再冗余——这类"砍掉不该做的事"的优化天然没有质量代价。
- [EOS] 概率在第一步就携带长度信号。 这看似反直觉(一步去噪后的文本质量极差),但有双重证据:一是表 6 的漂移分析,第 2 步与第 0 步的长度估计几乎相同;二是生存框架把它解释为:模型拟合数据分布后,p_{P+k} 就是条件终止概率的合理估计,“文本还没写好"与"模型已知道大概写到哪"并不矛盾——长度是比内容更粗粒度的统计量。
- 生存恒等式把逐位置信号变成可用决策。 逐位置的 [EOS] 概率单独看都不可靠(均场近似的独立性假设在自然语言上当然不严格成立),但连乘成生存曲线再求和取期望,相当于对整条长度分布做了均值化——个别位置的估计噪声在求和中被平均掉,最终 L̂ 只需准确到"不截断长样本、不显著虚增短样本"的区间即可。固定均值消融反向印证:把分布信息压缩成单个常数(L̄)就掉 2-3 分,说明方差结构本身承载着精度。
对 DAEDAL 的优势同样来自机制差异:迭代扩长度必然多次付费前向,且阈值规则依赖 argmax 级的 [EOS] 信号(只有 instruct 模型满足);本文把"搜索长度"变成"解析地读出长度”,一次前向、软概率、base 模型通用——快是结构性的,不是工程调优的。
局限(作者自述):只在两个模型、五个基准上验证,未覆盖超长上下文生成与多轮对话;目标严格限定为推理效率,未触及校准、鲁棒性等输出性质。
七、必要知识反推
要吃透这篇论文(它本身很短,但背后知识可以挖深):
- 掩码扩散语言模型基础:离散扩散的加噪/去噪过程、[MASK] 画布、AOAR 解码范式、MaskGIT 式置信度去掩码调度——理解"画布长度=计算预算"这一 DLM 特有耦合的来源。
- 生存分析入门:事件时间、危险率 h(t)=P(T=t|T≥t)、生存函数 S(t)、π_k = h_k·S(k−1) 的离散时间关系链——这套语言在医学、可靠性工程、客户流失分析中通用,是本文全部数学的工具箱。
- 期望-生存求和恒等式:E[L] = Σ S(k−1)。附录 A 的证明值得亲手推一遍,它是"从分布到决策量"的桥梁。
- 均场近似:把联合分布拆成条件独立边际的经典变分手段;需要理解它是近似、以及为什么在"求和取期望"的用法下近似误差被容忍。
- 插件式估计思想:不重训任何东西,直接把模型已有输出([EOS] logits)当作统计量的估计——与 LLM 复杂度估计、序列级不确定性估计中"用模型自身概率当测量仪"一脉相承。
- DLM 加速生态版图:DAEDAL(长度)、Prophet(早收敛提交)、EB-Sampler/SlowFast(调度)、dLLM-cache/Fast-dLLM(缓存/并行)——知道每个方法省的是哪一段开销,才能组合叠加。
八、通用性灵感
- 换数学框架可以变搜索为解析。 DAEDAL 用迭代搜索找长度,本文用生存恒等式直接算出来。当一个工程问题被反复迭代求解时,值得问一句:它是否是某个经典数学结构的化身?“何时结束"类问题(对话轮数、迭代深度、循环次数)都可以试试生存分析。
- 坏输出里可能藏着好信号。 一步去噪的文本不堪入用,但其 [EOS] 概率已能定长度。评估中间信号时别只看下游质量,要问"这个信号对哪个统计量已经足够”——粗粒度问题(长度、难度、主题)往往比细粒度问题(内容)更早可测。
- 预算自适应是免费的午餐区。 全局保守预算是系统里最隐蔽的浪费:每个实例的真实需求差异巨大(BBH 上 537±204),把常数换成逐实例估计,收益直接且通常无副作用。推理系统里的 max_tokens、检索条数、工具调用次数都值得照此审视。
- 聚合可以吸收估计噪声。 均场独立性假设并不真,但"连乘成曲线、求和取期望"的聚合让最终决策对局部误差鲁棒。做不确定性估计时,优先寻找这类天然的平均化结构,而不是执着于逐点精确。
- 免训练方法优先搭在模型原生输出上。 本文零训练零参数,任何 DLM 都能直接插上。它与技术栈上其他加速手段(调度器、缓存)正交可叠加——设计系统优化时,正交性意味着可组合性,可组合性意味着长期价值。
- 消融要打在因果假设上。 论文用三个消融分别回答三个潜在质疑:均值消融排除"只要短就行"、步数漂移排除"初始信号不够"、DAEDAL 对比排除"迭代搜索不可替代"。这套"每个设计决策配一个反事实实验"的写法值得套用。