论文链接:Full-bandwidth transformer 发表时间:2026年8月(arXiv:2608.08888v1,2026年8月9日提交) 机构:Johns Hopkins University、Princeton University、Microsoft(微软 AI Frontiers 实习生工作,John Langford 指导,Xi Wang 通讯) 领域标签:cs.AI / LLM 预训练架构 / 潜推理 / 数据高效训练
一、论文背景
1.1 两条计算轴:一条是高速公路,一条是独木桥
自回归 Transformer 沿两条轴计算:水平轴(横跨生成的 token 序列)和垂直轴(纵穿模型深度)。把模型想象成一个信息处理工厂,这两条轴就是两条信息通道:
- 水平轴像广播网:生成第 t 个 token 时,第 ℓ 层的状态可以通过稠密注意力直接读到之前每个位置的缓存表示——水平方向上,每个 token 都能“听到”全部历史,带宽极宽;
- 垂直轴像只有一个对讲机的传话系统:步与步之间(上一个 token 到下一个 token),只有采样出来的那个 token 回到网络底层。模型的整个顶层隐状态是一个 D 维连续向量,承载了模型对当前位置的全部思考,但传给下一步时被压缩成一个离散符号,至多 log2|V| 比特——词表 100352 时也就约 16.6 比特。顶层隐状态本身则被直接丢弃。
1.2 被浪费的计算:“depth-frozen”的非语言化计算
一个关键观察是:非语言化的计算并没有被抹掉——中间激活仍留在 KV cache 里——但被深度冻结了:第 ℓ 层的状态只能被 ℓ 之上的层读取,永远无法回到网络底部再加工;最深的状态——顶层输出——根本不被缓存。
于是“说出来”(verbalization)成了信息重新进入网络底层、获得全新深度预算的唯一通道,代价是被挤过一个 token 的窄口。模型只有两个糟糕的选择:要么花 token 把中间状态 narrate 出来(这就是链式推理 CoT 的本质),要么在每个位置从头重新计算那个状态。
1.3 动机:当数据成为瓶颈,计算带宽是新战场
Scaling 的传统路径是更多参数+更多 token(Kaplan et al., 2020),但高质量独有数据日益成为约束。既然数据有限,能否通过给每个 token 分配更多计算来榨取更多学习信号?循环、迭代、反馈式计算是自然方向——但额外的 FLOPs 只有转化为更丰富的表示或更有效的推理时计算才有意义。本文的答案是:把垂直轴上那条被浪费的窄通道拓宽到全带宽。
二、论文定位和关联工作
拓宽“步间反馈通道”和“在潜空间推理”并非全新想法,这条线上已有多项工作,但每项都留有未越过的门槛:
| 工作 | 核心做法 | 关键局限 |
|---|---|---|
| Feedback Transformer(2020) | 先驱工作:每个位置聚合各层表示成记忆,未来位置的注意力读聚合记忆而非同层 KV | 训练必须顺序处理输入 token,不可扩展;修改注意力结构 |
| T2MLR(2026) | 把前一个位置的早中层表示注入当前位置的晚中层 | 注入点在模型内部,额外 MLP 引入约 5D² 参数 |
| Latent Recurrent Transformer(LRT,2026) | 前一位置固定源层的隐状态经额外 KV 投影注入注意力与残差流 | 层间投影引入 LD² 参数;实验只做非自由生成评测 |
| Coconut / Soft Thinking | 潜推理:用连续隐状态做推理 | 替换离散 token 或仅限后训练阶段,监督困难 |
| PonderLM-2(2025) | 预训练时交错嵌入/隐状态输入,同样用多次前向替代顺序 rollout | 输入长度(及 KV cache)翻倍,训练推理开销更大 |
| Loop Transformer 系 | 推理时重复施加整个 Transformer 栈获得有效深度 | 每个 token 的推理计算随循环步数线性增长 |
本文的差异点是三条:仅在输入侧注入(不改架构、不动注意力和 KV cache)、最少参数(两个 D×D 投影,2D² 参数)、最大规模验证(400B token 预训练,该线最大规模,且在真实推理工作负载上验证收益)。论文也坦诚:这些方法精神相似,大规模下谁优谁劣未经验证。
三、问题定义
3.1 带宽的正式刻画:可达集
论文用“可达集”给两个通道的带宽下了精确定义。计算位置 t、层 ℓ 时能读到的历史状态集合,标准解码下是:
$$R_{std}(t,\ell) = \{(t',\ell') : t' < t, \ell' < \ell\}, \quad |R_{std}| = \Theta(T\ell)$$也就是说第 ℓ 层只能读浅于自己的历史——浅层看到的是“只被部分处理过的过去”,尽管那些位置更深、处理更充分的状态早已算出来躺在缓存里。潜反馈则把可达集拓宽为:
$$R_{lf}(t,\ell) = \{(t',\ell') : t' < t, 0 \le \ell' \le L\}, \quad |R_{lf}| = \Theta(TL)$$每一层(包括最浅的第 0 层)都能读到被全部 L 层处理过的历史。从 Θ(Tℓ) 到 Θ(TL),这就是“全带宽”的含义。
3.2 两个必须澄清的“不是什么”
- 不是可变寄存器:RNN/状态空间模型每步覆写压缩状态;潜反馈形式上是循环,但过去状态持久留在 KV cache 中不被覆写,仍可被当前 token 直接读取;
- 不增加解码时的渐近深度:无论有无潜反馈,每步计算图深度都是 O(L)。改变的是通道带宽——离散语言通道与连续潜通道并行演化。
3.3 信息与计算之辨
一个精妙论证:新隐状态 z_{t+1} 是 x_{1:t+1} 的确定性函数,不携带任何上下文尚未确定的信息——增益是计算性的,不是信息性的。信息没变多,收益从哪来?从可达性来:重注入解除了公式 (2) 的深度限制,让全栈处理的摘要直达底层。“信息不变、计算可达性改变”是全文理论分析的支点。
四、问题解法
4.1 潜反馈解码:一步之差的核心机制
推理时每步把上一步的顶层隐状态与当前采样 token 的嵌入通过门控线性单元融合,作为下一步输入:
$$h_t^L = f_\theta(e_t \otimes h_{t-1}^L; C), \quad e_t \otimes h_{t-1} = W_U h_{t-1} \odot \sigma(W_G e_t)$$整个改动只有两个 D×D 矩阵。不对称设计是故意的:隐状态走 value 通路(被 W_U 变换后保留),token 只做乘性门(σ(W_G e_t) 决定放行哪些维度)。为什么不用对称的加性融合 e_t + W h_{t-1}?因为那会留一条捷径:模型可以压制状态通路、还原纯 token 输入、照样达到普通预训练损失——从标准 checkpoint 起训时尤其诱人。门控堵死了它:丢掉 h_{t-1} 等于丢掉输入本身,token 身份只存活于它施加在状态上的 D 维门控模式里。读状态从“可选”变成“强制”。
4.2 训练:多 pass 目标与“时间并行”
障碍在于训练。预训练模型从没见过输入端出现隐状态,推理时不能直接打开潜反馈;而潜反馈定义的递归在位置上是顺序的,直接训练会丢掉并行 teacher forcing——Transformer 高效训练的根基。
解法是多 pass(multi-pass)近似:pass 1 是普通无反馈前向;pass k 把 pass k-1 的隐状态右移一位、与嵌入融合、再全序列并行跑一遍栈——每个 pass 需要的状态在上个 pass 已全部完成,所以顺序性只在 k 个 pass 间支付,而非在序列长度 T 上支付。每个 pass 都施加 teacher-forced NTP 损失(λ=1,未调参),梯度不截断——后期 pass 的损失反传进早期 pass 的隐状态,充当辅助目标。这就是 temporal parallelism:每个 pass 是对潜反馈递归的一次 Jacobi 式更新,k 个 pass 训练的是 k-1 个 token 步的反馈转移。
4.3 三个让训练落地的工程决策
(1)渐进调度。反馈 pass 昂贵(k-pass batch 的成本是标准 teacher forcing 的 k 倍),所以大部分训练用单 pass 目标(可以直接从标准预训练 checkpoint 起跑),训练中段才引入双 pass,后期再混入少量三 pass。最终配比 75% 单 pass / 22% 双 pass / 3% 三 pass。
(2)3% 的第三步换来外推稳定性——最反直觉的发现。只训单+双 pass(75/25)的模型在训练深度内良好,但超出后验证损失骤增、隐状态变化量震荡不衰减——递归发散。仅加入 3% 三 pass batch,行为质变:验证损失在 30 步反馈内平坦,隐状态变化衰减到小平台——反馈映射成为向不动点收缩的压缩映射,附录中 k=1000 仍稳定。目标不是在完整推理深度上训练,而是把反馈映射训练到在自我复合下稳定。
(3)prefix mixin 弥合分布差。训练的 pass 里每个位置都被融合,但推理时序列是异质的:prompt 位置是纯嵌入(单次 prefill 处理),生成位置才是融合输入。只见过全融合序列的模型在“prompt 结束、生成开始”的边界上会遇到分布外输入。prefix mixin 在每个额外 pass 中随机采样前缀长度 p,把 t≤p 的位置还原为纯嵌入、只融合后缀——训练由此覆盖了“任意位置从纯切换到融合”的结构,恰好是单 prefill 推理的形态。
4.4 三个轻量稳定化配方
- 平稳的隐状态尺度:depth scaling 保证 ||h^L||~O(1) 而非 O(L),融合输入再过 RMSNorm——否则反馈反复施加时范数会爆;
- 权重共享:嵌入层与读出层 tie,让两类输入共享同一基底,减轻融合权重学习大旋转的负担;
- 抖动噪声:融合前给状态加 σ=0.02 均匀噪声,把反馈映射暴露在训练状态的局部邻域上,降低对微小偏差的敏感性——这类偏差在长反馈 horizon 下会累积。
4.5 三种解码模式:STANDARD / SOFT / FUSED
- STANDARD:单次 prefill + 生成时纯嵌入输入——把全带宽模型当普通 Transformer 用,衡量“训了潜反馈但推理不用”的代价;
- SOFT:单次 prefill + 生成时潜反馈(公式 3),与 STANDARD 的 prefill 成本完全相同,每 token 额外开销只有两次 D×D 矩阵乘,与上下文长度和模型深度无关,<1%;
- FUSED:在 SOFT 基础上,先把 prompt 额外跑一次融合 prefill pass(对 prompt token 并行,成本翻倍),让 prompt 状态在生成开始前先被精炼一轮。
工程兼容性:融合保持输入维度 D 不变,架构、KV cache、serving 栈全不动;vLLM 实现复用 EAGLE/MTP 的 hidden state buffer 模式(把每请求最新主干隐状态原地拷贝进固定地址缓冲区,CUDA graph 照常捕获门控)。
五、评估指标与实验证据
5.1 实验设置
1B 参数(24 层、1536 维、100352 词表、8192 上下文),Phi-4 同款数据混合,NorMuon 优化器+WSD 调度。token 等效计算 = token 数 × 平均前向次数:200B run 记 256B、400B run 记 512B。四个规模:10B(100% 三 pass)、100B(75 单/25 三)、200B 与 400B(75 单/22 双/3 三)。
5.2 主结果一:数据效率(约 2 倍)
Fused prefill 改善非生成任务。在 prompt 上追加 k 次融合 pass,验证损失与 5-shot LM Eval(10 任务)单调改善且收益前置——大部分增益在第一次融合 pass 到账,符合“全栈状态暴露给第 0 层=增加有效深度”的机制预期。关键对比:两次反馈 pass 下,100B 全带宽达到 200B 标准基线,200B 全带宽达到 400B 标准基线——约 2 倍预训练数据效率。稳健性发现:step 0(不用反馈)时全带宽模型只比标准基线差一点点验证损失,LM Eval 精度甚至已更高——训了不用,代价很小。
指令调优后仍保持优势(200B/400B 模型经过 12B token 长上下文扩展到 32K + 6B token 指令调优,无 few-shot):
| 任务 | 200B Standard | 200B Soft | 200B Fused | 400B Standard | 400B Soft | 400B Fused | 1T 标准 |
|---|---|---|---|---|---|---|---|
| GSM8K (Pass@1) | 64.52 | 67.93 | 67.55 | 67.90 | 71.00 | 71.80 | 70.13 |
| MATH-500 (Pass@1) | 43.80 | 45.60 | 45.60 | 46.00 | 45.40 | 48.40 | 47.40 |
| HumanEval (Pass@3) | 42.54 | 45.06 | 45.92 | 46.50 | 47.20 | 47.60 | 50.01 |
| MBPP (Pass@3) | 38.39 | 39.80 | 41.22 | 40.50 | 40.60 | 41.70 | 41.93 |
亮点:200B SOFT 在 Math500 上 0.27→0.37(base 模型)超过 1T token 标准基线;指令调优后 400B FUSED 的 GSM8K 71.80 超 1T 基线 70.13,MBPP 41.2 逼近 1T 的 41.9。任务偏好有规律:数学上 SOFT 增益最大(生成中携带状态助推理),代码上 FUSED 最强(生成前精炼 prompt 表示更有价值)。
5.3 主结果二:更短的推理链
base 模型上,SOFT 在 Math500 以相等或更高精度产出明显更短的解题轨迹(中位数约 500→450 token)。这是拓宽通道的直接预测:STANDARD 必须逐 token、以每步 log2|V| 比特语言化的中间计算,现在可以骑在隐状态上。例子很直观:问“137/500 小数展开中小数点右侧最后一个非零数字”,标准解码写 326 个 token 的长除法过程,SOFT 三行直出答案。该现象在指令调优后消失——调优数据相对潜反馈解码是 off-policy 的,模仿标准推理的冗长风格把全语言化写作方式强加回来(on-policy 后训练可能保住简洁性,留作未来工作)。
5.4 主结果三:机制直接验证(线性探针)
三个合成状态追踪任务(目标信息全在共享冒号之前、夹入 0~256 个语义无关干扰更新),在冒号处对各残差深度拟合线性探针:
| 任务 | 标准 prefill 第 0 层 | 一步循环 prefill 第 0 层 |
|---|---|---|
| 完成追踪(DONE/MORE) | 接近随机 | 99.6% |
| 延迟记忆(ZERO/ONE) | 接近随机 | 100% |
标准 prefill 下浅层只能读部分处理的前缀,重构全局状态需要好几层;循环 prefill 把全栈处理的前缀摘要直接放到第 0 层输入端。论文诚实标注 caveat:可解码 ≠ 会被使用——线性可恢复只说明信息在场,是否因果影响下一个 token 的决策,只有下游任务结果能回答。多寄存器实验进一步显示:一次循环步的增益在更深层与更多覆写场景下减弱,全程循环最好——持续维护状态有额外价值。
5.5 实验设计为何能证明论点
- 同权重对照:三种解码用同一套权重,SOFT 对 STANDARD 的提升纯来自解码方式——排除训练数据、优化器等混淆变量;
- 跨规模基线:与 100B–1T token 无递归基线对比,把“提升多少分”翻译成“等效多少训练 token”;
- 机制-行为互证:探针实验验证可达性机制确实发生,行为实验验证机制转化为任务收益,缺一不可;
- 反直觉消融:3% 三 pass 的有无(图 3)钉死“外推稳定性”因果链;
- 开源对照:附录 B 与 OPT/Pythia/TinyLlama/Llama3.2/Qwen3/EvoLM 的 0-shot 对比显示同量级持平或更优,确认改进建立在强基线上。
六、效果优势的根源解释
按“方法差异 → 机制变化 → 指标提升”的因果链逐环分析。
6.1 门控不对称设计 → 堵死捷径 → 通道被强制使用
对称加性融合下模型有退路:压制状态通路、恢复纯 token 输入,照样拿到普通预训练损失——尤其从标准 checkpoint 起训时,加性路径能轻松复现其低损失,宽通道成为摆设。门控中 token 只是门:丢掉状态等于丢掉输入本身。读状态从可选变成强制,这是后续一切收益的前提。反向印证:Feedback Transformer 的消融也支持顶层记忆近乎匹配全层混合,而第一层记忆不比标准 Transformer 好——选顶层反馈是对的。
6.2 潜反馈 → 可达集 Θ(Tℓ)→Θ(TL) → 浅层拿到全栈摘要 → 数据效率
标准解码里浅层读到的历史只被浅层处理过;潜反馈把全栈摘要回灌输入端,第 0 层即读到完整处理的历史——等效于每个生成步免费获得“额外深度预算”。这解释了数据效率:同一批 token 在训练时被多 pass 递进加工消费,推理时以融合 prefill 再加工,从每个 token 榨取更多学习信号。探针实验(99.6%/100% vs 随机)把中间环节可视化。
6.3 3% 三 pass → 压缩映射 → 训练 horizon 之外稳定 → 长生成可靠
推理时反馈循环要展开成百上千步,训练预算不可能模拟。75/25 配比训练的映射超出训练深度后发散(损失上升、状态变化震荡),而 3% 三 pass 让映射变成向不动点收缩的压缩映射,k=1000 仍稳定。机制上,三 pass 让梯度流经“反馈再反馈”的复合,等价于对映射的自复合施加了稳定性约束。这条链说明:反馈系统的可用性不取决于训练时展开多深,而取决于学到的映射是否收敛——外推稳定性可以廉价地买。
6.4 双通道并行 → 计算骑在隐状态上 → 更短推理链
CoT 的状态就是 token 序列本身,从中恢复问题求解状态又是一个状态追踪问题;潜反馈把状态维护从序列轴部分转移到深度轴,中间结果沿 z 在栈内更新而不必扩张 token 序列——base 模型轨迹更短精度不降。指令调优后现象消失从反面确认因果:off-policy 数据重新灌输全语言化风格,覆盖了通道带来的行为变化——这个红利依赖与训练分布一致的解码方式。
6.5 一条总因果链
输入侧注入(不改架构)+ 强制门控(堵死捷径)→ 全栈状态回到第 0 层(可达性 Θ(TL))+ 隐状态获得跨位置复用监督 → 推理时几乎零成本兑换为有效深度 → 约 2 倍数据效率、部分任务超 1T 基线、base 模型更短推理链。每一环都有实验钉死:探针钉可达性、3% 消融钉稳定性、同权重三解码钉推理收益、跨规模基线钉数据效率。
七、必要知识反推
假设一个毫无背景的人要做这项工作,最少必须知道什么?
7.1 领域知识层
- Transformer 解码全流程:KV cache 机制、teacher forcing 并行训练、采样与词表——不知道“步间只回传一个 token”这个事实本身就无法发现窄通道问题;
- CoT 与串行计算理论:CoT 让计算深度随 token 数增长(Li et al., 2024b)、固定深度 Transformer 每次前向只有有界串行计算——这是“verbalization 是唯一深度刷新通道”论证的前提;
- RNN/状态空间模型与稠密注意力的区别:压缩状态 vs 显式保留全部历史——论文“无可变寄存器”的澄清建立在这个对比上。
7.2 方法论知识层
- Jacobi 迭代/定点迭代视角:多 pass 训练本质是对递归的 Jacobi 式并行更新,压缩映射与不动点概念直接决定了调度设计与外推稳定性判据;
- 训练动态与稳定化工具箱:depth scaling 控制范数增长、权重共享对齐基底、噪声正则提高鲁棒性——这些是循环深度网络训练的通用配方(loop transformer 文献同样依赖 depth scaling);
- 分布差意识:训练目标与推理用法之间的 mismatch(全融合 vs prompt 纯嵌入+生成融合)能被 prefix mixin 这样的显式对齐手段弥合——意识到 mismatch 的存在比修复它更难;
- scaling law 与数据效率语境:知道 Chinchilla 式 token/参数比约束,才能把结果正确表述为“计算换数据”。
7.3 工程知识层
- 大规模预训练基础设施:WSD 调度、z-loss、AdamC、NorMuon 优化器、token 等效计算核算(tokens × 平均 pass 数)——400B token 级实验的成本记账与稳定训练全靠这些;
- 推理服务栈:vLLM 的 CUDA graph 捕获、EAGLE/MTP 的 hidden state buffer 模式——知道 serving 栈怎么工作,才能设计出“解码循环只改两行”的方案并落地兼容;
- 探针实验设计:分组交叉验证的线性探针、控制目标与干扰解耦的合成任务构造——机制验证的可信度取决于此。
7.4 知识融合的关键节点
- 节点一:“带宽”视角:需要同时有信息论直觉(每 token log2|V| 比特)和 Transformer 结构知识(层间可达性限制),才能把“丢掉顶层状态”重构为“通道过窄”问题——这是全文的奠基性视角转换;
- 节点二:“顺序性可以在 pass 维度支付”:需要既懂 teacher forcing 的并行性来源(位置间无依赖),又懂定点迭代,才会想到把长度 T 的递归展开压缩成 k 次全并行前向;
- 节点三:“训练到映射稳定而非训练到目标深度”:需要递归动力系统素养(收缩/发散的判别)+ 训练预算现实,才会把目标从“模拟完整 horizon”改为“让自复合收敛”,并用极小比例的深 pass 实现它。
八、论文中可以提取的通用性灵感
8.1 带宽视角:审视任何反馈系统的第一步是量化它的通道容量
核心思想:反馈环路的存在不等于反馈的有效性——先问“每步到底传了多少比特、什么被丢弃了”。自回归 Transformer 的步间反馈看似存在(token 会回来),实则只有十几比特;许多系统里“有反馈”与“全带宽反馈”之间隔着数量级差距。
论文证据:D 维连续隐状态 vs log2|V| 比特离散 token 的量化对比;可达集从 Θ(Tℓ) 到 Θ(TL)。
推广场景:Agent 系统中步骤间只传“最终答案”而不传中间推理状态;组织管理中汇报层级只上行结论不上行证据;传感器网络中只回传阈值告警而非原始信号——都可以问一句“这个反馈环的带宽够吗,什么信息被 bottleneck 掉了”。
8.2 用“强制依赖”堵死捷径:结构不对称防止能力退化
核心思想:给系统新增一条通道时,如果存在“绕过它还能达到同等损失”的捷径,优化器一定会走捷径。让使用新通道成为结构上不可避免的(token 做门、状态做值,丢状态=丢输入),能力才会真正建立。
论文证据:对比加性融合的捷径分析;门控设计下模型被迫学会读取隐状态。
推广场景:多任务学习中的梯度手术 vs 结构性路由;特征工程中防止模型忽略新特征;教育中“先测旧方法失效再教新方法”——可用性必须被强制,不能指望被自愿选择。
8.3 3% 的第三步:训练递归系统到“映射收敛”而非“深度覆盖”
核心思想:需要外推到远超训练预算的循环系统,训练目标不应是模拟完整长度,而是让转移映射成为压缩映射——极小比例的更深展开样本就足以把发散动力学扭成收敛动力学。
论文证据:75/25 配比在训练深度外发散,加 3% 三 pass 后 k=1000 仍稳定,损失平坦、状态变化衰减到平台。
推广场景:迭代式优化器(如文本迭代优化、进化策略)只需少量多步样本保证收敛性;数值模拟中用小规模长程模拟校验积分器稳定性;策略迭代类方法混入少量深 rollout 防止策略震荡。
8.4 顺序性可以换轴支付:把序列维的串行折叠进 pass 维的串行
核心思想:当递归让训练无法并行时,问一句“串行依赖到底在哪个维度”——用全并行多次前向(Jacobi 式)近似顺序展开,把 O(T) 的串行成本换成 O(k) 的串行成本,k≪T。
论文证据:multi-pass 目标让长度 T 的递归展开变成 k 次 Transformer 前向,训练保留并行 teacher forcing;PonderLM-2 用类似思路但输入翻倍,本文更省。
推广场景:时序模型训练的并行化(Mamba/ParaRNN 一脉);多轮对话的离线模拟;任何“逐步依赖”流程的批处理近似—— Jacobi 迭代思想远不止于线性情况。
8.5 训练用法与推理用法的分布对齐:prefix mixin 式的边界弥合
核心思想:训练目标与推理用法之间的结构性 mismatch(这里:全融合序列 vs 纯嵌入前缀+融合后缀)会在推理时的边界处爆发。与其在推理时迁就训练(如把 prompt 也跑融合 pass),不如在训练时随机化边界位置,让模型天然覆盖推理时的异质结构。
论文证据:prefix mixin 让单 prefill 推理(SOFT)无需额外 pass 也表现良好,同时保留 FUSED 作为可选增强。
推广场景:RLHF 中训练分布与部署分布的错位修补;课程学习中随机化任务边界;编译器优化中训练与生产负载的对齐——“随机化边界”是比“统一格式”更便宜的对齐手段。
附录:方法全景速查表
| 要素 | Full-bandwidth transformer 对应物 |
|---|---|
| 反馈信号 | 上一步顶层隐状态 h^L(D 维连续向量,全带宽) |
| 融合机制 | 门控线性单元 W_U h ⊙ σ(W_G e),状态走值通路、token 做门(2D² 参数) |
| 训练目标 | 多 pass NTP:pass k 融合 pass k-1 隐态,逐 pass 算损失,梯度不截断 |
| 调度 | 75% 单 pass / 22% 双 pass / 3% 三 pass(压缩映射的关键) |
| 分布对齐 | prefix mixin 随机前缀长度(纯嵌入前缀+融合后缀) |
| 稳定化 | depth scaling(‖h‖~O(1))、嵌入/读出权重共享、jitter 噪声 σ=0.02 |
| 解码模式 | STANDARD(纯嵌入)/ SOFT(生成时反馈,<1% 开销)/ FUSED(+1 次融合 prefill) |
| 理论刻画 | 可达集 Θ(Tℓ) → Θ(TL) |
| 工程兼容 | 维度不变、KV cache 不动、vLLM 复用 EAGLE/MTP hidden state buffer |
| 规模 | 1B 参数、400B token、Phi-4 数据混合(该方向最大规模预训练验证) |