论文链接:Full-bandwidth transformer 发表时间:2026年8月(arXiv:2608.08888v1,2026年8月9日提交) 机构:Johns Hopkins University、Princeton University、Microsoft(微软 AI Frontiers 实习生工作,John Langford 指导,Xi Wang 通讯) 领域标签:cs.AI / LLM 预训练架构 / 潜推理 / 数据高效训练


一、论文背景

1.1 两条计算轴:一条是高速公路,一条是独木桥

自回归 Transformer 沿两条轴计算:水平轴(横跨生成的 token 序列)和垂直轴(纵穿模型深度)。把模型想象成一个信息处理工厂,这两条轴就是两条信息通道:

  • 水平轴像广播网:生成第 t 个 token 时,第 ℓ 层的状态可以通过稠密注意力直接读到之前每个位置的缓存表示——水平方向上,每个 token 都能“听到”全部历史,带宽极宽;
  • 垂直轴像只有一个对讲机的传话系统:步与步之间(上一个 token 到下一个 token),只有采样出来的那个 token 回到网络底层。模型的整个顶层隐状态是一个 D 维连续向量,承载了模型对当前位置的全部思考,但传给下一步时被压缩成一个离散符号,至多 log2|V| 比特——词表 100352 时也就约 16.6 比特。顶层隐状态本身则被直接丢弃。

1.2 被浪费的计算:“depth-frozen”的非语言化计算

一个关键观察是:非语言化的计算并没有被抹掉——中间激活仍留在 KV cache 里——但被深度冻结了:第 ℓ 层的状态只能被 ℓ 之上的层读取,永远无法回到网络底部再加工;最深的状态——顶层输出——根本不被缓存。

于是“说出来”(verbalization)成了信息重新进入网络底层、获得全新深度预算的唯一通道,代价是被挤过一个 token 的窄口。模型只有两个糟糕的选择:要么花 token 把中间状态 narrate 出来(这就是链式推理 CoT 的本质),要么在每个位置从头重新计算那个状态。

1.3 动机:当数据成为瓶颈,计算带宽是新战场

Scaling 的传统路径是更多参数+更多 token(Kaplan et al., 2020),但高质量独有数据日益成为约束。既然数据有限,能否通过给每个 token 分配更多计算来榨取更多学习信号?循环、迭代、反馈式计算是自然方向——但额外的 FLOPs 只有转化为更丰富的表示或更有效的推理时计算才有意义。本文的答案是:把垂直轴上那条被浪费的窄通道拓宽到全带宽。

二、论文定位和关联工作

拓宽“步间反馈通道”和“在潜空间推理”并非全新想法,这条线上已有多项工作,但每项都留有未越过的门槛:

工作核心做法关键局限
Feedback Transformer(2020)先驱工作:每个位置聚合各层表示成记忆,未来位置的注意力读聚合记忆而非同层 KV训练必须顺序处理输入 token,不可扩展;修改注意力结构
T2MLR(2026)把前一个位置的早中层表示注入当前位置的晚中层注入点在模型内部,额外 MLP 引入约 5D² 参数
Latent Recurrent Transformer(LRT,2026)前一位置固定源层的隐状态经额外 KV 投影注入注意力与残差流层间投影引入 LD² 参数;实验只做非自由生成评测
Coconut / Soft Thinking潜推理:用连续隐状态做推理替换离散 token 或仅限后训练阶段,监督困难
PonderLM-2(2025)预训练时交错嵌入/隐状态输入,同样用多次前向替代顺序 rollout输入长度(及 KV cache)翻倍,训练推理开销更大
Loop Transformer 系推理时重复施加整个 Transformer 栈获得有效深度每个 token 的推理计算随循环步数线性增长

本文的差异点是三条:仅在输入侧注入(不改架构、不动注意力和 KV cache)、最少参数(两个 D×D 投影,2D² 参数)、最大规模验证(400B token 预训练,该线最大规模,且在真实推理工作负载上验证收益)。论文也坦诚:这些方法精神相似,大规模下谁优谁劣未经验证。

三、问题定义

3.1 带宽的正式刻画:可达集

论文用“可达集”给两个通道的带宽下了精确定义。计算位置 t、层 ℓ 时能读到的历史状态集合,标准解码下是:

$$R_{std}(t,\ell) = \{(t',\ell') : t' < t, \ell' < \ell\}, \quad |R_{std}| = \Theta(T\ell)$$

也就是说第 ℓ 层只能读浅于自己的历史——浅层看到的是“只被部分处理过的过去”,尽管那些位置更深、处理更充分的状态早已算出来躺在缓存里。潜反馈则把可达集拓宽为:

$$R_{lf}(t,\ell) = \{(t',\ell') : t' < t, 0 \le \ell' \le L\}, \quad |R_{lf}| = \Theta(TL)$$

每一层(包括最浅的第 0 层)都能读到被全部 L 层处理过的历史。从 Θ(Tℓ) 到 Θ(TL),这就是“全带宽”的含义。

3.2 两个必须澄清的“不是什么”

  • 不是可变寄存器:RNN/状态空间模型每步覆写压缩状态;潜反馈形式上是循环,但过去状态持久留在 KV cache 中不被覆写,仍可被当前 token 直接读取;
  • 不增加解码时的渐近深度:无论有无潜反馈,每步计算图深度都是 O(L)。改变的是通道带宽——离散语言通道与连续潜通道并行演化。

3.3 信息与计算之辨

一个精妙论证:新隐状态 z_{t+1} 是 x_{1:t+1} 的确定性函数,不携带任何上下文尚未确定的信息——增益是计算性的,不是信息性的。信息没变多,收益从哪来?从可达性来:重注入解除了公式 (2) 的深度限制,让全栈处理的摘要直达底层。“信息不变、计算可达性改变”是全文理论分析的支点。

四、问题解法

4.1 潜反馈解码:一步之差的核心机制

推理时每步把上一步的顶层隐状态与当前采样 token 的嵌入通过门控线性单元融合,作为下一步输入:

$$h_t^L = f_\theta(e_t \otimes h_{t-1}^L; C), \quad e_t \otimes h_{t-1} = W_U h_{t-1} \odot \sigma(W_G e_t)$$

整个改动只有两个 D×D 矩阵。不对称设计是故意的:隐状态走 value 通路(被 W_U 变换后保留),token 只做乘性门(σ(W_G e_t) 决定放行哪些维度)。为什么不用对称的加性融合 e_t + W h_{t-1}?因为那会留一条捷径:模型可以压制状态通路、还原纯 token 输入、照样达到普通预训练损失——从标准 checkpoint 起训时尤其诱人。门控堵死了它:丢掉 h_{t-1} 等于丢掉输入本身,token 身份只存活于它施加在状态上的 D 维门控模式里。读状态从“可选”变成“强制”。

4.2 训练:多 pass 目标与“时间并行”

障碍在于训练。预训练模型从没见过输入端出现隐状态,推理时不能直接打开潜反馈;而潜反馈定义的递归在位置上是顺序的,直接训练会丢掉并行 teacher forcing——Transformer 高效训练的根基。

解法是多 pass(multi-pass)近似:pass 1 是普通无反馈前向;pass k 把 pass k-1 的隐状态右移一位、与嵌入融合、再全序列并行跑一遍栈——每个 pass 需要的状态在上个 pass 已全部完成,所以顺序性只在 k 个 pass 间支付,而非在序列长度 T 上支付。每个 pass 都施加 teacher-forced NTP 损失(λ=1,未调参),梯度不截断——后期 pass 的损失反传进早期 pass 的隐状态,充当辅助目标。这就是 temporal parallelism:每个 pass 是对潜反馈递归的一次 Jacobi 式更新,k 个 pass 训练的是 k-1 个 token 步的反馈转移。

4.3 三个让训练落地的工程决策

(1)渐进调度。反馈 pass 昂贵(k-pass batch 的成本是标准 teacher forcing 的 k 倍),所以大部分训练用单 pass 目标(可以直接从标准预训练 checkpoint 起跑),训练中段才引入双 pass,后期再混入少量三 pass。最终配比 75% 单 pass / 22% 双 pass / 3% 三 pass。

(2)3% 的第三步换来外推稳定性——最反直觉的发现。只训单+双 pass(75/25)的模型在训练深度内良好,但超出后验证损失骤增、隐状态变化量震荡不衰减——递归发散。仅加入 3% 三 pass batch,行为质变:验证损失在 30 步反馈内平坦,隐状态变化衰减到小平台——反馈映射成为向不动点收缩的压缩映射,附录中 k=1000 仍稳定。目标不是在完整推理深度上训练,而是把反馈映射训练到在自我复合下稳定。

(3)prefix mixin 弥合分布差。训练的 pass 里每个位置都被融合,但推理时序列是异质的:prompt 位置是纯嵌入(单次 prefill 处理),生成位置才是融合输入。只见过全融合序列的模型在“prompt 结束、生成开始”的边界上会遇到分布外输入。prefix mixin 在每个额外 pass 中随机采样前缀长度 p,把 t≤p 的位置还原为纯嵌入、只融合后缀——训练由此覆盖了“任意位置从纯切换到融合”的结构,恰好是单 prefill 推理的形态。

4.4 三个轻量稳定化配方

  • 平稳的隐状态尺度:depth scaling 保证 ||h^L||~O(1) 而非 O(L),融合输入再过 RMSNorm——否则反馈反复施加时范数会爆;
  • 权重共享:嵌入层与读出层 tie,让两类输入共享同一基底,减轻融合权重学习大旋转的负担;
  • 抖动噪声:融合前给状态加 σ=0.02 均匀噪声,把反馈映射暴露在训练状态的局部邻域上,降低对微小偏差的敏感性——这类偏差在长反馈 horizon 下会累积。

4.5 三种解码模式:STANDARD / SOFT / FUSED

  • STANDARD:单次 prefill + 生成时纯嵌入输入——把全带宽模型当普通 Transformer 用,衡量“训了潜反馈但推理不用”的代价;
  • SOFT:单次 prefill + 生成时潜反馈(公式 3),与 STANDARD 的 prefill 成本完全相同,每 token 额外开销只有两次 D×D 矩阵乘,与上下文长度和模型深度无关,<1%;
  • FUSED:在 SOFT 基础上,先把 prompt 额外跑一次融合 prefill pass(对 prompt token 并行,成本翻倍),让 prompt 状态在生成开始前先被精炼一轮。

工程兼容性:融合保持输入维度 D 不变,架构、KV cache、serving 栈全不动;vLLM 实现复用 EAGLE/MTP 的 hidden state buffer 模式(把每请求最新主干隐状态原地拷贝进固定地址缓冲区,CUDA graph 照常捕获门控)。

五、评估指标与实验证据

5.1 实验设置

1B 参数(24 层、1536 维、100352 词表、8192 上下文),Phi-4 同款数据混合,NorMuon 优化器+WSD 调度。token 等效计算 = token 数 × 平均前向次数:200B run 记 256B、400B run 记 512B。四个规模:10B(100% 三 pass)、100B(75 单/25 三)、200B 与 400B(75 单/22 双/3 三)。

5.2 主结果一:数据效率(约 2 倍)

Fused prefill 改善非生成任务。在 prompt 上追加 k 次融合 pass,验证损失与 5-shot LM Eval(10 任务)单调改善且收益前置——大部分增益在第一次融合 pass 到账,符合“全栈状态暴露给第 0 层=增加有效深度”的机制预期。关键对比:两次反馈 pass 下,100B 全带宽达到 200B 标准基线,200B 全带宽达到 400B 标准基线——约 2 倍预训练数据效率。稳健性发现:step 0(不用反馈)时全带宽模型只比标准基线差一点点验证损失,LM Eval 精度甚至已更高——训了不用,代价很小。

指令调优后仍保持优势(200B/400B 模型经过 12B token 长上下文扩展到 32K + 6B token 指令调优,无 few-shot):

任务200B Standard200B Soft200B Fused400B Standard400B Soft400B Fused1T 标准
GSM8K (Pass@1)64.5267.9367.5567.9071.0071.8070.13
MATH-500 (Pass@1)43.8045.6045.6046.0045.4048.4047.40
HumanEval (Pass@3)42.5445.0645.9246.5047.2047.6050.01
MBPP (Pass@3)38.3939.8041.2240.5040.6041.7041.93

亮点:200B SOFT 在 Math500 上 0.27→0.37(base 模型)超过 1T token 标准基线;指令调优后 400B FUSED 的 GSM8K 71.80 超 1T 基线 70.13,MBPP 41.2 逼近 1T 的 41.9。任务偏好有规律:数学上 SOFT 增益最大(生成中携带状态助推理),代码上 FUSED 最强(生成前精炼 prompt 表示更有价值)。

5.3 主结果二:更短的推理链

base 模型上,SOFT 在 Math500 以相等或更高精度产出明显更短的解题轨迹(中位数约 500→450 token)。这是拓宽通道的直接预测:STANDARD 必须逐 token、以每步 log2|V| 比特语言化的中间计算,现在可以骑在隐状态上。例子很直观:问“137/500 小数展开中小数点右侧最后一个非零数字”,标准解码写 326 个 token 的长除法过程,SOFT 三行直出答案。该现象在指令调优后消失——调优数据相对潜反馈解码是 off-policy 的,模仿标准推理的冗长风格把全语言化写作方式强加回来(on-policy 后训练可能保住简洁性,留作未来工作)。

5.4 主结果三:机制直接验证(线性探针)

三个合成状态追踪任务(目标信息全在共享冒号之前、夹入 0~256 个语义无关干扰更新),在冒号处对各残差深度拟合线性探针:

任务标准 prefill 第 0 层一步循环 prefill 第 0 层
完成追踪(DONE/MORE)接近随机99.6%
延迟记忆(ZERO/ONE)接近随机100%

标准 prefill 下浅层只能读部分处理的前缀,重构全局状态需要好几层;循环 prefill 把全栈处理的前缀摘要直接放到第 0 层输入端。论文诚实标注 caveat:可解码 ≠ 会被使用——线性可恢复只说明信息在场,是否因果影响下一个 token 的决策,只有下游任务结果能回答。多寄存器实验进一步显示:一次循环步的增益在更深层与更多覆写场景下减弱,全程循环最好——持续维护状态有额外价值。

5.5 实验设计为何能证明论点

  • 同权重对照:三种解码用同一套权重,SOFT 对 STANDARD 的提升纯来自解码方式——排除训练数据、优化器等混淆变量;
  • 跨规模基线:与 100B–1T token 无递归基线对比,把“提升多少分”翻译成“等效多少训练 token”;
  • 机制-行为互证:探针实验验证可达性机制确实发生,行为实验验证机制转化为任务收益,缺一不可;
  • 反直觉消融:3% 三 pass 的有无(图 3)钉死“外推稳定性”因果链;
  • 开源对照:附录 B 与 OPT/Pythia/TinyLlama/Llama3.2/Qwen3/EvoLM 的 0-shot 对比显示同量级持平或更优,确认改进建立在强基线上。

六、效果优势的根源解释

按“方法差异 → 机制变化 → 指标提升”的因果链逐环分析。

6.1 门控不对称设计 → 堵死捷径 → 通道被强制使用

对称加性融合下模型有退路:压制状态通路、恢复纯 token 输入,照样拿到普通预训练损失——尤其从标准 checkpoint 起训时,加性路径能轻松复现其低损失,宽通道成为摆设。门控中 token 只是门:丢掉状态等于丢掉输入本身。读状态从可选变成强制,这是后续一切收益的前提。反向印证:Feedback Transformer 的消融也支持顶层记忆近乎匹配全层混合,而第一层记忆不比标准 Transformer 好——选顶层反馈是对的。

6.2 潜反馈 → 可达集 Θ(Tℓ)→Θ(TL) → 浅层拿到全栈摘要 → 数据效率

标准解码里浅层读到的历史只被浅层处理过;潜反馈把全栈摘要回灌输入端,第 0 层即读到完整处理的历史——等效于每个生成步免费获得“额外深度预算”。这解释了数据效率:同一批 token 在训练时被多 pass 递进加工消费,推理时以融合 prefill 再加工,从每个 token 榨取更多学习信号。探针实验(99.6%/100% vs 随机)把中间环节可视化。

6.3 3% 三 pass → 压缩映射 → 训练 horizon 之外稳定 → 长生成可靠

推理时反馈循环要展开成百上千步,训练预算不可能模拟。75/25 配比训练的映射超出训练深度后发散(损失上升、状态变化震荡),而 3% 三 pass 让映射变成向不动点收缩的压缩映射,k=1000 仍稳定。机制上,三 pass 让梯度流经“反馈再反馈”的复合,等价于对映射的自复合施加了稳定性约束。这条链说明:反馈系统的可用性不取决于训练时展开多深,而取决于学到的映射是否收敛——外推稳定性可以廉价地买。

6.4 双通道并行 → 计算骑在隐状态上 → 更短推理链

CoT 的状态就是 token 序列本身,从中恢复问题求解状态又是一个状态追踪问题;潜反馈把状态维护从序列轴部分转移到深度轴,中间结果沿 z 在栈内更新而不必扩张 token 序列——base 模型轨迹更短精度不降。指令调优后现象消失从反面确认因果:off-policy 数据重新灌输全语言化风格,覆盖了通道带来的行为变化——这个红利依赖与训练分布一致的解码方式。

6.5 一条总因果链

输入侧注入(不改架构)+ 强制门控(堵死捷径)→ 全栈状态回到第 0 层(可达性 Θ(TL))+ 隐状态获得跨位置复用监督 → 推理时几乎零成本兑换为有效深度 → 约 2 倍数据效率、部分任务超 1T 基线、base 模型更短推理链。每一环都有实验钉死:探针钉可达性、3% 消融钉稳定性、同权重三解码钉推理收益、跨规模基线钉数据效率。

七、必要知识反推

假设一个毫无背景的人要做这项工作,最少必须知道什么?

7.1 领域知识层

  • Transformer 解码全流程:KV cache 机制、teacher forcing 并行训练、采样与词表——不知道“步间只回传一个 token”这个事实本身就无法发现窄通道问题;
  • CoT 与串行计算理论:CoT 让计算深度随 token 数增长(Li et al., 2024b)、固定深度 Transformer 每次前向只有有界串行计算——这是“verbalization 是唯一深度刷新通道”论证的前提;
  • RNN/状态空间模型与稠密注意力的区别:压缩状态 vs 显式保留全部历史——论文“无可变寄存器”的澄清建立在这个对比上。

7.2 方法论知识层

  • Jacobi 迭代/定点迭代视角:多 pass 训练本质是对递归的 Jacobi 式并行更新,压缩映射与不动点概念直接决定了调度设计与外推稳定性判据;
  • 训练动态与稳定化工具箱:depth scaling 控制范数增长、权重共享对齐基底、噪声正则提高鲁棒性——这些是循环深度网络训练的通用配方(loop transformer 文献同样依赖 depth scaling);
  • 分布差意识:训练目标与推理用法之间的 mismatch(全融合 vs prompt 纯嵌入+生成融合)能被 prefix mixin 这样的显式对齐手段弥合——意识到 mismatch 的存在比修复它更难;
  • scaling law 与数据效率语境:知道 Chinchilla 式 token/参数比约束,才能把结果正确表述为“计算换数据”。

7.3 工程知识层

  • 大规模预训练基础设施:WSD 调度、z-loss、AdamC、NorMuon 优化器、token 等效计算核算(tokens × 平均 pass 数)——400B token 级实验的成本记账与稳定训练全靠这些;
  • 推理服务栈:vLLM 的 CUDA graph 捕获、EAGLE/MTP 的 hidden state buffer 模式——知道 serving 栈怎么工作,才能设计出“解码循环只改两行”的方案并落地兼容;
  • 探针实验设计:分组交叉验证的线性探针、控制目标与干扰解耦的合成任务构造——机制验证的可信度取决于此。

7.4 知识融合的关键节点

  • 节点一:“带宽”视角:需要同时有信息论直觉(每 token log2|V| 比特)和 Transformer 结构知识(层间可达性限制),才能把“丢掉顶层状态”重构为“通道过窄”问题——这是全文的奠基性视角转换;
  • 节点二:“顺序性可以在 pass 维度支付”:需要既懂 teacher forcing 的并行性来源(位置间无依赖),又懂定点迭代,才会想到把长度 T 的递归展开压缩成 k 次全并行前向;
  • 节点三:“训练到映射稳定而非训练到目标深度”:需要递归动力系统素养(收缩/发散的判别)+ 训练预算现实,才会把目标从“模拟完整 horizon”改为“让自复合收敛”,并用极小比例的深 pass 实现它。

八、论文中可以提取的通用性灵感

8.1 带宽视角:审视任何反馈系统的第一步是量化它的通道容量

核心思想:反馈环路的存在不等于反馈的有效性——先问“每步到底传了多少比特、什么被丢弃了”。自回归 Transformer 的步间反馈看似存在(token 会回来),实则只有十几比特;许多系统里“有反馈”与“全带宽反馈”之间隔着数量级差距。

论文证据:D 维连续隐状态 vs log2|V| 比特离散 token 的量化对比;可达集从 Θ(Tℓ) 到 Θ(TL)。

推广场景:Agent 系统中步骤间只传“最终答案”而不传中间推理状态;组织管理中汇报层级只上行结论不上行证据;传感器网络中只回传阈值告警而非原始信号——都可以问一句“这个反馈环的带宽够吗,什么信息被 bottleneck 掉了”。

8.2 用“强制依赖”堵死捷径:结构不对称防止能力退化

核心思想:给系统新增一条通道时,如果存在“绕过它还能达到同等损失”的捷径,优化器一定会走捷径。让使用新通道成为结构上不可避免的(token 做门、状态做值,丢状态=丢输入),能力才会真正建立。

论文证据:对比加性融合的捷径分析;门控设计下模型被迫学会读取隐状态。

推广场景:多任务学习中的梯度手术 vs 结构性路由;特征工程中防止模型忽略新特征;教育中“先测旧方法失效再教新方法”——可用性必须被强制,不能指望被自愿选择。

8.3 3% 的第三步:训练递归系统到“映射收敛”而非“深度覆盖”

核心思想:需要外推到远超训练预算的循环系统,训练目标不应是模拟完整长度,而是让转移映射成为压缩映射——极小比例的更深展开样本就足以把发散动力学扭成收敛动力学。

论文证据:75/25 配比在训练深度外发散,加 3% 三 pass 后 k=1000 仍稳定,损失平坦、状态变化衰减到平台。

推广场景:迭代式优化器(如文本迭代优化、进化策略)只需少量多步样本保证收敛性;数值模拟中用小规模长程模拟校验积分器稳定性;策略迭代类方法混入少量深 rollout 防止策略震荡。

8.4 顺序性可以换轴支付:把序列维的串行折叠进 pass 维的串行

核心思想:当递归让训练无法并行时,问一句“串行依赖到底在哪个维度”——用全并行多次前向(Jacobi 式)近似顺序展开,把 O(T) 的串行成本换成 O(k) 的串行成本,k≪T。

论文证据:multi-pass 目标让长度 T 的递归展开变成 k 次 Transformer 前向,训练保留并行 teacher forcing;PonderLM-2 用类似思路但输入翻倍,本文更省。

推广场景:时序模型训练的并行化(Mamba/ParaRNN 一脉);多轮对话的离线模拟;任何“逐步依赖”流程的批处理近似—— Jacobi 迭代思想远不止于线性情况。

8.5 训练用法与推理用法的分布对齐:prefix mixin 式的边界弥合

核心思想:训练目标与推理用法之间的结构性 mismatch(这里:全融合序列 vs 纯嵌入前缀+融合后缀)会在推理时的边界处爆发。与其在推理时迁就训练(如把 prompt 也跑融合 pass),不如在训练时随机化边界位置,让模型天然覆盖推理时的异质结构。

论文证据:prefix mixin 让单 prefill 推理(SOFT)无需额外 pass 也表现良好,同时保留 FUSED 作为可选增强。

推广场景:RLHF 中训练分布与部署分布的错位修补;课程学习中随机化任务边界;编译器优化中训练与生产负载的对齐——“随机化边界”是比“统一格式”更便宜的对齐手段。

附录:方法全景速查表

要素Full-bandwidth transformer 对应物
反馈信号上一步顶层隐状态 h^L(D 维连续向量,全带宽)
融合机制门控线性单元 W_U h ⊙ σ(W_G e),状态走值通路、token 做门(2D² 参数)
训练目标多 pass NTP:pass k 融合 pass k-1 隐态,逐 pass 算损失,梯度不截断
调度75% 单 pass / 22% 双 pass / 3% 三 pass(压缩映射的关键)
分布对齐prefix mixin 随机前缀长度(纯嵌入前缀+融合后缀)
稳定化depth scaling(‖h‖~O(1))、嵌入/读出权重共享、jitter 噪声 σ=0.02
解码模式STANDARD(纯嵌入)/ SOFT(生成时反馈,<1% 开销)/ FUSED(+1 次融合 prefill)
理论刻画可达集 Θ(Tℓ) → Θ(TL)
工程兼容维度不变、KV cache 不动、vLLM 复用 EAGLE/MTP hidden state buffer
规模1B 参数、400B token、Phi-4 数据混合(该方向最大规模预训练验证)