本文为两篇论文合并精读:论文一《Diffusion Reward Models》(arXiv:2609.33803,DRM);论文二《SOLO: Pretraining Billion-Parameter Language Models with Shared-Output Local Learning》(arXiv:2609.35440,SOLO)。前四部分分论文展开,第五、六部分合并讨论。

总题目区

论文一(DRM):arXiv 2609.33803 | 模型开源于 HuggingFace / 代码开源于 GitHub | 2026 年 9 月 | 清华大学(thunlp,主要)+ 香港中文大学 + UIUC,纯高校合作 | cs.LG / RLHF 奖励模型 / 密度估计;当日 Hugging Face 日榜 up=22 论文二(SOLO):arXiv 2609.35440 | 2026 年 9 月 | 中国科学院自动化研究所(单一机构,Bojian Yin 通讯)| cs.LG / 局部学习 / 大模型预训练系统

一、论文背景:两项「旧技术」各自卡在哪儿

1.1 奖励模型:从标量到分布,缺的不是想法是头

奖励模型(Reward Model, RM)是什么。大语言模型的后训练分三步:预训练学语言、监督微调学指令、基于人类反馈的强化学习(RLHF)学偏好。RLHF 需要一个「打分器」——输入一个(提示,回答)对,输出一个分数代表人类满意度,这个打分器就是奖励模型。它之所以关键,是因为在数学、代码这类可验证领域,答案对错可以直接机器判定(RLVR 路线);但在通用对齐领域——聊天、写作、安全权衡——没有这样的「标准答案oracle」,策略模型优化的就是这个 RM 的分数。RM 的质量直接决定对齐的上限:RM 有偏,策略就学会钻营它的偏差(reward hacking)。

Bradley–Terry 训练与点估计。主流 RM 用 Bradley–Terry(BT)损失训练:标注者对同一提示的两个回答给出偏好对(chosen, rejected),模型输出标量分数 r(x,y),训练目标让 r(chosen) > r(rejected) 的概率最大化。这套 1952 年的统计方法把「偏好」压缩成一个点估计——每个(提示,回答)对对应唯一一个稳定分值。后来的多属性路线(如 ArmoRM)让模型对 helpfulness、correctness 等 19 个属性分别打分再由门控聚合,但每个属性仍是标量。

标注者分歧:被平均掉的真实结构。点估计的前提假设是「人类偏好存在稳定共识」,但数据早就说了不。Anthropic-HH 数据集上标注者间一致率只有约 63%;DRM 论文用带重复标注的数据集直接统计了分歧的形态:HelpSteer2 的 helpfulness 维度上,43.49% 的样本评分 range ≥ 2(满分 4 分),28.20% 呈分离簇(一部分人打高分一部分人打低分,中间空着),24.34% 呈完全极化;MultiPref 上 45.64% 的偏好对存在「对侧判断」(同一对回答,不同标注者给出方向相反的偏好)。这些不是噪声——研究表明分歧多反映真实的个体偏好差异,且跨文化、跨人群系统性存在。把这样的多峰结构平均成一个标量,等于把「人群里有 40% 的人会讨厌这个回答」这条决策关键信息直接抹掉。

已有的「分布化奖励模型」尝试都打了补丁但没解决问题:DPL 和 URM 让头输出高斯均值-方差——高斯按构造单峰;DPRM 输出离散类别分布——受 bin 粒度限制;QRM 输出固定分位格——存在分位交叉和不稳定尾部。它们都预先承诺了一个参数分布族,而没有任何单一分布族能覆盖人类偏好实际呈现的形态(多峰、偏斜、极化)。缺的是一个不承诺分布族的奖励头。

扩散模型为什么是候选。扩散模型(DDPM/DiT 一脉)是 2020 年后图像生成的统治者:训练时给数据加高斯噪声、学习预测噪声,采样时从纯噪声出发迭代去噪。它的一个标志性性质是模式覆盖能力强——Dhariwal & Nichol 2021 年证明扩散在 ImageNet 生成上全面超过 GAN,关键指标 recall 从 0.28 升到 0.53,定量刻画了 GAN 的模式坍缩(只生成少数「安全」样本)与扩散的全分布覆盖之差;理论上扩散去噪等价于学习数据分布的 score function,可逼近任意连续密度。一个能表示任意连续多峰密度的成熟生成技术,与一个「需要任意连续多峰密度输出头」的奖励建模问题,看似天然匹配——但在 DRM 之前没有工作把它们接起来。

1.2 反向传播的代价:局部学习为什么二十年推不大

端到端反向传播(BP)与 update locking。所有大模型都在用 BP:损失在网络末端计算,梯度从最后一层逐层传回。这个全局梯度有一个隐含代价——update locking:第 k 层必须等梯度穿过所有比它深的层才能更新,在那之前它的激活(前向中间结果)也必须留着不能释放,因为反向传播要用。激活重计算、优化器分片、各种并行策略能缓解内存压力,但都不移除这个「浅层等深层」的依赖本身。

局部学习(local learning)。打破 update locking 的经典思路:把网络切成 K 个模块,模块间用 stop-gradient 切断梯度(前向传值、反向不传梯度),每个模块配一个自己的轻量辅助头预测最终目标、用自己的局部损失训练,训完丢弃辅助头。这样每个模块前向完就能立即反向、更新、释放激活,谁也不等谁。这条线在生物学合理性(大脑不做全局反向传播)与工程效率(内存、并行度)两个动机下发展了二十多年。

卡在 ImageNet,上不了语言模型。局部学习在图像分类上已接近 BP(Belilovsky 等 2019 年证明贪心逐层训练可扩展到 ImageNet),但有两个条件恰好被图像分类满足而被语言模型预训练完全反转:模型小、输出类别少(ImageNet 1000 类,readout 只是一个 1000×d 的小矩阵)。语言模型预训练要求每个局部 readout 把中间状态映射到大词表(3 万+ token),模型也大得多(十亿参数)。在 LLM 上的已有尝试全部停在玩具规模:Laskin 等(2020)只训了 6M 参数 Transformer;Shing 等(2026)止步 12 层;Sushma 等(2026)774M 且靠 WikiText-103 反复多轮。据 SOLO 作者所知,从未有十亿参数语言模型用局部学习从头预训练成功。

障碍在哪?SOLO 的诊断直指一个所有前作共享的设计:私有 readout。每个模块的辅助头配一个自己独有、自己训练的 readout 矩阵 W_k。在 32k 词表、2048 宽度下一个 readout 有 67M 参数——K-1 个私有 readout 意味着巨额参数与优化器状态;更要命的是,各模块在自己的 readout 张成的不同基上预测同一个词表,局部梯度与 BP 梯度系统性错位,且模块完全得不到「深层模块在做什么」的信息。局部学习需要的是隔离梯度,不是隔离输出 readout——这句话是整篇 SOLO 的题眼。

二、论文定位和关联工作

2.1 DRM 的坐标系:奖励头的三次范式迁移

谱系一:判别式 RM(标量头)。BT 损失 + 标量头是工业主流,通过大规模偏好数据混合扩展(Skywork 系列、InternLM2-Reward 等)。ArmoRM-Llama3-8B 是 DRM 受控对比的直接对象——同样在 ArmoRM 聚合语料(569K 样本、19 属性)上训练、同一 LLaMA3-8B 骨干。标量头的根本局限:无论怎么扩数据,输出形态固定为单点。

谱系二:生成式 RM。让 LLM 生成一段评审文字再给分(DeepSeek-GRM、GPT-4o 作为 judge、rubric 类方法),把建模负担转移到长文本推理,推理成本陡增,且最终还是输出单个判词。DRM 与它的关系是「接近其精度但推理成本远低」,并指出其随机性只来自解码温度——是生成过程的噪声,不是被建模的奖励分布。

谱系三:参数化分布 RM。DPL(高斯,ICLR 2024)、URM(高斯)、DPRM(类别分布)、QRM(分位格)——目标与 DRM 一致(建模 p(r|x,y)),实现是单次前向输出固定分布族参数。DRM 论文的定位论证:DRM-Multi-8B 平均 66.2 vs URM 66.1、QRM 64.1——在完全不承诺分布族的前提下追平参数化方法,说明分布族假设并非必要成本。

维度判别式(ArmoRM/Skywork)参数化分布(DPL/URM/QRM)生成式(GRM/GPT-4o)DRM
输出形态单标量固定分布族参数单判词(带推理文本)经验分布(N 采样)
多峰表示无按构造不能无(温度噪声≠分布)任意连续密度
推理成本1 次前向1 次前向长文本生成N 次轻量头(10 DDIM 步×32 样本)
不确定性无族内无显式方差/分位数/超越概率
测试时缩放轴仅响应轴(BoN)仅响应轴仅响应轴响应轴+奖励轴

2.2 SOLO 的坐标系:局部学习谱系与流水线并行

谱系一:私有 readout 局部学习。Belilovsky 等(ICML 2019/2020,贪心逐层/解耦训练到 ImageNet)、Löwe 等(2019,梯度隔离学习)、Laskin 等(2020,CURL 局部更新并行训练)、Nøkland & Eidnes(2019,局部误差信号)、Ma 等(ICLR 2024,增强辅助网络扩监督局部学习)、Yin & Corradi(2025,随机逐层学习)。这一谱系统一在「每个模块一个私有 readout(可学习或随机冻结)」,SOLO 只改这一个组件:把全部私有 readout 换成一个共享终端 readout 的只读副本。

谱系二:其他解 update locking 的路。合成梯度/延迟梯度(Jaderberg 2017 DNI、Huo 2018)、前向梯度(Baydin 2022)、LocoProp(Amid 2022)传递下游导数的估计;反馈对齐(Lillicrap 2016、Launay 2020)用固定矩阵传最终误差。SOLO 与它们的本质区别:模块间不传任何当前样本的误差或导数,只传一份参数副本——副本承载的是过去批次的摘要信息,因此模块保持梯度隔离,不构成隐式的误差回传通道。

谱系三:跨深度共享 readout 的端到端先例。早退模型(Elbayad 等 2020 Depth-Adaptive Transformer、Elhoushi 等 2024 LayerSkip)已证明多个深度可共享一个 LM head——LayerSkip 用「单共享头 + 各层早退损失」让中间层表征对齐词表空间;循环 Transformer 与 logit lens/tuned lens 一线也依赖跨层共享读出。但这些全部端到端训练(每个出口损失都更新 readout 与下层),证明的是「共享跨深度有潜力」,不能回答「没有梯度穿越时共享还有没有用」——SOLO 补的正是这块。

谱系四:流水线并行。GPipe、1F1B(PipeDream)、VPP(Megatron 交错式)、zero-bubble(Qi 等,ICLR 2024,拆分 B/W 传递消灭气泡但需更多内存)——所有这些调度都保留 update locking:每个 stage 必须持有激活直到梯度返回。SOLO 在同一划分下直接消掉这个依赖,与调度创新正交;局部学习流水线(Gomez 等 interlocking、Guo 等 PPLL)此前只针对图像分类器。

维度私有 readout 局部学习合成/前向梯度流水线调度优化(1F1B/ZB/VPP)SOLO
消除 update locking是是(估计值)否(优化等待)是(完全)
模块间传什么无当前样本误差估计完整梯度仅参数副本(无梯度)
readout 一致基否(各模块异基)不涉及单一 readout单一只读副本共享
LLM 十亿规模验证无(≤774M)无是(但非局部学习)是(340M–2B)

三、问题定义

3.1 DRM:奖励建模 ≈ 条件密度估计

具体问题:偏好标注呈实例级多峰(同一回答被一群人打 4 分、另一群人打 1 分),标量头与固定族头都无法表示。

抽象问题:奖励建模的本质不是回归一个值,而是估计一个条件密度 p(r|x,y)。给定(提示 x,回答 y),求奖励 r 的条件分布;约束是不预设任何参数分布族(因为分歧形态——簇数、位置、偏斜——是实例相关的,任何固定族都只能表示其中一类)。

这个抽象的精妙之处在于换头不换骨:冻结 LLM 编码器把(x,y)映射成语义表征 h,问题就变成「给定 h,r 服从什么分布」——一个标准的条件生成问题,恰好是扩散模型二十年修炼的主场。奖励建模从「判别问题」被重述为「生成问题」,此后一切工具(掩码损失、CFG、DDIM 采样、测试时多采样)都是生成模型的现成库存。

3.2 SOLO:update locking 的三重代价与「梯度隔离 ≠ readout 隔离」

具体问题:局部学习在语言模型上推不到十亿参数,症状是私有 readout 下质量崩坏(cos 对齐仅 0.52)且参数爆炸(K-1 个 67M 的 readout)。

抽象问题:SOLO 把每个模块收到的 BP 梯度精确分解为三项因式——

$$g_k^{BP} = \underbrace{M_k^\top}_{path}\underbrace{W^\top}_{readout}\underbrace{\delta}_{residual}$$

path 是「误差如何从末端传到第 k 层」(深层模块的雅可比),residual 是「末端损失对 logits 的导数」,readout 是「logits 如何映射回表征」。局部学习切断模块间梯度,等于把 path 与 residual 变成局部的——这必要(否则就回到 update locking)。但 readout 是一个参数而非当前样本上计算的信号,完全可以不隔离:让所有头共享终端 readout,readout 项按构造归零,模块间唯一流动的是「参数的延迟副本」——不携带当前样本梯度,不重建依赖。

要素BP私有 readout 局部学习SOLO
path(路径)全局(深层雅可比)局部局部
readout(读出)终端 W私有 W_k(异基)共享只读副本 sg(W̄)
residual(残差)末端 δ局部 δ_k局部 δ_k
update locking有无无
模块获得深层信息完整零参数级摘要(一步延迟)

形式化:给定 K 个模块的网络,求一种训练规则,使(1)模块间无梯度传递(保持可并行/可释放激活),(2)每个模块的局部梯度与 BP 梯度的偏差尽可能小,(3)附加参数与同步开销有界。SOLO 的答案:z_k = τ_k·sg(W̄)·φ_k(h_k),副本每步(或每 S 步)刷新。

四、问题解法

4.1 DRM:冻结骨干 + 轻量 DiT 扩散奖励头

架构(对应 2.1 节):

  • LLM 编码器(冻结):取 FsfairX-LLaMA3-RM-v0.1 的 8B 骨干,去掉标量头,输入(x,y)取末 token 隐状态 h ∈ R^d。编码离线预计算——语言表征学习与奖励分布建模解耦,前者免费复用已有 RM 的语义先验,训练成本只剩头本身。
  • 扩散奖励头:轻量 DiT(3 块、6 头、隐维 384),从高斯噪声去噪出 K 维奖励向量。条件 h 与时间步 t 通过自适应层归一化(AdaLN)注入每个 DiT 块——这正是 DiT 处理图像类条件的方式,此处把「类别标签」换成「文本语义表征」。

训练(一个头,两种监督):

  • 多属性回归(DRM-Multi-8B):K=19,ArmoRM 聚合语料 569K 样本。每个样本只标注部分属性,用掩码去噪损失——只在有标注的维度上计算预测噪声与真实噪声的 MSE,异构标注在统一奖励空间融合。等价于学习条件奖励分布的 score function。
  • 偏好对(DRM-Pref-8B):K=1,Tulu3 偏好混合 273K 对。偏好数据没有绝对分数,构造零中心对称伪奖励(chosen=+Δ/2、rejected=−Δ/2,margin Δ=1)提供去噪监督;同时从含噪奖励重建去噪估计 r̂₀ = (r_t − √(1−ᾱ_t)·ε̂)/√ᾱ_t,对其施加分布化 BT 损失 L_BT = −log σ(r̂₀^(w) − r̂₀^(l))。总损失 L_pair = L_denoise + λ_BT·L_BT(λ_BT=0.5)——排序信号与分布信号在同一框架内联合学习。附录证明该点态 BT 是全分布偏好似然(对两个分布采样的期望)的一个上界(Jensen 不等式)。
  • CFG 训练:以固定概率把条件 h 替换为可学习的无条件向量,为推理时的引导采样留门。

推理(分布即产品):DDIM 10 步、引导尺度 ω=7,采 N=32 个独立样本构成经验分布 p̂(r|x,y),再按下游需求聚合:均值(兼容标准 RLHF/BoN/基准协议)、方差(不确定性)、分位数(风险敏感)。论文强调这打开了两个正交的测试时缩放轴:响应轴(经典 BoN,任何标量 RM 都有)与奖励轴——固定 (x,y) 多采样本收紧紧致估计,单样本 56.5% → 32 样本 65.6%(RewardBench v2),这是标量 RM 按定义不具备的旋钮(确定性头对任何 N 输出同一个数)。

4.2 SOLO:stop-gradient 保留 + 终端 readout 只读共享

机制(对应图 1c):

  • 保留:模块间 stop-gradient(sg(h_{k-1}) 前向传值、反向截断)、残差路径、每个模块自己的辅助头 φ_k 与温度 τ_k。
  • 替换:私有 readout W_k → 终端 readout W 的上一步只读副本 sg(W̄)。z_k = τ_k·sg(W̄)·φ_k(h_k)。梯度可以穿过副本训练 φ_k 和 τ_k,但不更新副本;只有最终损失更新 W。第 t 步各头用 W̄ = W_{t-1},终端模块同时计算 W_t——延迟一步换来零等待。
  • 刷新节奏:每步刷新(S=1)在流水线下引入同步开销最多 7%;S=10–50 步刷新验证集 PPL 变化 ≤0.4%,S=100/200 则恶化 1.9%/3.0%——10 到 50 是质量与吞吐的甜点。
  • 副产品:K−1 个 V×d 私有 readout(各 67M 参数+优化器状态)被只读副本取代——K=2 时附加参数从 PRIV 的 16.7M 降到 4.8M,K=4 从 50.2M 降到 14.4M。

三项分解的预测与验证:局部梯度与 BP 梯度之差精确分解为 readout/residual/path 三项(4.3 节公式)。SOLO 令 W_k = W̄,readout 项按构造为零(τ_k 与副本延迟会重新引入小量);residual 与 path 项保留——共享不保证完美对齐,但消掉了最大的一项。

系统收益的机制链(这是 SOLO 的另一半贡献):

  1. 激活内存 O(p)→O(1):1F1B 下第一个 stage 必须同时持有 p 个微批次的激活(等梯度回来),激活内存等于不切分时的量、加多少 stage 都不降。SOLO stage 前向完立即本地反向、释放激活,只持 1 个微批次——激活内存随 1/p 下降。p=8 时 17.4→2.5 GB(p=2,4,6,8 分别降 1.9/3.7/5.4/7.0 倍,接近 p 倍)。
  2. 反向气泡消失:1F1B 的气泡占比 (p−1)/(M+p−1);SOLO stage 永不等待梯度,气泡为零(代价是辅助头计算,12 层/stage 时仅约 1.4%/模块)。
  3. 级间通信减半:只前向传激活、不反向传梯度。
  4. 慢链路容忍:1Gb/s 链路下 1F1B 吞吐崩 51%,SOLO 只降 1.2%——因为反向不等待梯度,慢链路卡不住流水线。
  5. 内存换吞吐:省出的激活内存换大 micro-batch(16),吞吐达同划分 BP 1F1B 最佳的 1.44×(等内存下 1.43×)——1F1B 无法做此交易(大 micro-batch 同时抬高其激活内存并加宽其气泡)。

五、评估指标与实验证据

5.1 DRM:五基准 + 分布保真 + 下游 RLHF

指标体系:主指标为五个 RM 基准的准确率(RewardBench v2 / PPE 偏好与正确性 / RMB 成对 / RM-Bench / JudgeBench,覆盖聊天、指令跟随、数学、代码、事实性、安全);分布保真指标为与重复人类标注经验分布的距离(Wasserstein/JS/L1,越低越好)与多峰率;决策价值指标为不确定性拒绝的覆盖率-精度曲线与 LCB 聚合增益;下游指标为 RLHF 后策略的 Arena-Hard v2 与 MT-Bench。

受控主对比(同数据同骨干,只有头不同):

模型(奖励头类型)平均RMB Pairwise
ArmoRM(标量多属性头)62.364.6
QRM-Llama3.1-8B-v2(分位格头)64.161.1
URM-LLaMA-3.1-8B(高斯头)66.165.7
DRM-Multi-8B(扩散头)66.278.0

DRM-Multi-8B 平均 66.2,超 ArmoRM +3.9、超 QRM +2.1,增益在 RMB 上最大(78.0 vs 64.6/61.1)——数据与骨干冻结后,改进只能来自头,这个实验设计干净地隔离了变量。

跨家族对比:DRM 超过 Eurus-RM-7B(61.8)、Skywork-Llama3.1-8B-v0.2(64.8),与 Nemotron-70B(67.8)接近;超过生成式 DeepSeek-GRM-27B(65.6),接近 GPT-4o(67.7)与 Claude-3.5-Sonnet(68.5)——以数十万级开源样本的训练规模。诚实的差距:与当期最强 Skywork-V2-Qwen3-8B(76.9,工业级千万级偏好数据)仍有约 10 点距离,论文在 Limitations 明说 DRM 是新范式首探、数据规模远低于工业 RM。JudgeBench 上 DRM 58.6 低于 GPT-4o 59.4 与 Claude 64.8(论文正文「超过多数」的表述需限定为非头部基线)。DRM-Multi 与 DRM-Pref 66.2 vs 65.8,框架跨监督类型可迁移。

分布保真(核心论点的直接验证):HelpSteer2-Disagreements 重复标注上,helpfulness 维度 DRM 与经验分布的距离三指标全部最低:Wasserstein 0.804 vs 经验先验 1.030 / 全局高斯 1.032 / 点预测 1.032;JS 0.215、L1 0.907 同为最低。多峰率随人类分歧单调上升:分歧小(range≤1)37.6% → 分歧大(range≥2)55.5% → 极化 63.2%;correctness 同型(37.6→54.7→62.0)。这是「扩散头学到的确实是分歧结构而非全局噪声」的关键证据——如果只是学了个全局不确定性模式,多峰率不该随实例分歧变。

分布即决策价值:(1)不确定性拒绝——按分布不确定性排序先拒最不稳的决策,覆盖率 100%→70%,PPE Correctness 平均 +2.81pp(MATH +6.20),RMB +4.567.31pp;(2)LCB 聚合——μ−λσ(λ=0.4)在全部 PPE BoN(N=232)与 RMB 设置上超过纯均值排序(如 RMB helpfulness K=3:68.231→68.611);(3)下游 RLHF——Tulu3-8B-SFT + UltraFeedback 同设置,DRM-Multi 作训练奖励:Arena-Hard v2 2.0(vs FsfairX 1.3 / ArmoRM 1.0)、MT-Bench 74.8(vs 73.6/71.5)。

5.2 SOLO:质量追平 + 机制归因 + 系统收益

指标体系:主指标为 token 匹配 BP 的 WikiText PPL 差距与六任务 zero-shot 平均准确率(340M/1.3B/2B,15B SlimPajama tokens);机制指标为局部梯度与 BP 梯度余弦 cos(ĝ_k, g_k^BP)、三项分解的范数占比、模块可解码性;系统指标为流水线激活内存、吞吐倍数、慢链路鲁棒性。

质量追平(且差距随规模收窄):

规模SOLO K=2 PPL 差SOLO K=4 PPL 差K=2 相对差K=4 相对差
340M1.013.153.6%11.2%
1.3B0.681.98~3.1%~9.2%
2B0.641.283.1%6.1%

zero-shot 平均 K=2 距 BP 0.5 点内、K=4 0.9 点内;K=2 时 SOLO 在 ARC-easy(340M、1.3B)上反超 BP。相对差距随规模单调收窄(K=4:11.2%→6.1%)——这是「首个推到这个规模」工作的最重要实证:局部学习的税随规模递减而非放大。LAMBADA 缺口最大(K=2 时 PPL 差 5.1→2.8→0.3,收窄最快);差距在前 2B token 形成、之后 13B token 保持平坦(不随训练恶化)。代价是辅助头 FLOPs 增加 11–13%(K=2)。

共享 vs 私有(等成本受控):同吞吐同内存下 SOLO 比 PRIV 降 Wiki PPL 0.42–0.60,zero-shot 平均升 0.5–1.6 点;LAMBADA 1.3B 28.1→22.8;40M–512M WikiText-103 扫描上 SOLO 领先 PRIV 2.1–4.7 PPL。

机制归因(readout 消融,五变体只动 readout):cos(ĝ_k, g_k^BP):RAND(随机冻结)0.32 → PRIV(私有学习)0.52 → SOLO 0.70,且排序在所有模块深度成立、与 PPL 排序一致。分解验证:SOLO 的 readout 项按构造为零(图 4c)。两个 PRETRAINED 变体(冻结已训好的 SOLO/BP readout 从头训新模型)作诊断探针:训好的 readout 更好(说明 readout 需要与模块共同成熟),但训好的 BP readout 反而比训好的 SOLO readout 差 1.0–2.0 PPL——有用的 readout 必须与局部模块共适应,不是越「强」越好。共享基而非共享内容:把训好的 readout 对每个模块用不同正交矩阵旋转(ROT,内容不变、基不同)PPL 恶化最多 13.3;反之共享一个随机矩阵(RSHARE,基同、内容随机)改善最多 12.0——起作用的是共享基本身。

跨模态边界条件:视觉(CIFAR→ImageNet-1k)上共享对 PRIV 无一致增益,随机 readout 在视觉几乎无代价而在语言最高 33%——词表/宽度比 26–85 倍时 readout 排布才关键,「共享只在 readout 重要的地方有用」。这个负结果让机制解释更干净:不是共享万能,而是大词表场景下基一致性必要。

模块可解码性(意外红利):保留辅助头即得免费早退——1.3B K=4 第一个模块出口 PPL 28.20 ≈ 340M 全模型 28.04;SOLO 中间层与最终预测一致率 71–75%,BP 模型只有 16–51%(BP 中间层表征对同一 readout 是「旋转的基」,不可直接解码)。每个更深的出口是对前一出口的精化而非重写。

系统收益(96 层 1.2B,8×A100,同划分):p=8 激活内存 17.4→2.5 GB;S=50 时 M=24 吞吐 1.18× 1F1B、超更快的 VPP 10%;micro-batch 16 达 1.44× 最佳 1F1B(等内存 1.43×);1Gb/s 慢链路吞吐仅降 1.2%(1F1B 降 51%)。诚实披露:24 层小模型固定 micro-batch 下 SOLO 只有 0.72–0.91× 1F1B(stage 层数少、头开销占比大),收益依赖每 stage 足够层数;系统研究在单节点内。

六、效果优势的根源解释

6.1 DRM:为什么迭代去噪能表示点估计头不能表示的东西

因果链(每步标注证据等级):

  1. 偏好标注呈实例级多峰结构——论文实验支持(Table 4:43.49% range≥2、28.20% 分离簇、24.34% 极化;MultiPref 45.64% 对侧判断)。
  2. BT/标量头把 p(r|x,y) 坍缩为点、固定族头按构造单峰——数学事实(高斯单峰;分位格受格分辨率限制)。
  3. 扩散去噪等价于学习条件分布的 score function,理论上可逼近任意连续密度(含多峰)——理论已知(Song 等 score-based SDE;Lipman 等 flow matching),图像领域有大量多峰覆盖实证。
  4. DRM 的经验分布拟合真实标注分布、分歧越大越多峰——论文实验支持(三距离指标全最低;多峰率 37.6%→63.2% 随分歧单调升)。
  5. 分布统计量提供均值之外的决策信号——论文实验支持(拒绝 +2.81~7.31pp、LCB 全设置正增益)。

第 3 步是整条链的「第一性原理」支点,且非本文自证——扩散的多峰覆盖能力是图像生成领域独立建立的(Dhariwal & Nichol 2021 的 recall 对比是定量标杆:扩散 0.53 vs BigGAN 0.28,模式覆盖差的直接度量)。DRM 做的是把这条已验证的性质「租借」到奖励维度:K 维(K=19 或 1)远低于图像的数万维,密度估计只会更容易。

反事实推理:若去掉掩码去噪损失只留 BT,头退化为普通 RM 的随机初始化版(无分布监督信号);若去掉 BT 只留去噪,偏好对上无排序监督(伪奖励目标本身不含区分度信息)。两者联合(L_pair = L_denoise + 0.5·L_BT)是分布与排序同时成立的必要条件——这解释了为何单一框架能同时吃两类数据。

6.2 SOLO:为什么共享 readout 使 readout 项为零、残差连接让「同一基」免费成立

因果链(每步标注证据等级):

  1. 局部梯度与 BP 梯度之差 = readout + residual + path 三项——论文推导(式 4,代数恒等分解)。
  2. 私有 readout 下 readout 项非零且大(cos 仅 0.52),各模块在不同基上预测同一词表——论文实验支持(分解范数与对齐测量)。
  3. SOLO 令 W_k = W̄ 使 readout 项按构造为零——数学事实(代入即得;τ_k 与副本延迟重新引入小量)。
  4. 残差连接(ResNet 式 skip)使每个模块的输出继承其输入的表征基——论文论证 + 可解码性证据(模块 h_k = h_{k-1} + f_k(h_{k-1}) 的加法结构意味着 h_k 与 h_{k-1} 在「同一坐标系」中,共享 readout 直接解码这个被继承的基;71–75% 中间层一致率 vs BP 的 16–51% 是直接证据)。
  5. cos 0.70 → PPL 差距收窄且随规模递减——论文实验支持(Table 2 全表)。
  6. 激活 O(1)/stage、气泡为零 → 内存换大 micro-batch → 1.44×——论文实验支持(同划分受控)。

第 4 步的「适配性论证」值得展开(这是 ResNet 残差与共享 readout 的深层契合):旋转 readout 实验(ROT)证明单纯内容相同、基不同就足以恶化 PPL 达 13.3——因为每个后续模块被迫「翻译」前一个模块的基。而 Transformer 的残差流本质是一个持续累加的通道空间:h_K = x + Σf_k(…),所有模块天然在同一个残差基上工作。终端 readout W 正是在这个基的末端训练的,把它共享给所有头,等于让每个头直接读出「这个共享基的当前状态」。这个论证同时解释了为什么共享随机矩阵(RSHARE)也有 12.0 的改善——基的共享性独立于内容的训练质量起作用,也解释了 LayerSkip 等端到端工作选择共享头的原因(跨域一致的独立证据)。

反事实推理:RAND 控制组(随机冻结、不共享)cos 0.32、PPL 最差——证明「共享」与「有信息的 readout」缺一不可;PRETRAINED(BP) 掉队 1.0–2.0 PPL——证明信息必须与局部模块共适应,单纯的「好 readout」移植有害。视觉负结果划定边界:小词表下 readout 排布无关紧要,共享无增益——机制解释预测了适用域,这是比「处处有效」更强的一致性。

6.3 外部检索交叉验证

围绕两篇论文的关键机制,本次检索发现的相关工作与对照(检索时间 2026-09-30;未能命中处如实说明):

研究(可核验链接)相似尝试相关结论与本文差异/边界对根源解释的影响
DPL, Siththaranjan 等, ICLR 2024奖励分布建模(高斯/类别两变体)隐藏上下文(标注者多样性)使 BT 隐式执行 Borda 计数;分布化+低分位优化降低越狱脆弱性固定分布族(单峰高斯/粗粒度类别);DRM 无族假设且给出多峰率随分歧增长的直接证据方法相似+结论相近:独立工作从安全性动机出发得出「标量 RM 有结构损失」一致结论,支持 DRM 的问题定义;DRM 的多峰表示是相对它的增量
Dhariwal & Nichol 2021, Diffusion Beat GANs扩散模型多峰覆盖(图像域)recall 0.53 vs BigGAN 0.28,定量证明扩散的模式覆盖优势图像生成≠奖励密度;DRM 是该性质向低维结构化输出的迁移结论相近(跨域):支撑「迭代去噪隐式覆盖多峰」的机制假设,但任务设定不同,不能直接当因果证明
LayerSkip, Elhoushi 等, ACL 2024跨深度共享 LM head(端到端)单共享头+各层早退损失使中间层可解码、自推测解码 2× 加速端到端训练(出口损失更新 head 与下层);SOLO 无跨模块梯度方法相似(不同训练范式):独立证明「共享头让中间表征对齐词表空间」有效,与 SOLO 的 71–75% 可解码性互为印证;限定:不证明无梯度时仍有效(SOLO 补此缺口)
Belilovsky 等, ICML 2019贪心逐层局部学习到 ImageNet局部学习在图像分类可追平端到端私有 readout、小词表、CNN;SOLO 指出其条件(小 readout)恰是语言模型不满足的方法相似:确认局部学习在 readout 不重要时可行——与 SOLO 的视觉负结果共同构成「readout 重要性决定共享收益」的一致图景
Zero Bubble PP, Qi 等, ICLR 2024流水线气泡消除(拆分 B/W 传递)同步语义下近零气泡,吞吐 +23~31%,代价是内存上升保留 update locking(激活仍需持有);ZB-1p 内存同 1F1B结论相近(不同机制):说明「气泡可用调度消但内存换」——SOLO 从依赖结构上消,内存反而降。两者正交可叠加(检索未发现叠加实验)
Meulemans 等, NeurIPS 2022(least-control) 及 目标传播框架, 2020生物合理的局部学习规则理论局部规则可匹配梯度方法(特定设定);TP≈Gauss-Newton理论与玩具/中等规模;无 LLM 预训练系统收益补充:为局部学习的可行性提供独立理论基础;不覆盖 SOLO 的共享 readout 机制(该谱系传目标/控制信号,SOLO 只传参数副本)
DRM 第三方解读(bayesiansapien 笔记)DRM 的独立摘要指出「均值打分被分布取代」的两用:低分位抗 reward hacking、高方差做路由信号博客笔记,无独立实验补充:风险敏感聚合的动机(hacking 集中在 RM 自信但错误的区域)与 LCB 实验设计自洽

检索范围的诚实说明:(1)「diffusion head 用于奖励密度估计」在本次检索范围内未发现 DRM 之外的独立工作(作为方法本体的首创性暂无反例,但检索覆盖有限,不能断言不存在);(2)「readout 三项分解+共享终端 readout」在局部学习文献中未检索到前例,SOLO 引用的 Shing 等 2026(DiffusionBlocks)、Shi 等 2026(局部学习后训练)为同期工作未能获取全文核对;(3)未发现直接挑战「扩散头优于固定族头」或「共享 readout 优于私有」结论的相反证据——最接近的限定是 SOLO 自己的视觉负结果(共享增益仅在大词表场景成立)与 DRM 自己的 Limitations(数据规模有限、单一 8B 骨干、与最强工业 RM 仍有差距)。

6.4 综合判断与未决问题

多研究共同支持的机制:(1)奖励分布的多峰性是真实数据结构而非噪声(DPL 的隐藏上下文理论 + DRM 的重复标注统计 + 此前的标注者分歧研究三方一致);(2)共享 readout/头使中间表征可解码(LayerSkip 端到端 + SOLO 无梯度两种训练范式独立成立);(3)update locking 的消除带来激活内存 O(1)/stage(BP 调度文献的全部内存分析反向印证:1F1B 第一 stage 持 O(p) 是公认事实)。

仍属合理推测的部分:(1)DRM 的多峰率上升(37.6%→63.2%)与「分歧越大越多峰」之间是强相关而非因果证明——存在「头对难样本输出更宽分布」的替代解释,需逐样本控制分歧来源(价值观差异 vs 理解差异)才能区分;(2)SOLO 的「差距随规模收窄」基于三个规模点的外推(340M/1.3B/2B),4B~70B 行为未知,作者也承认未测 MoE、GQA、长上下文与后训练;(3)PPL 差距收窄的机制(残差基继承假说)有可解码性间接支持,但无直接干预实验(如逐层测量基旋转角)。

适用条件与失效条件:DRM——收益依赖标注分歧真实存在(客观可验证域收益会缩水)、推理需 N 次采样(延迟敏感场景受约束)、与最强数据规模 RM 的差距未消除;SOLO——需要每 stage 足够层数摊薄头开销(24 层小模型固定 micro-batch 反而 0.72–0.91×)、K=4 以上精度税明显(+6.1%)、多节点扩展(异步刷新副本)尚未验证。两者的共同失效边界:把它们当作「普遍更好」而忽略场景——DRM 在共识强的任务、SOLO 在浅模型细划分下,退化到与 baseline 相当或更差。

七、必要知识反推

假设让一个没有任何背景的人重做这两项工作,最少需要知道什么?

7.1 领域知识层

  • RLHF 中 RM 的角色与 BT 训练(DRM):不知道「RM 是策略优化的目标函数、其缺陷会被策略利用」,就不会意识到奖励头形态值得动。
  • 标注分歧的实证形态学(DRM):必须知道 HelpSteer2-Disagreements 这类重复标注数据集存在、且分歧呈簇/极化结构——这是「分布应该长什么样」的唯一地面真值来源。
  • 奖励头三大家族的实现细节(DRM):ArmoRM 的多属性门控、URM 的高斯头、QRM 的分位格——不知道对手的参数化方式,无法论证「它们都承诺了分布族」。
  • BP 的 update locking 与流水线并行的调度细节(SOLO):1F1B 每个 stage 持有多少激活、气泡公式 (p−1)/(M+p−1)、VPP 的内存-气泡交换——这些是「系统收益」一半贡献的度量衡,不知道就无法设计同划分受控实验。
  • 局部学习二十年谱系(SOLO):从贪心逐层到 CURL 到增强辅助网络,以及它们全部使用私有 readout 这一共同点——谱系盲会看不出「只改 readout」是一个值得单独隔离的变量。

7.2 方法论知识层

  • 扩散模型的 score 视角(DRM):去噪目标等价于 score matching、条件生成即条件密度估计、CFG/DDIM 是现成推理工具——把「奖励建模」翻译成「条件生成」的语法表。
  • 梯度分解的分析方法(SOLO):把局部与 BP 梯度之差写成 path·readout·residual 三项因式——这是代数技巧,但知道「分解后再逐项消去」这个方法论(类似控制变量在梯度空间的版本)才会去尝试。
  • 受控对比的实验设计(两篇共用):同数据同骨干只换头(DRM)、同吞吐同内存只换 readout(SOLO)——变量隔离是两篇论文结论可信度的共同支柱。
  • 早退/可解码性作为诊断(SOLO):中间层能否被终端 readout 解码,是「表征是否在共享基上」的可观测代理——把抽象的「基一致性」变成可测量的量。

7.3 工程知识层

  • 冻结骨干+离线预计算表征(DRM):8B 编码器前向一次缓存、12M 级头反复训练——这是让「换个头」的实验在学术算力下可行的工程决策。
  • DDIM 10 步 + 批量 32 采样(DRM):推理成本控制——扩散头若要上千步采样就没有实用价值,10 步×32 样本的配置选择决定方法可用性。
  • 副本刷新周期与同步代价的权衡(SOLO):S=1 每步同步代价 7%,S=10–50 质量≤0.4% 损失——工程参数空间的测绘让方法落地。
  • 流水线微批次-内存-吞吐三角(SOLO):为什么 1F1B 峰值在 micro-batch 4 而 SOLO 能吃到 16——不理解这个三角,就只会把省的内存闲置而不是换成吞吐。

7.4 知识融合的关键节点

两篇论文的「化学反应」都发生在跨域概念的精确对位上:

  • DRM 的节点:「条件密度估计 ≈ 条件生成」。把 p(r|h) 看成一个以 h 为条件的生成目标,扩散模型库存(AdaLN 条件注入、掩码损失处理异构标注、CFG 增强条件依从、DDIM 快采样)逐件搬进奖励建模。缺任何一件(比如不知道掩码损失)融合都不完整。
  • SOLO 的节点:「readout 是参数不是信号」。update locking 的分析都聚焦在信号(梯度)上,SOLO 看出三项分解中 readout 这一项的特殊性——它是参数、可以廉价地跨时间复制共享而不引入当前样本依赖。这个「信号 vs 参数」的二分是整个方法的认识论基础。
  • 两篇共用的元节点:「哪些旧组件在新规模下被错误地保留了」——DRM 发现奖励头保留着统计小数据时代的点估计形态,SOLO 发现局部学习保留着小词表时代的私有 readout 设计。识别「历史的默认值」而非「当前的缺陷」,是两项工作共同的思维起点。

八、论文中可以提取的通用性灵感

灵感一:旧技术的规模化复活有一套可复用的动作模板

核心思想:一项技术在领域 A 成熟后被搁置,往往不是因为思想错误,而是因为当时的一个配套组件不适配领域 B 的规模条件;诊断出那个组件并替换之,即可解锁。

论文证据:DRM——扩散模型在图像成熟,「从未用于奖励建模」的障碍是没人把奖励向量当作去噪目标+处理异构偏好标注的掩码损失;SOLO——局部学习在图像成熟,「从未用于十亿 LLM」的障碍被诊断为私有 readout 在大词表下的三重失效(参数爆炸/异基错位/深层信息缺失),一个只读副本解决。

推广场景:(1)Mamba/线性 RNN 的状态空间思想在语音识别衰落后于 2023 年以 SSM 之名在 LLM 复活;(2)检索增强在符号时代(CASE-based reasoning)式微后以 RAG 复活;(3)数据库领域的Late Materialization 在列存引擎中复活;(4)硬件领域 Chiplet 是多芯片模块化(MCM)思想在先进制程成本压力下的复活——每个案例都可套用「识别被搁置技术→诊断规模障碍→单点替换」的三步。

灵感二:把点估计升级为分布估计,决策价值是免费的午餐

核心思想:只要训练目标是拟合而非预测,输出从「值」变成「分布」后,均值之外的所有统计量(方差、分位数、超越概率)都是新决策信号,不需要额外建模成本。

论文证据:DRM 的经验分布带来不确定性拒绝(+2.81~7.31pp)、LCB 风险敏感聚合(全设置正增益)、奖励轴测试时缩放(56.5%→65.6%)——三个下游能力全部来自同一分布的免费读出。

推广场景:(1)天气预报从点预报到概率预报(降水概率、路径锥)后的应急决策分级;(2)软件工期的分布估计替代点估计,做排期的风险缓冲;(3)推荐系统的兴趣分布替代兴趣点,支持多样性探索;(4)金融风险中 VaR 到期望损失(ES,分布低分位)的演进;(5)机器运维的剩余寿命分布(而非均值)决定维护窗口。

灵感三:「隔离什么」要逐项审查,默认捆绑的组件可能只需要隔离其中一半

核心思想:一个约束(如局部学习的梯度隔离)实现时常把多个组件捆绑在一起隔离(梯度+readout),但逐项分析可能发现部分组件的隔离既无必要又高成本——只隔离必要的,收益立即释放。

论文证据:SOLO 把 update locking 的要求精确化为「path 与 residual 必须局部」,readout 无需局部——共享后 cos 0.52→0.70、参数 16.7M→4.8M、附带早退红利(模块可解码率 71–75%)。

推广场景:(1)微服务拆分时「数据隔离」常被捆绑实现为「代码库隔离」,前者必要后者可选;(2)安全沙箱中「文件系统隔离」与「网络隔离」的必要性各自审查;(3)联邦学习中「数据不出域」与「模型结构不可见」的解绑;(4)组织设计中「职能隔离」vs「信息隔离」——合规要求的常只是后者。

灵感四:残差结构让「共享终端」天然合法——架构特征决定共享策略

核心思想:当系统组件通过累加式(残差)结构耦合时,末端训练出的「读出/解释器」对上游组件天然可复用,因为所有组件工作在同一坐标系;推翻这一点的成本(强迫各组件翻译坐标)远高于共享。

论文证据:SOLO 的旋转实验(ROT 恶化 13.3 PPL)与随机共享实验(RSHARE 改善 12.0)分离了「基共享」与「内容质量」两个因素;LayerSkip 在端到端设定下独立得出相同选择。

推广场景:(1)多级缓存层级共享同一序列化格式 vs 各自转换的协议设计;(2)GAN 判别器中间层与生成器的「表征基对齐」问题(特征匹配损失);(3)公司各业务线共享统一数据字典 vs 各自维护口径(口径不一致=基旋转,对账=翻译成本);(4)编译器 IR 设计——多层 pass 共享同一中间表示避免反复降级。

灵感五:负结果划定机制的适用域,比普适性宣称更有信息量

核心思想:主动找到方法不奏效的条件并解释为什么,能反过来确认机制解释的正确性——机制应该预测自己的失效边界。

论文证据:SOLO 的视觉实验(共享无增益,因词表/宽度比小、readout 无关紧要)与 24 层小模型系统负结果(头开销占比过高);DRM 主动披露与 Skywork-V2 的 10 点差距和 JudgeBench 低于 GPT-4o 的事实。

推广场景:(1)药物临床的亚组分析(对哪类人群无效)指导精准用药;(2)A/B 测试的分群异质性分析;(3)算法工程的「适用条件文档」(如哈希表 vs 树的访问模式边界);(4)物理学的经典力学适用边界(低速宏观)反而确认了相对论的机制。

灵感六:「参数副本」是介于「无通信」与「梯度通信」之间的第三种模块间通道

核心思想:分布式系统中模块解耦不等于零通信——传递「状态的延迟快照」(参数、统计量)既能传递全局信息又保持决策独立性,是常被忽略的中间态设计。

论文证据:SOLO 的 sg(W̄) 每步(或每 S 步)广播一次,模块拿到的是「深层模块对过去批次的摘要」,据此独立决策;与反馈对齐(传当前误差)与 BP(传当前梯度)形成三通道谱系。

推广场景:(1)异步 RL 的目标网络(target network)——延迟参数副本稳定学习;(2)DiLoCo 等低通信训练中周期性同步全局参数;(3)微服务的事件溯源/最终一致性——副本同步替代实时调用;(4)组织中的周报制度——延迟状态广播替代逐次审批,保持团队自主性;(5)货币体系的中央银行利率信号——参数级引导而非指令级计划。


附录:两篇论文对照速览

维度DRM(arXiv:2609.33803)SOLO(arXiv:2609.35440)
被复活的技术扩散生成模型(2020–)局部学习(1990s–,图像成熟)
规模化障碍无人把奖励当去噪目标+异构标注融合私有 readout 大词表下失效
机制创新掩码去噪+分布化 BT 统一头终端 readout 只读共享副本
关键实证多峰率 37.6→63.2 随分歧升cos 对齐 0.52→0.70、差距随规模收窄
受控增益66.2 vs ArmoRM 62.3(+3.9)K=2 PPL 差 0.68(2B)、1.44× 吞吐
系统红利奖励轴测试时缩放(56.5→65.6)激活内存近 p 倍降、慢链路仅降 1.2%
诚实边界与 Skywork-V2 差 ~10 点、需 N 次采样15B tokens/2B 参数止步、K=4 税 6.1%
机构清华 thunlp+港中文+UIUC(高校合作)中科院自动化所(单一机构)