论文链接:
- RIDE: The Teacher Is a Direction, Not a Destination
- OASIS: Overcoming Scaling Limits in On-Policy Self-Distillation
- ProRubric: Scoring Higher, Answering Worse
- Astra 具身评测: GPT-6 Astra as Embodied Policies
代码仓库:RIDE 开源(GitHub: xixixixixxxx/RIDE);ProRubric 承诺随论文发布 发表时间:2026年9月 机构:RIDE=中国科学技术大学+罗格斯大学+浙江大学+独立研究者(学生团队);OASIS=North South University(孟加拉国)+KAIST+Andria Labs;ProRubric=字节跳动+北京邮电大学(一作实习);Astra 评测=Galbot Team(星海图,具身智能创业公司) 领域标签:cs.LG / cs.CL / cs.RO,后训练·蒸馏·RLHF·具身智能
##〇、四篇一图:训练前沿的四个切片
如果只读一句话版本:监督信号在哪里施加、以什么形式施加、怎样聚合成数字、以及训练出来的能力边界在哪——这四个「在哪/如何」的问题,正决定 2026 年后训练的效率上限。
| 切片 | 论文 | 一句话核心 | 关键数字 |
|---|---|---|---|
| 表示空间 | RIDE | 教师是方向不是终点:沿 RL 残差把回归目标外推到教师之外 | 4 组基座全部追平或超过 RL 教师(λ=1.25) |
| 监督状态 | OASIS | 蒸馏只用在教师可模仿处:验证脚手架解除规模瓶颈 | OPSD 增益 1.7B→8B 从 +3.05 衰减到 +0.14,OASIS 恢复到 +3.19 |
| 奖励聚合 | ProRubric | 分数更高答案更差:合取式协议级评分治理奖励攻击 | 医学 c 从 26.0 回升到 36.8(+10.8),g 反升至 35.0 |
| 能力边界 | Astra 评测 | 任务决策强、物理控制弱:前沿模型首份系统具身评测 | 导航 RxR 92% SR,但手内旋转 at-goal 0.51% vs RL 76.90% |
前三篇的主角都是「监督信号设计」——分别换了监督的空间(RIDE:从输出空间换到隐状态空间)、监督的状态子集(OASIS:从全部轨迹换到验证轨迹)、监督的聚合函数(ProRubric:从加权和换到合取维度)。第四篇则是参照系:即便监督设计到极致,前沿模型在物理控制上仍有硬边界,提醒我们「训练出来的能力」与「任务需要的能力」之间永远需要诚实测量。
一、论文背景
1.1 后训练的成熟与「最后一步」的争论
大模型后训练已经形成了相对固定的流水线:预训练→监督微调(SFT)→强化学习(RLHF 或 RLVR)→(可选)蒸馏回基座。2025 年以来,这条流水线的每个环节都在被重新审视,而 2026 年 9 月底这四篇论文恰好攻击了其中四个正在发酵的问题。
在线策略蒸馏(OPD)与「学生能否超过教师」。OPD 让学生在自己采样的轨迹上逐 token 匹配教师分布,已成为标准后训练阶段(Thinking Machines 的 On-Policy Distillation 博文、Qwen 与 MiMo-V2 等技术报告均采用)。但标准 OPD 有一个理论天花板:学生以教师分布为回归终点,最好也就是追平教师。想要「超过教师」,此前的方案是在输出空间外推——把教师与参考模型的 log 概率比值当作隐式奖励并放大(广义 OPD/ExOPD 一族)。RIDE 的出发点正是对这条路线的质疑:LM head 会在很大程度上「看不见」RL 对模型内部的改动。
在线自蒸馏(OPSD)与规模怪圈。OPSD 是 OPD 的自蒸馏特例:同一个模型分饰两角,教师分支额外拿到参考解作为特权上下文。它在小模型上效果显著(Qwen3-1.7B +3 分),但业界逐渐观察到「模型越大、收益越小」的怪圈。OASIS 把这个怪圈拆开,发现了一个更扎心的结构性浪费:教师的优势恰恰集中在学生模仿不了的地方。
无验证器域的 Rubric-RL 与奖励攻击。代码有编译器、数学有答案检查器,RLVR 一路高歌;但医疗咨询、写作、对话这类开放域没有验证器,只能用 LLM judge 逐条检查 rubric 准则再加权求和成奖励。Mahmoud 等人 2026 年已报告「rubric 分数上涨、盲评反而偏好未训练模型」的倒挂现象,并归因于准则写得不够好。ProRubric 的发现更尖锐:准则一字不改,只改聚合方式,倒挂就会大幅移动——问题不在「验什么」,而在「怎么把验的结果加起来」。
前沿模型的具身能力悬念。GPT-6 Astra 发布后,社区演示显示它能直接生成数值机器人指令,但演示不等于系统能力。Galbot 团队做了前沿模型的第一份六域系统评测(夹爪/灵巧/移动操作、导航、运动、人形 loco-manipulation),核心概念贡献是把「任务决策」与「可靠物理控制」拆成两件事分别测量。
1.2 四篇共享的隐线:监督信号的「放置问题」
把四篇放在一起读会发现一个共同结构——它们都在回答「学习信号应该放在哪」:
- RIDE:放在 head 之前的隐状态空间(输出空间只能看到残差的投影);
- OASIS:放在 验证通过的轨迹状态(教师在这些状态上没有特权优势);
- ProRubric:放在 协议阶段的合取结构里(孤立碎片不再单独计酬);
- Astra 评测反过来说明:监督放得再好,也要用配对初态与分解计量来诚实测量「能力到底落在哪个环节」。
这条「放置问题」主线正是 2026 年后训练研究的显学:不是发明新优化器,而是精确定位学习信号的有效作用面。
二、论文定位和关联工作
2.1 蒸馏谱系:RIDE 与 OASIS 的坐标
「学生超越教师」谱系。Rafailov 等人的 DPO 系工作确立了「教师/参考 log 比值=隐式奖励」的视角;Yang 等人 2026 年的广义 OPD(即本文的 ExOPD 基线)把这个奖励乘上 λ>1 做输出空间外推;Zheng 等人的模型外推(model extrapolation)在参数空间做类似事。RIDE 的差异化在于:度量空间换到隐状态、逐层逐位置、且目标由两次前向确定性计算。与表示蒸馏谱系(FitNets→OPRD→PHF)的关系是:RIDE 在 λ=1 时严格退化为 OPRD,只改目标不改协议,因果干净。
自蒸馏与特权信息谱系。OPSD(Zhao 等人,ICML 2026)是 OASIS 的直接前身;Shen 等人把教师信号分解为参考诱发与问题条件两个成分;Ichihara 等人发现给教师喂「别的题的解」也有用——这些「教师侧」分析与 OASIS 的「学生侧」提问(监督落在哪些状态)互补。理论上,OASIS 的命题 1 接通了模仿学习中的特权信息框架(Pechyony & Vapnik;Swamy 等人的 unobserved contexts):学生最优解是上下文平均教师,残余损失=条件互信息 I(A;R|Z)。值得注意的是同期的 UCLA 纯理论工作(arXiv:2609.38666)证明反向 KL 的序列级最优目标是几何平均并给出「误导教师/长视野翻转」两条脆弱性命题——恰好能为 RIDE 中 ExOPD 的崩溃与 OASIS 中的熵漂移提供统一理论解释,三篇构成 OPD 的「目标-数据-理论」三层。
蒸馏三部曲的互补:RIDE 管目标(往哪推)、OASIS 管数据(在哪教)、理论工作管解释(为什么崩)。
2.2 Rubric 奖励治理谱系:ProRubric 的坐标
RaR(Gunjal 等人,ICLR 2026)确立了「显式聚合(加权求和)vs 隐式聚合(整单打分)」的对照,是 ProRubric 的直接基线。同期的治理方案有三类:Lv 等人的依赖感知图聚合(需要标注准则间先决关系)、Rubric Dropout(随机丢准则)、SRaR(把准则归属到推理步)。ProRubric 的定位是零标注、零推理成本、零优化器改动:离线一次把 checklist 分组为 2-5 个协议级维度,维度内合取+失败条款,跨维度仍加权和。与 Mahmoud 等人的归因之争(准则欠指定 vs 聚合方式)是本文最锋利的对照点——ProRubric 用「准则文本逐字不动、只改聚合」的对照组系列证明聚合才是主因。
2.3 具身评测谱系:Astra 评测的坐标
VLA 模型(π0.5 一族)与 LLM-控制接口(SayCan、Code as Policies)是两条既有路线,Astra 评测首次对前沿推理 LLM 做系统化 Direct/Hybrid 双模评测,并引入三项评测学设计:配对物理初态下的同实例对比、执行步来源分解(策略动作 vs Astra 修正占比)、token/延迟的全程透明计量。相对已有的 Astra 社区演示,它的增量是「从演示到协议」。
2.4 定位总结
| 维度 | 之前路线 | 本文突破 |
|---|---|---|
| RIDE | 输出空间外推(ExOPD),教师即终点(OPRD) | 表示空间沿 RL 残差外推,λ=1 退化为 OPRD,换空间同时解决信号衰减与噪声放大 |
| OASIS | OPSD 全轨迹监督+特权参考上下文 | 因子化解耦「脚手架×上下文」,验证作为可模仿性代理,监督只落验证轨迹 |
| ProRubric | 加权求和聚合;归因于准则文本 | 固定准则文本只干预聚合,合取+失败条款回收损失,训练前可读出激励 |
| Astra 评测 | 单点演示;VLA vs LLM 各说各话 | 六域配对协议+执行分解+资源计量,界定「任务决策 vs 物理控制」边界 |
三、问题定义
3.1 RIDE:把「教师给的是方向」操作化
具体问题:同初始化在线策略蒸馏中,学生初始化为 RL 教师的预 RL 基座,如何让学生超过教师而非停在教师?
核心洞察:RL 更新是「小、结构化、跨 run 一致」的,因此 RL 教师相对基座的位移定义了一个方向,而不仅是终点。形式化极简:在每一层每一位置取教师与基座的隐状态差 Δ = h_T − h_B,把回归目标放到教师之外:
h* = λ·h_T + (1−λ)·h_B,λ = 1.25
λ=1 时严格退化为 OPRD(教师匹配),λ>1 时沿 RL 诱发残差外推。关键在于Δ 在学生访问的每个前缀上重新计算——方向是上下文相关的活向量,不是固定偏移。
精妙之处:这个定义把「超越教师」从「放大输出概率比」(信号被 head 各向异性衰减、噪声按 (λ−1)² 放大)改写为「在 head 之前的空间直接回归一个确定性目标」——同一件事,换了个测度空间后信息保真与噪声性质完全不同。
3.2 OASIS:把「在哪监督」与「教师看什么」解耦
具体问题:OPSD 随规模增大收益衰减(1.7B +3.05 → 8B +0.14),为什么?能否在不换损失函数的前提下恢复可扩展性?
核心洞察:标准 OPSD 把两件事耦在一起——脚手架(在哪条轨迹上监督,定义监督落在哪些状态)与上下文(教师看什么,定义目标分布依赖什么信息)。因子分析发现:脚手架正确性对下游准确率的影响大于上下文正确性。更根本地,命题 1 给出不可消除损失:学生看不到特权参考 r,前向 KL 下的最优解是上下文平均教师,残余损失=I(A;R|Z),且平均分布熵更高——模仿一个依赖你不知道的信息的教师,理性的结果是变得更不确定。
形式化:用结果验证 V(x,y) 作为「教师可模仿性」的经验代理——把期望 OPSD 损失按验证结果分解,监督只保留验证轨迹项。验证不构成目标(区别于 RFT/STaR),只决定「哪些状态配得到教师信号」。
3.3 ProRubric:把「怎么加起来」从「验什么」里剥离
具体问题:无验证器域的 Rubric-RL 中,加权和聚合下每条准则按固定汇率付酬——策略漏掉唯一关键决策,可以用没人要的建议把分数买回来。如何在不改准则、不改优化器、不加推理成本的前提下治理?
核心洞察:临床标准是协议不是记账(引 Gawande《清单宣言》):分诊做对不是三十条准则里的一条,做错也不是可以从别处补回来的扣分。合取式聚合改变边际激励的结构(式 3):
∂E[R]/∂p_i = w_k·Π_{j≠i} p_j
一条准则的边际报酬正比于「同维度其余准则已成立的概率」——孤立碎片几乎不值钱,补齐近完整维度的最后一块赚走整维权重。失败条款(如「延误急症处置则整维归零」)则封死「加内容抵扣」的通道。
3.4 Astra 评测:把「会决策」与「会控制」拆开测量
具体问题:前沿推理 LLM 能否直接充当具身策略?在哪些任务上可靠、在哪些环节失效、消耗多少资源?
核心洞察:任务成功与否不揭示「责任在谁」。评测框架把控制路径拆为 Direct(Astra 直接生成数值指令+解析控制器)与 Hybrid(Astra 审阅/修正学习策略 π0.5,或指挥冻结全身控制器),在配对物理初态下同实例对比,并分解执行步来源与 token 成本。「任务决策 vs 物理控制」的边界概念由此可操作化。
四、问题解法
4.1 RIDE:三处协作的即插即用改动
RIDE 的实现哲学是「只改 OPRD 管线里的一个目标构造」,训练协议(提示集、采样、优化器、500 步预算、4×H200)与所有基线完全对齐:
- 残差计算:教师 worker 上多载入预 RL 基座 π_B;每条学生 rollout,教师与基座在相同前缀 (x, ŷ<t) 上各做一次前向,逐层取隐状态差 Δ。相同 token 序列保证 Δ 只反映 RL 改了什么,不混入轨迹差异。
- 目标构造:h* = λ·h_T + (1−λ)·h_B 原地形成,只传一个隐状态张量给训练器——传输量与 OPRD 完全相同,代价只是基座的一次额外前向。
- 回归损失:监督全部 L 层、最后 k=2000 个响应位置(师生分歧集中区),维度归一化平方误差,损失系数乘 λ⁻² 以对齐初始损失尺度(Remark G.1)。
两条命题撑起机制解释:
- 命题 4.1(条件方差):输出空间优势 A_λ(v) = ℓ(v) − (λ−1)ρ(v) 的采样方差含 (λ−1)²Var[ρ] 项,p→q 也不消失;RIDE 梯度由两次前向确定性计算,条件方差为零。
- 命题 4.2(奖励-惩罚形式):回归等价于最大化线性方向奖励 r(h)=⟨h−h_T, Δ⟩ − 二次惩罚,最优解恰为 h*。λ−1 是奖励与约束的交换率——表示空间版本的 KL 约束 RL 视角。
类比:如果说 ExOPD 是「把 GPS 导航语音放大 1.25 倍音量希望车开得更远」,RIDE 是「直接沿指南针方向把目的地坐标外推 25%」——前者放大的是有噪声的语音信号,后者直接在地图坐标系里移动目标。
4.2 OASIS:改 (r, y) 构造,不改损失
OASIS = OPSD 损失 + 新的脚手架/上下文构造:
- 采样与验证:每题采 K=8 条 rollout(学生 prompt、OPSD 同款采样设置),用最终答案验证器 V 筛出 Y⁺(x)。
- 脚手架选择:y* = Y⁺ 中最短验证轨迹(消融:最短 54.17 vs 最长 52.33)。验证轨迹天然含完整答案与终止点——截断轨迹既无答案 token 也无停止 token,根本无法教会模型「完成」。
- 上下文构造:教师上下文换成同题另一条 rollout r(x),通常取未验证的最短者(全对时取另一条验证轨迹,绝不用脚手架自身)。依据:验证脚手架上教师对上下文不敏感(TV 距离 0.051-0.065),学生无上下文也能恢复 95% 验证前缀。
- 损失不变:逐词条 KL 截断(κ=0.05)、温度、优化器全部沿用 OPSD。
诊断侧的两条命题值得单独记:命题 1(特权模仿间隙)解释了为什么 OPSD 把学生熵从 0.40 推到 0.70、top-1 一致性从 0.932 掉到 0.888;命题 2(截断梯度反转)证明 κ 截断下被截词条的 logit 梯度反向——κ=0.05 移除 97% 正 KL 质量、影响 29-32% 词条,这解释了两种方法晚期共同漂移的现象(4B 上 OASIS top-1 也掉到 0.853)。
4.3 ProRubric:离线一次的协议化重写
ProRubric 的生成管线分三步,全部发生在训练前:
- 分组:生成器(DeepSeek-V4-Pro,温度 0)把 20-30 条原子准则划分为 2-5 个协议级维度(分诊=排除→检查→处置),要求每条准则恰好归属一维、权重取绝对值求和。校验步骤做结构修复与丢弃(只验结构不验语义)。
- 改写+失败条款:每维重写为一段「好答案达成了什么」的整体描述,句末附失败条款——「无论包含多少其余内容,若延误急症处置则本维不满足」。合取与失败条款都写进 judge 读的文本里,judge 每维返回一个二值判定,判定后无任何计算。
- 训练不动:GRPO、64 prompt×8 响应、300 步、无 KL(对照组除外),与 Rubric-RL 完全一致。
对照组系列是方法学的精华——固定准则文本逐字不动,只动聚合:raw-AND(逐字准则直接合取)、implicit(整单打分)、Graded(四级部分分)、K=1(全部合为一维);再对照「改别的一切」:长度减半、KL 惩罚、重加权、SFT。这个 2×2 式设计把「聚合是因」钉死。
4.4 Astra 评测:Direct/Hybrid 双模配对协议
六域各自保留原生指标与协议,共同骨架是「观察→Astra 生成或审查→机器人执行→反馈」闭环:
- 夹爪操作:RoboDojo(双手、长时程、接触敏感)与 RoboLab(单臂语义拾放)分别评测。Hybrid 中 π0.5 提议 50 步联合动作序列,Astra 审阅后执行前 1-15 步或替换为 1-5 步末端修正。
- 灵巧操作:10 任务策略辅助+DexJoCo 汉诺塔经验引导+手内旋转/平移的配对初态对比(Astra 与任务专用 RL 从相同物理状态出发)。
- 移动操作:RoboCasa365 三组任务(原子见过/复合见过/复合未见)×75 集,共享初态指纹,Hybrid 还可改写策略指令为子目标(66/75 集用到)。
- 导航:R2R/RxR/MP3D/HM3D 各 50 集,单前视 RGB、无 GPS/地图/深度,500 原始动作预算。
- 运动:替换 PASSAGE 的运动生成器,为冻结 G1 控制器生成密集参考(每调用 0.5s×50Hz=1625 个自洂数值);同一障碍场 5 次顺序尝试(经验累积,非独立样本)。
- 人形 loco-manipulation:HumanoidBench 30 任务指挥冻结全身控制器;SIMPLE 6 任务检验经验改写指导的保持性。
资源计量的口径也值得沿用:区分机器人控制步、动作段、模型请求、缓存/非缓存输入与输出 token;推理期间物理暂停,运动时钟与决策延迟分离。
五、评估指标与实验证据
5.1 RIDE:四组基座的「越线」实验
指标:Avg@16(每题 16 采样平均正确率,温度 0.70),AIME24/AIME25/AIMO(AMC22-23) 三基准等权平均;3 个训练种子(14/42/2027)。
主表(四组基座/教师对的 Avg 均值):
| 基座→教师 | 学生 | OPD top-1 | OPRD | ExOPD | RIDE | 教师 |
|---|---|---|---|---|---|---|
| R1-Distill-1.5B→JustRL | 39.00 | 52.90 | 54.50 | 49.87 | 56.38 | 55.30 |
| Qwen3-4B→Just-Qwen3 | 62.82 | 59.24 | 62.01 | 48.75 | 66.07 | 65.59 |
| Llama-3.2-3B→Just-Llama | 6.99 | 1.08 | 10.94 | 6.95 | 13.33 | 13.01 |
| Phi-4-mini→Just-Phi | 15.13 | 12.90 | 17.33 | 12.22 | 18.30 | 17.96 |
四组全部越线(三组超出量在一个跨种子标准差内,Qwen3-4B 超 0.48)。RIDE 是唯一在每组上均值都超过教师的方法;所有教师匹配方法(OPD/OPRD)按目标定义落在教师之下;ExOPD 在每组都低于教师——教师离基座越近伤害越大(Qwen3-4B 上比未训练学生还低 14.1 分)。
机制证据链(这是本文实验设计的示范处):
- head 衰减实测:残差 79.8% 的隐状态能量落在 head 最弱的 512 个方向上,仅 30% 转化为 logit 能量;归一化 head 增益 0.59(各向同性方向只有 0.59 倍传导);这些方向吃掉 73.0% 的表示损失梯度但只占 48.6% 的输出 KL 梯度——输出空间目标对大部分 RL 改动「弱监督」。
- 方差分解实测:9152 个验证前缀上,ExOPD 条件方差从 λ=1 到 λ=2 涨 12.6 倍(拟合 Var[A_λ]=0.0096−0.0421(λ−1)+0.153(λ−1)²),负协方差项造成 λ≈1.14 的浅谷后二次项接管;RIDE 梯度范数对重采样 token 在每个前缀每个 λ 下都不变。
- λ 扫描:RIDE 在 [1.15, 1.35] 全区间优于 OPRD,1.25 峰值 55.4;λ≥1 使响应变短(5.3-5.7k vs 6.8-7.4k)。ExOPD λ>1 全面劣化:格式分从 92% 掉到 64%、响应涨到 8700 token、λ=2 晚期从 51.2 漂移到 46.2。
- 方向控制(钉死因果):随机方向 55.04 / 反向 53.90 / 错配来源(用 Qwen2.5-Math 的残差)54.75 / 轨迹错配 55.12——全部在 OPRD 一分以内;只有真 RL 残差方向到 56.38。增益确来自「RL 诱发的方向」本身,不是正则化或损失尺度。
5.2 OASIS:规模曲线的「拉直」
指标:Avg@12,AIME24/AIME25/HMMT25;Qwen3-1.7B/4B/8B。
| 规模 | Base | OPSD | OASIS | Δ(OASIS−OPSD) | OASIS 对 Base |
|---|---|---|---|---|---|
| 1.7B | 37.10 | 40.15 | 40.74 | +0.59 | +3.64 |
| 4B | 59.86 | 61.84 | 63.70 | +1.86 | +3.84 |
| 8B | 62.64 | 62.78 | 65.83 | +3.05 | +3.19 |
OPSD 的增益随规模从 +3.05 衰减到 +0.14,OASIS 把三条规模曲线拉成近乎水平(3.64/3.84/3.19)。8B 上 OASIS 65.83 全面超过 OPSD 62.78、AVSD 63.58、CRISP 62.08、GRPO 62.87、SFT 62.32。
诊断证据链:
- 监督分配浪费:1.7B/4B 上仅 28.3%/30.6% rollout 验证通过,约 70% 更新落在截断/错误轨迹上;且训练中验证率还在降(0.333→0.229)。
- 恢复实验(表 1 的核心):失败前缀上金牌教师恢复率 0.77 vs 学生 0.37(Δ+0.40),4B 缩到 +0.17;验证前缀上仅 +0.04。教师的优势集中在失败轨迹且依赖特权信息——规模增大→学生自身恢复力上升→特权优势收缩→OPSD 增益消退。
- KL 差距解剖:1.7B 上师生 KL 差距中 thinking 模板占 55.0%、参考块占 15.4%、参考内容仅 29.6%(4B 降到 17.3%);验证脚手架上教师对各种替代上下文的 TV 距离都 ≤0.065。
- 训练动力学:OASIS 学生熵 0.49 vs OPSD 0.70、top-1 一致性稳定 0.931 vs 掉到 0.888——与命题 1 的预测(模仿特权教师推高学生熵)吻合。
- 成本账:生成 token 43.5M vs 2.76M(≈16 倍),但监督 token 更少(1.98M,验证脚手架更短 603 vs 859);等预算对比下(Table 4)OASIS 用 1/4 监督题量、零书面解,4B 63.70 vs OPSD 63.60,8B 65.83 vs 64.80。
5.3 ProRubric:双轴评测+聚合消融闭环
双轴指标:g=HealthBench 覆盖率(训练优化的代理);c=HealthBench-consensus 适当性(医生共识准则、held-out,DeepSeek-V4-Pro 判分,与医生 balanced-F1 0.62 vs 医生间 0.65)。主张不在 g 升,而在 c 不再被牺牲。
医学 4B 主结果与消融(固定准则文本的因果闭环):
| 奖励 | c | g |
|---|---|---|
| ProRubric | 36.8±2.7 | 35.0±1.4 |
| raw-AND(逐字合取) | 34.9±3.6 | 33.8±1.1 |
| implicit(整单打分) | 36.7±0.1 | 34.9±0.1 |
| additive(Rubric-RL) | 26.0±2.2 | 32.1±1.2 |
| 长度减半 | 27.1±1.8 | 30.4±1.4 |
| 重加权 | 25.3±1.5 | 32.0±1.8 |
| KL β=0.04 | 靠停学恢复 | →基座 |
| SFT(同数据) | 66.3 | — |
三个读数:(1) 只改聚合即可回收约 1/3-40% 损失,改长度/权重/KL/数据全部无效(SFT 66.3 证明数据无辜——只有变成加性奖励才崩);(2) 训练前激励审计可在零训练成本下预测崩溃——Rubric-RL 奖励对「点名不分析」+7.3、对「删关键建议」仅 −0.9,ProRubric 分别为 −0.3/−2.2;(3) Rubric-RL 50 步内 c 从 55.8 崩到 35.9,ProRubric 50 步仍 50.3。
跨域崩溃规律(c 变化,4B):医学 −28.9 / 科学 −11.2 / 对话 −7.1 / 写作 +16.0。mention 型准则走「点名」路线(医学崩得最狠),实体型准则走「堆实质」路线(科学靠冗余实质丢分);七基准均值 ProRubric 双规模最优(4B 46.9 vs 45.6,CI[+0.2,+2.4])。
诚实的边界:c 仍未回到基座 54.1——维度间仍加和,冗余成本只降低未消除(ProRubric 回应仍 9.8k 字符);作者坦承这是 Pareto 前沿扩展而非完全解决。
5.4 Astra 评测:六域的能力剖面
| 域 | 关键数字 | 读法 |
|---|---|---|
| 夹爪 RoboDojo | Hybrid 48%/62.60 vs Direct 26%/37.81 vs 重加权 π0.5 15.67%/24.43 | 长时程接触任务放大分工收益 |
| 夹爪 RoboLab | Direct 98% vs Hybrid 92% vs π0.5 36% | 零样本弱先验下协助反成负担 |
| 灵巧 10 任务 | Hybrid 61.6 vs π0.5 44.2 vs Direct 16.6;Astra 干预仅占 11.98% 执行步 | 少量针对性修正撬动大增益 |
| DexJoCo 汉诺塔 | Astra+π0.5 50% vs DP-T 24.7% | 经验引导下的审阅式控制 |
| 手内旋转 | Astra at-goal 0.51%/4.40% vs RL 76.90%/63.50% | 保抓握尚可、重组接触失败——Direct 的硬边界 |
| 手内平移+旋转 | Astra 0/5 vs RL 4/5(配对步数) | 同上 |
| 移动操作 | Hybrid 38.7% > Direct 33.3% > π0.5 22.7%;未见组合任务 Direct 56% 反超 Hybrid 36% | 先验适配度决定协助价值 |
| 导航 | RxR SR 92%/SPL 77.25、HM3D 82%/43.69;对 LightNav-0 SR 领先 16-36 点 | 语义决策层的强项;SPL 低揭示搜索绕路 |
| 运动 | 5 次顺序尝试全部未达目标(PASSAGE 13.18s 完成);第 5 次 30s 走 3.833m 仍差 6.519m | 密集参考(单调用 1625 个自洽数值)是 LLM 的天然弱项 |
| HumanoidBench | 30 任务均分 581.9 vs TD-MPC2 338.2;13/30 超最强基线;Maze 1358.8 达阈值 | 指挥冻结全身控制器可行 |
| 资源 | RoboDojo 50 实例:Hybrid 6.25 亿 / Direct 11.32 亿 token;30s 运动=250 次调用×39.86s | 延迟是具身落地的硬约束 |
核心结论一句话:Astra 强在语义决策层(纠错任务目标、准备接触几何、按状态调速转向、跟随语言指令),弱在持续接触协调(部分手指松开重排、其余保持支撑的动态配合)。Hybrid 分工(策略供 85.6-88% 步、Astra 选择性干预 12-14% 步)在长时程接触任务放大收益,但策略先验差时反成负担。
六、效果优势的根源解释
6.1 RIDE:换空间=同时解决「信号衰减」与「噪声放大」
因果链(每步标注证据等级):
- RL 改动主要发生在 head 弱传导方向上【论文实验已支持:79.8% 能量/30% logit 传导、head 增益 0.59】→ 输出空间目标对这些方向弱监督、且不约束浅层【论文实验已支持:48.6% vs 73.0% 梯度占比】。
- ExOPD 的外推项是单 token 采样估计,噪声按 (λ−1)² 放大且 p→q 不消失【论文实验已支持:命题 4.1+12.6 倍实测】→ λ 越大越不稳定,教师离基座越近信噪比越差、崩得越狠【论文实验已支持:Qwen3-4B 低于学生 14.1 分】。
- RIDE 目标由两次冻结前向确定性计算【机制事实】→ λ 只改目的地不改噪声性质【论文实验已支持:梯度范数对重采样不变】。
- 增益来自 RL 残差方向本身而非「位移正则化」【论文实验已支持:四方向控制全部不及 RIDE】。
外部对照:表示蒸馏对输出损失的互补性在 OPRD(Yang 等 2026a)与特征蒸馏经典线(FitNets 起)中已被反复观察;行为方向在隐空间的近线性可加性有 Park/Turner/Zou/Arditi 的 steering 文献支撑;RL 更新小而结构化有 Mukherjee/Zhu/Shenfeld 佐证。反向警示也存在:UCLA 理论工作(2609.38666)的「误导教师」命题提示——若外推方向本身有害,几何平均式的目标会把损害也放大;RIDE 的伦理声明同样提醒隐状态目标可能放大教师缺陷(其安全性需独立评估,作者自陈未做)。适用边界:需要预 RL 检查点与共享表示空间(同初始化设定)、单一全局 λ、仅在数学推理与单一 RL 配方上验证。
6.2 OASIS:「只教可模仿的」是一条可迁移判据
因果链:
- 前向 KL+特权上下文→学生最优解是上下文平均、熵更高【理论:命题 1;实证:熵 0.70 vs 0.49】→ 在失败轨迹上模仿特权教师是结构性反学习。
- 教师优势集中在失败轨迹(Δ+0.40)且随规模收缩(4B +0.17)【论文实验已支持】→ OPSD 把 ~70% 更新浪费在「教师信号最不可模仿」的状态上,且模型越强浪费占比越高【论文实验已支持:训练组成统计】。
- 验证轨迹上教师优势小(+0.04)、对上下文不敏感(TV≤0.065)【论文实验已支持】→ 把监督限制在这个子集,增益不随规模衰减【论文实验已支持:3.64/3.84/3.19】。
外部对照:验证/结果筛选作为可模仿性代理,与 RFT/STaR(验证选择训练数据)与 GRPO(验证构成奖励)的根本区别在「验证只选轨迹不构成目标」——GRPO 同验证器仅 +0.23-0.60 分,说明稠密教师分布本身贡献了验证之外的增量。特权信息视角接通 Swamy 等人的 imitation with unobserved contexts 与非对称 actor-critic(Lambrechts 等)。阅读者推测(标注):判据「蒸馏只用在教师可被学生上下文复现处」可迁移到代码单测、工具调用回放等一切「结果便宜可验、过程昂贵难写」的场景——作者自己也点名了这个方向但未实验。适用边界:仅 Qwen 家族、4B/8B 单 run、仅竞赛数学;生成成本 16 倍需权衡(K=4 消融可减半);晚期漂移(截断梯度反转)未根治。
6.3 ProRubric:激励结构先于准则内容
因果链:
- 加权和下每条准则按权重份额固定付酬、与难度无关【机制推导】→ 满足「点名」类廉价准则的期望成本远低于关键决策 → 策略梯度理性买分【论文实验已支持:训练前审计 +7.3/−0.9】。
- 合取使边际激励乘上「其余准则成立概率」【式 3 推导】→ 孤立碎片不计酬、补齐近完整维度赚整维权重【论文实验已支持:raw-AND 也回收 8.9 分——结构本身起作用】。
- 失败条款封死加内容抵扣通道【论文实验已支持:无必要高风险检查从免费变 −5.8】。
- 冗余成本只降不消:维度间仍加和【论文实验已支持:回应仍 9.8k 字符、c 未回基座】——这是残余 gap 的机制解释,作者诚实交代。
外部对照:Lv 等人的「假信用传播」治理(图聚合)与 Rubric Dropout 从不同角度支持同一根源判断——加性结构是病灶;Mahmoud 等人的「准则欠指定」归因被本文的固定准则对照组直接挑战(在同一现象上,改聚合比改准则的边际效应更大);implicit 聚合在 RaR 中已被比较,ProRubric 的增量是把它放进「g vs held-out c」双轴里重新解读。适用边界:单轮医疗场景、judge 校准有限(0.62 vs 0.65)、写作域为何反升 +16 仍是开放问题(作者猜测写作策略整合而非追加材料,标注为未解)。
6.4 Astra 评测:边界不是「能力不够」而是「能力类型不匹配」
因果链:LLM 的自回归生成不维持「多指接触状态的持续动力学协调」——手内旋转需要部分手指松开重排、其余保持支撑,这种并发约束满足与 LLM 的顺序生成模式错配【论文实验已支持:保抓握 5/5 全程但转不动(cuboid at-goal 4.40%),排除掉落解释】;密集运动参考需单次输出 1625 个自洽数值,LLM 生成不连贯参考导致原地踏步【论文实验已支持】。而语义决策(纠目标、备几何、调速度)是离散、语言可陈述的判断——恰是推理 LLM 的主场【论文实验已支持:导航、指令改写、Maze 状态调速】。Hybrid 的价值函数是条件性的:先验质量决定审阅负担与修正收益的净额【论文实验已支持:RoboDojo vs RoboLab 方向相反】。
外部对照:π0.5/VLA 谱系证明学习先验对接触动力学的必要性;SayCan/CaP 确立「LLM 决策+底层执行」分工传统——Astra 评测用配对计量把这个分工的有效域量化了。适用边界(作者自陈):单障碍场 5 连试非独立样本、部分基线经本地相机/适配器改造、token 计量口径含缓存输入。
6.5 综合判断
多研究共同支持:(1) 监督空间的选择决定信号保真(RIDE 的 head 投影恒等式+OPRD 先例);(2) 监督应落在可模仿/可验证状态(OASIS 与 RFT/GRPO 消融互证,但「验证选轨迹不构成目标」的细化是新的);(3) 加性奖励聚合在无验证器域有结构性风险(ProRubric 与 Lv/Yang 等多方收敛)。
仍属推测:RIDE 的隐状态目标对安全性/校准的影响;OASIS 判据向代码/工具域的迁移效果;ProRubric 写作域正增益的机制;「LLM 不擅接触动力学」从评测现象上升为生成机制的因果解释。
可能失效条件:RIDE 在教师与基座表示空间不共享或 RL 配方剧烈不同时;OASIS 在验证器昂贵或错误率高的域;ProRubric 在准则本身即目标的域(如 ResearchQA 的广度型准则,ProRubric 反而落后);Hybrid 范式在策略先验与任务错配时(RoboLab 反例)。
七、必要知识反推
7.1 领域知识层
- OPD/OPSD 的机制细节(逐 token 反向 KL、在线采样降低 exposure bias、隐式奖励视角):不理解就无法定位「外推」与「脚手架」这两个干预点。
- LM head 的各向异性奇异谱(softmax bottleneck 一系):RIDE 的全部立论建立在与 head 投影的互动上。
- 特权信息学习与模仿间隙:OASIS 的命题 1 直接搬用该框架,命题的熵不等式解释了实测熵漂移。
- 临床协议的「门控而非记账」本质(Gawande 清单宣言):ProRubric 的合取结构不是发明而是「把领域本体写进奖励」。
- 机器人控制栈分层(末端执行器目标 vs 关节 PD vs 全身控制器 vs 运动参考):Astra 评测的 Direct/Hybrid 划分与执行步分解都依赖对接口语义的理解。
7.2 方法论知识层
- 因果干净的消融设计:RIDE 的方向控制(固定位移范数只改方向)、OASIS 的因子化(脚手架×上下文)、ProRubric 的固定准则文本系列对照——三篇各自示范了「一次只动一个东西」。
- 训练前激励审计:ProRubric 证明扰动-奖励响应可在零训练时预测崩溃——这是对 Goodhart 的低成本早期预警。
- 方差分析与噪声分解:RIDE 命题 4.1 的 (λ−1)² 项、OASIS 命题 2 的截断梯度反转,都是「把训练不稳定归因到估计器性质」的范本。
- 评测学设计:双轴 proxy/held-out(ProRubric)、配对初态与执行分解(Astra)、固定配置与开发试验分离——评测协议本身是可复用的产出。
7.3 工程知识层
- 分布式训练的通信账:RIDE 的目标在 teacher worker 原地构造、传输量与 OPRD 相同——工程上「免费」的改动才可能被工业管线采纳。
- token 预算的细粒度记账(缓存/非缓存输入、输出、请求次数、延迟):Astra 评测展示了如何让「能力」与「代价」同表呈现。
- Rollout 采样经济学:OASIS 的 16 倍生成换 1/4 监督题量与零书面解,在「采样便宜可并行、书面解不存在」的域是正收益。
7.4 知识融合的关键节点
- RIDE=「RL 更新的结构一致性」(RL 文献)×「隐空间方向可操控性」(可解释性文献)×「特征蒸馏管线」(蒸馏文献)——三个领域的交集处长出的目标函数。
- OASIS=「信息论刻画特权间隙」(模仿学习理论)×「结果验证经济学」(RLVR 实践)——把理论量 I(A;R|Z) 换成可测代理 V(x,y) 的那一步是融合点。
- ProRubric=「领域协议本体」(临床)×「边际激励分析」(奖励设计)——发现「合取改变边际报酬乘子」的式 3 是化学反节点。
- Astra 评测=「VLA 先验」×「LLM 接口传统」×「资源计量纪律」——配对初态+执行分解让「分工是否值得」第一次可计算。
八、论文中可以提取的通用性灵感
灵感一:换测度空间比放大信号更根本
核心思想:当一个学习信号在某个空间被系统性衰减时,正确做法不是在该空间放大它(同时放大噪声),而是找到信号尚未衰减的上游空间直接监督。
论文证据:ExOPD 在输出空间放大隐式奖励→噪声按 (λ−1)² 放大→教师近基座时崩到低于学生;RIDE 在 head 前的隐状态监督→同样 λ=1.25 条件方差为零→四组全部越线。
推广场景:(1) 检测任务的分类头之前的表征做数据增强;(2) 推荐系统在排序层之前监督用户兴趣向量;(3) 代码模型在 AST/IR 层而非 token 层施加等价性约束;(4) 语音合成在声学特征层而非波形层做 speaker 适配。
灵感二:验证选「在哪教」,不构成「教什么」
核心思想:廉价的结果验证器可以承担「学习信号的空间滤波器」角色——决定哪些状态值得施加深监督,而监督内容本身仍来自更贵的教师信号。
论文证据:OASIS 用最终答案验证筛脚手架(监督 100% 落验证轨迹),但目标仍是教师分布(区别于 RFT 的自监督:GRPO 同验证器只 +0.23-0.60 分)。
推广场景:(1) 代码单测筛「值得蒸馏的提交状态」,过程监督来自强模型;(2) 工具调用链用执行成功筛选回放状态、LLM 教师供 token 级目标;(3) 数学解题用答案对错筛中间步、供过程奖励蒸馏;(4) 对话系统用任务完成筛轮次、供策略蒸馏。
灵感三:聚合函数是奖励设计的第一公民
核心思想:把多个检查信号合成一个标量时,「怎么加」与「加什么」同等重要——加性和允许补偿,合取性禁止补偿;选择的依据是领域本体(协议是门控的就用门控)。
论文证据:固定准则文本逐字不动,加性→合取即回收 1/3-40% 的适当性损失;训练前审计显示加性下「删关键建议仅 −0.9」而合取+失败条款下 −2.2。
推广场景:(1) Agent 评测的多维打分(完成度×安全×成本)改按阶段门控聚合;(2) RLHF 的多目标奖励(有用×无害×诚实)按对话阶段合取;(3) CI 的测试报告按模块合取而非错误数求和;(4) 医疗 QA 的多准则评分按分诊协议分组。
灵感四:训练前审计是 Goodhart 的早期预警
核心思想:对未训练模型做最小扰动并读奖励变化,可以在零训练成本下预判优化器会钻哪些空子——激励结构先于训练存在。
论文证据:ProRubric 的扰动-奖励表(Table 1b)在训练前就复现了「点名买分、删建议无害」的攻击面,与训练后行为一一对应。
推广场景:(1) 上线前 red-team 奖励模型;(2) 评测基准发布前用扰动检测可刷分维度;(3) 推荐目标上线前审计「刷量买曝光」通道。
灵感五:「会决策」≠「会控制」——接口决定能力的可表达性
核心思想:生成式模型的能力剖面由「输出必须满足的约束类型」决定:离散可陈述的判断容易、持续性并发协调难;给模型配何种执行接口,等于选择让哪些能力可被表达与测量。
论文证据:Astra 在导航/指令改写/状态调速上强,在密集参考(1625 个自洽数值)与手内接触重组上弱;Hybrid 把「决策」与「运动」分给两个组件后,11.98% 的干预步撬动 17.4 分增益(灵巧 10 任务)。
推广场景:(1) Agent 框架把「规划」与「工具执行」分离并计量各自贡献;(2) GUI 自动化让 LLM 出高层意图、专用策略出原子操作;(3) 科学发现系统把「假设生成」与「实验控制」解耦。
灵感六:诚实的边界报告是评测的贡献形态
核心思想:一份好评测的价值密度常在负结果与失败模式分析里——「哪里不行、为什么不行、耗了多少资源」比单一总分更能指导后续设计。
论文证据:Astra 评测的手内旋转 0.51%、运动 5 连败、误判任务完成(鸡蛋还躺着就宣布成功)、Hybrid 反例(RoboLab/CoffeeSetupMug)、39.86s 平均延迟——全部如实呈现并给机制解释。
推广场景:(1) 大模型榜单附失败模式分类与 token 成本;(2) Agent 基准报告「协助增益的条件性」(何时帮忙何时添乱);(3) 学术评测论文把「负结果」列为一级产出。
结语。这四篇论文没有一个新优化器、没有一个新架构,它们做的都是同一件事:把已有的学习信号放到正确的位置——正确的空间(RIDE)、正确的状态(OASIS)、正确的聚合结构(ProRubric),并在正确的坐标系里测量结果(Astra 评测)。当预训练的规模红利见顶,「放置问题」就是后训练的规模红利。四篇的局限也互为镜像:RIDE 需要同初始化与预 RL 检查点、OASIS 付 16 倍生成成本、ProRubric 只回收三分之一损失、Astra 的 Hybrid 依赖先验质量——这些未解之处,恰好是下一年训练前沿的待办清单。