训练前沿四重奏:蒸馏外推、规模解除、奖励治理与具身评测 精读

本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文:RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推,四组基座全部追平或超越教师;OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」,用验证脚手架解除;ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式,合取式协议级评分回收三分之一损失;GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线:监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。

October 2, 2026 · 8 min

Harness-Zero:通过 Agent-as-Harness 实现 Harness 蒸馏——论文精读

精读北京大学与 Google 合作的 Harness-Zero,提出 agent-as-harness 范式:用一个审查型智能体在学生模型的响应边界上把进化出的专用 harness 收益「翻译」成可训练轨迹,经 SFT 把外挂行为蒸馏进权重,部署时彻底移除外挂。Qwen3.5-9B 宏平均成功率从 23.3% 提升到 44.3%,甚至超过挂载原 harness 的 41.7%。

September 23, 2026 · 6 min

One to More, More to One:面向软件工程 Agent 的类别感知迭代专家训练(类别感知 SWE 专家训练精读)

阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架:SWE Labeler 用 47 个语义族 227 个标签做多轴标注,Agentic-miniRL 在可执行奖励下做长程 RL,RRE 循环(Refresh-Repair-Expand)让专家自蒸馏成功轨迹,Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%(较基座 +5.39),多语言 59.00%(+2.78),且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。

September 23, 2026 · 6 min

Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization 精读

Google 的这篇论文问了一个极简的问题:agent 能否通过’写优化器代码并评估’的可执行实践学会一个搜索策略,然后把这个策略蒸馏成一段文本、迁移给从未见过这段实践的其他模型?答案是肯定的——自博弈产出的 197 词文本 harness(Harness A)使 Gemini Flash 在黑盒优化上 regret 降低 48%(N=30,p<.001),同一文本让所有受测 Gemini 执行器与 Claude Sonnet 都改善(regret -43%~-49%),独立复现的 Harness B 性能同档。‘语言是部署搜索策略的便携介质’——harness 自动生成从进化搜索走向了实践蒸馏。

September 11, 2026 · 1 min

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读

AgentOPSD 把 Agent 强化学习中长期被回避的’信用分配’难题重新拉回中心:在多轮交互、稀疏奖励的 Agent 任务里,GRPO 这类方法只能把最终成败均摊到每个动作上,导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师(注入了成功技能 c+)与学生之间的 token 级对数概率差聚合为 turn 级证据,再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k,最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把’稀疏结果监督’转化为’每一步的密集信用’,在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%(+7.9pp),长程任务每轮交互衰减仅 0.54 点(GRPO 衰减 2.91 点)。消融实验进一步证明:先验锚定贡献 -10.2pp 是最关键设计,贝叶斯方向(符号保持)次之 -8.6pp。

August 8, 2026 · 8 min

【论文精读】Any-OPD:通过表示空间桥接实现异构流匹配模型的在策略蒸馏

京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题:用冻结DINOv2表示空间桥接不兼容的潜在空间,仅训练LoRA适配器,将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生,在多项指标上实现’学生超越教师’的奇迹。ImageReward提升是教师自身优势的近4倍。

August 5, 2026 · 4 min