信用分配四重奏:给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读

2026 年 10 月初,四篇论文从四条路线围攻 agentic RL 的同一个软肋:终端奖励只给轨迹级 0/1 分,步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配,把训练信号覆盖率从 GRPO 的 41% 拉到 95%,ALFWorld 91.0%;LinkedIn 的 SHARPO 用段级 hindsight 重加权,84.90±1.19 对 GRPO 70.57(+14.32);南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器,WebShop score +12.7;UIUC 等的 DARS 用谓词依赖图势函数塑形,ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」:不是要不要过程奖励,而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界,并提炼可迁移的通用做法。

October 3, 2026 · 7 min

失败资产化二重奏:Agent Error Dataset 与 AREX-2 精读

Agent 训练数据的传统会计准则里,失败 rollout 是费用——采集了、用不上、直接核销。2026 年 9 月末的两篇论文在同两周内把这个科目改成了资产:Apodex 的 Agent Error Dataset(AED)把 50,228 个自然失败变成带诊断、带修正、带受控重放证据的「错误-诊断对」资产,用同检查点双臂重放首次把「修正的净因果增益」(18.4%→51.1%)从「重试也能过」(30.1% 的双通过率)中分离出来;BAAI 的 AREX-2 则把整条多轮失败-恢复轨迹做成训练数据,损失只打在「错误之后做了什么」的恢复性决策上,让 27B 模型在 MLE-bench Lite 拿到 81.8、超 GPT-5.6 Sol 9.1 分,且五小时预算内持续提升。本精读逐篇拆解两条「失败炼金流水线」的机制与证据,再处理它们之间最锋利的张力——AED 用 73 页附录诚实披露修复训练的环境依赖与真实环境倒退,AREX-2 用 12 页报告宣告跨域元技能迁移——结论是:两者在「损失不打在错误上、打在恢复上」这一核心设计上惊人收敛,而「失败资产」的变现条件(结构化保存、恰当标记、证据分级)比乐观者预期的更苛刻。

October 2, 2026 · 8 min

编码 Agent 训练三条线:token 效率、自验证与安全 精读

本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文:HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来(SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token);SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」,再用学生条件化蒸馏修复(PASS@1 +9.7~16.9pp 且 OOD 不掉点);SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为,再用 Security Suite SFT + rl/hg 双路后训练补齐(unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1)。三篇论文共享同一方法论:先归因行为缺口,再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。

October 2, 2026 · 9 min

训练前沿四重奏:蒸馏外推、规模解除、奖励治理与具身评测 精读

本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文:RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推,四组基座全部追平或超越教师;OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」,用验证脚手架解除;ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式,合取式协议级评分回收三分之一损失;GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线:监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。

October 2, 2026 · 8 min

Diffusion Reward Models × SOLO:成熟技术的首次规模化双案例 精读

同日两篇论文在各自领域做了同一件事:把一项被搁置多年的成熟技术,用一个机制创新首次推到现代规模。清华 thunlp+港中文+UIUC 的 Diffusion Reward Models(DRM,当日 Hugging Face 日榜 up=22)把扩散模型首次引入奖励建模——奖励从点估计变为条件密度估计 p(r|x,y),轻量 DiT 头无参数族假设地表示人类偏好的多峰结构(多峰率随标注分歧 37.6%→63.2%,Wasserstein 距离全表最低),同骨干同数据受控对比平均 66.2 vs ArmoRM 62.3(+3.9);中科院自动化所的 SOLO 把局部学习(local learning)首次推到十亿参数 LLM 预训练——用一个所有模块共享的终端 readout 只读副本打破 update locking,梯度对齐 cos 从 0.52 升至 0.70,流水线激活内存降近 p 倍、吞吐达 1F1B 的 1.44×。二者方法论同构:识别被搁置的旧技术、诊断其规模化障碍、用一个机制创新解锁,为「旧思想在新规模下复活」提供了可复用的模板。

September 30, 2026 · 9 min

EAPO × DN-MOPD × d-OPD:大模型训练信号的三个盲区与最小修正 精读

同日三篇论文各自修复了 LLM 训练信号的一处失真:KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」,符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%(超最强基线 5.6pp,AIME24 20.2 vs GRPO 12.5);NTU+耶鲁+曼彻斯特的 DN-MOPD(当日 Hugging Face 日榜 up=111 第一)发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号,批内测离散度+有界乘子重缩放即恢复各域均衡(8K 下 +2.47~+3.08);清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来,Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249,8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。

September 30, 2026 · 5 min

Imprint Reader × ATD:权重更新与行为影子之间的双向桥 精读

本精读合并解读两篇在「权重空间」与「可观测行为」之间建立可计算映射的论文:上海AI实验室+上海交大的 Imprint Reader 用 SMaRT 训练一个把冻结 LoRA delta「挂载」到自身、在无锚点元查询下读出其编码知识/行为语义的 Reader——held-out 更新上行为读出 Pass@100 达 16%(知识 2%),且因与父模型坐标对齐,读出梯度经 MetaEdit 反转为干预:0.5% 行剪枝把有害拒绝率按目标方向分离为 +6.2/−2.5pp(基线全部不分方向),免训练数据的 vibe alignment 把 BFCL Agentic 15.93 提到 22.30;北大+佐治亚理工+上科大+清华+Lovart AI 的 ATD 则反向而行——用公共祖先筛选近平局提示(|q−0.5|≤0.02),每提示只取教师一个词的一比特观测,5,664 对即把私有 code-DPO 教师能力迁移 +5.34pp [1.22,9.60](超精确对照),7 任务全正、7 任务教师-学生方向余弦 0.701 vs 0.398,而记忆答案/密码教师零迁移。一个「权重→行为→干预」、一个「行为→权重分量」,互为镜像,兼具可解释性与模型提取/泄露双重意义。

September 30, 2026 · 6 min

New LoRA Skills Should Read but Never Write 精读

LoRA 让大模型微调变得便宜,但把多个独立训练的适配器合并成一个模型始终是难题:直接在权重空间相加会互相干扰,全量重训昂贵且伤害旧技能,路由方案则放弃了「单一模型」的目标。本文追溯其困难根源,指出每个组合方法都在隐式做两个选择——因子坐标(规范自由度)与耦合方向(读写不对称),并提出 READ 方法:规范化因子坐标、只训练新技能的「读行」、折叠回基权重。在 32 个测试谱系中,READ 以平均 +0.073(95% CI +0.047 至 +0.101)战胜 14 种可折叠基线的逐谱系最强者,且全部 8 次失败均集中于 BBH 的新技能习得环节。本精读覆盖其背景、定位、方法、实验证据与优势根源的因果解释,并交叉验证相关谱系的研究结论。

September 29, 2026 · 6 min

训练机制三重奏精读:对数线性稀疏注意力、置信度停止与跨段信用分配

本文合并精读 2026 年 9 月下旬三篇聚焦「训练时机制创新」的论文:上交+字节 Seed 的 PISA 把块稀疏注意力的选择阶段压到 O(N log N) 并用 LSE 打分提升选块质量;马里兰+Capital One 的 ConfSFT 只监督置信度、不监督长度,就让四家族模型推理 token 下降 10%~19%;北大+深大+腾讯的 SLCA-GRPO 识别并结构性消除工具调用 RL 中的跨段信用错配,7B/8B 上 τ2-Bench 分别提升 9.15/10.03 个百分点。每篇覆盖背景、关联工作、问题、解法、实验证据、优势根源(含外部交叉验证)、知识反推与通用灵感九部分,最后合并讨论「选择、停止与信用分配」这一共同主题。

September 29, 2026 · 9 min

递归自改进的能力与安全双螺旋精读:DCE 自蒸馏与演化安全框架

本文合并精读 2026 年 9 月同日发布于 arXiv 的两篇递归自改进(RSI)论文。论文一(Meta AI + UC Riverside)提出 DCE+SRCL:让特权教师在 on-policy 自蒸馏中与学生逐轮共同进化,在 Qwen3-8B 四项数学竞赛基准上取得 65.97% Average@12,较冻结教师的 OPSD 提升 35.62 个百分点,并用固定轨迹探针揭示教师监督退化的机制证据。论文二(中科院计算所)提出演化安全框架:以携带时间历史的安全相关变更为分析对象,建立六种风险表现 × 五类变更载体 × 四层评估单元的分类学与治理原则。本精读各按九部分展开,并以「教师共同进化 ↔ 风险共同进化」的双螺旋视角合并收束:DCE 证明上轮学到的修正行为会经由教师进入下轮监督——这正是演化安全所警告的经验污染与风险继承在能力侧的镜像。

September 29, 2026 · 7 min