信用分配四重奏:给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读

2026 年 10 月初,四篇论文从四条路线围攻 agentic RL 的同一个软肋:终端奖励只给轨迹级 0/1 分,步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配,把训练信号覆盖率从 GRPO 的 41% 拉到 95%,ALFWorld 91.0%;LinkedIn 的 SHARPO 用段级 hindsight 重加权,84.90±1.19 对 GRPO 70.57(+14.32);南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器,WebShop score +12.7;UIUC 等的 DARS 用谓词依赖图势函数塑形,ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」:不是要不要过程奖励,而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界,并提炼可迁移的通用做法。

October 3, 2026 · 7 min

Harness 的三种缩放轴:Mid-Harness × STITCH × Turbo Harness 精读

同日三篇论文从三个互补粒度回答同一问题:固定模型后 Harness 侧还有哪些缩放轴可挖。NVIDIA+KAIST 的 Mid-Harness 下沉「动作级」——在模型与 Harness 边界采样 N 个候选、执行前由验证器选一,发现采样收益完全由验证支配(前沿验证器把 TerminalBench-Lite 从 50.00% 拉到 68.03%),且与轨迹级缩放正交可组合(+Best-of-T 达 66.33%、成本减半)。UIUC+UMich 的 STITCH 沿「原语级」轴测试时组装——带 scope/contract 的原语库+确定性编译器,SWE-V 80.5%、组装开销仅 2.7%,配 mismatch gap 与指数衰减两命题。Rutgers+Red Hat AI+MIT-IBM 的 Turbo Harness 沿「实例级」轴打补丁——回收外层搜索副产物蒸馏 playbook、GRPO 训 9B 编辑器逐实例补丁,SWE-V 38.4→54.4%、步数 23.1→8.7。三轴正交可叠加,构成 Harness 工程学的完整缩放谱系。

October 2, 2026 · 10 min

编码 Agent 训练三条线:token 效率、自验证与安全 精读

本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文:HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来(SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token);SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」,再用学生条件化蒸馏修复(PASS@1 +9.7~16.9pp 且 OOD 不掉点);SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为,再用 Security Suite SFT + rl/hg 双路后训练补齐(unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1)。三篇论文共享同一方法论:先归因行为缺口,再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。

October 2, 2026 · 9 min

训练前沿四重奏:蒸馏外推、规模解除、奖励治理与具身评测 精读

本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文:RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推,四组基座全部追平或超越教师;OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」,用验证脚手架解除;ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式,合取式协议级评分回收三分之一损失;GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线:监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。

October 2, 2026 · 8 min

CAMG × Comet-9B:文件即记忆与程序状态推理的 Agent 训练新范式 精读

本篇精读两篇 2026 年 9 月的代码 Agent 训练论文:京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外(surprisal 6.371 vs 0.252 nats/token),转而用纯任务奖励让 shell 文件操作自发生长为记忆,4B 模型追平 35B;UCSB 与微软合作的 Comet-9B 不直接训练写补丁,而是训练「程序状态推理」(bug 何时触发、错误如何传播),反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论:不直接优化目标行为,而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开,并用外部文献交叉验证两大机制。

September 30, 2026 · 7 min

CoDeL × ReproBench:智能体安全的攻防共进化与漏洞复现评估 精读

本精读合读两篇智能体安全新工作:北航 CoDeL 将间接提示注入防御形式化为攻防共进化训练,首创「攻击潜伏期」可度量信号,在 AgentDojo 上将攻击成功率从 0.364 压到 0.042(−88.5%)同时受攻效用提升 38%;中科院软件所 ReproBench 则把 LLM 漏洞复现评估推入 pre-environment 设定,用真目标门控暴露出 45.3% 的「仿真替代」失败模式。一篇教智能体抵御攻击、一篇测智能体发起攻击的能力,恰构成安全能力的攻守双向标尺。

September 30, 2026 · 3 min

CodeSkill × NanoHarness:技能抽象与 Harness 效应——被低估的智能体性能杠杆 精读

本精读合并解读两篇从「模型权重之外」挖掘编码智能体性能的论文:清华+华为诺亚+上交的 CodeSkill 把长程 RL 从 token 级提升到技能级——teacher 蒸馏三级文本技能(目标/执行/控制),分层 VAE + Gumbel-Softmax 执行反馈门控边界把离散技能映射为连续隐变量 zH/zM/zL,以软提示前缀注入冻结 LLM(LoRA),PPO 在隐空间优化;SWE-bench Verified 76.2、EvalPlus 99.2 开源第一,交互步数 12.3→6.8(−45%),去掉 VAE 直接用文本技能+RL 则 BigCodeBench 从 94.8 掉到 88.4。南京理工+TUM+南京大学的 NanoHarness 首次把 harness(模型外基础设施)作为一等研究对象做组件级受控分解:固定模型下 harness 差 19.4pp vs 模型差 22.8pp;在 mini-SWE-agent 上增量加五组件,工具注册表 +4.57pp、任务特定子代理 +5.91pp,而上下文压缩 −4.86pp——机制是结构化工具把无序 shell 探索变针对性调用(jqlang 案例 133 次探测→43 次、通过率 24.68%→68.17%)。二者共同指向:技能结构与 harness 设计是被系统低估的性能杠杆。

September 30, 2026 · 6 min

EAPO × DN-MOPD × d-OPD:大模型训练信号的三个盲区与最小修正 精读

同日三篇论文各自修复了 LLM 训练信号的一处失真:KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」,符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%(超最强基线 5.6pp,AIME24 20.2 vs GRPO 12.5);NTU+耶鲁+曼彻斯特的 DN-MOPD(当日 Hugging Face 日榜 up=111 第一)发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号,批内测离散度+有界乘子重缩放即恢复各域均衡(8K 下 +2.47~+3.08);清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来,Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249,8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。

September 30, 2026 · 5 min

Gagar × SWE-MILE × CRR:代码智能体强化学习的细粒度信用分配三重奏 精读

本文合并精读 2026 年 9 月底三篇聚焦「代码智能体 RL 细粒度信用分配」的论文:小米+人大+北大+港大的 Gagar 用组内 agentic 评审排出补丁质量层级,再以保和重分配把质量偏好注入 GRPO 优势,DeepSWE 从 50.2% 提到 62.2%;中科院自动化所+国科大+腾讯的 SWE-MILE 定义导航势与验证势两个运行时势函数,以势差做过程奖励塑形,SWE-bench Verified 63.8 全面超越五条过程奖励基线;北邮+卢森堡大学的 NeurIPS 2026 论文 CRR 利用沙箱可 fork 的物理性质真实执行反事实动作,把「续走终局的回报差」作为免费过程奖励,Verified 41.7% vs GRPO 36.4%。三篇论文回答同一个问题——终态二值奖励下如何区分好坏决策——却给出质量对比、运行时信号、反事实执行三条机制迥异的路线。每篇覆盖背景、关联工作、问题、解法、证据、根源(含外部交叉验证)、知识反推与通用灵感。

September 30, 2026 · 6 min

Skill2Env × QwenGyre × AgentPerfBench:智能体强化学习的数据、系统与推理三层基建 精读

同日挂出的三篇 arXiv 论文恰好拼出 Agent 强化学习的三层基础设施:数据层(AllSpark 的 Skill2Env 把「环境合成」从扩展覆盖升级为能力参数化——100 个带控制旋钮的难度模式+基于 solver 执行证据的迭代加难,1.5K 轨迹 SFT 换 7 基准 +8.4pt);系统层(阿里 Token Hub 牵头的 QwenGyre 用 cell 级弹性调度+轨迹树处理让 2.4T 旗舰模型的百万 token rollout 在线 RL 提速 1.78×,pass rate 52.48%→58.54%);推理层(帝国理工+剑桥+牛津的 AgentPerfBench 用 22 个负载画像+饱和扫描+NCU roofline 证明 chat→coding 的 TTFT 差 4.8×、操作强度差 46×,agentic 负载在并发爬升时吞吐崩塌 43–76% 而 chat 仍在扩张)。本文按九部分结构合并精读,并给出「Agent RL 全栈工程」的公共图景。

September 30, 2026 · 8 min