Gagar × SWE-MILE × CRR:代码智能体强化学习的细粒度信用分配三重奏 精读
本文合并精读 2026 年 9 月底三篇聚焦「代码智能体 RL 细粒度信用分配」的论文:小米+人大+北大+港大的 Gagar 用组内 agentic 评审排出补丁质量层级,再以保和重分配把质量偏好注入 GRPO 优势,DeepSWE 从 50.2% 提到 62.2%;中科院自动化所+国科大+腾讯的 SWE-MILE 定义导航势与验证势两个运行时势函数,以势差做过程奖励塑形,SWE-bench Verified 63.8 全面超越五条过程奖励基线;北邮+卢森堡大学的 NeurIPS 2026 论文 CRR 利用沙箱可 fork 的物理性质真实执行反事实动作,把「续走终局的回报差」作为免费过程奖励,Verified 41.7% vs GRPO 36.4%。三篇论文回答同一个问题——终态二值奖励下如何区分好坏决策——却给出质量对比、运行时信号、反事实执行三条机制迥异的路线。每篇覆盖背景、关联工作、问题、解法、证据、根源(含外部交叉验证)、知识反推与通用灵感。