ExecCritic: Learn to Test, Test to Improve for Coding Agents 精读

同一个 Agent 轨迹既写补丁又写测试时,一个共同的误解会让’错误的补丁通过错误的测试’——执行反馈不但没用反而有害。ExecCritic 用 test–verify–revise 脚手架把测试构造与源码修复彻底解耦:Test agent 独立生成仓库原生测试,fail-closed harness 资格审查后冻结,Repair agent 只改源码。SWE-bench Verified 上,Qwen 自产测试把解决率从 61.2% 拖到 57.3%,GPT-5.6 测试提到 65.3%——测试质量决定反馈价值;角色专用 RL 把 Base-to-Gold 判别成功率从 22.2% 拉到 62.2%,两角色组合达 72.6%(+11.4)。本文精读拆解其解耦机制、fail-closed 语义与反馈可靠性的因果链。

September 10, 2026 · 3 min

FlowBalance:验证器锚定的自改进——把符号门控装进轨迹平衡 精读

腾讯 HY LLM Frontier×UPenn 推出 FlowBalance:冻结的特权后见视角对已采样轨迹打密集分,验证器组相对优势用符号门控决定引导方向(正保留/负反转/零关闭),profiled trajectory balance 拟合归一化目标分布。Qwen3-8B 五基准平均 67.61 超 GRPO/OPSD/RLSD/FlowRL,AIME24 达标 100 步 vs GRPO 143 步,四条目标级定理精确刻画反自确认机制。

September 9, 2026 · 2 min

TGOPD:在策略蒸馏前先验证教师——提示级可靠性门控 精读

AllSpark 团队推出 TGOPD:对每个提示用少量验证器打分的教师探针估计可靠性,通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD,35B LiveCodeBench 64.0(其他蒸馏方法全部负迁移),探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。

September 9, 2026 · 2 min

Bilevel Coordinated Reflection: 多智能体 LLM 系统的博弈论统一理论 精读

UCL×利物浦×华为的 BCR 把 orchestrator–worker 多智能体系统建模为双层协调博弈,证明 follower 子游戏是近似势博弈,并首次给出’只看文本的门控不可能可靠’的信息论不可能性定理。据此提出的 SRMA 仅在环境验证风险严格下降时接受候选记忆,SWE-bench 500 实例解决率 72.2%(免费反思仅 58.4%)。本文精读其双层博弈建模、漂移分析、不可能性定理与 SWE-bench 端到端验证的完整因果链。

September 8, 2026 · 2 min

CoSkill: 把元技能变成可学习智能体 — 分层技能库的联合强化学习 精读

中科院自动化所×人大的 CoSkill 把静态元技能工作流重构为可学习的 Meta-Skill Agent,与 Reasoning Agent 共享单骨干联合 RL:推理智能体条件于检索到的任务技能与子技能,任务表现反向指导元技能精炼。ALFWorld 98.4%(+3.5pp)、WebShop 90.6%(+6.2pp),样本效率与墙钟效率全面占优。本文精读’技能从被动对象到主动协作者’的范式转变。

September 8, 2026 · 2 min

Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读

Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象:每条推理轨迹仅监督 1–2 个关键 token(占全部生成 token 的 0.05%)即可匹配甚至超越全 token 训练的推理激励,跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一’有效学习不需要 token 密集’的证据链及其对后训练范式的改写意义。

September 8, 2026 · 2 min

Iris: Climbing to the Search Frontier — 开源搜索智能体的数据反构造与 SFT-RL 攀爬配方 精读

AllSpark 团队发布 Iris-mini/pro 两个开源搜索智能体(35B-A3B 与 397B-A17B):从网页超链接实体图反向构造多跳任务,把非答案实体改写为描述性引用以杜绝字符串匹配作弊;提出 SFT-RL climbing 交替训练——每轮 RL 把最难与最高效轨迹回流进下一轮 SFT。BrowseComp 88.6 / HLE 56.4,同参数段开源最强。本文精读其’不可作弊任务合成’与’爬坡式两阶段循环’的完整配方。

September 8, 2026 · 2 min

RISE: 自外推策略蒸馏把 on-policy 蒸馏变成递归自我改进 精读

RISE 从模型自身 RLVR 训练轨迹外推合成教师:以当前检查点与滑动锚点的位移放大(β>1)构造未来教师,在 logit 或权重空间实现,教师随学生每轮刷新。OLMo3-7B AIME'24 从 30.2 提至 46.9(+16.7),ALFWorld +9.4、WebShop +10.9 vs GRPO,OOD 不降反升。本文精读’教师从哪来’这一 OPD 根本问题的第一性解法及其递归改进机制。

September 8, 2026 · 2 min

What Does Multi-Harness RL Learn? — 评测 Harness 是 Agent RL 的主导变量 精读

本论文在同一 Qwen3-8B 热启动上回放相同任务-harness 记录(Aider/OpenHands/Qwen Code/SWE-agent),对比 GRPO 的 Within/Cross 两种分组规则,用 24,000 次密封 SWE-bench Verified 评估发现:评测 harness 使解决率从 2.14% 摆到 9.27%(4.3 倍),训练配方仅移动 1.16,分组规则不显著(+0.25pp,CI 含 0)。harness 工程对 Agent RL 的影响碾压算法选择。

September 8, 2026 · 2 min

Rethinking On-Policy Distillation II: One Training Example 精读

on-policy 蒸馏到底需要多少数据?本文把实验推到’一条训练样本’的极限:单条查询即可驱动 OPD 持续改进数百步,覆盖全数据 OPD 71.5% 的状态空间;16 个语义多样查询覆盖 98.9% 并匹配全数据训练。提出状态覆盖率度量解释现象——OPD 是’数据过饱、算法饥饿’,瓶颈在步数效率而非数据规模。

September 7, 2026 · 2 min