DRACO 精读:没有验证器时,如何给长程 Agent 训练信号分步定责

DRACO(IBM×CMU)形式化’outcome-blind’训练设定——长程 Agent 任务往往没有程序化验证器可依赖。方法用训练中动态生成的 rubric 逐轨迹打一次分,再按’步骤涉及哪些标准’闭式分摊到每步 GRPO advantage,不引入任何可学习归因模块。AppWorld TN 上 Qwen3.6-27B TGC/SGC 69.4/41.1→85.3/70.6,反超偷看真值奖励的 GRPO +5.3/+11.3,τ-bench 零样本迁移 SR 15.8→20.4。

September 6, 2026 · 2 min

Locked at the Entrance 精读:RLVR 的多样性坍缩发生在推理的门口

RLVR 提升 pass@1 却坍缩解空间已是共识,但坍缩发生在哪一步始终未知。上海大学×伯明翰大学在 Countdown 任务上穷举解空间、按首操作数+算子划分入口族,把求解分解为 access×execution:PPO 覆盖 0.337→0.111,首算术操作前的似然偏移是下游的 11–16 倍,塞一个入口前缀就能让低覆盖族完成率 0.018→0.212——能力还在,只是不再进门。后层参数插值恢复 37% 覆盖且 pass@1 零损失。

September 6, 2026 · 2 min

When Models Edit Too Much 精读:编码 Agent 的过度编辑病与保真度评测轴

NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架,系统刻画 over-editing:GPT-5.5 高 Pass@1 与大改动并存,一行 bug 修出 60 行代码;一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3;SFT 过拟合已见损坏模式,RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。

September 6, 2026 · 2 min

Environment Evolution 精读:让训练环境的难度离线进化

腾讯混元×港科大(广州)的 Environment Evolution 把环境难度演化从 on-policy 共进化中解耦:从多轮学习目标推导三个演化方向,用多 Agent harness 离线逐代提升环境难度,再由谱系调度器持续供给学习信号。Qwen3.6-27B/35B-A3B 经简单长程 RL 在 Terminal-Bench 2.1 分别提升 14.4/18.0 个百分点。本文基于全文阅读拆解演化方向推导与调度器设计。

September 5, 2026 · 2 min

Cliff: Learning Process Rewards from the First Mistake 精读

RLVR 用最终答案的对错给整条推理链打分,粒度太粗;PRM 要训练专用奖励模型,OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式:只用现成 LLM 定位每个错误 rollout 的’第一个错误步’(Pitfall Step),把轨迹切成正确前缀与错误后缀,前缀正优势、后缀负优势。12 个场景上一致超越:比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%,且弱教师(27B)下依然有效。本精读拆解’错误前缀之后无信息’这一核心洞察、token 级优势的构造细节,以及教师定位能力与人类标注 80% 一致率的验证实验。

September 4, 2026 · 3 min

Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读

在 IOI 2026 上,一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分,超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径:22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距,以及’纯 SFT 的 Ultra 反超 SFT+RL 的 Nano’背后的并行采样机制。

September 4, 2026 · 3 min

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? 精读

Agent 每天与环境交互积累海量轨迹,但经验真的变成了能力吗?ByteDance Seed 姊篇基准 S3Gym 把’自改进’拆成自测试、自判断、自改进三个可测环节,在 7 个可执行验证的文本游戏上比较三种经验注入通路:原始历史 ICL、摘要记忆、参数训练。7 个前沿模型的核心发现:自改进既不自动也不均匀——GPT-5.5 在 PvZ 上 History ICL 的 AUC⁺ 高达 548.5,换摘要记忆暴跌到 33.2;同一模型同一环境换个通路结果天差地别。本精读拆解宽松探索/严格评测的分离设计、自评分与环境真值的对照记录,以及’经验压缩可行性决定通路优劣’的机制规律。

September 4, 2026 · 3 min

DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory 精读

港中深联合美团 LongCat 团队提出 DiagEvo:自进化自博弈中 solver 常平台化甚至衰退,现有方法靠难度/多样性信号出题却不指明’该修哪个弱点’。DiagEvo 的答案是分层错误记忆——4B 诊断器分析失败轨迹、按’错误原因→主题→实体’三层组织、定向采样未解决错误因生成新题,辅以双置信度过滤与自由探索。三个 solver(Qwen3-4B/8B、OctoThinker-8B)在九个基准上全胜 R-Zero/DARC 等基线;消融显示去掉分层错误记忆数学均值掉 3.8 分(最大组件贡献)。与 HarnessEvolve 同日揭示同一趋势:显式诊断信号优于隐式统计信号。

September 3, 2026 · 2 min

WHALE: A Simple Recipe for Joint Harness–Weight Optimization 精读

KRAFTON 联合 KAIST/Stanford 提出 WHALE(Weight-Harness Alternating LEarning):把 agent 性能看作模型权重 θ 与可执行 harness 代码 h 的联合函数 J(θ,h),交替执行’当前 harness 下在线拒绝采样微调’与’更新后模型上 Meta-Harness 搜索’两阶段,用固定时长或自适应 patience 规则切换。在 Qwen3.5-2B/4B × 搜索问答/数学/国际象棋三域上,比 weight-only、harness-only 与 Fast-Slow Training 高 4.15–24.38 个百分点,且揭示 harness-limited 与 weight-limited 两种机制不同的瓶颈域。这是首个把优化空间从’权重+文本提示’扩展到’权重+完整可执行 harness’的交替优化配方。

September 3, 2026 · 3 min

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents 精读

亚利桑那州立大学与思科研究的 CAST 解决长程工具调用 Agent 的可靠性死穴:在电商退款、医疗分诊这类有状态环境中,一个错误动作(退错订单)就造成不可逆失败。CAST 把稀疏任务结果转化为动作级监督——合成解释’该动作在部分可观测下为何有效/无效’的结构化批评理由训练批评模型,再用批评模型构造数据优化策略模型。微调后的 Qwen3 系小模型在 Retail 任务可靠性超 GPT-OSS-120B 逾 10 个百分点,域外 Telehealth 再 +9%。

September 2, 2026 · 2 min