EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读

蚂蚁集团与上海交通大学联合提出 EnvACE,让一个策略同时扮演「行动者」和「环境」两个角色:Acting 角色生成工具调用,Rehearsal 角色生成对应的环境响应,两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互,却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline,综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是,模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling,在提交执行前先在内部排练验证,把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」,并提炼出三条可迁移到其他领域的通用灵感。

August 8, 2026 · 6 min

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models 精读

深度精读港大与腾讯联合出品的 OSReward——首个系统检验计算机使用 Agent(CUA)轨迹评判器可靠性的基准与开源奖励模型工作。论文构建了覆盖 Web/Windows/macOS/Ubuntu/Mobile 五大平台的 1,019 条人工标注轨迹基准,揭示了所有主流 VLM 评判器存在的系统性「宽容偏差」,并训练出成本降低 30-60 倍的开源奖励模型 OS-Shepherd。本精读从背景补全、研究脉络定位、问题抽象、方法机制、评估证据、效果根源、必要知识反推到可推广灵感,九部分完整拆解这项为 CUA 评判建立标准化评估体系的开创性研究。

August 8, 2026 · 8 min

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories 精读

深度精读论文《When History Lies》——首次形式化『历史诱导的策略劫持』现象:结构有效、语义合理的历史轨迹仍可劫持 Agent 已有的正确策略,在 Qwen3-1.7B 上翻转 32.1% 的正确决策。论文提出 ContextPollute-Bench(同步三视图 Original/Polluted/Oracle State,十一类干扰算子)与 Oracle-OPD 方法(基于 Oracle State 的教师通过反向 KL 在策略蒸馏迁移到仅观察污染历史的学生),将 1.7B 模型的 BTA 从 47.2% 提升至 87.0%,8B 教师蒸馏后达 91.9%,并迁移到干净历史、未见工具与噪声多跳 QA。

August 8, 2026 · 4 min

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents 精读

深度精读浙江大学 VaG(Verifier-as-Gatekeeper)论文——首个正面刻画「自进化 Agent 中能力-污染相变」现象的工作。论文首次形式化了「技能池超过临界规模后新增技能反而降低性能」的非单调相变,并从数学上证明污染链具有结构不可逆性:有缺陷技能进入决策上下文后,其后代继承缺陷推理却从不引用原始缺陷源,导致事后回滚恢复率仅17%。VaG 采用「渐进信任层次 + 异构验证器检查不相交属性」的三级前commit门控(SchemaCritic 结构检查 / ExecCritic held-out重放 / AgentCritic 语义审查),配合边际增益贪心子集选择移除组合污染,在 Terminal-Bench 2 上以仅37个技能达到72% pass@1(Ungated崩溃至50%),技能池缩小近5倍,并在跨模型、跨基准迁移上全面领先。本文从背景、关联工作、问题抽象、三级门控解法、实验证据到不可逆性根源解释,完整拆解这一「前commit优于事后修复」的开创性研究,并提炼出可推广的系统安全设计灵感。

August 8, 2026 · 8 min

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment 精读

上海交通大学提出ABSeeker,通过答案回溯线索恢复(ABCR)和线索锚定步级评分(CASS),将搜索Agent训练中稀疏的轨迹级结果监督转化为密集步级奖励。基于Qwen3.5-4B仅用8.5k样本,ABSeeker在BrowseComp上达55.3%,匹配约30B级Agent性能。本文深入解析答案回溯信用分配的机制设计、实验证据与优势根源。

August 6, 2026 · 2 min

Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation 精读

微软研究院系统性诊断自蒸馏(SD)作为RLVR替代方案的根本缺陷。通过单一因果链揭示:特权信息(PI)偏见使教师的per-token目标偏向特定参考解而非通用正确性,学生损失集中于低信息token,最终训练信号与任务成功解耦。在QA、数学、编码和Agent工具使用四个领域跨模型规模和PI形式验证,为OPSD/SDPO研究方向提供根本性警示。

August 6, 2026 · 2 min

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act 精读

本文形式化定义了’记忆不确定性下的安全承诺’问题——Agent在记忆过时、冲突或被污染时不应执行不可逆的外部动作。SafeCommit在Agent推理与外部执行间插入风险控制层,利用保形预测构建可能潜在世界集合,仅当动作在每个保留世界中安全时才允许执行。在校准世界覆盖下,不安全认证承诺概率被数学保证不超过目标水平α。

August 6, 2026 · 2 min

DAPD: Dual-Anchored Policy Distillation 精读

On-policy 自蒸馏(OPSD)本该是 LLM 后训练的稳妥方法,但它会让模型越练越差——DAPD 首次诊断出根因是’特权幻觉’:训练时教师能看到参考答案,推理时学生看不到,学生却表现得像参考答案还在一样。DAPD 用双路径锚定(DPA)和双源锚定(DSA)在匹配信息可用性下对齐,让 Qwen3-4B 平均 +2.00,且关键的是——OPSD 增益在 8B 以上几乎消失,DAPD 在 32B 仍稳定 +2.78。本文从’信息不对称’的第一性原理出发,解释为什么改信号不如改结构。

August 5, 2026 · 2 min

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories 精读

Agent 部署后会积累大量失败轨迹,但它的行为通常固定不变——模型不更新,Harness(运行时框架)也不更新。Harness-R1 首次把’编辑可执行运行时’本身变成一个可被在线 RL 训练的能力:一个 9B 的’harness 工程师’模型从失败批次中生成可执行补丁,用冻结目标 Agent 重跑的真实成功率作为奖励。结果这个 9B 工程师反超 GLM-5.2、GPT-5.5、DeepSeek-V4-Pro 等所有更大的前沿模型编辑器;即便目标 Agent 微调后,工程师仍能再 +5.0pp。本文从’把脚手架变成可学习对象’的第一性原理,解释为什么小模型+真实结果奖励能赢过大模型+教师提议。

August 5, 2026 · 2 min

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks 精读

长程任务(long-horizon)是 Agent 走向真实世界的最后一块硬骨头。LongHorizon-Harness 把’执行-状态管理-完成评估’从一个不断增长的上下文里拆开,重构为 Manage-Execute-Audit(MEA)循环:Manager 只管状态不碰环境、Executor 每轮用新鲜上下文执行、Auditor 只读独立验证。这套架构让 Qwen 3.7-Plus 在 WeaveBench 上从 51.8% 跃升到 80.7%(近乎翻倍官方 SOTA),OSWorld 2.0 上把 Claude Opus 4.7 从 20.0% 提到 34.3%。本文从’状态-执行-审计’分离的第一性原理出发,解释为什么这套架构在难任务上收益更大、在更强模型上 token 反而更省。

August 5, 2026 · 3 min