AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale 精读

深度精读 Meridian Intelligence 与 UMass Amherst 合作的 AgentMercury 论文——从高层业务场景合成 4,783 个可执行业务环境的框架。文章拆解其世界与任务分离设计、PLANET 构造流程与确定性 SQL 验证机制,解读 Qwen3.5-4B 在 EnterpriseOps-Gym 提升 27.6%、AIME26 提升 10.1 分的域外迁移证据,以及构造轨迹微调让环境作者成功率从 3.3% 跃升至 83.3% 的闭环实验,回答一个核心问题:出题人本身能否被训练出题。

August 25, 2026 · 4 min

AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization 精读

深度精读 AUSO 论文——中科大 × UNSW × 国科大 × 西交利物浦跨国合作提出的动作级统一技能优化框架。从技能角色随策略演化而变化的洞察出发,拆解任务级路由的噪声困境与轨迹内技能效应异质性问题,详解三阶段渐进优化(师从内化 → 结果探索 → 双上下文动作级利用)、JSD 信息增益信号与不确定性门控的设计逻辑,结合 ALFWorld / WebShop / SearchQA 三基准与五组件消融的证据链,反推出干预粒度下沉、生命周期感知训练、双上下文自对照三条通用性灵感。

August 25, 2026 · 4 min

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (ERPO) 精读

ERPO(阿里 AMAP × 西安交大 × 京东 × 北师大 × NUS 五机构产学研)重新定位了 LLM 强化学习训练崩溃的根源:不是策略(动作)分布漂移,而是策略诱导的查询分布漂移改变了有效训练环境。它把 KL 正则化从动作侧移到输入侧,Query-KL 的梯度严格不流经响应分布,从而在不牺牲探索的前提下根治高温解码崩溃——32B 模型在 T=1.5 下 GRPO 只剩 25.2%,ERPO 保持 80.8%。

August 25, 2026 · 2 min

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents 精读

深度精读新加坡国立大学 COTA 论文——用一个 0.5B 的微型比较器干预 8B 到 284B 的 LLM Agent。核心思想是把干预任务从「评估动作绝对价值」降维成「判断两个动作哪个更好」:配对比较加上建设性建议,九组实验全部提升,Qwen3-8B 在 WebShop 上从 0.3960 涨到 0.5630;而绝对 Q 评分加强制执行的组合只有 2%-9%,两要素缺一不可。

August 25, 2026 · 5 min

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents 精读

深度精读 UIUC×Meta AI 合作论文 EvoHarness-RL(已被 LLA@COLM 2026 接收):把长程智能体对外部 harness(记忆、工具、状态跟踪)的访问从提示词硬编码变成可学习的策略决策。通过 BPE 三态抽象(Belief/Progress/Experience)与四个元动作(track/commit/recall/note),配合教师轨迹 SFT 与代价感知 GRPO 两阶段训练,Qwen3-8B 在 ALFWorld 上从 ReAct 的 47.9% 跃升至 96.9%,逼近 Claude Opus 4.5;训练中还揭示“harness 退火”与“harness 演化”两个动力学过程。

August 25, 2026 · 5 min

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读

Co-RL 提出无标签多智能体强化学习框架:多个不共享参数的异构模型对同一道无标签题目各自采样回答,每个 agent 的奖励取决于其回答是否命中指定同伴的多数投票伪标签,从而把监督信号从『自己批改自己』换成『同伴互相批改』。理论证明自奖励是自我确认动态,正确率低于一半必然收敛到零;而跨智能体监督把正确收敛的吸引域扩大到两者正确率之和大于一。实验上文本七基准平均提升 3.0-8.6%,多模态四基准提升 2.3-7.2%,多个设置下甚至超过使用真值标签的 GRPO,也无需 LLM 裁判。

August 24, 2026 · 4 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

EnvHarness 把 agent harness 的思路搬到环境侧:不改一行底层代码,只在 reset/step 标准接口外包裹可插拔组件(Stage 改初始态、Contract 重写交互、Chain 串联环境),把静态人工环境改造成针对目标策略弱点的定制训练场,且 100% 继承原环境可信 verifier。配套 EnvRigger 自动化闭环从 rollout 诊断策略缺陷、写组件、用新鲜 rollout 验证。五个基准四领域全面超越原始环境与领域专用生成管线:held-out 最高提升 9.0 分、步数省 9.8%,并支撑 RL 共同进化。

August 24, 2026 · 3 min

Q-Learning with World Models 精读

斯坦福与北大合作的 QWM 提出了一条与世界模型协作的新路线:世界模型完全不参与策略与价值函数的训练,只在测试时(在线采样与评估执行)通过树搜索帮助挑选动作。策略提议 N=8 个候选动作,世界模型为每个动作想象 K=8 个未来状态,递归展开至深度 4,节点值由 Q 函数估计器与奖励加未来值估计器等权聚合。由于训练只发生在真实转移上,模型偏差不会复合进策略;在 Robomimic 与 LIBERO 机器人操作基准上,QWM 在样本效率与最终性能上均显著超越强基线,而传统 model-based 方法几乎无法在同等预算内学出非零成功率。

August 24, 2026 · 3 min

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning 精读

深度精读厦门大学与南洋理工大学 2026 年 8 月论文 SAPO:面向多轮 Agent 的强化学习后训练,让策略、状态价值与动作价值共享同一个自回归主干,在动作前后的两个因果边界分别读出 V 与 Q,以两个保留词元的 logit 差经裁剪映射为有界标量并从动作分布中剔除;配合单次 rollout 的轨迹级 GAE 与批归一化轮级优势,一次反向传播统一更新。在 ALFWorld 与 WebShop 上以 Qwen2.5-1.5B/7B 训练,平均超越 PPO 与 GRPO 15.1 与 12.1 个百分点,单轮迭代运行时缩短 33.2%,并彻底消除独立 critic 的显存开销。

August 24, 2026 · 5 min

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学联合小红书提出 SkillGate,解决长程 Agent 在 episode 中途该读哪个技能文件的训练难题。论文先诊断出 outcome-only RL 失效的结构性根源——selector credit starvation:技能命名 token 仅占轨迹损失的中位 0.14%,随轨迹变长稀释约 7 倍,且近五分之二的正确选择因后续执行失败收到错误负号的信用,而该决策本身价值 +11.2 个百分点。SkillGate 将同一 GRPO 更新的 token 支持划分为构造上不相交的双 credit 通道:任务通道只把组归一结果优势广播到执行 token,整段 read call 从损失掩码删除;选择通道把单次读取且为 oracle 才计 1 的 action-local 效用做组中心化后仅落在身份 token,等权归一使选择权重与轨迹长度无关。5 个基准 385-trial 协议下,9B 模型从 SFT 的 40.8% 升至 53.2%,超同预算 outcome-only RL 6.2 个百分点,oracle 读取率 54.3% 升至 83.9%,误导暴露降约三分之二且读得更少。

August 24, 2026 · 5 min