LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents 精读

华为LegoX团队联合港中文发布LEGO-RL——在不修改原生编码agent harness内部控制流的前提下接入可扩展策略梯度训练。三大支柱:进程内LLM代理捕获原始生成流实现token级对齐与训练端logprob重算(即使harness压缩/重序列化上下文)、Nydus镜像缓存+分级防御抑制reward hacking、插件化校验监控+Live UI轨迹诊断。训练Qwen3.5-35B-A3B(GSPO)在三大harness上全面提升:OpenHands SDK 64.0%→70.4%、Claude Code 62.4%→68.2%、OpenCode 57.2%→66.6%,rollout-训练概率相关性保持0.99以上。

August 20, 2026 · 2 min

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs 精读

厦门大学联合上海交大、南洋理工提出PlanPO——解决组相对优化中的优势坍缩(advantage collapse)问题:成功轨迹获得相同结果奖励,迂回成功与高效成功优势无差,组内梯度信号消失。PlanPO在组相对结构内引入粗到细优势信号——轨迹级长度差异+成功条件下的轮级响应长度差异,无需价值模型与人工启发式,在ALFWorld、WebShop、SciWorld三个多轮基准上平均超GRPO 27.2%,额外训练开销可忽略。

August 20, 2026 · 1 min

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学与小红书合作的论文诊断了agent技能选择失败的结构性根因——selector credit starvation:在广播式序列级优势下,命名技能的少数token在损失中份额趋零、继承的信用随轨迹变长而日益错号(选择正确但执行失败时正确选择被惩罚)。SkillGate把token支持划分为两个不相交信用通道:结果信用只达执行token、动作局部优势只达技能命名token(仅当轨迹唯一一次读取是oracle时为正)。5个agent基准、16候选技能档位下,9B策略试验成功率从40.8%提升到53.2%,超同预算outcome-only RL受控对照,误导技能暴露减少三分之二,读取技能更少。

August 20, 2026 · 5 min

SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

当高质量人类文本接近耗尽,LLM 训练的瓶颈正转移到『训练环境的供给』上。SPADE 让一个 LLM 同时扮演环境设计者与推理智能体两个角色:设计者把完整的长程可执行环境写成带 reset()/step() 接口的 Python MDP 代码,并用『有提示与无提示奖励差』这一 hint-based regret 信号被 RL 训练,从而持续瞄准学习者能力边界出题。在 30B 规模上,SPADE 在八个 held-out 基准上平均超过最强固定环境基线 +5.3,工具使用场景 BFCL v4 多轮 +5.7、ACEBench-Agent +13.9。这篇精读拆解它的双角色自博弈机制、regret 信号设计、语料接地与环境记忆两大组件,以及为什么『把环境设计变成可学习组件』可能改写 agentic RL 的 scaling 逻辑。

August 20, 2026 · 6 min

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读

阿里云端云智能计算团队发布Wuying-Browser-Agent——开源长程浏览器agent新SOTA(WebVoyager 80.6%、Online-Mind2Web 66.7%、自建BrowserBench 65.1%)。核心论点是’对齐每一层’而非单点规模:结构化浏览器harness提供稳定执行原语、RUIC-SFT显式训练错误恢复轨迹(仅用成功数据的SFT只能恢复8.5%的错误步骤)、DAO-GRPO用势函数奖励塑形+发散感知步加权解决长程功劳分配,并发布双语真实网页基准BrowserBench(350任务均37.9步)。

August 20, 2026 · 2 min

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读

清华大学 AIR 团队提出 Zetta,一个能在部署时自我进化的闭环具身智能框架:冻结 VLA 基座策略不动,用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行,配合三时间尺度进化循环(动作级治理、批次级失败诊断修复、验证门控技能晋升)与专用推理基建 Z-Infra,在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%,在 RoboCasa 18 任务上从 73.56% 提升到 93.56%,推理延迟较 RPent 降低 91%,并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。

August 20, 2026 · 8 min

ClawGym II: Exploring Black-Box RL on Agent Harness 精读

人大高瓴AI学院与IQuest Research联合提出首个面向复杂agent harness的黑盒RL统一框架:用临时沙盒把任务环境与harness整体隔离包装(对训练侧完全黑盒),以忠实轨迹恢复机制从沙盒遥测中重建树状执行轨迹并回传环境奖励,使PPO/GRPO能稳定优化“harness+模型”整体。在OpenClaw与Claude Code两种结构迥异的harness上验证:30A3B骨干较初始策略分别+9.98/+14.81分,超SFT基线5.80分,PinchBench外部迁移87.32;训练在200-400步内保持稳定,且首创混合harness联合训练——单一模型在两种harness上持平甚至超过各自单独训练版。配套发布ClawGym-Bench(六域)与PinchBench双评测体系。

August 19, 2026 · 2 min

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills 精读

上海AI Lab联合上交大、西工大、复旦、浙大提出JailbreakSkill——技能中心的自动化红队框架:把攻击策略沉淀为结构化技能资产(SKILL.md+脚本+引用三件套),两阶段循环中Stage 1用风险条件化UCB规划器在16个初始技能中路由排序(每次攻击选性价比最高的技能先试),Stage 2以失败记忆驱动技能进化(精修/组合/发现新技能,准入标准为救回至少一个未解行为)。在AdvBench/HarmBench上macro-ASR@10达72.0%/68.1%(16个模型-基准设置的13个第一),平均查询成本AQC 4.14/4.63为全场最低;随机路由消融使ASR掉8.1pp验证风险条件化排序的价值。攻击能力随使用单调增长——红队从一次性脚本进化为可复利资产。

August 19, 2026 · 2 min

SA-MRPO: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization 精读

UCSD联合五机构提出SA-MRPO——多奖励RL后训练的饱和感知优势重加权:针对固定标量化+组标准化的两大缺陷(奖励轮廓不同的rollout获得相同优势;已饱和目标仍按固定权重占用梯度预算),按每个奖励维度的实时饱和度自适应重加权,使梯度流向“还有提升空间的未竟目标”。Qwen2.5-7B三目标设置下15项基准对比12项超GDPO(AIME24 +5.0pp、MATH500 +3.5pp);自适应推理设置平均准确率+3.8且响应更短;代码基准Codeforces从10.6%升至12.9%。机制本质:把优化预算从“维持已会技能”重新分配到“攻克未会技能”。

August 19, 2026 · 2 min

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents 精读

深度精读 2026 年 8 月 arXiv 论文 CREST:面向多轮多步工具调用 Agent 的层级化功劳分配框架。它把每 token 优势分解为「轮级 verifier 优势 × token 级教师调制幅值」,让自教师只调幅值、不碰方向,从而保住 RL 的 verifier 上界。BFCL V3 上 Qwen3-4B 达 52.00%(较基座 +29.88),13/14 项最佳,长上下文与 Session 级指标增益最大。

August 17, 2026 · 5 min