DarwinX: Evolving Agent Harnesses Through Natural Selection 精读

LLM Agent 的能力不只取决于模型权重,还取决于包裹模型的 Harness(提示词、工具、技能、控制流)。Salesforce AI Research 的 DarwinX 在完全冻结模型权重的前提下,把 Agent 自进化重构为对 Harness 种群的“自然选择”:preserve-and-extend 契约只接纳“净增益为正且回退有界”的变体,树状 archive 保留多条谱系供跨谱系重组,失败/教师/自采三种证据共用同一编辑接口,适应度完全来自 benchmark 自带 verifier。四个基准平均提升约 17 分:Terminal-Bench 2.1 达 83.2%,WebArena-Infinity 从 43.5% 跃升至 93.0%,且零适应迁移到 SWE-bench Verified 达 84.2%。本精读逐部分拆解其机制,并建立“方法差异→机制变化→指标提升”的因果链。

August 15, 2026 · 5 min

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models 精读

SKILLER 提出语言级强化学习框架:用强模型(GPT-5.4)兼任 actor 与 critic,把小模型智能体系统当作环境,官方验证器提供标量奖励与文本诊断,全部 RL 信号经由自然语言传播,优化变量是技能文本本身而非模型权重。在五个基准上,9B/4B 小模型配 SKILLER 技能全面超越闭源 Manus 与开源技能生成方法,SWE-Skills-Bench 上超人类技能 30.8 分,且零样本迁移到 GAIA/EarthBench 仍保持领先。本精读覆盖其背景脉络、语言级 RL 形式化、actor-critic 机制、消融因果链与可推广灵感。

August 15, 2026 · 5 min

Thought-Level Beam Search for Reasoning 精读

测试时算力扩展是大推理模型性能的主引擎,但并行采样极度浪费、减法剪枝又让GPU挨饿,核心问题已从“花多少算力”变成“把算力花在哪”。本文提出思维级束搜索 Gambit:用轻量评分器探测步骤边界隐状态,周期性剪除劣迹并立即从高分前缀分支,以零和交换维持固定容量活跃池,同时保持硬件满载。在 5 个基准 × 3 个模型上严格支配 SC、Slim-SC、DeepConf、STEP 四大基线:HMMT-24 最高 +6.7%,token 消耗较并行采样最高降 68.5%,吞吐超 2 倍,管理开销仅 0.97%。本精读覆盖其问题形式化、方法细节、实验证据与因果链根源分析。

August 15, 2026 · 3 min

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training 精读

编码智能体在 RLVR 训练中长期受困于「信用分配粒度不足」——一个动作里同时打包了对代码不同区域的多种修改,谁贡献了通过、谁制造了失败,传统方法无法区分。DiDPO 从代码 diff 的结构出发,用「可分组性分数」动态选择锚点,把完整 diff 切成可比较的子 diff 组,把 episode 级优势投影到 token 级信号。Qwen2.5-7B-Coder 上超越可比方法超 10%,并附带开源 verl-code 代码库。本精读按九部分结构拆解:从背景、定位、问题抽象、解法、实验证据到优势根源的因果链,再到必要知识反推与通用性灵感。

August 11, 2026 · 8 min

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States 精读

深度精读 RoMeRL 论文——首次将自进化 Agent 记忆中的’反馈稀疏’与’记忆-奖励陷阱’两大耦合难题统一刻画,并用’降阶效用状态’把不断增长的轨迹索引效用空间压缩到固定维度的语义坐标上。理论证明降阶参数化提升每个效用坐标的平均反馈量,并刻画错误坐标的稳态占用;ALFWorld 和 LifelongAgentBench 上 Cold-Q 比例降低 80.0%、反馈密度提升约 6.0 倍、维护记忆大小减少 84.4%、LLM 调用减少 21.1%。本精读覆盖问题根源、因子化机制、反馈聚集原理、实验设计与通用性灵感。

August 11, 2026 · 8 min

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读

当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。

August 11, 2026 · 9 min

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读

AgentOPSD 把 Agent 强化学习中长期被回避的’信用分配’难题重新拉回中心:在多轮交互、稀疏奖励的 Agent 任务里,GRPO 这类方法只能把最终成败均摊到每个动作上,导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师(注入了成功技能 c+)与学生之间的 token 级对数概率差聚合为 turn 级证据,再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k,最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把’稀疏结果监督’转化为’每一步的密集信用’,在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%(+7.9pp),长程任务每轮交互衰减仅 0.54 点(GRPO 衰减 2.91 点)。消融实验进一步证明:先验锚定贡献 -10.2pp 是最关键设计,贝叶斯方向(符号保持)次之 -8.6pp。

August 8, 2026 · 8 min

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读

蚂蚁集团与上海交通大学联合提出 EnvACE,让一个策略同时扮演「行动者」和「环境」两个角色:Acting 角色生成工具调用,Rehearsal 角色生成对应的环境响应,两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互,却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline,综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是,模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling,在提交执行前先在内部排练验证,把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」,并提炼出三条可迁移到其他领域的通用灵感。

August 8, 2026 · 6 min

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models 精读

深度精读港大与腾讯联合出品的 OSReward——首个系统检验计算机使用 Agent(CUA)轨迹评判器可靠性的基准与开源奖励模型工作。论文构建了覆盖 Web/Windows/macOS/Ubuntu/Mobile 五大平台的 1,019 条人工标注轨迹基准,揭示了所有主流 VLM 评判器存在的系统性「宽容偏差」,并训练出成本降低 30-60 倍的开源奖励模型 OS-Shepherd。本精读从背景补全、研究脉络定位、问题抽象、方法机制、评估证据、效果根源、必要知识反推到可推广灵感,九部分完整拆解这项为 CUA 评判建立标准化评估体系的开创性研究。

August 8, 2026 · 8 min

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents 精读

深度精读浙江大学 VaG(Verifier-as-Gatekeeper)论文——首个正面刻画「自进化 Agent 中能力-污染相变」现象的工作。论文首次形式化了「技能池超过临界规模后新增技能反而降低性能」的非单调相变,并从数学上证明污染链具有结构不可逆性:有缺陷技能进入决策上下文后,其后代继承缺陷推理却从不引用原始缺陷源,导致事后回滚恢复率仅17%。VaG 采用「渐进信任层次 + 异构验证器检查不相交属性」的三级前commit门控(SchemaCritic 结构检查 / ExecCritic held-out重放 / AgentCritic 语义审查),配合边际增益贪心子集选择移除组合污染,在 Terminal-Bench 2 上以仅37个技能达到72% pass@1(Ungated崩溃至50%),技能池缩小近5倍,并在跨模型、跨基准迁移上全面领先。本文从背景、关联工作、问题抽象、三级门控解法、实验证据到不可逆性根源解释,完整拆解这一「前commit优于事后修复」的开创性研究,并提炼出可推广的系统安全设计灵感。

August 8, 2026 · 8 min