Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines? 精读

深度精读 Hui Xue 与 Fan Yang 的《Rethinking Self-Evolving Agents》——一项直面预设流水线是否仍然必要的反思性研究。文章提出 OEO(Open-Ended Optimization,开放式优化):固定目标、交互、预算、数据边界和评估这五项不可妥协的约束,但把优化过程完全交给前沿模型自行组合。在 GPT-5.5 驱动下,OEO 在 14 次正面交锋中 12 胜 1 平 1 负,仅用 SkillOpt 配置预算中位数 34.3% 的目标交互 token。本精读按九部分结构拆解其背景、定位、问题抽象、机制、实验证据、优势根源、必要知识反推与通用性灵感,并重点解读能力依赖的脚手架这一核心洞见。

August 11, 2026 · 7 min

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States 精读

深度精读 RoMeRL 论文——首次将自进化 Agent 记忆中的’反馈稀疏’与’记忆-奖励陷阱’两大耦合难题统一刻画,并用’降阶效用状态’把不断增长的轨迹索引效用空间压缩到固定维度的语义坐标上。理论证明降阶参数化提升每个效用坐标的平均反馈量,并刻画错误坐标的稳态占用;ALFWorld 和 LifelongAgentBench 上 Cold-Q 比例降低 80.0%、反馈密度提升约 6.0 倍、维护记忆大小减少 84.4%、LLM 调用减少 21.1%。本精读覆盖问题根源、因子化机制、反馈聚集原理、实验设计与通用性灵感。

August 11, 2026 · 8 min

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 精读

深度精读 SHE 论文——复旦、阿里达摩院、莱斯大学等多校合作提出 Safety Harness Evolution,将 Agent 安全 harness 解构为 System Prompt / Rule Bank / Safety Memory / Tool Policy 四个责任显式、独立可进化的制品,并通过归因引导的进化循环把轨迹失败转化为结构化诊断、局部精化与安全-效用验证。在 Agent-SafetyBench 上攻击成功率(ASR)相比静态 SafeHarness 降低 3.1 倍,同时良性任务效用不降反升;进化后的 harness 还能零成本泛化到 held-out 的 AgentHarm 基准并跨 Agent 模型迁移。本精读按九部分结构展开:从 Agent 安全 harness 的’整体黑盒’困境,到 SHE 的’免疫系统白细胞规则集’类比,再到归因引导进化与’精准医疗 vs 全身化疗’的范式对照。

August 11, 2026 · 10 min

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 精读

港科大的 SkillProx 把 LLM Agent 的「技能自进化」重新拆解为「近端梯度下降」的前向-后向两阶段:前向用闭环重执行拦截退化的诊断补丁,后向用冻结的留一效用审计配合验证门控选择性整合/降级/删除知识单元。相比最强梯度基线 SkillGrad 平均提升 3.0pp,且消融清晰地揭示了「闭环诊断 -1.5、近端收缩 -2.5」的因果分工。本精读以九部分结构,详解这套自进化框架的方法机制、实验证据、效果根源与可迁移灵感。

August 11, 2026 · 7 min

TEPA: Revoking Stale Memories for Conflict-Robust Language Agents 精读

深度精读 TEPA 论文——首次将 Agent 长期记忆的’记忆污染’形式化为可证伪性问题,提出可撤销的证据-记忆机制,让有效性成为记忆的显式状态。在完全反转场景下,append-only 跌至 0.210(甚至低于无记忆基线 0.309),而 TEPA 保持 0.950。真实文件执行场景同样再现这一模式,MemoryAgentBench SH-6k 上匹配强 last-write-wins 缓存(0.890)。边界测试揭示多跳和超长上下文是下一阶段架构挑战。

August 11, 2026 · 8 min

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读

AgentOPSD 把 Agent 强化学习中长期被回避的’信用分配’难题重新拉回中心:在多轮交互、稀疏奖励的 Agent 任务里,GRPO 这类方法只能把最终成败均摊到每个动作上,导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师(注入了成功技能 c+)与学生之间的 token 级对数概率差聚合为 turn 级证据,再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k,最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把’稀疏结果监督’转化为’每一步的密集信用’,在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%(+7.9pp),长程任务每轮交互衰减仅 0.54 点(GRPO 衰减 2.91 点)。消融实验进一步证明:先验锚定贡献 -10.2pp 是最关键设计,贝叶斯方向(符号保持)次之 -8.6pp。

August 8, 2026 · 8 min

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 精读

CalibForge 提出了一个自主终端任务合成系统,把求解器行为当作’构建时反馈’,通过多求解器校准和对比求解器校准两种对抗式策略,将候选任务反复修订到’可证明可解但又不被统一求解’的求解器相对可学习区间。基于 5,431 个校准任务蒸馏 SFT 后,Qwen3-30B-A3B 在 Terminal-Bench 2.0 从 7.87% 跃升到 32.58%,并在 SWE-bench Pro、Doc2Repo 两个分布外基准上同步取得 +27.68、+30.04 个百分点的迁移提升。本文从终端任务与可学习区间讲起,逐层拆解对抗式作者-求解器循环、轨迹反馈的三类修订模式,并从第一性原理分析’为何校准优于单求解器反馈’。

August 8, 2026 · 7 min

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents 精读

深度精读浙江大学 VaG(Verifier-as-Gatekeeper)论文——首个正面刻画「自进化 Agent 中能力-污染相变」现象的工作。论文首次形式化了「技能池超过临界规模后新增技能反而降低性能」的非单调相变,并从数学上证明污染链具有结构不可逆性:有缺陷技能进入决策上下文后,其后代继承缺陷推理却从不引用原始缺陷源,导致事后回滚恢复率仅17%。VaG 采用「渐进信任层次 + 异构验证器检查不相交属性」的三级前commit门控(SchemaCritic 结构检查 / ExecCritic held-out重放 / AgentCritic 语义审查),配合边际增益贪心子集选择移除组合污染,在 Terminal-Bench 2 上以仅37个技能达到72% pass@1(Ungated崩溃至50%),技能池缩小近5倍,并在跨模型、跨基准迁移上全面领先。本文从背景、关联工作、问题抽象、三级门控解法、实验证据到不可逆性根源解释,完整拆解这一「前commit优于事后修复」的开创性研究,并提炼出可推广的系统安全设计灵感。

August 8, 2026 · 8 min

RSI比Coding Agent大得多:对话田渊栋,递归自进化为什么是阶段式突破而非渐进攀升

前Meta FAIR研究员田渊栋创立Recursive Superintelligence(A轮6.5亿美元,估值46.5亿美元)后首次系统阐述RSI:它比coding agent大得多、难得多;完全自动化不会很快发生,递归会先发生;智能发展是S型曲线而非scaling law的平滑攀升,这恰恰给了初创公司窗口。他们的第一阶段成果在算子优化、NanoChat训练和NanoGPT SpeedRun三个方向取得SOTA,用一套通用系统击败了专业GPU团队。田渊栋认为AI终将从炼金术变成化学,可解释性是少数派但正确的路。

August 7, 2026 · 1 min

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories 精读

Agent 部署后会积累大量失败轨迹,但它的行为通常固定不变——模型不更新,Harness(运行时框架)也不更新。Harness-R1 首次把’编辑可执行运行时’本身变成一个可被在线 RL 训练的能力:一个 9B 的’harness 工程师’模型从失败批次中生成可执行补丁,用冻结目标 Agent 重跑的真实成功率作为奖励。结果这个 9B 工程师反超 GLM-5.2、GPT-5.5、DeepSeek-V4-Pro 等所有更大的前沿模型编辑器;即便目标 Agent 微调后,工程师仍能再 +5.0pp。本文从’把脚手架变成可学习对象’的第一性原理,解释为什么小模型+真实结果奖励能赢过大模型+教师提议。

August 5, 2026 · 2 min