Progressive Agent Skill Generation via Reinforcement Learning (Skill-α) 精读

Agent 技能(Skill)是可复用的程序性知识,但生成技能缺乏自然监督信号——技能好不好只能看它能不能帮 Agent 在下游任务上做得更好。Skill-α 把技能生成形式化为序列编辑过程(Create/Update/Merge/Prune/Noop),核心创新是’回滚奖励’:对每个编辑,用同一锚定查询在原始技能和编辑后技能上分别运行固定工作器,编辑后更优才给正奖励。GPT-4o 工作器下 CL-Bench +3.3 点、tau2-bench +6.7 点超越最强基线。本文从’技能价值只能由下游表现定义’的第一性原理,解释为什么回滚奖励是技能生成的正确监督信号。

August 5, 2026 · 2 min

TARL:面向长期Agent的可执行记忆管理精读

长期Agent的持久记忆里,一次错误的更新会像多米诺骨牌一样反复扭曲未来的检索与推理。现有系统把记忆更新简化为二元Write/Hold决策,无法区分’新增/忽略/修订/拒绝/延迟验证’这五种本质不同的处置。TARL把每条语句映射到五种可执行操作,通过Accepted/Pending/History三账本管理记忆生命周期,并用反事实执行监督——在训练时执行所有候选动作、比较产生的记忆状态质量——来训练模型选择导致正确结果的操作。5-way Macro F1 0.8286、Next State Accuracy 0.6621、Memory Pollution Rate改善10.1%,且完美二元标签仅能恢复28.6%的状态、五动作Oracle可达100%——这篇论文从机制因果上证明了为什么二元监督从根本上不足。

August 5, 2026 · 5 min

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement 精读

RLVR(带可验证奖励的强化学习)让 LLM 在数学、代码等可确定性判对的领域突飞猛进,却长期被「开放式任务没有标准答案」挡在门外。本文精读 COLM 2026 论文 RLSVR/SpyRL:借鉴自监督学习「构造前置任务」的思路,把摘要、创意写作这类开放任务变换成一个「谁是卧底」的多智能体博弈——因为卧底身份是预设的,投票结果天然可验证,从而第一次让开放域 LLM 自我改进脱离了外部评判器。实验在摘要、写作、数学三大领域全面超越 R-Zero、Absolute Zero,甚至击败 GPT-4o 作评判的 Rubric-as-Reward 方案,且成本为 0。

August 3, 2026 · 9 min

MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems 精读

MANTA首次将多Agent系统的通信拓扑从’部署前固定的设计选择’重新定义为’推理时可自我演化的系统变量’。通过拓扑规划器、轨迹审计器和技能反射器三个编排组件,MANTA在任务执行期间监控协作过程并应用有界结构修复——修改角色、通信链路、执行顺序和信息可见性。在五个基准上平均74.0分,超越最强baseline 5.8分,且总token消耗最低。论文揭示了’拓扑是自我改进的独立层次’这一新范式。

August 2, 2026 · 3 min

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow 精读

ShadowDancer提出影子对(shadow pairs)和跨影子预测(cross-shadow prediction),通过构造方式解决潜在动作模型的外观-动力学耦合问题。同一动力学轨迹在不同外观下重放,预测一个影子所需的表示必然是共享动力学本身。任何演示片段成为可复用动作资产,在新环境中重放无需动作标签、运动估计器或微调,跨五族动力学平均盲测胜率86%。论文揭示了’构造性不变量提取’的全新自监督范式。

August 2, 2026 · 3 min

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 精读

SpatialCLI提出Call-Learn-Internalize三阶段框架,教VLM先用空间专家工具(定位/分割/深度/姿态)学会组合感知,再通过双视图训练将专家能力内化为无工具推理。8B模型内化后无工具达72.7%、带工具达91.3%,均超越GPT-5.6 Sol。论文揭示了’工具→RL→内化’的渐进式能力蒸馏新范式。

August 2, 2026 · 3 min

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation 精读

β-OPSD揭示在线策略自蒸馏(OPSD)是KL正则化策略优化家族中β=1的特例,将β从隐式固定值变为可控参数后,最优策略变为参考策略与特权教师之间的几何插值。通过将RL推导的闭式解转化为蒸馏目标,用廉价的蒸馏近似昂贵的策略优化。Return-to-go信用分配纠正token级更新的短视性。在Qwen3-1.7B上数学推理平均提升5.74分,持续超越vanilla OPSD、SFT和GRPO。

August 2, 2026 · 2 min

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement 精读

RSIBench-Data 是首个专门评估「LLM Agent 能否自动化数据中心化后训练研究」的受控基准。它固定训练/服务/评估基础设施,隔离 Agent 的研究决策能力。实验揭示了「发现-���靠性差距」:Agent 在 58.33% 的设置中能通过反馈迭代改进首次尝试,但在达到峰值后继续搜索时,78.26% 反而退化。强运行轨迹有四种模式:准确假设、验证信号、行为对齐数据、保留最佳检查点。

July 31, 2026 · 3 min

Recursive Harness Self-Improvement 精读

Sakana AI 与 UC Berkeley 提出 RHI(递归式框架自改进):把多智能体框架当作提示词级对象,仅用当前与上一版本的自我比较来迭代优化,少数几轮就能让低推理强度的 Agent 超越同族最高推理强度设置,同时把推理成本降低最高 60%。本文从 Harness 是什么、模型-框架协同进化讲起,拆解 RHI 的轨迹局部目标、算法流程、信息论隐式目标,并提炼可推广的通用性灵感。

July 23, 2026 · 6 min

智能体技能演化(Skill Evolution 与 Self-Evolving Agents)综述:53 篇核心论文精读

技能演化与自演化智能体综述。从 116 篇候选中筛定 53 篇 CORE 论文下载全文精读,提炼技能库选择退化、技能创建与部署脱节、自演化缺乏可靠接受准则、上下文无界膨胀等共性问题,以及 16 个范式级新转变(PACE、Bayesian-Agent、Red Queen Godel、Trellis、MMG2Skill 等 5 个已联网验证)。

July 17, 2026 · 4 min