Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 精读

harness 进化后,让弱模型模仿更强专家的轨迹——这个’显然正确’的配方在七个企业任务上全部翻车(平均 -14.9 分),而同样的做法在未进化 harness 下却有增益。论文定位出根源:模仿让弱模型学会了专家的知识,却也继承了专家的规划风格,破坏了它与’围绕自身原生风格进化出来的 harness’的拟合。解法是 on-policy 专家修正:meta-MLE agent 定位失败 turn、专家只重写那一轮,平均 +1.7 分且规划失败桶保持地板水平。本文精读拆解’模型-harness 拟合’这一新概念与其共进化配方。

September 10, 2026 · 3 min

Experience Funnel: A State–Policy Alternating Loop for Self-Evolving Agents 精读

自进化 Agent 面临双时间尺度困境:文本状态(技能/记忆)快而外部依赖重,参数策略持久而更新慢。华为与港理工的 Experience Funnel 用交替环打通两者:轨迹先蒸馏为显式状态快速适配,再选择性把’跨状态修订仍有效’的行为经 transition-aware distillation 固化入策略——经验像漏斗一样从原始轨迹逐级过滤为可复用能力。多基准上一致超越 state-only 进化与 policy-internalization 两条单路线。

September 10, 2026 · 2 min

Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 精读

知识图把事实组织成 (实体, 关系, 实体) 三元组来回答’是什么’;Google 团队的 Procedural Graph 用 (过程, 关系, 过程) 三元组回答’怎么做’。Agent 每步决策时定位活跃节点,引导模型把邻域子图翻译成步级情境引导;离线自进化循环对比成败轨迹编辑图拓扑与属性,验证门通过才采纳、拒绝项存为负约束。六个基准三个 LLM 全面超越 ReAct/ExpeL/AWM 等记忆基线——Gemini 3.1 Pro 上 τ-bench 72.17→80.00、GDPval 56.39→78.78、ALFWorld 满分,零骨架自进化图匹配乃至超越手工设计。本文精读拆解过程性知识的表示设计与’验证门+拒绝记忆’的进化机制。

September 10, 2026 · 2 min

EvoHarnessBench: 智能体能跟上不断进化的 Harness 吗 精读

Salesforce Research×UNC Chapel Hill×UW–Madison 的 EvoHarnessBench 把非平稳性从任务流转移到 harness 本身:17 条受控 harness 进化流(802 任务、520 工具、42 技能、62 智能体),分部署评估(能力保持)与自进化适应两设定。基准回答一个此前无人系统提问的问题:当工具、技能、子智能体持续增加时,已部署 agent 的既有能力何去何从。

September 8, 2026 · 2 min

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 精读

流式视频理解的主流范式是’存历史、按需检索’,但外部证据永远只是临时上下文。南京理工×蚂蚁×NUS×港中文的 LatentStream 把范式翻转为’检索并内化’:分层流记忆 + 渐进扩张感受野的 latent token 把历史证据固化进固定长度潜记忆,用熵构造的渐进置信奖励在测试时联合优化。OVO-Bench 64.2%、StreamingBench 76.9%、MLVU +6.1,全部 SOTA。

September 7, 2026 · 2 min

Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training 精读

自主 LLM 后训练系统不断积累’过去什么更新有效’的经验,但父模型一旦变化,旧经验就可能是毒药。本文把这一困境形式化为条件经验迁移问题,提出 BCIT:把效果绑定到源上下文、更新前检查适用性、具名硬冲突否决、必要时小预算试验取证。等预算对比中 BCIT 更少授权有害更新、最终模型质量更高,为自进化 Agent 补上’免疫排异’机制。

September 7, 2026 · 2 min

Aspire: Can Models Self-Evolve from Vague Goals? 精读

现有 LLM 自进化研究都从人类定义好的显式任务出发,agent 只搜索’怎么优化’;但人类学习往往始于’成为更好的物理学家’这样的模糊目标。ByteDance Seed 联合 SUTD、M-A-P 等发布 Aspire 基准:只给一句自然语言能力目标,评测集对 agent 完全隐藏,agent 必须自己决定优化什么、怎么训练、如何验证。实验给出罕见的机制级阴性结果——24 次 final-only 运行仅 1 次超过基线分,最佳进化 harness 仍低于人工 Qwen-Agent。本精读拆解隐藏评测设计、三条研究问题(RQ1-RQ3)的实验逻辑,以及’代理增益不迁移’这一失败模式的根源。

September 4, 2026 · 3 min

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? 精读

Agent 每天与环境交互积累海量轨迹,但经验真的变成了能力吗?ByteDance Seed 姊篇基准 S3Gym 把’自改进’拆成自测试、自判断、自改进三个可测环节,在 7 个可执行验证的文本游戏上比较三种经验注入通路:原始历史 ICL、摘要记忆、参数训练。7 个前沿模型的核心发现:自改进既不自动也不均匀——GPT-5.5 在 PvZ 上 History ICL 的 AUC⁺ 高达 548.5,换摘要记忆暴跌到 33.2;同一模型同一环境换个通路结果天差地别。本精读拆解宽松探索/严格评测的分离设计、自评分与环境真值的对照记录,以及’经验压缩可行性决定通路优劣’的机制规律。

September 4, 2026 · 3 min

Fast Weight Attention for Continual Learning 精读

深度精读 ByteDance Seed、Princeton、清华、UCLA 与 Hyperbolic Labs 合作的 Falcon 论文:把线性注意力与状态空间模型的状态转移显式化为在线学习规则,发现读后写语义下快记忆的正确训练对应是前缀配对 φ(k(t-1))→v(t) 而非常见的同对配对,并从平方误差回归与内积两个局部目标统一推导出 NLMS 归一化的六个变体族(Falcon-1/2/3 与 Falcon-1A/2A/3A),全部兼容 SSD 式 chunk 并行训练。语言建模上与最强递归基线互有胜负,变长加法外推上 Falcon-3A.3 以 87.2 平均精度大幅领先 Transformer 的 65.8。

August 31, 2026 · 6 min

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读

CAFE(复旦大学 × 腾讯 LLM 部门)把纠正性反馈做成搜索智能体轨迹内可请求的干预:共享参数模型分饰 agent/critic 两角色,冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示;在线 RL 用比较反馈估计(同提示请求组 vs 跳过组的成功率差)塑造请求回报,反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用;离线 RDPO 从前缀匹配的成功/失败对学反馈生成;100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法,6 个 OOD 基准全保持,答案级幻觉率 17.6%→12.6%;单向消融证明只改 agent 或只改 critic 都会平台化,交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。

August 27, 2026 · 3 min