论文链接:Experience Funnel: A State–Policy Alternating Loop for Self-Evolving Agents 发表时间:2026年9月 机构:Huawei(Weizhe Lin 通讯作者等)+ The Hong Kong Polytechnic University + Renmin University of China —— “企业+高校"合作:华为主导系统研发与算力,港理工/人大参与方法设计 领域标签:cs.CL / Self-Evolving Agents / Skill Distillation / Continual Learning
一、论文背景
Agent 在反复交互中不断产生经验:成功轨迹揭示有效策略,失败暴露错误决策与能力缺口。自进化研究的核心问题是:如何把这些经验转化为未来行为的改进?
现有方案沿着两条路各走各的:
路线一:显式文本状态——把经验存成技能文档、记忆、程序性指令、harness 说明。优点:快(改文档即生效)、可读可编辑、人可审计。缺点:外部依赖持久存在——每次执行都要检索、塞上下文;经验无限累积会导致检索成本攀升、指令冲突、记忆管理复杂化;且"指导是否还有用"依赖当前策略水平,策略进步后旧指导可能冗余甚至冲突。
路线二:参数化策略——用 RL 或蒸馏把经验内化进权重。优点:紧凑、自主、不占上下文。缺点:慢且不可逆风险——把每条观察到的经验都吸进权重,会固化噪声性、样本特异、甚至已掌握的行为;而且经验的价值是策略相关的:对当前策略有用的指导,策略进步后可能变得冗余、互补或冲突。
问题的本质是时间尺度错配:文本状态是快变量,参数策略是慢变量,而经验的价值随策略演化不断变动。单一路线要么被快变量的债务压垮(状态无限膨胀),要么把慢变量更新得太频繁太脏(权重吸收噪声)。如何让经验被渐进地过滤——从原始轨迹到可编辑状态,再选择性固化入策略,并随策略演化重新评估?——这就是本文要填的空。
二、论文定位和关联工作
脉络一:状态侧进化。 Reflexion/MemoryBank/ExpeL 的记忆进化、技能自进化(AutoManual、Trace2Skill、SkillRL 的技能库维护)、harness 进化(HarnessForge 等)。它们打磨了"经验→文本状态"的管线,但没有回答"状态何时该退役入权重”。
脉络二:策略侧内化。 Skill-conditioned RL、OPID(从 on-policy 轨迹提取后视技能并做 token 级归因)、自蒸馏。它们解决了"文本指导→权重"的单次内化,但没有管理"哪些值得内化、内化后状态怎么办"。
脉络三:联合优化系。 SkillRL 递归进化技能库+RL、ReSkill 在演化策略下评估技能修订、HarnessForge 联合适配 harness 与策略。这些工作承认了依赖关系,但缺少一个统一的经验管理叙事:经验如何被逐级过滤、谁决定晋升、晋升后状态如何回收。
| 维度 | State-only | Policy-only | Experience Funnel |
|---|---|---|---|
| 适配速度 | 快(改文本) | 慢(更新权重) | 快慢兼备(交替环) |
| 经验筛选 | 无(累积) | 无(吸收) | 双重门:状态验证+跨修订有效性 |
| 外部依赖 | 持续增长 | 无 | 逐步下降(内化后状态退役) |
| 策略演化适配 | 指导冲突风险 | 无显式经验 | 状态按新策略重新评估 |
定位结论:本文给出自进化 Agent 的第一个"经验漏斗"完整架构——快慢变量的交替环与经验的分级晋升制度。
三、问题定义
具体问题:如何把交互经验渐进转化为可复用的模型能力,同时保留快速可编辑的持续适应机制。
核心洞察(抽象):经验应该经历一个两级漏斗:第一级从原始轨迹到显式状态(快变量,负责快速试错与验证);第二级从状态到策略(慢变量,只晋升那些经过状态修订仍稳定有效的行为——即"跨修订稳定性"作为内化的准入门)。状态-策略构成交替环:策略更新后,剩余状态按新策略重新评估价值。漏斗的每一级都是一个过滤器,滤掉噪声性、样本特异性与已过时性。
形式化:给定交互流,维护状态 S(文本技能/指导集)与策略 π_θ:
- 状态适配(快):轨迹 τ → S 的更新(新增/修订指导),在环境验证中快速检验;
- 选择性固化(慢):定义"状态使能行为"b 为在 S 引导下出现且跨多个状态修订版本仍有益于任务成功的行为;将 {b} 经 transition-aware distillation 写入 π_θ;
- 交替:θ 更新后产生新 rollout → 驱动下一轮状态适配 → 循环;
- 目标:任务成功率最大化,同时外部状态依赖随轮次递减(内化后的指导可从 S 中退役)。
精妙之处:“跨修订有效性"把"哪些经验值得进权重"从主观判断变成了可操作的统计判据——噪声与样本特异行为很难在状态多次修订中保持稳定有效。
四、问题解法
4.1 状态适配层
轨迹经 LLM 归纳为显式文本状态(技能条目、程序指导),与传统技能进化一致;新经验快速并入并在少量验证 rollout 上检验有效性——快变量承担探索性试错的成本,避免直接污染权重。
4.2 选择性固化层(核心创新)
不是把状态里的一切蒸馏进策略,而是:
- 跨版本追踪:维护每个状态条目的修订历史;一个行为如果在状态的多个修订版本间持续出现且持续与任务成功相关,才被标记为"状态使能”;
- transition-aware distillation:对标记行为做蒸馏时保持转移感知——在学生自己 rollout 的对应转移上施加教师监督(与 on-policy 修正思想同源),而非离线模仿文本;
- 状态退役:已固化行为对应的指导从状态中删除或降权——上下文占用下降,且避免旧指导与新策略冲突。
4.3 交替循环
新策略产生新 rollout → 新的成功/失败模式进入状态适配 → 新一轮筛选固化。论文用消融展示了环上每个缺口(去掉选择性、去掉交替、去掉退役)的退化。
五、评估指标与实验证据
基准与对比:多个 Agent 基准(工具使用、多步任务形态),对比三类基线:无进化基线、state-only 进化(技能/记忆进化 SOTA)、policy-internalization(RL/自蒸馏 SOTA)。
核心发现:
- 一致超越两条单路线:Experience Funnel 在各基准上稳定优于 state-only 与 policy-internalization——这不是"融合两个方法"的和,而是筛选机制带来的独立增益:单路线要么吸收噪声(policy-only),要么背负依赖(state-only),漏斗两头都避开了;
- 外部依赖递减:随交替轮次推进,状态中的指导条目被逐批固化退役,上下文占用下降而性能不降反升——“经验从上下文迁移进权重"的主张有了直接观测;
- 固化质量分析:跨修订稳定性筛出的行为在固化后的策略成功率显著高于"全部固化"对照——准入门确实滤掉了不稳定行为。
证明力评估:双基线对照(state-only/policy-only)恰好对应两个"反事实单路线”,加上消融(去筛选/去交替/去退役)与依赖递减的过程性观测,机制主张与端到端收益都有支撑。局限:跨修订判据的统计功效依赖修订次数,冷启动阶段筛选噪声较大(论文在分析节讨论)。
六、效果优势的根源解释
两条单路线的根本瓶颈:
- state-only 的瓶颈是经验的"会计成本":所有经验平铺在上下文层,检索与冲突随量恶化;更隐蔽的是"过时指导"问题——策略进步后,旧指导从帮助变成脚手架依赖,Agent 无法内化能力。
- policy-only 的瓶颈是经验的"质量控制":RL/蒸馏直接吃轨迹,轨迹中的噪声(环境随机性、单样本侥幸)与真信号同权重进入梯度;且一次内化不可逆,错误行为固化后需更多成本纠正。
漏斗的机制改变与因果链:
- 快变量先试错 → 噪声在廉价层被淘汰 → 慢变量只见干净信号。状态层像一个低成本实验场:一个指导假设先以文本形式接受验证,无效者改写或删除,根本不碰权重。这改变了权重的"输入质量分布"——只有通过状态层生存检验的行为才进入蒸馏。
- 跨修订稳定性作为晋升判据 → 滤掉样本特异与过时行为 → 固化收益为正。噪声行为难以在多次状态修订中重复出现且持续有效;跨版本存活是"该行为反映领域规律而非偶然"的操作化证明。固化对照实验(跨修订筛选 vs 全量)直接验证了这层过滤的增益。
- 退役机制 → 状态层不被胜利品塞满 → 系统可持续。固化后的指导退役,状态保持小而新:上下文成本可控,且新经验不会与已内化的旧指导冲突——这解决了 state-only 的会计成本问题,使交替可以无限持续。
- 交替环 → 策略进化驱动状态再评估 → 适配目标随能力滚动。每轮新 rollout 暴露新短板,状态层聚焦新短板快速补足,再筛选固化——快慢变量各做各擅长的事。
反事实:去掉筛选(全量固化)——固化质量下降;去掉退役(只进不出)——上下文成本回升、冲突出现;去掉交替(一次性固化)——策略进化后无新经验通道,性能停滞。三个反事实分别支撑三个组件。
七、必要知识反推
领域知识层:
- Agent 经验的形态学(成功模式/失败模式/环境随机性的区分);
- 技能与记忆系统的工程结构(条目、修订、检索);
- 蒸馏与 RL 的内化特性对比(离线模仿 vs on-policy 校正)。
方法论知识层:
- 快慢双系统的控制论思想(不同时间尺度的变量耦合);
- 稳定性判据的统计设计(跨修订有效性 = 简单的重复性检验);
- 自进化系统的持续学习理论(灾难性遗忘、能力固化、课程自组织)。
工程知识层:
- 状态存储与修订追踪的版本管理;
- transition-aware 蒸馏的 rollout 采集与对齐;
- 交替循环的调度与验证 rollout 预算控制。
知识融合的关键节点:融合发生在"技能/记忆工程(文本状态的实操传统)“与”持续学习理论(权重更新的稳定性问题)“之间。技能工程师知道怎么写好一条指导但不管权重;持续学习理论家有稳定性判据但少有 Agent 场景的落地。作者看到"技能的修订历史"恰好是"行为的稳定性证据"这一无人注意的现成资产——不需要新的评估器,修订日志本身就是筛选器。快慢变量的控制论叙事则把零散组件组织成了一个可以无限运转的环。
八、论文中可以提取的通用性灵感
1. 经典两稿制:快变量试错,慢变量定型。 核心思想:让可逆的快层承担探索与试错,只有存活下来的经验才写入不可逆的慢层——任何学习系统都值得检查它有没有这个漏斗。 论文证据:状态层过滤后固化的行为成功率显著高于全量固化。 推广场景:个人笔记→长期知识卡片;灰度发布→全量上线;草稿→正式制度。
2. 修订存活史是稳定性的免费证据。 核心思想:一个假设/指导/规则若在多次修订中持续有效,即为其反映规律而非偶然的操作化证明——不需要额外评估器。 论文证据:跨修订稳定性作为内化准入门。 推广场景:开源项目的"久经考验"代码路径优先复用;组织 SOP 的存活条目优先培训;产品功能的留存分析。
3. 胜利品要退役,系统才能持续运转。 核心思想:已内化/已固化的经验应从快层退出,否则快层被旧货塞满、新经验无处安放。 论文证据:指导退役后上下文占用下降而性能提升。 推广场景:个人技能清单的"已掌握"归档;团队规范的"已内化"条款移除;模型 prompt 的指令瘦身。
4. 策略升级后,旧指导要重新评估而非永久保留。 核心思想:指导的价值依赖执行者水平——能力进步后旧指导会从脚手架变成枷锁。 论文证据:状态-策略交替环中按新策略重新评估状态价值。 推广场景:新员工指导随其成长逐步撤除;模型的 prompt 随版本能力升级而精简;父代教育的阶段调整。
5. 自进化系统的可持续性取决于进出平衡。 核心思想:只进不出的经验累积与只出不进的更新都会崩溃;设计进出两个通道(适配进、固化出)并让它们成环。 论文证据:交替环在多轮次上性能上升且依赖递减。 推广场景:知识库的编辑与归档制度;组织的人才流动设计;模型记忆系统的读写策略。
本文基于 arXiv:2609.08919 全文精读撰写。数据与结论均引自原文。