论文链接:RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments 发表时间:2026年9月 机构:Aether AI + 高校合作(论文含实习期完成标注) 领域标签:cs.AI / Recursive Self-Improvement
一、论文背景
新环境适应问题:数字 Agent(操作电脑、浏览器、软件的智能体)部署到新环境时,面对的是预训练从未见过的界面、工具与失败模式——某个内部系统的提交按钮藏在三级菜单下、某个 API 对并发调用有隐藏限流。预训练知识覆盖不到这些"环境特异性"。
两条既有路线的困境:训练路线(在环境数据上微调模型)泛化差且每个新环境都要重训,成本高;training-free 路线(用多模态大模型直接上阵+通用提示)虽灵活,但缺乏把"提议动作"与"空间证据、任务进度、执行失败"对账的机制——错了不知道为什么错,下次还错。
RSI 视角:论文把这个适应问题纳入递归自我改进框架——Agent 通过自主探索构建环境知识,知识改善后续探索,形成正循环。关键问题变成:探索产生的知识应该以什么形态存储才能被复用?
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 环境 Agent 基准 | OSWorld、Agent’s Last Exam | 真实环境评测 | 评测基准,非适应方法 |
| 经验记忆 Agent | ExpeL、Reflexion 系 | 从轨迹中提炼经验 | 记忆多为自然语言启示,非结构化因果 |
| 课程式探索 | curriculum learning 系 | 由易到难安排任务 | 多用于训练,本文 training-free 探索 |
| 自主探索 | WebArena 探索系 | Agent 主动摸查环境 | 探索产物未结构化为因果知识 |
| 同日 RSI 工作 | Dream-RSI、ModularRSI | RSI 的其他子问题 | 改进对象不同(策略/harness vs 环境知识) |
定位结论:RSIAgent 占据"新环境适应 × 结构化记忆 × training-free"交点——不训练模型、不演化 harness,而是让 Agent 自己给环境"编写因果说明书"。
三、问题定义
具体场景:Agent 首次进入未知数字环境,无监督信号、无人类演示,需要尽快达到高水平任务完成。
抽象问题:如何把无监督探索产生的经验转化为可迁移、可冻结、可直接查询的环境知识表示。
形式化:给定环境 E(状态空间、动作空间、未知因果结构 C:动作×条件→后果),通过自主探索构建记忆 M ≈ C,使得下游任务 t 的执行策略 π(a|s, M) 的期望回报最大化;M 一经构建即冻结(不再更新模型参数)。
精妙之处:把"适应"重新定义为"因果结构辨识"而非"策略学习"——一旦环境的因果结构(什么操作在什么条件下导致什么后果)被正确识别,任何下游任务都只是在这个结构上做规划,不需要重新学习。这是"授人以渔"与"授人以鱼"的结构性差异。
四、问题解法
三类 Agent 协作:
① Curriculum Agent(课程 Agent):设计探索任务序列——从简单交互(点按钮、填表单)到复杂流程(多步操作、异常处理),由易到难渐进暴露环境结构。类比:新员工的入职培训计划制定者。
② Actor Agent(执行 Agent):实际执行探索动作并观察结果。
③ Verifier Agent(验证 Agent):判定探索结果——动作成功了吗?后果与预期一致吗?把成功/失败与前置条件关联,产出"动作-条件-后果"三元组写入记忆。类比:质检员,把关哪些经验值得入库。
广度+深度双探索策略:
- 广度探索(broad):并行发散,覆盖环境的不同区域/功能面,快速建立环境结构地图——哪里有什么、入口在哪。
- 深度探索(deep):聚焦收敛,对已发现的结构深挖隐藏约束、边界条件、罕见失败模式——并发上限是什么、哪些输入触发异常。
记忆冻结与复用:探索完成后记忆冻结,下游任务执行时作为只读知识库查询——“此操作是否触发隐藏约束”。
五、评估指标与实验证据
基准:OSWorld-v2(真实电脑操作)与 Agent’s Last Exam(近端任务)。
| 对比 | 指标 | 结果 | 证明什么 |
|---|---|---|---|
| 完整 RSI vs 仅广度 vs 仅深度 | 四任务平均 partial score | 74.54% / 65.52% / 56.50% | 广深互补缺一不可 |
| 开源+RSIAgent vs 闭源前沿 | OSWorld-v2 / ALE | Kimi-K3、GLM-5.3 反超 GPT-6 Astra | 环境知识可弥补模型能力差距 |
| 仅广度 vs baseline | 逐任务 | 广度每任务均有提升 | 广度是底线保障 |
| 仅深度 vs baseline | 逐任务 | 深度在 T085/T089 反而低于 baseline | 单独深挖可能浪费预算在错误方向 |
证明力分析:三消融的非单调组合效应是最有说服力的证据——广度单独有效(全覆盖)、深度单独甚至有害(T085/T089 低于 baseline,因为缺少广度地图时深挖方向错误)、组合最优(74.54% 超过两者之和的简单平均)。这种"1+1>2 但 0+1<0"的模式排除了"多探索总是好"的平凡解释,证明两种探索在信息类型上互补:广度提供结构先验,深度提供边界知识,后者依赖前者定向。
开源反超闭看的证明力:同一记忆分别加持 Kimi-K3 与 GLM-5.3 都超过 GPT-6 Astra——环境知识的增益跨模型族成立,说明收益来自记忆而非特定模型特性。
六、效果优势的根源解释
根源机制与证据链
- 因果 vs 轨迹的知识形态差异(论文实验已支持 + 机制推理):baseline(裸模型)靠预训练泛化猜测环境行为;经验记忆 Agent 存自然语言启示(“此系统较慢,需耐心”)——这类记忆在新任务的决策点上无法精确回答"这个操作现在安全吗"。因果三元组记忆把知识锚定在(动作、条件)→后果的可查询结构上,决策时精确匹配当前状态 → 体现在跨模型族一致反超。
- 广度为深度定向(论文实验已支持):消融中深度单独有害(56.50%<baseline),组合后增益显著——机制上,深度探索的预算有限,没有广度地图时深挖的对象选择近似随机;有地图后深挖集中在"结构上可疑"的区域(复杂度高、失败率异常的分支)。
- Verifier 的质量控制(论文实验间接支持):记忆污染(错误因果入册)会随复用放大;verifier 独立于 actor 判定,降低单一模型幻觉进入记忆的概率。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| ExpeL | 轨迹→自然语言经验 | 经验提炼提升 Agent | 记忆非结构化因果 | 支持:记忆有用;限定:形态影响上限 |
| Reflexion | 失败后语言反思 | 自我反思改善后续尝试 | 单任务内,不冻结复用 | 支持:失败信号价值 |
| Voyager | Minecraft 自主技能库 | 游戏域探索+技能沉淀 | 技能库非因果图谱 | 支持:探索-沉淀循环 |
| Dream-RSI(同日) | 重放改进探索策略 | 策略层 RSI | 知识层 vs 策略层 | 补充:RSI 分层谱系 |
| HarnessVLN(同日) | 具身导航 training-free | 证据驱动状态更新 | 具身域 | 支持:training-free 路线跨域 |
综合判断与未决问题
多研究共同支持:结构化经验优于无经验(ExpeL/Voyager/本文三方一致);training-free 适应可行(HarnessVLN/本文)。仍属推测:因果记忆的规模上限——环境因果结构复杂度增长时记忆检索是否会遭遇组合爆炸(论文四任务规模未触及)。适用边界:环境需可被探索(允许试错);破坏性环境(错误操作不可逆)需要安全护栏配合。可能的失效条件:非平稳环境(接口频繁变更)下冻结记忆过期为错误知识。
七、必要知识反推
领域知识层:数字环境的失效模式分类(隐藏限流、状态依赖行为、异步延迟)——不了解失败模式类型就无法设计 verifier 的判定维度。
方法论知识层:因果推断基础(相关≠因果——探索中观察到的共现需条件控制才能入册);课程学习理论(难度递增序列的设计原则);广度优先 vs 深度优先搜索的权衡理论。
工程知识层:多 Agent 编排(curriculum/actor/verifier 的消息协议与失败隔离);记忆的序列化与检索设计(三元组的索引结构)。
知识融合关键节点:“记忆应存因果关系而非轨迹"的洞察需要同时理解 Agent 经验复用研究(轨迹记忆的迁移失败案例)与因果表征(条件的必要性)——两域知识的交集催生知识形态的设计决策。
八、通用性灵感
- 环境说明书原则:进入任何新系统先构建其"因果说明书”(什么操作在什么条件下导致什么),后续一切任务在此之上规划(论文证据:冻结记忆跨模型族反超闭源)。推广:新员工入职的环境知识库自动化;自动化测试脚本的"系统行为地图"预生成。
- 广度定向、深度挖界:探索预算分配的两阶段法则——先广撒建立结构地图,再聚焦深挖边界与异常(论文证据:消融的 74.54/65.52/56.50 非单调组合)。推广:市场调研(先全景扫描再深访)、代码审计(先架构梳理再钻可疑模块)。
- 知识冻结促复用:探索产物冻结为只读资产,与生产执行解耦(论文证据:记忆冻结后直接服务下游任务)。推广:咨询行业的行业知识库(项目沉淀冻结为方法论资产)。
- 小模型+结构化知识 ≥ 大模型:模型能力差距可以用环境知识弥补(论文证据:GLM-5.3+记忆 > GPT-6 Astra)。推广:垂直领域的企业 Agent 不必追最大模型,领域知识工程是更可控的杠杆。