论文链接:RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments 发表时间:2026年9月 机构:Aether AI + 高校合作(论文含实习期完成标注) 领域标签:cs.AI / Recursive Self-Improvement

一、论文背景

新环境适应问题:数字 Agent(操作电脑、浏览器、软件的智能体)部署到新环境时,面对的是预训练从未见过的界面、工具与失败模式——某个内部系统的提交按钮藏在三级菜单下、某个 API 对并发调用有隐藏限流。预训练知识覆盖不到这些"环境特异性"。

两条既有路线的困境:训练路线(在环境数据上微调模型)泛化差且每个新环境都要重训,成本高;training-free 路线(用多模态大模型直接上阵+通用提示)虽灵活,但缺乏把"提议动作"与"空间证据、任务进度、执行失败"对账的机制——错了不知道为什么错,下次还错。

RSI 视角:论文把这个适应问题纳入递归自我改进框架——Agent 通过自主探索构建环境知识,知识改善后续探索,形成正循环。关键问题变成:探索产生的知识应该以什么形态存储才能被复用?

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
环境 Agent 基准OSWorld、Agent’s Last Exam真实环境评测评测基准,非适应方法
经验记忆 AgentExpeL、Reflexion 系从轨迹中提炼经验记忆多为自然语言启示,非结构化因果
课程式探索curriculum learning 系由易到难安排任务多用于训练,本文 training-free 探索
自主探索WebArena 探索系Agent 主动摸查环境探索产物未结构化为因果知识
同日 RSI 工作Dream-RSI、ModularRSIRSI 的其他子问题改进对象不同(策略/harness vs 环境知识)

定位结论:RSIAgent 占据"新环境适应 × 结构化记忆 × training-free"交点——不训练模型、不演化 harness,而是让 Agent 自己给环境"编写因果说明书"。

三、问题定义

具体场景:Agent 首次进入未知数字环境,无监督信号、无人类演示,需要尽快达到高水平任务完成。

抽象问题:如何把无监督探索产生的经验转化为可迁移、可冻结、可直接查询的环境知识表示。

形式化:给定环境 E(状态空间、动作空间、未知因果结构 C:动作×条件→后果),通过自主探索构建记忆 M ≈ C,使得下游任务 t 的执行策略 π(a|s, M) 的期望回报最大化;M 一经构建即冻结(不再更新模型参数)。

精妙之处:把"适应"重新定义为"因果结构辨识"而非"策略学习"——一旦环境的因果结构(什么操作在什么条件下导致什么后果)被正确识别,任何下游任务都只是在这个结构上做规划,不需要重新学习。这是"授人以渔"与"授人以鱼"的结构性差异。

四、问题解法

三类 Agent 协作:

① Curriculum Agent(课程 Agent):设计探索任务序列——从简单交互(点按钮、填表单)到复杂流程(多步操作、异常处理),由易到难渐进暴露环境结构。类比:新员工的入职培训计划制定者。

② Actor Agent(执行 Agent):实际执行探索动作并观察结果。

③ Verifier Agent(验证 Agent):判定探索结果——动作成功了吗?后果与预期一致吗?把成功/失败与前置条件关联,产出"动作-条件-后果"三元组写入记忆。类比:质检员,把关哪些经验值得入库。

广度+深度双探索策略:

  • 广度探索(broad):并行发散,覆盖环境的不同区域/功能面,快速建立环境结构地图——哪里有什么、入口在哪。
  • 深度探索(deep):聚焦收敛,对已发现的结构深挖隐藏约束、边界条件、罕见失败模式——并发上限是什么、哪些输入触发异常。

记忆冻结与复用:探索完成后记忆冻结,下游任务执行时作为只读知识库查询——“此操作是否触发隐藏约束”。

五、评估指标与实验证据

基准:OSWorld-v2(真实电脑操作)与 Agent’s Last Exam(近端任务)。

对比指标结果证明什么
完整 RSI vs 仅广度 vs 仅深度四任务平均 partial score74.54% / 65.52% / 56.50%广深互补缺一不可
开源+RSIAgent vs 闭源前沿OSWorld-v2 / ALEKimi-K3、GLM-5.3 反超 GPT-6 Astra环境知识可弥补模型能力差距
仅广度 vs baseline逐任务广度每任务均有提升广度是底线保障
仅深度 vs baseline逐任务深度在 T085/T089 反而低于 baseline单独深挖可能浪费预算在错误方向

证明力分析:三消融的非单调组合效应是最有说服力的证据——广度单独有效(全覆盖)、深度单独甚至有害(T085/T089 低于 baseline,因为缺少广度地图时深挖方向错误)、组合最优(74.54% 超过两者之和的简单平均)。这种"1+1>2 但 0+1<0"的模式排除了"多探索总是好"的平凡解释,证明两种探索在信息类型上互补:广度提供结构先验,深度提供边界知识,后者依赖前者定向。

开源反超闭看的证明力:同一记忆分别加持 Kimi-K3 与 GLM-5.3 都超过 GPT-6 Astra——环境知识的增益跨模型族成立,说明收益来自记忆而非特定模型特性。

六、效果优势的根源解释

根源机制与证据链

  1. 因果 vs 轨迹的知识形态差异(论文实验已支持 + 机制推理):baseline(裸模型)靠预训练泛化猜测环境行为;经验记忆 Agent 存自然语言启示(“此系统较慢,需耐心”)——这类记忆在新任务的决策点上无法精确回答"这个操作现在安全吗"。因果三元组记忆把知识锚定在(动作、条件)→后果的可查询结构上,决策时精确匹配当前状态 → 体现在跨模型族一致反超。
  2. 广度为深度定向(论文实验已支持):消融中深度单独有害(56.50%<baseline),组合后增益显著——机制上,深度探索的预算有限,没有广度地图时深挖的对象选择近似随机;有地图后深挖集中在"结构上可疑"的区域(复杂度高、失败率异常的分支)。
  3. Verifier 的质量控制(论文实验间接支持):记忆污染(错误因果入册)会随复用放大;verifier 独立于 actor 判定,降低单一模型幻觉进入记忆的概率。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
ExpeL轨迹→自然语言经验经验提炼提升 Agent记忆非结构化因果支持:记忆有用;限定:形态影响上限
Reflexion失败后语言反思自我反思改善后续尝试单任务内,不冻结复用支持:失败信号价值
VoyagerMinecraft 自主技能库游戏域探索+技能沉淀技能库非因果图谱支持:探索-沉淀循环
Dream-RSI(同日)重放改进探索策略策略层 RSI知识层 vs 策略层补充:RSI 分层谱系
HarnessVLN(同日)具身导航 training-free证据驱动状态更新具身域支持:training-free 路线跨域

综合判断与未决问题

多研究共同支持:结构化经验优于无经验(ExpeL/Voyager/本文三方一致);training-free 适应可行(HarnessVLN/本文)。仍属推测:因果记忆的规模上限——环境因果结构复杂度增长时记忆检索是否会遭遇组合爆炸(论文四任务规模未触及)。适用边界:环境需可被探索(允许试错);破坏性环境(错误操作不可逆)需要安全护栏配合。可能的失效条件:非平稳环境(接口频繁变更)下冻结记忆过期为错误知识。

七、必要知识反推

领域知识层:数字环境的失效模式分类(隐藏限流、状态依赖行为、异步延迟)——不了解失败模式类型就无法设计 verifier 的判定维度。

方法论知识层:因果推断基础(相关≠因果——探索中观察到的共现需条件控制才能入册);课程学习理论(难度递增序列的设计原则);广度优先 vs 深度优先搜索的权衡理论。

工程知识层:多 Agent 编排(curriculum/actor/verifier 的消息协议与失败隔离);记忆的序列化与检索设计(三元组的索引结构)。

知识融合关键节点:“记忆应存因果关系而非轨迹"的洞察需要同时理解 Agent 经验复用研究(轨迹记忆的迁移失败案例)与因果表征(条件的必要性)——两域知识的交集催生知识形态的设计决策。

八、通用性灵感

  1. 环境说明书原则:进入任何新系统先构建其"因果说明书”(什么操作在什么条件下导致什么),后续一切任务在此之上规划(论文证据:冻结记忆跨模型族反超闭源)。推广:新员工入职的环境知识库自动化;自动化测试脚本的"系统行为地图"预生成。
  2. 广度定向、深度挖界:探索预算分配的两阶段法则——先广撒建立结构地图,再聚焦深挖边界与异常(论文证据:消融的 74.54/65.52/56.50 非单调组合)。推广:市场调研(先全景扫描再深访)、代码审计(先架构梳理再钻可疑模块)。
  3. 知识冻结促复用:探索产物冻结为只读资产,与生产执行解耦(论文证据:记忆冻结后直接服务下游任务)。推广:咨询行业的行业知识库(项目沉淀冻结为方法论资产)。
  4. 小模型+结构化知识 ≥ 大模型:模型能力差距可以用环境知识弥补(论文证据:GLM-5.3+记忆 > GPT-6 Astra)。推广:垂直领域的企业 Agent 不必追最大模型,领域知识工程是更可控的杠杆。