论文链接:Dream-RSI: Recursive Self-Improvement through Evolving Worlds 代码仓库:github.com/zhengkid/Dream-RSI | dream-rsi.com 发表时间:2026年9月 机构:马里兰大学(Heng Huang)等企业+高校混合团队 领域标签:cs.AI / Recursive Self-Improvement

一、论文背景

RSI 是什么:递归自我改进——AI 系统把自己的发现(更好的算法、更优的解)用于改进自身的搜索策略,从而滚雪球式加速后续发现。这是 Agent 研究的圣杯方向之一:OpenAI 的 Noam Brown 同日公开表示 RSI 是 OpenAI 第一优先级。

探索策略为什么是瓶颈:RSI 的进展取决于在复杂域中发现高价值解,而发现靠探索。当前系统面临两难(论文称之为 fundamental dilemma):固定探索策略随搜索空间扩大而失效(相当于用一张旧地图找新大陆);在线策略优化需要在巨大的元搜索空间中导航,且反馈来自长程 rollout——跑一次才知道好不好,又慢又贵。

“做梦"的隐喻:人类不是靠每次都真实尝试来学会更好的思考方式——我们在睡眠中重放白天的经验,离线强化有用的模式。Dream-RSI 把这个思想工程化:Agent 积累的发现历史(发现树+轨迹)在离线阶段被重放,用于改进探索策略本身。

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
自动算法发现AlphaEvolve、FunSearchLLM 进化搜索发现算法探索策略固定,不改进自身
自进化 AgentAgentEvolve 系、SkillOpt 系从经验中优化 prompt/skill优化对象是文本工件,非探索策略
经验回放DQN Replay Buffer离线重放历史转移重放用于值函数,非策略元学习
世界模型学习Dreamer 系学环境模型在其中规划模型学环境动力学,本文重放的是已实现搜索空间
测试时强化STE 系推理时自我改进单任务内改进,本文跨任务递归

定位结论:Dream-RSI 处在"算法发现 × 经验回放 × 策略元学习"交汇点——首次把 RL 的经验回放思想引入 RSI 的探索策略管理,重放的对象不是环境转移而是"发现过程本身”。

三、问题定义

具体场景:科学发现任务(算法工程/数学优化/GPU kernel)中,Agent 需要持续发现更好的解(更快的求解器、更优的配置),且发现效率要随经验递增。

抽象问题:在反馈延迟且昂贵的环境中,如何让探索策略自身随积累的经验递归改进,而不付出在线试错的全额成本。

形式化:给定任务分布、编码 Agent A、探索策略 π_θ:探索策略指导 A 扩展发现树 D 并记录轨迹 {τ};已实现搜索空间上的重放模拟器 S(D) 可零成本查询"若在状态 s 采取策略 π 会怎样";目标:max E[发现质量(D)] s.t. 真实 agent 调用次数最小化。

精妙之处:发现历史是"已付过钱的数据"——每次真实 rollout 的成本在首次发生时已支付,重放它的边际成本近零。这把"改进探索策略"从在线问题(每次尝试都烧钱)变成离线问题(用已购数据训练),与深度学习里"训练一次、推理多次"的成本结构同构。

四、问题解法

三环循环(论文 Figure 1):

① Online Explore(在线探索):当前探索策略 π_θ 引导编码 Agent 在真实环境中扩展发现树(尝试新算法变体/新参数组合),完整记录每条轨迹(决策、反馈、结果)。类比:白天实地考察,笔记本记下一切。

② Construct Replay Simulator(构建重放模拟器):把发现树转化为可复用的模拟器池——树中每个节点是已实现的状态,边是已采取的行动及其真实后果。查询模拟器 = 查询"历史上这个位置发生过什么"。类比:晚上把白天的考察路线整理成沙盘。

③ Dreaming-based Policy Improvement(做梦式策略改进):在重放模拟器上离线评估与改进探索策略:候选策略改动在模拟器上跑出预期发现增益,择优采纳,然后回到环①。类比:在沙盘上推演"如果当时走另一条路会怎样",改进明天的考察计划。

关键机制细节:发现的求解器(以 Lasso 路径求解为例)结合 strong-rule 筛选与 Cauchy-Schwarz KKT 剪枝,在主动集优化内部实现自适应性——只有当边界无法证明某特征时才重算精确梯度,剪枝失效时回退全量刷新。这展示了"发现的解"不是随机拼凑而是有内结构的算法创新。

五、评估指标与实验证据

任务体系:8 个科学发现任务横跨三域——算法工程(Lasso 路径求解)、数学优化(sum-difference/autocorrelation/circle packing)、GPU kernel 工程。

对比指标Dream-RSIbaseline证明什么
vs SimpleTESagent 调用数削减 162×—发现成本的量级改善
vs 固定探索agent 调用数削减 1.7×Recursive Fixed Exploration递归改进自身带来增益
held-out 质量六个 held-out 数据集平均运行时2931.0 ms3587.1 ms(Gemini-3.1-Pro)发现的解真实更好,非过拟合
双骨干Gemini-3.1-Pro / Gemini-3.7-Flash两骨干均更优质量-计算权衡—机制不依赖特定模型

证明力分析:最有力的设计是 held-out 评测——发现的求解器在从未见过的六个数据集上仍然更快,排除了"发现=对评测集过拟合"的解释。162× 的调用削减配合质量不降,直接证明重放模拟器提供了足够的学习信号密度。5 轮递归的动态分析显示改进贯穿轮次而非一次饱和。

六、效果优势的根源解释

根源机制与证据链

  1. 成本结构改变(论文实验已支持):baseline(在线优化)每次策略评估需真实 rollout;本文策略评估在重放模拟器上近零成本 → 等价预算下策略更新频率提高数量级 → 体现在 162× 调用削减。
  2. 信号保真度(论文实验已支持):重放模拟器记录的是真实后果(真实执行反馈),不是学出来的近似模型——因此不存在世界模型的模型误差累积问题;held-out 质量不降证明信号足够。
  3. 探索-利用的显式化(论文实验已支持):轻量编排层把探索变成显式可编程对象,底层编码 Agent 不变——这解耦了"谁执行"与"如何探索",使策略改进不干扰执行能力(与 harness 自演化研究的"冻结模型、演化脚手架"共识一致)。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
Dreamer v3在学到的世界模型中离线训练世界模型训练大幅降采样成本模型是近似的,存在模型偏差支持:离线训练降成本的方向
Experience Funnel(9/10 精读)经验浓缩复用经验资产化优于即用即弃华为×港理工,具身域支持:经验复用跨域有效
AlphaEvolve进化搜索发现算法好发现但探索策略固定Google DeepMind限定:本文聚焦策略改进层
RSIAgent(同日论文)记忆构建式 RSI开源模型超闭源无 simulator 重放机制补充:RSI 子问题谱系互补
ModularRSI(同日论文)harness 自演化对比式信号更有效演化对象是 harness补充:改进对象不同层

综合判断与未决问题

多研究共同支持:离线重放降低改进成本(Dreamer 系 + 本文);经验资产化(Experience Funnel + 本文)。仍属推测:重放模拟器只覆盖"已实现搜索空间",对"未探索区域"的策略泛化是否有效——论文未做系统性分析。适用边界:任务需有可执行环境与可记录轨迹;纯开放式创意任务(无明确反馈)不适用。可能的失效条件:环境非平稳(发现历史过时)时重放信号误导策略。

七、必要知识反推

领域知识层:科学发现任务的评价体系(Lasso 求解器的运行时基准、GPU kernel 的性能剖析)——不知道"什么算更好的解"就无法构造发现目标。

方法论知识层:经验回放与离线 RL 的理论(分布偏移问题——重放数据只覆盖已实现空间);进化搜索的种群管理(发现树的扩展与剪枝策略)。

工程知识层:Agent rollout 的全量日志基础设施(轨迹的规范化存储与检索);held-out 评测设计(发现-评测隔离,防止过拟合误判)。

知识融合关键节点:“发现历史 = 模拟器"这一洞察需要同时理解 RL 的 replay buffer(数据可重用)与算法发现的搜索树结构(树的边是已验证的行动-后果对)——两个领域的概念叠加才浮现"零成本查询已实现空间"的可能性。

八、通用性灵感

  1. 已付成本数据的二次利用:任何昂贵探索产生的记录(实验日志、用户行为流、debug 会话)都可以被重构为"已实现空间的模拟器"用于离线改进决策策略(论文证据:162× 调用削减)。推广:药物筛选历史库训练实验设计策略;软件测试历史训练 bug 定位策略。
  2. 执行与探索解耦:把"做事的系统"与"决定怎么找方向的策略"分层,改进后者不动前者(论文证据:编码 Agent 保持不变,仅编排层演化)。推广:销售团队的话术系统与客户选择策略分层优化;科研中实验技能与研究品味分离培养。
  3. 做梦即训练(离线巩固):在行动间隙用内部重放巩固学习,而非每次都求新经验(论文证据:做梦阶段的策略改进是增益主要来源)。推广:教育中的间隔复习;企业的复盘文化——行动后的结构化复盘等价于"做梦环”。
  4. held-out 验证防自欺:自我改进系统的产出必须在从未参与改进过程的数据上验证(论文证据:六 held-out 数据集运行时优势保持)。推广:任何优化流程(编译器调优、推荐系统)都需要锁定验证集。