论文链接:ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents 代码仓库:Gen-Verse/ScienceBuddy 发表时间:2026年9月 机构:Peking University + PHAI Labs(Zhenfei Yin / Yingcheng Wu / Ling Yang 通讯)——高校+企业合作,高校主导方法学,企业提供产品化与算力 领域标签:cs.AI / Recursive Self-Improvement / Scientific Agent
一、论文背景
RSI(递归自改进)是什么:让 AI 系统自己改进自己——Anthropic/OpenAI 界内所称 recursive self-improvement。当前主流有两条改进通道:改线束(harness:指令、技能、上下文管理程序——模型外围的"工作手册")和改模型(RL 更新权重)。此前工作大多只走一条:GEPA/ACE 优化提示词,Darwin Godel Machine 演化 agent 档案,SEAL 生成训练数据。
为什么要"嵌套"两条通道:两条通道互相影响——harness 的效果取决于执行它的模型(模型变强后旧 harness 可能反而碍事),模型训练的收益又取决于 harness 引导的轨迹分布(harness 好则训练经验质量高)。SIA 曾同时更新两者但未研究嵌套依赖;HELIX 连接 harness 演化与训练数据构造。ScienceBuddy 问的是:协作本身能否持续供应协调这两条通道的任务与评估标准。
科研场景的特殊价值:科研工作者每天与 AI 助手的真实对话(请求、澄清、质疑、反馈)天然携带"任务目标+成功标准"的信息——这些通常要专家标注才能得到的东西,在交互中免费产生。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| harness/提示优化 | Reflexion、GEPA、ACE、Meta-Harness、PILOT | 反思/搜索改提示或 harness 代码 | 只动 harness 不动权重 |
| RSI agent 演化 | Darwin Godel Machine、Hyperagents、SEAL | 演化 agent 档案/自生成更新指令 | 改进机制与模型学习的关系未系统化 |
| 联合更新 | SIA、HELIX | 同时更新 harness+权重 | 未研究嵌套依赖与交替调度 |
| 交互驱动学习 | OpenClaw-RL、RLAnything | 从用户回复提取训练信号 | 学习过程与 harness 演化的交互未考察 |
| rubric 奖励 | Rubrics as Rewards、AdaRubric | 不可验证域的 rubric RL | 静态任务集,非交互衍生 |
| 科学 agent | Biomni、LAB-Bench、AgentBuild | 生物医学工具/基准/构建 | 无持续学习闭环 |
定位结论:ScienceBuddy 首次把"交互→任务+rubric→双通道嵌套改进“整条链闭环化,且以可下载产品(224 工具/22 模块生物医学工作台)落地——研究范式与产品形态互为载体。
三、问题定义
具体场景:研究者上传图表/数据提问、追问、要求改分析——这些日常交互如何变成系统的持续进步,而非"本次会话改对了、下次任务照旧犯错”。
抽象问题:科学 agent 的自改进需要同时演化工作程序(harness)与底层能力(权重),两者互为条件且改进信号都应来自真实协作——如何设计一个协调机制,使两条递归通道的交替推进可控、可评估。
形式化:内层递归(固定 θk):辅助模型 U 从轨迹证据 E 提议有界 harness 编辑 Ĥ=U(H,E;θ),接受条件为 Valid(Ĥ) ∧ ΔS>0(成对开发集评估、含回归检查);外层递归(固定选中 H★k):环境难度校准后收集新鲜 on-policy rollout,rubric 奖励 R_x(τ)=Σw_c·v_c/Σw_c 驱动 GRPO 得 θ(k+1);重新评估 (θ(k+1), H★k) 后部署,下一轮交互开始。
精妙之处:改进信号的"免费性"与"可信性"分离——交互免费产出任务与 rubric 素材,但"研究者回复不当金标准"(科研中用户也常错),rubric 由协作轨迹构造并经执行检查/固定裁判评估,避免把用户满意度错当科学正确性。
四、问题解法
从协作到学习信号
交互记录 τ_collab(请求/回复/动作/观察/工件)被整理为:重构任务指令 I_x(只含最终要求,不含历史答案)+ 资产 A_x + 环境 E_x + 协作衍生 rubric C(x)(覆盖任务范围/方法要求/证据/期望工件)。打包为 Harbor 任务(instruction.md + task.toml + environment/ + tests/),同一任务支持 SFT(rubric 合格轨迹拒绝采样)与 RL(新鲜 rollout)两路。
内层:反馈引导的 harness 改进
GPT-6 Astra 作为固定辅助模型审查最近轨迹与 rubric 评估,引用未满足的具体标准,映射为有界编辑——每次只增/删/改一个 scoped skill、一条指令或一个上下文设置(schema 校验强制编辑范围与大小预算)。父/子 harness 在相同开发任务、种子、预算下用冻结 rubric 成对评估,ΔS>0 且无回归才接受,平局保留父代。被拒编辑进历史供后续参考。
外层:harness 固定下的模型 RL
环境增强按当前 (θk, H★k) 试点执行校准难度(变输入/条件/扩依赖链),新鲜 on-policy rollout 上 rubric 奖励做 GRPO——harness 与 rubric 在训练内冻结(保证奖励平稳),历史交互只提供任务定义不进训练批。训练后重评继承 harness 在新模型下的表现再部署。
协调调度
后台更新与在线服务异步:服务期收集 → 内层 harness 搜索(10 步)→ 外层 RL(20 更新)→ 重评部署 → 下一轮。所有 harness/环境版本保留,继承 harness 在新模型下重评后才复用。
五、评估指标与实验证据
| 实验 | 设置 | 关键结果 | 证明什么 |
|---|---|---|---|
| 两周期耦合动力学 | Qwen3.5-4B 起点,3 周期 | 测试单次准确率 42.2%→73.3%;33.3% 错→对、仅 2.2% 对→错 | 嵌套交替可持续且几乎不遗忘 |
| 同上(分周期) | 各周期 harness 验证准确率 | 38.9→44.4 / 34.4→46.7 / 61.1→70.0 | 内层每周期都在涨 |
| 纯 harness 演化 | 权重完全冻结 | 验证准确率 31.1%→51.1%(+20pp) | 程序改进独立有效 |
| 纯模型 RL | harness 冻结 | pass@4 覆盖率 48.3%→67.8%(+19.5pp) | 权重改进独立有效 |
| 任务族分解 | DbQA/GWAS/LitQA2/ProtocolQA | 四族全升(36%→74%、30%→60%、80%→87.5%、60%→70%) | 增益非单一任务族驱动 |
证明力分析:最有力的是解耦对照设计——4.3/4.4 两组"固定一个改另一个"的实验把系统总增益(73.3%)分解为两条可独立归因的通道(各约 +20pp),这比只报端到端数字的工作严谨得多:它证明了 RinR 的增益确实来自"两条递归"而非某一条的单独爆发。pass@4 覆盖率(而非 pass@1)衡量模型 RL 是刻意选择——改进的本质是"能解出更多不同问题"而非"同一类问题解得更稳"。
诚实边界:论文明确不主张改进机制本身(辅助模型)变强——“reflector 保持固定,任务性能提升不意味改进机制增强”,这与真正的 RSI 终极目标还差一层。
六、效果优势的根源解释
根源机制与证据链
- 交互衍生的 rubric 把不可验证域变成可训练域(论文实验已支持):科学任务没有单元测试,纯 RLVR 不可行;rubric 奖励(Rubrics as Rewards 已验证可行)的瓶颈在 rubric 从哪来——协作轨迹让 rubric 生产成本趋零。机制链:交互记录→任务重构+rubric 构造→每个任务自带评估→RL 有奖励可用。
- 有界编辑+成对回归检查控制了 harness 搜索的组合爆炸与退化风险(论文实验已支持):harness 空间是指数级的,无界编辑容易引入"修好 A 坏了 B"的隐性回归;成对评估显式包含"此前成功任务"查回归(ΔS>0 才接受)。这与 GEPA 的反思式 prompt 进化同思路,但编辑粒度受 schema 强制约束。
- 两通道交替的收益来自"训练分布与执行能力互相校准"(论文机制主张,部分实验支持):harness 演化塑造训练轨迹分布(好 harness→高质量 on-policy rollout→RL 学到的能力更贴近实际执行条件);模型更新后继承 harness 需重评——因为"harness 效果依赖执行模型"(论文引用 Meta-Harness 证据)。环境难度校准防止"旧难题已变简单后训练信号稀疏化"。
- 研究者回复不当金标准是科学域的关键设计(论文设计主张):科研协作中用户常错——把用户批准当正确标签会注入偏置;rubric 从轨迹构造但由执行检查+固定裁判评估。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| GEPA(2507.19457) | 反思式 prompt 进化 | 可超 RL | 只动 prompt,无权重通道 | 支持:harness 通道有效性 |
| SIA: Self Improving AI(2605.27276) | harness+权重同更 | 双通道可行 | 未研究嵌套调度与依赖 | 支持:联合更新方向正确 |
| HELIX(2608.13951) | harness 演化连数据构造 | co-evolution 有效 | 非交互驱动、非科学域 | 补充:harness→训练数据链路有先例 |
| Rubrics as Rewards(2507.17746) | rubric 奖励 RL | 不可验证域可用 | 静态 rubric、外部任务 | 支持:外层递归的奖励机制 |
| OpenClaw-RL(2603.10165) | 用户回复提取训练信号 | 交互即信号 | 无 harness 通道 | 支持:交互信号可行性 |
| Darwin Godel Machine(2505.22954) | 演化 agent 档案 | 开放式进化 | 改进机制自指、成本高 | 对照:DGM 改进改进器,本文刻意不 |
| Environment Evolution(2609.04128) | 环境难度演化 | 防训练信号稀疏 | 非 rubric/科学域 | 支持:外层环境校准设计 |
相反结论检索:检索范围内未发现主张"固定辅助模型即可永久自改进"的反例研究;最接近的张力来自 DGM 路线(改进机制本身也要进化)——论文明确承认自己不做这一层,属于自我设限而非被反驳。
综合判断与未决问题
多研究共同支持:harness 通道与模型通道各自有效(GEPA/Rubrics-as-Reward/本文解耦实验三方一致);交互含可提取学习信号(OpenClaw-RL+本文)。仍属推测:交替调度是否最优(vs 并行/事件驱动)、周期边界如何自适应决定;辅助模型固定意味着改进能力有天花板。适用边界:实验限于生物医学四任务族与 Qwen3.5-4B 单一起点模型;规模化到更前沿模型时"内层 harness 编辑还能否找到增益"未知。
七、必要知识反推
领域知识层:生物医学科研工作流(文献/数据库/协议/基因评估各族的典型任务形态)——任务族与 rubric 维度设计全赖于此;Harbor 任务框架的结构(instruction/toml/tests 分离)——学习信号打包的载体。
方法论知识层:RLVR 与 GRPO 的机制与局限(知道为什么科学域需要 rubric 奖励);成对评估与回归检查的实验设计传统(来自 prompt 优化谱系);难度校准/环境演化思想(课程学习在 agent 训练的变体)。
工程知识层:异步后台更新与在线服务共存的产品架构(服务不中断的前提下跑内层+外层);rubric composer 的实现(frontmatter 权重 w_c 与执行检查/固定裁判的混合评估);版本管理(所有 harness/环境版本保留供继承重评)。
知识融合关键节点:最关键的融合是"把协作语用学翻译成评估标准"——从一串自然语言往返中重构出机器可执行的 rubric(哪些是任务范围、哪些是方法约束、哪些冲突需先解决),这需要同时懂对话分析(信息在哪句话里)与评测工程(标准怎么变成可检查项)。第二个节点是"嵌套调度的工程纪律"——什么时候冻结什么(RL 时冻 harness 与 rubric、harness 搜索时冻模型),这套冻结纪律是双通道不互相干扰的制度保证。
八、通用性灵感
- 日常交互是免费的监督信号矿:最贵的标注(任务定义+成功标准)在真实使用中自然产生,关键是不把"用户满意"错当"客观正确"(论文证据:rubric 从轨迹构造但独立评估)。推广:客服系统(每单纠纷自动产出质检标准)、教育(学生答疑对话沉淀为考点 rubric)、代码评审(评审意见变评审规则库)。
- 双改进通道要"交替冻结"而非"同时全开":同时改 harness 和权重会让增益无法归因、训练不平稳;交替推进+各自对照评估,增益可分解、风险可控(论文证据:解耦实验各 +20pp)。推广:组织变革(流程与人员能力分步迭代)、个人成长(方法论与专业知识交替精进)。
- 有界编辑优于自由重写:每次只动一个组件+必须通过回归检查,防止"修好新问题弄坏老问题"(论文证据:ΔS>0 接受规则含回归任务)。推广:任何演化系统(法规修订的逐条审读、软件重构的小步提交)。
- 改进机制自指有天花板,刻意分层是务实选择:论文明确不进化"改进者"本身——承认改进能力的边界比假装无界更科学(论文原话:任务性能提升≠改进机制增强)。推广:企业流程改进办公室的元改进困境、compiler bootstrap 的分层自举。
- 环境难度要随学习者进化:旧难题变简单后训练信号稀疏,环境校准保持"恰到好处的挑战"(论文证据:外层环境增强按当前能力试点校准)。推广:游戏难度动态调节、康复训练负荷递增、教育分层教学。