论文链接:ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents 代码仓库:Gen-Verse/ScienceBuddy 发表时间:2026年9月 机构:Peking University + PHAI Labs(Zhenfei Yin / Yingcheng Wu / Ling Yang 通讯)——高校+企业合作,高校主导方法学,企业提供产品化与算力 领域标签:cs.AI / Recursive Self-Improvement / Scientific Agent

一、论文背景

RSI(递归自改进)是什么:让 AI 系统自己改进自己——Anthropic/OpenAI 界内所称 recursive self-improvement。当前主流有两条改进通道:改线束(harness:指令、技能、上下文管理程序——模型外围的"工作手册")和改模型(RL 更新权重)。此前工作大多只走一条:GEPA/ACE 优化提示词,Darwin Godel Machine 演化 agent 档案,SEAL 生成训练数据。

为什么要"嵌套"两条通道:两条通道互相影响——harness 的效果取决于执行它的模型(模型变强后旧 harness 可能反而碍事),模型训练的收益又取决于 harness 引导的轨迹分布(harness 好则训练经验质量高)。SIA 曾同时更新两者但未研究嵌套依赖;HELIX 连接 harness 演化与训练数据构造。ScienceBuddy 问的是:协作本身能否持续供应协调这两条通道的任务与评估标准。

科研场景的特殊价值:科研工作者每天与 AI 助手的真实对话(请求、澄清、质疑、反馈)天然携带"任务目标+成功标准"的信息——这些通常要专家标注才能得到的东西,在交互中免费产生。

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
harness/提示优化Reflexion、GEPA、ACE、Meta-Harness、PILOT反思/搜索改提示或 harness 代码只动 harness 不动权重
RSI agent 演化Darwin Godel Machine、Hyperagents、SEAL演化 agent 档案/自生成更新指令改进机制与模型学习的关系未系统化
联合更新SIA、HELIX同时更新 harness+权重未研究嵌套依赖与交替调度
交互驱动学习OpenClaw-RL、RLAnything从用户回复提取训练信号学习过程与 harness 演化的交互未考察
rubric 奖励Rubrics as Rewards、AdaRubric不可验证域的 rubric RL静态任务集,非交互衍生
科学 agentBiomni、LAB-Bench、AgentBuild生物医学工具/基准/构建无持续学习闭环

定位结论:ScienceBuddy 首次把"交互→任务+rubric→双通道嵌套改进“整条链闭环化,且以可下载产品(224 工具/22 模块生物医学工作台)落地——研究范式与产品形态互为载体。

三、问题定义

具体场景:研究者上传图表/数据提问、追问、要求改分析——这些日常交互如何变成系统的持续进步,而非"本次会话改对了、下次任务照旧犯错”。

抽象问题:科学 agent 的自改进需要同时演化工作程序(harness)与底层能力(权重),两者互为条件且改进信号都应来自真实协作——如何设计一个协调机制,使两条递归通道的交替推进可控、可评估。

形式化:内层递归(固定 θk):辅助模型 U 从轨迹证据 E 提议有界 harness 编辑 Ĥ=U(H,E;θ),接受条件为 Valid(Ĥ) ∧ ΔS>0(成对开发集评估、含回归检查);外层递归(固定选中 H★k):环境难度校准后收集新鲜 on-policy rollout,rubric 奖励 R_x(τ)=Σw_c·v_c/Σw_c 驱动 GRPO 得 θ(k+1);重新评估 (θ(k+1), H★k) 后部署,下一轮交互开始。

精妙之处:改进信号的"免费性"与"可信性"分离——交互免费产出任务与 rubric 素材,但"研究者回复不当金标准"(科研中用户也常错),rubric 由协作轨迹构造并经执行检查/固定裁判评估,避免把用户满意度错当科学正确性。

四、问题解法

从协作到学习信号

交互记录 τ_collab(请求/回复/动作/观察/工件)被整理为:重构任务指令 I_x(只含最终要求,不含历史答案)+ 资产 A_x + 环境 E_x + 协作衍生 rubric C(x)(覆盖任务范围/方法要求/证据/期望工件)。打包为 Harbor 任务(instruction.md + task.toml + environment/ + tests/),同一任务支持 SFT(rubric 合格轨迹拒绝采样)与 RL(新鲜 rollout)两路。

内层:反馈引导的 harness 改进

GPT-6 Astra 作为固定辅助模型审查最近轨迹与 rubric 评估,引用未满足的具体标准,映射为有界编辑——每次只增/删/改一个 scoped skill、一条指令或一个上下文设置(schema 校验强制编辑范围与大小预算)。父/子 harness 在相同开发任务、种子、预算下用冻结 rubric 成对评估,ΔS>0 且无回归才接受,平局保留父代。被拒编辑进历史供后续参考。

外层:harness 固定下的模型 RL

环境增强按当前 (θk, H★k) 试点执行校准难度(变输入/条件/扩依赖链),新鲜 on-policy rollout 上 rubric 奖励做 GRPO——harness 与 rubric 在训练内冻结(保证奖励平稳),历史交互只提供任务定义不进训练批。训练后重评继承 harness 在新模型下的表现再部署。

协调调度

后台更新与在线服务异步:服务期收集 → 内层 harness 搜索(10 步)→ 外层 RL(20 更新)→ 重评部署 → 下一轮。所有 harness/环境版本保留,继承 harness 在新模型下重评后才复用。

五、评估指标与实验证据

实验设置关键结果证明什么
两周期耦合动力学Qwen3.5-4B 起点,3 周期测试单次准确率 42.2%→73.3%;33.3% 错→对、仅 2.2% 对→错嵌套交替可持续且几乎不遗忘
同上(分周期)各周期 harness 验证准确率38.9→44.4 / 34.4→46.7 / 61.1→70.0内层每周期都在涨
纯 harness 演化权重完全冻结验证准确率 31.1%→51.1%(+20pp)程序改进独立有效
纯模型 RLharness 冻结pass@4 覆盖率 48.3%→67.8%(+19.5pp)权重改进独立有效
任务族分解DbQA/GWAS/LitQA2/ProtocolQA四族全升(36%→74%、30%→60%、80%→87.5%、60%→70%)增益非单一任务族驱动

证明力分析:最有力的是解耦对照设计——4.3/4.4 两组"固定一个改另一个"的实验把系统总增益(73.3%)分解为两条可独立归因的通道(各约 +20pp),这比只报端到端数字的工作严谨得多:它证明了 RinR 的增益确实来自"两条递归"而非某一条的单独爆发。pass@4 覆盖率(而非 pass@1)衡量模型 RL 是刻意选择——改进的本质是"能解出更多不同问题"而非"同一类问题解得更稳"。

诚实边界:论文明确不主张改进机制本身(辅助模型)变强——“reflector 保持固定,任务性能提升不意味改进机制增强”,这与真正的 RSI 终极目标还差一层。

六、效果优势的根源解释

根源机制与证据链

  1. 交互衍生的 rubric 把不可验证域变成可训练域(论文实验已支持):科学任务没有单元测试,纯 RLVR 不可行;rubric 奖励(Rubrics as Rewards 已验证可行)的瓶颈在 rubric 从哪来——协作轨迹让 rubric 生产成本趋零。机制链:交互记录→任务重构+rubric 构造→每个任务自带评估→RL 有奖励可用。
  2. 有界编辑+成对回归检查控制了 harness 搜索的组合爆炸与退化风险(论文实验已支持):harness 空间是指数级的,无界编辑容易引入"修好 A 坏了 B"的隐性回归;成对评估显式包含"此前成功任务"查回归(ΔS>0 才接受)。这与 GEPA 的反思式 prompt 进化同思路,但编辑粒度受 schema 强制约束。
  3. 两通道交替的收益来自"训练分布与执行能力互相校准"(论文机制主张,部分实验支持):harness 演化塑造训练轨迹分布(好 harness→高质量 on-policy rollout→RL 学到的能力更贴近实际执行条件);模型更新后继承 harness 需重评——因为"harness 效果依赖执行模型"(论文引用 Meta-Harness 证据)。环境难度校准防止"旧难题已变简单后训练信号稀疏化"。
  4. 研究者回复不当金标准是科学域的关键设计(论文设计主张):科研协作中用户常错——把用户批准当正确标签会注入偏置;rubric 从轨迹构造但由执行检查+固定裁判评估。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
GEPA(2507.19457)反思式 prompt 进化可超 RL只动 prompt,无权重通道支持:harness 通道有效性
SIA: Self Improving AI(2605.27276)harness+权重同更双通道可行未研究嵌套调度与依赖支持:联合更新方向正确
HELIX(2608.13951)harness 演化连数据构造co-evolution 有效非交互驱动、非科学域补充:harness→训练数据链路有先例
Rubrics as Rewards(2507.17746)rubric 奖励 RL不可验证域可用静态 rubric、外部任务支持:外层递归的奖励机制
OpenClaw-RL(2603.10165)用户回复提取训练信号交互即信号无 harness 通道支持:交互信号可行性
Darwin Godel Machine(2505.22954)演化 agent 档案开放式进化改进机制自指、成本高对照:DGM 改进改进器,本文刻意不
Environment Evolution(2609.04128)环境难度演化防训练信号稀疏非 rubric/科学域支持:外层环境校准设计

相反结论检索:检索范围内未发现主张"固定辅助模型即可永久自改进"的反例研究;最接近的张力来自 DGM 路线(改进机制本身也要进化)——论文明确承认自己不做这一层,属于自我设限而非被反驳。

综合判断与未决问题

多研究共同支持:harness 通道与模型通道各自有效(GEPA/Rubrics-as-Reward/本文解耦实验三方一致);交互含可提取学习信号(OpenClaw-RL+本文)。仍属推测:交替调度是否最优(vs 并行/事件驱动)、周期边界如何自适应决定;辅助模型固定意味着改进能力有天花板。适用边界:实验限于生物医学四任务族与 Qwen3.5-4B 单一起点模型;规模化到更前沿模型时"内层 harness 编辑还能否找到增益"未知。

七、必要知识反推

领域知识层:生物医学科研工作流(文献/数据库/协议/基因评估各族的典型任务形态)——任务族与 rubric 维度设计全赖于此;Harbor 任务框架的结构(instruction/toml/tests 分离)——学习信号打包的载体。

方法论知识层:RLVR 与 GRPO 的机制与局限(知道为什么科学域需要 rubric 奖励);成对评估与回归检查的实验设计传统(来自 prompt 优化谱系);难度校准/环境演化思想(课程学习在 agent 训练的变体)。

工程知识层:异步后台更新与在线服务共存的产品架构(服务不中断的前提下跑内层+外层);rubric composer 的实现(frontmatter 权重 w_c 与执行检查/固定裁判的混合评估);版本管理(所有 harness/环境版本保留供继承重评)。

知识融合关键节点:最关键的融合是"把协作语用学翻译成评估标准"——从一串自然语言往返中重构出机器可执行的 rubric(哪些是任务范围、哪些是方法约束、哪些冲突需先解决),这需要同时懂对话分析(信息在哪句话里)与评测工程(标准怎么变成可检查项)。第二个节点是"嵌套调度的工程纪律"——什么时候冻结什么(RL 时冻 harness 与 rubric、harness 搜索时冻模型),这套冻结纪律是双通道不互相干扰的制度保证。

八、通用性灵感

  1. 日常交互是免费的监督信号矿:最贵的标注(任务定义+成功标准)在真实使用中自然产生,关键是不把"用户满意"错当"客观正确"(论文证据:rubric 从轨迹构造但独立评估)。推广:客服系统(每单纠纷自动产出质检标准)、教育(学生答疑对话沉淀为考点 rubric)、代码评审(评审意见变评审规则库)。
  2. 双改进通道要"交替冻结"而非"同时全开":同时改 harness 和权重会让增益无法归因、训练不平稳;交替推进+各自对照评估,增益可分解、风险可控(论文证据:解耦实验各 +20pp)。推广:组织变革(流程与人员能力分步迭代)、个人成长(方法论与专业知识交替精进)。
  3. 有界编辑优于自由重写:每次只动一个组件+必须通过回归检查,防止"修好新问题弄坏老问题"(论文证据:ΔS>0 接受规则含回归任务)。推广:任何演化系统(法规修订的逐条审读、软件重构的小步提交)。
  4. 改进机制自指有天花板,刻意分层是务实选择:论文明确不进化"改进者"本身——承认改进能力的边界比假装无界更科学(论文原话:任务性能提升≠改进机制增强)。推广:企业流程改进办公室的元改进困境、compiler bootstrap 的分层自举。
  5. 环境难度要随学习者进化:旧难题变简单后训练信号稀疏,环境校准保持"恰到好处的挑战"(论文证据:外层环境增强按当前能力试点校准)。推广:游戏难度动态调节、康复训练负荷递增、教育分层教学。