论文链接:ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement 代码仓库:github.com/IQuestLab/ModularRSI 发表时间:2026年9月 机构:北京航空航天大学 + 河海大学 + IQuest Research 领域标签:cs.SE / Harness Self-Improvement

一、论文背景

Harness 是什么:LLM Agent 的"执行脚手架"——系统提示、工具定义、控制循环、轨迹格式等外围工程的总和。模型能力相同时,harness 质量决定 Agent 表现,因此"harness 自改进"(让 Agent 从自己的执行经验中改进自己的 harness)成为 RSI 在工程层最热门的落地方向。

泛化性危机的三大缺陷(论文系统化提出):

  1. 基准污染:现有工作直接在评测基准(或其子集)上演化 harness——这相当于开卷考试时偷看答案,演化出的"改进"是基准特化(benchmark-specific adaptation),换个任务就失效,且无法区分"可复用改进"与"过拟合"。
  2. 信号纠缠:从单条失败轨迹提取更新,会把"harness 的系统性缺陷"与"这道题的实例困难"纠缠——例如某次失败其实是任务本身极难,却被误诊为"harness 需要更多重试",产生迁移差的任务特化修改。
  3. 定位困难:即使识别出反复出现的缺陷,monolithic harness(一体化脚手架)中难以定位"该改哪个组件"——整体重写会把无关机制卷入,改动无法归因与验证。

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
Harness 演化HarnessEvolve、SE-GoS 系(9 月同月工作)轨迹反馈演化 harness常在基准数据上演化,泛化性未隔离
Prompt/skill 优化GEPA、SkillOpt 系文本工件搜索优化优化对象是 prompt/skill 而非 harness 全局
自我改进 AgentReflexion、ExpeL 系经验反思改进改进会话内行为,非持久 harness
因果推断配对差分设计成对比较消除混淆方法论来源,本文应用于 harness 演化
同日 RSI 工作Dream-RSI、RSIAgent策略层/知识层 RSI本文是结构层(harness)RSI

定位结论:ModularRSI 是首个把"harness 演化的泛化性"作为一级研究对象的工作——三大缺陷的诊断与三重解法一一对应,构成完整的实验设计。

三、问题定义

具体场景:CLI 编码 Agent(SWE-Bench/TerminalBench 类任务)的 harness 自动演化,要求演化出的 harness 在未见任务上仍然有效。

抽象问题:如何从执行反馈中提取"harness 层面的可泛化改进信号",使其与任务难度、实例特异性脱敏。

形式化:给定演化任务集 D_evo(与评测集 D_eval 不相交)、harness H 的组件集 {h_1…h_n}、执行结果 r∈{成功,失败}:寻找组件修改 δ:D_evo 上提取的改进在 D_eval 上产生正迁移。约束:信号需剥离任务难度混淆。

精妙之处:把 harness 演化重构为因果归因问题——“harness 的哪个组件的什么行为导致了跨任务的反复失败”。这直接借用了因果推断的配对差分设计:同一任务的成功/失败轨迹对,是控制了任务难度的自然实验。

四、问题解法

解法一:Benchmark-disjoint 演化数据(对症缺陷 1)

另建 2000 个可执行演化任务,来源与评测基准不相交(经细粒度域分析最小化重叠)。类比:训练运动员用训练场,比赛场地只在比赛时进入——训练成绩的提升才可信地反映能力而非场地熟悉度。这为"可泛化改进"提供了测量学基础。

解法二:对比式信用分配(对症缺陷 2)

不是看单条失败轨迹,而是同一任务的成功/失败轨迹对比 + 跨任务聚合:

  • 同任务对比:任务难度在成对轨迹间被天然控制(同一道题),差异只能来自执行路径——这才是 harness 行为的净信号。
  • 跨任务聚合:单一任务对的差异仍可能偶然,聚合多个任务后仍然反复出现的差异模式 = 系统性缺陷。类比:流行病学的病例-对照研究,单个病例说明不了什么,跨人群的重复关联才指向病因。

解法三:模块化定位(对症缺陷 3)

harness 显式分解为模块(提示组件、工具调度、错误恢复等),反复出现的缺陷模式被定位到具体模块,产生局部化修改——每个修改可独立验证(改了 A 模块,只看 A 相关指标变化),独立演化的模块可自由组合。

五、评估指标与实验证据

实验基准baseline → ModularRSI证明什么
in-domain 提升SWE-Bench-Verified73.40 → 76.45(+3.05)演化有效
in-domain 提升TerminalBench 2.047.57 → 52.43(+4.86)演化跨基准有效
out-of-domain两基准 OOD49.40/75.80 等保持增益泛化性成立
演化数据分布Medium-centered vs Hard&Easy76.45 vs 74.25(+2.20pp)中等难度任务提供更有信息量的对比
跨模型迁移换基座模型增益保持演化的是 harness 不是模型特化
逐代分析附录 F大体单调改进演化过程稳定非偶然

证明力分析:三个设计各自回答一个威胁效度的替代解释——benchmark-disjoint 排除"偷看评测集";OOD 增益排除"领域内过拟合";跨模型迁移排除"模型特化"。Medium-centered 优于 Hard&Easy 的消融尤其有价值:直觉上"难题信息量大",但难题的成对轨迹差异常来自任务本身的极端性而非 harness 行为——中等难度的对比最干净,这与教育测量学中"中等难度题区分度最高"的经典结论同构。

六、效果优势的根源解释

根源机制与证据链

  1. 配对差分消除任务难度混淆(论文实验已支持):单轨迹归因的失败信号被任务难度污染(难题失败≠harness 差);成对对比控制难度 → 信号纯度提升 → 体现在 Medium-centered 消融(难度适中的数据产生最好演化)与 OOD 迁移成立。
  2. 局部化修改的可组合性(论文实验已支持):monolithic 重写的修改纠缠无关机制,无法归因;模块化后每次修改的影响面小且可验证 → 逐代单调改进(附录 F)而非震荡。
  3. 演化与评测的隔离(论文实验已支持):2000 个不相交任务保证训练-测试分离 → in-domain 增益可直接解释为能力而非熟悉度。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
HarnessEvo(9/5 精读)归因式 harness 演化失败归因引导演化演化数据与评测未严格隔离支持:归因方向;对照:隔离的必要性
GEPA轨迹级 prompt 进化优于 DSPy 类优化单 prompt 对象支持:经验信号优于指令信号
SkillOpt 复现失败(9/15 精读)skill 优化外部验证无验证集的优化不可信skill 层支持:验证隔离原则跨层成立
配对差分/自然实验方法因果推断成对设计控制混淆的黄金标准方法论域支持:机制来源可靠
HarnessBandit(同日)多 harness 训练调度梯度可迁移性是关键信号训练层补充:迁移信号可计算

综合判断与未决问题

多研究共同支持:验证-评测隔离(SkillOpt 复现失败 + 本文);对比信号优于单例信号(GEPA + 因果推断传统 + 本文)。仍属推测:模块化分解的最优粒度——粒度过细可能破坏组件间协同(论文未探索粒度消融)。适用边界:需要可执行环境判定成败的任务;主观评价任务(创意写作)的"成功"信号弱。可能的失效条件:演化任务分布与评测分布差异过大时,可复用改进的空间本身受限(OOD 增益小于 in-domain 是自然边界)。

七、必要知识反推

领域知识层:CLI 编码 Agent 的 harness 构成(提示结构、工具协议、重试逻辑)——不了解组件边界就无法模块化。

方法论知识层:因果推断的配对设计与混淆控制(成功/失败对的自然实验本质);实验测量学(训练-测试隔离、构念效度);进化搜索的种群与收敛管理。

工程知识层:2000 个可执行演化任务的构建与去重流水线(域分析最小化与评测集重叠);轨迹的结构化对齐(同任务轨迹对的语义匹配);跨模型 serving(演化 harness 的基座无关性测试)。

知识融合关键节点:“把因果推断的配对差分引入 harness 演化"是本文的创造性融合——需要同时看到"轨迹对=自然实验”(领域观察)与"单轨迹归因有混淆"(方法论诊断),两个视角的叠加产生了核心设计。

八、通用性灵感

  1. 成对差分提纯信号:任何"从成败经验学习"的系统都应优先比较同一情境的成功/失败对,而非单例分析(论文证据:Medium-centered 数据 +2.20pp 与 OOD 迁移)。推广:销售复盘(同客户丢单/成单的成对分析)、医疗质量改进(同病情不同结局的病例对照)。
  2. 中等难度最优区分度:学习信号最丰富的数据不是最难的,而是难度适中的—— extremes 的差异被任务本身的极端性主导(论文证据:Medium > Hard&Easy 消融)。推广:教育题库设计、员工培训案例选择。
  3. 改进资产的模块化封装:让自动改进的产物保持模块边界,修改可归因、可组合、可独立验证(论文证据:逐代单调改进 + 跨模型迁移)。推广:企业流程优化的"可插拔改进单元";代码重构的模块化提交。
  4. 训练场与赛场的测量学分离:自改进系统的优化数据必须与验收数据隔离,否则改进不可信(论文证据:benchmark-disjoint 设计成为一切结论的前提)。推广:推荐系统的 A/B 隔离、个人成长的"练习-考核"分离。