论文链接:ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement 代码仓库:github.com/IQuestLab/ModularRSI 发表时间:2026年9月 机构:北京航空航天大学 + 河海大学 + IQuest Research 领域标签:cs.SE / Harness Self-Improvement
一、论文背景
Harness 是什么:LLM Agent 的"执行脚手架"——系统提示、工具定义、控制循环、轨迹格式等外围工程的总和。模型能力相同时,harness 质量决定 Agent 表现,因此"harness 自改进"(让 Agent 从自己的执行经验中改进自己的 harness)成为 RSI 在工程层最热门的落地方向。
泛化性危机的三大缺陷(论文系统化提出):
- 基准污染:现有工作直接在评测基准(或其子集)上演化 harness——这相当于开卷考试时偷看答案,演化出的"改进"是基准特化(benchmark-specific adaptation),换个任务就失效,且无法区分"可复用改进"与"过拟合"。
- 信号纠缠:从单条失败轨迹提取更新,会把"harness 的系统性缺陷"与"这道题的实例困难"纠缠——例如某次失败其实是任务本身极难,却被误诊为"harness 需要更多重试",产生迁移差的任务特化修改。
- 定位困难:即使识别出反复出现的缺陷,monolithic harness(一体化脚手架)中难以定位"该改哪个组件"——整体重写会把无关机制卷入,改动无法归因与验证。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| Harness 演化 | HarnessEvolve、SE-GoS 系(9 月同月工作) | 轨迹反馈演化 harness | 常在基准数据上演化,泛化性未隔离 |
| Prompt/skill 优化 | GEPA、SkillOpt 系 | 文本工件搜索优化 | 优化对象是 prompt/skill 而非 harness 全局 |
| 自我改进 Agent | Reflexion、ExpeL 系 | 经验反思改进 | 改进会话内行为,非持久 harness |
| 因果推断 | 配对差分设计 | 成对比较消除混淆 | 方法论来源,本文应用于 harness 演化 |
| 同日 RSI 工作 | Dream-RSI、RSIAgent | 策略层/知识层 RSI | 本文是结构层(harness)RSI |
定位结论:ModularRSI 是首个把"harness 演化的泛化性"作为一级研究对象的工作——三大缺陷的诊断与三重解法一一对应,构成完整的实验设计。
三、问题定义
具体场景:CLI 编码 Agent(SWE-Bench/TerminalBench 类任务)的 harness 自动演化,要求演化出的 harness 在未见任务上仍然有效。
抽象问题:如何从执行反馈中提取"harness 层面的可泛化改进信号",使其与任务难度、实例特异性脱敏。
形式化:给定演化任务集 D_evo(与评测集 D_eval 不相交)、harness H 的组件集 {h_1…h_n}、执行结果 r∈{成功,失败}:寻找组件修改 δ:D_evo 上提取的改进在 D_eval 上产生正迁移。约束:信号需剥离任务难度混淆。
精妙之处:把 harness 演化重构为因果归因问题——“harness 的哪个组件的什么行为导致了跨任务的反复失败”。这直接借用了因果推断的配对差分设计:同一任务的成功/失败轨迹对,是控制了任务难度的自然实验。
四、问题解法
解法一:Benchmark-disjoint 演化数据(对症缺陷 1)
另建 2000 个可执行演化任务,来源与评测基准不相交(经细粒度域分析最小化重叠)。类比:训练运动员用训练场,比赛场地只在比赛时进入——训练成绩的提升才可信地反映能力而非场地熟悉度。这为"可泛化改进"提供了测量学基础。
解法二:对比式信用分配(对症缺陷 2)
不是看单条失败轨迹,而是同一任务的成功/失败轨迹对比 + 跨任务聚合:
- 同任务对比:任务难度在成对轨迹间被天然控制(同一道题),差异只能来自执行路径——这才是 harness 行为的净信号。
- 跨任务聚合:单一任务对的差异仍可能偶然,聚合多个任务后仍然反复出现的差异模式 = 系统性缺陷。类比:流行病学的病例-对照研究,单个病例说明不了什么,跨人群的重复关联才指向病因。
解法三:模块化定位(对症缺陷 3)
harness 显式分解为模块(提示组件、工具调度、错误恢复等),反复出现的缺陷模式被定位到具体模块,产生局部化修改——每个修改可独立验证(改了 A 模块,只看 A 相关指标变化),独立演化的模块可自由组合。
五、评估指标与实验证据
| 实验 | 基准 | baseline → ModularRSI | 证明什么 |
|---|---|---|---|
| in-domain 提升 | SWE-Bench-Verified | 73.40 → 76.45(+3.05) | 演化有效 |
| in-domain 提升 | TerminalBench 2.0 | 47.57 → 52.43(+4.86) | 演化跨基准有效 |
| out-of-domain | 两基准 OOD | 49.40/75.80 等保持增益 | 泛化性成立 |
| 演化数据分布 | Medium-centered vs Hard&Easy | 76.45 vs 74.25(+2.20pp) | 中等难度任务提供更有信息量的对比 |
| 跨模型迁移 | 换基座模型 | 增益保持 | 演化的是 harness 不是模型特化 |
| 逐代分析 | 附录 F | 大体单调改进 | 演化过程稳定非偶然 |
证明力分析:三个设计各自回答一个威胁效度的替代解释——benchmark-disjoint 排除"偷看评测集";OOD 增益排除"领域内过拟合";跨模型迁移排除"模型特化"。Medium-centered 优于 Hard&Easy 的消融尤其有价值:直觉上"难题信息量大",但难题的成对轨迹差异常来自任务本身的极端性而非 harness 行为——中等难度的对比最干净,这与教育测量学中"中等难度题区分度最高"的经典结论同构。
六、效果优势的根源解释
根源机制与证据链
- 配对差分消除任务难度混淆(论文实验已支持):单轨迹归因的失败信号被任务难度污染(难题失败≠harness 差);成对对比控制难度 → 信号纯度提升 → 体现在 Medium-centered 消融(难度适中的数据产生最好演化)与 OOD 迁移成立。
- 局部化修改的可组合性(论文实验已支持):monolithic 重写的修改纠缠无关机制,无法归因;模块化后每次修改的影响面小且可验证 → 逐代单调改进(附录 F)而非震荡。
- 演化与评测的隔离(论文实验已支持):2000 个不相交任务保证训练-测试分离 → in-domain 增益可直接解释为能力而非熟悉度。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| HarnessEvo(9/5 精读) | 归因式 harness 演化 | 失败归因引导演化 | 演化数据与评测未严格隔离 | 支持:归因方向;对照:隔离的必要性 |
| GEPA | 轨迹级 prompt 进化 | 优于 DSPy 类优化 | 单 prompt 对象 | 支持:经验信号优于指令信号 |
| SkillOpt 复现失败(9/15 精读) | skill 优化外部验证 | 无验证集的优化不可信 | skill 层 | 支持:验证隔离原则跨层成立 |
| 配对差分/自然实验方法 | 因果推断成对设计 | 控制混淆的黄金标准 | 方法论域 | 支持:机制来源可靠 |
| HarnessBandit(同日) | 多 harness 训练调度 | 梯度可迁移性是关键信号 | 训练层 | 补充:迁移信号可计算 |
综合判断与未决问题
多研究共同支持:验证-评测隔离(SkillOpt 复现失败 + 本文);对比信号优于单例信号(GEPA + 因果推断传统 + 本文)。仍属推测:模块化分解的最优粒度——粒度过细可能破坏组件间协同(论文未探索粒度消融)。适用边界:需要可执行环境判定成败的任务;主观评价任务(创意写作)的"成功"信号弱。可能的失效条件:演化任务分布与评测分布差异过大时,可复用改进的空间本身受限(OOD 增益小于 in-domain 是自然边界)。
七、必要知识反推
领域知识层:CLI 编码 Agent 的 harness 构成(提示结构、工具协议、重试逻辑)——不了解组件边界就无法模块化。
方法论知识层:因果推断的配对设计与混淆控制(成功/失败对的自然实验本质);实验测量学(训练-测试隔离、构念效度);进化搜索的种群与收敛管理。
工程知识层:2000 个可执行演化任务的构建与去重流水线(域分析最小化与评测集重叠);轨迹的结构化对齐(同任务轨迹对的语义匹配);跨模型 serving(演化 harness 的基座无关性测试)。
知识融合关键节点:“把因果推断的配对差分引入 harness 演化"是本文的创造性融合——需要同时看到"轨迹对=自然实验”(领域观察)与"单轨迹归因有混淆"(方法论诊断),两个视角的叠加产生了核心设计。
八、通用性灵感
- 成对差分提纯信号:任何"从成败经验学习"的系统都应优先比较同一情境的成功/失败对,而非单例分析(论文证据:Medium-centered 数据 +2.20pp 与 OOD 迁移)。推广:销售复盘(同客户丢单/成单的成对分析)、医疗质量改进(同病情不同结局的病例对照)。
- 中等难度最优区分度:学习信号最丰富的数据不是最难的,而是难度适中的—— extremes 的差异被任务本身的极端性主导(论文证据:Medium > Hard&Easy 消融)。推广:教育题库设计、员工培训案例选择。
- 改进资产的模块化封装:让自动改进的产物保持模块边界,修改可归因、可组合、可独立验证(论文证据:逐代单调改进 + 跨模型迁移)。推广:企业流程优化的"可插拔改进单元";代码重构的模块化提交。
- 训练场与赛场的测量学分离:自改进系统的优化数据必须与验收数据隔离,否则改进不可信(论文证据:benchmark-disjoint 设计成为一切结论的前提)。推广:推荐系统的 A/B 隔离、个人成长的"练习-考核"分离。