论文链接:arxiv.org/abs/2609.24972 代码仓库:github.com/google-research/rrsi 项目主页:regularized-rsi.com 发表时间:2026年9月(arXiv v1,2026-09-21) 机构:Google Cloud AI Research、UNC-Chapel Hill、Stanford University、Washington University in St. Louis(一作 Peng Xia 为 Google 学生研究员,属产学研合作)
一、论文背景
1.1 什么是 Agent 与 Harness?
要理解这篇论文,必须先厘清两个核心概念:Agent(智能体) 与 Harness(运行框架/外壳)。
一个现代 LLM Agent,本质上不是「孤立的模型」,而是一个系统。它的能力 = 冻结的主干模型(backbone policy,比如 Claude Opus 4.8)+ 包裹在模型外面的 Harness。Harness 是什么?论文给它下了一个非常清晰的定义:它是模型权重之外的所有东西,包括:
- 系统提示词与任务提示词(system/task prompts)
- 控制流(control flow):模型何时规划、行动、反思、停止
- 工具接口及其描述(tool interfaces)
- 记忆与技能文件(memory、skill files)
- 上下文管理(context management):每一步让模型「看到」什么
可以打一个通俗的比方:主干模型像一位天赋很高的员工,Harness 则是他手边的操作手册、工作流程、工具箱和汇报格式。同一个员工,给他一套混乱的工作流和一套精心设计的工作流,产出天差地别。论文开篇就点明:近期 Agent 产品的很多进步来自 Harness 工程,而不是新模型权重——所谓「换模型不如调框架」。
1.2 什么是 Harness Evolution(运行框架演化)?
既然 Harness 这么重要,过去它靠人类工程师手工调:人去读失败轨迹、改脚手架。这条路的上限,取决于一个工程师能读多少条轨迹。于是近年出现一类新方法:用 LLM 自己来优化 Harness——这就是 Harness Evolution(运行框架演化),也是论文所研究对象的雏形。
它的通用循环长这样(论文公式 2):
- 在第 t 轮,用当前 Harness $H_t$ 在「演化集(evolve set)」$D_{evolve}$ 上跑任务,得到轨迹;
- 把这些轨迹总结成反馈 $F_t$;
- 一个「提案者 LLM(proposer)」根据反馈生成若干候选 Harness;
- 在同一演化集上评估这些候选;
- 选最好的作为下一轮 incumbent( incumbent 即「当前最优 Harness」)。
1.3 什么是 RSI(递归自我改进)?
把上面的循环反复迭代,就构成了论文所说的 Recursive Self-Improvement(RSI,递归自我改进)——以 Agent 系统自身为对象,用当前系统的反馈来改进塑造其后续行为的 Harness。这是「自改进」在 Agent 系统层面的一种现实形态:反馈来自当前系统,修改作用在 Harness,模型权重始终冻结。
这正是 RRSI 这篇论文的立足点:RSI 本身是危险的——如果演化集有限且反馈有噪声,递归改进极易「记住训练任务」而非「学到可迁移机制」。
二、论文定位和关联工作
2.1 论文要解决的「母问题」
论文把 Harness Evolution 视为一种 「在异常高表达力的搜索空间上的自适应经验优化」。关键在于「自适应」:第 t 轮提出的候选,依赖于前几轮在同一批任务上测得的反馈。换句话说,演化集被反复复用,且每次复用都根据上一次结果调整搜索方向。这和传统机器学习里「训练集被反复看、反复调参」的过拟合情景,在结构上高度同构。
2.2 关联工作:两条脉络
论文在 Related Work 中明确区分了两条线:
第一线:Agent Harness 本身。 大量前沿报告(OpenAI 的 harness engineering、Anthropic 的 long-running app harness 设计、Lilian Weng 的 harness 工程综述等)指出 Harness 能独立决定 Agent 能力,甚至「好 Harness 可替代规模」——用一个更便宜的小模型配上好 Harness,能追回大模型大部分能力。但这类工程「高度手工」,且「最好的 Harness 绑定特定主干模型」,每次换模型都要重付成本。
第二线:Harness Evolution(自动化这条循环)。 这是最接近本论文的工作,包括 Meta-Harness(Lee et al., 2026b)、AHE(Lin et al., 2026a)、TTHE(Nie et al., 2026)、HarnessX(Chen et al., 2026),以及单组件演化(skill、memory、rollout 偏好信号)等。这些方法共享「搜索由所优化套件的分数驱动、没有泛化项」的特点。论文明确指出:已有研究报告 gains 经常在换套件后消失(如 Wang et al., 2026b 的「重新思考 harness 演化评估」),且「delta attribution」工作(Ding et al., 2026)能把「装了可复用机制」的修改与「仅拟合演化任务」的修改分开。
RRSI 的差异化定位:它与「编辑什么」正交——保留同样的开放编辑空间,转而正则化搜索动力学本身:跨整个演化史的信用分配、在打分前过滤任务特定逻辑、对噪声调整底线做接受判定。让「存活下来的」是机制,而非对演化套件的拟合。
三、问题定义
3.1 形式化
论文给出严格记号(公式 1):Agent $A=(\pi, H)$,主干策略 $\pi$ 固定,Harness 为 $H$。给定任务 $x$ 与环境,Agent 产出轨迹 $\tau$ 与交付物,由验证器打分 $r(x,\tau)\in[0,1]$。对任务集 $D$:
$$S(H;D)=\mathbb{E}_{x\sim D}\,\mathbb{E}_{\tau\sim A(\cdot|x)}[r(x,\tau)],\qquad C(H;D)=\mathbb{E}_{x\sim D}\,\mathbb{E}_{\tau\sim A(\cdot|x)}[c(\tau)]$$即 $S$ 是任务性能(分数),$C$ 是策略 token 成本。Harness Evolution 把 $H$ 当优化变量(公式 3),用每任务 $k$ 次试验的经验分数 $\hat S$ 与经验成本 $\hat C$ 做选择。
3.2 过拟合从哪来?
论文指出,过拟合通过三种耦合行为产生(对应 Figure 1(a) 的「evolve 集收益」与「OOD 收益」严重脱节):
- 基准特定拟合(benchmark-specific fitting):演化搜索把演化集特有的模式写进 Harness(例如硬编码任务名、答案、特定工具顺序、已知错误路径)。
- 噪声追逐(noise chasing):选择被评估噪声偏爱的候选,把随机波动当真改进。
- 复杂度累积(complexity accumulation):接受一堆只抬高演化集分数、却不改善底层机制的修改。
三者都会拉大「演化集→迁移」的鸿沟。论文定义的「泛化问题」即:演化出的 Harness 能否迁移到任务描述、工具接口或验证器都不同的未见基准上。
3.3 本文的核心主张
因为有限演化集被跨轮自适应复用,看似的自改进可能反映的是基准特定拟合、评估噪声或无谓复杂度,而非可迁移进展。RRSI 的解决方案是:正则化演化如何移动,而不是限制哪些组件可改。
四、问题解法
RRSI 的核心洞见:把机器学习里的正则化思想翻译成「自适应 Harness 搜索」的语言。它不收缩 Harness 的可编辑空间(prompt、控制流、配置、上下文管理、工具、技能、记忆、子 Agent 全部可改),而是正则化穿过这个空间的搜索轨迹。分两侧:
- 提案侧(proposal-side)正则化:控制「搜索容量如何用」——每轮改多少、改在哪儿。
- 选择侧(selection-side)正则化:控制「哪些测得的好处能成为永久状态」。
4.1 提案侧三招
(1)L0 式退火编辑稀疏度(Annealed Update Sparsity)。 无约束提案者会把很多不相关修改打包进一个候选,使其「有效容量」过高、难以归因。RRSI 给每轮可打包的「可独立归因编辑数」设预算(公式 4):
$$b_t = b_{\min} + (b_{\max}-b_{\min})\cdot \tfrac12\left(1+\cos(\pi t/T)\right)$$这是一个余弦退火预算:从 $b_{\max}$ 降到 $b_{\min}$。论文实验中 coding/engineering 取 $b_{\max}=4,b_{\min}=1$,agentic workspace 取 $b_{\max}=3,b_{\min}=1$。早期轮次可组合若干协同改动去发现新机制;后期轮次越来越稀疏、可归因。这最贴近经典 L0 式基数约束:把候选里独立激活的编辑看作 0/1 指示变量,预算直接限制其「个数」。注意类比只针对「更新稀疏度」而非固定参数向量——编辑池每轮可变,论文也不优化 L0 惩罚目标。
(2)证据感知信用分配(Evidence-Aware Credit Assignment)。 只限制更新大小不够——搜索得知道「早先更新确立了什么」。因为每次评估都是对同一有限演化集的又一次自适应观察,反复测试早几轮已证伪的假设纯属浪费容量(呼应 Dwork et al., 2015)。RRSI 为每条评估过的候选记录:它改的组件、测的假设、source diff、分数与成本变化、是否被接受。后续轮次的提案者以这段历史为条件:被拒机制保留为负证据,成功机制保留显式信用。后期每候选编辑更少,归因更易。
(3)结构化探索(Structured Exploration)。 同一段历史能暴露「提案者塌缩到狭窄编辑族」的情况(例如反复改写 prompt,却不动结构性机制)。论文把「过去 $w$ 轮进步落在经验噪声带 $\delta$ 内」视为停滞(stall),停滞时保留一小部分提案预算给「本轮还没被练过的组件」(探索集 $U_t = K \setminus T_t$)。这类似多样性/熵正则化:把有限提案容量导向未被充分探索的机制,而不改变 Harness 允许含哪些机制。
4.2 选择侧四招
标准演化会把分数最高的候选直接晋升,即使那分数来自显式泄漏、随机波动或昂贵增长。RRSI 要求候选先满足若干**非补偿性(non-compensatory)**标准,分数才有资格替换 incumbent。
(1)泄漏筛查(Leakage Screening)。 完整评估前,一个 critic 读每个候选 diff,拒绝显式编码任务名、实体名、任务特定取值、答案、或演化基准特定逻辑,以及添加惰性机械的编辑。筛查在「打分前」很重要:一个泄漏候选永远不会拿到那虚高的演化集分数去诱惑后续轮次。注意它针对「基准特定内容」而非「特定 Harness 组件」——通用的 prompt 或工具描述改进仍是合法候选。
(2)稳定性感知接受(Stability-Aware / Noise-Adjusted Floor)。 演化前反复评估不变的基 Harness,估计经验噪声带 $\delta$。设 $S^\star$ 为迄今观测到的最佳演化集分数,候选须满足(公式 5):
$$\hat S(H') \ge S^\star - \delta$$这个底线防止搜索「顺着一串各自小到可被误判为噪声的回退往下走」。更广泛地说,它让选择对「同一演化集上反复随机评估诱发的波动」保持保守(Dwork et al., 2015)。
(3)Ridge/L2 式复杂度感知接受(Complexity-Aware Acceptance)。 对相对当前 Harness 的候选,定义 $\Delta S = \hat S(H')-\hat S(H_t)$,$\Delta C = (\hat C(H')-\hat C(H_t))/\hat C(H_t)$。对增益超过噪声带($\Delta S>\delta$)的候选,要求(公式 7):
$$\Delta C \le \beta_0 + \beta_1 \Delta S$$$\beta_0$ 是「分数几乎没涨时容忍的成本增量」,$\beta_1$ 是「随测得改进增大而允许追加的成本」比例。论文用策略 token 成本作为资源 footprint 的可测代理。这像 Ridge/L2 式收缩:抑制整体资源规模的失控增长,而不要求删掉某个具体组件。实验取值(Table 5):coding $\beta_0=0.10,\beta_1=44.5$;agentic $\beta_0=0.10,\beta_1=35.4$;engineering $\beta_0=0.15,\beta_1=24.4$。
(4)Lasso/L1 式结构剪枝(Structural Pruning)。 公式 4 的退火预算稀疏化「每次更新」;剪枝稀疏化「保留下来的 Harness」。RRSI 跟踪近期被练过的组件在固定剪枝窗口内是否产生严格为正的测得增益;持续无产出的组件,作为删除目标回报给提案者。这像 Lasso/L1 式稀疏化:证据不足的机制被整体删除,使保留 Harness 结构性更稀疏,而非仅整体更便宜。注意这是「按观测贡献删除离散组件」的定性类比,并非 L1 惩罚的连续优化。
4.3 一段式小结表
| 正则化手段 | 经典 ML 类比 | 作用位置 | 直觉 |
|---|---|---|---|
| 退火编辑预算 $b_t$ | L0 式基数约束 | 提案侧 | 每轮只动少数可归因编辑 |
| 证据感知信用分配 | 跨轮经验复用 | 提案侧 | 别反复测已证伪的假设 |
| 结构化探索 | 熵/多样性正则 | 提案侧 | 停滞时转向未探索组件 |
| 泄漏筛查 | 数据清洗/防作弊 | 选择侧 | 打分前砍掉基准特定逻辑 |
| 噪声调整底线 $S^\star-\delta$ | 稳定性阈值 | 选择侧 | 拒绝被噪声误导的小回退 |
| 复杂度感知接受 | L2/Ridge 收缩 | 选择侧 | 额外成本须由增益证明 |
| 结构剪枝 | L1/Lasso 稀疏 | 选择侧 | 长期无用的组件直接删 |
五、评估指标与实验证据
5.1 实验设置
环境(八基准三域):
- 编码域:Terminal-Bench 2.1(89 个容器化终端任务,靠自身单元测试验证)、SWE-bench Verified(仓库级修 bug,OOD)。
- Agent 工作域:Harvey LAB(法律工作,120 演化 + 40 同分布 held-out)、JobBench、GDPval、APEX-Agents(三者 OOD)。
- 工程设计域:EngDesign(61 个设计任务,靠冻结仿真器确定性评分)、Frontier-Eng(26 域真实工程优化,OOD,按 Medal Score 计)。
基线:未演化基 Harness $H_0$,以及四个近期 harness 演化方法 Meta-Harness、AHE、TTHE、HarnessX。所有基线同起点、同冻结策略、同演化集、同候选预算。
实现:主干策略全程冻结为 Claude Opus 4.8;提案者、反馈分析者、泄漏 critic 均为 Claude Opus 4.8。基 Harness 因域而异(Terminus-2、ReAct+MCP、动态工具箱、ReSum 式上下文管理)。
5.2 主结果(Figure 3 / Table 1)
RRSI 在「演化集之外」的每个 split 都提升,三域一致:
| 基准 | 类型 | $H_0$ | RRSI | Δ |
|---|---|---|---|---|
| Terminal-Bench 2.1 | Evolve | 74.2 | 80.2 | +6.0 |
| SWE-bench Verified | OOD | 82.0 | 83.8 | +1.8 |
| Harvey LAB | Evolve | 89.4 | 90.5 | +1.1 |
| Harvey LAB (ID held-out) | ID | 86.9 | 89.2 | +2.3 |
| JobBench | OOD | 36.0 | 40.7 | +4.7 |
| GDPval | OOD | 48.8 | 52.3 | +3.5 |
| APEX-Agents | OOD | 34.2 | 37.9 | +3.7 |
| EngDesign | Evolve | 17.7 | 22.0 | +4.3 |
| Frontier-Eng | OOD | 17.7 | 22.0 | +4.3(+24.3% 相对) |
注意关键对比(Table 1):四个基线在演化集上都不错,但排名在 OOD 处反转——Meta-Harness 在 OOD 平均仅 +0.9、HarnessX 落回基线、AHE 与 TTHE 甚至低于起点(TTHE −1.7)。RRSI 的演化集增益是「所有演化 Harness 中最小之一」,却是唯一 OOD 平均比 $H_0$ 高出超过 1 分的——43.6 vs 39.7。这就是正则化刻意做的「交易」:牺牲一点演化集分数,换 OOD 泛化。
5.3 消融(Table 2)
去掉任一组正则化都会「抬高演化集分数、压低迁移」:
| 变体 | Evolve | OOD 平均 | Tokens/trial(M) |
|---|---|---|---|
| $H_0$ | 89.4 | 39.7 | 1.56 |
| 无正则演化 | 92.8 | 40.3 | 3.80 |
| 去提案正则 | 90.7 | 41.9 | 2.69 |
| 去接受正则 | 91.5 | 41.0 | 3.59 |
| RRSI | 90.5 | 43.6 | 2.42 |
最糟的是「两组都去」:演化集冲到 92.8(最高),OOD 平均却落到 40.3(贴近未演化 Harness),且每试验 3.80M token。说明无约束选择把大部分接受的编辑花在噪声和上下文上,而非机制上。
5.4 跨策略与跨模型(Table 3 / 4)
- 换搜索策略:在 coding 域用 Gemini 3.5 Flash 独立跑演化,Terminal-Bench 2.1 从 64.6→78.7(+14.1),并迁移 +2.2 到 SWE-bench Verified;Claude Opus 4.8 下同样模式(64.6→80.2 与 82.0→83.8),只是强策略起点更接近天花板、空间更小。
- 对搜索时从未用过的弱模型:把 Gemini 3.5 Flash 演化出的 Harness 原样给 Gemini 3.1 Flash Lite(更小、未参与搜索)跑,Terminal-Bench 从 11.2→14.6,相对 +30.4%。说明机制不依赖搜索时的能力水位。
5.5 成本(Figure 4)
两个正则化直接作用于成本:L1 式预算拒绝「提出时未被付费」的增长,剪枝规则删掉「已不再被付费」的增长。RRSI 产出所有演化 Harness 中最轻的:2.42M token/试验,而 AHE 高达 3.82M(+58%),OOD 反而低 4.4 分。轨迹长度 RRSI 26.3 步/试验,优于其余 27.3–34.6。比 $H_0$(1.56M)仍贵,说明演化确实用一部分测试时算力买了增益——预算决定买多少。
六、效果优势的根源解释(含外部检索交叉验证)
为什么 RRSI 能泛化,而四个基线不能?论文给出机制层面的解释,我再用外部检索做交叉验证,区分「方法相似」与「结论相近」。
6.1 论文自身的根因解释
- 正则化把「可复用机制」与「基准特定拟合/噪声/复杂度」分开。泄漏筛查在打分前就切断「基准特定逻辑」成为永久状态的可能;证据感知信用分配避免反复踩已证伪的坑;L0/L1/L2 三招分别限制「每轮改多少」「保留结构多稀疏」「总资源长多大」。
- 随机化控制:噪声带 $\delta$ 来自对不变基 Harness 的反复评估,使选择对「同集反复随机评估的波动」保守;复杂度门槛 $\Delta C\le\beta_0+\beta_1\Delta S$ 让「用算力买来的增益」须可被测量证明(对应 HDA 里的 Test-Time Scaling 概念)。
- 迁移不是评测假象:Harvey LAB/JobBench/GDPval 由 judge 模型打分,理论上可「写 judge 爱看的话」刷分;但 EngDesign/Frontier-Eng 用确定性仿真器评分、设计要么达标要么不达标,增益在那里原样存活,且确定性评分还去掉了 judge 方差。
6.2 外部交叉验证
(A)Harness 演化过拟合/泛化的并行工作——方法相似、结论相近。
HarnessCompass(Zhang et al., arXiv:2608.01918,2026-08):提出围绕「约束演化 + 主动反馈 + 组件级优化」的自动 harness 演化框架。它第一招就强制全局约束,限制修改为「任务无关、能泛化到演化任务之外」的 harness 改动,并把不同组件解耦优化以减少跨组件干扰。这与 RRSI 的「泄漏筛查 + 组件级证据感知」方法高度相似;其结论也相近——在 SWE-bench Verified 上 5 轮把 Pass@1 从 54% 提到 66%,且「演化出的 Harness 有效迁移到 held-out 任务与其他模型」。区别:HarnessCompass 还引入「agent 第一人称主动反馈」与「组件解耦」,RRSI 则提供一套与经典正则化一一对应的完整理论类比。
Harness-Delta Attribution / HDA(Ding et al., wenwen-d.github.io,2026-08):方法不同(是事后归因而非训练期正则),但结论高度相近且互为印证。它把演化增益分解为三部分:O=过拟合(数据集捷径、硬编码任务知识)、T=测试时缩放(多采样/重试/验证,真实但要花钱)、G=可泛化改进(可复用技能、更好任务分解)。结论是:在 ALFWorld/LiveMath/CREATE/SWE-bench Verified 上,大部分搜索集增益来自过拟合或测试时缩放,可泛化残差往往很小;且「即使有验证集门控,防过拟合仍非平凡」。这恰好解释了 RRSI 为何要用「泄漏筛查(对应 O)+ 噪声调整底线与成本门槛(对应 T)+ 组件级证据(对应 G)」三管齐下——HDA 是从测量侧证实问题,RRSI 是从训练侧解决问题。
EvoBench(Huang et al., arXiv:2608.09096,2026-08):第一个评测「模型内在 harness 演化能力」的基准,用「harness-guided 构建 + 敏感度分层划分」隔离 harness 改进与模型能力、并防任务特定过拟合。其结论点出早期饱和(early saturation)——模型前几轮就找到高质量结构,后续修改反而破坏已有能力——这与 RRSI「退火预算让后期更稀疏、更可归因」的设计动机一致。属结论相近、方法互补(EvoBench 是评测方法论,RRSI 是训练期方法)。
(B)自适应数据分析过拟合理论——结论相近(理论根基)。
- Dwork et al., 2015,「Generalization in Adaptive Data Analysis and Holdout Reuse」(NeurIPS 2015, arXiv:1506.02629):经典结论——自适应反复复用 holdout 集本身就会过拟合到 holdout;论文给出基于差分隐私与描述长度的算法,使大量自适应假设仍能避免过拟合。RRSI 在 Related Work 与正文多次直接引用此文(证据感知信用分配、噪声调整底线均 cite 它)。方法不同(这是理论算法,RRSI 是工程启发),但结论相近:当同一有限集合被跨轮自适应复用并据其结果调搜索方向时,必须引入噪声/复用控制,否则「测得的好」不等于「能泛化」。这正是 RRSI 全文的理论支点。
(C)LLM 评估噪声/随机选择问题——结论相近(支撑噪声带 δ 的必要性)。
「Stop Comparing LLM Agents Without Disclosing the Harness」(Zhang et al., arXiv:2605.23950):立场论文,论证Harness 配置引发的方差可远超模型本身引发的方差(同一模型换 Harness 在 Terminal-Bench 2.1 上 pass@1 从 69.7%→77.0%;SWE-bench Verified 上有高达 15 个百分点的 scaffold-only 波动)。这支撑了 RRSI「必须分离模型信号与 harness 信号、并把成本作为一等指标」的评测纪律。
LLM Eval 噪声实测(ClawBench / compiletheory 噪声地板实践):实践侧证据显示,agent 评测分数波动中相当大的比例来自 seed 噪声(ClawBench 报告约 47% 的方差可归因于 seed 噪声,仅约 52.7% 反映真实能力差异);「judge 噪声地板」方法建议对不变 agent 重复跑 5 次取标准差,任何小于该噪声带的声称改进都不成立。这直接对应 RRSI 用「反复评估不变基 Harness 估计 $\delta$」的做法——其 $\delta$(coding 0.017、agentic 0.004、engineering 0.020)本质就是一个经验校准的噪声地板,使选择不会把随机波动当真改进。
小结:RRSI 的「泛化来自正则化」主张,并非孤例。方法层面 HarnessCompass 提供了同向约束式演化;测量层面 HDA 事后证实了「过拟合/测试时缩放占主导」;理论层面 Dwork et al. 2015 给出自适应复用必过拟合的严格依据;工程层面 LLM eval 噪声研究证明「噪声地板」不可或缺。四者共同支撑而非削弱 RRSI 的论断。需要如实说明:上述并行工作中,HarnessCompass 与 RRSI 方法最相似,HDA 与 EvoBench 主要是结论相近/互补验证,Dwork 2015 是理论根基,均非直接复现本论文实验。
七、必要知识反推
为读懂本文,需反推以下前置知识:
正则化三件套(L0/L1/L2)。L0 直接限制「非零参数个数」(最稀疏,但组合优化难);L1(Lasso)对绝对值求和,产生稀疏解(自动做特征选择);L2(Ridge)对平方和惩罚,抑制整体幅度、不稀疏。RRSI 把这三者「角色化」映射到 harness 搜索:编辑预算≈L0、结构剪枝≈L1、成本门槛≈L2。关键要理解:类比只在「角色」层面成立,RRSI 不优化任何范数惩罚目标,也不把异构 harness 组件当连续参数向量。
退火(annealing)。源于模拟退火的「由热到冷」:早期探索广、后期收敛稳。RRSI 用余弦退火让编辑预算从大到小,对应「先广后精」。
自适应数据分析与 holdout 复用。传统 ML 假设每次分析用「新鲜采样」数据;现实中训练/验证集被反复看、反复调参,导致对验证集本身过拟合。Dwork et al. 2015 证明需引入差分隐私式噪声或描述长度控制才能保统计有效性。这是理解 RRSI「为何要噪声带 + 证据史」的钥匙。
信用分配(credit assignment)。强化学习经典难题:一个好结果该归功于哪一步?RRSI 把「每候选编辑更少」与「跨轮证据史」结合,让后期归因更清晰——这是把 RL 信用分配思想用到 harness 演化。
LLM-as-a-Judge 及其方差。很多 agent 基准用 judge 模型打分,但 judge 有位置偏置、冗长偏置、跨 run 不一致。RRSI 用确定性仿真器基准(EngDesign/Frontier-Eng)做「去 judge 方差」的硬验证,是评测严谨性的示范。
余弦相似度的余弦 vs 余弦退火。本文公式 4 用的是 $\cos(\pi t/T)$ 做平滑衰减调度,与「余弦相似度」无关,勿混淆。
八、通用性灵感
RRSI 不止是一篇「agent 调参」论文,其思想可迁移到更广的场景:
任何「有限反馈被反复复用」的自动优化,都应加正则化。不仅是 harness 演化,prompt 自动搜索、AutoML、超参调优、甚至「用 LLM 反复改自己代码」的 Gödel machine 类系统,都面临同构的「自适应过拟合」风险。RRSI 的 L0/L1/L2 角色化框架是可复用的模板。
「约束编辑空间」不如「正则化搜索轨迹」。很多系统靠「限制能改什么」防过拟合,RRSI 证明:保留完全开放的编辑能力、转而约束「怎么改、改多少、何时接受」,既灵活又防过拟合。这对「在保持表达力的同时求泛化」是通用原则。
把成本当一等公民。RRSI 用 token 成本作资源 footprint 代理,用 L2 式门槛逼「额外算力须由增益证明」。在一切 test-time compute scaling 盛行的当下,这是对抗「用钱堆分」的朴素而有力的方法。
证据史即记忆。把每轮「改了什么组件、测了什么假设、是成功还是失败」记成跨轮历史,让搜索「不重复踩坑」。这比「每轮只看最新胜利」稳健得多,可直接用于任何迭代式 agent 自评循环。
用确定性硬基准做去方差验证。当你宣称「系统级改进」时,至少应有一个「答案非对即错、无 judge 方差」的基准来兜底,排除「刷 judge 喜好」的假象。这是 agent 评测的方法论启示。
弱模型也能吃强模型演化出的机制。RRSI 跨模型迁移(Flash Lite 相对 +30.4%)暗示:好的 harness 是一种「与能力水位解耦的可迁移知识」,可作为独立资产沉淀与复用——这指向「harness 作为可移植资产」的产品化思路。
局限即下一步。论文诚实说明:仅限冻结权重的 harness 级 RSI,未涉及权重更新;仍依赖有限演化集与若干超参(δ、β0、β1、bmin/max),其有效性可能受反馈信号质量与搜索预算影响;跨「差异极大的 agent 架构、工具生态、更长程自改进」仍需更广泛验证。这些正是后续工作的开放口。
一句话总结:RRSI 把一个被忽视的真相讲清楚了——递归自我改进的危险不在「改什么」,而在「用有限噪声反馈反复改、且把随机波动当进步」;把机器学习用了几十年的正则化思想搬进 harness 搜索的轨迹,就能让自我改进真正泛化,而非只记住训练任务。