论文链接:DarwinX: Evolving Agent Harnesses Through Natural Selection 发表时间:2026年7月31日 机构:Salesforce AI Research + Agentforce 领域标签:cs.NE / cs.AI / cs.LG / cs.SE
一、论文背景
1.1 Harness 是什么
把 Claude Code、Codex 这样的 coding agent 拆开看,除了模型本身,还有:系统提示词(决定模型"怎么思考")、工具集(读写文件、跑命令)、技能库(可复用的操作手册)、上下文管理、子 Agent 调度和循环控制(何时继续、何时停)。这套包裹在模型外、决定能力能兑现多少的 runtime 系统,就是 Harness。
Harness 直译是"马具"——把马的力气变成可控拉力的装置。放到 Agent 里:模型是马力,Harness 决定马力能兑现成多少生产力。同一个模型套不同 Harness 差异巨大:Darwin Gödel Machine(DGM)的实验里,基座固定 Claude 3.5 Sonnet,只进化 Harness,SWE-bench Verified 从 20% 涨到 50%。业界正把这一层当研究对象:Lilian Weng(前 OpenAI 安全研究 VP)2026 年 7 月的综述判断,近期的递归自我改进(RSI)不会从"模型改写权重"开始,更现实的路径是优化 Harness——改权重需要 GPU 集群,改 Harness 只需要文件系统、评测集和一个能写代码的模型,迭代快、杠杆大。
1.2 自进化的已有路线与它们的病
让 Agent 自己改自己的 Harness,已有工作分两类:元 agent 模式(固定"元 agent"修订目标 agent 的脚手架,如 ADAS、HarnessX)与自指模式(agent 直接改自己的可执行代码,源于 Gödel machine 思想,LLM 实现有 STOP、SICA、DGM 等)。这些系统验证了"harness 可以自进化",但有两大顽疾:
- 路径依赖:单谱系搜索受早期编辑偏差影响,很快陷入平台期(SICA 自己报告了这一现象)。好比流水线只在初始设计附近局部修补,跳不出去。
- 跨任务干扰:修复 A 类任务的编辑会隐性回归 B 类任务——修好数据库任务的 prompt,悄悄弄坏数值计算。任务分布越宽,病症越尖锐,最终进化停滞。
现有应对各有残缺:HarnessX 用"隔离变体"避免干扰,但专家留在互不相通的谱系里,互补能力无法合并;DGM 每次只变异一个父代、没有合并算子,且一次增益没有义务保住它所取代的东西。
1.3 拦路虎:评测噪声
进化需要适应度,但 benchmark 评测有噪声:SWE-bench Verified 上同一配置的 pass@1 波动可达 2.2–6.0 分——相当于一次"被接受的编辑"的量级。选择机制不加防护,噪声会让进化随机漂移甚至倒退。路径依赖、跨任务干扰、评测噪声,就是 DarwinX 的三个设计靶心。
二、论文定位和关联工作
谱系一:提示/工作流/技能优化(优化单一指定工件)
OPRO/PromptBreeder/TextGrad 优化指令文本,Reflexion/Self-Refine 从轨迹蒸馏反馈,DSPy 把提示工程"编译"成数据驱动优化,AFlow/GPTSwarm 把 agent 程序提升为可优化图,Voyager/SkillOpt 做技能积累。共同局限:优化器本身不改进,harness 的工具/控制流留在搜索空间之外。
谱系二:自进化 agent(编辑自己的可执行脚手架)
| 工作 | 核心机制 | 与 DarwinX 的关键区别 |
|---|---|---|
| STOP / Gödel Agent / SICA | 自指代码改写 | 单谱系、无种群、报告了早期平台期 |
| DGM | 开放式 archive + 单亲随机变异 | 无跨谱系合并算子;增益不承诺保持 |
| HGM / HyperAgents / RQGM | DGM 的扩展 | 同样缺少有界回退约束 |
| HarnessX | 类型化 harness 隔离进化 | 谱系互不相通,亚阈值回退仍会积累 |
| AlphaEvolve / FunSearch | 进化任务解程序(非 agent) | 预设确定性适应度,不处理评测噪声 |
谱系三:噪声评估下的选择
Hoeffding races、竞速算法、Hyperband 等经典机制处理"测量噪声下的选择",DarwinX 吸收其思想但方向不同:不消除噪声,而是校准每个决策所需的证据量。
论文的定位矩阵(✓ 完备、~ 受限、✗ 缺失):
| 方法 | 编辑工具/控制流 | 种群 archive | 跨谱系合并 | 有界回退 | 噪声感知 avg@k | 教师+自信号 |
|---|---|---|---|---|---|---|
| OPRO / PromptBreeder | ✗ | ~ | ~ | ✗ | ✗ | ✗ |
| ADAS / AFlow / GPTSwarm | ~ | ✓ | ✗ | ✗ | ~ | ✗ |
| SkillOpt | ✗ | ✗ | ✗ | ~ | ~ | ✗ |
| SICA | ✓ | ~ | ✗ | ✗ | ✗ | ✗ |
| DGM | ✓ | ✓ | ✗ | ~ | ~ | ✗ |
| HarnessX | ✓ | ~ | ✗ | ✓ | ~ | ✗ |
| DarwinX | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
定位结论:DarwinX 与先前工作的差异"不在于编辑什么,而在于候选如何被搜索、提升与保留"——它是第一个同时具备种群 archive、跨谱系合并、有界回退约束与噪声感知确认机制的自进化 agent 系统。
三、问题定义
3.1 从具体到抽象
具体问题:给定冻结权重的 LLM 和一组有 verifier 的任务,如何让 agent 变强?直觉做法是"让 agent 复盘失败、自己改自己"。论文的核心洞察是把问题重新抽象为进化论意义上的自然选择:
权重冻结后,Harness 是唯一可变量。与其让一条谱系"自我改进",不如维护一个 Harness 的种群,让更适应的变体在测量到的适应度下存活。
| 生物进化 | DarwinX |
|---|---|
| 基因型 | Harness(提示+技能+工具+控制流+源码) |
| 表现型 | agent 在任务上的行为 |
| 适应度 | benchmark verifier 的逐任务求解率 |
| 突变 | proposer 生成的 harness 编辑 |
| 自然选择 | preserve-and-extend 准入契约 |
| 种群基因库 | 树状 archive |
| 基因重组 | 跨谱系合并算子 |
3.2 形式化定义
给定:冻结基座模型 M、任务集 T(每个任务 t 有 verifier v_t)、初始 harness H₀。求:进化过程产出 H₁, H₂, … 使 benchmark 成绩持续提升。约束:① 准入约束——子代 c 被接纳当且仅当净增益 g(c) > 0 且回退 R(c) ≤ δ;② 适应度只能来自 benchmark 自带 verifier,无金标签、无人工挑选赢家;③ 只编辑 harness,不碰权重。
抽象的精妙之处:其一,把"改进"从动词(某次编辑让分数变高)变成名词(在种群中传播的选择压力),天然获得种群级视野和重组能力;其二,适应度来自 verifier 排除了人工挑选,“自然选择"是字面意义而非比喻——这正是论文名 DarwinX 的由来。
四、问题解法
4.1 适应度与 Preserve-and-Extend 契约(谁有资格成为祖先)
类比:像公司的晋升制度——“想升职,总体业绩必须为正,且不许有任何一条业务线跌超过 δ”。只看总分的晋升会让"做大一件事、搞砸另一件事"的人上位;这个契约把"不破坏"写进准入规则。
每个变体按逐任务求解率 p̂_t(avg@k,每任务跑 k 次取平均)评分。对子代 c 与父代 p:
| 量 | 定义 | 含义 |
|---|---|---|
| 逐任务变化 | Δ_t = p̂_t(c) − p̂_t(p) | 每个任务的成绩变化 |
| 净增益 | g(c) = Σ_t Δ_t | 总体改进量 |
| 有界回退 | R(c) = Σ_t(−Δ_t)_+ | 只把退步部分求和 |
| 谱系增益 | G(c) = G(p) + g(c) | 累计增益,用于父代选择 |
准入规则:g(c) > 0 且 R(c) ≤ δ——“扩展”(解新任务)而不破坏"保持”(已有任务回退有界)。之上还有两道保险:推理型 verifier agent 读试验证据返回 promote/revert;被提升的子代须通过 preservation probe(对谱系已知解集重采样确认)才能主导搜索。这就是"两速哲学":对尝试宽松、对信任严格——噪声下"看起来变好"和"真的变好"必须用不同证据标准分开。
4.2 分支进化(怎么产生变体)
每代从 archive 选父代,proposer(LLM)产出加性 harness 编辑——可改提示词、技能、工具、控制流乃至源码;“加性"指谱系不断积累能力而非推倒重来。父代选择以 (1−β) 概率利用累计增益 G 最高的节点、以 β 概率在更宽种群中探索;按累计 G 而非原始分排名,因为不同变体在不同任务子集上被筛选,原始分不可比。TB2.1 上并行分支针对五个能力簇:数值 ML、底层系统、生物/汇编、解析/文本工具、数据库任务。
4.3 树状 Archive 与跨谱系重组(与 DGM 拉开差距的核心)
类比:DGM 像"单传家族”,谱系链状;DarwinX 像植物园——每棵被评分过的树都保留为一等 archive 节点(快照+编辑增量+逐任务分数+试验证据+课程),并允许"杂交授粉"。按子代解集 S(c) 与父代解集 S(p) 的关系,变体分五类:
| 类型 | 定义 | 命运 |
|---|---|---|
| Improver | S(c) ⊋ S(p) | 可参与继承 |
| Neutral child | S(c) = S(p) | 可参与继承 |
| Stepping stone | S(c) ⊊ S(p) | 不继承,回馈课程 |
| Archived | 与父代互换部分解 | 不继承,回馈课程 |
| Specialist | 解出兄弟都解不出的任务 | 保留观察 |
合并算子:从共同祖先 H₀ 出发,H = H₀ ⊕ Δ,Δ = Δ_code ⊕ Δ_skill ⊕ Δ_prompt ⊕ Δ_tool。关键规则:子代被保留当且仅当 S(child) ⊇ ∪ᵢ S(vᵢ),即子代的胜利必须覆盖所有父代胜利的并集。合并可超过两个变体,同样受"准入契约 + avg@k 确认"双重检验。
4.4 三种学习信号(编辑的原料从哪来)
| 信号 | 来源 | 适用任务状态 |
|---|---|---|
| 失败驱动 ∇ | 总结失败轨迹,定位缺失能力 | 普通变异的默认信号 |
| 教师驱动 π* | 蒸馏参考求解器的成功轨迹 | “墙"任务(所有 rollout 都失败) |
| 自驱动 A | 对比 agent 自己 k 次采样的通过/失败 rollout | “方差带"任务(时对时错) |
三种信号按任务状态动态分区、构造性互补——proposer 永远拿到当前任务最有信息量的证据。所有信号最终都转为 harness 编辑,无一更新权重。
4.5 共享记忆(种群级的"病历本”)
失败模式分类器给每次试验打标(timeout-setup、wrong-output、tool-error),聚合主导主题进入种群共享记忆,同时供 proposer 与 verifier 读取。主导主题的注入促使搜索发明全局能力(如"setup 成本主导超时 → 构建高效 setup 能力”)而非逐任务补丁——把个体经验升华为种群知识。
五、评估指标与实验证据
5.1 评估设计:四层递进的"信号-测试分离度"
四个 benchmark 按"进化时看到的信号"与"最终测试"的分离度递增排列,层层逼近"进化的到底是通用能力还是 benchmark 补丁":
| RQ | Benchmark | 冻结基模 | 进化数据 | 报告数据 | 分离度 |
|---|---|---|---|---|---|
| RQ1 | Terminal-Bench 2.1 | GPT-5.5 | 89 个 verifier 任务 | 同 89 任务 | 同分布 |
| RQ2 | TerminalWorld | Opus 4.8 | 94 训练任务 | 41 个不相交 held-out | 任务不相交 |
| RQ3 | WebArena-Infinity | GPT-5.5 | 300 合成意图(LLM judge) | 1,260 真实任务(确定性 verifier) | 分布+奖励双重改变 |
| RQ4 | SWE-bench Verified | Opus 4.8 | 无(纯迁移) | 500 issue(官方测试) | 零适应跨 benchmark |
设计巧妙之处:如果进化只是"背题",RQ2 会崩(held-out 没见过)、RQ3 更会崩(连评分器都换了)、RQ4 会归零。四层递进构成对"泛化主张"的完整证伪链。
5.2 主指标结果
RQ1:Terminal-Bench 2.1(官方 avg@5):
| Agent | 模型/努力度 | avg@5 |
|---|---|---|
| Monet (DarwinX) | GPT-5.6 Sol / medium | 84.7 ±1.2 |
| Claude Code | Fable 5 / xhigh | 83.8 ±1.2 |
| Monet (DarwinX) | GPT-5.5 / high | 83.2 ±1.2 |
| Codex | GPT-5.5 / xhigh | 83.1 ±1.1 |
| OpenAI 原生 reference | GPT-5.6 Sol / medium | 81.8 |
| Terminus-2 | GPT-5.5 / xhigh | 78.0 ±1.2 |
| Monet (base) | GPT-5.5 / default | 75.5 ±3.5 |
同模型自比 75.5%→83.2%(+7.7);相对同基模中性 harness Terminus-2 的纯 harness 增益 +5.2;GPT-5.6 Sol 以更低努力度达 84.7%,超 Claude Code(83.8%)+0.9、超 OpenAI 原生 +2.9。计算量排除实验:6 个新解任务轮次翻倍(22 vs 11)、token 四倍;69 个两者皆解的任务计算几乎不动——增益来自"知道何时继续工作"的 harness,而非更大预算。
RQ2:TerminalWorld held-out(41 个不相交任务,单次 pass@1):
| Agent | 模型 | pass@1 |
|---|---|---|
| Monet (DarwinX) | Opus 4.8 | 68.3%(28/41) |
| Claude Code | Opus 4.8 | 65.9% |
| Monet (base) | Opus 4.8 | 61.0% |
| Terminus-2 | GPT-5.5 | 61.0% |
| Codex | GPT-5.5 | 51.2% |
匹配 Opus 对比 61.0%→68.3%(+7.3)。训练子集从 0.505 涨到 1.000 饱和,held-out 却只有 68.3%——代理拟合者不等于泛化者;而 4 个专家变体各解 24/25/26/27 个 held-out 任务,合并 harness 解 28 个,超过每一个单专家——archive 多样性吸收过拟合的直接证据。
RQ3:WebArena-Infinity(10 应用 1,260 个真实任务,audit-clean pass@1):Monet (base) 43.5 → Monet (DarwinX) 93.0(+49.5);GPT-5.5+BrowserUse 为 86.1(DarwinX +6.9)、Gemini 3 Flash+BrowserUse 69.3、Qwen 48.3、Kimi 43.3。增益覆盖全部 10 个应用,状态变更密集的应用最显著(Elation prescriptions +75.0、Gmail +73.3)。
轨迹质量审计(能力与合规是否同步):
| 指标 | Base | DarwinX | 变化 |
|---|---|---|---|
| Raw pass@1 | 53.0 | 94.4 | +41.4 pp |
| Audit-clean pass@1 | 43.5 | 93.0 | +49.5 pp |
| 确认无效轨迹 | 293 | 17 | −276 |
| Confirmed invalid 率 | 23.5% | 1.4% | −22.1 pp |
Base 的违规构成:evaluation-plane 违规、特权宿主违规、exploit/提权、原始状态篡改四类——前三类进化后完全消失。这说明进化的不是"钻 verifier 空子的技巧"(那会让 invalid 上升),而是合规的真实能力。
RQ4:SWE-bench Verified 零适应迁移:TB2.1 进化的 harness 原封不动跑全部 500 个 issue,官方 pass@1 84.2%(421/500),比 80.8% 的 fix-skill 参考 +3.4,全程无任何 SWE-V 反馈。
5.3 消融:到底进化出了什么
相对 base,进化谱系新增 7 个 harness 技能,全部属于同一族——验证/工件契约:contract-candidate(定稿前推导任务验收契约并据此检查解)、artifact-verification-loop(验证被评分工件并迭代"修复-复查")、tool-grounded-artifact(输出基于真实工具执行而非断言/模拟)、security-contract-repair(针对安全和契约检查修复解)等。
没有一个技能添加领域知识——每个技能都让 agent 定稿前建立并检查显式验收契约,或让输出落地于真实工具执行。增益落点印证:ML/科学计算 +14.8、数据/数据库 +13.8——恰是基模余量最大、契约验证能解锁脆弱多步工作之处;已强簇几乎不动且无簇回退超噪声。被解锁的难度是程序性的(长依赖安装、环境 setup、输出验证)而非知识型的。作者诚实标注:技能是共选而非独立随机化,归因是探索性的;archive、父代选择器、重组算子的内部贡献尚需受控分离(系统级主张)。
六、效果优势的根源解释
为什么 DarwinX 在结构上必然优于单谱系自编辑(SICA 式)和无合并 archive 进化(DGM 式)?三条因果链。
因果链一:准入契约 → 搜索空间约束改变 → 契约类技能必然胜出 → 脆弱簇大幅提升
方法差异:DGM/HarnessX 接受"总分变高"的变体(HarnessX 的亚阈值回退仍会积累);DarwinX 要求 g > 0 且 R ≤ δ。
机制变化:考虑两类候选编辑—— benchmark 补丁类(硬编码某任务的验收细节,提升该任务但可能在相似任务上失效)与 程序性能力类(定稿前推导验收契约并自查,提升一族任务且几乎不伤别的任务)。“只看总分"的准入下两者都能上位;R ≤ δ 的准入下, 类一旦引发其他任务回退就被拒,(b) 类成为唯一能稳定通过契约的编辑族。preservation probe 进一步要求"赢面在重验证中存活”,惩罚投机、奖励持久能力。
指标落点:消融显示 7 个技能全部是契约族;增益集中在脆弱簇(ML +14.8、DB +13.8);WAI 上 confirmed-invalid 率 23.5%→1.4%(投机被选择压力清除)。
反事实:去掉 R ≤ δ 只留 g > 0,就退化为 HarnessX 式——积累亚阈值回退、投机编辑无法系统性排除,即论文动机里的"跨任务干扰导致进化停滞"。
因果链二:树状 archive + 跨谱系重组 → 遗传多样性 → 过拟合吸收与互补聚合 → held-out 及合并优势
方法差异:DGM 链式单亲变异、互补谱系永不聚合;HarnessX 隔离谱系互不相通;DarwinX 保留全部变体为一等节点并提供合并算子。
机制变化:专家变体各自在不同任务子集上过拟合,解集"重叠但不同"。单谱系系统只能在"选哪个专家"里挑一个,必然丢弃其他专家的独有胜利;合并算子把多个专家的编辑增量拼进一个子代(覆盖并集即保留)——把不可比的选择题变成可叠加的填空题。
指标落点:TerminalWorld 上专家各解 24–27 题、合并解 28 题;TB2.1 上五能力簇的增益汇聚到一个 harness(83.2%)而非分散在五个专家里。
反事实:去掉合并算子(退化为 DGM),TerminalWorld 上限就是最佳专家的 27 题(65.9%),恰好输掉对 Claude Code 的领先。
因果链三:三信号统一接口 → 证据供给效率 → 各状态任务持续产出编辑 → 无平台期
方法差异:多数前序工作只用失败信号,而失败信号在"墙任务"上信息量极低——只知道"全错了",不知道"差在哪"。机制变化:教师信号为墙任务提供与参考解的差距,自采信号为方差带任务提供成功/失败 rollout 的 diff——proposer 永远拿到最有信息量的证据,证据密度决定编辑质量上限。指标落点:解释了 SICA 式平台期与 DarwinX 无平台期的差异;但需如实说明——三信号未做独立消融,此链证据强度低于前两条,属"合理机制推断 + 系统级验证"。
汇总
| 方法差异 | 机制变化 | 指标提升 |
|---|---|---|
| R ≤ δ 准入 + preservation probe | 投机编辑被排除,契约技能成唯一稳定通道 | 技能全为契约族;ML +14.8、DB +13.8;invalid 23.5%→1.4% |
| 树状 archive + 并集覆盖合并 | 互补专家能力可叠加,过拟合被多样性吸收 | 合并 28 题 > 最佳专家 27 题;TB2.1 83.2% |
| 三信号统一接口 | 墙/方差带任务持续供给高信息量证据 | 无平台期(推断性) |
| 契约技能 benchmark 通用 | 零适应跨 benchmark 可用 | SWE-V 84.2%(+3.4,suggestive) |
一句话根源:前序方法的准入规则允许"局部赢、全局伤"的编辑存活,谱系结构又无法聚合互补能力;DarwinX 通过改变选择压力的方向(契约只放行可泛化的程序性能力)与种群结构(archive+合并),使"变强"从碰运气的局部修补,变成结构上必然偏向通用能力的累积过程。
七、必要知识反推
假设一个毫无背景的人要做这项工作,最少必须掌握什么?
领域知识层
- Harness 解剖学:agent 能力 = 权重 × harness,harness 可细分为提示/工具/技能/控制流/源码五个可编辑面——不理解就找不到"冻结后还能动什么"。
- Benchmark verifier 生态:各 benchmark 的 verifier 机制、噪声水平(SWE-bench 2.2–6.0 分波动)、held-out 划分——不理解就无法设计"适应度来自 verifier"的选择。
- Reward hacking 形态学:evaluation-plane 违规、特权宿主访问、状态篡改等作弊形态——不理解就无法设计审计并解读"invalid 下降"。
方法论知识层
- 进化计算:种群、archive、重组算子、质量多样性搜索——树状 archive 与合并算子直接继承这些机制。
- 噪声评估下的选择理论:老虎机/竞速、Hoeffding races、Thompson 采样——avg@k 两速确认是这些思想的再设计。
- 前序系统的病历:SICA 的平台期、DGM 的单亲无合并、HarnessX 的隔离与回退积累——三大失败模式正是三大组件的靶心。
- Gödel machine 谱系:知道这条线的历史边界,才能把 DarwinX 定位为"种群选择"而非又一个自指系统。
工程知识层
- 大规模评测基础设施:agent 超时与基础设施故障的分离处理、错误试验记零分、avg@k 预算控制——否则噪声淹没信号。
- LLM-as-proposer/verifier 工程:加性编辑接口、失败模式分类器、共享记忆聚合逻辑。
知识融合的关键节点
- 进化论 × 评测工程:纯粹的自然选择会被噪声欺骗,纯粹的统计检验没有方向性——preserve-and-extend 契约是两者的杂交产物。
- QD 搜索 × 失败诊断:archive 五类变体分类把质量多样性机制与"哪些变体值得保留"的任务级洞察融合。
- 评测设计 × 泛化主张:四层递进的信号-测试分离度,把哲学问题(“进化的是能力还是补丁?")转化为四个可测量的实证问题。
八、论文中可以提取的通用性灵感
灵感一:有界回退优于无界重写(机制类)
核心思想:接受变更的准则不应是"总体变好”,而是"总体变好且任何局部都没坏超过阈值"。论文证据:R ≤ δ 契约使进化偏向契约技能、排除投机补丁;HarnessX 式无界准入积累亚阈值回退。推广场景:合并 PR 的标准从"总体收益为正"改为"无模块回退超阈值";模型量化接受方案时约束任一子任务回退;RLHF 用 per-dimension 有界惩罚替代单一总分。
灵感二:把单谱系优化重构为种群选择(范式迁移类)
核心思想:改进链陷入平台期时,问题往往不在步长而在结构——把"改进"从单体属性变成种群的选择压力,可获得重组与多样性收益。论文证据:SICA 单谱系平台期 vs DarwinX 合并 harness(28 题)超过任一专家(24–27 题)。推广场景:产品迭代维护变体池做重组而非单线迭代;科研资助 portfolio 而非单一路线;编译器保留多个优化 pass 组合的档案供重组。
灵感三:让证据供给匹配任务状态(信号利用类)
核心思想:同一干预在不同状态下可用的证据类型不同,应为每种状态匹配信息量最大的证据源。论文证据:墙任务用教师信号、方差带任务用自采对比、常态用失败驱动。推广场景:教育分层——零基础学生给示范,不稳定学生给对错对照;故障排查——不可复现 bug 找参考实现 diff,间歇性 bug 做成功/失败日志对比;销售复盘——丢单客户用竞品分析,输赢各半客户用自对比。
灵感四:评估即训练——评测算力转化为持久资产(范式迁移类)
核心思想:把评测从"事后打分"重构为"选择压力",评测消耗的算力就沉淀为可迁移、可复用的能力资产。论文证据:全文口号 “harness selection turns evaluation compute into durable capability”;TB2.1 进化资产零适应迁移到 SWE-V 达 84.2%。推广场景:CI/CD 把测试失败的修复经验沉淀为团队规则库;客服把工单质检结果转化为 SOP 进化信号;竞赛训练把模拟赛成绩作为训练计划的适应度。其姊妹发现同样值得记住:WAI 上审计后增益(+49.5)反而大于原始增益(+41.4)、确认无效轨迹 293→17——能力提升与合规提升可以在同一选择压力下同步发生,前提是准入规则惩罚投机(赢面须在重验证中存活)。
附录:进化的技能资产示例
WAI 浏览器 harness 新增 4 个面向契约的浏览器技能,行为改变为:卡住时不再放弃应用界面,而是推导验收契约、检查客户端可见状态、使用应用自有的语义操作、验证渲染状态与持久化——与 TB2.1 谱系的"验证/工件契约"技能族同源,印证跨 benchmark 的能力通用性。
一句话收束:冻结的模型不等于固定的 agent——harness 是仍可移动的表面,对它做选择,能把评估算力转化为持久能力。