LongWoF-Bench: Evaluating EvoMap Genes 精读

论文链接:arXiv:2608.23200 数据集:EvoMapAI/LongWoF-Bench;💻 Evolver 引擎 发表时间:2026年8月 机构:Infinite Evolution Lab, EvoMap(企业)+ 清华大学(Haoyang Zhang、Junjie Wang 为通讯/项目负责人)——企业实验室挂靠高校的产学研合作:EvoMap 出 Evolver 执行引擎与 Gene 体系,清华负责基准设计与统计检验 领域标签:cs.AI / cs.CL(Agent 记忆与经验复用)

一、论文背景

Agent 的"经验"问题是什么? 大模型 Agent 每次会话都是一张白纸:这个任务上犯过的错、试出来的成功路径,下次全部清零。业界给出的解法是把经验"资产化"——写成可复用的文档。两种主流形态:Skill(技能文档),人工或半自动总结的"操作手册"(Anthropic 的 Agent Skills 是代表,一篇 SKILL.md 告诉 Agent 怎么做某类事);Gene(经验基因),EvoMap 提出的概念——从 Agent 自己的执行轨迹中蒸馏的"成功策略+前置检查+边界条件+失败修正"结构化经验。

核心争议:这两种形态哪种真正有效?更本质地——经验复用的有效性到底来自哪里:是"有份文档总比没有强",还是来自经验被如何生成?这个问题在 2026 年尤为关键:Agent 技能生态爆发(SkillsBench 已建立技能评测标准),但"静态文档 vs 执行经验"从未被干净对照过。

为什么现有评测回答不了? 缺一个满足三个条件的基准:任务严格可验证(不能靠 LLM judge 模糊打分,否则经验的价值与 judge 的偏好混在一起);任务长流程(短任务里经验没有发挥空间);同任务跨模型(同一个经验给不同模型用,才能区分"经验内容有效"与"模型恰好擅长")。

二、论文定位和关联工作

  • SkillsBench(2026.02):首个技能评测基准,确立"配对评测"(有无技能对照)标准,发现技能提升显著但不一致——LongWoF-Bench 直接继承其配对思想,但把对照三态化(无上下文/静态 Skill/执行 Gene)并引入可验证私有验证器。
  • Voyager / ExpeL / Agent Workflow Memory:经验积累系统的先驱(技能库/反思洞察/工作流记忆),但都在各自环境内自评,无统一严格基准。
  • 同日相关:Signal or Noise(百度)证明 WebDev 场景 Skill 注入平均负收益;Repo2Skill-Evo(字节)证明技能会静默失效。三篇合起来给"技能资产化"泼了三盆冷水又指出路:经验要"验证器确认+随版本维护"才有效——LongWoF-Bench 正是"验证器确认"这条路的正面证据。

三、问题定义

具体场景:Agent 要完成代码生成、环境合成、数学推理、规则遵循四类长工作流任务,可以携带一种辅助指导(无/静态 Skill/执行 Gene)。

抽象问题:剥离任务规格、运行时与验证器的差异后,经验的"生成方式"(静态撰写 vs 执行-验证-精炼)对其跨模型复用价值的影响是多少? 进一步:这种价值的来源是表示形式(结构化程度)还是信息内容(失败与修正的判别性信息)?

四、问题解法

4.1 基准构建:778 个可验证任务

四类任务(代码生成 341/环境合成 127/数学推理 151/规则遵循 159),每个任务 T=(S,E,Y,V) 带私有验证器 V:可执行测试、隐藏检查或归一化精确匹配,要求全部必要条件满足才算通过——机器可验证消除了 judge 偏好污染。

4.2 Gene 的生成:执行-验证-精炼

生产模型(Claude Opus)先在任务上执行;失败后携带脱敏验证器反馈迭代修订直至通过;通过后把轨迹中的"执行关键信息"蒸馏为结构化 Gene(成功策略/前置检查/边界条件/失败修正)。关键:Gene 的每一条都对应一次"真的失败过然后被修正"的经历。

4.3 严格三条件对照

同一任务规格、同一运行时、同一验证器,唯一变量是辅助指导:No Context / Skill(同领域静态文档)/ Gene。消费模型 7 个(Opus、Gemini Pro/Flash、Qwen3.5、MiniMax M3、Qwen3-Coder、Sonnet),跨四个模型家族。

4.4 溯源对照实验(本文最巧妙的设计)

额外构造 reference-distilled Gene:不经过执行验证、直接从参考答案蒸馏的 Gene——表示形式与执行 Gene 完全相同,只缺"验证器确认"环节。这隔离了"表示形式"与"生成方式"两个混淆变量。

五、评估指标与实验证据

主实验(252 个 Opus-evolved 任务 × 7 消费模型,严格通过率):

条件平均通过率
No Context41.0%
Skill51.2%
Gene62.9%

Gene vs Skill 增益全部显著:Opus +15.5pp(63.9→79.4%,McNemar p<0.001)、Qwen3.5 MoE +13.5、MiniMax M3 +13.1、Qwen3-Coder +11.5、Sonnet +10.7、Gemini Pro +9.1、Gemini Flash-Lite +8.7——跨四家族一致为正。

决定性的溯源反转:526 个 reference-distilled 任务上,Gene 反而落后 Skill 3.3-11.3pp——同一种表示形式,只因为没经过验证器确认,效果从 +8.7~15.5 翻转为负。这是全文最重要的对照。

生产者效应:180 个共同任务上,Opus-authored Gene 比 Gemini-authored 高 4.4-11.7pp——经验的下游价值依赖生产者的执行能力。

效率:Gene 一次复用通过 200/252 任务(Skill 161)、token -9.9%;vs 现场多轮发现(404 次调用)省 45.8%。

分域模式:agent-environment 域 Gene 增益最大(+15.6~29.7pp);数学域仅 Opus 大涨(+40pp)其余持平——数学依赖消费模型自身推理能力,经验的边际价值低。增益分布与"任务依赖领域约定 vs 依赖推理能力"的结构吻合。

六、效果优势的根源解释

为什么执行 Gene 赢静态 Skill? 表面解释(“Gene 更结构化”)被溯源实验直接否定——reference-distilled Gene 同样结构化却输给 Skill。真正的根源是信息内容的判别性:

  • 执行 Gene 携带"哪些看似合理的选择会失败、哪些修正真正改变验证结果"的反事实信息——论文案例:钻孔化验的分段约定(看似任意的约定只有试错后才知道)、急救调度的优先级与等值边界(文档写不清的 corner case)。这些信息只存在于"失败→验证器反馈→修正"的循环中。
  • 静态 Skill(与 reference-distilled Gene)只有"应该怎么做"的正面陈述,没有"不这样做会怎样"的负面证据——而长工作流的失败恰恰埋在这些负面地带。

跨模型迁移成立的原因:Gene 传递的是任务特定的语义约定(分段规则、边界条件)而非模型私有的推理格式——四个家族都受益证明其内容普遍性。反过来,数学域增益小(除 Opus)与"约定类信息少、推理类需求高"一致。

因果链:执行-验证-精炼生成 → Gene 含判别性负面证据 → 消费模型避开"看似合理的错误路径" → 严格验证下通过率 +8.7~15.5pp;去掉验证环节(reference-distilled)→ 只剩正面陈述 → 落后 Skill。

七、必要知识反推

  • 领域知识层:四类任务域的验证器设计(可执行测试/隐藏检查/精确匹配的适用边界)——验证器不严,一切对照失效;脱敏技术(验证器反馈给生产模型时不得泄漏验证细节,否则 Gene 变成作弊手册)。
  • 方法论知识层:配对实验设计与 McNemar 检验(同任务跨条件的统计功效);溯源对照实验设计(同表示、异生成)——这是全文方法论上最值得学的一手;跨模型泛化评估。
  • 工程知识层:执行轨迹的结构化蒸馏(哪些信息值得进 Gene:策略/前置/边界/修正四类);778 任务的运行时统一(同规格同验证器的工程一致性)。

知识融合的关键节点:把"数据质量研究中的溯源意识"(数据怎么来的决定其价值)与"Agent 经验复用"结合——多数经验复用工作只关心"存什么格式",本文证明"怎么生成"才是第一变量。

八、论文中可以提取的通用性灵感

  1. 经验的价值在负面证据,不在正面指导(机制类)

    • 证据:执行验证 Gene +8.715.5pp,同格式未验证 Gene 反而 -3.3-11.3pp;案例中关键信息全是"不这样做会失败"。
    • 推广:组织知识管理——事故复盘(含失败细节)比最佳实践手册更有培训价值;个人学习——错题本(含错误原因)优于知识点笔记;文档写作——“常见坑"章节是文档中最有价值的部分。
  2. 对照组要与处理组同构,否则归因失效(方法论类)

    • 证据:reference-distilled Gene 的巧妙设计(同表示、只缺验证)使"表示形式 vs 生成方式"两个混淆变量被干净分离。
    • 推广:任何 A/B 实验(产品改版归因、医疗疗效、政策评估)都应问"对照组与处理组除了目标变量外还差什么”——最常见的错误是把"格式差异"误归因为"内容差异"。
  3. 先问依赖关系,再决定复用什么(现象类)

    • 证据:约定密集型任务(环境合成/规则遵循)经验增益最大,推理密集型任务(数学)增益趋零。
    • 推广:知识复用前先分类——这个领域的成败主要取决于"知道约定"还是"能推理"?前者值得建经验库(法务合规、运维手册),后者要投资能力本身(数学、算法),抄经验册没用。
  4. 资产的下游价值依赖生产者质量(现象类)

    • 证据:Opus-authored Gene 比 Gemini-authored 高 4.4-11.7pp。
    • 推广:企业知识库的"谁写的"比"写了多少"重要——资深工程师的一条踩坑记录可能胜过新人十篇总结;同样提示:用弱模型批量生成"经验"的自动化方案存在质量天花板。