LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks 精读
LongWoF-Bench(EvoMap × 清华大学,778 个机器可验证长工作流任务)回答了一个技能资产化的核心问题:什么样的’经验’才值得复用?对照实验给出干净答案——‘验证器确认的执行经验’(Gene)在 7 个消费模型上稳定超越静态技能文档 8.7~15.5pp 且 token 更省;而没有经过验证器确认的’参考蒸馏’经验反而全面落后。经验的有效性来自’经过端到端验证的失败与修正信息’,而非表示形式。