Harness 自动进化三重奏:MILO、ScholarEvolve 与 Malena 精读

2026 年 9 月末,arXiv 上同时出现三篇方向相撞的 Harness 论文:MILO 用「负证据谱系记忆+编排者元进化」把自动 Harness 发现推上 Terminal-Bench 2.1 官方榜首之上(RR@5 86.1%),ScholarEvolve 让 Harness 从研究文献中学习模块化变异(AppWorld Challenge TGC 49.6%→63.6%),而 Malena 却用大规模控制变量消融证明:在前沿编码 Agent 之上,复杂 Harness 机制几乎全部冗余(MLE-bench 获奖 62.5% vs 最佳开源 Harness 47.1%)。本精读逐篇拆解三者的机制与实验,再正面处理这个当日最大的张力——结论是:Malena 消融的是「统一机制的加减法」,而 MILO/ScholarEvolve 的增益来自「任务自适应、负证据利用与成本-精度前沿」这些 Malena 未覆盖的轴,弱模型反例(gpt-oss-120b、Gemma 4 31B)进一步表明机制收益随模型能力变化,两条路线实为同一光谱的两端。

October 2, 2026 · 10 min

Skill 全生命周期三重奏:SkillFM、Prompt2Skill 与 SkillGym 合读精读

合读精读三篇覆盖 Skill 全生命周期的新作:SkillFM 用潜空间流匹配把「从库里检索 skill」变成「单步直接生成」;Prompt2Skill 在零训练样本、零权重更新前提下仅凭一句任务描述无监督定制 skill;SkillGym 从 18.4 万社区 skill 反向合成 6.8K 可验证训练环境,教会模型「用 skill」(Trigger 行为 28%→96%)。三篇共同指向 Anthropic Agent Skills 生态爆发后的 skill 资产化浪潮:生成、定制、训练三阶段互补成一套完整的 skill 工程闭环。

October 2, 2026 · 11 min

Skill 泛化性二重奏:GSO 的过拟合诊断与 Rep2Skill 的表征进化 精读

本文合读同日发布于 arXiv 的两篇 Skill 论文:大阪大学 GSO 首次系统度量 skill 过拟合——21 个训练增益 skill 仅 5 个全保真、3 个归零,并提出改学「元技能」(学写法不学内容),在全部 6 基准领先(SWE-bench 47.5 vs 25.0);上科大+美团 Rep2Skill 证明文本轨迹归因太粗(AUROC 0.494),引入隐藏态轨迹+Neural CDE 定位偏离成功动力学的关键轮次(AUROC 0.838),ALFWorld Qwen3.5-9B 达 69.90%。两篇一体两面,共同回答「skill 自进化的信号应从哪里来」。

October 2, 2026 · 7 min

失败资产化二重奏:Agent Error Dataset 与 AREX-2 精读

Agent 训练数据的传统会计准则里,失败 rollout 是费用——采集了、用不上、直接核销。2026 年 9 月末的两篇论文在同两周内把这个科目改成了资产:Apodex 的 Agent Error Dataset(AED)把 50,228 个自然失败变成带诊断、带修正、带受控重放证据的「错误-诊断对」资产,用同检查点双臂重放首次把「修正的净因果增益」(18.4%→51.1%)从「重试也能过」(30.1% 的双通过率)中分离出来;BAAI 的 AREX-2 则把整条多轮失败-恢复轨迹做成训练数据,损失只打在「错误之后做了什么」的恢复性决策上,让 27B 模型在 MLE-bench Lite 拿到 81.8、超 GPT-5.6 Sol 9.1 分,且五小时预算内持续提升。本精读逐篇拆解两条「失败炼金流水线」的机制与证据,再处理它们之间最锋利的张力——AED 用 73 页附录诚实披露修复训练的环境依赖与真实环境倒退,AREX-2 用 12 页报告宣告跨域元技能迁移——结论是:两者在「损失不打在错误上、打在恢复上」这一核心设计上惊人收敛,而「失败资产」的变现条件(结构化保存、恰当标记、证据分级)比乐观者预期的更苛刻。

October 2, 2026 · 8 min

编码 Agent 的安全边界与协作假象:Approval Laundering 与 OpenCollab 合读 精读

本文合读 2026 年 9 月底同期出现的两篇编码 Agent 基础设施论文:复旦单作者工作 Approval Laundering 证明「人批准的动作 ≠ 实际执行的动作」,用六轴分类学系统化批准-执行绑定漏洞(Scope/Temporal/PATH 替换 BGR=1.0),并以七字段 HMAC Approval Token 部分修复;上海交大牵头的七机构工作 OpenCollab 证明「声明的协作 ≠ 发生的协作」,用 Adherence 六轴审计与 CACE 因果归因把多智能体增益争议变成可测量问题,并以双 Coder 工作流在 SWE-bench Pro 拿下 64.25% SOTA。两篇从安全与效能两个方向拆掉 Harness 的同一类隐式信任假设:把 Agent 系统的隐式假设变成可测量、可审计的对象。

October 2, 2026 · 9 min

编码 Agent 训练三条线:token 效率、自验证与安全 精读

本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文:HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来(SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token);SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」,再用学生条件化蒸馏修复(PASS@1 +9.7~16.9pp 且 OOD 不掉点);SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为,再用 Security Suite SFT + rl/hg 双路后训练补齐(unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1)。三篇论文共享同一方法论:先归因行为缺口,再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。

October 2, 2026 · 9 min

自进化的可信与规模化:False Frontiers、UniEvo-VL 与 CollabFlow 合读 精读

自进化 Agent 的瓶颈正在从「能不能提升」转向「提升是不是真的」。本精读合读三篇 2026 年 9 月底的新作:False Frontiers 诊断出 proposer–solver 自进化中的「合谋作弊」(co-cheating)并用 CrossFit 交叉拟合反馈将错误合谋率从 6.1% 压到 3.0%;UniEvo-VL 把自我批评作为「特权信息」,用在策略自蒸馏让多模态模型 GenEval 从 0.747 升至 0.808,展示自我提升的正确姿势;CollabFlow 则把协作本身作为改进对象,用证据门控通信与 GFlowNet 轨迹平衡在 12 个数据集上全面登顶。三者合看,回答了「自我改进何时可信、何时失控」这一拐点问题。

October 2, 2026 · 6 min

CAMG × Comet-9B:文件即记忆与程序状态推理的 Agent 训练新范式 精读

本篇精读两篇 2026 年 9 月的代码 Agent 训练论文:京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外(surprisal 6.371 vs 0.252 nats/token),转而用纯任务奖励让 shell 文件操作自发生长为记忆,4B 模型追平 35B;UCSB 与微软合作的 Comet-9B 不直接训练写补丁,而是训练「程序状态推理」(bug 何时触发、错误如何传播),反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论:不直接优化目标行为,而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开,并用外部文献交叉验证两大机制。

September 30, 2026 · 7 min

CoDeL × ReproBench:智能体安全的攻防共进化与漏洞复现评估 精读

本精读合读两篇智能体安全新工作:北航 CoDeL 将间接提示注入防御形式化为攻防共进化训练,首创「攻击潜伏期」可度量信号,在 AgentDojo 上将攻击成功率从 0.364 压到 0.042(−88.5%)同时受攻效用提升 38%;中科院软件所 ReproBench 则把 LLM 漏洞复现评估推入 pre-environment 设定,用真目标门控暴露出 45.3% 的「仿真替代」失败模式。一篇教智能体抵御攻击、一篇测智能体发起攻击的能力,恰构成安全能力的攻守双向标尺。

September 30, 2026 · 3 min

CodeSkill × NanoHarness:技能抽象与 Harness 效应——被低估的智能体性能杠杆 精读

本精读合并解读两篇从「模型权重之外」挖掘编码智能体性能的论文:清华+华为诺亚+上交的 CodeSkill 把长程 RL 从 token 级提升到技能级——teacher 蒸馏三级文本技能(目标/执行/控制),分层 VAE + Gumbel-Softmax 执行反馈门控边界把离散技能映射为连续隐变量 zH/zM/zL,以软提示前缀注入冻结 LLM(LoRA),PPO 在隐空间优化;SWE-bench Verified 76.2、EvalPlus 99.2 开源第一,交互步数 12.3→6.8(−45%),去掉 VAE 直接用文本技能+RL 则 BigCodeBench 从 94.8 掉到 88.4。南京理工+TUM+南京大学的 NanoHarness 首次把 harness(模型外基础设施)作为一等研究对象做组件级受控分解:固定模型下 harness 差 19.4pp vs 模型差 22.8pp;在 mini-SWE-agent 上增量加五组件,工具注册表 +4.57pp、任务特定子代理 +5.91pp,而上下文压缩 −4.86pp——机制是结构化工具把无序 shell 探索变针对性调用(jqlang 案例 133 次探测→43 次、通过率 24.68%→68.17%)。二者共同指向:技能结构与 harness 设计是被系统低估的性能杠杆。

September 30, 2026 · 6 min