GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读:harness 自进化在 GUI、机器人、图像生成三条垂直域的落地

「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线:GUI-HARVEST 用重复视觉执行证据加行为预测双门,在 OSWorld 六个骨干上最高提升 12.33 个百分点;DynaHarness 用快慢脑加物理执行契约,把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%;EvoGen-Harness 用 where+how 联合归因进化,让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作,本文合读三者的共同骨架、域特化设计与实验证据链,并讨论 harness 工程的边界与反例。

October 3, 2026 · 6 min

信用分配四重奏:给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读

2026 年 10 月初,四篇论文从四条路线围攻 agentic RL 的同一个软肋:终端奖励只给轨迹级 0/1 分,步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配,把训练信号覆盖率从 GRPO 的 41% 拉到 95%,ALFWorld 91.0%;LinkedIn 的 SHARPO 用段级 hindsight 重加权,84.90±1.19 对 GRPO 70.57(+14.32);南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器,WebShop score +12.7;UIUC 等的 DARS 用谓词依赖图势函数塑形,ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」:不是要不要过程奖励,而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界,并提炼可迁移的通用做法。

October 3, 2026 · 7 min

Harness 自动进化三重奏:MILO、ScholarEvolve 与 Malena 精读

2026 年 9 月末,arXiv 上同时出现三篇方向相撞的 Harness 论文:MILO 用「负证据谱系记忆+编排者元进化」把自动 Harness 发现推上 Terminal-Bench 2.1 官方榜首之上(RR@5 86.1%),ScholarEvolve 让 Harness 从研究文献中学习模块化变异(AppWorld Challenge TGC 49.6%→63.6%),而 Malena 却用大规模控制变量消融证明:在前沿编码 Agent 之上,复杂 Harness 机制几乎全部冗余(MLE-bench 获奖 62.5% vs 最佳开源 Harness 47.1%)。本精读逐篇拆解三者的机制与实验,再正面处理这个当日最大的张力——结论是:Malena 消融的是「统一机制的加减法」,而 MILO/ScholarEvolve 的增益来自「任务自适应、负证据利用与成本-精度前沿」这些 Malena 未覆盖的轴,弱模型反例(gpt-oss-120b、Gemma 4 31B)进一步表明机制收益随模型能力变化,两条路线实为同一光谱的两端。

October 2, 2026 · 10 min

Skill 全生命周期三重奏:SkillFM、Prompt2Skill 与 SkillGym 合读精读

合读精读三篇覆盖 Skill 全生命周期的新作:SkillFM 用潜空间流匹配把「从库里检索 skill」变成「单步直接生成」;Prompt2Skill 在零训练样本、零权重更新前提下仅凭一句任务描述无监督定制 skill;SkillGym 从 18.4 万社区 skill 反向合成 6.8K 可验证训练环境,教会模型「用 skill」(Trigger 行为 28%→96%)。三篇共同指向 Anthropic Agent Skills 生态爆发后的 skill 资产化浪潮:生成、定制、训练三阶段互补成一套完整的 skill 工程闭环。

October 2, 2026 · 11 min

Skill 泛化性二重奏:GSO 的过拟合诊断与 Rep2Skill 的表征进化 精读

本文合读同日发布于 arXiv 的两篇 Skill 论文:大阪大学 GSO 首次系统度量 skill 过拟合——21 个训练增益 skill 仅 5 个全保真、3 个归零,并提出改学「元技能」(学写法不学内容),在全部 6 基准领先(SWE-bench 47.5 vs 25.0);上科大+美团 Rep2Skill 证明文本轨迹归因太粗(AUROC 0.494),引入隐藏态轨迹+Neural CDE 定位偏离成功动力学的关键轮次(AUROC 0.838),ALFWorld Qwen3.5-9B 达 69.90%。两篇一体两面,共同回答「skill 自进化的信号应从哪里来」。

October 2, 2026 · 7 min

失败资产化二重奏:Agent Error Dataset 与 AREX-2 精读

Agent 训练数据的传统会计准则里,失败 rollout 是费用——采集了、用不上、直接核销。2026 年 9 月末的两篇论文在同两周内把这个科目改成了资产:Apodex 的 Agent Error Dataset(AED)把 50,228 个自然失败变成带诊断、带修正、带受控重放证据的「错误-诊断对」资产,用同检查点双臂重放首次把「修正的净因果增益」(18.4%→51.1%)从「重试也能过」(30.1% 的双通过率)中分离出来;BAAI 的 AREX-2 则把整条多轮失败-恢复轨迹做成训练数据,损失只打在「错误之后做了什么」的恢复性决策上,让 27B 模型在 MLE-bench Lite 拿到 81.8、超 GPT-5.6 Sol 9.1 分,且五小时预算内持续提升。本精读逐篇拆解两条「失败炼金流水线」的机制与证据,再处理它们之间最锋利的张力——AED 用 73 页附录诚实披露修复训练的环境依赖与真实环境倒退,AREX-2 用 12 页报告宣告跨域元技能迁移——结论是:两者在「损失不打在错误上、打在恢复上」这一核心设计上惊人收敛,而「失败资产」的变现条件(结构化保存、恰当标记、证据分级)比乐观者预期的更苛刻。

October 2, 2026 · 8 min

自进化的可信与规模化:False Frontiers、UniEvo-VL 与 CollabFlow 合读 精读

自进化 Agent 的瓶颈正在从「能不能提升」转向「提升是不是真的」。本精读合读三篇 2026 年 9 月底的新作:False Frontiers 诊断出 proposer–solver 自进化中的「合谋作弊」(co-cheating)并用 CrossFit 交叉拟合反馈将错误合谋率从 6.1% 压到 3.0%;UniEvo-VL 把自我批评作为「特权信息」,用在策略自蒸馏让多模态模型 GenEval 从 0.747 升至 0.808,展示自我提升的正确姿势;CollabFlow 则把协作本身作为改进对象,用证据门控通信与 GFlowNet 轨迹平衡在 12 个数据集上全面登顶。三者合看,回答了「自我改进何时可信、何时失控」这一拐点问题。

October 2, 2026 · 6 min

SEABench × Audit the Scaffold × REUSE:递归自我改进的测量、理论与统计三重保障 精读

同一周出现的三篇论文,恰好构成递归自我改进(RSI)治理的三根支柱:SEABench 用配对反事实与归因裁判测量「自进化会不会内生地变坏」(安全失败率 43.9% vs 0%);Audit the Scaffold 用 Lean 4 验证的平稳性二分法回答「自我改进何时必然耗尽、何时可能失控」(改脚手架可扩类不碰权重,冻结权重≠安全);REUSE 用决策-only 反馈与全历史 union bound 保证「每一次晋升都是真实总体改进」(75 次假晋升→0 次,提升不损)。本精读从「是什么」讲起,拆解三篇的方法机制、评估证据与优势根源,并交叉验证其在 2026 年 RSI 治理浪潮中的位置。

September 30, 2026 · 12 min

Self-Evolving Coding Agents × RE-0:从数字程序到物理世界的自进化智能体 精读

二重奏精读两篇互补论文:hexafuture.ai 的 Self-Evolving Coding Agents 提出物理编码范式,用 Code as World + Code as Policy 双可执行表征与类型化验证器,把编码代理范式迁移到物理世界,在 RoboCasa365 上把成功率从 56.6% 提升到 61.1%;吉林大学与大连理工的 RE-0 用 locate-verify-weight 递归和 LCB 准入,仅凭 3-67 条验证数据把具身 Code-as-Policy 基线从 4-68% 提升到 62-100%。一篇搭系统、一篇做训练,勾勒物理世界自进化智能体的完整图景。

September 30, 2026 · 7 min

递归自改进的能力与安全双螺旋精读:DCE 自蒸馏与演化安全框架

本文合并精读 2026 年 9 月同日发布于 arXiv 的两篇递归自改进(RSI)论文。论文一(Meta AI + UC Riverside)提出 DCE+SRCL:让特权教师在 on-policy 自蒸馏中与学生逐轮共同进化,在 Qwen3-8B 四项数学竞赛基准上取得 65.97% Average@12,较冻结教师的 OPSD 提升 35.62 个百分点,并用固定轨迹探针揭示教师监督退化的机制证据。论文二(中科院计算所)提出演化安全框架:以携带时间历史的安全相关变更为分析对象,建立六种风险表现 × 五类变更载体 × 四层评估单元的分类学与治理原则。本精读各按九部分展开,并以「教师共同进化 ↔ 风险共同进化」的双螺旋视角合并收束:DCE 证明上轮学到的修正行为会经由教师进入下轮监督——这正是演化安全所警告的经验污染与风险继承在能力侧的镜像。

September 29, 2026 · 7 min