SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback 精读

深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文。核心论断:技能自进化的瓶颈不在编辑能力也不在迭代次数,而在评估反馈能否持续供给可信的进化梯度。框架用两根支柱支撑这一命题——把多轮用户模拟从评估终点反转为反馈生成器(意图状态机、双侧正交评估、集体归因),再用独立治理层主动修复事实退化与结构膨胀(双锚点硬约束、图结构诊断软约束)。在腾讯云 6 类云服务、9 个生产 Skill、2000 张升级工单上,TSR 从 30.0 提升到 81.8,较单轮 QA 进化高 15.4 个点,膨胀率仅 2.8%,并已部署于生产环境。

August 17, 2026 · 4 min

DIVE: 多样性驱动的冻结模型技能进化 精读

深度精读佐治亚理工与 Cisco Research 合作的 DIVE 论文——让只能通过 API 访问的冻结大模型,把任务经验进化成可持续复用的自然语言技能。从三大挑战(自修订噪声、经验超上下文、进化路径依赖)出发,拆解其核心机制:多种群独立进化维持假设多样性、异构算子组合 + UCB 自适应分配进化预算、算子本身也能进化、验证集上联合选择互补技能集。GPT-5-nano 借此平均 81.5 分反超 GPT-5 + ICL 且推理成本降低 42.5%,小模型逆袭大模型的路径首次如此清晰。

August 16, 2026 · 2 min

ERSkill: 检索技能与路由器共进化 精读

Agent 记忆系统的进化大多发生在“写入侧”——怎么抽取、压缩、组织记忆。深圳国际工业与应用数学中心等机构的 ERSkill 把目光转向被忽视的“读取侧”:检索机制本身。它把检索行为表示为由固定原语(实体搜索/BM25/稠密检索 + 三种扩展 + LLM 处理)组合成的可执行技能,用训练好的 router 按查询的信息需求派发技能;进化时用经验 trie 记录所有探索过的原语路径以避免重复提议,用 Pareto 式双前沿把“能力探索”与“router 面向的部署”解耦。三大记忆基准上整体平均提升 31.3%(Qwen3-Next-80B-A3B 骨干),LongMemEval 零训练迁移仍居首。本精读逐部分拆解其机制,并建立“查询异构性→技能化→证据密集型任务受益”的因果链。

August 16, 2026 · 4 min

SkillEvo: 多轮交互反馈的自更新进化梯度 精读

深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文——把多轮用户模拟从评估终点反转为反馈生成器,让 Agent 技能在生产工单上自进化。从梯度衰减机制、可信反馈三条件(意图状态机、双侧正交评估、集体归因)到双层治理(有界修订、结构退化主动修复),全面拆解这套在腾讯云 9 个生产 Skill 上将 TSR 从 30.0 提升到 81.8 并落地生产环境的自进化框架。

August 16, 2026 · 2 min

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design 精读

把一篇20页论文变成一张合格学术海报,需要上百次工具调用、多轮排版修订与视觉验证——这是典型的长时程智能体设计任务。本文精读美团联合多家高校的 AutoDesign:它不直接训练模型,而是让一个元harness优化器引导 code agent 基于 rollout 反馈递归自改进 harness,经 7 天演化沉淀出可复用、可迁移的学习型 DesignHarness。在自建的 PosterBench 百篇论文基准上,AutoDesign 以 78.32 分超过商业系统 Claude Design 7.45 分,盲测人类偏好 BT 值 64.0% 位列第一;给 7 个模型配置挂载该 harness,平均分从 54.99 提升到 67.39。本精读重点拆解其双层优化循环、五组件 harness 结构,并用因果链解释’学习型 harness 为什么弱模型受益更大’。

August 15, 2026 · 3 min

DarwinX: Evolving Agent Harnesses Through Natural Selection 精读

LLM Agent 的能力不只取决于模型权重,还取决于包裹模型的 Harness(提示词、工具、技能、控制流)。Salesforce AI Research 的 DarwinX 在完全冻结模型权重的前提下,把 Agent 自进化重构为对 Harness 种群的“自然选择”:preserve-and-extend 契约只接纳“净增益为正且回退有界”的变体,树状 archive 保留多条谱系供跨谱系重组,失败/教师/自采三种证据共用同一编辑接口,适应度完全来自 benchmark 自带 verifier。四个基准平均提升约 17 分:Terminal-Bench 2.1 达 83.2%,WebArena-Infinity 从 43.5% 跃升至 93.0%,且零适应迁移到 SWE-bench Verified 达 84.2%。本精读逐部分拆解其机制,并建立“方法差异→机制变化→指标提升”的因果链。

August 15, 2026 · 5 min

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses 精读

Salesforce AI Research 联合 Notre Dame、UIUC(Heng Ji)提出强到弱推理时脚手架(Strong-to-Weak Scaffolding):用强 builder 模型为弱 target 模型自动构建推理时 harness,无需任何参数更新即可在四个 Theory-of-Mind 基准(3900 项)上将 GPT-5.4-mini 从 0.488 提升到 0.912(+0.423)。机制分析表明增益主要来自把不稳定的自然语言推理卸载为确定性代码(r=0.72),而非更长推理链或更多采样。这是对传统训练时蒸馏的一条互补路线,也直接印证了 harness 工程作为独立工程对象的价值。

August 12, 2026 · 9 min

Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution 精读

LMU Munich 团队提出的 Mendel Gödel Machine (MGM),将孟德尔遗传学中「受控比较分离遗传效应」的原理引入自改进编码智能体。在 HGM 的树搜索框架之上,MGM 新增两种自我修改算子——反应规范突变(跨任务比较同一基因型)和跨谱系杂交(跨谱系比较同一任务),在不增加任何额外任务评估成本的前提下,把 Qwen3.6-35B-A3B 在 Polyglot 上的成绩从 50.8% 拉到 93.3%,以约 117× 更少参数超越闭源 GPT-5;进化的脚手架迁移到 DeepSeek-V4-Pro 后在完整 Polyglot-225 上达 96.9%。本精读覆盖其生物学启发、三种算子机制、加性适应度景观下的收敛性证明、实验证据与通用性灵感。

August 12, 2026 · 9 min

SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure 精读

深度精读阿里+浙大+杜克联合提出的 SkillZip——首个无需任务回放(evaluation-free)的 Agent 技能压缩方法。它把’自进化积累的技能’视为一份带类型签名的契约,用’解释一次,引用多次’的直觉统一了规则共享、作用域提升、工作流复用与例外编码,形式化为一个带硬覆盖约束的类型化最小描述长度(MDL)目标。实验显示:平均压缩 31.2%,性能甚至略超未压缩技能,压缩速度比最强基线 SkillReducer 快 3.5 倍,且零次任务 rollout。

August 12, 2026 · 6 min

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution 精读

本文精读 Anton Razzhigaev、Roman Yampolskiy 等人 2026 年发表的 Ouroboros——一个能够自开发的前沿编程 Agent。它把 Agent 的工具、提示词、上下文组装乃至核心实现本身都视为可被审查、可被修改的活体代码,并通过多模型对抗式 diff 审查作为变更门控,实现经审查的核心进化(Reviewed Core Evolution)。文章在 Terminal-Bench 2.1、OSWorld-Verified、CL-Bench 等基准上刷新 SOTA,并在代号为 Hope 的 161 天活体实验中持续运行(累计 1085 次自我修改提交、94.2% 由 Agent 撰写)。本精读将从背景、定位、问题定义、方法、评估、优势根源、必要知识反推、通用性灵感八个维度系统拆解这篇论文。

August 11, 2026 · 6 min