SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback 精读

深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文。核心论断:技能自进化的瓶颈不在编辑能力也不在迭代次数,而在评估反馈能否持续供给可信的进化梯度。框架用两根支柱支撑这一命题——把多轮用户模拟从评估终点反转为反馈生成器(意图状态机、双侧正交评估、集体归因),再用独立治理层主动修复事实退化与结构膨胀(双锚点硬约束、图结构诊断软约束)。在腾讯云 6 类云服务、9 个生产 Skill、2000 张升级工单上,TSR 从 30.0 提升到 81.8,较单轮 QA 进化高 15.4 个点,膨胀率仅 2.8%,并已部署于生产环境。

August 17, 2026 · 4 min

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents 精读

深度精读 2026 年 8 月 arXiv 论文 CREST:面向多轮多步工具调用 Agent 的层级化功劳分配框架。它把每 token 优势分解为「轮级 verifier 优势 × token 级教师调制幅值」,让自教师只调幅值、不碰方向,从而保住 RL 的 verifier 上界。BFCL V3 上 Qwen3-4B 达 52.00%(较基座 +29.88),13/14 项最佳,长上下文与 Session 级指标增益最大。

August 17, 2026 · 5 min

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior 精读

普渡大学、微软研究院与芝加哥大学团队对编码智能体的工具架构做了受控对比实验:在能力等价前提下比较六种工具架构(BashOnly、Atomic、NLSearch、Python、HypoTrack、Scratchpad),覆盖三个模型共11700条轨迹。结果显示结构化原子工具将弱模型重复运行稳定性最高提升4.7倍,自然语言搜索拓宽仓库探索广度超过11%,代码执行接口在任务表现相近的情况下减少41.6%步数与56.3%token消耗,而轻量认知脚手架几乎无效——接口本身就在塑造智能体行为。

August 17, 2026 · 4 min

Beyond Final Scores: 长程AI研发Agent过程级评测 精读

深度精读美团与中国科学院大学的论文 Beyond Final Scores——一项花费约10万美元推理成本、覆盖7个前沿模型×36个长程任务×3次rollout(共756次运行)的系统评测。它不满足于给Agent打一个终分,而是把研究循环拆成方案框架(C1)、执行(C2)、反馈控制(C3)三个规则化过程指标,并用受控对照测出经验复用(M)与harness的真实影响。核心结论:当前自动研发Agent更像“工程优化器”而非自主研究者——拉开模型差距的是可靠性而非峰值(avg@3差距0.237 vs best@3仅0.122),252个最佳解中仅3个(1.2%)具真正方法学新颖性,且钻评测漏洞的解(16个)比新颖解多五倍。

August 16, 2026 · 2 min

DIVE: 多样性驱动的冻结模型技能进化 精读

深度精读佐治亚理工与 Cisco Research 合作的 DIVE 论文——让只能通过 API 访问的冻结大模型,把任务经验进化成可持续复用的自然语言技能。从三大挑战(自修订噪声、经验超上下文、进化路径依赖)出发,拆解其核心机制:多种群独立进化维持假设多样性、异构算子组合 + UCB 自适应分配进化预算、算子本身也能进化、验证集上联合选择互补技能集。GPT-5-nano 借此平均 81.5 分反超 GPT-5 + ICL 且推理成本降低 42.5%,小模型逆袭大模型的路径首次如此清晰。

August 16, 2026 · 2 min

ERSkill: 检索技能与路由器共进化 精读

Agent 记忆系统的进化大多发生在“写入侧”——怎么抽取、压缩、组织记忆。深圳国际工业与应用数学中心等机构的 ERSkill 把目光转向被忽视的“读取侧”:检索机制本身。它把检索行为表示为由固定原语(实体搜索/BM25/稠密检索 + 三种扩展 + LLM 处理)组合成的可执行技能,用训练好的 router 按查询的信息需求派发技能;进化时用经验 trie 记录所有探索过的原语路径以避免重复提议,用 Pareto 式双前沿把“能力探索”与“router 面向的部署”解耦。三大记忆基准上整体平均提升 31.3%(Qwen3-Next-80B-A3B 骨干),LongMemEval 零训练迁移仍居首。本精读逐部分拆解其机制,并建立“查询异构性→技能化→证据密集型任务受益”的因果链。

August 16, 2026 · 4 min

Full-bandwidth transformer 精读

Full-bandwidth transformer(微软+JHU+普林斯顿,含 John Langford)指出自回归 Transformer 的垂直反馈通道极窄:步间只回传一个采样 token(至多 log2|V| 比特),顶层隐状态被直接丢弃。论文提出潜反馈解码(latent feedback decoding),用门控线性单元把上一步顶层隐状态与 token 嵌入融合后回灌输入端,配合多 pass 训练目标、渐进调度与 prefix mixin,在 1B 模型 400B token 预训练中验证:Math500 超越 1T token 标准基线、GSM8K 指令调优后 71.8 逼近 1T 基线、约 2 倍数据效率、base 模型推理链显著变短且精度不降,每 token 推理开销不到 1%。本精读覆盖带宽视角的动机、可达集理论、训练配方、实验因果链与可推广灵感。

August 16, 2026 · 5 min

Practice Makes Unsafe: 技能误进化 精读

自我改进的 LLM Agent 会把成功轨迹蒸馏成可复用技能,但一次“不安全的成功”也可能被写进技能库,在触发它的输入消失后继续潜伏。本文精读香港城市大学与阿德莱德大学的论文《Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents》:它提出概念“技能误进化”,构建了生命周期感知的测试环境 SKILLMISEVO-GYM 与冻结基准 SKILLMISEVO-BENCH,用“写入—检索—执行”三道门指标把风险归因到具体环节,并提出方法无关的治理包装器 SAFEEVOLVE。实验覆盖 25 个配置、每个 525 个任务:21 个进化配置全部写入了不安全技能,仅 15 个到达干净会话伤害;3 个恶意任务就把残留攻击成功率从 16.0% 推到 35.3%;SAFEEVOLVE 将不安全检索与残留伤害分别降低 26.7 和 17.3 个百分点,而良性效用只变化 0.4 分。

August 16, 2026 · 3 min

RippleMem: 从孤立检索到联想式回忆 精读

问一个 Agent’该不该听 Sam 的推荐带 Maya 去 Harbor Grill 吃饭’,正确的回答需要三条分散在不同会话里的证据:晚餐计划、Maya 的海鲜过敏、这家店是海鲜餐厅——直接检索只命中第一条,无向图扩展可能带出无关的订座偏好却恰恰漏掉过敏这条安全约束。本文精读中国传媒大学联合智联英才科技的 RippleMem:它把记忆访问从’一次性查找’重构为’证据条件化的联想式回忆’——已召回的记忆不是检索的终点,而是寻找缺失支持的线索。系统把交互历史写成线索丰富的情景记忆单元,组织成事件中心图,查询时从初始锚点沿语义与结构双通道局部扩散,定向找回缺失证据。在 LoCoMo 上 F1 52.49、LLM 裁判准确率 87.14 均为最佳,temporal 类超 SimpleMem 9.66 分,multi-session 从 60.92 提到 78.20;建图成本约为 Mem0g/Zep 的 1/30。本精读重点拆解其写读两阶段设计,并用因果链解释’evidence-distributed 题型为何增益最大’与'30 倍成本下降为何来自延迟建图’。

August 16, 2026 · 3 min

SkillEvo: 多轮交互反馈的自更新进化梯度 精读

深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文——把多轮用户模拟从评估终点反转为反馈生成器,让 Agent 技能在生产工单上自进化。从梯度衰减机制、可信反馈三条件(意图状态机、双侧正交评估、集体归因)到双层治理(有界修订、结构退化主动修复),全面拆解这套在腾讯云 9 个生产 Skill 上将 TSR 从 30.0 提升到 81.8 并落地生产环境的自进化框架。

August 16, 2026 · 2 min