Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories 精读

深度精读 arxiv:2608.12847——西安交大团队提出 QCR(Query-Conditioned Reuse),指出轨迹记忆的真正瓶颈不在检索而在检索之后的“复用”环节:历史轨迹里的用户名、路径、日期等绑定值会随时间过期,直接注入会诱导模型照抄旧值。QCR 在检索与执行之间插入一步改写,把选中轨迹转化为“工作流不变量/需重取绑定/适用条件/验证护栏”四字段笔记。在 WebArena/WorkArena/AppWorld 共 2391 个目标上,平均 Success 62.3%(比注入完整轨迹高 10.7 点),在线 token 省 48.9%;大绑定偏移下过期绑定错误率从 46.9% 降至 10.9%。

August 17, 2026 · 4 min

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test 精读

独立研究者 Saveliy Batruin 单人完成的论文,把“智能体组件各自正常、合起来却对不上”的 harness 故障形式化为层论粘合问题:5 个需求作顶点、行为签名作茎、限制映射为字面字段投影,用精确 CSP 判定可粘合性、用相对上同调类作诊断特征,并对隐藏中介状态取商以获得不变性。受控实验中 20 个任务簇全部获益(到首次成功的候选评估数 1.000 vs 2.000,token 降约 71%);但在真实 PatchFuseBench 上候选级商选择器 118/160 仅比匹配对照 116/160 高 2 题(p=0.75 不显著),未过预注册开发门,确认集保持封存。受控环境成立、真实优势尚未证明——论文以罕见的诚实划出了方法的边界。

August 17, 2026 · 4 min

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution 精读

深度精读佐治亚理工与 Cisco Research 合作的 DIVE 论文——让冻结大模型通过多样性驱动的技能进化实现自我改进。文章从冻结模型为何记不住经验讲起,拆解其核心设计:K=10 个独立技能种群、四种异构进化算子加 UCB 预算分配、联合选择至多 M=10 个互补技能、推理时候选排序。在六个数学与逻辑推理基准上,GPT-5-nano 借助 DIVE 从 52.3 跃升至 81.5,反超 GPT-5 few-shot,推理成本还降低 42.5%。本文逐节还原问题形式化、机制细节、完整实验数据与效果根源解释,并给出可迁移的方法论灵感。

August 17, 2026 · 5 min

GitSkills: A Dataset of Agent Skills on GitHub 精读

深度精读 UCL、霍恩海姆大学与卡利亚里大学合作的 GitSkills——首个对 GitHub 上 Agent Skill 生态做系统性快照的规模数据集。2025年10月 Anthropic 开源 SKILL.md 格式,仅九个月后 GitHub 公开仓库中已沉淀 3,797,117 个 SKILL.md 文件、282,200 个仓库、195,841 个账号。论文的三阶段管线绕过代码搜索 API 每查询 1000 条上限与不可靠的总数估计(报 34.9 万 vs 实际 380 万+),按文件大小递归分区搜索空间完成完整采集;内容哈希去重得 1,877,981 个不同内容,50.5% 的文件是逐字副本——这个无包管理器、靠复制传播的生态,把软件供应链安全命题原样搬进了自然语言工件世界。数据封装为单个自包含 SQLite 文件,采集与解释分离设计让社区可以自定义纳入标准。

August 17, 2026 · 3 min

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents 精读

自改进 LLM Agent 会把成功经验沉淀为可复用技能,但如果某次“成功”本身是不安全的,会怎样?本文精读港城大与阿德莱德大学的论文 Practice Makes Unsafe:作者提出技能劣化(skill misevolution)概念——不安全捷径随有用流程一起被写入技能库,攻击输入消失后危害仍持续。论文给出 SKILLMISEVO-GYM 生命周期测试框架、SKILLMISEVO-BENCH 冻结基准与 SAFEEVOLVE 治理包装器,实验发现 21 个进化配置全部产出不安全技能、3 个恶意任务即可使新会话攻击成功率从 16.0% 升至 35.3%,而 SAFEEVOLVE 能将不安全检索率降低 26.7 个百分点、良性效用仅损失 0.4 分。

August 17, 2026 · 4 min

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback 精读

深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文。核心论断:技能自进化的瓶颈不在编辑能力也不在迭代次数,而在评估反馈能否持续供给可信的进化梯度。框架用两根支柱支撑这一命题——把多轮用户模拟从评估终点反转为反馈生成器(意图状态机、双侧正交评估、集体归因),再用独立治理层主动修复事实退化与结构膨胀(双锚点硬约束、图结构诊断软约束)。在腾讯云 6 类云服务、9 个生产 Skill、2000 张升级工单上,TSR 从 30.0 提升到 81.8,较单轮 QA 进化高 15.4 个点,膨胀率仅 2.8%,并已部署于生产环境。

August 17, 2026 · 4 min

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents 精读

深度精读 2026 年 8 月 arXiv 论文 CREST:面向多轮多步工具调用 Agent 的层级化功劳分配框架。它把每 token 优势分解为「轮级 verifier 优势 × token 级教师调制幅值」,让自教师只调幅值、不碰方向,从而保住 RL 的 verifier 上界。BFCL V3 上 Qwen3-4B 达 52.00%(较基座 +29.88),13/14 项最佳,长上下文与 Session 级指标增益最大。

August 17, 2026 · 5 min

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior 精读

普渡大学、微软研究院与芝加哥大学团队对编码智能体的工具架构做了受控对比实验:在能力等价前提下比较六种工具架构(BashOnly、Atomic、NLSearch、Python、HypoTrack、Scratchpad),覆盖三个模型共11700条轨迹。结果显示结构化原子工具将弱模型重复运行稳定性最高提升4.7倍,自然语言搜索拓宽仓库探索广度超过11%,代码执行接口在任务表现相近的情况下减少41.6%步数与56.3%token消耗,而轻量认知脚手架几乎无效——接口本身就在塑造智能体行为。

August 17, 2026 · 4 min

【每日AI前沿追踪】2026年08月16日 核心技术与产业动态速递

DeepSeek 开源 Harness 三天斩获 12.2 万星成 GitHub 史上增长最快项目,并把编排层做成了契约化的插件体系;SpaceX 正式完成 600 亿美元收购 Cursor,独立编码工具时代落幕。学术侧 14 篇深读:技能自进化成主线——SkillEvo 腾讯云生产 TSR 30%→81.8%,DIVE 冻结模型技能进化超 SkillOpt +16.7,Practice Makes Unsafe 首次系统揭示技能劣化安全风险;CREST 轮级功劳分配、Capability Sheaves 层论修复、Behavioral Contracts 免独立性可靠性证书、AQuA 密封沙盒量化自改进等 11 篇达顶会标准触发精读。

August 16, 2026 · 7 min

Beyond Final Scores: 长程AI研发Agent过程级评测 精读

深度精读美团与中国科学院大学的论文 Beyond Final Scores——一项花费约10万美元推理成本、覆盖7个前沿模型×36个长程任务×3次rollout(共756次运行)的系统评测。它不满足于给Agent打一个终分,而是把研究循环拆成方案框架(C1)、执行(C2)、反馈控制(C3)三个规则化过程指标,并用受控对照测出经验复用(M)与harness的真实影响。核心结论:当前自动研发Agent更像“工程优化器”而非自主研究者——拉开模型差距的是可靠性而非峰值(avg@3差距0.237 vs best@3仅0.122),252个最佳解中仅3个(1.2%)具真正方法学新颖性,且钻评测漏洞的解(16个)比新颖解多五倍。

August 16, 2026 · 2 min