PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation 精读

为什么最强的编码 Agent 一进专业仓库就失灵?北京大学团队把根因锁定在「隐性知识」——那些只存在于开发者脑中、从不写进文档的业务规则、接口契约与操作约定。它们潜伏在开发实践之下、沿代码依赖图分散传播、且 Agent 根本不知道自己缺什么,三重性质让一切检索式方案天然失效。PRAXIS 给出四阶段闭环:让 Agent 在目标仓库里真实写代码暴露行为差异、蒸馏为带触发条件的结构化四元组、锚定到依赖图上双向传播与去重仲裁、并在任务初始化与工具交互时主动注入,支持在线演化。KoCo-Bench 四域平均 Pass@1 达 32.06%,较次优基线相对提升 16.7%,且随实践积累持续上涨。

August 24, 2026 · 5 min

MidTool: 面向Agent工具使用的中期训练数据合成 精读

工具使用是 LLM Agent 的核心能力,但此前几乎全靠后训练习得。MidTool(华盛顿大学 + Snowflake + UNC,工作完成于 Snowflake 实习)提出首个面向通用工具使用的开放中期训练语料管线:从网页、PDF、代码、真实 API 与 MCP 技能四类源出发,经「上下文接地增广」与「原生 Agent 轨迹合成」两条分支构建 20.3B token 的 MidTool-Mix,中期训练 Qwen3-4B/8B-Base 后再统一 SFT+RL。在 BFCL、τ²-Bench、MCP Universe 三基准上,两种后训练配方下均一致超过 SFT-only 基线,RL 通常进一步放大增益,MCP-Universe 上 4B/8B 全面超过 Qwen3 官方同尺寸模型。本精读覆盖背景、定位、问题抽象、管线解法、实验证据、机制因果链、必要知识反推与可迁移灵感。

August 23, 2026 · 6 min

Inducing Task Models from Computer-Use Traces 精读

计算机使用 agent 要真正进入真实工作,必须先搞清楚’这项工作实际是怎么做的’。Stanford 与 CMU 的这篇论文提出 TMI(TaskModelInduction),从被动录制的自然计算机使用轨迹中诱导结构化任务模型:先把多条交织的并发任务解缠成独立潜任务,再为每个任务构建’层次目标模型(做什么)+ 过程模型(怎么做)‘双模型。在受控轨迹上任务分组与 ground-truth 一致性达 0.974,重建 74.9% 的观测执行步骤;由任务模型派生的技能使 held-out 任务准确率提升 30.0%。本精读覆盖其问题定义、双模型解法、内外双层评估设计、优势根源与可推广的通用性灵感。

August 22, 2026 · 3 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

深度精读浙大 ZJUNLP 联合 NUS、东北大学、赫瑞瓦特大学与腾讯的 MemTrapBench——首个系统评估’记忆诱导认知陷阱’的基准。论文发现:忠实记录、语义相关的记忆仍可能扭曲模型推理与信念,1050 个对抗实例上所有记忆框架全面低于无记忆基线,最好的 EverMemOS 也落后 13.99 个百分点。文章拆解两类四情景陷阱分类、三段式对抗构建流水线、四组归因消融实验,以及仅靠推理时提示就挽回 14.9 个百分点的 AdaptiveMem 修复方案。

August 22, 2026 · 4 min

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution 精读

上海交通大学顾晓东组提出SkillForge——面向项目特定issue解决的自蒸馏框架。核心洞察是冷启动问题:agent在特定仓库上缺乏项目知识,历史驱动方法依赖过往issue信号、在线方法每题付出昂贵探索成本。SkillForge反其道行之:主动重新实现仓库中带测试覆盖的核心功能来合成项目特定issue,解决后把经验蒸馏为实体锚定技能。SWE-bench Verified上DeepSeek-V3.2达72.2%(+5.8超基线,超最强对手+3.0),GPT-5-mini 60.6%(+5.6),SWE-bench Pro上同样领先,单issue成本仅$0.069-0.087。

August 20, 2026 · 2 min

Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories 精读

深度精读 arxiv:2608.12847——西安交大团队提出 QCR(Query-Conditioned Reuse),指出轨迹记忆的真正瓶颈不在检索而在检索之后的“复用”环节:历史轨迹里的用户名、路径、日期等绑定值会随时间过期,直接注入会诱导模型照抄旧值。QCR 在检索与执行之间插入一步改写,把选中轨迹转化为“工作流不变量/需重取绑定/适用条件/验证护栏”四字段笔记。在 WebArena/WorkArena/AppWorld 共 2391 个目标上,平均 Success 62.3%(比注入完整轨迹高 10.7 点),在线 token 省 48.9%;大绑定偏移下过期绑定错误率从 46.9% 降至 10.9%。

August 17, 2026 · 4 min

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution 精读

深度精读佐治亚理工与 Cisco Research 合作的 DIVE 论文——让冻结大模型通过多样性驱动的技能进化实现自我改进。文章从冻结模型为何记不住经验讲起,拆解其核心设计:K=10 个独立技能种群、四种异构进化算子加 UCB 预算分配、联合选择至多 M=10 个互补技能、推理时候选排序。在六个数学与逻辑推理基准上,GPT-5-nano 借助 DIVE 从 52.3 跃升至 81.5,反超 GPT-5 few-shot,推理成本还降低 42.5%。本文逐节还原问题形式化、机制细节、完整实验数据与效果根源解释,并给出可迁移的方法论灵感。

August 17, 2026 · 5 min

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback 精读

深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文。核心论断:技能自进化的瓶颈不在编辑能力也不在迭代次数,而在评估反馈能否持续供给可信的进化梯度。框架用两根支柱支撑这一命题——把多轮用户模拟从评估终点反转为反馈生成器(意图状态机、双侧正交评估、集体归因),再用独立治理层主动修复事实退化与结构膨胀(双锚点硬约束、图结构诊断软约束)。在腾讯云 6 类云服务、9 个生产 Skill、2000 张升级工单上,TSR 从 30.0 提升到 81.8,较单轮 QA 进化高 15.4 个点,膨胀率仅 2.8%,并已部署于生产环境。

August 17, 2026 · 4 min

DIVE: 多样性驱动的冻结模型技能进化 精读

深度精读佐治亚理工与 Cisco Research 合作的 DIVE 论文——让只能通过 API 访问的冻结大模型,把任务经验进化成可持续复用的自然语言技能。从三大挑战(自修订噪声、经验超上下文、进化路径依赖)出发,拆解其核心机制:多种群独立进化维持假设多样性、异构算子组合 + UCB 自适应分配进化预算、算子本身也能进化、验证集上联合选择互补技能集。GPT-5-nano 借此平均 81.5 分反超 GPT-5 + ICL 且推理成本降低 42.5%,小模型逆袭大模型的路径首次如此清晰。

August 16, 2026 · 2 min

ERSkill: 检索技能与路由器共进化 精读

Agent 记忆系统的进化大多发生在“写入侧”——怎么抽取、压缩、组织记忆。深圳国际工业与应用数学中心等机构的 ERSkill 把目光转向被忽视的“读取侧”:检索机制本身。它把检索行为表示为由固定原语(实体搜索/BM25/稠密检索 + 三种扩展 + LLM 处理)组合成的可执行技能,用训练好的 router 按查询的信息需求派发技能;进化时用经验 trie 记录所有探索过的原语路径以避免重复提议,用 Pareto 式双前沿把“能力探索”与“router 面向的部署”解耦。三大记忆基准上整体平均提升 31.3%(Qwen3-Next-80B-A3B 骨干),LongMemEval 零训练迁移仍居首。本精读逐部分拆解其机制,并建立“查询异构性→技能化→证据密集型任务受益”的因果链。

August 16, 2026 · 4 min