CAMG × Comet-9B:文件即记忆与程序状态推理的 Agent 训练新范式 精读

本篇精读两篇 2026 年 9 月的代码 Agent 训练论文:京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外(surprisal 6.371 vs 0.252 nats/token),转而用纯任务奖励让 shell 文件操作自发生长为记忆,4B 模型追平 35B;UCSB 与微软合作的 Comet-9B 不直接训练写补丁,而是训练「程序状态推理」(bug 何时触发、错误如何传播),反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论:不直接优化目标行为,而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开,并用外部文献交叉验证两大机制。

September 30, 2026 · 7 min

Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 精读

Salesforce AI Research 提出 JITMEM,把智能体记忆的「塑形」时机从写时推迟到读时:写时零损耗保存原始轨迹,读时由 curator LLM 联合当前任务与检索轨迹合成任务自适应 payload,用后即焚。因为 payload 在当前任务上被立即消费,curator 可用 GRPO 直接以任务原生得分训练,信用分配零步延迟。在 ALFWorld、WebShop、τ²-bench 上分别领先最强基线 16.2、16.3、3.9 个成功率点,输入 token 省约一半。本精读覆盖其问题定义、方法拆解、实验证据、根因分析与可迁移灵感。

September 27, 2026 · 4 min

AWM: Answerable Working Memory for Long-Document VQA Agents 精读

深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现:即便给了金标证据页,42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO,同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证,以及中间产物监督这一通用方法论。

August 27, 2026 · 4 min

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization 精读

深度精读 KOPE 论文——香港城市大学与华为联合提出的硬件内核优化自进化 Agent 框架。在公共语料极度稀缺的昇腾 NPU 场景下,KOPE 用经验图记忆保留「决策-结果」证据链,配合预算化三层上下文注入,使模型参数完全冻结的前提下通过率达 84.6%(最强基线 57.8%),token 消耗反而下降 93%。本文从内核优化领域背景、经验记忆机制、主动上下文管理、双消融实验到 RISC-V 跨硬件迁移,完整拆解「经验复用为何在语料稀缺场景碾压模型能力」的因果链。

August 27, 2026 · 5 min

Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory 精读

深度精读中国科大 HiPS 论文:把记忆增强 agent 的记忆管理策略分解为「全局共享层 + 用户专属增量层」,用分歧门控决定谁需要个性化、跨层规则流动动态校准边界、反循环奖励分离阻断自我验证——12 个评测设置全部 SOTA,并发现域内靠通用规则、域外靠个性化机制的「组件重要性翻转」现象。

August 27, 2026 · 3 min

Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context 精读

深度精读 UC San Diego 的 SCALE-QA 与 TSIM 论文——针对真实助手使用形态「单线程多主题混杂的长对话」定义并测量 episode integrity failure:决定性证据明明在对话里,系统却检索到貌似合理的碎片而非让局部约束生效的完整 episode。SCALE-QA 用 3000 题反事实基准(防预训练泄漏)+ 确定性运行时打包(16k-1M);TSIM 以语义漂移在线分段 + 三视图 episode 索引,在三个后端全部第一(比最强基线高 5.6-17.6 点),1M 诊断中用约 1.3k token 达 96.5% 而 Full Context 用 1.05M token 只有 87.2%。本文拆解「找回 episode 而非答对问题」才是瓶颈的完整证据链。

August 27, 2026 · 5 min

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction 精读

实时语音助手至今没有一套像样的记忆系统:文本 Agent 记忆动辄 top-100 检索、2–3 秒延迟,而语音对话只给得起 500 毫秒预算和 5 条记忆的空间。南洋理工、新加坡国立、清华、港中文联合团队的 VoiceMem 用「双脑」架构解题:左脑以 schema-entity 两级索引把候选池收窄到稠密子集,让 top-5 检索达到别家 top-100 的精度;右脑用独立/跨实体双节点分别建模稳定人格与情境情感;四阶段流式查询把检索藏进 VAD 静默窗——134ms 完成检索、零感知延迟。信息记忆均值 76.39 超最强基线 +10.6,token 省 4.4 倍;还贡献了 53 小时音频的 ChatMem-Bench 与首批带显式记忆访问的语音语言模型。

August 27, 2026 · 4 min

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents 精读

UIC、华盛顿大学、McGill、MBZUAI与UCLA五校联合完成首个把记忆底座(substrate)作为受控变量的统一harness评测:11类底座×3个骨干模型×4组基准×26项指标。核心发现颠覆选型直觉——没有任何底座全面称雄,QA任务的前沿(图+向量混合)与决策任务的前沿(扁平检索/精炼蒸馏)完全不相交;检索宽度k在QA上单调涨分、在决策任务上反向往下跌分,注意力探针揭示同一稀释机制在不同任务中后果相反。这为记忆系统按工作区间路由底座提供了实证基础。

August 20, 2026 · 2 min

2026-06 arXiv 智能体记忆系统(Agent Memory)领域综述:113 篇全文精读

智能体记忆子领域纵深综述。从 11930 篇 6 月 arXiv 预印本中筛定 113 篇核心集,全部下载 PDF 抽全文逐篇精读,提炼 7 大共识性问题(检索不等于使用、固化的保留与遗忘决策、上下文成本爆炸、一致性/矛盾解决、评测混淆变量、记忆即新攻击面、遗忘治理)与多项原创问题定义,关键新框架已联网交叉验证。

July 17, 2026 · 5 min

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents 精读

深度精读中国科学技术大学与腾讯合著的 MMPO 论文——一种元认知记忆策略优化方法,通过引入 Belief Entropy(信念熵)作为自监督代理信号,为 LLM Agent 的记忆摘要提供密集的中间监督。在 RULER-HotpotQA 基准上,即使扩展到 175 万 token 上下文,仍能保持 97.1% 的性能。核心洞察:记忆优化的目标不应仅仅是最终任务是否成功,更应关注中间记忆是否让模型保持对任务状态的清晰认知。

June 9, 2026 · 4 min