<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>记忆策略 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E8%AE%B0%E5%BF%86%E7%AD%96%E7%95%A5/</link><description>Recent content in 记忆策略 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 30 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E8%AE%B0%E5%BF%86%E7%AD%96%E7%95%A5/index.xml" rel="self" type="application/rss+xml"/><item><title>CAMG × Comet-9B：文件即记忆与程序状态推理的 Agent 训练新范式 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-agent-training-paradigm-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-agent-training-paradigm-duet-paper-reading/</guid><description>本篇精读两篇 2026 年 9 月的代码 Agent 训练论文：京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外（surprisal 6.371 vs 0.252 nats/token），转而用纯任务奖励让 shell 文件操作自发生长为记忆，4B 模型追平 35B；UCSB 与微软合作的 Comet-9B 不直接训练写补丁，而是训练「程序状态推理」（bug 何时触发、错误如何传播），反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论：不直接优化目标行为，而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开，并用外部文献交叉验证两大机制。</description></item><item><title>Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-27-jit-memory-paper-reading/</link><pubDate>Sun, 27 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-27-jit-memory-paper-reading/</guid><description>Salesforce AI Research 提出 JITMEM，把智能体记忆的「塑形」时机从写时推迟到读时：写时零损耗保存原始轨迹，读时由 curator LLM 联合当前任务与检索轨迹合成任务自适应 payload，用后即焚。因为 payload 在当前任务上被立即消费，curator 可用 GRPO 直接以任务原生得分训练，信用分配零步延迟。在 ALFWorld、WebShop、τ²-bench 上分别领先最强基线 16.2、16.3、3.9 个成功率点，输入 token 省约一半。本精读覆盖其问题定义、方法拆解、实验证据、根因分析与可迁移灵感。</description></item><item><title>AWM: Answerable Working Memory for Long-Document VQA Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-awm-workmemory-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-awm-workmemory-paper-reading/</guid><description>深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现：即便给了金标证据页，42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO，同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证，以及中间产物监督这一通用方法论。</description></item><item><title>Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-kope-npu-kernel-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-kope-npu-kernel-paper-reading/</guid><description>深度精读 KOPE 论文——香港城市大学与华为联合提出的硬件内核优化自进化 Agent 框架。在公共语料极度稀缺的昇腾 NPU 场景下，KOPE 用经验图记忆保留「决策-结果」证据链，配合预算化三层上下文注入，使模型参数完全冻结的前提下通过率达 84.6%（最强基线 57.8%），token 消耗反而下降 93%。本文从内核优化领域背景、经验记忆机制、主动上下文管理、双消融实验到 RISC-V 跨硬件迁移，完整拆解「经验复用为何在语料稀缺场景碾压模型能力」的因果链。</description></item><item><title>Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-hips-memory-personalize-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-hips-memory-personalize-paper-reading/</guid><description>深度精读中国科大 HiPS 论文：把记忆增强 agent 的记忆管理策略分解为「全局共享层 + 用户专属增量层」，用分歧门控决定谁需要个性化、跨层规则流动动态校准边界、反循环奖励分离阻断自我验证——12 个评测设置全部 SOTA，并发现域内靠通用规则、域外靠个性化机制的「组件重要性翻转」现象。</description></item><item><title>Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-scaleqa-episode-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-scaleqa-episode-paper-reading/</guid><description>深度精读 UC San Diego 的 SCALE-QA 与 TSIM 论文——针对真实助手使用形态「单线程多主题混杂的长对话」定义并测量 episode integrity failure：决定性证据明明在对话里，系统却检索到貌似合理的碎片而非让局部约束生效的完整 episode。SCALE-QA 用 3000 题反事实基准（防预训练泄漏）+ 确定性运行时打包（16k-1M）；TSIM 以语义漂移在线分段 + 三视图 episode 索引，在三个后端全部第一（比最强基线高 5.6-17.6 点），1M 诊断中用约 1.3k token 达 96.5% 而 Full Context 用 1.05M token 只有 87.2%。本文拆解「找回 episode 而非答对问题」才是瓶颈的完整证据链。</description></item><item><title>VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-voicemem-memory-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-voicemem-memory-paper-reading/</guid><description>实时语音助手至今没有一套像样的记忆系统：文本 Agent 记忆动辄 top-100 检索、2–3 秒延迟，而语音对话只给得起 500 毫秒预算和 5 条记忆的空间。南洋理工、新加坡国立、清华、港中文联合团队的 VoiceMem 用「双脑」架构解题：左脑以 schema-entity 两级索引把候选池收窄到稠密子集，让 top-5 检索达到别家 top-100 的精度；右脑用独立/跨实体双节点分别建模稳定人格与情境情感；四阶段流式查询把检索藏进 VAD 静默窗——134ms 完成检索、零感知延迟。信息记忆均值 76.39 超最强基线 +10.6，token 省 4.4 倍；还贡献了 53 小时音频的 ChatMem-Bench 与首批带显式记忆访问的语音语言模型。</description></item><item><title>Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-harness-the-memory-substrates-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-harness-the-memory-substrates-paper-reading/</guid><description>UIC、华盛顿大学、McGill、MBZUAI与UCLA五校联合完成首个把记忆底座（substrate）作为受控变量的统一harness评测：11类底座×3个骨干模型×4组基准×26项指标。核心发现颠覆选型直觉——没有任何底座全面称雄，QA任务的前沿（图+向量混合）与决策任务的前沿（扁平检索/精炼蒸馏）完全不相交；检索宽度k在QA上单调涨分、在决策任务上反向往下跌分，注意力探针揭示同一稀释机制在不同任务中后果相反。这为记忆系统按工作区间路由底座提供了实证基础。</description></item><item><title>2026-06 arXiv 智能体记忆系统（Agent Memory）领域综述：113 篇全文精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-17-agent-memory-survey-2026-06/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-17-agent-memory-survey-2026-06/</guid><description>智能体记忆子领域纵深综述。从 11930 篇 6 月 arXiv 预印本中筛定 113 篇核心集，全部下载 PDF 抽全文逐篇精读，提炼 7 大共识性问题（检索不等于使用、固化的保留与遗忘决策、上下文成本爆炸、一致性/矛盾解决、评测混淆变量、记忆即新攻击面、遗忘治理）与多项原创问题定义，关键新框架已联网交叉验证。</description></item><item><title>Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-06-09-mmpo-paper-reading/</link><pubDate>Tue, 09 Jun 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-06-09-mmpo-paper-reading/</guid><description>深度精读中国科学技术大学与腾讯合著的 MMPO 论文——一种元认知记忆策略优化方法，通过引入 Belief Entropy（信念熵）作为自监督代理信号，为 LLM Agent 的记忆摘要提供密集的中间监督。在 RULER-HotpotQA 基准上，即使扩展到 175 万 token 上下文，仍能保持 97.1% 的性能。核心洞察：记忆优化的目标不应仅仅是最终任务是否成功，更应关注中间记忆是否让模型保持对任务状态的清晰认知。</description></item></channel></rss>