VibeMemBench:在真实仓库任务上用可执行测试受控评测 Coding Agent 记忆系统

VibeMemBench 是首个把「真实仓库编程任务 + 可执行测试」与「持久记忆系统」接起来的受控评测基准:它不考记忆系统能否答对回忆题,而考注入的历史经验能否真正提升可执行的仓库修复结果。论文用 SIEVE 四阶段流水线(来源校验、补丁模式筛选、历史执行与经验蒸馏、验证 uplift 并冻结)从 90 个仓库筛出 111 个目标与 3634 条历史轨迹,并提出「只改记忆开关」的匹配干预协议。核心结论有反差感:冻结的、已被执行验证过有用的经验,迁移到 5 个预留 solver 时让 4 个的解决率提升 1.1~4.5 个百分点、且步数全面下降;但当 Mem0 / SimpleMem / MemoryOS / A-MEM 这四个现有记忆系统必须从同一段历史里自己写、自己检索经验时,12 组 solver×系统配对中有 11 组没能超过「不开记忆」的配对基线。失败归因显示主因不是「没检索到」(ranking miss 仅 1.3%),而是「记录形态崩坏」(form degradation 占 69.3%)——strip 消融进一步证明危害来自原始 transcript 的体积而非指令语义。本文按九部分结构拆解其背景、定位、问题定义、构建方法、评估协议、外部交叉验证、核心结果、根因分析与启示。

September 23, 2026 · 4 min

Can Agent Memory Systems Track Evolving State? StateMemBench 精读

LLM Agent 走向跨会话长程任务后,记忆系统能否跟上不断被修订的世界状态?UIUC Jiawei Han 组把「状态追踪」从「事实回忆」中剥离:答案必须反映当前状态而非被取代的旧状态。论文先证明「状态漂移」在检索完美时仍是最大失败源,再发布 StateMemBench——234 个多会话场景、闭集三分评分,把漂移答案显式放入干扰池;随后提出显式追踪取代与依赖的 StateMem,在 DeepSeek-V4-Flash 上把准确率从 0.205 提到 0.363(1.8 倍),并以单次调用 Wrapper 给六个记忆后端带来 +32 到 +67 点提升。精读覆盖定义、构造、机制与根源解释。

August 23, 2026 · 7 min