Can Agent Memory Systems Track Evolving State? StateMemBench 精读
LLM Agent 走向跨会话长程任务后,记忆系统能否跟上不断被修订的世界状态?UIUC Jiawei Han 组把「状态追踪」从「事实回忆」中剥离:答案必须反映当前状态而非被取代的旧状态。论文先证明「状态漂移」在检索完美时仍是最大失败源,再发布 StateMemBench——234 个多会话场景、闭集三分评分,把漂移答案显式放入干扰池;随后提出显式追踪取代与依赖的 StateMem,在 DeepSeek-V4-Flash 上把准确率从 0.205 提到 0.363(1.8 倍),并以单次调用 Wrapper 给六个记忆后端带来 +32 到 +67 点提升。精读覆盖定义、构造、机制与根源解释。