Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents 精读
深度精读中国科学技术大学与腾讯合著的 MMPO 论文——一种元认知记忆策略优化方法,通过引入 Belief Entropy(信念熵)作为自监督代理信号,为 LLM Agent 的记忆摘要提供密集的中间监督。在 RULER-HotpotQA 基准上,即使扩展到 175 万 token 上下文,仍能保持 97.1% 的性能。核心洞察:记忆优化的目标不应仅仅是最终任务是否成功,更应关注中间记忆是否让模型保持对任务状态的清晰认知。