论文链接:arxiv.org/abs/2605.30159 发表时间:2026年5月 机构:中国科学技术大学、浙江大学、腾讯 合著标注:这是典型的高校+企业联合研究。核心团队来自中国科学技术大学(第一作者 Ziyan Liu),联合作者包括浙江大学的 Zhezheng Hao。通讯作者 Wei Xia 来自腾讯。三位共同第一作者标注了同等贡献。这是一个将强化学习理论与工业场景深度融合的工作。
一、论文背景
1.1 LLM Agent 的"记忆力"困境
想象你正在阅读一本 200 万字的小说,但你的短期记忆只能容纳 8000 字。你会怎么做?自然地,你会边读边做笔记——把之前读到的关键情节压缩成简短的摘要,用来辅助后续的理解。
LLM Agent 面对超长任务时,面临完全相同的问题。当前的大语言模型都有一个上下文窗口的限制(比如 8K、32K、128K token),当任务交互产生的文本累积到远超这个限制时,模型就无法一次性看到所有历史信息。为了解决这个问题,研究者们设计了记忆增强的 LLM Agent(Memory-augmented LLM Agent)——让 Agent 像"做笔记"一样,在每一步交互后把关键信息压缩成一个记忆摘要(memory summary),在后续步骤中只看这个摘要而非完整历史。
这种"边做边记"的策略听起来很合理,但存在一个致命问题:递归摘要会积累语义噪声。
1.2 递归摘要的信息流失——“传话游戏"效应
记忆摘要的工作方式是递归的:每一步的新记忆是在上一步记忆的基础上生成的。这就像我们在玩"传话游戏”——第一个人说一句话,第二个人把听到的传给第三个人,以此类推。每传一次,信息就可能丢失一点、走样一点。
在 LLM Agent 的场景下,这个过程更加严重:
- 信息丢失:当摘要把 10000 字压缩成 500 字时,大量细节被丢弃。关键的是,模型无法预知哪些信息在未来会变得重要,因此可能在第 3 步丢掉了第 17 步需要的关键线索。
- 语义噪声:模型在压缩信息时可能引入歧义或错误描述。一段关于"红色跑鞋"的记忆可能被压缩成"红色鞋子",丢失了"跑鞋"这个关键属性。
- 信念偏差(Belief Deviation):随着递归摘要一步步积累误差,Agent 对当前任务状态的认知会逐渐偏离真实情况。就像传话游戏传到最后,“今天下午开会"可能变成了"明天上午放假”。
1.3 现有方法的训练困境——只看终点,不看过程
此前最先进的方法(如 MemAgent、MEM1)采用**基于结果的强化学习(Outcome-based RL)**来训练记忆策略。它们的核心思路是:
如果最终任务做对了,就奖励模型;如果做错了,就惩罚模型。
这听起来像"只看考试成绩"的教育方式——不管中间学了多少、记了多少笔记,最终只看你考了几分。
问题在于,长序列任务中,一次交互可能包含几十甚至上百步,而最终的成功或失败只是一个极其稀疏的信号。模型很难从"任务最终失败了"这个信号中,反推出"是第 7 步的记忆摘要写错了"还是"第 23 步丢了关键信息"。这种**稀疏信用分配(sparse credit assignment)**问题,正是本文想要解决的核心挑战。
1.4 元认知的启发——“知道自己不知道”
论文从认知科学中的**元认知(Metacognition)**理论中汲取灵感。元认知指的是"对自身认知过程的认知"——简单来说,就是"知道自己知道什么,知道自己不知道什么"。
心理学家 Flavell 在 1979 年提出,元认知包含三个核心能力:
| 元认知能力 | 描述 | 在本文中的对应 |
|---|---|---|
| 元认知知识 | 了解自己的认知能力和局限 | Agent 知道记忆可能不完整 |
| 元认知监控 | 实时评估当前认知状态的质量 | Belief Entropy:评估当前记忆是否清晰 |
| 元认知控制 | 根据监控结果调整策略 | MMPO:根据 Belief Entropy 优化记忆策略 |
论文的核心洞察可以概括为一句话:与其等任务结束后才评判记忆好不好,不如让模型在每一步都"扪心自问"——“基于当前记忆,我清楚自己该做什么吗?”
二、论文定位与关联工作
2.1 记忆增强 LLM Agent 的发展脉络
记忆管理是 LLM Agent 研究中的一个核心方向。以下是 MMPO 在这一脉络中的定位:
第一代:静态记忆管理
- MemGPT(2023,UC Berkeley):借鉴操作系统的虚拟内存机制,将 LLM 的上下文空间比作"内存",外部存储比作"磁盘"。当上下文快要"满了"(达到 70% 阈值)时,系统自动触发记忆整理——把不紧急的信息存到外部存储,保持主上下文的清爽。这就像手机内存不够时,把照片自动备份到云端。
第二代:可学习的记忆策略
- MemAgent(2026,字节跳动/清华,ICLR 2026):将记忆管理从规则驱动升级为可训练的策略。采用分段读取+覆盖式记忆更新的方式处理超长文本,并通过强化学习(DAPO 算法的扩展)进行端到端训练。在 8K 上下文窗口上训练后,可以泛化到 350 万 token 的任务。
- MEM1(2026,新加坡-MIT 联合团队):让 Agent 以恒定内存运行。每一轮都更新一个紧凑的共享内部状态,同时支持记忆整合和推理,策略性地丢弃不相关或冗余的信息。
第三代:元认知驱动的记忆优化 ← MMPO 在这里
- MMPO:在 MemAgent/MEM1 的基础上,指出仅靠最终任务结果来训练记忆策略是不够的——中间的每一步记忆摘要都需要监督。它引入了 Belief Entropy 来实现这一目标。
2.2 强化学习在 LLM 中的演进
MMPO 的训练方法也站在一条清晰的技术脉络上:
| 阶段 | 方法 | 核心思路 |
|---|---|---|
| RLHF | PPO(2017) | 训练一个 Value Network 作为基线,估计每个状态的价值,再用 PPO 算法优化策略 |
| 简化 RL | GRPO(DeepSeek,2024) | 去掉 Value Network,用同一组采样的平均奖励作为基线,大幅降低计算开销 |
| 过程监督 | PRIME(2025) | 不只在最后给奖励,在推理的每一步都给中间奖励 |
| 记忆专用 RL | MMPO(本文) | 在 GRPO 的基础上,为每一步记忆摘要引入基于 Belief Entropy 的密集奖励 |
2.3 信息论与不确定性估计
MMPO 的理论基础还连接了两条重要线索:
- 信念状态(Belief State):来自 POMDP(部分可观测马尔可夫决策过程)理论。当环境状态不可完全观测时,智能体需要维护一个对当前状态的"信念"——即概率分布。MMPO 将 Agent 的记忆摘要视为对潜在任务状态的信念近似。
- 信息论中的熵:熵(Entropy)度量不确定性。高熵意味着"非常不确定",低熵意味着"比较确定"。MMPO 用 Belief Entropy 来衡量"模型基于当前记忆对任务状态有多确定"。
2.4 MMPO 的独特定位
综合来看,MMPO 的定位可以用一个公式概括:
$$\text{MMPO} = \underbrace{\text{MemAgent 的记忆框架}}_{\text{记忆策略}} + \underbrace{\text{POMDP 的信念建模}}_{\text{理论框架}} + \underbrace{\text{GRPO 的无 Critic 训练}}_{\text{RL 基础}} + \underbrace{\text{Belief Entropy}}_{\text{核心创新}}$$它的独特之处在于:在记忆策略优化的场景中,首次引入了元认知驱动的、面向信念不确定性的密集监督信号。这填补了 MemAgent/MEM1 留下的关键空白——“中间记忆质量如何评估”。
三、问题定义
3.1 从直觉到形式化
让我们先回到最根本的问题。记忆摘要的目标是什么?
直觉上:好的记忆应该让 Agent 知道当前任务做到哪了、接下来该做什么。差的记忆则让 Agent “犯迷糊”——不知道自己在干嘛。
但"让 Agent 知道该做什么"很难直接定义——你无法枚举所有可能的任务状态,也无法为每一步都标注一个"正确记忆"。
3.2 POMDP 建模:将记忆问题纳入数学框架
论文将长时域 LLM Agent 的交互过程建模为部分可观测马尔可夫决策过程(POMDP):
$$\mathcal{M} = \langle \mathcal{S}, \mathcal{A}, \Omega, \mathcal{T}, \mathcal{O}, \mathcal{R}, \gamma \rangle$$其中:
| 符号 | 含义 | 通俗解释 |
|---|---|---|
| $\mathcal{S}$ | 状态空间 | 任务当前的真实状态(比如"已经找到了 3 个线索,还需要找 2 个") |
| $\mathcal{A}$ | 动作空间 | Agent 可以做的事情(搜索、点击、回答等) |
| $\Omega$ | 观测空间 | Agent 能看到的信息(搜索结果、网页内容等) |
| $\mathcal{T}$ | 状态转移函数 | 做完一个动作后,任务状态怎么变 |
| $\mathcal{O}$ | 观测函数 | 每个状态下 Agent 能观测到什么 |
| $\mathcal{R}$ | 奖励函数 | 做得好给奖励,做得差给惩罚 |
| $\gamma$ | 折扣因子 | 未来奖励的重要程度 |
关键洞察:Agent 无法直接看到真实的任务状态 $s_t$(比如它不知道还差几个线索),只能通过记忆摘要 $m_t$ 来推断。这就是"部分可观测"的含义。
3.3 信念状态与摘要诱导信念
在标准 POMDP 中,信念状态是智能体对真实状态的概率估计:
$$b_t(s) = P(s_t = s \mid h_t)$$其中 $h_t$ 是到时刻 $t$ 为止的完整交互历史。
但在记忆增强的 Agent 中,Agent 看到的不是完整历史 $h_t$,而是压缩后的记忆摘要 $m_t$。因此,信念变成了摘要诱导信念:
$$b_t^M(s) = P(s_t \mid m_t)$$问题就出在这里:如果记忆摘要 $m_t$ 丢失了关键信息或引入了噪声,那么 $b_t^M(s)$ 就会偏离真实的 $b_t(s)$——这就是信念偏差(Belief Deviation)。
3.4 问题的本质抽象
排除掉所有外部干扰,论文要解决的最本质问题是:
如何在不依赖外部标注的情况下,自动评估每一步记忆摘要诱导的信念质量,并据此优化记忆策略?
具体来说,这个问题包含三个子挑战:
- 度量挑战:如何量化"记忆是否让 Agent 对任务状态有清晰认知"?——需要一个可计算的指标。
- 监督挑战:如何在没有"标准答案"的情况下提供训练信号?——需要一个自监督的代理信号。
- 信用分配挑战:如何将中间记忆质量的信号与最终任务结果结合,实现精准的策略优化?——需要一个有效的奖励组合机制。
四、问题解法
4.1 总体思路
MMPO 的解法可以用一句话概括:
让模型在每一步都问自己一个"检验问题",通过回答这个问题时的不确定程度来评估记忆质量。
这就像老师检查学生是否理解课文——不是直接问"你理解了吗"(学生会说理解了),而是问"请总结一下这段话的主要观点"(如果支支吾吾说不清楚,说明没理解)。
4.2 Belief Entropy(信念熵):量化"记忆好不好"
核心公式:
$$\mathcal{H}_{\text{BE}}(m_t) \triangleq H(y \mid m_t, q)$$其中:
- $m_t$ 是当前记忆摘要
- $q$ 是一个锚点问题(Anchor Question)
- $y$ 是模型对锚点问题的回答
- $H(y \mid m_t, q)$ 是回答 $y$ 在给定记忆和问题条件下的预测熵
通俗解释:给模型一个关于当前任务进展的问题,看它回答时有多"犹豫"。如果模型非常确定(低熵),说明记忆足够好,让模型清楚当前状态。如果模型很犹豫(高熵),说明记忆不够好,模型对当前状态感到模糊。
锚点问题的设计是关键一环。论文设计了两种锚点问题:
| 任务类型 | 锚点问题 |
|---|---|
| QA 任务 | “基于当前记忆,我们的任务进展如何?还需要什么信息?” |
| 工具使用任务 | “基于当前记忆,我们的任务进展如何?还剩什么步骤?” |
注意,这些锚点问题不需要人工标注答案!它们的目的是探测不确定性,而不是评估答案的正确性。
4.3 Token 级预测熵的具体计算
Belief Entropy 的实际计算是在 token 级别进行的。当模型回答锚点问题时,每一个 token 的生成都有一个概率分布(模型对"下一个词是什么"的预测)。论文利用这个概率分布来计算熵:
$$\widehat{\mathcal{H}}_{\mathrm{BE}}(m_t) = \frac{1}{|y^*|} \sum_{\ell=1}^{|y^*|} \left[ -\sum_{v \in \mathcal{V}_\ell} \tilde{\pi}_{\mathrm{LLM}}(v \mid m_t, q, y^*_{<\ell}) \log \tilde{\pi}_{\mathrm{LLM}}(v \mid m_t, q, y^*_{<\ell}) \right]$$通俗拆解:
- 让模型基于当前记忆 $m_t$ 回答锚点问题 $q$,生成回答 $y^*$
- 对于回答中的每一个位置 $\ell$,模型都有一个"下一个词预测"的概率分布
- 对每个位置计算预测分布的熵(不确定性)
- 取所有位置的平均值作为最终的 Belief Entropy
这完全不需要额外标注——只需要在模型正常生成回答时,把每一步的预测概率记录下来计算熵即可。这就是"自监督"的含义。
4.4 训练流程:三阶段流水线
MMPO 的训练过程分为三个阶段:
阶段一:轨迹采样
对每个任务,采样 $N$ 条完整的交互轨迹。每条轨迹包含多轮交互,每轮都会生成一个记忆摘要。
阶段二:Belief Entropy 计算与奖励构建
对于轨迹中每一步 $k$ 的记忆摘要 $m_k$:
$$R_k = \alpha \cdot \underbrace{\sigma(-\mathcal{H}_{\text{BE}}(m_k))}_{\text{信念奖励} \in (0,1)} + \underbrace{r_{\text{final}}}_{\text{结果奖励} \in [0,1]}$$其中:
- $\sigma(\cdot)$ 是 sigmoid 函数,把 Belief Entropy 映射到 $(0,1)$ 区间
- $\alpha = 0.5$ 控制信念奖励的权重
- 注意符号:$-\mathcal{H}_{\text{BE}}$ 表示熵越低,奖励越高(记忆越清晰越好)
阶段三:回合级优势聚合与策略更新
采用 GRPO 的组相对归一化机制:
组内标准化:对同一 prompt 的多条轨迹进行组内归一化
$$\hat{A}_k^{(i)} = \frac{R_k^{(i)} - \text{mean}(R_k)}{\text{std}(R_k)}$$回合级聚合:将同一条轨迹中从当前步到结尾的所有优势取平均
$$A_t^{(i)} = \frac{1}{T-t+1} \sum_{k=t}^{T} \hat{A}_k^{(i)}$$PPO 裁剪目标更新策略参数
4.5 为什么需要回合级聚合?
这是论文中一个精妙的设计。直觉上来说:
- 单一子轨迹的奖励只反映"那一步"的记忆质量,但记忆是一个连续过程——第 3 步的记忆影响了第 4 步,进而影响第 5 步。
- 回合级聚合把从当前步到结尾的所有子轨迹奖励都考虑进来,相当于在说:“如果你的记忆在第 3 步就很好,而且第 4 步、第 5 步……一直到最后的记忆都很好,那么第 3 步的记忆策略应该得到更高的奖励。”
这解决了一个关键问题:记忆的长期效应。好的记忆不仅在当下有用,还会影响后续所有步骤的质量。
4.6 训练开销分析
| 项目 | 开销 |
|---|---|
| 每轮额外前向传播 | 1 次(计算 Belief Entropy) |
| 训练时间额外开销 | ~12% |
| 推理时额外开销 | 0%(标准解码不需要 BE)或 ~5%(作为置信度信号) |
也就是说,Belief Entropy 只在训练时使用,推理时完全不影响速度。即使作为推理时的置信度信号(比如在多条候选轨迹中选择最优的),开销也只有 ~5%。
五、必要知识反推
如果让一个完全没有相关知识的人来完成这篇论文的工作,他需要掌握哪些信息?我们从"发现问题"到"解决问题"两个维度来反推。
5.1 发现问题需要什么知识?
知识 1:LLM Agent 的记忆机制及其缺陷
- 必须了解记忆增强 Agent 的基本工作方式——递归摘要、记忆更新策略
- 必须观察到现有方法(如 MemAgent、MEM1)训练时只使用最终结果奖励
- 必须意识到这导致了稀疏信用分配问题——模型无法知道中间哪一步的记忆出了问题
知识 2:信念偏差是长序列失败的根本原因
- 必须将记忆问题放在 POMDP 框架下理解——记忆摘要实际上是对任务状态的信念近似
- 必须通过实验观察到:在失败轨迹中,记忆摘要的语义质量逐步退化,导致信念偏离真实状态
- 这需要对 POMDP 理论、信念状态更新机制有深入理解
知识 3:递归摘要中的信息论性质
- 必须理解信息熵作为不确定性度量的理论基础
- 必须能够区分"认识论不确定性"(epistemic uncertainty,因为信息不足导致的不确定)和"随机不确定性"(aleatoric uncertainty,本质上随机的不确定)——这里关注的是前者
- 必须理解 Shannon 信息论中的条件熵概念
5.2 解决问题需要什么知识?
知识 4:元认知理论的"自我评估"机制
- 必须了解 Flavell(1979)和 Nelson(1990)的元认知理论——尤其是"元认知监控"(评估自身认知状态的能力)的概念
- 必须能够将"元认知监控"映射为一个可计算的信号——即 Belief Entropy
- 必须理解"锚点问题"作为一种探测工具的思想——通过提问来揭示内部状态
知识 5:LLM 的预测概率分布与不确定性估计
- 必须理解 LLM 在生成每个 token 时都有一个概率分布(logits → softmax)
- 必须知道如何从这个分布中计算预测熵
- 必须理解为什么"模型回答问题时的不确定性"可以作为"模型对任务状态清晰度"的代理
知识 6:强化学习中的密集奖励设计
- 必须了解 PPO、GRPO 等 RL 算法的原理和优缺点
- 必须理解"密集奖励 vs 稀疏奖励"对训练效果的影响
- 必须能够设计将中间奖励(Belief Entropy)与结果奖励(outcome reward)有效组合的奖励函数
- 必须理解 GRPO 的组相对归一化机制,以及为什么它不需要 Value Network
知识 7:实验验证方法论
- 必须能够设计消融实验来验证 Belief Entropy 的有效性(锚点问题设计、代理信号对比)
- 必须理解统计相关性分析(Pearson 相关系数)来验证 Belief Entropy 与任务准确率的关系
- 必须能够在多种任务和不同上下文长度上验证方法的泛化性
5.3 知识融合的关键路径
这些知识并不是独立使用的,而是需要按照特定的逻辑路径进行融合:
步骤 1: POMDP 建模(知识 2)+ 信息论(知识 3)
→ 将记忆问题形式化为"信念状态的熵"
步骤 2: 元认知理论(知识 4)+ LLM 预测分布(知识 5)
→ 设计锚点问题 + 预测熵 = Belief Entropy
步骤 3: 密集奖励设计(知识 6)+ GRPO(知识 6)
→ 将 Belief Entropy 转化为可训练的奖励信号
步骤 4: 实验验证(知识 7)
→ 在多任务、多长度、多消融条件下验证有效性
这条路径的关键在于:每一步都同时需要"理论"和"工程"两方面的知识。仅有理论理解(比如知道 POMDP 和信息熵)而不懂工程实现(比如如何从 LLM 中提取 token 级预测概率),是无法完成这篇论文的。反之,仅懂工程而不理解理论(比如不理解为什么熵可以代理信念质量),也无法提出 Belief Entropy 这个核心概念。
六、论文中可以提取的通用性灵感
灵感 1:用"提问时的犹豫程度"来评估内部状态质量
核心思想:不直接评估某个中间表征好不好,而是让模型回答一个关于当前状态的问题,通过回答时的"不确定性"来间接评估。
通用性推广:
- 在推荐系统中:不确定推荐是否准确?让系统回答"为什么推荐这个",如果回答很犹豫,说明推荐理由不充分。
- 在自动驾驶中:不确定对当前路况的判断?让系统回答"前方有什么障碍物",如果回答不确定,说明感知不够清晰。
- 在代码生成中:不确定生成的代码是否正确?让模型解释"这段代码做了什么",如果解释含糊,说明模型对代码的理解不够深入。
灵感 2:用中间状态的"自知之明"作为密集训练信号
核心思想:当最终结果信号太稀疏时,不要只在终点给奖励,而是在每一步都引入一个自监督的中间信号。
通用性推广:
- 在多步骤推理中:不只看最终答案对不对,还在每一步让模型"自评"对当前推理步骤的信心,作为过程奖励。
- 在多轮对话中:不只看用户最终是否满意,还在每轮让模型评估自己是否充分理解了用户意图。
- 在项目管理中:不只看项目最终是否按时交付,还在每个里程碑评估团队是否清楚当前进展和风险。
灵感 3:“Progress + Gap” 双探测比单一探测更有效
核心思想:锚点问题同时询问"进展如何"和"还缺什么"比只问其中一个更有效(消融实验中"Progress + Gap"比"Direct-answer"和"Gap-only"都好)。
通用性推广:
- 在学习评估中:不只问学生"你学到了什么"(progress),还要问"你觉得还不会什么"(gap),两者结合才能准确评估学习状态。
- 在系统监控中:同时监控"系统正常运行了什么"和"系统还有什么异常",比只监控其中一个更能反映系统真实状态。
- 在团队管理中:同时了解"团队完成了什么"和"团队遇到了什么困难",才能做出更好的决策。
灵感 4:“简洁的自监督信号"比"复杂的监督机制"更实用
核心思想:Belief Entropy 的计算只需要一次额外的前向传播(约 12% 额外训练开销),不需要额外的标注数据或辅助模型,却带来了显著的效果提升。
通用性推广:
- 在模型评估中:与其设计复杂的评估流程,不如找到一个简单但有效的自评估指标。关键是指标与最终目标有强相关性(论文中 Pearson $r = -0.684$)。
- 在系统优化中:与其引入复杂的监控体系,不如找到一个轻量的健康检查指标,能够快速、低成本地反映系统状态。
灵感 5:超长上下文的"97.1% 保持率"揭示了一个重要规律
核心思想:MMPO 在从 7K 扩展到 1.75M token(250 倍增长)时,仅损失了约 2.9% 的性能。这说明记忆策略的优化可以在极端尺度上保持稳定。
通用性推广:
- 这为超长任务序列的 Agent 设计提供了信心——如果中间记忆的信念质量得到保证,Agent 在百万级 token 的任务中依然可以保持高性能。
- 在系统设计中:如果一个中间处理环节的质量得到严格保证,那么整个系统的性能衰减可以被控制在极小范围内,即使在极端工作负载下也是如此。
灵感 6:元认知不仅是理论隐喻,可以成为可计算的工程工具
核心思想:论文将认知科学中的"元认知监控"概念从理论隐喻转化为了可计算的 Belief Entropy,并证明了其工程有效性。
通用性推广:
- 在AI 安全中:可以通过类似的"自评估"机制让模型在每一步都评估自己的确定性,在不确定时主动求助或拒绝操作。
- 在可解释 AI中:Belief Entropy 提供了一种不依赖外部标注的、内在的"模型置信度"信号,可以作为解释模型决策过程的依据。
- 这启发我们:认知科学中的许多概念(如元认知、工作记忆、注意力调控)都有可能被形式化为可计算的机制,而不仅仅是比喻。
附录:实验结果速览
A. 主实验:RULER-HotpotQA(不同上下文长度下的准确率)
| 上下文长度 | RL-MemAgent-7B | MMPO-7B | 提升 |
|---|---|---|---|
| 224K | 75.78% | 79.56% | +3.78% |
| 448K | 76.56% | 78.12% | +1.56% |
| 896K | 74.22% | 79.69% | +5.47% |
| 1.75M | 77.34% | 78.91% | +1.57% |
| 3.5M | 71.88% | 75.22% | +3.34% |
B. 多目标 QA(与 MEM1 对比)
| 目标数 | MEM1 F1 | MMPO F1 | 提升 |
|---|---|---|---|
| 2-Obj | 0.838 | 0.852 | +1.7% |
| 8-Obj | 2.31 | 2.63 | +13.8% |
| 16-Obj | 2.39 | 2.84 | +18.8% |
C. WebShop(交互任务)
| 方法 | 平均奖励 |
|---|---|
| MEM1-WebShop | 70.87 |
| MMPO | 77.25 (+9.0%) |
D. 关键发现:Belief Entropy 的经验验证
- Finding 1:成功轨迹中 $\mathcal{H}_{\text{BE}}$ 持续下降(模型越来越清楚任务状态),失败轨迹中 $\mathcal{H}_{\text{BE}}$ 停滞或上升(模型越做越迷糊)。
- Finding 2:熵下降总量 $\Delta\mathcal{H}_{\text{BE}}$ 与最终任务准确率强相关(Pearson $r = -0.684$)。
- Finding 3:无需额外训练,在推理时直接用 Best-of-5 策略(选择 Belief Entropy 最低的轨迹),就能提升准确率。