论文链接:arxiv.org/abs/2608.25618 代码仓库:github.com/DongzhuoranZhou/AWM 发表时间:2026年8月 机构:University of Oslo、University of Stuttgart、HKUST(广州)、清华大学、Bosch Center for AI——企业+高校合作:高校团队(Dongzhuoran Zhou、Yule Liu 等)主导方法与实验设计,Bosch AI 中心提供工业视角支持(作者同时挂靠 Oslo 与 Bosch),清华团队(Yuxiao Dong、Jie Tang)提供算力与数据生态支撑 领域标签:cs.CL / 长文档 VQA / Agent 记忆 / RL 后训练


一、论文背景

1.1 什么是长文档视觉问答(Long-Document VQA)?

想象你要从一份 150 页的财报 PDF 里回答「2022 年研发支出占比多少?」——文档里答案可能藏在一张图表、一个跨页表格或一段正文里。长文档 VQA 就是让 AI 完成这件事:输入一份多页文档(几十到几百页)和一个问题,输出答案。它难在三点:文档太长无法一次塞进模型、证据形式混合(文本+表格+图+图表)、答案往往需要跨页整合。

1.2 VLM Agent 的检索-查看-记忆循环

现在的主流做法不是「硬塞全文」,而是让 **VLM Agent(视觉语言模型智能体)**模拟人类的翻阅过程:

  1. 检索:根据问题检索候选页面(拿到的是页面图像而非文本);
  2. 查看:观察页面图像;
  3. 写工作记忆:把发现追加到 Working Memory——每条记录形如 {source_page: p_i, finding: "..."} 的源链接条目;
  4. 作答:循环若干轮后输出最终答案与终端工作记忆。

工作记忆就像你查资料时做的笔记:它要在页面翻过去之后,替页面「记住」答案相关的证据。

1.3 被忽视的问题:笔记质量没有人在评

现有评测只看两件事:最终答案对不对、有没有访问到证据页。至于 Agent 留下的笔记(工作记忆)质量如何——没人检查。

这造成一个盲区:Agent 可能「当场看图答对了」,但笔记只写了一句「图表显示了趋势」这种泛泛之词。一旦把页面图像撤走、只留笔记,这个答案就无法复现。这不是较真——工作记忆是 Agent 跨步骤整合证据的唯一载体,笔记太泛意味着后续推理实际依赖的是「一次性看图记忆」,多轮整合就成了空中楼阁。

论文用一个数字刺穿了这个盲区:即便直接把金标证据页喂给 Agent,42.5% 答对的样本,其终端工作记忆依然不足以独立支撑答案。

二、论文定位和关联工作

2.1 研究谱系一:长文档 VQA Agent

工作核心思路与 AWM 的关键区别
M3DocRAG / VisRAG / MoLoRAG 等多模态 RAG 检索页面后直接作答不维护工作记忆,或只当辅助
Doc-V* (Zheng et al. 2026)顺序页面导航 + 结构化工作记忆 + GRPO 训练导航策略AWM 保持其架构,但评并奖励记忆的可答性
MemSearcher文本搜索 Agent 的紧凑跨轮记忆文本而非页面图像;多上下文 GRPO 传播优势
AgenticRAG-R1 / TC-RAG栈式记忆 / 图灵完备 RAG记忆结构创新,不评估记忆是否「可答」

关键区别:此前工作的记忆是「过程工具」,AWM 第一次把终端工作记忆当作被评估、被优化的答案性证据工件。

2.2 研究谱系二:中间状态监督

  • TableQA 的表格剪枝(Ye et al. 2026 等):保留答案关键内容——监督的是「输入保留什么」;
  • CapRL / Vision-SR1:奖励「可答的描述」——针对单张图的字幕/描述;
  • Perception-R1:检查推理响应中的视觉内容是否与标注一致。

AWM 的差异:评估的是跨多次页面查看累积的、问题条件化的终端工作记忆,而非单张图或单步描述。

2.3 研究谱系三:记忆评估与证据引用

  • 证据引用研究(Gao et al. 2023 等):查「答案是否被引用支撑」——与可答性互不包含:可答的记忆可能含无据断言,有据的记忆可能漏掉答题所需事实;
  • 可解释性中的记忆探针(Patchscopes):查内部激活是否编码事实——AWM 查的是外化的、源链接的终端记录。

定位结论:AWM 站在「Agent 记忆」与「RL 后训练」的交汇点,贡献不是新架构,而是新评估视角(memory-only answerability)+ 新奖励机制(四格 GRPO 奖励)。

三、问题定义

3.1 从具体场景出发

具体问题:长文档 VQA Agent 答对了问题,但它的工作记忆写得太泛,删掉页面图像后答案无法从记忆复现。现有评测完全看不到这个缺陷,RL 奖励也从不惩罚它。

3.2 核心洞察:把「记忆」从过程产物升格为「可评估的证据工件」

论文的抽象跳跃是:终端工作记忆本身应当是一个「可独立作答的证据工件」。判断标准不需要人工定义「什么是好笔记」——只需要一个操作性检验:一个只拿到 (问题, 终端记忆) 的冻结读者模型,能否答对?这就是 memory-only answerability。

3.3 形式化定义

长文档 VQA 实例为 $(D, q, y)$,$D=\{p_1,...,p_N\}$ 为多页文档。Agent 策略 $\pi$ 循环「检索→查看→追加源链接 finding」,输出最终答案 $\hat{y}$ 与终端记忆 $M_{term}$。

诊断:冻结读者 $R$ 只接收 $(q, M_{term})$,产出记忆答案 $R(q, M_{term})$;官方裁判 $J$ 对 $\hat{y}$ 与记忆答案分别打分,二值化后得两个二元变量:

  • $s_{ans} = \mathbf{1}[J(\hat{y}, y)>0]$(答案对错)
  • $s_{mem} = \mathbf{1}[J(R(q,M_{term}), y)>0]$(记忆可答性)

四格划分:

最终答案记忆可答案例名
✓✓memory-supported correct(完全成功)
✓✗memory-missing correct(MMC,焦点案例)
✗✓answering error(答错了但笔记有用)
✗✗unresolved error(完全失败)

汇总指标 $P_{mmc}$:答对样本中记忆不可答的比例——条件在 $s_{ans}=1$ 上,排除了「本来就答错」的混淆,专门问「答对之后记忆够不够」。

优化目标:设计 GRPO 奖励,使轨迹按 (答案对错 × 记忆可答) 双维度排序,且保持答案优先。

3.4 抽象的精妙之处

用「外部读者能否复现答案」定义记忆质量,绕开了「好笔记」的主观定义——可答性是功能性标准(能不能用),不是风格性标准(写得好不好看)。且它天然可自动化:冻结模型 + 官方裁判即可规模化。

四、问题解法

4.1 动机诊断:先证明问题真实存在且值得修

类比:先给病人做检查,再开药。论文用两个诊断实验完成论证:

诊断一(现状测量):在 MMLongBench-DOC 固定 500 例可答子集上测基础 Agent(Qwen3-VL-4B 无后训练):

设定答案准确率记忆可答率MMC/答对数$P_{mmc}$
完整多轮33.4%27.4%43/17225.0%
给金标证据页36.2%30.2%77/18142.5%

关键读数:给了金标页,$P_{mmc}$ 反而从 25% 升到 42.5%——页面越容易拿到,Agent 越依赖「当场看图」,笔记越潦草。页面访问与答案正确都不保证记忆可答。

诊断二(记忆质量是否因果影响答题):控制金标页访问不变,只换终端记忆:空记忆 → 答案率 2.8%;原 Agent 记忆 → 36.2%;GPT-4o 从同样金标页改写的「改进记忆」→ 44.4%(记忆可答率 44.8%)。只改记忆就能涨 8.2 点——记忆质量是因果变量,不是相关变量。

4.2 AWM-GRPO:四格奖励的设计

类比:GRPO 像班级内相对排名——每题采样 G 条轨迹组成一组,组内归一化决定谁被强化。关键不是绝对分数,而是排序。

GRPO 机制回顾:$A_i = (r(\tau_i) - \mu_g)/(\sigma_g + \epsilon)$。组内归一化后,优势排序完全由奖励排序决定:$A_z - A_{z'} = (r_z - r_{z'})/(\sigma_g + \epsilon)$。

要实现的三条偏好:

  1. 记忆精炼:都答对时,记忆可答 > 记忆不可答——$(1,1) \succ (1,0)$;
  2. 答案门控:答对但记忆不完美 > 答错但留有用记忆——$(1,0) \succ (0,1)$(答案优先);
  3. 有用记忆失败:答错留有用记忆 > 完全失败——$(0,1) \succ (0,0)$。

最小四格标量奖励:复用两个二元变量,定义

$$R_{AWM}(s_{ans}, s_{mem}) = r_{s_{ans} \cdot s_{mem}}, \quad (r_{11}, r_{10}, r_{01}, r_{00}) = (\beta, 0, \gamma, \omega), \quad \beta > 0 > \gamma > \omega$$

默认取值 $(2, 0, -0.1, -1)$。锚定 $r_{10}=0$ 是点睛之笔:答对但记忆不完美被固定在原点,低于完全成功($\beta=2$)、高于答错留有用记忆($\gamma=-0.1$)。

与 answer-only 奖励的本质区别:$R_{ans}(s_{ans}) = s_{ans}$ 给 $(1,1)$ 和 $(1,0)$ 打同分 1——记忆质量在组内优势中结构性不可见,GRPO 对记忆的任何影响都是偶然的。AWM 奖励把这两格的差 $\beta=2$ 显式暴露给组归一化。

组组成依赖的动力学:单元优势符号由组均值决定($A_z > 0 \Leftrightarrow r_z > \mu_g$)。训练早期多数轨迹失败($\mu_g$ 低),$(1,0)$ 还能拿正优势(先学会答对);随着 $(1,1)$ 变多、$\mu_g$ 升过 0,$(1,0)$ 转负、正优势向完全成功集中(再学会写好笔记)——「答案优先、记忆精炼在后」是组动力学涌现的课程,不是硬编码。

4.3 蒙特卡洛验证:奖励机制的行为推演

论文用仿真单独验证奖励→优势的转化:固定四格分布、抽 15,000 组×每组 8 条轨迹。左列(answer-only)里「答对+记忆可答」与「答对+记忆不可答」混成一个区域;右列(AWM)两者分离,且随 $p_{11}$(完全成功概率)从 0.08→0.30→0.60 上升,红色「答对但记忆不可答」曲线沉到零以下——机制在受控环境下被独立验证,不依赖真实训练的混杂因素。

4.4 训练实现要点

  • 策略模型:Qwen3-VL-4B-Instruct(SGLang 服务),检索用 Jina v4 页面图像嵌入 + Qdrant 索引(Top-3),最多 15 步,追加式强制记忆更新;
  • 奖励打分器:在线训练时用冻结本地 Qwen3-14B 生成记忆答案并打两个分(只更新 4B 策略);诊断报告用官方裁判;
  • 数据:后训练提示来自 DOC-750K(与评测集不交),994 条 SFT 轨迹(kimi-k2.5 教师)+ 226 个混合难度 GRPO 组;
  • 变体受控:五个对比(direct input / RAG Top-3 / SFT / Answer-GRPO / AWM-GRPO)共享同 backbone、检索、工具、记忆 schema、prompt、优化器,只有后训练与奖励不同——这是因果归因的关键设计。

五、评估指标与实验证据

5.1 指标体系

指标定义衡量什么
最终答案准确率官方裁判对 $\hat{y}$ 的广义准确率任务本身的完成度(主指标)
记忆可答准确率读者从 $(q, M_{term})$ 作答的准确率记忆的独立证据价值
$P_{mmc}$答对样本中记忆不可答比例记忆质量盲区的规模(越低越好)

5.2 基准

  • MMLongBench-DOC(N=1082):混合文本/表格/图表/版面的多页 PDF 问答;
  • LongDocURL(N=2325):长文档理解+推理+定位。

5.3 主实验:最终答案准确率

方法MMLongBench-DOCLongDocURL
direct input(无检索无记忆)43.5–
VLM + RAG Top-3(无记忆)45.848.2
AWM-Agent (SFT)49.255.7
+ Answer-GRPO51.657.4
+ AWM-GRPO53.960.1

受控对比增益:比 RAG +8.1/+11.9,比 SFT +4.7/+4.4,比 answer-only GRPO +2.3/+2.7——最后这组最有说服力:同模型、同数据、同优化器,唯一差异是奖励结构,增益只能来自记忆信号。外部参照:Doc-V*(GRPO, 7B)为 42.1/56.3,AWM-GRPO 用 4B 模型在两个基准上都超过它。

5.4 记忆质量分析

完整多轮设定(1082 条轨迹):

变体答案准确率记忆准确率$P_{mmc}$
SFT40.838.517.7%
+ Answer-GRPO43.242.519.9%(恶化)
+ AWM-GRPO45.444.517.2%(改善)

注意 Answer-GRPO 的 $P_{mmc}$ 从 17.7% 升到 19.9%——答案奖励涨分的同时记忆质量在变差,这正是「盲区」的直接证据。AWM-GRPO 三项指标同时改善。

EP-given 设定(733 例,金标页替代检索):AWM-GRPO 答案 48.0 vs 45.4、记忆 43.5 vs 41.2、$P_{mmc}$ 16.4% vs 19.1%——控制页面访问后奖励依然有效,排除了「只是检索变好」的解释。

训练动态:记忆可答准确率从 step 40 的 38.8 单调升至 step 280 的 43.5——奖励持续起作用。

按证据源分解:mixed visual+text($P_{mmc}$ 36.2→22.2)、figure(20.3→16.2)、chart(21.4→17.5)、text-multi(31.8→24.0)均改善;table 与 layout 反而升高——结构化证据的保存是未解决的残留问题,作者如实报告。

5.5 为什么实验设计能证明论点

三层递进:(1) 诊断实验证明问题存在(42.5% 盲区)且记忆是因果变量(换记忆 ±8 点);(2) 受控对比隔离奖励结构(唯一变量是奖励,+2.3 点);(3) EP-given 设定排除检索混淆。加上蒙特卡洛仿真独立验证机制——证据链完整。

六、效果优势的根源解释

对比对象:answer-only GRPO——它为什么曾经有效?因为它把「答案对错」这个稀疏但真实的信号变成组内排序,足以教会 Agent「检索到对的页、答对」。

它的根本局限在表征层面:奖励函数把轨迹空间投影到一维(对/错),$(1,1)$ 与 $(1,0)$ 被折叠为同一点。GRPO 的更新方向由组内优势差决定——两个不可区分的格子之间优势差恒为零,记忆质量这个维度在优化几何里根本不存在。Answer-GRPO 的 $P_{mmc}$ 恶化到 19.9% 不是意外:策略找到的最短路径是「提高当场看图效率」,笔记沦为装饰。

AWM 奖励的根本性改变:

  1. 优化空间的维度恢复:四格奖励在「答对区」内撕开一条 $\beta=2$ 的间隙,使 $(1,1)$ 与 $(1,0)$ 在组归一化后产生非零优势差 $A_{11} - A_{10} = \beta/(\sigma_g+\epsilon)$。记忆质量从「不可见」变「可排序」——GRPO 的梯度从此有了指向「写问题条件化 finding」的分量。因果链:奖励区分度 → 组内优势差 → 策略偏好「答对且留证据」→ 每次查看后写下「2020 自给率 4.7%」式的具体 finding 而非「图表显示趋势」→ 记忆可答率与最终准确率同升(53.9 与 44.5)。
  2. 最终答案也涨的机制:为什么奖励记忆连答案都涨了 2.3 点?因为问题条件化的 finding 改变了多轮整合的信息基础——后续轮次的推理读的是高密度笔记而非靠注意力回头翻页面图像,整合更稳。EP-given 实验佐证:页面访问完全固定,答案仍从 45.4 升到 48.0,增益只能来自记忆通路。
  3. 组动力学的自适应课程:锚定 $r_{10}=0$ 让 $(1,0)$ 的正负号随组均值翻转——训练早期答对就被奖励,后期标准自动收紧到「答对+可答」。不需要手工课程表。

反事实验证:把奖励换回 answer-only → $P_{mmc}$ 恶化;把记忆信号去掉格式/风格评分(AWM 不评风格长度)→ 证明起作用的确实是「可答性」这个功能性信号。

如实说明:仅 Qwen3-VL-4B 单尺度、两个基准;记忆读者依赖冻结 Qwen3-14B 未做第二读者鲁棒性测试;奖励衡量可答性而非完整溯源——可答记忆可能含无据断言。

七、必要知识反推

7.1 领域知识层

  • 长文档 VQA 的循环范式(检索→查看→记忆→作答)与工作记忆 schema(源链接 finding):不理解「记忆是跨步骤证据载体」,就看不出笔记泛泛是多轮整合的隐患;
  • 基准的官方裁判协议:answer 抽取 + 确定性规则的广义准确率——四格分析的 $s_{ans}/s_{mem}$ 都建立在它上面。

7.2 方法论知识层

  • GRPO 的组内归一化机制:核心洞察「优势排序=奖励排序」直接决定了奖励设计思路——只需控制格子间的排序,无需调绝对分数;
  • 中间状态监督研究脉络(CapRL/Vision-SR1/表格剪枝):知道前人监督过「描述可答性」「输入保留」,才能定位「累积终端记忆可答性」这个空位;
  • 证据引用 vs 可答性的逻辑关系(互不包含):防止把 AWM 误当引用系统的重复发明;
  • 蒙特卡洛仿真验证方法论:在真实训练前用合成分布验证奖励的组动力学行为。

7.3 工程知识层

  • 受控变体设计:五变体共享一切、只差后训练与奖励——归因的工程前提;
  • 冻结读者+冻结打分器的在线奖励管线(Qwen3-14B 本地服务):奖励可自动化且不泄漏进策略更新;
  • 难度均衡采样与教师轨迹构造(DOC-750K 子集、kimi-k2.5 教师)。

7.4 知识融合的关键节点

  • 节点一:「答案对≠记忆对」的诊断构造——把评测界的「证据页访问」检查升格为「记忆独立可答」检查,需要同时理解 Agent 记忆机制与评测方法论,再用 EP-given 设计排除检索混淆。这是全文的支点。
  • 节点二:四格排序 × GRPO 归一化——意识到 GRPO 只看排序不看绝对值,把偏好规格翻译成最小标量四格奖励(锚定 $r_{10}=0$),是 RL 机制知识与任务需求的化学反应。
  • 节点三:因果验证闭环——先证明记忆质量因果影响答案(换记忆实验),再优化记忆,最后 EP-given 复验——「诊断→干预→控制复验」的实验设计纪律。

八、论文中可以提取的通用性灵感

灵感一:中间产物应作为独立可评估的证据工件

核心思想:Agent 的中间产物(记忆、笔记、摘要、计划)不应只当过程工具,应定义为「撤走原始输入后仍能支撑任务完成」的证据工件,并用「独立读者能否仅凭它复现结果」做功能性检验。 论文证据:42.5% 答对样本的终端记忆不可答;换 GPT-4o 改进记忆使答案率 36.2→44.4(仅改记忆、其余全固定)。 推广场景:(1) 代码 Agent 的「理解摘要」质量评估;(2) 会议纪要系统的「可行动性」检验;(3) 研究助手的知识卡片管理;(4) 多轮对话产品的用户画像文件维护——凡「中间表示承载跨步信息」的系统都适用。

灵感二:奖励设计的本质是排序设计,不是分数设计

核心思想:在组相对优化(GRPO 类)中,起作用的只有轨迹间排序——设计奖励时先写清「谁必须排在谁前面」的偏好规格,再找最小标量实现。 论文证据:三条偏好(记忆精炼/答案门控/有用失败)翻译为 $(2,0,-0.1,-1)$;蒙特卡洛仿真显示优势分布完全由格子差决定。 推广场景:(1) 任何 RLHF/RLVR 的奖励规格化流程;(2) 排序学习中的偏好约束设计;(3) 多目标 Agent 训练的字典序实现。

灵感三:不可见的维度要用「折叠-撕开」诊断暴露

核心思想:如果现有指标把两种本质不同的成功折叠为同一类(答对+记忆好 vs 答对+记忆差),优化就会系统性牺牲被折叠的维度——先构造指标把它撕开,再优化。 论文证据:Answer-GRPO 的 $P_{mmc}$ 从 17.7% 恶化到 19.9%(答案奖励以记忆为代价);AWM 奖励撕开后三项指标同升。 推广场景:(1) Agent 评估中「答对但过程违规」的折叠;(2) 推荐系统「点击高但体验差」的折叠;(3) 编译器「跑分高但代码不可维护」——Goodhart 定律的系统性检测与修复。

灵感四:组动力学可以涌现训练课程

核心思想:把中间格子的奖励锚定在组均值翻转点上,优化器会在早期容忍「部分成功」、后期自动收紧标准——课程不需要手工编排,可以从组相对归一化的动力学中涌现。 论文证据:$r_{10}=0$ 使 $(1,0)$ 随 $\mu_g$ 上升自动转负;仿真显示 $p_{11}$ 升高时红色曲线沉入负区。 推广场景:(1) 课程学习的自动化替代;(2) 多级质检标准的渐进收紧;(3) 团队绩效评估的相对标准设计。

灵感五:先证明「值得修」,再动手修

核心思想:动手优化一个中间质量之前,先用受控干预证明它是因果变量(只改它、结果真的变)——避免在相关性变量上浪费训练算力。 论文证据:空记忆/原记忆/改进记忆的三元对照(2.8/36.2/44.4)在训练任何模型之前就完成了论证。 推广场景:(1) ML 管线中「先做 oracle 上界分析再决定优化哪个组件」;(2) 产品迭代中的 A/B 前置因果验证;(3) 科研中的「干预实验先于机制设计」。


一句话总结:AWM 告诉我们,Agent 答对了不等于记对了——把「笔记能否独立支撑答案」变成可计算、可奖励的信号后,答案和记忆第一次被同时优化,而且答案是搭着记忆的便车一起涨的。