论文链接:https://arxiv.org/abs/2608.26141 代码:https://github.com/PriNing/AdaThinking-E 发表时间:2026 年 6 月(arXiv:2608.26141) 机构:美团 + 上海交通大学 + 中国科学院自动化所(企业主导的企业+高校合作,美团为第一单位)
一、论文背景
过去两年,多模态大模型(MLLM)在文档理解上取得了长足进步:从识别图片里的文字,到解读复杂表格、图表,再到跨页面的逻辑推理。这背后很重要的推手是强化学习——通过 RL 让模型学会生成逐步推理链(Chain-of-Thought),先想后答。像 Qwen3-VL-Thinking 这样的模型已经能对复杂图表问题给出相当扎实的分析。
但一个新的问题浮出水面:思考是万能的吗?显然不是。 论文举了一个很直白的例子:“这份备忘录是哪个部门发的?"——答案就写在文档抬头里,直接抽取即可。对这种问题强行开启深度推理,不仅白白烧掉几百个 token 的推理成本、拖慢响应速度,甚至会因为"想多了"产生幻觉,把本来能答对的题想错。这就是所谓的"过度思考”(overthinking)问题。
理想状态应该是:模型拿到问题后自己判断难度——简单题直答,复杂题深思。这就是"自适应思考"(adaptive thinking)。可是现状是,主流 MLLM 要么靠用户在提示词里手动指定思考开关(如 Llama-Nemotron 的 “reasoning on/off”),要么靠外部模型给问题打难度标签再决定要不要思考。前者不灵活,后者引入主观判断和高昂标注成本,而且本质上都是在"替模型做决定",模型自己并没有学会判断。
二、论文定位和关联工作
论文将相关工作分为两条线。
文档理解 MLLM:按多模态特征提取方式分为 OCR 依赖型(先用 OCR 引擎抽出文字和版面再送入 LLM)和 OCR-free 型(直接端到端处理文档图像)。近年来通过微调和强化学习提升感知与推理能力的工作很多,也有一批工作(如 L1、Sketch-of-Thought、O1-Pruner、CoT-Valve)通过压缩推理链长度来提效。但论文指出,这些压缩类方法依赖静态策略——不管题目难易都用同一套压缩逻辑,无法随难度动态调整推理深度。
自适应思考模型:可分为"外控推理模型"(靠 prompt 模板切换长短回复模式,Llama-Nemotron 是代表)和"自适应思考模型"。后者又有两派:一派(如 Overthinker’s Diet、AdaCtrl、SelfBudgeter)显式地用另一个模型估计问题难度或 token 预算;另一派(如 AdaptThink、Dual Process Thinking)用问题解决率或生成长度作为难度的隐式指标。最新的工作(Keye-VL、Mimo-VL、R-4B 等)支持思考/不思考双模式切换,普遍做法是冷启动阶段用双模式退火让模型兼备两种能力,RL 阶段再靠精心设计的规则奖励引导"要不要推理"的决策。
论文对这一派的批评很尖锐:这些规则奖励掺杂了训练者的主观意图,模型学到的是"服从外部设定的规则",而不是真正的自主模式选择能力。更关键的是,所有已有方法都没有考察模式切换的核心机制本身——输出模式切换 token 那一刻的概率分布。这正是本文的切入点。
三、问题定义
论文要解决的问题是:让文档理解 MLLM 无需人工干预、无需外部难度标签,自主学会按问题复杂度决定是否启用深度思考。
形式化地看:模型输出首位是一个"模式切换 token"(/no_think 或 /to_think),它的条件概率分布反映了模型对两种模式的不确定程度。如果模型确信问题简单,就会给 /no_think 分配高概率;反之则给 /to_think 高概率。熵——衡量概率分布不确定性的经典指标——天然就是模型"模式选择信心"的量化指标:高熵意味着模型在两种模式间犹豫不决,低熵意味着模型有笃定的判断。
于是问题被重构为一个熵主导的课程学习:训练初期维持模式切换 token 的高熵(模型充分探索两种模式),训练后期收敛到低熵(模型对每类问题形成稳定、自信的模式选择)。整个过程不需要任何人告诉模型"这道题该不该想"。
这里的挑战在于:直接用标准 RL(如 GRPO)训练这个目标会失败。作者实测发现模型会迅速坍缩为对所有问题都输出不思考模式——因为奖励均摊到每个 token 上时,短序列的单位 token 奖励天然更高,思考模式(长序列)被系统性惩罚。
四、问题解法
AdaThinking-E 的方案分两个阶段,核心创新在 RL 阶段的"双目标解耦优化"。
阶段一:冷启动(AdaThinking-Doc 数据)
为了让模型稳定具备双模式输出能力,作者构建了首个面向文档理解自适应思考的数据集 AdaThinking-Doc:覆盖信息抽取类场景(DocVQA、FUNSD、SROIE 等 14 个数据集)和推理类场景(ChartQA、CharXiv、AI2D 等 9 个数据集)。用 Seed1.5-VL 先过滤 20 万高精度数据并为每条生成思维链,再由 GPT-4o-mini 校验推理逻辑的合理性,最终保留 19.6 万有效查询。关键设计是:每条查询同时生成思考型与不思考型两种回答——不预先指定哪些题该想,避免把外部偏见注入模型,为 RL 阶段的无偏采样留足空间。输出格式统一为 模式切换token + <think>...</think><answer>...</answer>。
阶段二:RL 双目标优化
核心洞察:模式选择的决策完全取决于首位那个切换 token,与后面的回答内容无关。因此把 token 分成两类,分别挂不同的损失项——
切换 token 用熵奖励。对每个问题采样一组(16 个)回答,每个回答首位的切换 token 独立按概率分布采样,据此计算归一化熵:
H_i,0 = -(1/ln2) * Σ p_m * ln(p_m),m 遍历思考与不思考两个 token。
熵奖励设计为两阶段课程,由随训练步数变化的系数 α_k 平滑衔接:
E_i,0 = w_m * [(1-α_k) * H_i,0 + α_k * (1-H_i,0)] + p_tk + p_ntk
- 前期 α_k 小,高熵项主导:两模式概率接近五五开,模型对每个问题都充分尝试两种模式,组内采样均衡,为比较两种模式谁更优提供高质量信号;
- 后期 α_k 大,低熵项主导:鼓励某一模式概率显著占优,模型对问题类型形成笃定的分流决策;
- 末尾加 p_tk + p_ntk 确保首 token 概率集中于两个合法模式 token,不会跑到别的词上。
α_k 用 sigmoid 形式调度:α_k = 1/(1+exp(β×(γ−k/K))),其中 γ 是探索转收敛的拐点位置(占总步数比例),β 控制过渡陡峭度。消融实验确定 γ=0.4、β=10 最优。
决策反馈机制。光有熵探索还不够,得告诉模型探索结果哪个更好。对每组采样统计两种模式各自的出现率 ρ 和准确率 acc,构造模式权重:
w_m = acc_m/acc_¬m + A(acc,m) + P(acc,ρ,m,Δρ)
其中准确率按阈值 ϵ_l、ϵ_h 分低/中/高三档。准确率引导项 A 只在两模式准确率同档时激活:双低档时引导模型去思考(说明不思考答不对),双中或双高档时引导跳过思考(说明不思考也够用)。倾向性引导项 P 是防坑设计:考虑模型对某题采了 16 个样,15 个选思考且 13/15 正确(86.7%),只有 1 个选不思考且 1/1 正确(100%)——朴素按准确率比会得出"该不思考"的荒谬结论,但那 100% 只来自单样本,毫无统计可靠性。P 在两模式均高档且出现率差异超 Δρ 时激活,把优化方向拉回模型自身的倾向(思考),避免小样本噪声把训练带崩。
回答 token 用质量奖励:格式奖励(是否严格遵守模板,1/0)+ 准确率奖励(答案是否与真值一致,1/0)。与模式选择完全解耦——不管选了什么模式,回答部分只管把题做对。
五、评估指标与实验证据
实验以 Qwen2.5-VL-7B 或 Qwen3-VL-8B 为基座(RL 阶段基于 DAPO 框架,VeRL 实现,8 张 A100,2000 步),在 8 个文档基准上与不思考(NT)、思考(TK)、自适应思考(ATK)三类模型对比。
主结果(准确率,%):
| 模型 | 模式 | DocVQA | InfoVQA | TextVQA | ChartQA | CharXiv RQ | CharXiv DQ | OCR-Bench | OCR-Reasoning |
|---|---|---|---|---|---|---|---|---|---|
| QwenVL2.5-8B | NT | 95.7 | 82.6 | 84.9 | 87.3 | 42.5 | 73.9 | 86.4 | 15.7 |
| QwenVL3-8B | TK | 95.3 | 86.0 | 78.7 | 88.6 | 53.0 | 85.9 | 81.9 | 48.4 |
| R-4B(ATK SOTA) | ATK | 94.1 | 67.0 | 76.6 | 87.2 | 56.8 | 82.9 | 83.6 | 22.2 |
| AdaThink-E-7B-Qwen2.5 | ATK | 96.3 | 82.9 | 85.3 | 89.1 | 56.7 | 83.5 | 88.7 | 26.5 |
| AdaThink-E-8B-Qwen3 | ATK | 96.4 | 86.3 | 82.8 | 90.1 | 57.3 | 86.6 | 89.8 | 49.7 |
要点:自适应模式几乎在所有基准上持平或超过自身的纯思考、纯不思考模式;Qwen3 版 OCR-Reasoning 49.7 甚至超过 Qwen3-VL-Thinking 的 48.4。相对基座 Qwen2.5-VL,DocVQA +0.6、ChartQA +1.8、OCR-Reasoning +10.8;相对 R-4B,ChartQA +1.9、OCR-Reasoning +4.3。
效率对比(思考率与 token 消耗):
| 数据集 | 模型 | 思考率 | 平均 token | 准确率 |
|---|---|---|---|---|
| CharXiv RQ | R-4B | 82% | 366 | 56.8 |
| CharXiv RQ | AdaThinking-E | 27% | 72 | 56.7(基本持平) |
| CharXiv DQ | R-4B | 45% | — | 82.9 |
| CharXiv DQ | AdaThinking-E | 11% | — | 83.5(+0.6) |
以约 1/5 到 1/3 的思考率拿到相同甚至更好的成绩,效率优势显著。OCR-Reasoning 上 AdaThinking-E 思考率升到 62%,准确率 26.5% 反超自身强制思考模式的 26.1%,平均还省 88 个 token——“对简单子问题少想"甚至能减少过度思考幻觉。
关键消融:
| 配置 | ChartQA Acc / Think% | OCR-Reasoning Acc / Think% |
|---|---|---|
| 冷启动(无 RL) | 87.6 / 9.2 | 21.6 / 10.4 |
| 全程高熵(γ=1.0) | 88.1 / 75.6 | 23.7 / 48.4 |
| 全程低熵(γ=0.0) | 87.8 / 0.0 | 18.7 / 0.0 |
| 熵课程(γ=0.4, β=10) | 89.1 / 24.3 | 26.5 / 61.9 |
| 无 A&P 项(仅 acc 反馈) | 88.1 / 39.9 | 25.7 / 83.4 |
全程低熵直接复现模式坍缩(思考率归零,OCR-Reasoning 掉到 18.7);全程高熵则思考率虚高、难题被错配到不思考模式,掉约 1.5%;熵课程双双最优。训练动态图还显示 GRPO 和 DAPO 基线在训练中思考率都迅速滑向 0(坍缩),而 AdaThinking-E 探索期熵稳定保持高位、组内两模式数量差小,进入决策期后思考比例稳定不塌。冷启动数据本身已带来 ChartQA +0.6、OCR-Reasoning +5.9,RL 阶段再平均 +3.1。
六、效果优势的根源解释
把因果链拆开看:方法差异 → 机制变化 → 指标提升。
方法差异一:奖励按 token 角色解耦(vs GRPO/DAPO 均匀奖励)。 标准 RL 把同一个序列的优势估计摊到所有 token 上。机制变化:短回答的单位 token 奖励系统性高于长思考链,等于隐式惩罚思考模式,所以 GRPO/DAPO 全部坍缩为不思考(图 4c 实证)。AdaThinking-E 把模式决策的梯度单独系在切换 token 的熵奖励上、回答质量的梯度单独走准确率奖励,两条信号互不污染。指标提升:模式坍缩消失,思考率在训练全程保持稳定,OCR-Reasoning 从坍缩后的 18.7 提升到 26.5。
方法差异二:熵课程(vs 固定高熵或低熵)。 高熵探索期保证组内两种模式采样均衡——这是决策反馈能做出可靠"哪模式更好"比较的前提;若一开始就低熵,模型永远只见到一种模式的样本,无从比较,直接锁死在不思考。低熵决策期则把探索结论固化为对输入的确定性分流。机制变化:模型从"被动接受外部难度规则"变成"用自己采样到的双模式准确率证据自主分流”。指标提升:消融表显示熵课程相对全程低熵/高熵在两个基准上分别领先 1.3~7.8 个点,且思考率落在合理区间(ChartQA 24.3% vs 坍缩的 0% 或虚高的 75.6%)。
方法差异三:倾向性引导项 P(vs 朴素准确率比)。 小样本下不思考模式的"100% 准确率"是统计噪声,朴素反馈会被带偏产生振荡。P 项承认"模型已表现出强倾向且两模式都好"时倾向即证据。机制变化:优化方向反映大样本的真实偏好而非小样本运气。指标提升:训练稳定性提升,且无 P&A 时思考率虚高(OCR-Reasoning 83.4% vs 61.9%)而准确率反低,说明 P&A 帮模型找到了更精准的思考/不思考分界线。
方法差异四:决策内化到单 token(vs 外部难度标签)。 难度判断不再依赖外部模型或人工规则,而是编码进首位切换 token 的概率分布。指标提升:CharXiv RQ 上 27% 思考率匹敌 R-4B 的 82%——分流更精准意味着同样精度下 token 成本降至约 1/5。
一句话总结根源:“该不该想"这个决策本身被从"想的内容质量"中剥离出来,单独用熵课程去学,而学它的证据来自模型自己双模式采样的准确率对比——没有任何人工难度先验,所以决策边界更贴题、更自信。
七、必要知识反推
想读懂并复现这篇论文,需要以下前置知识(按依赖顺序反推):
- 信息熵与归一化熵:H = -Σp·ln p 的含义,为什么熵能度量不确定性;以 ln2 归一化后熵落在 [0,1],方便设阈值。
- GRPO 算法:组内采样(本文每题 16 样本)、组内相对优势估计的机制;以及 DAPO 对 GRPO 的长度偏置修正尝试。不理解"奖励均摊到 token"就理解不了坍缩的成因。
- GRPO/DAPO 的熵机制与策略熵:RL 训练中熵常被当作需要维持的探索性指标(如 clip-cov 式熵奖励),本文创新点恰是把"维持/压低熵"做成时间上的课程,需要知道熵在 RLHF 语境下的常规用法。
- 思考/不思考双模式模型:Qwen3 的 hybrid thinking、
<think>标签格式、软思考开关(如/no_think)的工业实践。 - 多模态文档理解基准体系:DocVQA(文档抽取)、ChartQA/CharXiv(图表推理,RQ 为常规题、DQ 为难错题)、OCR-Bench/OCR-Reasoning(文字识别与推理)各自考察什么能力,难易梯度如何。
- SFT 冷启动工程:SWIFT 微调框架、VeRL 强化学习框架的基本使用;用强模型(Seed1.5-VL)生成+裁判模型(GPT-4o-mini)过滤的数据蒸馏管线。
- 课程学习:从易到难、从探索到收敛的调度思想,这里是把它实现为 sigmoid 系数 α_k 的时间表。
八、通用性灵感
跳出文档理解,这篇论文有几条可迁移的思想:
- “用一个 token 的概率分布"承载策略决策是极轻量的接口设计。任何"二选一及以上"的行为决策(要不要调用工具、要不要检索、要不要长回答)都可以显式建模为首位特殊 token 的选择,其概率分布天然可观测、可调控。把决策变量从隐式行为模式提升为显式 token,是让 RL 可直接作用于决策的通用手法。
- 解耦优化目标,防止梯度互相污染。当一个序列里混着"策略性 token"和"内容性 token"时,均摊奖励会让两者互相绑架(本文中短回答偏见杀死思考模式就是典型)。识别 token 的功能角色并分轨奖励,是普适的工程教训。
- 熵课程 = 先保证数据均衡、再固化决策。很多需要"探索后收敛"的学习问题(路由选择、模式切换、超参搜索)都可用同一模板:前期奖励熵维持选项均衡以便获得可比样本,后期惩罚熵固化最优选项。γ、β 两个参数就把课程形状调出来了。
- 小样本比例不可信,倾向本身是证据。16 个样本里 1/1 的 100% 不如 13/15 的 86.7% 可靠——任何依赖组内统计做反馈的系统都该内置这种"出现率加权"的防坑逻辑。
- 自适应未必赢在最高分,而是赢在同分低成本。CharXiv DQ 上 11% 思考率反超对手 45% 思考率,说明精准的分流决策本身就是性能来源。对一切推理成本敏感的场景(端侧、实时对话、Agent 长链路),“该省则省"都是被低估的优化轴。
- 过度思考幻觉是真实存在且可量化的。OCR-Reasoning 上自适应模式反超自身强制思考模式,提示我们:对简单问题强行 CoT 不是中性冗余而是负收益,这为"难易分流"提供了超出省 token 的额外动机。