论文链接:arxiv.org/abs/2608.25580 项目主页:shulin16.github.io/v-rubrics 发表时间:2026年8月 机构:南洋理工大学 S-Lab、ASTAR(新加坡科技研究局)、独立研究者、UIUC——高校+国家研究机构合作(S-Lab 提供训练框架与算力,ASTAR 参与方法设计) 领域标签:cs.CV / 多模态后训练 / RLHF-VR


一、论文背景

1.1 什么是视觉忠实性?

视觉语言模型(VLM) 能看图答题:给它一张日食示意图问"这是什么现象",它流畅地回答"日食"。但流畅不等于可信。视觉忠实性(Visual Faithfulness) 指回答中的每个视觉陈述——物体、属性、关系、数量、图表数值——都要有图像证据支撑。

问题在于:VLM 常生成"看似合理但无证据"的细节。比如图中太阳、地球、月亮确实排成一线(有证据),但模型顺手推断"因此出现小潮"(图中没有任何信息支持这个推断)。一个不支持的物体、一个读错的图表数值、一步无据推断,就能让整段回答的正确性崩塌。这类似于学生考试时"答案碰巧对了,但过程是编的"——批改只看答案就发现不了。

1.2 为什么这是一个 credit assignment 问题?

现有评测(幻觉基准、忠实性度量)能诊断这个问题,但诊断不等于治疗。训练侧,主流 RL 后训练用标量结果奖励:答案对了给 1,错了给 0。论文的关键重构是把问题归因为多模态后训练中的信用分配(credit assignment)失败:

一个视觉回答往往是"混合体"——正确识别了物体、做了一步无据推断、同时满足了格式要求。标量奖励对这三个部分一视同仁,无法告诉优化器:哪个视觉事实是接地的、哪步推理有效、哪条指令约束被漏掉。就像老师只给作文打总分,从不圈出错句——学生无从改进具体弱点。

1.3 已有方案与缺口

文本侧,“Rubrics as Rewards”(Gunjal et al. 2025)已证明实例级评分标准可以把 RL 扩展到不可验证任务。但把它搬到视觉领域有两个未解问题:其一,如何让评分条目视觉接地(绑定到图像证据);其二,条目级信号如何变成 token 级信用分配(哪段生成文本对应哪条标准)。V-Rubrics 正是补这两块缺口的工作。


二、论文定位和关联工作

2.1 多模态推理与奖励粒度谱系

  • 多模态 RLVR:把可验证奖励适配到视觉任务(Liu et al. 2025; Shen et al. 2025 等),奖励仍挂在整条回答或最终答案上。
  • 推理改进系统:改进数据配比、rollout 选择、长推理链(Chen et al. 2025; OneThinker 等),优化对象是训练流程而非奖励结构。
  • Rubrics 作为奖励接口:文本侧 Rubrics-as-Rewards 是最近邻;多模态裁判与奖励模型把打分思想扩展到图文。
  • 对齐反馈到局部信用:LLaVA-RLHF、RLHF-V、细粒度 AI 反馈等用偏好/批评信号塑造行为,但信号形式仍是整体偏好或批评文本。

2.2 本文的位置

维度answer-only GRPO文本 Rubrics-as-Rewards细粒度 AI 反馈V-Rubrics
奖励单元整条回答实例级文本条目偏好对/批评视觉接地的原子条目(VF/RC/IF)
信号落点全序列广播通常序列级聚合序列级条目前缀掩码局部化
视觉接地无无部分显式(VF 绑定图像证据)

定位结论:V-Rubrics = Rubrics-as-Rewards 的视觉接地扩展 + 组件化/前缀局部化信用分配的组合,是"把视觉接地变成结构化训练接口"的第一个系统尝试。


三、问题定义

具体问题:多模态 RL 中标量奖励无法区分"视觉解读对但推理错"与"视觉错但答案碰巧对",导致模型学不到"哪些中间视觉步骤值得保持"。

抽象洞察:多模态失败是局部的——幻觉一个图表值、漏掉一条约束、推错一步,后果只在最终答案显现。因此监督单元应该与失败单元对齐:从"最终答案可接受性"改为"接地视觉事实 / 有效推理步 / 满足的约束"。

形式化:对图像-指令对 x,把参考答案分解为条目集 R(x) = {(r_j, d_j, c_j, w_j)},其中 r_j 是自包含原子标准,d_j ∈ {VF, RC, IF} 是维度标签,c_j 是重要度(ESSENTIAL/IMPORTANT/OPTIONAL/PITFALL),w_j 是数值权重。给定生成回答 a,验证器逐条打二值分 s_j,目标是构造条目分解且前缀局部化的 token 级优势,使策略在保持任务成功(答案奖励锚定)的同时学会接地推理。

精妙之处:奖励单元与失败点对齐——每个条目对应一个可独立成败的子主张,信用不再"一荣俱荣、一损俱损"。


四、问题解法

4.1 管线总览:共享起点的受控设计

基座 Qwen3-VL-8B-Instruct 先在公开的 OpenMMReasoner-SFT-874K 上做 SFT 冷启动得到 π_SFT。之后每个 GRPO 运行独立复制两份参数:可训练 actor π_θ 与冻结 KL 参考 π_ref,初始均为 π_SFT。所有对比变体共享同一 SFT 起点、同一 RL 数据、同一 rollout 预算——这让"增益来自奖励结构本身"的归因干净。

4.2 V-Rubrics 50K 数据构建

三步流水线:

  1. 粗筛:17 个视觉接地数据源(图表理解、文档 VQA、数学视觉推理、计数、教育 QA 等)归一化为"图像-指令-参考答案"格式,规则过滤(媒体有效、任务非平凡、语言质量、去重)。
  2. 难度分层:用 π_SFT 对每例做 8 次拒绝采样,成功率 k/8 作为模型相对难度信号,映射为 hard/medium/simple(最终配比 36.1%/50.4%/13.6%),固定为 50,248 例。
  3. Rubric 标注:Gemini-3-Pro 用统一结构化 prompt 把每例标注为原子条目——共 352,938 条。

4.3 Rubric 设计四原则

以一张日食图为案例:条目 1"识别太阳(A)/地球(C)/月亮(D/G)"(VF,权重 5,Essential);条目 2"识别三者排成直线"(VF,5,Essential);条目 3"指出 B/F 指向潮汐隆起"(VF,4,Important);条目 4"解释对齐引力产生最高潮"(RC,4,Important);条目 5"答案为大潮/选项(3)/(D)"(IF,5,Essential);条目 6"小潮需要 90° 日月角"(RC,3,Important,区分干扰项)。

原则含义为什么
视觉接地VF 条目指向可检图像证据(物体/属性/计数/图表值)防止条目飘到纯文本知识
自包含每条标准独立可判,无需重建参考答案全文降低验证器负担、可审计
覆盖中间步评价视觉事实与推理步而非仅最终答案局部信用的前提
编码重要度ESSENTIAL/IMPORTANT/OPTIONAL/PITFALL + 权重中心标准权重大;PITFALL 标记常见幻觉陷阱

4.4 奖励与优势构造(方法核心)

语义层奖励:正权重条目的重要性加权部分学分 R_rub = Σ ρ_j s_j(ρ_j 为归一化权重);与二值答案奖励 R_ans 混合 R = α·R_ans + (1−α)·R_rub;确认的 PITFALL 违反作为语义否决门。答案项锚定任务成功,rubric 项指出"答案由哪些部分支撑"。

优势的组件化+前缀局部化:这是与传统 GRPO 的分野。

  • 传统:把 z(R)(序列级标准化奖励优势)广播到全序列。

  • 本文:验证器逐条打分并返回支撑句,将支撑句对齐回生成文本得到证据 span 末 token 位置 t_j,end,构造前缀掩码 M_{j,t} = 1[t ≤ t_j,end]。最终 token 优势:

    A_t = α·z(R_ans) + (1−α)·Σ_j ρ_j·z(s_j)·M_{j,t}

即:答案优势广播全序列,每条 rubric 优势只落到支撑它的响应前缀上。无对齐 span 的条目退化为全序列的条目分解信用;所有 rollout 得分一致的条目不产生梯度(组内无区分度)。

类比:answer-only GRPO 像全班只公布总分;序列级 rubric 聚合像公布各科总分;组件化+前缀信用像在试卷上逐题批注、且把每题分数写在学生写答案的具体位置——复习时一眼看到"这句话值多少分、错在哪"。


五、评估指标与实验证据

5.1 指标与基准

VLMEvalKit 上 10 个基准家族,覆盖通用 VLM 能力、知识学术推理(MMMU、MMMU-Pro)、视觉数学(MathVista/MathVision/MathVerse/DynaMath/WeMath)、图表逻辑。报告标准准确率与非加权平均。

5.2 主结果(两维度表)

通用与知识(Overall Avg.):

模型Overall Avg.
Qwen3-VL-8B-Instruct67.63
Qwen3-VL-8B-Thinking67.63(知识均值 63.63)
SFT(本文)64.93
+ GRPO(answer-only)66.25
+ GRPO w/ rubrics68.04(+1.79 vs GRPO)

知识均值 59.35 → 61.88,MMMU 68.00→70.56、MMMU-Pro 55.72→58.15。

视觉数学/图表/逻辑(Overall Avg.):SFT 58.45 → GRPO 61.94 → rubric 62.45(对 SFT +4.00,相对 +6.8%)。单项:MathVision 56.71→58.88、WeMath 84.86→86.29、LogicVista 60.63→62.42。超过 Qwen3-VL-8B-Thinking 的 62.22;MathVision 58.88 大幅领先 GPT-4o 的 31.1。

关键模式:增益集中在依赖脆弱中间子链的基准(MathVision/DynaMath/WeMath/LogicVista),而非宽泛能力(MMBench 上 scalar GRPO 略高、MathVerse V/O 与 CharXiv 上 GRPO 更好)——提升不是均匀的基准抬升,而是集中在 rubric 能暴露部分学分的地方。

5.3 消融(Overall Avg.)

信号信用得分
仅答案序列级66.25
答案+rubrics序列级聚合67.74
答案+rubrics组件化+前缀68.04

5.4 为什么实验设计能证明论点

三个受控层:(1) SFT/RL 数据/rollout 预算/优化器全对齐,唯一变量是奖励与信用结构 → 增益可归因于奖励本身;(2) 三级消融隔离"有 rubric"与"如何用 rubric"两个因素;(3) 增益的分布模式(集中在接地中间推理型基准)与机制预测一致——如果 rubric 只是"更多监督",增益应均匀分布;它集中出现恰证明是"局部信用修复了局部失败"。

定性案例补强:answer-only 检查点数对了人数却做出无据的"年龄→出生年"推断,rubric 版保留了中间接地步骤;answer-only 读错曲线位置,rubric 版先描摹可见线段再作答。


六、效果优势的根源解释

(1)为什么 rubric-GRPO 优于 answer-only GRPO?

因果链:标量奖励无法区分两种错误模式 → 优化器只能学到"整体答案倾向",对中间过程是盲的 → 遇到"多步脆弱子链"任务时,正确答案依赖的接地观察得不到专门强化。rubric 把监督单元从终答案改为接地视觉事实/有效推理步/满足约束 → 同一 rollout 可因接地观察得学分、同时因致错步受罚 → 梯度信号携带"哪里对哪里错"的结构信息。增益集中在 MathVision/DynaMath 等基准(正确答案是多个脆弱子主张的终产物)而非 MMBench(宽泛能力),增益分布本身就是机制的证据。

(2)为什么前缀局部化有效?

序列级聚合把条目学分摊到全序列每个 token,包括与该条目无关的文本——信用被稀释、错位。前缀掩码把每条优势落到支撑句之前的前缀:视觉识别条目的学分主要塑造识别段,结论条目塑造结论段。这与"多模态失败是局部的"结构对齐。消融显示前缀+组件化比序列级聚合再高 0.30 分(68.04 vs 67.74)。

(3)为什么需要 PITFALL 与权重?

PITFALL 条目(如"小潮需要 90° 日月角"这类常见混淆)作为语义否决,防止模型靠碰巧踩对选项得分;全局权重归一保持奖励尺度跨例可比,避免条目多的样本主导梯度。

(4)诚实的边界:作者自陈三个局限——rubric 与判分依赖 Gemini/Qwen 自动生成(可能有参考答案偏差);前缀对齐是模糊匹配(实用局部反馈而非精确 token 监督);Qwen 家族裁判评 Qwen 策略可能有家族偏差。增益绝对值(+1.79)不大但一致,且方向与机制吻合。


七、必要知识反推

7.1 领域知识层

  • VLM 后训练流程:SFT 冷启动 → RL 对齐的两阶段范式;不理解管线就无法设计共享起点的受控对比。
  • 多模态失败模式学:幻觉、图表误读、无据推断的表现形态——这是定义 VF/RC/IF 三维的知识基础。
  • GRPO 组相对优化:组内标准化优势的机制——改造优势构造的前提是理解原构造。

7.2 方法论知识层

  • Rubrics-as-Rewards 前作:知道实例级标准可扩展 RL 至不可验证任务——直接的方法母体。
  • 信用分配理论:过程奖励(PRM)、token 级奖励的思想谱系——前缀局部化的灵感来源。
  • 数据工程:拒绝采样定难度、规则过滤、难度分层配比——构建 5 万例可靠数据集的工程知识。

7.3 工程知识层

  • verl 训练框架与 KL 惩罚的实现;LLM-as-judge 的 prompt 设计(答案等价裁判 + rubric 验证器两种);span 对齐的模糊匹配实现。

7.4 知识融合的关键节点

  • 节点一(问题重构):把"VLM 不忠实"从评测问题翻译成 credit assignment 问题——需要同时横跨幻觉评测与 RL 训练两个社区。
  • 节点二(视觉接地的条目化):把抽象的"忠实性"拆成可判定的原子命题并绑定图像证据——概念操作化的关键一步。
  • 节点三(前缀掩码设计):意识到验证器返回的支撑句可以反过来定位信用落点——把"打分副产物"变成"对齐信号"。
  • 节点四(受控实验纪律):坚持同起点/同数据/同预算的三对齐,让 1.79 分的小增益具备机制归因价值。

八、论文中可以提取的通用性灵感

灵感一:把事后诊断指标升级为训练接口

  • 核心思想:评测侧已有的细粒度诊断维度(忠实性、一致性、遵循度)可以直接变成后训练的奖励分解,而不只是发 benchmark 报告。
  • 论文证据:VF/RC/IF 三维从幻觉评测文献中来,转化为 352,938 条原子奖励条目后带来 +1.79 分。
  • 推广场景:代码生成的测试覆盖率维度变成 RL 奖励;agent 的工具调用规范维度变成过程奖励;写作的可信度维度变成微调信号;翻译的术语一致性维度变成偏好信号。

灵感二:监督单元应与失败单元对齐

  • 核心思想:学习信号的最小粒度应等于系统失败的最小粒度;粒度过粗时局部错误被全局信号淹没。
  • 论文证据:标量奖励下"接地观察对+推断错"与"全错"得到同一惩罚;条目化后前者部分得学分后者受罚,增益集中于多子链任务。
  • 推广场景:多模块软件的集成测试→单元测试;客服质检的满意度总分→逐项服务标准;医学诊断的结局指标→环节质控;团队绩效的团队 KPI→个人贡献分解。

灵感三:让打分者说出"依据在哪",再把依据变成信用落点

  • 核心思想:裁判系统若能输出支撑证据的位置信息,证据位置即可用作局部反馈的锚点,实现从"打分"到"定位"的跃迁。
  • 论文证据:rubric 验证器返回支撑句,前缀掩码据此把条目优势限定在相关响应前缀,比序列级聚合再 +0.30。
  • 推广场景:教育 AI 逐句批注而非总分;代码评审定位到 diff 行;法律 AI 引用法条定位论点;RAG 系统用引用段落做 token 级奖励。

灵感四:重要性加权 + 否决门的奖励结构

  • 核心思想:复杂任务的奖励 = 加权的部分学分之和,配以"关键违规一票否决"的硬门,兼顾细腻与刚性。
  • 论文证据:ESSENTIAL 权重 5 与 OPTIONAL 权重 2-3 拉开层次;PITFALL 违反直接否决答案学分。
  • 推广场景:自动驾驶决策评分(安全否决+舒适度加权);招标评标(强制性条款否决+技术商务加权);内容平台审核(违法否决+质量加权);科研基金评审(伦理否决+创新性加权)。

灵感五:受控变量是小增益研究的生命线

  • 核心思想:当预期效应量不大时,必须把一切无关变量锁死,小差异才可信、可归因。
  • 论文证据:SFT 起点、RL 数据、rollout 预算、优化器设置在 GRPO 与 rubric-GRPO 间完全对齐,+1.79/+0.51 的增益才能归因于奖励结构。
  • 推广场景:模型压缩的精度回归测试;营销 ablation 测试;药物临床的安慰剂对照;任何"效应量小于噪声"场景的实验设计。