论文链接:arxiv.org/abs/2608.26105 项目主页:video-reason.com 发表时间:2026年8月 机构:Nanyang Technological University(牵头)+ UC Berkeley、CUHK、东京大学、Michigan、Johns Hopkins、CMU、Columbia、Stanford、Toronto、Mila、Oxford、INSAIT、HKUST 等 20 个机构、50+ 研究者大合作——纯学术共同体(无企业挂名,获 AWS Trainium 算力支持) 领域标签:cs.CV / 视觉生成 × 推理 / 可验证奖励 RL


一、论文背景

1.1 什么是"原生视觉推理"?

语言模型的巨大成功让语言成为推理研究的默认介质——思维链(CoT)就是"用语言想"。但物理世界的许多智能天然非语言:空间变换、时间连续性、物体恒存性、动态交互。原生视觉推理(Native Visual Reasoning) 提出另一种范式:模型通过构造、更新、优化视觉状态(图像与视频)来解题——视觉不是被理解的输入或被渲染的输出,而是一等公民的求解基底。

举例:解迷宫时,语言模型用文字描述"先左后右";原生视觉推理模型则直接生成一段动画:代理沿白路移动、取钥匙、到门口——推理过程外化为视觉状态的演化。就像建筑师不用文字论证方案,而是直接搭模型推演。

1.2 这个范式的三大基础设施缺口

论文开篇诊断了该方向无法系统研究的原因:

  1. 缺可训练的任务源:现有基准只为评测设计、无训练数据;大规模合成数据又局限于简化符号设定,教不出可迁移能力。
  2. 缺可靠反馈:主流 VLM-as-a-judge 范式在视觉推理上不可靠——数值不精、细节忽视、规则误解,且不可复现(同视频重评 55–93% 分数会变),作为 RL 奖励更是灾难。
  3. 缺受控比较:图像、视频、交错文本生成三种基底从未在同一任务分布与验证协议下比较过——“哪种介质最适合视觉推理"无法回答。

1.3 核心主张

VBVR-Pro 用"闭环测试床"一次补齐三块:任务可训练(程序生成+多模态对齐渲染)、评估可验证(确定性评分器)、优化可靠(评分器兼作 RL 奖励)、模态可实验(同分布跨模态比较)。其最重结论:视觉轨迹(而非语言 CoT)才是视觉推理的关键基底——这是对"语言中心主义"推理观的直接挑战。


二、论文定位和关联工作

2.1 视觉推理基准谱系

现有资源按"任务数/规模/模态/评估方式"对比(原文表 1):VideoThinkBench(48 任务)、V-ReasonBench(13)、RULER-Bench(40)、MME-CoF-Pro(16)等评测基准全部依赖 VLM 裁判;训练侧 Zebra-CoT(92 万图)、StructCoT(84 万交错样本)无验证评估;前作 VBVR(150 任务、200 万图)首次实现可验证但仅视频模态。VBVR-Pro 是唯一同时具备 300 任务、百万级训练数据、三模态支持、全任务可验证评估的资源。

2.2 VLM-as-a-judge 批评谱系

近年多项工作指出 LLM/VLM 裁判的局限。本文的贡献是给出三类系统失败模式的具体案例(见第四节)并给出替代方案:基于语义实体提取的确定性评分器。

2.3 生成式推理谱系

ThinkMorph(交错生成做几何变形推理)与 VBVR 原版是这个方向的前序。本文扩展了三方面:任务规模翻倍、评估从模型级相关验证升级到实例级人类对齐验证、新增 RL 基线与机制研究。

定位结论:这是一篇基础设施论文——单点算法创新有限,但其价值在于把一个新兴范式从"零散演示"推进到"可系统研究的科学”,类似 ImageNet 之于视觉分类。


三、问题定义

具体问题:如何让"通过生成来做视觉推理"可以规模化训练、可靠评估、稳定优化、跨模态受控比较?

抽象洞察:一个范式要成为科学,必须先成为基础设施。论文把模糊的"视觉推理能力"拆解为四个可工程化的性质:

  • 可训练(Trainable)= 任务可程序化生成(无限实例)× 覆盖能力谱系(防过拟合单一模式)
  • 可验证(Verifiable)= 每个输出有确定性、可复现、与人类判断对齐的分数
  • 可优化(Optimizable)= 分数可直接做 RL 奖励且信号无噪声
  • 可受控(Controllable)= 同一任务分布下渲染出对齐的多模态版本

形式化(评分器为例):给定生成输出 O 与任务元数据 M(种子、问题规范、完整解、关键元素属性),评分器 S: (O, M) → [0,1],由语义实体提取(HSV 分割/轮廓/OCR/轨迹跟踪)+ 任务特定检查(软标准加权和 + 硬约束乘法门)构成,且 S(O,M) 对相同输入严格确定。

精妙之处:验证的可靠性是整个闭环的地基——评测不可复现则排名无意义,奖励不可复现则 RL 无法收敛,因此"确定性评分器"是同时解锁评测与训练的单一关键。


四、问题解法

4.1 支柱一:任务扩展——300 个程序生成任务

  • 来源:150 个改自 VBVR + 150 个新设计,覆盖五认知 faculty:感知(OCR/计数/排序)、空间(位置/3D/导航)、变换(平移/旋转)、抽象(模式归纳/对称补全)、知识(物理常识/游戏规则)。
  • 难度升级:新任务视觉复杂度中位数 80 个连通色区(旧任务 12);需多步搜索的任务占比从 7% 升至 47%(数独、五子棋等);盲评 150 对中新任务被认为需更深推理的 113 对。
  • 多模态对齐渲染:每个实例同步渲染视频与图像(三种图像体制:Last-Frame 终态即可判、Key-Frame 选取关键转移帧、Multi-Frame 均匀采样过程帧),交错模态再加 Gemini-3.1-Pro 生成中间步骤文本描述。关键设计:视频与图像不是两个语料库,而是同一问题的不同渲染——这使"模态导致的差异"可归因。
  • 规模:347 万图 + 130 万视频;50 任务留作 OOD 评测,其余 250 任务每任务采样 5000 例构成 125 万训练实例;另有 5 万 RL 专用切分。

4.2 支柱二:可验证奖励评分器

先看 VLM 裁判的三类失败案例(原文图 4):

  1. 感知不精:加色混合任务中生成球的色相错误,评分器给 0.40,三个 VLM 裁判却都给 ≥0.80(“红绿混合成黄"大致对了)。
  2. 忽视细节:同心圆任务改变了应保留的圆尺寸与颜色,裁判仍给 0.78–0.93。
  3. 误解任务:模式补全任务圈错大小选项,正确答案评分器 0.94,GPT-5.5 只给 0.24。

评分器设计:对 100 个评测任务各配一个专用评分器。不比像素,而提取任务相关语义实体(颜色/形状/位置/计数),在属性层判定。软标准任务用检查项加权和(如"球簇合并"任务分解为 3 次合并准确率 0.91/0.70/0.70 + 球数 + 其他簇消失 + 簇形状 + 最终标签 → 0.40);硬约束任务用乘法门(迷宫的墙违规 3 次使墙门 0.73、钥匙未取+门未达使门门 0.55)。轻量、无需 API、确定性、可解释错误分解。

4.3 支柱三:机制研究三件套

  • 受控模型比较:9 个开源生成基座(图像:BAGEL/FLUX.2/Qwen-Image-Edit;交错:ThinkMorph/SenseNova-U1;视频:Wan2.1/Wan2.2×2/LTX-2.3)统一训练一个 epoch、512×512、LoRA/全参一致的协议。
  • 反事实诊断:输入侧干预(改写/去语义/去图/翻转旋转)+ 中间态干预(去中间文本/去中间图像/加噪)。
  • CPS 探索式 RL:视觉推理的有用探索是语义级的(迷宫左转还是右转),普通随机扰动只改外观不改决策;Coefficients-Preserving Sampling 的 cos²+sin²=1 保证新注入噪声不超调度器规定总量,高随机度下仍保视觉干净。

五、评估指标与实验证据

5.1 指标体系

  • 评分器质量:per-vote 人类一致性(4 类竞技场格式)、模型级排名相关(Spearman ρ / Pearson r)、可复现性(同输入重评分数变化率)、每次评估成本。
  • 模型能力:scorer 分数(0–1),按 ID/OOD 与五分类报告。
  • 训练收益:9 模型训练前后分数差 + 7 个外部基准迁移。

5.2 评分器:人类对齐与可复现性

评估者per-vote 一致性重评分数变化率
人类一致上限0.770—
本文评分器>0.600.00%
GPT-5.50.54—
Gemini-3.1-Pro0.5292.8%
Qwen3.7-plus—80.8%
GLM-4.6V-Flash—54.6%(最低的 VLM)

评分器达到人类一致上限的约 78%,且成本最低(开源 VLM 需 GPU 推理、专有 VLM 需 API 费)。模型级排名:OOD Spearman ρ 从 VBVR 的 0.93 升至 1.00。

5.3 30+ 模型主结果

  • 顶层专有模型已有不俗视觉推理能力:Seedance 2.0 视频 0.499、GPT-Image-2 交错 0.507、Nano Banana Pro 0.564。
  • 学术开源模型大幅落后(HunyuanVideo 0.054),但经 VBVR-Pro 训练后可反超:Wan2.2-I2V-A14B 从 0.182 → 0.670(ID 0.808)。
  • 9 个开源模型训练平均 +0.290(ID +0.401 / OOD +0.179)。

5.4 外部迁移(7 基准,VBVR-Pro-Wan2.2-I2V-A14B vs 基座)

基准基座训练后
V-ReasonBench10.2138.22(+28)
MME-CoF-Pro24.7648.39(+24)
VideoThinkBench-mini25.7152.86(+27)

迁移增益非记忆:最近邻检索(CLIP/DINOv2/文本)显示测试例与训练集视觉语义均不相似;同 prompt 视觉反事实(翻转/旋转)仍正确跟随。

5.5 模态结论与"视觉轨迹 > 文本 CoT"证据链

  • 视频生成在持久时空状态跟踪上最强(变换类 ID 与 OOD 全面领先)。
  • 交错生成是高性价比替代:训练后 SenseNova-U1(0.638)与最强视频模型(0.670)在多数 ID 任务持平,而生成成本低得多。
  • 单图生成难以表达过程推理(变换类大幅落后)。
  • 三面证据链(视觉轨迹因果性):
    1. 训练侧消融:去中间图像 SenseNova −0.111、ThinkMorph −0.024;把中间文本换成无语义占位符仅 −0.009(ThinkMorph 侧甚至略升)——视觉轨迹监督远重要于文本语义。
    2. 推理侧干预:去中间图像掉到 0.099、加噪 0.190;去/换矛盾中间文本只降到 0.533/0.530——中间视觉状态被因果性地使用。
    3. Chain-of-Step 可视化:去噪早步出现多路径探索、叠加态探索等推理行为。

5.6 RL 结果(Wan2.2-TI2V-5B,5 万 RL 集)

方法OverallOOD
Baseline0.4700.300
+ SFT0.5030.328
+ RLVLM(VLM 裁判奖励)0.5080.345
+ RLVR(评分器奖励)0.5480.377

RLVR 稳定上升;RLVLM 在 400–500 步震荡掉分(奖励不可复现→优化信号噪声)。案例显示 RLVR 带来"后步自我修正”(第 6 步改判颜色收敛到正确答案)与更连贯的多步空间规划。

5.7 为什么实验设计能证明论点

三个设计保障:其一,评分器在实例级与人类对齐验证(而非仅模型级相关——排名对但逐例错仍会毒害 RL);其二,训练收益用"ID/OOD/外部基准"三层分解,配最近邻+反事实排除记忆解释;其三,模态结论建立在"同一任务分布的多模态渲染"上,模态是唯一变量。


六、效果优势的根源解释

(1)为什么评分器优于 VLM 裁判? 裁判看的是"生成的视频/图像像不像合理答案",依赖语义整体印象;评分器提取的是任务定义的判分属性(数量、位置、时序)。前者对"大致对"宽容(色相错给 0.8)、对"精确错"盲然(尺寸变给 0.93);后者逐属性硬核对。确定性带来的可复现性(0.00% vs 54.6–92.8% 变化率)不是附加优点而是** RL 可用性的前提**——RLVLM 的训练震荡直接证明噪声奖励如何破坏组相对优化。

(2)为什么训练增益能迁移? 300 任务覆盖的是能力谱系(感知/空间/变换/抽象/知识)而非具体题型;125 万实例是这些能力的随机化练习。最近邻分析(无相似训练样本)与视觉反事实(翻转仍跟随)排除了两条捷径:视觉记忆与指令模板拟合。模型学到的是"可复用的视觉操作"(找模式、排序、移动物体)——这与"任务覆盖比实例数量更重要"的假设一致。

(3)为什么视觉轨迹比文本 CoT 关键? 视觉推理任务的解天然是状态转换序列(迷宫的路径、旋转的中间姿态)。中间图像使变换直接可观察——推理过程与表示同构;文本描述则需要把空间结构序列化为语言,丢失空间并行性。训练侧(去图 −0.111 vs 去语义文本 −0.009)与推理侧(去图 → 0.099 vs 去文本 → 0.533)的双重不对称,把"视觉是工作记忆、语言是辅助注解"的角色分工钉死。

(4)为什么 RLVR > SFT? SFT 模仿示范轨迹的每一步,包括分布外情况的"错误示范"缺失;RLVR 用奖励引导探索,在语义级随机(CPS)下尝试不同决策并获得差异化回报。OOD 上 RLVR(0.377)超过 SFT(0.328)说明奖励优化泛化出的是决策质量而非轨迹模仿。


七、必要知识反推

7.1 领域知识层

  • 生成模型三范式:视频/图像/交错文本-图像生成的架构(MoT/MoE/Dense)与训练方式——选择基座、设计训练协议的基础。
  • 认知能力分类学:五 faculty 的划分来自 VBVR 认知框架——设计任务空间的骨架。
  • 扩散采样理论:流匹配、SDE 随机度、CPS 的系数保持原理——RL 探索机制的设计依据。

7.2 方法论知识层

  • 程序化任务生成:参数化生成器+求解器+元数据记录的范式——规模化无标注监督的来源。
  • 经典 CV 技术栈:HSV 分割、轮廓检测、OCR、轨迹跟踪——语义实体提取评分器的实现材料。
  • RLVR 方法论:Flow-GRPO/DanceGRPO 的组相对奖励公式——把评分器接入 RL 的桥梁。
  • 评测科学:实例级 vs 模型级验证的区别;竞技场式人类偏好协议;可复现性度量。

7.3 工程知识层

  • 大规模分布式训练与 LoRA 配置;20 机构协作的生成器审核流程(每个生成器经渲染样本检查+求解器验证);跨模态一致渲染的工程。

7.4 知识融合的关键节点

  • 节点一(评分器=评测×奖励的统一抽象):意识到"确定性、人类对齐、便宜"这三个评测需求恰好也是 RL 奖励的需求——一次投入双重回报。
  • 节点二(对齐渲染):把"模态比较"从不可能(语料不同)变为可能(同一问题的不同渲染)——实验设计的巧思。
  • 节点三(反事实三件套):训练消融+推理干预+可视化从三个独立方向收敛到同一结论——机制证据的鲁棒性设计。
  • 节点四(大规模协作治理):50+ 研究者贡献 300 生成器还能保持统一质量协议——社区基础设施的组织知识。

八、论文中可以提取的通用性灵感

灵感一:确定性评分器应优先于更强裁判

  • 核心思想:当反馈要用于优化(而非仅排名)时,可复现性比智能更重要——一个"笨但稳定"的规则评分器优于"聪明但摇摆"的 LLM 裁判。
  • 论文证据:评分器 per-vote 一致性 >0.60 超 GPT-5.5(0.54),重评变化 0.00% vs VLM 54.6–92.8%;RLVR(0.548)> RLVLM(0.508)且后者训练震荡。
  • 推广场景:自动化测试中确定性断言优于 LLM 审代码;教育评分用规则化 rubric;自动驾驶仿真验收用规则引擎;内容审核的确定性规则层。

灵感二:任务覆盖广度比实例数量更利于迁移

  • 核心思想:从少数模板反复采样产生的是"相似变化的堆叠",不扩展能力面;广覆盖的多样化任务才教出可复用操作。
  • 论文证据:300 任务训练后在 7 个外部基准 +28 分级别迁移;最近邻分析显示测试例与训练集不相似——学的是操作不是样本。
  • 推广场景:题库设计应覆盖题型谱系而非刷同类题;员工轮岗广度 vs 单岗位重复;模型数据配比的多样性原则;游戏 AI 的课程设计。

灵感三:为待比较的变量创造"同底数"条件

  • 核心思想:要归因"介质/框架/工具"的差异,必须让它们求解同一问题分布——对齐渲染是受控实验思想在多模态的落地。
  • 论文证据:同一实例渲染为视频/关键帧/交错三版本,才得出"视频强于跟踪、交错高性价比、单图弱于过程"的可信结论。
  • 推广场景:框架 benchmark 的同一任务集;云厂商选型的同负载测试;教学法的同教材对照;临床试验的同适应症分组。

灵感四:用三面独立证据钉死一个机制主张

  • 核心思想:单一证据(如消融)总有替代解释;训练侧消融+推理侧干预+过程可视化三方收敛,才能把相关性升级为因果性。
  • 论文证据:“视觉轨迹 > 文本 CoT"由消融(去图 −0.111 vs 去文本 −0.009)、干预(去图 0.099 vs 去文本 0.533)、CoS 可视化共同支撑。
  • 推广场景:药物机制研究(体外+动物+临床);性能优化验证(基准+剖析+ A/B);教育政策评估(横断+追踪+实验);任何因果归因场景。

灵感五:基础设施是范式成熟的催化剂

  • 核心思想:新范式的瓶颈往往不是算法而是缺少可系统研究的公共底座;造基础设施的回报是定义整个领域的问题空间。
  • 论文证据:VBVR-Pro 之前"通过生成推理"只有零散演示;之后 9 模型可训练比较、RL 可优化、模态可归因——论文类比 ImageNet 的历史作用。
  • 推广场景:具身智能需要统一仿真协议;agent 研究需要可复现 harness 基准;科学发现的自动化需要标准化实验底座;开源社区建设公共测试集。