论文链接:Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent HTML 全文:arxiv.org/html/2608.03979v1 代码仓库:github.com/Osilly/Vision-DeepResearch 发表时间:2026 年 8 月 核心作者:Zhen Fang, Yu Zeng, Wenxuan Huang, … Wanli Ouyang(上海 AI Lab), Shaosheng Cao, Feng Zhao 等 20 位作者 领域标签:多模态智能体、视频深度研究、视觉定位、强化学习、Agent Harness


一、论文背景

1.1 从"Deep Research"到"Video Deep Research":任务边界的跃迁

过去两年,“Deep Research”(深度研究)成为大模型应用最炙手可热的形态之一。它不再是单轮问答,而是一个会自主多步检索、交叉验证、综合成报告的智能体——典型的如各种联网搜索 Agent、代码调研 Agent。但这些能力几乎全部停留在纯文本或静态图像的世界里。

当我们把同样的范式搬到连续视频流上时,问题立即发生质变:

  • 视频是时空密集的信号。要回答"这个视频里第 47 秒出现的男演员后来在哪部影片里拿了影帝",Agent 不能只是"看完视频凭印象答",它必须先定位到那一帧、裁剪出那个人脸、再去网络检索验证。这种"先看清、再查证"的过程,是图像 Deep Research 不曾面对的。
  • 视频中的实体往往是长尾、动态、跨帧漂移的。一辆车从远到近,一个人从正面到侧脸,同一个实体在不同帧里的视觉表征差异巨大,单帧 grounding 的成功率会被严重稀释。
  • 视频理解天然要求跨帧、跨实体、跨模态的多跳推理。这把任务从"感知"推向了"感知 + 探索"的复合体。

Video-DeepResearch 这篇论文,正是把多模态 Agent 的边界,从"给一张图去查"推进到"给一段视频去深入研究"。

1.2 两个被论文当场"抓包"的顽疾

论文没有上来就讲方法,而是先做了一个非常漂亮的诊断实验(Empirical Study):把三个代表性模型丢到 VideoDR 基准上,仔细追踪它们到底调用了哪些工具。结果暴露了两个让整个领域都难堪的事实:

模型准确率视觉工具调用/任务文本工具调用/任务
Qwen3.5-35B-A3B41%0.040.58
Qwen3.5-397B-A17B58%0.101.27
GPT-557%0.000.12

顽疾一:模态偏见(Modality Bias)/ 视觉工具回避。即便是参数量高达 397B 的开源旗舰,平均每个任务也只调用 0.10 次视觉操作,却调用 1.27 次文本搜索。换句话说,Agent 嘴上说是"多模态",身体却很诚实地绕开视觉工具、直接去 Google 关键词。它根本没有真正"看"视频。

顽疾二:参数知识泄露(Parametric Knowledge Leakage)。GPT-5 在几乎零工具调用(视觉 0.00、文本 0.12)的情况下,仍然拿到了 57% 的"竞争性"分数。这意味着——现有基准里大量问题,模型靠内部记忆就能蒙对,根本不需要真正去做工具增强的推理。这是一个评测层面的系统性缺陷:分数可能和"真正的视频理解"完全脱钩。

这两个顽疾合起来,构成了本文要解决的核心问题:如何让 Agent 真正去"看",又如何让评测真正测出"看的能力"。


二、论文定位和关联工作

2.1 本文在研究脉络中的位置

Video-DeepResearch 处在三条主线的交汇处:

  1. 视觉语言模型(VLM)主线:从 CLIP、BLIP 到 Qwen-VL / Qwen3-VL / Qwen3.5 系列,把视觉感知能力内化进模型权重。这条线解决了"看懂",但没解决"主动去看"。
  2. 工具增强 Agent 主线:以 Deep Research、ReAct、ToolFormer 为代表,让模型学会调用外部工具。这条线在文本领域成熟,但在视频领域几乎没有被系统性地训练过。
  3. 视频问答(VideoQA)评测主线:从 MVBench、MLVU、Video-MME 到 VideoDR。前几代基准多是"闭卷感知"——视频和问题一起给,直接答;而 VideoDR 类基准要求"开卷探索"——需要外部证据。

Video-DR 的独特定位是:第一条线提供基础模型,第二条线提供 Agent 范式,第三条线提供评测战场,它把三者耦合起来,提出了一套完整的"训练-评测"闭环。

2.2 最直接的关联工作

工作关系关键差异
VideoSearcher [Gao 2026]最接近的同期工作,同样用 RL 训练视频 Deep Research Agent,提出 BiSPO 算法VideoSearcher 没有强制阶段化解耦,视觉与文本工具同时可用;Video-DR 用"工具解锁"硬性约束先视觉后网络
RETOOL-VIDEO [Liu 2026]提出 134 个细粒度工具 + 递归 grounding 的视频 Agent工具空间极大但缺乏"模态偏见"的诊断与针对性训练;Video-DR 反其道——只定义少量核心工具,但用训练范式纠正偏见
VideoMind [Liu 2025]角色化 Agent(planner/grounder/verifier/answerer)+ Chain-of-LoRA把不同能力拆到不同 LoRA,本质是"分工";Video-DR 是"单模型 + 显式工具协议",强调同一策略网络的能力内化
VideoDR 基准 [Liu 2026]本文直接对标和重构的评测原版 VideoDR 偏文本中心检索,丢弃了关键视觉信息;本文构造的 VideoDR-Bench 强制要求视觉 grounding 才能答对
GRPO [DeepSeek]本文采用的 RL 算法基础本文把 GRPO 从纯文本推理迁移到多模态 Agent 轨迹优化,并设计了格式违规梯度的下采样技巧

2.3 与顶级闭源模型的对照

论文最硬的对照对象是 2026 年上半年的三大闭源旗舰:

  • Claude-4.5-Sonnet:以"扩展思考(Extended Thinking)“和 Constitution AI 著称,在 SWE-bench 等推理密集任务上长期领先,是本文 59.0% 的直接被超越对象。
  • GPT-5:在 GPQA Diamond 等专家知识基准上第一,但正如本文诊断——它的分数高度依赖参数记忆,工具调用接近于零。
  • Gemini 2.5 Pro:10M 上下文 + 强视频理解,是视频任务的传统强者。

Video-DR 的定位宣言可以一句话概括:不是靠更大的模型,而是靠"让模型真正学会用工具看视频"的训练范式,去打赢这些闭源旗舰。


三、问题定义

3.1 形式化:视频 Deep Research 是一个序贯决策过程

论文把任务严格定义为一个序贯决策过程(Sequential Decision-Making)。在第 i 步,Agent 基于历史轨迹生成动作:

$$a_i \sim \pi_\theta(a \mid \mathcal{H}_i), \quad \mathcal{H}_i = [Q, V, a_1, o_1, \dots, a_{i-1}, o_{i-1}]$$

其中 $\pi_\theta$ 是多模态策略,$Q$ 是问题,$V$ 是视频,$o$ 是环境返回的观察。动作空间 $\mathcal{A}$ 被精心设计为:

$$\mathcal{A} = \{\texttt{Select\_Keyframe}, \texttt{Crop\_Search}, \texttt{Search}, \texttt{Visit}, \dots\}$$
  • 时间工具 Select_Keyframe:选择索引 $t \in \{1, \dots, T\}$,隔离出一帧 $v_t$。
  • 空间工具 Crop_Search:在 $v_t$ 上用一个 bbox $B \in \mathbb{R}^4$ 裁剪目标实体,产出局部视觉上下文 $c_{vis} = \text{Crop}(v_t, B)$,供下游搜索使用。
  • 网络工具 Search / Visit:标准 web 检索与网页蒸馏。

这套形式化的关键在于——视觉 grounding(Select_Keyframe + Crop_Search)是 web 探索的前置依赖,而不是可选项。这正是论文要强制的事情。

3.2 两个必须同时解决的目标

论文把问题拆成两个耦合目标:

  1. 评测目标(构造 VideoDR-Bench):必须有一组不靠参数记忆就能蒙对的难题,否则任何方法改进都无法被可信度量。这意味着基准要主动过滤掉参数知识泄露的样本。
  2. 训练目标(构造 Video-DR 模型):必须让模型从"回避视觉工具"转变为"主动穷举式视觉 grounding”,并且能自主探索而非机械模仿教师轨迹。

这两个目标缺一不可——没有好基准,训练改进看不出来;没有好训练,基准就只是个排行榜。


四、解决方案

Video-DR 的方案是一个完整闭环,可以拆成三个相互咬合的组件:数据合成 → 轨迹合成 → 两阶段训练。

4.1 VQA 数据合成管道(Phase I + II)

数据是整个方案的源头。论文设计了一条多阶段、抗泄露的 VQA 合成管道,最终产出 30K 高质量 VQA 对。

Step 0:多源视频过滤

  • 来源既有既有视频数据集,也有 YouTube 流媒体。
  • 两阶段过滤:规则过滤(丢弃超长视频)+ Agent 过滤(用 Qwen3.5-35B-A3B 评估内容复杂度,剔除信息量不足或过于简单的视频)。

Step 1:关键帧选择与视觉搜索

  • 用 CLIP-ViT-L/14@336px 计算帧间相似度,相似度 > 0.8 的连续帧被丢弃(去冗余),每视频最多保留 20 帧关键帧。
  • 用 Qwen3.5-397B-A17B 在关键帧上预测 bbox 并定位实体,再用 Qwen3.5-35B-A3B 做语义对齐验证。
  • 产出元数据四元组:$\langle v_t, B, \text{entity\_name}, \text{search\_summary} \rangle$。

Step 2:VQA 生成与抗泄露过滤(关键创新)

  • 两种生成模式:单实体模式(事实性问题)和多实体模式(跨实体组合推理)。
  • 参数泄露过滤是这里的灵魂:对每个生成问题执行 4 次无工具 rollout,如果 Agent 在任何一次尝试中答对,该实例被永久丢弃。这从源头保证了——留下来的题目,模型不调用工具就答不对。

这条过滤策略与第三部分诊断的"参数知识泄露"问题直接对应,是从数据侧对评测缺陷的根治。

4.2 解耦感知-探索管道(Phase III):阶段式工具解锁

这是论文方法侧最具识别度的设计。论文没有让 Agent 自由选择工具,而是硬性规定执行阶段:

阶段 1:纯视觉感知(强制穷举)
├── 可用工具:Select_Keyframe, Crop_Search
├── 目标:强制跨帧、跨实体的视觉 grounding
└── 终止:视觉上下文充足 OR 达到最大感知深度

阶段 2:网络探索(条件解锁)
├── 扩展工具:Search, Visit
├── 目标:基于视觉证据进行网络检索
└── 最终:生成答案

这个设计的精髓在于——工具集合是动态解锁的,而不是一开始就全开放的。为什么这么做?因为论文诊断发现,一旦视觉和网络工具同时可用,Agent 会系统性地直接跳到网络工具,完全绕过视觉 grounding。阶段式解锁强制 Agent 必须先把视觉证据拿到手,才能进入 web 探索阶段,从机制上消除了"捷径"。

用 Qwen3.5-397B-A17B 作为教师生成轨迹,应用拒绝采样(rejection sampling)只保留成功解决的轨迹,最终得到 7K 高质量视频 DR 轨迹。

4.3 两阶段训练:SFT + GRPO

4.3.1 基座模型选择

变体基座激活参数
Video-DR-30B-A3BQwen3-VL-30B-A3B-Instruct3B
Video-DR-35B-A3BQwen3.5-35B-A3B3B

两者都是 MoE 架构,激活参数仅 3B——这一点至关重要,后面解释 35B 为什么能赢 Claude-4.5-Sonnet 时会用到。

4.3.2 第一阶段:监督微调(SFT)

训练数据组成:

  • 7K 视觉 DR 轨迹(来自 4.2 节)
  • 7K 纯文本 QA 实例(来自 VDR 数据集)
  • 合计 14K 混合数据

为什么要在视觉数据里掺文本数据?这不是拍脑袋。论文的诊断指出,模态偏见的根源在于——模型对"工具调用"这件事本身的先验,主要来自文本预训练语料。注入文本 DR 数据,可以让模型把"主动调用工具去探索"这个行为模式从文本域迁移到视觉域。消融实验会证明这一步贡献了 +3.8% 的提升。

SFT 目标就是标准的负对数似然:

$$\mathcal{L}_{\text{SFT}} = -\mathbb{E}_{(x,y) \sim \mathcal{D}}\left[\sum_{i=1}^{|y|} \log \pi_\theta(y_i \mid x, y_{关键训练配置:

  • 硬件:44 节点 × 8 × 80GB GPU(共 352 张 GPU)
  • 框架:Megatron-LM
  • 上下文长度:80,000 tokens(视频 Agent 必须的长上下文)
  • 并行:TP=4, CP=2, EP=8, SP 启用
  • 3 个 epoch,全局 batch 64,学习率 warmup 到 1e-5 再衰减到 5e-7

4.3.3 第二阶段:GRPO 强化学习

SFT 只是模仿教师, ceiling 被教师轨迹锁死。要真正"自主探索",必须上 RL。

RL 数据构造的精髓——难度过滤:

  • 对每个轨迹执行 4 次 rollout
  • 只保留 Pass@4 分数严格在 0 和 1 之间的实例(即有时对有时错的"中等难度"样本)
  • 全对或全错的样本被剔除——前者太简单学不到东西,后者太难无法提供有效梯度
  • 最终得到 2K 中等难度 RL 数据集

奖励设计:

  • 稀疏二值奖励:$r=1$(答案正确)或 $r=0$(错误)
  • 正确性判断由 Qwen3-VL-30B-A3B-Instruct 担任"裁判模型"
  • 一个关键的工程技巧:对格式违规(format violation)的负梯度,以 20% 概率下采样。这避免了 RL 早期模型格式不稳时,格式惩罚淹没正确性信号。

GRPO 目标函数:

$$\mathcal{L}_{\text{GRPO}} = \frac{1}{G}\sum_{i=1}^{G}\left[\min\left(\frac{\pi_\theta(o_i)}{\pi_{\text{old}}(o_i)}\hat{A}_i, \text{clip}\left(\frac{\pi_\theta(o_i)}{\pi_{\text{old}}(o_i)}, 1-\epsilon, 1+\epsilon\right)\hat{A}_i\right)\right] - \beta\mathbb{D}_{\text{KL}}$$

4.4 VideoDR-Bench:抗泄露的人类-AI 协作基准

最后是评测侧。VideoDR-Bench 是一个 200 条多跳 VQA 的精标基准,设计极其考究:

基本构成:

  • 8 名专业标注员,约 3 周标注周期,人类-AI 协作
  • 6 大领域分布:Knowledge 29.5%、Entertainment 22.0%、Daily Life 18.5%、Game & Sports 14.5%、News 12.0%、Others 3.5%
  • 视频时长分布:短视频(≤2 分钟)46%、中视频(2-10 分钟)34%、长视频(≥10 分钟)20%——长视频占比不低,保证了时间定位的挑战性

标注流程的精髓:标注员必须在关键时间戳暂停视频,亲自用 Crop_Search 工具查询显著视觉实体,严格验证检索的外部证据与原始帧一致后,才基于验证结果制定种子 VQA。这保证了——每个问题的"标准答案路径"都必须经过视觉 grounding。

多代理合成阶段:

Drafting Agent(头脑风暴扩展种子 VQA)
  ↓
搜索引擎查询(检索网络上下文)
  ↓
QA Generation Agent(制定多跳推理问题)
  ↓
参数泄露过滤(淘汰无工具可答的题)
  ↓
人工验证(答案性验证)
  ↓
Ranking Agent(评分保留最高质量实例)
  ↓
可递归作为新种子,实现迭代复杂化

这个流程最重要的设计是**“可递归作为新种子”**——它让题目的复杂度可以迭代堆叠,从而构造出真正需要多跳推理才能解决的难题。


五、实验与评估

5.1 主结果:刷新 SOTA

下表是论文最核心的结果(表 3,按领域拆分):

模型VideoDRKNLENTDLYG&SNWSOTHBench 总平均
闭源
Gemini 2.5 Pro62.054.252.351.451.754.257.153.057.5
GPT-557.050.845.548.648.345.842.948.052.5
Claude-4.5-Sonnet63.055.954.554.158.654.242.955.059.0
开源基座
Qwen3.5-397B-A13B58.049.261.440.555.229.214.347.552.8
Qwen3-VL-30B-A3B-Instruct38.044.143.235.151.741.742.943.040.5
Video-DR-30B-A3B(本文)62.062.761.440.558.658.342.956.559.3
相对基座提升+24.0+18.6+18.2+5.4+6.9+16.60.0+13.5+18.8
Qwen3.5-35B-A3B(基座)42.045.850.040.544.833.328.643.542.8
Video-DR-35B-A3B(本文)68.066.165.956.862.141.742.960.064.0
相对基座提升+26.0+20.3+15.9+16.3+17.3+8.4+14.3+16.5+21.2

三个核心结论:

  1. Video-DR-35B-A3B 以 64.0% 创下新 SOTA,超越 Claude-4.5-Sonnet(59.0%)5.0 个百分点,超越 GPT-5(52.5%)11.5 个百分点,超越 Gemini 2.5 Pro(57.5%)6.5 个百分点。在 VideoDR 主基准上更是达到 68.0%,是所有模型中最高。
  2. Video-DR-30B-A3B 达到 59.3%,与 Claude-4.5-Sonnet 持平,证明这套训练范式在紧凑规模下依然有效。
  3. 相对基座的提升幅度惊人:30B 变体 +18.8%,35B 变体 +21.2%。这说明基座模型本身的能力远未被释放——是训练范式,而不是模型规模,决定了上限。

5.2 工具使用分析:从"不看"到"主动看"

下表(表 4)直接印证了论文诊断的顽疾被治愈:

模型VideoDR 视觉VideoDR 文本Bench 视觉Bench 文本
Claude-4.5-Sonnet1.833.382.253.24
GPT-50.000.120.311.43
Gemini 2.5 Pro0.310.841.932.07
Qwen3.5-35B(基座)0.040.580.200.70
Qwen3.5-397B(基座)0.101.270.042.77
Video-DR-30B(本文)2.334.242.983.81

最震撼的对比:基座 Qwen3.5-397B 每任务视觉工具调用 0.10 次,经过 Video-DR 训练后的 30B 模型达到 2.33 次——23 倍增长。一个 30B 的"小学生"在视觉工具使用上,完爆了 397B 的"大学生"基座。这证明了论文的核心论点:模态偏见不是架构限制,而是训练数据分布的假象,可以通过训练范式纠正。

同时,GPT-5 在 VideoDR 上视觉调用为 0.00——它根本没在看视频,却在 VideoDR 上拿到 57% 分数。这正是参数知识泄露的直接证据。而 VideoDR-Bench 成功把它逼到了 0.31 次视觉调用——基准的抗泄露设计起了作用。

5.3 消融研究:每个组件的贡献

在 Video-DR-30B 上的渐进式消融(表 5):

配置VideoDRBench平均增量
Base38.043.040.5—
4K-SFT44.048.046.0+5.5
7K-SFT55.051.053.0+7.0
7K-SFT + 7K-text-SFT59.054.556.8+3.8
14K-SFT + 2K-RL62.056.559.3+2.5

逐项解读:

  • 视觉 SFT(Base → 7K-SFT)贡献 +12.5%:4K 轨迹立即带来 +5.5%,扩展到 7K 进一步推到 +12.5%。这是整个方案的基础——没有视觉 grounding 轨迹,后面的所有改进都无从谈起。值得注意的是,VideoDR-Bench 的改善(51.0% vs 43.0%)比 VideoDR 更显著,说明视觉 grounding 的泛化性很强。
  • 文本增强 SFT(+7K-text-SFT)贡献 +3.8%:这一步印证了论文的关键假设——注入文本 DR 数据可以跨模态迁移,强化"主动调用工具"的行为先验,从而间接提升视觉 grounding 表现。这是一个反直觉但极具启发性的发现:要让模型学会用视觉工具,反而要先教它用文本工具。
  • GRPO 强化学习(+2K-RL)贡献 +2.5%:RL 把模型从"模仿教师"推向"自主探索"。对 VideoDR-Bench 的改善(+2.0%)尤其说明泛化性——RL 学到的是策略本身,而不是特定轨迹。

论文总结得非常到位:Video-DR 的能力来自视觉 grounding、文本探索技能、自主探索三者的协同组合,任何一个组件单独使用都达不到最优,完整管道是实现 SOTA 的必要条件。


六、机制解释:为什么 35B 能赢 Claude-4.5-Sonnet

这是本文最值得深挖的部分。一个激活参数仅 3B、总参数 35B 的开源模型,凭什么在视频 Deep Research 任务上反超参数量大得多的 Claude-4.5-Sonnet?这不是玄学,而是有清晰的机制因果。

6.1 原因一:闭源旗舰的"视觉工具回避"是训练缺陷,不是能力上限

从表 4 可以看到,Claude-4.5-Sonnet 在 VideoDR 上视觉工具调用 1.83 次,已经是闭源模型里最"勤快"的,但仍然明显低于 Video-DR-30B 的 2.33 次。而 GPT-5 的视觉调用是 0.00——它根本不在看。

为什么会这样?因为闭源模型的 RLHF / 后训练数据里,“主动调用视觉定位工具"这种行为几乎从未被正向强化过。 这些模型在通用对话、代码、文本推理场景下被训练,它们的行为先验是"用脑子想,用文字答”。当它们被丢到视频 Agent 场景时,默认行为就是——绕开视觉工具,直接用文本搜索,甚至直接用内部记忆蒙。

Video-DR 通过 14K SFT + 2K RL,把"主动穷举式视觉 grounding"这种行为模式直接写进了模型的策略分布。它不是比 Claude 更聪明,而是它被专门训练成了"会看视频的 Agent"。

6.2 原因二:阶段式工具解锁强制了正确的因果链

Claude-4.5-Sonnet 可以同时调用所有工具——这看似自由,实则是灾难。因为模型一旦发现"直接 Search 关键词"这条路在部分题目上能蒙对,它就会系统性地走这条捷径,永远学不会先 grounding 再探索。

Video-DR 的阶段式解锁从机制上消除了这条捷径。模型必须先用 Select_Keyframe 和 Crop_Search 把视觉证据拿到手,工具集才会扩展到 Search 和 Visit。这强制建立了一条正确的因果链:

问题 → 定位关键帧 → 裁剪实体 → 视觉证据 → 网络检索 → 交叉验证 → 答案

而闭源旗舰走的是:

问题 → 直接 Search 关键词 → 猜答案(捷径,失败率高)

这条捷径在简单题上能用,但在 VideoDR-Bench 这种抗泄露的多跳难题上必然崩盘——因为答案的关键信息藏在视频某一帧的某个角落里,不定位就找不到。

6.3 原因三:抗泄露基准让"记忆"失效,让"真正的 grounding"得分

GPT-5 在 VideoDR 上零工具调用却拿 57%,是参数知识泄露的铁证。但 VideoDR-Bench 经过了4 次无工具 rollout 的抗泄露过滤——任何能被模型靠记忆答对的题,都被永久剔除了。

这意味着——在 VideoDR-Bench 上,参数记忆这条捷径被彻底堵死。所有模型必须真正去做 grounding + 探索才能得分。而 Video-DR 是唯一一个被系统性训练过去走这条"正路"的模型。Claude-4.5-Sonnet 虽然也部分走正路(视觉调用 1.83 次),但它的"走正路"能力是从通用能力泛化来的,没有被专门强化;Video-DR 则是用 7K 专门合成的 grounding 轨迹 + 2K RL 策略优化硬生生训出来的。

6.4 原因四:MoE 架构的工具调用密度优势

最后是一个架构层面的原因。Video-DR-35B 基于 Qwen3.5-35B-A3B,是 MoE 架构,激活参数仅 3B。MoE 的特性是——稀疏激活让模型在长轨迹、多工具调用场景下的推理成本极低。

视频 DR 任务的特点恰恰是长轨迹、多工具、长上下文(80K tokens)。在 such 场景下,稠密大模型每一步都要激活全部参数,成本极高;而 MoE 每步只激活 3B,可以负担得起 5-10 步的多工具调用轨迹。这给了 Video-DR 一个隐性的"轨迹深度优势"——它能 afford 走更深的 grounding-探索链,而闭源旗舰在同样的成本预算下,轨迹会更短。

6.5 一句话总结

Video-DR-35B 赢 Claude-4.5-Sonnet,不是赢在"更聪明",而是赢在"被专门训练过去做正确的因果推理链"——阶段式解锁强制了正确的工具调用顺序,抗泄露基准堵死了记忆捷径,14K SFT + 2K RL 把"主动视觉 grounding"写进了策略分布,MoE 架构让长轨迹调用变得可负担。这四者合起来,让一个 3B 激活参数的模型,在视频 DR 这个特定战场上,打赢了体量大得多的通用旗舰。


七、知识反推:从结果倒推论文的核心洞察

读完这篇论文,我们不仅可以总结作者说了什么,还可以倒推一些作者没有明说、但可以从结果中推断出的深层洞察。

7.1 洞察一:模态偏见是"训练分布病",不是"架构病"

这是本文最重要的反直觉发现。业界长期默认——视觉语言模型"不愿意用视觉工具"是因为某种架构瓶颈。但本文用铁证反驳:只需 14K SFT + 2K RL,一个 30B 模型的视觉工具调用就从 0.10 次飙升到 2.33 次。 模态偏见的根源是预训练语料里"工具调用 = 文本搜索"的分布偏置,一旦用专门的 grounding 轨迹去纠正,偏见就消失了。

这对整个 VLM 领域都是个重要启示:很多被认为是"能力上限"的问题,其实是"训练分布病",可以用相对小规模的对齐数据根治。

7.2 洞察二:“被动回忆"和"主动验证"是两种不同的认知模式

GPT-5 的零工具调用 + 57% 准确率,揭示了一个深层问题:当前大多数 VLM 评测,测的是"被动回忆”,而不是"主动验证"。 一个模型可以完全不"看"视频,靠内部记忆拿到看似不错的分数。

Video-DR 的阶段式解锁 + 抗泄露基准,本质上是在强制模型从"被动回忆"切换到"主动验证"。这两种模式的分野,可能比"参数量大小"更能解释模型在真实任务上的表现差异。这也是为什么——在 VideoDR-Bench 这种强制主动验证的基准上,参数量大得多的 GPT-5 反而输给了 35B 的 Video-DR。

7.3 洞察三:RL 的价值不在"更聪明",而在"打破模仿上限"

消融实验显示,GRPO 只贡献了 +2.5% 的提升,看似不如 SFT 的 +12.5% 醒目。但这 +2.5% 的价值远超数字本身——它代表了模型从"模仿教师"到"自主探索"的质变。

SFT 的上限被教师轨迹锁死——教师做不到的,学生永远学不到。GRPO 的真正价值是让模型探索到教师从未走过的轨迹,从而突破模仿学习的天花板。这个 +2.5% 是"新大陆",而不是"已知领土的优化"。

7.4 洞察四:基准和模型必须协同进化

本文最值得借鉴的方法论是——它没有只造模型,也没有只造基准,而是同时重构了两者,并让它们相互咬合。 VideoDR-Bench 的抗泄露设计保证了模型改进可被可信度量;Video-DR 的训练范式针对的正是基准暴露出的缺陷。这种"模型-基准协同进化"的思路,对整个 Agent 评测领域都有示范价值。


八、可迁移的通用启发

抛开视频 Deep Research 这个具体任务,这篇论文对更广泛的 AI 研究和工程实践有哪些可迁移的启发?

8.1 启发一:诊断先于方案

论文最漂亮的地方不是方法,而是开篇那个诊断实验。它用三行表格,把"模态偏见"和"参数知识泄露"这两个行业级顽疾当场抓包。没有这个诊断,后面所有的设计都失去意义——因为你不知道病在哪,开什么药都是撞大运。

这对工程实践的启发是:在动手优化之前,先用最简洁的探针实验把问题的根因定位清楚。 一个好诊断胜过十个方案。

8.2 启发二:约束即设计

阶段式工具解锁是"约束即设计"的典范。直觉上,给模型更多自由(同时开放所有工具)似乎更好;但实际上,有约束的搜索空间反而能学到更好的策略。这与 curriculum learning、阶段性课程设计的思想一脉相承。

对 Agent 设计的启发是:不要急着把所有工具一次性全开放,想想能不能用"解锁机制"强制模型先掌握基础能力。

8.3 启发三:跨模态迁移可以治"同模态病"

论文最反直觉的发现是——给视觉模型掺文本 DR 数据,反而提升了视觉工具调用。这是因为"主动调用工具探索"这个行为先验,是跨模态可迁移的。

这对多模态训练的启发是:当一个模态的能力上不去时,试试用另一个模态的对齐数据去"激活"它。 行为先验的迁移,往往比知识本身的迁移更有效。

8.4 启发四:难度过滤是 RL 数据的王道

GRPO 阶段只保留 Pass@4 严格在 (0, 1) 之间的"中等难度"样本,这个细节极其关键。全对的样本没有梯度信号,全错的样本梯度噪声过大——只有"有时对有时错"的样本,才是 RL 真正能学的东西。

这对所有 RL 训练的启发是:RL 数据的质量不在多,在"难度刚好"。 与其堆 10K 全对全错的样本,不如精心筛 2K 中等难度的样本。

8.5 启发五:小模型 + 专门训练 > 大模型 + 通用训练

Video-DR-30B 追平 Claude-4.5-Sonnet,Video-DR-35B 反超之。这个结果对整个行业的启示是——在垂直 Agent 场景下,“小模型 + 针对性训练范式"可以打赢"大模型 + 通用训练”。

这意味着,Agent 时代的竞争壁垒,正在从"参数规模"转向"训练范式 + 数据合成 + Harness 设计"。这是中小团队的机会——你不需要炼万亿参数,你需要的是一套精巧的训练-评测闭环。

8.6 启发六:评测的抗污染要从数据源头做起

VideoDR-Bench 的"4 次无工具 rollout 过滤"是一个极其朴素但极其有效的设计。它从数据源头把所有"不靠工具就能答对"的题都剔除了。这与 WorkBuddy Bench 的抗污染思路异曲同工——污染不是事后修补的,是构造时就该杜绝的。

对所有 benchmark 构造者的启发是:与其纠结事后检测污染,不如在设计时就内置抗污染机制。


九、总结

Video-DeepResearch 这篇论文做了一件非常完整的事:

  1. 诊断:用简洁实验抓出当前多模态 Agent 的两大顽疾——模态偏见与参数知识泄露。
  2. 方案:用"解耦感知-探索 + 阶段式工具解锁 + SFT+GRPO"三件套,系统性地根治了顽疾。
  3. 评测:构造了 VideoDR-Bench 这个抗泄露基准,让真正的视频理解能力可被可信度量。
  4. 结果:35B-A3B 模型以 64.0% 超越所有闭源旗舰,30B 变体追平 Claude-4.5-Sonnet,证明"训练范式 > 模型规模"。

它最深远的意义不在于那个 64.0% 的分数,而在于它清晰地向社区传递了一个信号:多模态 Agent 的下一个前沿,不是把模型做得更大,而是让模型真正学会"主动去看、主动去查、主动去验证"。 当评测基准不再允许模型靠记忆蒙混过关,当训练范式不再让模型回避视觉工具,多模态 Agent 才真正从"被动的图像描述器"走向"主动的视频研究者"。

这是一个范式转移的起点。