Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 精读
上海 AI Lab 等机构联合提出 Video-DeepResearch(Video-DR),把多模态 Deep Research Agent 从静态图像推进到连续视频流。论文诊断出当前 Agent 的两大顽疾——模态偏见(回避视觉工具转向文本搜索)与参数知识泄露(靠内部记忆蒙答案而非真正调用工具),并设计解耦感知-探索流水线 + 阶段式工具解锁 + SFT+GRPO 两阶段训练予以破解。其 35B-A3B 模型以 64.0% 平均准确率刷新 VideoDR-Bench SOTA,超越 Claude-4.5-Sonnet 5.0 分、GPT-5 11.5 分;30B 变体也追平 Claude-4.5-Sonnet。本文从机制因果层面解释:为何一个激活参数仅 3B 的模型能在视频 Deep Research 任务上反超数十倍体量的顶级闭源模型。