论文链接:One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering 发表时间:2026年9月 机构:Queen Mary University of London × Samsung AI Research Institute(产学研合作:Samsung 提供长视频理解落地场景与工程资源,QMUL 出方法框架) 领域标签:cs.CV / cs.AI — 长视频理解 / 技能路由

一、论文背景

长视频 QA 的帧预算困境:小时级视频无法整段输入模型,必须选帧——有限的帧预算是"证据获取"问题:选到关键帧才能答题。现有 training-free 方法大多一套帧选择策略打天下(均匀采样、场景切分、相关性打分等)。

被忽视的异质性:论文的实证分析显示,帧选择策略的相对有效性随问题语义类别剧烈变化——“数数题"需要密集均匀采样,“因果题"需要事件转折点,“细节题"需要文本线索定位。任何单一策略都在部分类别上系统性失效。

标注困境:为每个目标 benchmark 标注"哪类问题配哪个策略"成本高——需要零目标域标注的路由机制。

二、论文定位和关联工作

谱系工作关键区别
帧选择均匀采样/场景切分/相关性打分系单一策略;AutoSkill 类别条件路由
视频检索增强SeViLA 等帧定位器定位器是模型组件;AutoSkill 是可执行技能层
技能发现Voyager、SkillOpt 系在任务反馈上进化;AutoSkill 在源域池上发现后跨域路由
免标注适配测试时自适应AutoSkill 的分类树归纳只用问题文本(无答案标签)

本文定位:帧选择从"策略选择"升级为"技能空间的类别条件路由”,且整条管线无需目标域标注。

三、问题定义

具体场景:长视频 QA benchmark 上,帧预算 B 内选哪些帧,使得 QA 准确率最高。

抽象问题:当最优策略是问题类别的函数而类别标签不可得(目标域无标注)时,如何自动发现策略集合并构建无监督路由?

形式化:源域带标注池 D_s → 技能集 {s_1…s_n};目标域仅有未标注问题文本 Q_t → 归纳分类树 T(Q_t);路由 π: category(q) → s。目标 max E[QA(q | frames selected by π(q))]。

精妙之处:把"策略选择"重新表述为"问题空间分区+分区条件化策略”——将连续的策略搜索离散化为有限技能的路由问题。

四、问题解法

阶段一:源域技能发现(source-supervised)

  • 小规模带标注源池上,LLM agent 循环:提议(根据失败模式提出新帧选择技能)→ 实现(写成可执行代码,如"按字幕密度采样”)→ 评估(在源池任务上跑分)→ 精炼(依据执行证据修改);
  • 产出:一批可执行技能 + 每个技能擅长的类别画像。

阶段二:目标域分类树归纳(零标注)

  • 仅用目标 benchmark 的问题+选项文本(不含答案)聚类/归纳出语义分类树;
  • 关键假设:问题语义类别跨 benchmark 迁移(“数数"还是"数数”)。

阶段三:类别→技能路由

  • 源域上建立"类别→最优技能"映射;目标域问题沿分类树落到类别,路由到对应技能;
  • 推理时执行被选技能的采样代码。

五、评估指标与实验证据

维度结果
主结果多个长视频 benchmark 平均准确率超 Qwen2.5-VL-7B 基线 2.4%、超 Qwen3.5-4B 1.2%
策略异质性证据预分析:策略相对有效性随语义类别与 benchmark 显著变化(动机实验)
消融分类树路由 vs 单一最优技能:类别条件化有独立贡献
迁移成本目标域零标注(只用问题文本)

为什么这套设计能证明论点:先有"异质性"的实证证据(策略×类别交互显著),路由的必要性才有依据——不是为路由而路由;跨两个基线模型的一致增益排除了模型特定拟合;零标注设计经"只用问题+选项文本"的实现约束直接落实。

六、效果优势的根源解释

为何类别路由优于单一策略?

因果链:帧的证据价值取决于问题类型(领域事实:数数需覆盖、因果需转折、细节需线索)(机制前提)→ 单一策略在异质类别分布上必然顾此失彼(机制变化:错配损失)→ 平均准确率被短板类别拖低(指标);类别路由把策略分配细化到分区(方法差异)→ 每类用其最优技能(机制变化:错配消除)→ 平均提升。增益幅度不大(1-2.4pp)的原因(阅读者分析):分类树归纳自无标注文本,类别边界有噪声;部分类别最优技能相同(路由退化)——与"跨 benchmark 类别迁移不完全"的预期一致。

外部交叉验证:本系列前轮精读的 AutoSkill 同名框架与其他技能路由工作(SkillRouter)证明"路由层"在大规模技能空间的价值;混合专家(MoE)的"输入条件化专家选择"是同一原则在模型层的体现;测试时策略选择(TTT 系)支持"策略应是输入的函数"。本次检索范围内未发现"类别路由在长视频 QA 无效"的反例;相近领域(模型路由 RouterDC)显示增益幅度同样温和(1-3pp 级),量级一致。

七、必要知识反推

  • 领域知识层:长视频 QA 的帧预算约束与证据获取本质;各类帧选择策略的机制与适用面。
  • 方法论知识层:LLM agent 的 propose-implement-evaluate-refine 循环;无监督语义聚类/分类树归纳;跨域类别对齐假设。
  • 工程知识层:可执行技能的沙箱运行;源池/目标域的评估隔离(防标签泄漏)。
  • 融合关键节点:“策略有效性异质性”(实证发现)与"分类树归纳只需问题文本"(标注工程洞察)的对接——前者创造需求、后者使方案可行。

八、通用性灵感

  1. 先证伪"最优单一策略",再谈路由。论文证据:策略×类别交互实验先于方法设计。推广:任何系统配置(缓存策略、调度算法、检索器)都应先做"配置×负载类型"交互分析。
  2. 源域学技能、目标域只做无监督对齐。论文证据:分类树只用问题文本。推广:跨领域推荐(源域学用户模式+目标域无标注对齐)、跨设备模型部署。
  3. 把连续配置空间离散化为可路由技能。论文证据:帧选择策略→有限技能集。推广:超参组合→离散 profile、提示词模板→可路由模板库。
  4. 温和增益×零标注成本也是好交易。论文证据:1-2.4pp 但无目标域标注。推广:迁移场景中"无标注小增益"常优于"全标注大增益"(成本归一后)。