论文链接:SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 项目页:https://SemComp-Bench.github.io 发表时间:2026年8月19日 机构:中国科学技术大学 + FrameX.AI + 中山大学(通讯作者 Mengqi Huang,huangmq@ustc.edu.cn) 领域标签:cs.CV / 视频生成 / Benchmark / 语义接地 / 世界模型


一、论文背景

1.1 视频生成模型的"虚假繁荣"

近两年的视频生成模型(Sora、Veo、Seedance、Kling、Wan2.2、HunyuanVideo)在视觉保真度和时序连贯性上已经达到了惊人水平:单帧画面接近照片级真实,镜头运动流畅自然,主体外观基本稳定。在VBench这类综合评测套件上,头部模型的分数一年之内被反复刷高。

但如果换一个问法——“让模型完成一件具体的事”,局面立刻不同。给模型一张钞票的图片,指令是"把这张钞票折成一只乌龟"。用户期待的是什么?是视频结尾出现一只由这张钞票折出来的乌龟形折纸。而当前模型常见的输出有两种失败形态:一种是老老实实播放了一段折纸过程,但最终成品既不像乌龟也不是那张钞票;另一种更隐蔽——视频里确实出现了一只逼真的乌龟,但那只乌龟和输入的钞票毫无关系,它只是模型对"乌龟"这个词的任意想象。

这就是本文抓住的核心缺口:“会生成"不等于"能完成任务”。

1.2 缺口为什么一直没被测量

用一个类比来理解:这就像考驾照。现有的视频评测大多在考察"你会不会打方向盘、会不会踩油门"——画面清不清晰、动不动作连贯、主体和文本对不对齐。但真正的路考只问一件事:你能不能按要求把车停进这个车位。方向盘打得再标准,车没停进车位,就是不及格。

现有基准没有测这件事,有两个技术原因。第一,评测需要"正确的终点状态"作为参照。要判断"任务完成没有",必须知道完成之后长什么样,而构造"参考图像 + 正确结果视频"的对儿非常昂贵——你不能雇人去把每张钞票都折一遍乌龟。第二,“完成"的定义包含双重约束:结果既要达成指令描述的目标状态,又不能背叛参考图像的来源语义。单一维度的打分体系(清晰度、连贯性)无法表达这种合取式的要求。

1.3 语义接地:结果必须"还是那张钞票”

论文把第二个约束称为语义接地(semantic grounding):生成的结果在任务相关的高层语义上必须与参考图像对应——保留了任务相关的实体与属性关系,同时允许无关属性自由变化。

回到钞票折乌龟的例子。“那张钞票"的图案、颜色、纸质感知是任务相关的,折出来的乌龟必须能看出"这是用钞票折的”;但钞票的摆放角度、背景桌面、光线,这些是任务无关的,允许任意变化。语义接地不等于像素级外观一致——折成乌龟后,钞票的几何形状当然彻底变了,但它的"钞票性"不能丢。如果视频最后出现的是一只毛绒乌龟玩具,无论多逼真,都是语义脱靶。

这个任务定义还有一个关键的减负设计:不要求展示中间步骤。视频不需要演示完整的折叠过程,只要最终状态达成即可。这使任务聚焦在"结果"上,避免了对过程正确性的无穷争论——就像驾照路考不考你的倒库手法标不标准,只考最后车在不在车位里。


二、论文定位和关联工作

2.1 视频生成基准的谱系

把现有视频生成基准按"测什么"排开,可以看到一条清晰的能力维度谱系:

基准会议/时间测评维度核心关切
VBench / VBench++CVPR 2024 Highlight / TPAMI 2025视觉保真、时序连贯、文本对齐等16+维生成质量的整体画像
EvalCrafterCVPR 2024客观指标+人工评测结合大模型视频评测方法论
VBench-2.02025intrinsic faithfulness从"看起来好"到"内在可信"
TC-Bench2024时序组合性指令中多个属性的时间排列是否被遵守
VideoPhy-22025物理常识动作中心场景的物理合理性
WorldModelBenchNeurIPS 2026世界模型视角把生成模型当世界模拟器审判
VMBenchICCV 2025感知对齐的运动质量运动是否让人感觉"对"
OpenS2V-Nexus2025主体一致性主体到视频生成中的身份保持

这些基准各自覆盖了生成质量、身份、运动、物理合理性,但它们的共同盲区是:没有直接测试"指令 × 参考联合定义的结果是否达成"。TC-Bench测时序组合,但组合的参照物只是文本;OpenS2V-Nexus测主体一致,但一致的对象是外观而非"任务结果";VideoPhy-2测物理,但物理正确不等于任务完成。SemComp-Bench填补的正是这个交集:结果达成 × 语义接地的联合评测。

2.2 数据管线侧的关联工作

基准论文的另一半生命线是数据从哪来。本文站在两个已有数据基础设施的肩膀上:

  • Koala-36M(CVPR 2025):大规模细粒度条件一致视频数据集,提供覆盖真实世界场景的海量全上下文视频源池,其细粒度条件一致性保证了视频内容与元信息(如标题)的可靠对应。
  • Panda-70M(CVPR 2024):为7000万视频提供了多教师协同的镜头检测与字幕管线,本文复用其镜头检测+同场景合并程序来做结果中心片段的扩展。
数据工具在本文中的角色
Koala-36M约20K视频的源池,提供全上下文真实任务视频
Panda-70M镜头分割与同场景合并算法,服务于结果片段提取
Doubao-Seed-1.8(火山引擎API)管线各阶段与最终评测的VLM执行者

2.3 三方机构分工:高校方法学 × 企业评测基建

这篇论文的机构组合值得注意:中国科学技术大学出任务定义与管线方法学,FrameX.AI出VLM评测工程与API基建,中山大学参与协作。这种"高校+企业AI实验室"的组合在基准类工作里几乎是标配——基准的生命在于大规模自动化评测的执行力,而这恰恰是企业侧API资源与工程能力的强项。通讯作者Mengqi Huang挂职USTC与FrameX.AI双方,是这种产学研耦合的枢纽。


三、问题定义

3.1 从具体任务到抽象本质

先看任务的具体形态:给定一张参考图像(如一张钞票的照片)和一条指令(“把钞票折成乌龟”),模型生成一段视频,成功条件是视频呈现出指令要求的结果状态,且该结果在语义上接地于参考图像。

抽象一层,这个任务的本质是:生成结果与"指令-参考对"所定义的目标状态之间的双向匹配——

  • 正向:达成目标(结果实现了指令描述的状态,乌龟出现了);
  • 反向:不背叛来源(结果的语义来源可追溯到参考,它还是那张钞票)。

只满足正向不满足反向,是"语义脱靶"(换了一只无关乌龟);只满足反向不满足正向,是"原地踏步"(钞票还在,但没折)。两个方向同时成立才算完成,这就是"双向匹配"。

3.2 形式化定义

一个数据实例是三元组:

$$x_i = (r_i,\ I_i,\ o_i)$$

其中 $r_i$ 是参考帧,$I_i = (i_i^{brief},\ i_i^{detailed})$ 是同一目标的两个指令变体(简/详双指令),$o_i$ 是结果中心视频片段。关键约束:$r_i$ 与 $o_i$ 来自同一条全上下文视频——这保证了任务真实可行且视觉上可验证。

评测侧,每个生成视频在四个准则上做二元判定:

$$A_i = a_i^{or} \cdot a_i^{sg} \cdot a_i^{gec} \cdot a_i^{gvc} \in \{0,1\}$$

四个准则分别是结果实现(outcome realization)、语义接地(semantic grounding)、接地实体一致性(grounded entity consistency)、全局视觉连续性(global visual continuity)。OA Score是样本级指标 $A_i$ 的数据集均值。

3.3 为什么是"联合通过率"而不是平均分

这是整个评测设计里最值得咀嚼的决定:OA用四个准则的乘积(合取),GR用五个准则的均值(平均)。为什么不同?

因为**“任务完成"在语义上就是合取而非折衷**。一段视频如果结果实现了但实体中途被偷换(比如钞票折到一半变成了另一张颜色不同的钞票),你不能说它"完成了75%"——对用户来说它就是失败的,折纸乌龟用错钞票和根本没折出乌龟,是同样不可用的结果。成功是AND,不是AVERAGE。

反过来,GR(生成可靠性)测的是物理合理性、清晰度、渲染伪影、场景内时空连贯、文字界面完整性这五个相对独立的"质量卫生项”——它们之间可以互补(一处模糊不代表整体不可用),所以用平均分刻画整体可靠性水平。指标形态服从被测对象的逻辑结构,而不是一刀切地套用平均分,这是本文评测设计的方法论亮点。


四、问题解法

解法分两半:数据怎么造(四阶段管线)和怎么评(OA/GR双维协议)。

4.1 四阶段数据管线总览

从Koala-36M随机抽取约20K视频,经四个阶段产出1273个结构化实例:

阶段输入核心操作输出
① Candidate Filtering 候选过滤约20K原始视频标题关键词过滤 + 视频摘要分域视觉自包含的视频 + 六域归属
② State Mining 状态挖掘过滤后视频 + 类别状态定义时间戳级状态定位 + QA质检验证过的参考/结果帧对及时间戳
③ Video Extension 视频扩展全上下文视频 + 结果时间戳镜头检测、以时间戳为锚扩展片段结果中心视频片段(平均4.03s)
④ Instruction Structuring 指令结构化参考帧 + 结果片段规范化关系描述 + 对齐类型选择 + 双指令合成brief/detailed指令对

下面逐一拆解每个阶段的设计智慧。

4.2 阶段一:候选过滤——先把"看不见结果"的视频踢出去

类比:这一步像图书馆进书前的初筛——先把纯靠嘴讲的"评书"剔除,只留"有画面的书"。

机制:SemComp-Data依赖视觉可观察的结果,所以第一步用标题关键词过滤排除叙述依赖型视频:标题含talk show、interview、news等45个关键词串(分news/movie/entertainment三组,大小写敏感子串匹配)的视频直接出局。理由很直接——一段访谈视频里"任务是否完成"根本无法仅凭画面判定,这类样本对视觉接地评测是毒药。

然后对保留视频做均匀采样帧拼成马赛克摘要,交给VLM分类到六个域:Arts and Precision、Beauty and Fashion、Crafts and DIY、Food and Cooking、Gardening and Pets、Sports and Fitness。视觉证据不足的分类为Uncertain并丢弃。对每个任务类别,人工定义其参考态与结果态(如"Dish Making:参考态=食材或未完成的备菜可见,结果态=可辨认的完成菜品可见"),这些定义成为阶段二的定位依据。

输出:视觉自包含的视频 + 域/类别归属 + 人工状态定义。

4.3 阶段二:状态挖掘——时间戳定位为什么优于直接片段定位

机制:这是管线里最有技术判断力的设计。给VLM全上下文视频和状态定义,让它先识别演示的任务与预期结果,再定位最匹配两个状态定义的时间戳,抽取参考帧与结果帧。

为什么定位"时间戳"而不是直接让VLM找出"结果片段"?因为片段定位要求VLM同时建模中间过程并裁决模糊的片段边界——结果从哪一秒算"完成"?折叠最后一下的手收回去之前还是之后?这些边界判断极易出错。而时间戳定位只需VLM找到状态的代表性视觉证据:“这一帧里完成的帽子清晰可见”——任务简单得多,准确率自然更高。

QA质检的保守丢弃逻辑:抽出的帧对要过一道一致性检验——给VLM两张不带标签的帧加上任务描述,问它"哪张是结果帧"。如果VLM答对了,说明这对帧的参考-结果关系清晰可辨,保留;如果答错了,保守丢弃。注意这里的逻辑:答错可能意味着三种情况——参考-结果关系本身模糊、视觉证据不足、或VLM犯错。无法区分是哪种,那就宁可错杀不可放过。在数据构造里,一个污染样本的代价远大于一个好样本的损失,这是自动化数据管线的通用守则。

4.4 阶段三:视频扩展——用确定性算法锚定不确定的语义

类比:知道了"终点在哪一秒",然后往前向后把这一秒所在的、镜头没切换的整段都圈进来——像考古发掘,确定了遗址坐标,把整个探方都挖出来。

机制:沿用Panda-70M的镜头检测与同场景合并程序,把全上下文视频切成视点一致的片段。以阶段二验证过的结果时间戳为时间锚,选取包含结果帧的核心片段,并向视觉一致的相邻片段合并,直到达到最少3秒。补充材料给出了细节:落在3-4秒名义目标范围内的事件完整保留;过长事件从中抽4秒结果中心窗口,过短事件抽3秒窗口,必要时做边界感知的时移。

为什么时间戳锚定优于VLM直接定位区间:论文明说——timestamp-anchored策略更有效地把片段中心对准完成结果,同时效率更高、成本更低。镜头检测是成熟的确定性算法(边界由视觉相似度聚类决定),VLM区间定位则又贵又飘。这背后是管线设计的通用哲学:能用确定性工具解决的环节就不要交给生成式模型。

最终片段平均4.03秒(中位数4.067s,最短3.020s,最长4.125s)——足够提供结果完成的充分时间证据,又尽量裁掉中间过程与无关内容。

4.5 阶段四:指令结构化——四类对齐的深意

这一阶段从参考帧+结果片段合成两级指令。

brief指令:预实验发现直接让VLM描述会产生冗长指令、夹带品牌名与屏幕文字等偶然细节。所以用规范化关系描述约束VLM:按 [动词] + [参考中的主体] + [介词] + [结果中的状态] 模板生成不超过30词的简指令——“Crochet yarn into a summer hat"这种。

Attribute Selection与四类对齐:并行地,VLM先从四个对齐类型中选出适用的一类,再据此决定参考图像的哪些属性该保留、哪些可丢弃:

对齐类型操作性定义典型保留属性
Object Element结果接地于任务相关的物体类别/组件/食材/材料/数量/颜色,不要求特定实例的外观物体类别、构成、数量、材料、色板
Person Identity参考与结果中的人必须可辨识为同一人人物身份、面部、体型、姿态
Object Appearance结果接地于特定参考物体的实例级视觉外观类别、色板、材料、形状结构、表面外观、图形细节
Scene结果接地于参考场景的组织与语境场景类型、布局、空间关系、背景语境、视点

完整的保留属性词表共17项。四分类的意义在于把"什么算语义接地"从连续模糊的问题变成离散可裁定的选择:化妆任务接地的是人的身份(脸可以变、人不能换),蓝图施工任务接地的是场景结构(图纸的布局必须体现在成品里),折钞票任务接地的是物体外观(钞票的图案质地必须延续到乌龟上)。每类任务"接地"的含义不同,一刀切的定义必然失真。

detailed指令:由brief指令扩展而来,合成两部分——选定的对齐类型+保留/丢弃属性(参考接地约束),以及对完成结果的细粒度视觉刻画(背景、光照、颜色、形状、组件细节)。论文里绳结案例的detailed指令是典型:“一双手用两根绳子——一根带白红斑点的蓝色、一根纯橙色——打双称人结……背景是素净的中性灰桌面……绳子的类别、数量、色板与材料应与参考图保持一致,其初始的盘绕状态与空间排布可随需要改变以成型绳结。“注意最后一句:明确划定了"保留什么/允许变什么"的边界。

双指令的实验价值:同一参考、同一结果目标,只有指令详简度不同——这构成了控制变量意义上干净的指令特异性实验,且brief指令更贴近真实用户的提示习惯,构成更难的评测设定。

4.6 评测协议:OA/GR双维设计的互补性

SemComp-Bench用VLM回答结构化二元问题(每题必须引用帧级视觉证据),27帧均匀采样按时序排列送评,每视频3次独立VLM调用取均值(标准差在补充材料报告,OA Score的σ在0.96-4.41pp之间,说明评测基本稳定)。

两个维度的分工:

OA(结果达成)GR(生成可靠性)
测什么任务完成:结果实现+语义接地+实体一致+全局连续质量卫生:物理合理+清晰+无伪影+场景内连贯+文字界面完好
聚合方式四准则合取(AND)五准则均值(AVERAGE)
角色任务能力评测有效性保障

GR是有效性保障而非任务评测——它独立于任务完成与语义接地单独评估(GR的五个问题全是failure-oriented,“No"即通过)。没有GR,一段糊成马赛克的视频可能因为VLM"看不出结果没实现"而蒙混过关OA;有了GR,你能诊断出失败是"能力不行"还是"渲染崩了”。


五、评估指标与实验证据

5.1 主实验设置

  • 数据:SemComp-Data共1273实例;评测用SemComp-Core子集60实例(六域分层抽样各10个,近似保持域内对齐类型分布),每实例含双指令。
  • 模型:7个代表模型——Seedance 2.0(闭源)、Wan2.2-TI2V-5B、Wan2.2-I2V-A14B、CogVideoX1.5-5B-I2V、SkyReels-V2-I2V-14B-720P、HunyuanVideo-1.5-720P-I2V(论文缩写HY)、Phantom-1.3B。
  • 条件:表1/2均为I2V+参考图+detailed指令(Wan2.2-TI2V-5B以图像条件模式运行);每实例生成一条720p视频;有显式种子控制的用固定种子。
  • VLM评测器:Doubao-Seed-1.8(火山引擎API),预实验表明其在评测效率与成本间权衡最优。

5.2 OA主表:最高37.8%,无一模型过四成

模型AorAsgAgecAgvcOA Score
Seedance 2.00.8390.7440.4440.59420.0%
Wan2.2-TI2V-5B0.5890.4000.6890.92223.3%
Wan2.2-I2V-A14B0.8000.5280.6280.78928.3%
CogVideoX1.5-5B-I2V0.5500.3890.5060.74414.4%
SkyReels-V2-I2V-14B-720P0.7330.4890.5220.77222.8%
HY-1.5-720P-I2V0.8780.7060.5830.79437.8%
Phantom-1.3B0.5390.3560.3220.5113.9%

三个层次的读法:

第一层:天花板极低。 最强的HY也只有37.8%——三分之二的实例上,至少有一个准则挂掉。当前最好的视频生成模型,十次任务完不成六次。

第二层:失败模式互补,暴露能力短板各异。 Seedance 2.0的结果实现(0.839)与语义接地(0.744)都很强——它"知道要干什么”,但接地实体一致性(0.444)和全局连续性(0.594)拖了后腿——它管不住执行过程中实体不漂移、画面不跳变。Wan2.2-TI2V-5B恰好相反:实体一致(0.689)与全局连续(0.922)全场最佳——视频很"稳”,但结果实现(0.589)和语义接地(0.400)偏弱——稳稳地没把任务做对。合取式指标的价值正在于此:它逼着你看到每个模型的短板在哪一环,而平均分会把这些短板糊平。

第三层:HY为何第一。 不是因为某一项碾压,而是四项相对均衡(0.878/0.706/0.583/0.794)。论文的原话是"consistent with relatively balanced pass rates across the four OA criteria, rather than dominance in any single criterion”——合取指标奖励的是没有短板,而非单点极强。

5.3 GR主表:可靠性高分下的共同软肋

模型GppGvcGafrGwscGtiGR Score
Seedance 2.00.8830.9940.9940.7390.97891.8%
Wan2.2-TI2V-5B0.7940.9780.8890.7220.88985.4%
Wan2.2-I2V-A14B0.9110.9720.9670.6720.92889.0%
CogVideoX1.5-5B-I2V0.9440.8110.7720.5830.82878.8%
SkyReels-V2-I2V-14B-720P0.7780.9220.7390.3280.78971.1%
HY-1.5-720P-I2V0.8000.9390.8830.4720.86179.1%
Phantom-1.3B0.7780.9720.8560.5060.72876.8%

关键发现:场景内时空连贯性是全模型的瓶颈,通过率仅0.328-0.739。其余四项大多在0.8以上,唯独Gwsc(场景内的闪烁、瞬态重影、局部几何形变等低级渲染不稳定)全线塌方——连GR冠军Seedance也只有0.739,SkyReels更是低到0.328。论文的解读精准:当前模型能生成视觉上可信的单帧,但难以维持场景内稳定的视觉演化。这呼应了OA维度的观察——生成模型擅长"每一帧都对",不擅长"帧与帧之间的关系也对"。

5.4 条件实验:I2V、T2V与brief/detailed三因素

Table 3对比了三个模型家族(同参数规模的checkpoint)在 I2V+detailed / T2V+detailed / T2V+brief 三种设定下的表现:

模型设定AorAsgAgecAgvcOA
Wan2.2-A14BI2V+Detailed0.8000.5280.6280.78928.3%
Wan2.2-A14BT2V+Detailed0.8890.5220.3170.1174.4%
Wan2.2-A14BT2V+Brief0.3890.1110.8060.1610.6%
CogVideoX1.5-5BI2V+Detailed0.5500.3890.5060.74414.4%
CogVideoX1.5-5BT2V+Detailed0.5670.3610.3610.1615.0%
CogVideoX1.5-5BT2V+Brief0.5670.1500.6780.1330.6%
HY-1.5-720PI2V+Detailed0.8780.7060.5830.79437.8%
HY-1.5-720PT2V+Detailed0.8330.6060.3890.1334.4%
HY-1.5-720PT2V+Brief0.5500.1000.7610.1781.7%

发现一:I2V全面碾压T2V。 三个家族无一例外:HY 37.8%→4.4%,Wan 28.3%→4.4%,Cog 14.4%→5.0%。OA跌幅达8倍量级。且增益来源清晰:语义接地、接地实体一致性、全局视觉连续性三项大幅受益于参考图像条件,而结果实现率大体相当(三个家族中还有两个家族T2V的Aor反而更高:Wan 0.889>0.800、Cog 0.567>0.550)。这个分解很有说服力——参考图像提供的不是"结果长什么样"的信息(那个文本里也有),而是"实体是谁"的锚点。

发现二:T2V下brief指令暴跌。 HY从4.4%跌到1.7%,Wan和Cog双双跌到0.6%。有意思的反转是:brief下Aor/Asg大跌,但Agec反而升高(Wan 0.317→0.806,HY 0.389→0.761)——指令越简单,视频越容易生成得连贯,但越不知道该实现什么。论文提炼为指令特异性与生成难度的权衡:detailed更好地定义了组合式结果但要求更强的语义理解与协调生成能力;brief更贴近用户习惯但把"结果定义"的责任全推给了模型。

发现三:GR与OA排名错位。 Seedance GR第一(91.8%)但OA只有20.0%;HY OA第一(37.8%)但GR只排中游(79.1%);Wan2.2-A14B两项都是第二,是最均衡的。可靠性与任务能力是两个近乎正交的轴——这直接证伪了"视频质量好=任务能力强"的直觉等式,也为模型选型提供了双坐标系的依据(要稳选Seedance,要完成任务选HY,要均衡选Wan2.2-A14B)。

5.5 定性观察与评测稳定性

可视化分析(论文Fig.5)补充了定量结论:模型普遍倾向于保持参考图像的外观并展示任务执行过程,却经常无法达成预期结果;失败案例中常见的物理不合理变换与突兀视觉跳变(Wan2.2-A14B与Phantom-1.3B的案例)对应GR维度的问题。

评测稳定性设计值得单独一提:27帧固定均匀采样保证了送评输入的长度归一与时序结构固定;3次不同时间的独立VLM调用取均值压制了VLM判定的随机波动——补充材料报告的σ(OA Score在0.96-4.41pp,GR Score在1.35-7.20pp)表明这套协议的方差可控。对一个VLM-as-judge基准来说,把评测器自身的噪声量化并公之于众,是可信度的必要条件。


六、效果优势的根源解释

本文是基准论文,没有"本文方法比baseline提升X%“式的优势论证。它的解释力体现在对实验现象给出机制层面的根源——为什么现状是这样。四个现象,四个根源。

6.1 为什么最强模型OA也不到38%:优化目标与任务要求错位

生成模型的训练目标是帧级保真与文本对齐,而任务完成需要长程状态转移与实体持久性的组合约束——两者存在结构性错位。

扩散式视频生成在训练中被优化的是:每一帧去噪后视觉可信、整体与提示词语义匹配。而"把钞票折成乌龟"要求模型在数秒的时间跨度上维持一个实体的持久存在(同一张钞票,材质图案不能换)同时完成一个状态转移(平面→乌龟形)。这是两个耦合的长程约束:实体持久性要求跨帧的身份保持,状态转移要求跨帧的几何演化合理。帧级优化目标里没有任何一项直接奖励"长程状态转移成功且实体全程不漂移”。所以模型可以画出漂亮的折纸过程(帧级保真没问题),却在中间某一步悄悄换了钞票的颜色(实体持久性断裂),或者折到最后乌龟不成型(状态转移未完成)。Gwsc全线低分(0.328-0.739)是同一错位在可靠性维度的投影:帧间关系的维持从来不是训练目标的一等公民。

6.2 为什么I2V碾压T2V:参考图像是实体锚点

Table 3的分解给出了近乎决定性的证据:I2V的增益集中在Asg/Agec/Agvc(语义接地、实体一致、全局连续),而Aor基本持平甚至T2V略高。

机制解释:参考图像为生成过程提供了实体级的锚点。T2V下,“那张钞票"只是文本里的三个字,模型必须从先验中凭空想象一个实体并全程保持它——Agec崩到0.317/0.361/0.389,Agvc崩到0.117/0.133/0.161,说明没有视觉锚点时实体漂移和画面跳变几乎不可避免。I2V下,实体外观在每一帧去噪时都被参考图拉住,三个准则直接受益。而Aor不受影响则说明:“结果是什么"这件事文本指令已经说清楚了,参考图的增量价值不在结果定义而在实体锚定。这也解释了为什么语义任务完成这个任务的正确评测姿势必须包含参考图——纯T2V设定下,任务的"不背叛来源"这半边根本无从谈起。

6.3 为什么brief指令下OA暴跌:结果定义的责任转移

detailed指令里 enumerates 了结果实体的属性(两根绳子、一根蓝底白红斑、一根纯橙、背景中性灰桌面……),等于把目标状态的规格书写好了。brief指令(“Crochet yarn into a summer hat”)只给了目标的骨架,“完成态到底长什么样"的规格填充责任转移给了模型自己的常识推理。

模型的常识推理撑不起这个责任:毛线是什么颜色?帽子什么款式?什么算"完成”?——模型自由发挥的结果就是Aor和Asg双崩(HY brief的Asg只有0.100,Cog只有0.150)。而Agec反升的现象(内容更简单→更容易生成连贯)说明崩的不是生成能力而是任务理解与目标具体化能力。这对用户实践有直接含义:在模型具备自主任务具体化能力之前,把指令写全写细不是可选项而是必需品。

6.4 为什么GR与OA错位:可靠性与任务能力是正交轴

Seedance GR第一/OA中游,HY OA第一/GR中游——这个错位不是评测bug,而是本质现象:可靠性(渲染质量、物理合理、画面稳定)与任务能力(达成结果+接地)测量的是模型的两套不同子系统。

类比:一个厨子刀工火候无可挑剔(可靠性高),但听不懂"少辣”(任务能力低);另一个厨子完全按你的要求调味(任务能力高),但摆盘毛糙、偶尔糊锅(可靠性中游)。前者的可靠性与他理不理解你的需求无关。放在模型上:帧级去噪的质量管线决定GR,长程语义规划与约束满足决定OA——两条能力线在架构与训练中大体独立地演化,所以排名自然解耦。这对社区的方法论提醒是:任何单一维度的排行榜都在误导选型,任务导向的应用必须看任务维度的评测。


七、必要知识反推

如果要在这篇论文的基础上做研究或工程,需要提前掌握哪些知识?按层次反推如下。

7.1 领域层

  • 视频生成模型生态:闭源(Sora、Veo、Seedance、Kling、Hailuo、Pika)与开源(Wan2.2、CogVideoX、HunyuanVideo、SkyReels、Phantom、Pyramid Flow、LTX)的双轨格局,各家的I2V/T2V能力形态——本文评测的7个模型横跨双轨,不了解生态就无法理解选样的代表性。
  • 评测维度学:视觉保真/时序连贯/主体一致/物理合理性/时序组合性……每个维度对应哪个基准(VBench系、TC-Bench、VideoPhy-2、WorldModelBench、VMBench、OpenS2V-Nexus),维度之间正交还是相关——这是定位任何新基准的坐标系。
  • 世界模型视角:把视频生成模型视为世界模拟器的思潮(Sora世界模拟器宣言、WorldModelBench、WorldOlympiad、RISE-Video)——语义任务完成本质上是世界模型能力的微观测试:模型必须"知道"钞票折起来会变成什么样。

7.2 方法论层

  • 状态定位思想:把"找结果片段"转化为"找状态代表性时间戳”,再由确定性算法扩展区间——语义定位交给VLM、边界裁决交给算法的分工模式,可迁移到任何"从长视频中挖结构化片段"的场景。
  • VLM-as-judge的结构化二元判定vs连续打分:二元判定+证据引用比1-10打分更稳定、更可解释、更抗评分膨胀;failure-oriented问题(“是否存在X问题”,No=通过)的设计能进一步降低VLM的确认偏差。
  • 合取式指标设计:什么时候用AND什么时候用AVERAGE——被测语义是"全都要成立才算成功"时用合取,是"整体水平"时用均值。以及合取指标的读法:它奖励无短板而非单点极强。
  • 保守质检逻辑:QA不一致即丢弃,接受召回率损失换取精度保证。
  • 控制变量式基准设计:同源双指令(brief/detailed)、同规模checkpoint跨模态(I2V/T2V)——让"指令特异性"“条件模态"这些因素可以被干净地分离研究。

7.3 工程层

  • 数据工具链:Koala-36M(源池+细粒度条件一致性)、Panda-70M(镜头检测+同场景合并)的开源可用性——造视频基准不必从零标起。
  • API成本权衡:VLM评测器的选择是效率×成本×判别力的三角权衡,Doubao-Seed-1.8经预实验胜出;20K视频×多阶段VLM调用的账单规模决定了"能用确定性算法的环节绝不烧VLM”。
  • 评测噪声管理:27帧固定采样+3次独立调用+标准差报告,这套组合拳是VLM评测可信度的工程底线。

7.4 融合节点

以上知识在论文中汇聚成一个核心方法论资产:同源参考-结果对保证任务可验证性——参考帧与结果片段抽取自同一条真实视频,天然证明"该任务对该参考可行且结果视觉可验证",同时免费获得细粒度的属性对齐标注。这是整篇论文数据构造的支点,也是最容易迁移到其他领域的设计。


八、通用性灵感

灵感一:结果导向评测——只看终点,不看过程展示

本文最激进的设计是明确宣布不要求中间步骤、不要求过程正确、甚至不要求外观一致,只裁决终点状态。这大幅降低了任务的定义争议与评测的裁决难度。

推广:GUI agent评测——与其逐步检查点击序列,不如只检查最终界面状态是否达成目标(订单是否下单成功);教育测评——项目制学习只验收作品终态而非解题过程;RPA流程自动化——只验证下游系统状态。凡是过程多样、结果可验的场景,结果导向评测都比过程导向更鲁棒、更公平。前提是本文的另一半设计必须跟上:结果状态要有客观参照(同源结果对),否则"达成"无从裁定。

灵感二:合取式通过率vs平均分——成功是AND,不是AVERAGE

四准则合取的OA设计逼出了平均分永远无法揭示的洞察:Seedance的"强理解弱执行"与Wan的"稳而不准",在平均分下可能同分,在合取下暴露出完全不同的短板。

推广:任何多准则验收体系都该问一句"这些准则的逻辑关系是AND还是OR还是可互补?"——代码评审(正确性AND安全性AND可读性,前三者是合取);产品验收(核心功能合取,体验项可均值);医疗诊断辅助(敏感性要求合取多体征);甚至个人OKR复盘(目标达成是合取,过程指标是均值)。用错聚合方式,评测就会系统性地奖励偏科者。

灵感三:同源数据构造保证可验证性——参考与结果来自同一视频

造"任务成功样本"最贵的部分是"正确答案"。本文的答案:从真实过程视频里同时截取起点(参考帧)与终点(结果片段),二者天然构成 verified pair——答案不是造出来的,是从真实世界里切出来的。

推广:这是数据合成的通用方法论——代码重构评测可以从真实commit里切出"重构前/重构后"的函数对;翻译评测从真实多语言文档对齐切句;UI改版评测从产品迭代历史里切"旧版/新版"截图。任何"输入-目标输出"配对需求,都先找人类活动自然留下的过程记录,再设计管线去切——比雇佣标注或纯合成便宜一个数量级,且真实性免费。

灵感四:双向匹配的问题定义——达成目标∧不背叛来源

“结果达成指令 ∧ 结果接地于参考"这个双向匹配结构,本质上是给生成任务加了来源约束:你不仅要做对,还要"用给定的东西"做对。

推广:代码重构评测——“功能等价 ∧ 不引入新依赖”(重构对了但偷偷换了底层库,等于换了一只无关的乌龟);翻译评测——“译文达意 ∧ 保留原文术语体系”;图片编辑评测——“编辑达成 ∧ 未编辑区域不变”;Agent工具调用评测——“任务完成 ∧ 只用授权工具”。单向评测(只看结果)会奖励"绕过来源约束走捷径"的行为,双向匹配堵死这条捷径——这是对齐评测的一种通用防作弊结构。

灵感五:可靠性轴与能力轴正交——双坐标系选型框架

GR-OA错位现象(Seedance GR冠军OA中游、HY OA冠军GR中游)证明"做得好"和"做得出"是两个独立维度。

推广:模型选型框架应从单排行榜升级为二维散点图——代码模型(可靠性=代码可运行率 × 能力=需求满足度)、Agent框架(可靠性=不崩溃 × 能力=任务完成)、甚至招聘评估(执行力×判断力)。当一个系统需要同时不出错和能成事时,两个维度必须分开测、分开优化——本文的Wan2.2-A14B(双第二的均衡型)提示我们,均衡选手在真实生产中往往比单项冠军更可用。

灵感六:指令特异性是一个被低估的自变量

brief/detailed双指令的设计揭示:指令详简度不是无关紧要的提示工程技巧,而是把结果定义责任在用户与模型之间重新分配的杠杆——detailed下模型表现好,说明能力在;brief下崩,说明"任务具体化"本身是项未解决的能力。

推广:任何自然语言接口系统的评测都该包含指令特异性梯度——搜索(短query vs 完整描述)、代码生成(一句话需求 vs 详细规格)、设计工具(“做个海报” vs 完整brief)。模型在指令谱系两端的表现差,刻画的是它的"自主理解力带宽”——这可能是比任何单项分数都更本质的能力指标。


结语

SemComp-Bench的价值不在榜单,而在它把一个所有人都隐约感觉到、却没人系统测量过的现象变成了可复现的数字:最好的视频生成模型,十次任务完不成六次;脱离参考图像,一百次只成四次;指令说少了,一百次只成两次。“会生成"与"能完成任务"之间隔着一条结构性的鸿沟,这条鸿沟的名字叫长程状态转移与实体持久性的联合约束。当视频生成朝着世界模拟器的叙事狂奔时,这样的基准是必要的减速带——它提醒我们:画面可信不等于世界可算,能演出过程不等于能抵达终点。