Source-linked AI summary

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

arXiv:2608.09873v1cs.CVcs.AI

TL;DR

科学视频生成需要评估机制与因果保真度,而不能只看视觉合理性;但现有基准缺乏多学科、专家依据充分的覆盖。Sci-VBench通过1,253项专家编写的任务和基于评分标准的评估加以弥补,发现感知质量差异较小,而科学推理表现显现出显著的 proprietary–open-source 差距。

  • 问题

    现有视频生成基准对视觉合理性之外的科学机制、因果关系和时间依赖性,仅提供有限的多学科、专家依据充分的评估。

  • 方法

    Sci-VBench将覆盖60个主题和四个学科的1,253项专家编写的任务,与参考指南、评分标准以及自动和人工评估协议相结合。

  • 结果

    在16个模型中,感知质量分数几乎持平,而Prompt Grounding和Scientific and Causal Correctness差异显著,并呈现出明显的 proprietary–open-source 差距。

  • 要点与局限

    仅凭视觉逼真度无法可靠表明科学有效性,这凸显了评估机制推理和时间上连贯的因果动态的必要性。

Abstract

from arXiv · show

We introduce Sci-VBench, a comprehensive benchmark for evaluating knowledge- and reasoning-intensive video generation across scientific domains. It contains 1,253 expert-annotated examples spanning 60 subjects across four core disciplines: Natural Science, Healthcare, Humanities & Social Sciences, and Engineering. Each example requires models to generate temporally rich videos that demand scientific reasoning and knowledge-grounded synthesis, going beyond surface-level visual plausibility. We further establish a rubric-based evaluation protocol. Our analysis shows that, under this protocol, both non-expert human evaluators and MLLM-as-Judge systems can achieve relatively high agreement with expert judgments, supporting reproducible evaluation at scale. We benchmark 16 frontier proprietary and open-source models and find that, while automatic perceptual-quality scores cluster tightly across systems, performance on Prompt Grounding and Scientific and Causal Correctness varies substantially, with a pronounced proprietary-open-source gap. These findings show that advances in visual realism have not yet translated into reliable modeling of scientific and causal dynamics.

1 引言

Sci-VBench 通过专家标注基准和可扩展的基于评分标准的评测协议,弥补科学视频生成在知识与推理密集型评估方面的不足。对 16 个模型的评测显示,尽管感知质量分数几乎持平,模型在科学与因果维度上仍存在明显的 proprietary–open-source 差距。

  • 1 引言: 该基准面向知识与推理密集型、可通过视觉验证的视频生成,将评测从感知 plausibility 扩展到事件、约束和时间依赖关系的忠实呈现。科学场景具有重要影响,因为感知 plausibility 可能掩盖根本性错误。
  • 1 引言: 现有基准主要关注感知质量、提示对齐、组合性或一般物理常识,导致知识与推理密集型科学视频生成评测不足。知识与推理密集型评测主要针对视频理解开展,而非视频生成。
  • 1 引言: Sci-VBench 包含 1,253 个由专家编写并经独立审阅的任务,覆盖 Natural Science、Healthcare、Humanities & Social Sciences 和 Engineering 四大领域的 60 个主题。每项任务都将最简生成提示与专家编写的评测规范配对。
  • 1 引言: 基于评分标准的协议以专家评分作为参考标签,并结合 VBench Vision Tools 与受评分标准约束的 MLLM 评判,从感知、grounding、科学因果和时空维度开展评测。一项受控人工研究表明,评测规范能显著提升非专家与专家判断的一致性。
  • 1 引言: 对 16 个前沿模型的评测显示,明显的 proprietary–open-source 差距主要集中在 Prompt Grounding 和 Scientific and Causal Correctness 上,而自动感知质量 proxy 几乎持平。定性分析进一步发现,尽管输出在视觉上具有说服力,领先模型仍存在系统性的机制错误。

2 相关工作

视频生成研究已通过 diffusion–transformer 系统,从短时、低保真片段发展到高保真且时间连贯的输出,同时日益关注物理定律遵循与常识推理。现有基准主要评估感知、运动、构图、交互和提示词遵循能力,而非特定领域的科学机制。

  • 视频生成基准: Sci-VBench 将专家参与和可复用于各样本的评估指南或评分标准纳入比较维度,以区别于既有基准。Table 1 将“Expert”定义为领域专家参与,将“Eval Spec”定义为已发布的评估指南或评分标准。
  • 视频生成: 视频生成系统借助 diffusion models 和大规模 transformers,已从短时、低保真片段发展到高保真且时间连贯的输出。近期研究也日益关注对物理定律的遵循和常识推理。
  • 视频生成基准: 现有视频生成基准主要评估感知保真度和运动质量,部分基准还将评估扩展到构图能力、物体交互和更高层次的提示词遵循。这些基准并非旨在通过可由评分标准核验的科学评估,检验模型对特定领域机制的忠实度。

3 Sci-VBench 基准

Sci-VBench 包含覆盖四个学科、60 个主题的 1,253 个专家编写示例,旨在测试知识支撑的多步因果与时空推理能力。其基准构建结合专家标注与审查、参考指南以及 1–5 评分标准,使领域外专家也能开展机制层面的评估。

  • 基准设计目标: Sci-VBench 覆盖四个学科、60 个主题的 1,253 个示例,强调广泛的领域知识与专家级因果推理能力。每条提示词均由领域专家编写,针对需要扎实科学理解与多步推理的现象。
  • 评估维度: 该基准评估感知保真度、提示词 grounding、科学与因果正确性,以及时空一致性。后几项维度能够单独识别通用质量与提示词对齐标准无法捕捉的机制层面失败。
  • 基准构建: 专家选择具有教材依据、可通过视觉观察实现且受机制支配的概念,并编写简洁提示词,要求模型推断潜在机制。提示词规定初始设置以及干预或目标,但省略预期的机制演化过程与关键现象。
  • 评估规范: 每条提示词均配有高层级参考指南和详细的 1–5 评分标准,用于界定预期的因果转变、可观察证据、部分正确性与失败条件。这将评估所需的专家知识外显化,使非专家或 MLLM 评审也能依据该规范进行判断。
  • 质量控制与数据划分: 每个示例都要经过独立领域专家审查,以评估其清晰度、视觉可测试性,以及提示词、参考指南与评分标准之间的一致性。该基准还提供包含 150 个示例的 testmini 划分,用于快速且受成本约束的评估;开源模型使用两个划分,而 proprietary 系统仅使用 testmini。

4 Sci-VBench 评测协议

Sci-VBench 以专家 1–5 评分作为参考标签,并结合 VBench 指标与基于评分标准的 MLLM 评审,构建可扩展的自动化协议。可靠性分析将这些评测与非专家及 MLLM-as-Judge 评分进行比较,发现明确的评测规范和更大规模的评审模型能够提高与专家的一致性。

  • 人工评测: 专家标注者经过学科专属校准后,在全部四个评测维度上为每个生成视频打出 1–5 分,提供主要参考标签。每位标注者都会获得提示词、生成视频和逐例评测规范,并将可观察线索映射为评分标准中的分数。
  • 自动化评测: 自动化协议在保留逐例规范的同时扩展评测规模:VBench Vision Tools 报告低层次感知保真度,基于评分标准的评审器则对其余三个维度进行评分。MLLM-as-Judge 使用支持原生视频输入的 Qwen3.5-397B-A17B,评估 Prompt Grounding、Scientific and Causal Correctness 和 Spatiotemporal Consistency。
  • 可靠性分析: 可靠性以专家评分为基准进行测量,采用具有不同指导条件的非专家群体和获得评测规范的 MLLM 评审器。可靠性分析使用专家评分的视频,并比较人工与自动化评测者之间的一致性。
  • 可靠性分析: 通过有无逐例评测规范两种设置评估非专家与专家的一致性,以检验评分标准指导是否能够提高可靠性。无规范组只能看到提示词和视频,有规范组则会获得参考指南和评分标准。
  • 可靠性分析: Qwen3.5-397B-A17B 与专家评分的总体相关性最高,而一致性总体上会随 MLLM 评测器规模扩大而提高。比较包括 Qwen3.5-397B-A17B、Gemma-4-31B 和 Qwen3.5-9B;每个评测器都会在四个维度上与专家评分进行比较。

5 实验

实验使用原样提示词评测 Sci-VBench 上的 16 个专有和开源文生视频模型,发现区分系统的关键在于科学与因果推理,而非感知外观。专有模型在推理维度上领先,开源模型则可在时空一致性上达到或超过前者;观测到的失败涉及指令遵循、科学模拟以及时间或视觉质量。

  • 5.1 主要结果: 基准使用各模型的默认配置和原样提示词,评测 16 个前沿文生视频模型——其中 8 个为专有模型,8 个为开源模型。各模型的版本、分辨率、帧率和片段时长列于附录 A.3。
  • 5.1 主要结果: 各模型的自动感知质量几乎持平,VT 范围为 3.79 到 4.12;相比之下,对机制敏感的维度差异显著。结果表明,当前系统的差异更多体现在机制而非外观上。
  • 5.1 主要结果: Testmini 是完整基准的高保真低成本代理评测;开源模型的单模型完整基准平均分与 testmini 的差异至多为 0.07。Table 4 报告了全部 16 个模型的 testmini 结果,完整基准的逐维度结果见附录 C.1。
  • 5.1 主要结果: 专有模型在科学与因果推理上领先,而开源模型在 SCC 上明显落后,尽管其时空一致性可达到或超过专有系统。MiniMax-H3 以 SCC 得分 1.63 领跑开源组,仅为专有模型最佳成绩的一半;Wan2.2-5B 则以 2.79 取得最高自动 SC 得分。
  • 5.2 错误分析: 观测到的错误可归为指令遵循不佳、科学原理模拟不准确,以及时间连贯性和视觉质量不足。这些失败包括遗漏提示词细节、因优先追求美观而产生事实错误的动态,以及物体随时间发生不合逻辑的变化。
  • 5.3 提示消融: 显式提示消融实验重写 testmini 提示词,使场景和所请求的动态在视觉上更加具体,随后在设置不变的情况下,使用 Wan2.2-5B 和 HunyuanVideo-1.5 重新生成视频。Figure 4 报告了两个模型上一致的增益排序。

6 结论

Sci-VBench通过覆盖四个学科、60个主题的1,253条专家编写提示词,将文本到视频模型作为专家领域世界模拟器进行评估。该基准强调机制推理与时间连贯的因果动态,揭示了感知逼真度与科学有效性之间的差距。

  • 评估重点: Sci-VBench的成功取决于机制推理和时间连贯的因果动态,而非表层逼真度。
  • 关键发现: 对16个前沿专有和开源模型进行基准测试,揭示了感知逼真度与科学有效性之间持续存在的差距。

A Sci-VBench 数据集 · A.1 主题选择

Sci-VBench 使用覆盖60个主题和四大领域的1,253个专家标注样例,评估知识密集型和推理密集型科学视频生成。基于量规的分析发现,尽管感知质量得分较为集中,科学正确性和因果正确性仍存在显著差异。

  • A Sci-VBench 数据集: Sci-VBench 建立了基于量规的评估协议,用于评估生成的科学视频。
  • A Sci-VBench 数据集: 在该协议下,非专家人类评估者和 MLLM-as-Judge 系统与专家判断达成了相对较高的一致性。

A.2 数据质量控制 … B.1 低层次视频质量:定义与实现细节(改编自 VBench)

该基准审查评估者一致性,记录模型生成设置与标注者信息,并通过涵盖时间连贯性、运动、动态性、美学和成像保真度的维度评估低层次视频质量。

  • A.2 数据质量控制: 针对性审查抽取 200 个样例,由另一名研究相同主题的标注者在不查看第一份规格的情况下,独立构建每个样例的完整评估规格。这些规格包括高层次参考指南,以及针对所有维度的 1–5 分锚定式评分标准。
  • A.3 视频生成模型: Table 6 记录了所评估视频生成模型的详细设置。视频使用基准提示词的原文,并采用各模型的默认配置;支持的时长以最接近 15 秒为主,部分模型上限为 5–10 秒。
  • A.4 标注者信息: Tables 7 和 8 提供了标注者简介,而作者兼任标注者的简介则予以隐去,以维护匿名性。这些表涵盖参与构建 Sci-VBench 的 61 名标注者。
  • B.1 低层次视频质量:定义与实现细节(改编自 VBench): 主体与背景一致性衡量跨帧的身份、属性、布局、光照和空间结构是否保持稳定,且没有非预期变化。主体一致性强调保留主要主体的身份与外观,而背景一致性关注环境连续性和闪烁。
  • B.1 低层次视频质量:定义与实现细节(改编自 VBench): Motion Smoothness 评估时间上连续且符合物理规律的运动,而 Dynamic Degree 衡量运动强度与丰富度,不判断其正确性。运动标准会惩罚抖动、突变和时间伪影;Dynamic Degree 捕捉运动、形变与交互,而非静止程度。
  • B.1 低层次视频质量:定义与实现细节(改编自 VBench): Aesthetic Quality 通过构图、色彩和谐、光照、平衡性和风格连贯性评估感知吸引力。该指标衡量从人类感知角度看,视频是否令人愉悦且结构良好。
  • B.1 低层次视频质量:定义与实现细节(改编自 VBench): Imaging Quality 使用清晰度、分辨率、噪声、压缩伪影、模糊度和渲染清晰度衡量帧级视觉保真度。该指标反映生成图像在像素层面呈现得是否干净且逼真。

B.2 与既有视频评分方法比较 · B.3 评测提示模板 · C 其他实验结果

相比既有自动视频评分方法,基于 rubric 条件的 MLLM-as-Judge 在关键推理维度上与专家评分的一致性更高。其评测针对每个基准样例,使用维度特定的提示词以及带锚点的 1–5 评分 rubric。

  • B.2 与既有视频评分方法比较: 比较采用 VideoScore,该方法对五个已发布的评测器分数取平均,涵盖视觉质量、时间一致性、动态程度、文本到视频对齐和事实一致性。
  • B.2 与既有视频评分方法比较: 在 Prompt Grounding、Scientific and Causal Correctness 和 Spatiotemporal Consistency 上,基于 rubric 条件的 MLLM-as-Judge 在所比较的自动方法中取得最高的实例级 Pearson 相关系数。
  • B.2 与既有视频评分方法比较: ETVA 在 Prompt Grounding 以及 Scientific and Causal Correctness 上具有较强竞争力,但在 Low-level Perceptual Fidelity 和 Spatiotemporal Consistency 上表现急剧下降。
  • B.3 评测提示模板: Figure 6 展示了已发布的评测规范:先给出逐字保留的生成提示词,随后针对每个评测维度给出带锚点的 1–5 评分 rubric。
  • B.3 评测提示模板: Figure 5 规定了一种模板,使 MLLM-as-Judge 以一个评测维度为条件,并针对每个样例分别填入尖括号标记的字段。
  • B.3 评测提示模板: 该 rubric 示例使用了基准中的逐字保留的 knee-jerk-reflex 提示词以及专家编写的评测锚点。

C.1 全基准结果

本节展示开源模型在全部 1,253 个 Sci-VBench 示例上的完整自动评测结果。结果涵盖各项评测维度,并报告相应的总体平均值以便比较。

  • 评测按照各个维度分别报告结果,所采用的指标定义与 Table 4 一致。
  • 总体平均值列于 Table 4 的 Full Avg. 列中,而 Table 9 按其最右侧的 Avg. 列对开源模型进行排序。
  • Table 9 涵盖开源模型在完整 Sci-VBench 基准的 1,253 个示例上的全部自动评测结果。

C.2 错误分析

错误分析指出,知识密集型 text-to-video 生成存在三类主要失败模式:指令遵循不佳、科学模拟不准确,以及时间连贯性和视觉质量方面的缺陷。

  • 指令遵循不佳: 模型常常遗漏提示词中的细粒度细节,例如未能在指定设置中呈现按指令要求的瞬时按钮开关。该示例包含一个带电阻的单个 LED,同时一只手反复按下并松开按钮。
  • 科学原理模拟不准确: 模型经常违背科学原理,未能从前置条件推理出符合科学规律的结果。例如,膝跳反射中未受敲击的腿发生踢动,以及挤压袋子时从眼睛旁边而非侧面施力。
  • 时间连贯性和视觉质量方面的缺陷: 时间和视觉缺陷包括物体持久性失效、风格不连续变化、纹理粗糙,以及事件之间的因果联系薄弱。在一个示例中,同时在两条独立轨道上释放的两个球在运动过程中合并成一个。
Loading 2608.09873v1…