Source-linked AI summary
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao
TL;DR
과학 비디오 생성은 시각적 개연성을 넘어 메커니즘 및 인과적 충실도를 평가해야 하지만, 기존 벤치마크는 다학제적이고 전문가에 근거한 범위를 충분히 다루지 못한다. Sci-VBench는 1,253개의 전문가 작성 과제와 rubric 기반 평가로 이를 보완하며, 지각적 품질의 변동은 작지만 과학적 추론 성능에서는 뚜렷한 proprietary–open-source 격차가 나타남을 보인다.
문제
기존 비디오 생성 벤치마크는 지각적 개연성을 넘어 과학적 메커니즘, 인과 관계, 시간적 의존성에 대한 다학제적이고 전문가에 근거한 평가를 제한적으로만 제공한다.
방법
Sci-VBench는 60개 주제와 네 개 분야에 걸친 1,253개의 전문가 작성 과제를 reference guide, scoring rubric, automatic 및 human evaluation protocol과 결합한다.
결과
16개 모델에서 perceptual-quality score는 거의 일정한 반면, Prompt Grounding과 Scientific and Causal Correctness는 뚜렷한 proprietary–open-source 격차와 함께 크게 달라진다.
시사점 및 한계
시각적 사실성만으로는 scientific validity를 신뢰성 있게 나타낼 수 없으며, 이는 메커니즘적 추론과 시간적으로 일관된 인과 동역학을 평가해야 할 필요성을 보여준다.
Abstract
from arXiv · showhide
We introduce Sci-VBench, a comprehensive benchmark for evaluating knowledge- and reasoning-intensive video generation across scientific domains. It contains 1,253 expert-annotated examples spanning 60 subjects across four core disciplines: Natural Science, Healthcare, Humanities & Social Sciences, and Engineering. Each example requires models to generate temporally rich videos that demand scientific reasoning and knowledge-grounded synthesis, going beyond surface-level visual plausibility. We further establish a rubric-based evaluation protocol. Our analysis shows that, under this protocol, both non-expert human evaluators and MLLM-as-Judge systems can achieve relatively high agreement with expert judgments, supporting reproducible evaluation at scale. We benchmark 16 frontier proprietary and open-source models and find that, while automatic perceptual-quality scores cluster tightly across systems, performance on Prompt Grounding and Scientific and Causal Correctness varies substantially, with a pronounced proprietary-open-source gap. These findings show that advances in visual realism have not yet translated into reliable modeling of scientific and causal dynamics.
1 서론
Sci-VBench는 전문가 주석 benchmark와 확장 가능한 rubric-based protocol을 통해 과학적 비디오 생성에서 지식 및 추론 집약적 평가의 부재를 다룬다. 16개 모델에 대한 평가에서 perceptual-quality 점수가 거의 평탄함에도 scientific 및 causal 차원에서 proprietary–open-source 격차가 드러난다.
- 1 서론: 이 benchmark는 지식 및 추론 집약적이며 시각적으로 검증 가능한 비디오 생성을 대상으로 하며, 평가 범위를 perceptual plausibility에서 벗어나 충실한 사건, 제약, 시간적 의존성까지 확장한다.과학적 설정은 perceptual plausibility가 근본적 오류를 가릴 수 있기 때문에 중요하다.
- 1 서론: 기존 benchmark는 perceptual quality, prompt alignment, compositionality 또는 일반적인 physical commonsense를 강조해 왔으며, 지식 및 추론 집약적 과학 비디오 생성은 충분히 평가되지 않았다.지식 및 추론 집약적 평가는 주로 생성보다 비디오 이해에서 연구되어 왔다.
- 1 서론: Sci-VBench는 Natural Science, Healthcare, Humanities & Social Sciences, Engineering 전반의 60개 주제를 아우르는 1,253개의 전문가 작성 및 독립 검토 task로 구성된다.각 task는 최소한의 generation prompt와 전문가가 작성한 evaluation specification을 짝지어 구성한다.
- 1 서론: rubric-based protocol은 전문가 평정을 reference label로 사용하고, VBench Vision Tools와 rubric-conditioned MLLM judging을 결합해 perceptual, grounding, scientific-causal, spatiotemporal 차원을 평가한다.통제된 인간 연구는 evaluation specification이 비전문가와 전문가 간 일치도를 크게 향상시킴을 보여준다.
- 1 서론: 16개 frontier model에 대한 평가에서 Prompt Grounding과 Scientific and Causal Correctness에 집중된 뚜렷한 proprietary–open-source 격차가 나타난 반면, 자동 perceptual-quality proxy는 거의 평탄했다.정성적 분석에서는 시각적으로 설득력 있는 출력에도 불구하고 선도 모델에서 체계적인 기계론적 오류가 추가로 발견된다.
2 관련 연구
Video-generation 연구는 diffusion–transformer 시스템을 통해 짧고 낮은 fidelity의 클립에서 고 fidelity와 시간적 일관성을 갖춘 출력으로 발전했으며, 물리 법칙 준수와 commonsense reasoning도 점점 더 다루고 있다. 기존 benchmark는 주로 지각, motion, 구성, 상호작용, prompt following 능력을 평가하며, domain-specific scientific mechanism은 충분히 평가하지 않는다.
- Video-Generation Benchmark: Sci-VBench는 expert 참여와 재사용 가능한 example별 evaluation guide 또는 rubric을 비교 차원에 포함함으로써 기존 benchmark와 차별화된다.Table 1은 domain expert 참여를 “Expert”로, 공개된 evaluation guide 또는 rubric을 “Eval Spec”으로 정의한다.
- Video Generation: Video-generation 시스템은 diffusion model과 대규모 transformer를 통해 짧고 낮은 fidelity의 클립에서 고 fidelity와 시간적 일관성을 갖춘 출력으로 발전했다.최근 연구는 물리 법칙 준수와 commonsense reasoning도 점점 더 목표로 삼는다.
- Video-Generation Benchmark: 기존 video-generation benchmark는 주로 지각적 fidelity와 motion quality를 평가하며, 일부는 compositionality, object interaction, higher-level prompt following까지 평가를 확장한다.이 benchmark들은 rubric으로 검증 가능한 scientific evaluation을 통해 domain-specific mechanism에 대한 충실성을 시험하도록 설계되지 않았다.
3 Sci-VBench 벤치마크
Sci-VBench는 네 가지 학문 분야의 60개 주제를 아우르는 1,253개의 전문가 작성 예시로 구성되며, 지식에 근거한 다단계 인과 및 시공간 추론을 평가하도록 설계됐다. 벤치마크 구축에는 전문가 주석과 reference guide 및 1–5 scoring rubric을 활용한 검토가 결합되어, 분야 비전문가도 mechanism-level 평가를 수행할 수 있게 했다.
- 벤치마크 설계 기준: Sci-VBench는 60개 주제와 네 가지 학문 분야에 걸쳐 1,253개의 예시를 다루며, 폭넓은 영역 지식과 전문가 수준의 인과 추론을 중점적으로 평가한다.모든 prompt는 해당 분야 전문가가 작성하며, 과학적 이해에 근거한 다단계 추론이 필요한 현상을 대상으로 한다.
- 평가 차원: 이 벤치마크는 지각적 충실도, prompt grounding, 과학적 및 인과적 정확성, 시공간적 일관성을 평가한다.후자의 차원들은 일반적인 품질 및 prompt 정렬 기준으로는 포착되지 않는 mechanism-level 실패를 분리해 평가한다.
- 벤치마크 구축: 전문가들은 관찰 가능하고 메커니즘에 의해 지배되는 시각적 실현이 가능한 교과서 기반 개념을 선택하고, 모델이 underlying mechanism을 추론해야 하는 최소한의 prompt를 작성한다.Prompt에는 초기 설정과 개입 또는 목표가 명시되지만, 예상되는 메커니즘적 궤적과 핵심 현상은 제시되지 않는다.
- 평가 명세: 각 prompt에는 예상되는 인과적 전이, 관찰 가능한 증거, 부분적 정확성, 실패 조건을 정의하는 고수준 reference guide와 상세한 1–5 rubric이 부여된다.이를 통해 평가에 필요한 전문가 지식을 외부화하여, 비전문가나 MLLM judge도 해당 명세를 적용할 수 있게 한다.
- 품질 관리 및 분할: 모든 예시는 명확성, 시각적 테스트 가능성, prompt·reference guide·rubric 간 일관성에 대해 독립적인 분야 전문가 검토를 거친다.또한 벤치마크는 신속하고 비용 제약적인 평가를 위한 150개 예시의 testmini split을 제공한다. 오픈소스 모델은 두 split을 모두 사용하는 반면, proprietary 시스템은 testmini만 사용한다.
4 Sci-VBench 평가 프로토콜
Sci-VBench는 전문가의 1–5점 평가를 기준 레이블로 사용하고, VBench metrics와 rubric-conditioned MLLM judging을 결합한 확장 가능한 자동화 프로토콜을 적용한다. 신뢰도 분석에서는 이러한 평가를 비전문가 및 MLLM-as-Judge 평가와 비교하며, 평가 명세와 더 큰 judge model이 전문가와의 일치도를 높인다는 결과를 보인다.
- Human Evaluation: 전문가 annotator는 분야별 calibration 이후 모든 생성 비디오를 네 가지 평가 차원 각각에서 1–5점으로 채점해 primary reference labels를 제공한다.각 annotator는 prompt, 생성 비디오, 예시별 평가 명세를 받고, 관찰 가능한 단서를 rubric 점수로 매핑한다.
- Automated Evaluation: 자동화 프로토콜은 예시별 명세를 유지하면서 평가를 확장한다. VBench Vision Tools는 Low-level Perceptual Fidelity를 산출하고, rubric-conditioned judge는 나머지 세 차원을 채점한다.MLLM-as-Judge는 native video input을 사용하는 Qwen3.5-397B-A17B로 Prompt Grounding, Scientific and Causal Correctness, Spatiotemporal Consistency를 평가한다.
- Reliability Analysis: 신뢰도는 서로 다른 guidance condition을 적용한 비전문가 cohort와 evaluation specification을 제공받은 MLLM judge를 사용해 전문가 평가와 비교하여 측정한다.신뢰도 분석에서는 전문가가 채점한 비디오를 사용하고, human evaluator와 automated evaluator 간 일치도를 비교한다.
- Reliability Analysis: 비전문가와 전문가의 일치도는 예시별 평가 명세를 제공하는 경우와 제공하지 않는 경우 모두에서 평가하여, rubric guidance가 신뢰도를 높이는지 검증한다.without-specification cohort는 prompt와 비디오만 보는 반면, with-specification cohort는 reference guide와 scoring rubric을 제공받는다.
- Reliability Analysis: Qwen3.5-397B-A17B는 전문가 평가와의 highest overall correlations를 달성하며, MLLM evaluator scale이 커질수록 일치도도 전반적으로 증가한다.비교에는 Qwen3.5-397B-A17B, Gemma-4-31B, Qwen3.5-9B가 포함되며, 모든 evaluator는 네 가지 차원에서 전문가 평가를 기준으로 평가된다.
5 실험
이 실험은 Sci-VBench에서 16개 proprietary 및 open-source text-to-video model을 원문 그대로의 prompt로 평가한 결과, perceptual appearance가 아니라 scientific and causal reasoning이 시스템을 구분하는 것으로 나타났다. Proprietary model은 reasoning 차원에서 앞섰고, open-source model은 spatiotemporal consistency에서 이들과 대등하거나 더 나은 성능을 보였으며, 관찰된 실패는 instruction adherence, scientific simulation, temporal 또는 visual quality와 관련되었다.
- 5.1 주요 결과: 이 benchmark는 각 model의 default configuration에서 원문 그대로의 prompt를 사용해 16개 frontier text-to-video model—proprietary model 8개와 open-source model 8개—을 평가한다.Model별 version, resolution, frame rate, clip duration은 Appendix A.3에 제시되어 있다.
- 5.1 주요 결과: Automatic perceptual quality는 model 전반에서 거의 일정하며 VT는 3.79에서 4.12까지인 반면, mechanism-sensitive 차원은 크게 달라진다.이 결과는 현재 시스템이 appearance보다 mechanism에서 더 큰 차이를 보인다는 점을 보여준다.
- 5.1 주요 결과: Testmini는 full benchmark의 충실한 저비용 proxy이며, open-source model의 model별 full-benchmark 평균은 testmini와 최대 0.07만큼만 다르다.Table 4에는 16개 model 전체의 testmini 결과가 보고되어 있고, full benchmark의 차원별 전체 결과는 Appendix C.1에 제시되어 있다.
- 5.1 주요 결과: Proprietary model은 scientific and causal reasoning에서 앞서는 반면, open-source model은 spatiotemporal consistency에서 proprietary system과 대등하거나 이를 능가하면서도 SCC에서는 크게 뒤처진다.MiniMax-H3는 SCC에서 1.63으로 open-source group 중 선두지만 proprietary 최고 성능의 절반이며, Wan2.2-5B는 2.79로 automatic SC score가 가장 높다.
- 5.2 오류 분석: 관찰된 오류는 instruction adherence 부족, scientific principle의 부정확한 simulation, temporal coherence와 visual quality의 결함으로 나뉜다.이러한 실패에는 prompt 세부 내용의 누락, aesthetics를 우선시해 발생한 사실과 어긋난 dynamics, 시간에 따라 물체가 비논리적으로 변하는 현상이 포함된다.
- 5.3 Prompting Ablation: Explicit-prompting ablation에서는 testmini prompt를 다시 작성해 scene과 요청된 dynamics를 시각적으로 더 구체화한 뒤, 변경하지 않은 setting에서 Wan2.2-5B와 HunyuanVideo-1.5로 video를 재생성한다.두 model 모두에서 일관되게 같은 순서로 나타난 gains가 Figure 4에 보고되어 있다.
6 결론
Sci-VBench는 네 개 분야의 60개 주제에 걸쳐 전문가가 작성한 1,253개 프롬프트를 바탕으로 text-to-video 모델을 전문 영역의 세계 시뮬레이터로 평가한다. 이 벤치마크는 mechanistic reasoning과 시간적으로 일관된 인과 동역학을 중시하며, 지각적 사실성과 과학적 타당성 사이의 간극을 드러낸다.
- 평가 초점: Sci-VBench에서의 성공은 표면적 사실성이 아니라 mechanistic reasoning과 시간적으로 일관된 인과 동역학에 달려 있다.
- 핵심 발견: 16개 최첨단 proprietary 및 open-source 모델을 벤치마킹한 결과, 지각적 사실성과 과학적 타당성 사이의 간극이 지속적으로 존재함이 드러난다.
A Sci-VBench 데이터셋 · A.1 주제 선정
Sci-VBench는 네 개 학문 분야의 60개 주제에 걸친 전문가 주석 예시 1,253개를 사용해 지식 및 추론 집약적 과학 비디오 생성을 평가한다. rubric 기반 분석에서는 지각 품질 점수가 비슷하게 군집을 이루는데도 과학적·인과적 정확성에서 큰 차이가 나타난다.
- A Sci-VBench 데이터셋: Sci-VBench는 생성된 과학 비디오를 평가하기 위한 rubric 기반 평가 프로토콜을 수립한다.
- A Sci-VBench 데이터셋: 비전문가 인간 평가자와 MLLM-as-Judge 시스템은 이 프로토콜에서 전문가 판단과 비교적 높은 일치도를 보인다.
A.2 데이터 품질 관리 … B.1 저수준 비디오 품질: 정의 및 구현 세부사항 (VBench에서 각색)
벤치마크는 평가자 일관성을 감사하고, 모델 생성 설정과 annotator 정보를 문서화하며, 시간적 일관성, motion, dynamics, aesthetics, imaging fidelity를 포괄하는 차원을 통해 저수준 비디오 품질을 평가한다.
- A.2 데이터 품질 관리: 표적 감사에서는 200개 예시를 표본 추출하고, 동일 subject를 담당한 두 번째 annotator가 첫 번째 annotator의 결과를 보지 않은 채 각 예시의 전체 평가 사양을 독립적으로 작성한다.사양에는 모든 차원에 대한 상위 수준 reference guide와 기준이 명시된 1–5 평가 기준이 포함된다.
- A.3 비디오 생성 모델: Table 6은 평가된 video generation model의 상세 설정을 문서화한다.비디오는 벤치마크 prompt를 그대로 사용하며 각 모델의 default configuration으로 생성된다. 지원되는 duration은 15초에 가장 가까운 값이고, 일부 모델은 5–10초로 제한된다.
- A.4 Annotator 정보: annotator 약력은 Tables 7 and 8에 제시되지만, 익명성 보장을 위해 author-annotator의 약력은 공개하지 않는다.표에는 Sci-VBench 구축에 참여한 61명의 annotator가 포함된다.
- B.1 저수준 비디오 품질: 정의 및 구현 세부사항 (VBench에서 각색): Subject and background consistency는 의도하지 않은 변화 없이 프레임 간 identity, attribute, layout, lighting, spatial structure가 안정적으로 유지되는지를 측정한다.Subject consistency는 주 subject의 identity와 appearance 보존을 중시하는 반면, background consistency는 환경의 연속성과 flicker를 다룬다.
- B.1 저수준 비디오 품질: 정의 및 구현 세부사항 (VBench에서 각색): Motion Smoothness는 시간적으로 연속적이고 물리적으로 그럴듯한 movement를 평가하는 반면, Dynamic Degree는 올바른지 여부를 판단하지 않고 motion intensity와 richness를 측정한다.motion 기준은 jitter, abrupt jump, temporal artifact에 불이익을 주며, Dynamic Degree는 staticness가 아니라 movement, deformation, interaction을 포착한다.
- B.1 저수준 비디오 품질: 정의 및 구현 세부사항 (VBench에서 각색): Aesthetic Quality는 composition, color harmony, lighting, balance, stylistic coherence를 통해 perceptual appeal을 평가한다.인간의 perceptual 관점에서 비디오가 얼마나 매력적이고 잘 구성되어 보이는지를 측정한다.
- B.1 저수준 비디오 품질: 정의 및 구현 세부사항 (VBench에서 각색): Imaging Quality는 sharpness, resolution, noise, compression artifact, blur, rendering clarity를 사용해 프레임 수준의 visual fidelity를 측정한다.이 metric은 생성된 이미지가 pixel 수준에서 얼마나 깨끗하고 현실적으로 보이는지를 반영한다.
B.2 기존 Video Scoring Methods와의 비교 · B.3 Evaluation Prompt Templates · C 추가 실험 결과
Rubric-conditioned MLLM-as-Judge는 핵심 reasoning 중심 차원에서 기존 automatic video-scoring methods보다 expert ratings와 더 밀접하게 일치한다. 평가는 각 benchmark example에 dimension-specific prompts와 anchored 1–5 rubrics를 적용해 수행된다.
- B.2 기존 Video Scoring Methods와의 비교: 비교에는 visual quality, temporal consistency, dynamic degree, text-to-video alignment, factual consistency를 포괄하는 공개 evaluator score 5개의 평균을 사용하는 VideoScore가 포함된다.
- B.2 기존 Video Scoring Methods와의 비교: Rubric-conditioned MLLM-as-Judge는 Prompt Grounding, Scientific and Causal Correctness, Spatiotemporal Consistency에서 비교된 automatic methods 중 instance-level Pearson correlation이 가장 높다.
- B.2 기존 Video Scoring Methods와의 비교: ETVA는 Prompt Grounding과 Scientific and Causal Correctness에서는 비교적 경쟁력 있지만, Low-level Perceptual Fidelity와 Spatiotemporal Consistency에서는 급격히 저하된다.
- B.3 Evaluation Prompt Templates: Figure 6은 공개된 evaluation specification을 제시한다. 즉, verbatim generation prompt 뒤에 각 평가 차원에 대한 anchored 1–5 rubrics가 이어진다.
- B.3 Evaluation Prompt Templates: Figure 5는 하나의 evaluation dimension을 기준으로 MLLM-as-Judge를 조건화하는 template을 지정하며, angle-bracketed fields는 각 example에 대해 별도로 채워진다.
- B.3 Evaluation Prompt Templates: Rubric example은 benchmark의 verbatim knee-jerk-reflex prompt와 expert-authored evaluation anchors를 사용한다.
C.1 전체 벤치마크 결과
이 절에서는 1,253개의 Sci-VBench 전체 예제에 대한 open-source 모델의 완전한 자동 평가 결과를 제시한다. 결과는 각 평가 차원을 포괄하며 비교를 위해 해당 전체 평균을 보고한다.
- 평가는 Table 4와 일관된 metric 정의를 사용해 각 차원별로 결과를 별도로 보고한다.
- 전체 평균은 Table 4의 Full Avg. 열에 포함되며, Table 9는 가장 오른쪽의 Avg. 열을 기준으로 open-source 모델을 정렬한다.
- Table 9는 1,253개 예제로 구성된 전체 Sci-VBench 벤치마크에서 open-source 모델에 대한 완전한 자동 평가 결과를 다룬다.
C.2 오류 분석
오류 분석은 지식 집약적 text-to-video 생성에서 세 가지 주요 실패 양상을 식별한다: 지시 준수 부족, 부정확한 과학적 시뮬레이션, 시간적 일관성과 시각적 품질의 결함이다.
- 지시 준수 부족: 모델은 세부적인 prompt 내용을 자주 놓치며, 지시된 설정에서 지정된 순간적인 push-button switch를 렌더링하지 못하는 경우가 그 예다.해당 예시에는 resistor가 연결된 단일 LED가 등장하고, 손이 버튼을 반복해서 눌렀다 놓는다.
- 과학적 원리의 부정확한 시뮬레이션: 모델은 전제조건에서 과학적으로 타당한 결과를 추론하지 못해 과학적 원리를 자주 위반한다.예시로는 무릎반사에서 자극하지 않은 다리가 차는 경우와, 가방을 옆에서가 아니라 눈 옆에서 누르는 경우가 있다.
- 시간적 일관성과 시각적 품질의 결함: 시간적·시각적 결함에는 객체 지속성 실패, 불연속적인 스타일 변화, 거친 텍스처, 사건 간 인과 연결의 약화가 포함된다.한 예시에서는 서로 다른 트랙에서 동시에 놓인 두 공이 움직이는 동안 하나로 합쳐진다.