Source-linked AI summary

MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye, Nanqing Liu, Yaling Liang

arXiv:2604.23789v3cs.CV

TL;DR

MuSS는 일관된 multi-shot 영화적 서사와 copy-paste가 배제된 Subject-to-Video 생성을 위한 데이터셋과 benchmark의 부재를 해결한다. 이중 트랙 데이터셋, cross-shot matching, Cinematic Narrative Benchmark를 통해 기존 baseline보다 스토리텔링 효과, 구조적 grounding, 정체성 일관성을 향상한다.

  • 문제

    기존 video dataset과 benchmark는 대체로 고립된 single-shot 생성에 초점을 맞추며, 실제적인 multi-shot 서사 논리와 시공간적 스토리텔링에 대한 평가가 부족하다.

  • 방법

    MuSS는 대규모 이중 트랙 cinematic dataset에 progressive captioning, cross-shot subject matching, visual-logic-driven Cinematic Narrative Benchmark를 결합한다.

  • 결과

    MuSS-augmented model은 state-of-the-art 스토리텔링 효과, 구조적 grounding, cross-shot 정체성 일관성을 달성하는 반면, 기존 baseline은 cinematic multi-shot 시나리오에서 어려움을 겪는다.

  • 시사점 및 한계

    MuSS는 연속적인 cinematic storytelling과 3D 일관성을 갖춘 Subject-to-Video 생성을 학습하고 평가하기 위한 unified resource를 제공한다.

  • 시사점 및 한계

    일부 baseline은 외부 reference input이 없어 정체성 평가에서 ACP-Var와 Copy-Paste Rate를 구조적으로 적용할 수 없다.

Abstract

from arXiv · show

While video foundation models excel at single-shot generation, real-world cinematic storytelling inherently relies on complex multi-shot sequencing. Further progress is constrained by the absence of datasets that address three core challenges: authentic narrative logic, spatiotemporal text-video alignment conflicts, and the "copy-paste" dilemma prevalent in Subject-to-Video (S2V) generation. To bridge this gap, we introduce MuSS, a large-scale, dual-track dataset tailored for multi-shot video and S2V generation. Sourced from over 3,000 movies, MuSS explicitly supports both complex montage transitions and subject-centric narratives. To construct this dataset, we pioneer a progressive captioning pipeline that eliminates contextual conflicts by ensuring local shot-level accuracy before enforcing global narrative coherence. Crucially, we implement a cross-shot matching mechanism to fundamentally eradicate the S2V copy-paste shortcut. Alongside the dataset, we propose the Cinematic Narrative Benchmark, featuring a visual-logic-driven paradigm and a novel Anti-Copy-Paste Variance (ACP-Var) metric to rigorously assess continuous storytelling and 3D structural consistency. Extensive experiments demonstrate that while current baselines struggle with continuous narrative logic or degenerate into trivial 2D sticker generators, our MuSS-augmented model achieves state-of-the-art narrative effectiveness and cross-shot identity preservation.

1 서론

MuSS는 progressive annotation과 cross-shot subject matching을 적용한 대규모 cinematic multi-shot dataset을 도입해 single-shot video dataset과 기존 S2V method의 한계를 해결한다. 또한 visual logic을 중심으로 storytelling과 subject consistency를 평가하는 Cinematic Narrative Benchmark와 Anti-Copy-Paste Variance metric을 제안한다.

  • 동기: 기존 dataset과 framework는 주로 단순한 단일 subject 동작을 담은 isolated single-shot videos를 지원하는 반면, cinematic production에는 복잡한 multi-shot sequencing이 필요하다.서론에서는 부족한 narrative logic과 local shot accuracy와 global caption coherence 사이의 충돌을 dataset construction의 핵심 과제로 지적한다.
  • Dataset: MuSS는 over 3,000 movies에서 구축되었으며, multi-shot video와 S2V generation을 위해 approximately 700K filtered shots와 more than 30K captioned multi-shot sequences를 포함한다.이 sequences는 aesthetics, motion, semantic consistency를 포함한 multi-dimensional filtering을 통해 선별된다.
  • Benchmark: Cinematic Narrative Benchmark는 dual-track, visual-logic-driven evaluation suite로서, global quality와 basic text alignment만이 아니라 realistic cinematic conditions에서 storytelling을 측정하도록 설계되었다.명시된 기여에는 Multi-Dimensional Visual Logic과 Anti-Copy-Paste Variance (ACP-Var) metric이 포함된다.
  • Dataset Construction: MuSS는 progressive VLM annotation과 정밀한 cross-shot subject matching을 결합하고, alternate-shot references를 사용해 새로운 view를 유도하며 S2V “copy-paste” shortcut을 방지한다.이는 기존 personalized S2V models가 reference subject의 pose와 lighting을 복제해 shot 간 novel views에 대한 generalization을 저해하는 경향을 해결한다.

2 관련 연구

기존 연구는 long-range attention, hierarchical sequencing, memory-based continuity를 통해 일관된 장편 동영상 생성을 발전시켜 왔으며, customized video generation은 다양한 시점과 장면에서의 identity preservation을 increasingly 목표로 한다. 그러나 기존 S2V dataset은 isolated single-shot action을 중심으로 구성되어 copy-paste shortcut을 조장하고, multi-shot에서의 3D identity preservation은 충분히 benchmark되지 않았다.

  • 장편 동영상 생성: 장편 동영상 생성은 consistent self-attention, hierarchical visual sequencing, memory-based contextual continuity를 통해 temporal extrapolation에서 narrative modeling으로 발전해 왔다 [60] [58] [54].StoryDiffusion [60]은 long-range generation을 지원하고, MovieDreamer [58]는 coherent visual sequence를 계층적으로 모델링하며, LetsTalk [54]는 긴 talking video에서 error accumulation을 완화한다.
  • Customized video generation: Customized generation은 spatial prior와 video diffusion transformer를 사용해 다양한 시점과 장면에서 엄격한 identity preservation을 increasingly 다룬다 [46] [7] [27] [55].WithAnyone [46], MultiRef [7], OpenSubject [27]은 image-level spatial prior를 video로 확장해 제공하며, Magic Mirror [55]는 video diffusion transformer를 사용한다.
  • Customized video generation: 기존 S2V dataset은 주로 isolated single-shot action을 다루므로 copy-paste shortcut을 조장하고, dynamic multi-shot cinematic transition 전반에서 3D identity preservation을 엄밀하게 benchmark하지 못한다.이러한 한계는 isolated action을 넘어 cinematic transition 전반에서 identity consistency를 검증하는 evaluation protocol의 필요성을 제기한다.

3 MuSS 데이터셋 구축

MuSS는 3,000편이 넘는 영화에서 두 단계로 구축된다. 일관된 multi-shot 데이터셋 생성과 cross-shot-matched Subject-to-Video 쌍 큐레이션으로 구성된다. 파이프라인은 shot filtering, progressive narrative captioning, zero-shot subject extraction을 결합해 alignment와 3D identity consistency를 향상한다.

  • 데이터셋 구축: MuSS에는 약 700K개의 필터링된 single shot, 30,000개가 넘는 전문 caption multi-shot clip, 3,000편이 넘는 영화에서 추출한 1,000시간 이상의 video가 포함된다.데이터셋 통계에는 clip duration, caption length, caption vocabulary, source video별 clip 수가 포함된다.
  • Multi-Shot 기반: 구축 파이프라인은 먼저 영화를 전처리하고, TransNetV2 로 shot boundary를 검출한 뒤, 사용 가능한 cinematic dynamics를 유지하도록 motion을 필터링한다.전처리에서는 watermark와 black border를 제거한다. motion filtering은 정지된 shot이나 과도하게 혼란스러운 shot을 제외하되, motion이 적은 대화 장면과 establishing shot은 유지한다.
  • 점진적 일관 captioning: Progressive captioning은 먼저 개별 shot을 다시 caption하고 0.20 미만의 점수를 받은 VideoCLIPXL [47] 쌍을 제거한 다음, 연속 shot을 narrative-coherent sequence로 집계한다.film-director-assistant VLM은 entity, coreference, contextual-consistency, structured-formatting 제약 아래 keyframe과 initial caption을 사용해 caption을 전역적으로 정교화한다.
  • Subject-to-Video 쌍 구축: S2V 큐레이션은 zero-shot subject extraction과 cross-shot matching을 사용해 “copy-paste” shortcut을 방지하면서 3D identity consistency를 보존한다.Qwen2.5-VL-7B [2]와 DeepSeekV3 [23]는 subject tag를 생성하고, GroundingDINO [25]는 initial-frame object를 검출하며, SAM 2.1 [34]은 pixel-level mask를 생성한다.

4 시네마틱 내러티브 벤치마크

시네마틱 내러티브 벤치마크는 단일 샷의 거친 지표를 넘어 스토리텔링, 샷 간 안정성, 시공간 제어, 진정한 3D 일관성을 평가하도록 설계된 이중 트랙 MuSS suite다. Visual-Logic Driven 패러다임은 LMM reasoning과 도메인 전문가 perceptual model을 결합하며, 특화 지표를 통해 시간성, 정체성, copy-paste 실패를 드러낸다.

  • 벤치마크 개요: 이 벤치마크는 두 개의 MuSS-derived track을 통해 스토리텔링, 샷 간 시각적 안정성, 시공간 제어를 측정함으로써 기존 단일 샷 평가의 공백을 다룬다.기존 벤치마크는 거친 전역 평가에 의존하며 이러한 시네마틱 특성을 충분히 포착하지 못한다.
  • 평가 패러다임: Visual-Logic Driven 패러다임은 일반적인 전역 텍스트 prior 없이 Gemini-2.5-Flash reasoning을 DINOv2, TransNet V2, RAFT, YOLOv11, SAM과 결합해 인간 수준의 구조 평가를 수행한다.완벽한 전역 caption은 대규모로 적용하기 어렵기 때문에, 이 접근법은 visual reasoning과 도메인 특화 perceptual fidelity를 결합한다.
  • Track 1: Track 1은 Txt.Align, Scene.Con, Con.Gap을 사용해 로컬 shot-text alignment, transition precision, global visual-world preservation, motion dynamics, narrative rhythm을 측정한다.RAFT는 정적인 slideshow와 같은 생성을 걸러내며, 이후 professional film-edit coherence distribution에 대한 Jensen-Shannon Distance를 계산해 Con.Gap을 구한다.
  • Track 2: Track 2는 reference fidelity와 internal identity preservation을 분리하고, 정당한 시네마틱 카메라 변화에 불이익을 주지 않으면서 진정한 시공간 grounding을 평가한다.Ref-Sub.Con은 외부 reference에 대한 fidelity를 측정하는 반면, Inter-Sub.Con은 생성된 shot 전반의 identity consistency를 측정한다.
  • Track 2: ACP-Var, Simpose, CP-Rate, Act.Str은 structural diversity, pose diversity, keypoint similarity, feature-entropy collapse, action tempo를 평가해 2D sticker와 같은 copying을 탐지한다.DINOv2 similarity entropy가 0에 가까우면 사소한 2D duplication을 나타내며, Procrustes-aligned keypoint는 경직된 reference-posture collapse를 드러낸다.
  • 평가 설정: 이 연구는 100개의 MuSS test prompt를 수동 검증하고, 층화된 시네마틱 조건 전반에서 storyboard, native multi-shot, customized S2V, physical copy-paste baseline을 평가한다.prompt는 shot 수, scene type, dialogue/action rhythm, framing, subject 수를 포괄하며, 각 track에 50개씩 배정된다.

5 실험

실험 결과, MuSS는 연속적인 multi-shot narrative logic과 subject identity preservation을 향상시키며, 기존 baseline의 성능을 제한하는 spatial hallucination과 copy-paste 동작을 극복한다. Human evaluation은 benchmark metric이 전문가 판단과 부합함을 추가로 뒷받침한다.

  • Track 1: Narrative Effectiveness: MuSS가 보강된 모델은 multi-shot 일관성과 경쟁력 있는 spatiotemporal transition precision을 유지하면서 Track 1의 visual-logic metric에서 전반적으로 우수한 성능을 보인다.benchmark는 연속적인 storytelling과 cinematic transition 전반에서 narrative effectiveness를 평가한다.
  • Track 2: Subject Consistency: MuSS는 S2V copy-paste shortcut을 차단하면서 customizable baseline 중 state-of-the-art grounding과 내부 identity preservation을 달성한다.Phantom과 VACE는 높은 reference-subject consistency를 보이지만 inter-subject consistency는 낮아, 경직된 2D image-translation 동작을 드러낸다. 외부 reference가 없는 방법에는 ACP-Var와 CP-Rate를 사용할 수 없다.
  • Track 1: Narrative Effectiveness: MuSS는 관점을 바꾸는 transition 전반에서 spatial topology와 cast continuity를 보존하는 반면, 기존 baseline은 background를 hallucinate하고 lighting이나 architecture를 바꾸며 character를 잃는다.Concatenation 기반 방법은 연속적인 storytelling에 어려움을 겪고, native multi-shot 모델은 four-dimensional visual-logic test에 실패할 수 있다.
  • Metric Validation: 15명의 professional filmmaker가 생성된 200개 sequence를 평가한 결과, ACP-Var, visual-logic metric, 그리고 motion naturalness·perspective richness·visual continuity에 대한 판단 사이의 강한 부합이 확인된다.ACP-Var는 traditional metric이 간과하는 경직된 2D sticker 효과에 페널티를 부여하며, Scene.Logic은 전문가의 continuity 평가와 부합한다.

6 결론

이 연구는 MuSS와 Cinematic Narrative Benchmark를 통해 비일관적인 multi-shot 영화적 내러티브와 Subject-to-Video 합성의 copy-paste shortcut 문제를 다룬다. MuSS는 progressive captioning과 cross-shot matching을 결합해 진정성 있는 identity preservation을 지원한다.

  • MuSS는 두 가지 병목, 즉 비일관적인 multi-shot 영화적 내러티브와 Subject-to-Video 합성에서 만연한 copy-paste shortcut을 겨냥한다.
  • 이 데이터셋은 multi-shot video generation의 과제를 해결하기 위해 progressive captioning을 사용한다.
  • Subject-to-Video 합성에서 진정성 있는 identity preservation을 보장하도록 엄밀한 cross-shot matching 메커니즘을 설계한다.
  • 또한 제안된 multi-shot 및 Subject-to-Video generation 설정을 평가하기 위한 Cinematic Narrative Benchmark를 도입한다.

보충 자료 … B.2 점진적 캡셔닝을 위한 Prompt Templates

보충 자료는 MuSS의 재현 가능한 데이터 접근, 단계적 필터링, cross-shot reference 구성, progressive-captioning prompt templates를 명시한다. 이러한 세부 사항은 품질, 정체성 신뢰성, 시공간 정렬 문제를 다루면서 dataset curation을 구체화한다.

  • A 데이터 소스 및 접근: MuSS는 raw video가 아니라 YouTube video identifiers와 timestamp annotations를 배포하며, source copyright와 licensing에 대한 책임은 provider와 rights holder에게 남긴다.dataset은 공개적으로 접근 가능한 YouTube videos로 구축되지만, raw files는 직접 배포되지 않는다.
  • A 데이터 소스 및 접근: 자동 다운로드 및 trimming scripts는 공개된 identifiers와 annotated multi-shot boundaries로부터 dataset을 로컬에서 재현하며, 사용자는 source content를 합법적으로 사용할 책임을 진다.repository는 open-source fetching 및 trimming tools를 사용하는 download_muss.sh와 download_muss.py를 제공한다.
  • B 확장된 Dataset Construction 세부 사항: 보충 자료는 본문에서 소개한 MuSS curation pipeline을 재현하기 위한 operational parameters를 제공한다.이 세부 사항은 확장된 dataset construction, filtering, cross-shot references, captioning prompts를 다룬다.
  • B.1 다차원 Cascaded Filtering Thresholds: MuSS는 sliding-window sequence construction에 앞서 single-shot candidates에 cascaded filtering을 적용하고, low-motion dialogue와 establishing shots는 유지하는 한편 frozen 또는 지나치게 chaotic한 content는 제외한다.filtering pipeline은 심각한 intra-shot semantic drift, 낮은 visual aesthetics, 불충분한 temporal quality도 대상으로 삼으며, Table S1에 경험적 threshold가 제시된다.
  • B.1 다차원 Cascaded Filtering Thresholds: Cross-shot references는 동일한 storyline에서 가져오되 target clips 외부에서 subject tags, entity captions, GroundingDINO 및 SAM 2.1 masks, visual matching, verifier checks를 사용해 선택한다.candidate pairs는 추가 verification 전에 multimodal text/image similarity threshold 0.6을 충족해야 한다.
  • B.2 점진적 캡셔닝을 위한 Prompt Templates: Table S2는 Large Multimodal Models와 함께 Progressive Two-Stage Coherent Captioning에 사용되는 정확한 System 및 User prompt templates를 기록한다.이 templates는 시공간 text-alignment conflicts를 해결할 때 투명성과 재현성을 높이기 위해 제공된다.

C 확장 벤치마크 구현 세부 사항

벤치마크는 투명하게 문서화된 계층화 LMM 프롬프트와 시각적 근거에 기반한 MDVL 평가를 사용한다. Gemini-2.5-Flash는 전역 및 로컬 프롬프트와 짝지은 균일 샘플링 keyframe으로 네 가지 cinematic continuity 차원을 평가한다.

  • 프롬프트 구성: MDVL 프롬프트는 MuSS에서 샘플링하며, 트랙, shot 수, 장면 유형, 대화/행동 리듬, 구도, subject 구성에 걸쳐 균형을 맞추고 수동 검수를 수행한다.프롬프트 집합은 재현성을 지원하면서 다양한 벤치마크 조건을 포괄하도록 설계된다.
  • MDVL 평가: Gemini-2.5-Flash [9]는 생성된 각 sub-shot에서 균일하게 샘플링한 두 개의 keyframe으로 구성된 2×N visual grid를 사용해 네 가지 cinematic continuity 차원을 평가한다.시각적 근거에 기반한 추론을 유도하기 위해 해당 grid를 전역 narrative description 및 로컬 shot 프롬프트와 함께 제공한다.

D 구현 및 학습 세부사항

MuSS가 추가된 baseline은 EchoShot [40]을 기반으로 하며, identity prior를 주입하기 위해 latent sequence concatenation을 사용한다. 수렴에 도달하기 위해 지정된 최적화, 비디오 처리 및 연산 설정으로 학습한다.

  • 모델 구성: MuSS가 추가된 baseline은 EchoShot [40]을 기반으로 하며, identity prior 주입을 위해 latent sequence concatenation을 사용한다.
  • 최적화: 학습에는 β1 = 0.9, β2 = 0.999, weight decay = 10−4, 1×10−5 learning rate, 2,000-step linear warmup 및 총 50,000 steps를 사용하는 AdamW가 적용된다.
  • 비디오 처리: 비디오는 832 × 480 해상도와 16 fps로 처리되며, multi-shot sliding-window 방식으로 161-frame temporal context를 사용한다.
  • 연산 및 준비: 학습은 32 NVIDIA H20 GPUs에서 수행되며 수렴까지 약 3.5일이 소요되고, reference preparation에는 automated curation을 사용한다.

E 사용자 연구 세부 사항 · F 확장 데이터셋 시각화 및 한계 · F.1 데이터셋 추가 시각화

블라인드 전문가 연구는 표준화된 1–5 평가 기준으로 MuSS가 생성한 시퀀스를 영화적 기준에 따라 평가하며, 확장 시각화는 데이터셋의 장르 다양성, 시각적 충실도, 두 가지 내러티브 트랙을 보여준다.

  • E 사용자 연구 세부 사항: 최소 3년의 업계 경력을 보유한 15명의 전문 영화 제작자가 무작위로 추출된 200개의 생성 시퀀스를 블라인드 평가했다.참가자들은 생성 모델을 알지 못했다.
  • E 사용자 연구 세부 사항: 평가는 시간적 내러티브 일관성, 컷 간 시각적 연속성, 동작의 자연스러움, 전반적인 피사체 일관성을 다뤘다.
  • E 사용자 연구 세부 사항: 전문가들은 영화 수준의 연속성과 정체성 보존부터 완전한 멀티샷 실패까지를 포괄하는 엄격한 1–5 Likert 평가 기준을 사용했다.최고 평점은 전문적인 외관의 시간적 연속성, 정체성 보존, 공간적 전환을 의미하며, 최저 평점은 자의적인 피사체 변형 또는 슬라이드쇼와 같은 품질 저하를 의미한다.
  • F 확장 데이터셋 시각화 및 한계: MuSS의 확장 시각화는 복잡한 조명, 다양한 공간 배치, 역동적인 피사체 동작을 포함한 폭넓은 영화적 장르 범위를 보여준다.
  • F.1 데이터셋 추가 시각화: 시각화는 두 가지 핵심 내러티브 트랙, 즉 복잡한 영화적 내러티브와 피사체 중심 내러티브를 다룬다.이러한 트랙을 부각하기 위해 네 가지 상세 시각화를 사용한다.
  • F.1 데이터셋 추가 시각화: 복잡한 내러티브 예시는 establishing shot, over-the-shoulder shot, 멀티캐릭터 shot을 가로지르는 montage transitions와 keyframes, progressive captions, 원본 스크린샷을 보여준다.
  • F.1 데이터셋 추가 시각화: 피사체 중심 예시는 하나의 핵심 reference subject와 다양한 멀티뷰 target shot을 짝지어 샷 간 동일한 정체성을 보여준다.

F.2 한계와 향후 연구 · G 윤리적 고려사항

MuSS는 copy-paste shortcut을 줄이지만 subject extraction을 방해하는 어려운 시각적 조건에는 여전히 취약하다. 일관된 subject-driven generation은 dual-use 위험도 제기하므로, 배포 시 watermarking, logging, provenance safeguard가 필요하다.

  • F.2 한계와 향후 연구: MuSS의 curation과 auditing에서 86개의 어려운 사례가 확인되었으며, 주로 occlusion 또는 crowd(31%), viewpoint 변화 또는 extreme close-up(24%), 저조도 또는 motion blur(22%), identity switch(19%), formatting 또는 tool error(4%)로 구성된다.이러한 사례는 zero-shot subject extraction pipeline을 교란할 수 있다.
  • F.2 한계와 향후 연구: progressive captioning pipeline은 복잡한 cinematic narrative에서 정밀한 spatiotemporal text alignment를 목표로 한다.Track 1에서는 엄선된 keyframe을 progressive multi-shot caption과 짝지었다.
  • G 윤리적 고려사항: 강건한 Subject-to-Video generation은 deepfake generation과 기만적 합성의 위험을 초래한다.저자들은 공개 배포를 위해 SynthID와 같은 invisible watermarking, 종합적인 generation logging, 강건한 provenance tracking을 제안한다.
  • G 윤리적 고려사항: MuSS는 학술 연구를 목적으로 하며, 피상적 copying에 불이익을 주는 curation 및 evaluation metric을 사용해 구조적으로 근거 있고 physics-aware한 synthesis를 장려한다.그럼에도 논문은 highly consistent subject-driven generation의 dual-use 특성을 인정한다.
  • G 윤리적 고려사항: Track 2는 분리된 reference subject를 dynamic target shot 및 pixel copying이 아닌 novel-view synthesis를 강제하는 caption과 함께 구성한다.이 설계는 cross-shot variation을 통해 subject-to-video copy-paste shortcut을 해결한다.
  • G 윤리적 고려사항: Raw cinematic data에는 다양한 장르의 montage transition과 변화하는 camera angle, lighting condition, background에서 일관되게 등장하는 subject가 포함된다.이 사례들은 MuSS가 목표로 하는 구조적 일관성과 cross-shot consistency를 보여준다.
Loading 2604.23789v3…