Source-linked AI summary

MOVA: Towards Scalable and Synchronized Video-Audio Generation

SII-OpenMOSS Team, :, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zhang, Yuerong Song, Zhe Xu, Zhiyu Zhang, Chenchen Yang, Cheng Chang, Chushu Zhou, Hanfu Chen, Hongnan Ma, Jiaxi Li, Jingqi Tong, Junxi Liu, Ke Chen, Shimin Li, Shiqi Jiang, Songlin Wang, Wei Jiang, Zhaoye Fei, Zhiyuan Ning, Chunguo Li, Chenhui Li, Ziwei He, Zengfeng Huang, Xie Chen, Xipeng Qiu

arXiv:2602.08794v2cs.CVcs.SD

TL;DR

공동 video-audio 생성은 modality가 분리된 pipeline과 proprietary system의 제약을 여전히 받는다. MOVA는 video와 audio tower를 양방향 cross-modal interaction으로 결합하며, 규모를 키울수록 synchronization이 향상되고 특히 lip-synced speech에서 두드러진다.

  • 문제

    Video-audio generation은 cascaded pipeline에 cross-modal interaction이 없고, 주요 synchronized system이 closed-source이기 때문에 아직 충분히 탐구되지 않았다.

  • 방법

    MOVA는 bidirectional cross-attention을 적용한 비대칭 pretrained video 및 audio tower를 사용해 synchronized video-audio latent를 생성한다.

  • 결과

    Video capacity와 training data를 확장하면 synchronization이 상당히 향상되며, 특히 lip synchronization에서 두드러진다. 반면 더 작은 model은 성능 포화 양상을 보인다.

  • 시사점 및 한계

    공동 video-audio generation은 model capacity와 정렬된 training data를 확장할 때 이점을 얻으며, 특히 세밀한 speech synchronization에서 그렇다.

  • 시사점 및 한계

    제한된 audio-tower capacity는 singing, 복잡한 sound texture, music 및 instrumental content에서 성능을 저하시킨다.

Abstract

from arXiv · show

Audio is indispensable for real-world video, yet generation models have largely overlooked audio components. Current approaches to producing audio-visual content often rely on cascaded pipelines, which increase cost, accumulate errors, and degrade overall quality. While systems such as Veo 3 and Sora 2 emphasize the value of simultaneous generation, joint multimodal modeling introduces unique challenges in architecture, data, and training. Moreover, the closed-source nature of existing systems limits progress in the field. In this work, we introduce MOVA (MOSS Video and Audio), an open-source model capable of generating high-quality, synchronized audio-visual content, including realistic lip-synced speech, environment-aware sound effects, and content-aligned music. MOVA employs a Mixture-of-Experts (MoE) architecture, with a total of 32B parameters, of which 18B are active during inference. It supports IT2VA (Image-Text to Video-Audio) generation task. By releasing the model weights and code, we aim to advance research and foster a vibrant community of creators. The released codebase features comprehensive support for efficient inference, LoRA fine-tuning, and prompt enhancement.

1 서론

MOVA는 동기화된 joint modeling을 통해 cascade 방식의, 대체로 closed-source인 video-audio generation의 한계를 해결한다. 비대칭 dual-tower architecture, 확장 가능한 bimodal data construction, modality 간 동기화를 향상하는 training을 결합한다.

  • 동기: 캐스케이드 파이프라인은 오디오와 비디오를 모달리티 간 상호작용 없이 별도로 합성하기 때문에 품질에 한계가 있으며, 선도적인 end-to-end 시스템도 여전히 비공개다 [11–16].이로 인해 고품질 비디오-오디오 생성은 연구 커뮤니티에서 상대적으로 충분히 탐구되지 않았다.
  • 과제: Video-audio generation은 세 가지 challenge를 제기한다: fine-grained audio-video data construction, 상호 정보를 제공하는 modality fusion, 그리고 modality 간 서로 다른 native information density다.이러한 challenge로 인해 simultaneous bimodal generation은 video-only generation보다 어렵다.
  • 기여: MOVA는 multilingual lip-synced speech와 정밀하게 정렬된 environmental sounds를 포함하는 synchronized video-audio generation을 목표로 한다.또한 English 및 Chinese multi-speaker speech, physical sound effects, scene text, 16:9 또는 9:16 format을 포함한 다양한 scenario에서 synchronized generation을 지원한다.
  • Architecture: MOVA는 modality fusion을 위한 bidirectional cross-attention을 갖춘 asymmetric dual-tower architecture를 통해 pretrained video 및 audio generator를 결합한다.이 구조는 A14B video DiT, 1.3B audio DiT, 2.6B bidirectional Bridge module을 결합한다.
  • Data 및 Training: MOVA는 fine-grained audio-video captioning pipeline을 사용해 대규모로 고품질 bimodal training data를 생성한다.Video-audio training을 확장하면 두 modality 전반에서 synchronization performance가 지속적으로 향상된다.

2 모델 아키텍처

MOVA는 modality-specific latent space에서 temporal alignment된 video–audio pair를 공동 생성하며, bidirectional hidden-state exchange를 통해 pretrained video 및 audio diffusion backbone을 결합한다. Aligned positional encoding은 video와 audio token을 shared temporal scale에 배치하고, flow matching은 synchronized cross-modal dynamics를 학습한다.

  • Latent Representation: MOVA는 pretrained Wan2.1 및 DAC-style audio VAE를 사용해 video와 48 kHz mono audio를 compact latent representations로 압축한다.이후의 모든 module은 이러한 latent space에서 동작한다.
  • Training Objective: Training은 text와 선택적으로 input image를 조건으로 하는 cross-modal velocity field를 회귀하도록 flow matching을 사용하며, video와 audio에 별도의 loss weight를 둔다.이 objective는 λ_v와 λ_a를 통해 video- 및 audio-velocity regression의 균형을 맞춘다.
  • Backbones and Bridge: Architecture는 Wan2.2 I2V A14B 와 1.3B text-to-audio diffusion backbone을 lightweight dual-tower Bridge로 결합한다.Bridge는 pretrained backbone을 보존하면서 bidirectional information exchange를 가능하게 한다.
  • Backbones and Bridge: 각 interaction layer에서 cross-attention은 video hidden state를 audio DiT에 주입하고 audio hidden state를 video DiT에 주입한다.이 hidden-state-level coupling은 두 DiT backbone 사이에서 양방향으로 정보를 교환한다.
  • Aligned RoPE: Aligned RoPE는 video와 audio latent position을 shared temporal scale에 매핑해 cross-attention이 물리적 시간이 일치하지 않는 token끼리 pairing하는 것을 방지한다.Video index는 s = f_a/f_v로 scaling되며, 여기서 f_v와 f_a는 VAE 이후의 latent frame rate다.

3 데이터 엔지니어링

MOVA는 이질적인 원시 비디오를 길이가 고정되고 품질이 높으며 동기화된 일관된 멀티모달 캡션 클립으로 변환하는 3단계 데이터 큐레이션 파이프라인을 구축한다. 이 과정은 전처리, 품질 및 정렬 필터링, 비디오·오디오별 주석 처리와 뒤이은 크로스모달 캡션 병합으로 구성된다.

  • 데이터 큐레이션 개요: 3단계 파이프라인은 원시 비디오를 단계적으로 전처리하고, 오디오·비디오·시청각 품질을 기준으로 필터링하며, 선별된 클립에 일관된 멀티모달 캡션을 주석으로 부여한다.각 단계는 길이가 고정된 클립을 생성하고, 품질이 낮은 샘플을 제거하며, 강한 시청각 일관성과 의미적 라벨을 보존한다.
  • 비디오 전처리: 파이프라인은 VAD와 장면 전환을 사용해 음성/비음성 및 단일-/다중-장면 세그먼트를 생성하고, 비디오를 720p, 24fps, 8.05초 클립으로 표준화한다.각 세그먼트는 193개 프레임으로 구성되며, 진행 중인 음성이 잘리지 않도록 음성 경계를 조정한다.
  • 데이터 수집: 큐레이션된 코퍼스는 필터링된 공개 데이터셋 [26] [27] [28] [29] [30] [31] [32]과 교육, 스포츠, 뷰티, 뉴스, 애니메이션 등의 도메인을 아우르는 자체 수집 데이터로 구성된다.이러한 다양성은 복잡한 실제 시나리오 전반에서의 일반화를 지원하기 위한 것이다.
  • 데이터 필터링: 품질 필터링은 클립을 보존하기 전에 오디오 품질, 비디오 품질, 시간적 동기화, 의미적 시청각 정렬을 평가한다.Audiobox-aesthetics, DOVER, SynchFormer, ImageBind가 각각 이러한 차원을 평가한다.
  • 멀티모달 주석: 비디오와 오디오는 서로 다른 파이프라인을 통해 주석 처리되며, 비디오에는 MiMo-VL-7B-RL, 음성 및 비음성 오디오에는 Qwen3-Omni 모델 [40], 크로스모달 캡션 병합에는 GPT-OSS-120B [41]를 사용한다.캡션 병합은 시각-오디오 일관성을 확인하고 모달리티 간 잠재적 충돌을 해결한다.

4 학습 전략

MOVA는 단계적 audio 사전학습 후 synchronous end-to-end video-audio joint training을 수행하며, frozen VAE와 양방향 Bridge cross-attention으로 두 tower를 연결한다. 3단계 curriculum, modality-specific noise schedule, heterogeneous learning rate로 확장 가능한 학습과 audio-video 정렬을 지원한다.

  • 학습 파이프라인: 학습은 두 단계로 진행된다. 먼저 1.3B text-to-audio DiT를 music, general sound, speech 데이터로 사전학습한 뒤 A14B video tower와 joint training한다.Video tower와 video VAE는 Wan2.2 에서, audio VAE는 HunyuanVideo-Foley [21]에서 초기화하며, 두 VAE 모두 frozen 상태로 유지한다. Bridge cross-attention이 두 tower를 연결한다.
  • Audio tower 사전학습: Audio tower는 Wan2.1-1.3B architecture를 재사용하되 3D positional encoding을 temporal 1D encoding으로 대체하고, 나머지 component와 depth는 유지한다.학습 데이터는 WavCaps와 VGGSound [26] [42], JamendoMaxCaps [43], 자체 구축 TTS로 구성되며, duration을 제어한 fixed-length clip을 사용한다.
  • Audio tower 평가: 10.54 IS는 AudioLDM2 (7.79)를 상회하며, FD openl3는 AudioLDM2 (72.04)와 TangoFLUX (80.47)에 비해 72.25를 기록하고, KL passt는 1.66 대비 1.47이다.AudioCaps에서 CLAP는 0.463을 유지한다. Table 2에 benchmark metric과 model setting이 보고되어 있다.
  • Audio tower 평가: CU = 5.56과 PQ = 6.20은 AudioBox에서 가장 우수한 결과이지만, CE 또는 PC에서는 선두를 차지하지 못한다.이 결과는 AudioLDM2와 Tango2 를 포함한 최신 baseline을 능가한다.
  • 최적화 전략: End-to-end optimization은 첫 단계부터 Bridge와 두 tower를 모두 업데이트하며, alignment와 tower stability의 균형을 위해 η_br = 2 × 10^-5와 η_b = 1 × 10^-5를 사용한다.2단계 warm-start는 초기에 plateau에 도달한 반면, learning rate의 2배 차이는 Bridge 수렴을 가속하고 pretrained tower에서의 forgetting을 줄인다.

5 추론

MOVA는 dual classifier-free guidance를 사용해 텍스트 충실도와 cross-modal 정렬을 독립적으로 제어하며, 다단계 prompt enhancement workflow를 통해 이미지 또는 텍스트에서 시각적으로 grounded된 video-audio 생성을 개선한다.

  • Dual Classifier-Free Guidance: Dual CFG는 텍스트 조건과 Bridge 기반 cross-modal 조건의 스케일을 독립적으로 조절해, 원칙적으로 Bayes에서 유도된 formulation을 통해 정렬–품질 trade-off를 유연하게 제어한다 [57].일반적인 formulation은 step당 세 번의 function evaluation을 사용하며 (NFE=3), 두 branch 특수 사례에서는 NFE=2를 사용한다.
  • Dual Classifier-Free Guidance: Text-only CFG는 ImageBind scores와 같은 높은 semantic fidelity를 제공하지만, temporal synchronization이 약하고 DeSync가 더 높다.두 branch 모두에서 Bridge를 활성화하며 NFE=2를 사용한다.
  • Dual Classifier-Free Guidance: Text + modality CFG는 unconditional branch에서 Bridge injection을 비활성화해 더 낮은 DeSync와 더 나은 lip-sync를 포함한 강한 synchronization을 생성한다.이 두 branch scheme 역시 NFE=2를 사용하며 cross-modal alignment signal을 분리한다.
  • Prompt Enhancement Workflow: MOVA는 visual grounding과 narrative synthesis를 통해 user input을 보강하고, reference frame의 style, lighting, cinematography, visual priors를 보존한다.Qwen3-VL [58]은 style, cinematography, visual elements, exact OCR text를 포괄하는 구조화된 description을 추출하며, Gemini 2.5 Pro 와 같은 LLM은 in-context learning [60]을 사용해 generation prompt를 합성한다.
  • Prompt Enhancement Workflow: 최종 generator는 합성된 prompt와 initial frame을 dual conditioning으로 사용하며, 정보가 없는 white image를 통해 text-to-video-audio generation을 수행한다.이 workflow는 Figure 5에 제시되어 있으며, text prompt에서 zero-shot video-audio synthesis를 지원한다.

6 평가

MOVA는 오디오 품질, 모달 간 정렬, 시간적 일관성, 립싱크의 객관적 평가와 사용자 선호도 연구를 통해 광범위한 비디오–오디오 벤치마크 및 전용 벤치마크에서 평가된다. 이러한 평가 전반에서 MOVA는 오디오 품질, 동기화, 립싱크, 화자 귀속, 해상도 강건성, 사용자 선호도에서 우수한 성능을 보이며, dual CFG는 정렬 관련 metric을 향상한다.

  • 오디오 충실도 및 음성 품질: MOVA-360p는 IS 4.269와 DNSMOS 3.797이라는 state-of-the-art 성능을 달성해 오디오 충실도와 음성 품질에서 LTX-2 및 Ovi를 능가한다.Cascaded WAN2.1 + MMAudio baseline은 IS 4.036에 도달하지만 알아들을 수 있는 음성을 생성하지 못하는 반면, MOVA는 720p에서도 자연스럽고 명확한 음성을 유지한다.
  • 오디오-비주얼 정렬: MOVA-360p에 dual CFG를 적용하면 DeSync 0.351과 IB-Score 0.315에 도달해 LTX-2 및 Ovi를 능가하며, cascaded pipeline의 DeSync 0.260에도 거의 근접한다.이는 unified architecture에서 dual CFG가 시각적 맥락에 대한 청각 이벤트 결속을 강화함을 보여준다.
  • 립싱크 정밀도 및 다중 화자 귀속: MOVA-360p에 dual CFG를 적용하면 최상의 LSE-D 7.004와 LSE-C 7.800을 달성하며, MOVA-720p는 LTX-2의 0.220 및 Ovi의 0.436에 비해 cpCER 0.149를 기록한다.이는 다중 인물 장면에서 세밀한 립싱크와 화자 정체성 일관성이 우수함을 보여준다.
  • 고해상도로의 확장: MOVA-720p는 DeSync 0.485와 IB-Score 0.277을 유지하며, MOVA-360p의 0.475와 0.286에 비해 해상도 확장 시 성능 저하가 제한적임을 보인다.비교 결과는 Table 4에 요약되어 있다.
  • Dual Classifier-Free Guidance의 효과: dual CFG를 1.0에서 4.0으로 높이면 정렬 metric이 일관되게 향상되며, LSE-C는 7.891에서 정점을 이루고 DeSync는 0.365까지 감소한다.이러한 변화 과정에서는 Table 5에 보고된 것처럼 DeSync와 LSE-D가 낮아지고 IB-Score와 LSE-C가 높아진다.
  • 주관적 비교, Ablation 및 창발적 T2VA Capability: MOVA는 ELO rating of 1113.8을 기록하고 50% 이상의 승률을 달성하며, Ovi 및 WAN + MMAudio를 상대로는 70%를 넘는다. MOVA의 T2VA variant는 IS 4.370과 DeSync 0.441에 도달한다.내부 ablation에서 prompt refinement는 MOVA-720p의 ELO를 982.9에서 1025.3으로 높이는 반면, dual CFG는 상대적으로 약한 text guidance로 인해 선호도를 소폭 낮출 수 있다.

7 논의

논의에서는 동기화된 오디오-비주얼 생성에서 conditioning 방향과 diffusion schedule 간의 긴장을 규명하고, 채택한 dual-CFG 순서가 실용적으로 유용한 이유를 설명하며, audio capacity, multi-speaker synchronization, computational scaling의 한계를 강조한다.

  • Conditioning 긴장: 이산적인 event-driven 장면에서는 시각적 사건이 많은 sound event의 시간과 위치를 고정하므로 Video→Audio conditioning이 자연스럽게 선호된다.이 절에서는 충돌, 충격, 장면 전환, 타악기 제스처를 명확한 시간적 시작점을 지닌 시각 주도 사건의 예로 제시한다.
  • Conditioning 긴장: 고정된 audio 및 video noise schedule은 audio corruption이 설계상 고정되는 반면 visual uncertainty는 장면 내용에 따라 달라지므로 diffusion-conditioning 긴장을 만든다.σ_v(t_v)와 σ_a(t_a) schedule은 사전 정의되어 학습되지 않는 반면, 유효한 visual uncertainty는 object scale과 visual dominance에 따라 변할 수 있다.
  • Dual-CFG 설계: 채택한 dual-CFG 순서는 s_B=1일 때 standard text-only CFG로 환원되고, sampling을 변경하지 않은 채 text-only guidance와 text-plus-modality guidance 사이를 보간한다.이 순서는 먼저 c_B를 통해 cross-modal information을 활성화한 다음 c_T를 통해 text guidance를 적용하며, 고정된 cross-modal injection을 유지한다.
  • 한계: 주요 한계로는 singing, 복잡한 texture와 music에 대한 취약한 modeling, 불안정한 multi-speaker attribution, 그리고 sequence length에 따른 높은 compute 및 latency 비용이 있다.Wan2.1-1.3B audio backbone은 음향적으로 풍부한 신호를 제한하고, annotation error는 multi-speaker synchronization 실패를 누적시키며, 720p 8 s clip은 약 1.6 × 10^5 tokens를 생성한다.

8 관련 연구

기존 연구는 확장 가능한 video 및 audio generation을 발전시켜 왔지만, 대부분의 시스템은 video-only이거나 cascaded pipeline에 의존한다. Joint audio-video model은 end-to-end architecture를 통해 이러한 한계를 해결하지만, 기존 접근법은 불안정성이나 제한적인 sound coverage에 직면한다.

  • Video Generation: Diffusion transformer [1] [68]는 대규모 video synthesis를 지원하며, Wan 과 HunyuanVideo [69] 같은 open model은 준실사 수준의 출력을 달성한다.최근 확장은 long-horizon generation [73], controllable camera motion [74], 1080p 초과 해상도를 목표로 하지만, 대부분의 text-to-video system은 audio를 제외한다.
  • Audio Generation and Cascaded Pipelines: Latent diffusion은 확장 가능한 text-to-audio generation [50] [75]을 가능하게 하며, audiovisual content creation에서는 cascaded video-to-audio pipeline [24] [78] [79]이 여전히 널리 사용된다.Audio VAE는 compact latent representation을 사용한다. DAC [76]는 residual vector quantization을 적용하는 반면, Stable Audio [77]는 spectral loss를 사용하는 stereo variational autoencoder를 사용한다.
  • Joint Audio-Video Generation: End-to-end joint generation [17] [18] [19] [20] [81]은 cascaded 방식의 한계를 극복하고자 하지만, 기존 방법은 adversarial training의 불안정성에 직면하거나 ambient sound로 제한된다.MMDisCo [83]는 discriminator-guided cooperative diffusion을 사용하며, MM-Diffusion 와 JavisDiT [81]는 dual-stream cross-modal attention을 사용하지만 ambient sound로 제한된다.

9 결론

MOVA는 동기화된 joint video–audio generation을 위한 개방형 확장 가능 framework로, dual-tower architecture와 bidirectional bridge, Aligned RoPE를 결합한다. 데이터, modeling, scaling 과제를 다루는 동시에 실용적인 대규모 training 최적화와 향후 open release 계획을 제시한다.

  • Model 및 architecture: MOVA는 32B-parameter model과 18B active parameters를 결합하고, 비대칭 video·audio tower, 2.6B bidirectional bridge, 세밀한 temporal interaction을 위한 Aligned RoPE를 사용한다.Architecture는 A14B video backbone과 1.3B audio backbone을 포함한다.
  • Data 및 training: MOVA는 100,000시간이 넘는 세밀한 audio–visual data를 선별하고, decoupled timestep sampling을 포함해 안정적인 대규모 multimodal diffusion을 위한 training 설계를 도입한다.데이터에는 visual content에 맞춰 정렬된 sound, music, speech annotation이 포함되며, decoupled timestep sampling을 통해 modality-specific noise schedule을 적용한다.
  • Systems 최적화: Context Parallelism, FSDP2 strategy, scheduled garbage collection을 적용한 안정적인 1024-GPU training에서 Approximately 35% MFU를 달성했다.이러한 system 최적화는 실용적인 대규모 training 효율을 목표로 한다.
  • Release 및 영향: 저자들은 동기화된 audio–video generation 연구를 위한 open baseline으로 MOVA의 model weights, training code, inference pipelines를 공개할 계획이다.이번 release는 향후 연구와 community development를 지원하는 것을 목표로 한다.

부록 … A.6 벤치마크 세부 사항

부록에서는 재현 가능한 학습 및 벤치마킹 설정, speech-window 알고리즘, 필터링 로직, 멀티모달 캡션 프롬프트, joint video–audio generation을 위한 벤치마크 시나리오를 정리한다. 또한 visual, audio, speech, integrated caption에 걸친 구현 예시를 제공한다.

  • A.1 학습 Hyperparameter: Table 7은 parallelism, learning rate, noise schedule, data curation, 그리고 data-parallel replicate size 64를 포함한 3단계 학습 설정과 1024-GPU 배포를 명시한다.이 세부 사항은 재현성을 위해 제공된다.
  • A.2 Ascend 910A2 Benchmark 세부 사항: Ascend 910A2 부록은 CP=4 및 DP-shard=2인 8-device microbenchmark를 보고하며, step time은 software와 distributed-training stack에 따라 달라진다고 주의한다.이 benchmark는 대규모 학습 비용의 완전한 추정치로 제시된 것이 아니다.
  • A.3 Multi-shot 및 Single-shot Speech Window Generation: Multi-shot 및 single-shot speech-window generation은 VAD segment, scene boundary, 그리고 overlap과 부자연스러운 scene transition을 피하도록 제한된 고정 8.05-second window를 사용한다.Multi-shot은 speech segment를 따라 진행하는 반면, single-shot은 하나의 scene 안에 완전히 포함되는 연속 scene interval을 탐색한다.
  • A.4 세부 Filtering Threshold: Data-quality filtering은 audio quality, video quality, audio-visual alignment 전반에 threshold를 적용하며, corpus quality와 diversity의 균형을 위해 threshold를 경험적으로 선택한다.Alignment는 IB-Score ≥0.2 또는 DeSync ≤0.5를 만족하는 video를 보존하며, speech subset은 positive EAT-contained-Speech 및 EAT-contained-Singing classification을 요구한다.
  • A.5 Audio-visual Captioning 세부 사항: Annotation pipeline은 GPT-OSS-120B [41] consistency checking 및 caption merging에 앞서 visual captioning, speech transcription, non-speech audio captioning을 분리한다.Video captioning에는 MiMo-VL-7B-RL, speech transcription에는 Qwen3-Omni-Instruct [40], non-speech sound에는 Qwen3-Omni-Captioner [40]를 사용한다.
  • Visual Description Prompt / Speech Transcription Prompt / Merge Caption Prompt: Caption prompt는 시각적으로 검증 가능한 설명, 정확한 speech transcription, 그리고 visual context, dialogue, speaker dynamics, music, ambience 및 기타 non-speech audio의 일관된 통합을 강제한다.Visual prompt는 audio 기반 추론을 금지하고, speech prompt는 원래 언어를 보존하며 speech가 없을 때 null로 표시한다. Merge prompt는 반복을 피하고 빈 field를 생략한다.
  • Visual Description / Audio Description / Speech Description / Integrated Caption: Caption 예시는 별도의 sound, music, video description을 total caption으로 결합하며, HP printer 장면, 전문 남성 narration, background electronic music, 갑자기 끊긴 advertisement excerpt로 이를 보여준다.통합 예시는 visual cartridge insertion, verbatim speech, synchronized multimodal context를 포함한다.
Loading 2602.08794v2…