Source-linked AI summary
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, Enze Xie
TL;DR
분 단위 카메라 제어 720p world modeling은 데이터, 학습, 추론 측면에서 여전히 비용이 크다. SANA-WM은 효율적인 오픈소스 모델을 처음부터 학습해 오픈 베이스라인보다 강한 action following, comparable visual quality, 최대 36× 높은 generation throughput을 달성한다.
문제
기존 분 단위 world model은 고비용 모델, 데이터, 학습, 추론을 요구하며, short-video distillation은 long-horizon persistence와 trajectory following에 제한적인 supervision만 제공한다.
방법
SANA-WM은 hybrid GDN–softmax long-context modeling, dual-branch camera control, progressive native minute-scale training, long-video refinement를 결합한다.
결과
SANA-WM은 comparable visual quality를 유지하면서 기존 오픈소스 베이스라인보다 강한 action following과 최대 36× 높은 generation throughput을 달성한다.
시사점 및 한계
SANA-WM은 단일 GPU에서 유망한 trajectory를 rollout하고 refinement하는 실용적인 분 단위 720p world-model 워크플로를 지원한다.
시사점 및 한계
SANA-WM은 여전히 scale에 제한이 있고, 명시적인 3D scene memory가 부족하며, dynamic scene, rare viewpoint 또는 더 긴 rollout에서 drift가 발생할 수 있다.
Abstract
from arXiv · showhide
We introduce SANA-WM, an efficient 2.6B-parameter open-source world model natively trained for one-minute generation, synthesizing high-fidelity, 720p, minute-scale videos with precise camera control. SANA-WM achieves visual quality comparable to large-scale industrial baselines such as LingBot-World and HY-WorldPlay, while significantly improving efficiency. Four core designs drive our architecture: (1) Hybrid Linear Attention combines frame-wise Gated DeltaNet (GDN) with softmax attention for memory-efficient long-context modeling. (2) Dual-Branch Camera Control ensures precise 6-DoF trajectory adherence. (3) Two-Stage Generation Pipeline applies a long-video refiner to stage-1 outputs, improving quality and consistency across sequences. (4) Robust Annotation Pipeline extracts accurate metric-scale 6-DoF camera poses from public videos to yield high-quality, spatiotemporally consistent action labels. Driven by these designs, SANA-WMdemonstrates remarkable efficiency across data, training compute, and inference hardware: it uses only $\sim$213K public video clips with metric-scale pose supervision, completes training in 15 days on 64 H100s, and generates each 60s clip on a single GPU; its distilled variant can be deployed on a single RTX 5090 with NVFP4 quantization to denoise a 60s 720p clip in 34s. On our one-minute world-model benchmark, SANA-WM demonstrates stronger action-following accuracy than prior open-source baselines and achieves comparable visual quality at $36\times$ higher throughput for scalable world modeling.
1. 서론
SANA-WM은 6-DoF 카메라 궤적으로 제어되는 1분 길이 720p 영상 생성을 위해 처음부터 학습된 2.6B 파라미터 오픈소스 world model이다. 효율적인 장기 문맥 모델링, 이중 분기 카메라 제어, 장시간 영상 정제, pose 기반 데이터 주석을 결합해 접근성과 action-following 성능을 높인다.
- 기여: SANA-WM은 2.6B 파라미터, metric-scale pose supervision이 포함된 ∼213K개의 공개 클립, 64개의 H100 GPU에서 15일간 수행한 학습을 사용해 1분 길이 영상을 네이티브하게 생성한다.양방향, chunk-causal, distilled autoregressive 단일 GPU 추론 변형을 제공한다.
- 효율적인 네이티브 1분 백본: Hybrid Linear DiT는 frame-wise Gated DeltaNet 블록과 주기적 softmax attention을 결합해 scene persistence와 장거리 recall을 지원하면서도 분 단위 문맥을 감당 가능한 비용으로 유지한다.고압축 LTX2 tokenizer [10]는 1분 길이 720p 생성에 필요한 token 부담을 줄인다.
- 이중 분기 카메라 제어: Dual-rate camera conditioning은 전역 궤적 구조를 위한 latent-rate UCPE branch [12]와 세밀한 카메라 움직임을 위한 raw-frame Plücker mixing을 결합한다.이 설계는 공격적인 영상 압축에도 불구하고 연속 궤적을 충실하게 따르는 것을 목표로 한다.
- 2단계 시각적 정제: 전용 두 번째 단계 refiner가 SANA-WM의 전체 분량 출력을 대상으로 구조적 아티팩트를 보정하고 시퀀스 전반의 세부 묘사를 선명하게 한다.refiner는 1단계 생성 이후 품질 개선 단계로 적용된다.
- 강건한 데이터 주석 및 평가 벤치마크: 강건한 주석 파이프라인은 pose 및 geometry estimator [13] [14] [15]를 사용해 공개 영상에서 metric-scale camera pose를 복원하며, 장기 카메라 제어 모델링의 학습과 평가를 가능하게 한다.필터링 후 파이프라인은 정밀한 metric-scale pose 주석이 포함된 ∼213K개의 클립을 산출하고 전용 1분 벤치마크를 지원한다.
- 결과: 비슷한 시각적 품질에서 기존 오픈소스 baseline보다 더 높은 action-following 정확도와 최대 36× higher generation throughput을 달성하며, 단일 GPU에서 1분 길이 영상을 생성한다.distilled variant는 NVFP4 quantization을 사용해 단일 RTX 5090에서 34s 만에 1분 길이 영상을 생성한다.
2. 관련 연구
관련 연구는 장시간 비디오 생성, 상호작용형 action-conditioned world model, 카메라 및 기하 인식 제어, 효율적인 long-context sequence modeling, 그리고 카메라 제어 시스템을 위한 데이터·annotation·evaluation을 아우른다.
- 장시간 비디오 생성과 상호작용형 world model: 장시간 비디오 생성은 압축된 시공간 latent 위에서 diffusion 또는 flow-transformer backbone을 사용하며, 장시간 합성에는 일반적으로 autoregressive 또는 block-wise rollout, diffusion forcing, streaming training을 활용한다.
- 장시간 비디오 생성과 상호작용형 world model: 상호작용형 world model은 비디오 생성을 키보드, gamepad, 카메라, 텍스트, 로봇 또는 혼합 제어를 사용하는 장시간 rollout action-conditioned simulation으로 확장한다.관련 연구는 재방문과 장기 일관성을 위해 명시적 memory, scene persistence, geometry-aware state도 연구하며, 여기에는 BEV 또는 occupancy 기반 driving simulator와 camera-aware memory가 포함된다.
- 카메라 제어, 기하, action space: Action-conditioned world model은 로봇 또는 embodied action, 키보드 또는 gamepad 제어, language·event·혼합 high-level command 등 다양한 interface를 사용한다.카메라 제어 생성은 novel-view synthesis 및 geometric video generation과 밀접하게 연관되며, pretrained video diffusion model에 추가된 camera-control module도 포함한다.
- 장기 시각 horizon을 위한 효율적 sequence model: Softmax attention의 memory와 compute가 context length에 따라 증가하기 때문에, 장기 시각 모델링에서는 linear, gated, state-space, convolutional, test-time-training, delta-rule sequence model을 점점 더 탐색하고 있다.Softmax attention은 여전히 효과적이며 FlashAttention [68]과 같은 kernel로 가속할 수 있다.
- 데이터, annotation, metric: 카메라 제어 world modeling은 인터넷 비디오, spatial collection, 3D capture, embodied scene, game, synthetic environment, controlled benchmark pipeline에서 수집한 신뢰할 수 있는 geometry, 다양한 motion, 장기 scene coverage를 갖춘 데이터에 의존한다.기존 연구는 shot detection과 video-quality assessment 같은 filtering 및 enhancement procedure도 적용한다.
3. 방법
SANA-WM은 점진적 학습과 네 가지 핵심 아키텍처 설계를 통해 엄격한 효율성 제약 아래에서 분 단위 고해상도 world modeling을 수행한다. 이 방법은 압축 latent modeling, hybrid recurrent-attention processing, dual-rate camera conditioning, 효율적인 chunk-causal deployment를 결합한다.
- 점진적 학습: SANA-WM은 VAE adaptation, hybrid architecture adaptation, minute-scale camera conditioning, chunk-causal distillation의 네 단계로 짧은 clip에서 분 단위 video까지 점진적으로 확장한다.파이프라인은 LTX2-VAE adaptation으로 시작해 짧은 clip에서 hybrid backbone을 안정화하고, metric 6-DoF control로 sequence length를 늘린 뒤, per-chunk softmax cost가 일정하도록 deployment를 네 번의 denoising step으로 distill한다.
- 효율적인 VAE adaptation: LTX2-VAE는 ST-DC-AE보다 2.0× smaller이고 Wan2.1-VAE보다 8.0× smaller인 representation을 제공해 training 및 inference efficiency를 높인다.기존 VAE를 교체하고 patchify layer와 final projection을 re-initialize한 뒤 50k step 동안 full-model fine-tuning을 수행한다.
- Chunk-causal deployment: Chunk-causal fine-tuning은 autoregressive rollout을 가능하게 하며, attention-sink token과 local temporal window는 rollout length에 따라 softmax memory와 per-chunk latency가 constant하게 유지되도록 한다.Reversed GDN scan은 chunk boundary에서 reset되어 leakage 없이 local future context를 제공하고, self-forcing distillation은 sampling을 네 번의 denoising step으로 줄인다.
- Hybrid GDN/Softmax Attention: Frame-wise GDN은 latent frame마다 모든 spatial token을 처리하면서 D×D recurrent state를 유지해 token-wise recurrence를 대체하며, GDN과 softmax attention을 교대로 적용해 long-video generation을 개선한다.Decay와 per-token update gate가 오래된 content를 제어하고, key scaling은 spatial-token aggregation 상황에서 transition을 안정화한다.
- Dual-Branch Camera Control: Dual-rate geometric conditioning은 global 6-DoF pose를 위한 latent-frame UCPE와 각 VAE stride 내부의 motion을 보정하는 raw-frame Plücker mixing을 결합한다.Coarse camera branch는 ray-local pose transformation과 shared frame-wise GDN gate를 사용하고, fine branch는 raw-frame pose에서 pixel-wise Plücker raymap을 계산한다.
4. 데이터 파이프라인
SANA-WM은 7개의 오픈소스 비디오 소스를 metric-scale camera pose로 재주석해 213K-clip corpus를 구축한다. 이 파이프라인은 개선된 depth 및 intrinsic optimization, synthetic trajectory augmentation, camera-aware filtering과 captioning을 결합한다.
- 소스와 pose annotation: 7개의 오픈소스 비디오 소스를 재주석해 metric-scale camera pose를 갖춘 213K-clip corpus를 구축한다.Figure 3은 구축 흐름을 요약하고, Table 1은 결과 데이터를 정리한다.
- 소스와 pose annotation: 불안정한 VIPE의 long-video depth backend를 Pi3X와 MoGe-2로 교체하고 프레임별 intrinsic optimization을 적용해 실제 환경의 비디오에서 견고한 metric-scale pose를 생성한다.Pi3X는 장시퀀스에서 일관된 depth를 제공하고, MoGe-2는 프레임별로 정확한 metric scale을 제공한다.
- 3DGS augmentation: 정적인 DL3DV 캡처를 FCGS reconstruction에 fitting하고, 알려진 intrinsics와 extrinsics로 다양한 camera path를 rendering한 뒤, DiFix3D로 artifact를 refinement해 1분 길이 비디오로 변환한다.이 절차는 rendering된 camera trajectory를 활용해 정적인 3D scene data를 확장한다.
- Filtering과 captioning: visual criterion과 field of view, focal consistency, pose smoothness, scale variation에 대한 추가 camera check를 사용해 품질이 낮거나 일관성이 없거나 cut된 장면을 제거한다.기본 visual filter는 SANA-Video [25]를 따른다.
5. 실험
SANA-WM은 60초, 4개 범주 benchmark에서 평가되며, 높은 camera-following 정확도와 선도권에 근접한 visual quality, 크게 향상된 inference efficiency를 달성한다. Ablation 결과는 이러한 성능이 hybrid GDN attention, dual camera conditioning, 안정적인 scaling 전략에서 비롯됨을 보여준다.
- Benchmark 결과: SANA-WM은 가장 뛰어난 action following 성능을 달성하며, refined RotErr 4.50°/8.34°와 CamMC 1.41/1.44를 기록한다. 또한 LingBot-World의 81.82/81.89에 근접한 80.62/81.89 VBench Overall을 달성한다.비교는 Simple-/Hard-Trajectory split을 사용하며, refined model은 480p 및 720p baseline을 모두 능가한다.
- Benchmark 결과: Refined pipeline은 74.7 GB와 22.0 videos/hour를 달성해 80 GB H100 budget 내에서 동작하며, 가장 빠른 가시적 480p baseline보다 3.7× 빠르다.Refinement를 적용하지 않은 SANA-WM은 51.1 GB를 사용하고 24.1 videos/hour에 도달하며, 분 단위 720p LingBot-World inference는 평가 예산으로 감당할 수 없다.
- Benchmark 결과: Refinement를 통해 재방문 PSNR이 14.46/14.80 dB로 향상되고 ΔIQ가 3.79/3.09에서 1.17/0.31로 감소해, Hard에서 첫 번째를 차지하고 장기 horizon drift를 제한한다.SANA-WM은 표시된 방법 중 Simple에서 두 번째, Hard에서 첫 번째를 차지하며, HY-WorldPlay는 ΔIQ 23.59/25.88로 심각한 성능 저하를 보인다.
- Progressive-training ablation: Hybrid 15-GDN/5-softmax backbone은 VBench-I2V Total을 0.853으로 높이는 반면, LTX2는 peak memory를 8.9에서 5.4 GB로 줄이고 latency를 3.4× 단축한다.Progressive-training ablation은 5 s horizon에서 동일한 data와 inference setting을 사용한다.
- Training stability and efficiency scaling: D_S scaling만이 안정적인 GDN variant이며, L2와 no-scale baseline은 각각 step 16과 1에서 NaN을 유발한다. 또한 recurrent variant는 all-softmax model의 60 s out-of-memory failure를 피한다.Matched scaling 실험은 compact recurrent/linear state를 보여주는 반면, all-softmax memory는 KV cache와 함께 증가한다.
- Camera conditioning: Dual UCPE + Plücker mixing은 competitive FVD와 함께 가장 낮은 Pi3X error를 달성하며, input-only Plücker 및 single attention-level conditioning variant를 능가한다.Ablation은 10k fine-tuning step 이후 5 s clip을 사용해 held-out OmniWorld validation에서 수행된다.
6. 결론
SANA-WM은 효율적인 모델링, camera conditioning, metric-pose annotation, long-video refinement를 결합해 6-DoF 제어가 가능한 실용적인 minute-scale 720p 생성을 구현한다. 다만 scale, scene memory, dynamic-scene drift, rare viewpoints, 더 긴 rollouts에 제약이 있어, 더 폭넓은 scaling과 강건한 control이 필요하다.
- 결론: SANA-WM은 hybrid GDN–softmax modeling, dual UCPE + Plücker conditioning, metric-pose annotation, long-video refiner를 결합해 6-DoF control이 가능한 실용적인 minute-scale 720p generation을 구현한다.이 시스템은 제한된 compute로 학습하고 single-GPU rollout을 수행하는 것을 목표로 하며, revisit가 많은 60s trajectory에 대한 실험에서 open baseline보다 더 우수한 camera following을 보인다.
- 한계, 사회적 영향, 향후 연구: SANA-WM은 scale-limited하며, 명시적인 3D scene memory가 없고 dynamic scene, rare viewpoint 또는 더 긴 rollout에서 drift가 발생할 수 있다.이러한 한계는 평가된 설정을 넘어선 robustness를 제한한다.
- 한계, 사회적 영향, 향후 연구: SANA-WM의 efficiency는 simulation, embodied AI, robotics 연구에 대한 접근성을 넓히지만, 배포 시 provenance, model scope, evaluation setting을 명확히 기록해야 한다.향후 연구로는 model과 data scaling, robot-action 또는 point-tracking control 탐색, persistent scene memory 강화, 강건한 method 개발이 있다.
A. 장시간 비디오 Refiner
장시간 비디오 refiner는 truncated-σflow matching을 사용해 noisy Stage-1 latent를 고충실도 target으로 변환하면서 reference conditioning을 통해 identity를 보존한다. 60초 시퀀스에서는 기존 short-video refiner가 지각 품질, 후반 구간 영상 품질, camera-control 정확도를 크게 저하시키므로 장시간 비디오에 대한 adaptation이 필요하다.
- Truncated-σflow matching: Truncated-σflow matching은 Gaussian-noised Stage-1 latent와 고충실도 target 사이의 interpolation을 따라 target velocity를 예측하도록 refiner를 학습한다.Noise level은 (0, σ_start]로 truncate된 shifted-logit-normal distribution에서 샘플링하며, training state는 source와 target을 잇는 segment 위에 유지된다.
- Reference conditioning: Reference conditioning은 clean target-latent slice를 고정된 key-value anchor로 앞에 붙여 identity와 appearance consistency를 보존하고, flow-matching loss에서는 reference token을 제외한다.Block-wise attention mask가 anchoring 동작을 제공한다.
- Implementation details: 경량 adaptation은 attention 및 feed-forward projection에 rank-384 LoRA를 적용하고, multi-step LTX-2 base model에서 학습한 뒤 distilled few-step model에 zero-shot merging한다.이를 통해 distilled refiner를 불안정하게 직접 finetuning하지 않으면서 distilled inference schedule을 보존한다.
- Ablation: Adapted refiner는 전체 60초 latent sequence에서 기존 LTX-2.3 short-video refiner보다 우수한 성능을 보이며, 기존 refiner는 지각 품질, 후반 구간 영상 품질, camera-control 정확도를 크게 저하시킨다.이 ablation은 동일한 Stage-1 SANA-WM latent를 사용하고 각 refiner를 전체 60초 latent sequence에 직접 적용한다.
B. 데이터 파이프라인 세부사항 · B.1. 수정된 VIPE 포즈 엔진 · B.2. 3DGS 증강 파이프라인
데이터 파이프라인은 metric-scale 인터넷 동영상 포즈 주석을 위해 VIPE를 조정하고, 제약이 있는 다양한 3DGS 렌더링 궤적으로 정적 장면을 증강한다. 또한 데이터셋별 supervision mode와 다단계 coverage 및 품질 필터링을 통해 강건성을 높인다.
- B.1. 수정된 VIPE 포즈 엔진: 수정된 VIPE는 SLAM front-end 구성요소를 유지하면서 depth 및 bundle-adjustment 단계를 교체한다 [13].Feature tracking과 keyframe selection은 유지하고, depth estimation과 bundle adjustment는 수정한다.
- B.1. 수정된 VIPE 포즈 엔진: Pi3X [14]와 MoGe-2 [15]는 Metric3D-Small을 대체하며, multi-frame 3D structure와 시간적으로 평활화된 frame별 scale estimation을 통한 metric-scale anchoring을 결합한다.Scale factor는 inverse-depth weighting과 momentum 0.99를 사용하는 exponential moving averaging을 적용한다.
- B.1. 수정된 VIPE 포즈 엔진: Frame별 bundle adjustment는 focal length와 principal point를 독립적으로 최적화하여 non-square pixel과 변화하는 focal length를 갖는 인터넷 동영상을 지원한다.Intrinsics는 frame, view, intrinsic dimension에 걸친 (N, V, D) tensor로 표현한다.
- B.1. 수정된 VIPE 포즈 엔진: 세 가지 annotation mode는 인터넷 동영상, GT-depth OmniWorld 데이터, 그리고 각 소스에 맞춘 metric-scale recovery를 적용한 GT-pose Sekai Game 및 DL3DV 데이터를 지원한다.GT-pose processing에는 Umeyama Sim(3) alignment 와 80th-percentile inlier filtering을 사용한다.
- B.2. 3DGS 증강 파이프라인: 정적 DL3DV 장면은 fitted FCGS [94] Gaussian Splats를 렌더링해 1분 동영상을 생성하고, 카메라를 관측된 capture region으로 제한하여 증강한다.파이프라인은 centroid, median radius, height range, PCA direction을 포함한 장면 및 카메라 통계를 계산한다.
- B.2. 3DGS 증강 파이프라인: 각 장면에는 40개의 trajectory가 할당된다. 10개는 training view 인근을 보간하고, 30개는 다양한 orbit, spiral, dolly, fly-through, crane, pendulum, random-walk 및 compound motion을 사용한다.Trajectory는 median camera distance로 스케일링하고, training camera 인근에 anchor를 설정하며, 적절한 경우 Gaussian centroid를 향하도록 정렬하고 coverage bound로 clamp한다.
- B.2. 3DGS 증강 파이프라인: Coverage test는 렌더링 전에 관측이 불충분한 view를 거부하고, 이후 거의 빈 clip을 제거하며, 살아남은 frame은 DiFix3D [95]로 정제한다.검사는 샘플링한 frame의 최소 70%에서 충분한 splat projection을 요구하고, empty tile이 65%를 초과하는 view를 거부하며, near-blank frame이 30%를 초과하는 clip을 폐기한다.
B.3. 데이터셋별 품질 필터 임계값 · C. 구현 세부사항 · C.1. 상세 구현 및 학습 효율
구현은 통합 품질·기하 필터링을 hybrid GDN–softmax backbone 및 communication-efficient context-parallel training과 결합한다. 정확한 recurrent-state recovery, boundary handling, fused Triton kernels가 long-sequence training을 지원하고 효율을 높인다.
- B.3. 데이터셋별 품질 필터 임계값: 통합 data-selection pipeline은 학습 전에 saturation, VMAF motion, optical-flow magnitude, DOVER quality, scene cuts를 점수화한다.긴 비디오에서는 optical flow가 처음 60s 구간에서 0.5s마다 frame pair를 샘플링하고, DOVER score는 …에 대해 평균한다.
- B.3. 데이터셋별 품질 필터 임계값: Camera geometry filtering은 horizontal 및 vertical field of view가 25°와 120° 사이여야 하며 symmetric normalized focal mismatch를 측정한다.Field of view는 frame resolution과 camera intrinsics로 계산한다.
- B.3. 데이터셋별 품질 필터 임계값: annotated per-frame scale factor의 coefficient of variation이 2.0을 초과하면 clip을 거부한다.계수는 std(s_t)/(mean(s_t) + ϵ)이다.
- B.3. 데이터셋별 품질 필터 임계값: Table 6은 데이터셋별 허용 가능한 quality-filter 범위를 요약하며, “—”는 적용하지 않은 filter를 나타낸다.범위는 [min, max]로 보고한다.
- C.1. 상세 구현 및 학습 효율: 20-block backbone은 head dimension D=112를 사용하며, layer {3, 7, 11, 15, 19}에서 15 frame-wise GDN blocks와 softmax blocks를 interleave한다.Dual UCPE + Plücker camera conditioning은 모든 block에 적용한다. softmax는 장기 spatial consistency를 고정하고 GDN은 효율적인 frame evolution을 지원한다.
- C.1. 상세 구현 및 학습 효율: Context-parallel training은 961-frame latent sequence를 P개 GPU에 shard하며, 각 rank는 compact GDN transition 및 input composite를 계산한다.각 shard는 할당된 frame interval을 담당하고 모든 GPU에 전체 sequence를 복제하지 않는다.
- C.1. 상세 구현 및 학습 효율: All-gather한 composite summary를 exclusive prefix로 구성해 각 rank의 수학적으로 정확한 initial GDN state를 최소한의 communication overhead로 복원한다.이는 full activation 대신 compact summary를 통신한다.
- C.1. 상세 구현 및 학습 효율: Fused OpenAI Triton kernel은 normalization, activation, scaling, positional preparation, recurrent scanning을 결합해 약 1.5×에서 2×의 efficiency gain을 달성한다.Halo exchange는 convolutional boundary context를 제공하고 unsharded computation과의 동등성을 보존하며, 해당되는 경우 global boundary에서 causal zero-padding을 적용한다.
C.2. Training Hyperparameters … D.2. Benchmark Examples
SANA-WM의 학습은 64개의 H100 GPU에서 약 15일이 필요한 progressive DiT 파이프라인을 사용하며, benchmark에서는 다양한 장면과 제어된 카메라 궤적을 대상으로 첫 프레임 조건부 생성을 평가한다. benchmark에는 장면 규모 motion 제약, collision 검사, 재현성 메타데이터, 그리고 네 가지 장면 범주를 아우르는 대표 예시가 포함된다.
- C.2. Training Hyperparameters: 주요 DiT 학습 단계에는 64개의 H100 GPU에서 15일이 필요하며, 이에 앞서 64개의 H100 GPU에서 LTX2 VAE adaptation에 약 3.5일이 소요된다.minute-scale 학습에서는 미리 계산한 VAE latent가 온라인 VAE encoding 비용을 제거한다.
- C.2. Training Hyperparameters: 모든 학습 단계에서 AdamW, BF16 mixed precision, 그리고 0.5로 설정한 gradient clipping을 사용한다.
- D. Benchmark Details: benchmark는 game-style, indoor, outdoor-city, outdoor-nature 장면에 균형 있게 배분된 80개의 1280×720 첫 프레임 이미지로 시작한다.각 장면에는 layout, material, lighting, autonomous world dynamics를 설명하되 카메라 motion 관련 표현은 포함하지 않는 scene-static first-person prompt를 부여한다.
- D.1. Benchmark Construction: 두 trajectory split은 Simple의 10개 smooth navigation template과 Hard의 10개 stress-test template으로 카메라 제어를 평가한다.template에는 waypoint로 정의된 arc, S-curve, backtracking, figure-eight return, 큰 yaw 변화, vertical motion, extreme pitch, whip-pan, loop, crane과 유사한 이동이 포함된다.
- D.1. Benchmark Construction: 카메라 궤적은 Pi3X [14]의 intrinsics, metric depth, point cloud를 사용해 각 장면에 맞게 조정하며, 이동 거리는 median depth의 60%, 속도는 0.4 m/s로 제한한다.benchmark는 이러한 추정치를 장면 규모 motion과 경계 확인에 사용하며, collision이 발생하면 속도를 낮추고 궤적을 재생성한다.
- D.2. Benchmark Examples: Figure 9는 네 가지 장면 범주에 걸친 대표적인 첫 프레임 conditioning 이미지를 제시하며, geometry, lighting, visual style, fine-grained scene detail의 다양성을 보여준다.
D.3. 평가 프로토콜 … E.2. Progressive-training ablation: VBench-I2V 차원별 분석
평가 프로토콜은 비디오 샘플링, camera-control 입력, visual-quality 및 camera metric, revisit memory, minute-long temporal degradation을 표준화한다. 추가 결과에서는 경쟁력 있는 loop-closure memory, refinement에 따른 장기 시야 drift 감소, 효율성과 일관성 효과를 분리해 확인하는 차원별 ablation을 보인다.
- D.3. 평가 프로토콜: 모든 방법은 split별 프로토콜에 따라 장면당 생성 비디오 하나를 사용하며, timestamp-remapped frame sampling과 궤적에서 유도한 공통 camera-control 입력을 적용한다.서로 다른 native frame rate를 수용하면서 discrete action, pose track, camera-control tensor, calibrated intrinsic의 일관성을 유지한다.
- D.3. 평가 프로토콜: 시각 품질은 여덟 개의 유효 차원과 집계된 VBench Overall score를 대상으로 custom-input VBench로 평가한다.보고하는 차원에는 subject 및 background consistency, temporal flickering, motion smoothness, aesthetic 및 imaging quality, dynamic degree, overall consistency가 포함된다.
- D.3. 평가 프로토콜: 카메라 정확도는 Umeyama Sim(3)을 사용해 benchmark trajectory에 정렬한 Pi3X pose recovery로 측정하며, rotation 및 translation error를 보고한다. 값이 낮을수록 더 좋다.Ground-truth trajectory와 recovered trajectory는 평가 비디오와 일관된 방식으로 상대화하고 샘플링한다.
- D.3. 평가 프로토콜: benchmark에는 Simple 및 Hard trajectory template이 포함되며, Hard split은 60초 height profile 전반에 vertical motion, loop closure, pitch 중심 viewpoint를 추가한다.이 template은 ground-plane projection만으로는 포착할 수 없는 out-of-plane motion을 드러낸다.
- D.3. 평가 프로토콜: Revisit memory는 장면당 최대 다섯 개의 가장 가까운 거의 동일한 viewpoint의 frame pair를 PSNR, SSIM, LPIPS로 비교하고, 유효한 pair와 scene에 대해 평균을 낸다.더 높은 PSNR/SSIM과 더 낮은 LPIPS는 loop closure 상황에서 더 우수한 scene memory를 의미한다.
- E.1. Revisit memory와 temporal stability (full table): SANA-WM은 720p loop-closure memory에서 여전히 경쟁력을 유지하며, second-stage refiner는 특히 Hard-Trajectory split에서 minute-long visual drift를 일관되게 줄인다.Revisit metric은 인접한 재방문 viewpoint에서 scene identity를 평가하는 반면, ΔIQ는 후반 window의 imaging-quality degradation을 측정한다.
- E.2. Progressive-training ablation: VBench-I2V 차원별 분석: 차원별 VBench-I2V 분석은 세 개의 I2V-specific axis와 여섯 개의 일반 video-quality axis를 분리해 보여주며, LTX2 VAE swap이 quality를 유지하면서 efficiency를 개선하고 hybrid backbone이 장거리 consistency와 I2V 차원을 향상시킨다는 점을 드러낸다.이 분석은 집계된 score를 camera motion, subject, background, consistency, smoothness, dynamic degree, aesthetic quality, imaging quality로 확장한다.
E.3. 추가 정성적 결과 … G. 기존 자산 및 도구 이용 조건
추가 정성적 결과는 SANA-WM이 수분 길이의 카메라 제어 rollout 동안 layout, object identity, 일관된 3D 단서를 보존하며, 효율성이 world modeling에 대한 접근성을 넓힌다는 점을 보여준다. 또한 논문은 deployment risks, provenance 및 licensing transparency, 그리고 데이터와 도구 범위에서 비롯되는 한계를 강조한다.
- E.4. 3D Reconstruction Visualization: Pi3X [14]에서 복원한 구조와 camera path는 Nano Banana Pro 의 첫 frame으로 생성한 SANA-WM 영상에서 coherent 3D cues를 보여준다.Figure 12는 3개의 60-second benchmark rollout을 사용해 frame-wise image quality를 넘어선 평가를 수행한다.
- F. Broader Impact: SANA-WM은 1분 720p rollout에 필요한 training corpus, training compute, inference hardware를 줄여 academic 및 소규모 research group의 진입 장벽을 낮춘다.예정된 application에는 simulation, embodied AI, robotics research, interactive content prototyping이 포함된다.
- F. Broader Impact: 생성된 영상은 실제 관측으로 오인될 수 있으며, safety-critical robotics, autonomous-driving 또는 physical-planning 환경에서는 simulated rollout이 충실한 예측으로 과도하게 해석될 수 있다.논문은 provenance documentation을 중요한 safeguard로 제시한다.
- F. Broader Impact: 모델이 data와 tool에서 비롯된 bias와 coverage limit을 물려받기 때문에, 성능이 culture, environment, rare viewpoint 또는 민감한 human-centered scene 전반에 균일하게 transfer되지 않을 수 있다.이러한 한계는 public video source, generated benchmark image, filtering 또는 captioning system에서 비롯된다.
- G. Existing Assets and Tool Terms: 저자들은 data construction, annotation, evaluation 및 refinement에 사용한 existing asset과 external tool의 public license 또는 terms status를 기록한다.이들은 original project를 인용하고 release term을 따르며, benchmark image와 prompt를 별도로 공개된 dataset이 아니라 internal evaluation input으로 취급한다.
- E.3. 추가 정성적 결과: SANA-WM은 수분 길이의 Hard-Trajectory rollout 전반에서 global layout과 object identity를 더 잘 보존하는 반면, baseline은 세부 정보를 흐리게 하거나 장면 구조를 바꾸거나 약한 motion으로 수렴한다.이 예시들은 별도의 evaluation protocol을 도입하기보다 aggregate pose, VBench, revisit-memory 결과를 보완한다.