Source-linked AI summary
PhyCo: Learning Controllable Physical Priors for Generative Motion
Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker
TL;DR
Video diffusion model은 사실적인 외형을 합성하지만 물리적 일관성을 자주 위반하고 물리적 속성을 제어 가능하게 변화시키는 데 한계가 있다. PhyCo는 물리적으로 근거 있는 simulation data, 명시적 property conditioning, VLM-guided reward optimization을 결합해 제어 가능하고 물리적으로 일관된 motion을 생성한다. 보지 못한 material, force, interaction을 포함해 physical realism과 controllable variation에서 기존 model을 능가한다.
문제
Video diffusion model은 사실적인 외형을 합성할 수 있지만 여전히 physical laws를 위반하고 물리적 속성을 제어 가능하게 변화시키는 데 어려움을 겪는다.
방법
PhyCo는 100K-video 규모의 물리적으로 근거 있는 dataset, physics-supervised ControlNet fine-tuning, VLM-guided reward optimization을 결합해 연속적인 물리 속성 제어를 제공한다.
결과
PhyCo는 physical realism과 controllable variation에서 기존 video model을 일관되게 능가하며, 보지 못한 material, force, interaction으로 일반화된다.
시사점 및 한계
PhyCo는 synthetic training data를 넘어 일반화되는 제어 가능하고 물리적으로 일관된 generative video model을 향한 확장 가능한 경로를 제시한다.
시사점 및 한계
Simulation은 물리적 속성이 시각적으로 모호하지 않도록 설계되어야 하며, pretrained diffusion model의 competence range 안에 머물러야 한다.
Abstract
from arXiv · showhide
Modern video diffusion models excel at appearance synthesis but still struggle with physical consistency: objects drift, collisions lack realistic rebound, and material responses seldom match their underlying properties. We present PhyCo, a framework that introduces continuous, interpretable, and physically grounded control into video generation. Our approach integrates three key components: (i) a large-scale dataset of over 100K photorealistic simulation videos where friction, restitution, deformation, and force are systematically varied across diverse scenarios; (ii) physics-supervised fine-tuning of a pretrained diffusion model using a ControlNet conditioned on pixel-aligned physical property maps; and (iii) VLM-guided reward optimization, where a fine-tuned vision-language model evaluates generated videos with targeted physics queries and provides differentiable feedback. This combination enables a generative model to produce physically consistent and controllable outputs through variations in physical attributes-without any simulator or geometry reconstruction at inference. On the Physics-IQ benchmark, PhyCo significantly improves physical realism over strong baselines, and human studies confirm clearer and more faithful control over physical attributes. Our results demonstrate a scalable path toward physically consistent, controllable generative video models that generalize beyond synthetic training environments.
1. 서론
PhyCo는 연속적이고 해석 가능한 물리적 속성을 비디오 diffusion model에 조건으로 제공해 시각적 사실성과 물리적 사실성 사이의 간극을 줄인다. 대규모 주석 시뮬레이션 데이터셋, physics-supervised ControlNet fine-tuning, VLM-guided reward optimization을 결합해 물리적으로 일관되고 제어 가능한 생성을 향상한다.
- 관련 연구: 기존 접근법은 생성 모델에 물리 시뮬레이션을 통합하지만, PhysGen 의 rigid-body dynamics, PhysDreamer 의 MPM-based optimization, WonderPlay [22]의 hybrid simulation 등 명시적 solver에 의존한다.이러한 접근법은 시뮬레이션 기반 구성 요소에 의존하면서 세밀한 motion coherence를 향상하는 것으로 제시된다.
- Framework: PhyCo는 friction, restitution, deformation, applied force를 포함한 물리적 속성을 video diffusion model의 조건으로 제공해 제어 가능하고 물리적으로 일관된 motion synthesis를 수행한다.이 framework는 외부 guidance에만 의존하지 않고 다양한 material과 contact condition에서 물리적 속성을 조작하도록 설계된다.
- 데이터셋: 이 방법은 다양한 material, interaction, view, physical regime를 포괄하는 연속적 물리 주석을 포함한 100K-video multi-scenario 데이터셋을 도입한다.Kubric [12], PyBullet, Blender [4]로 구축된 이 데이터셋은 시각적 appearance와 underlying physics를 disentangle하고 simulation을 넘어 generalization을 지원하도록 설계됐다.
- 학습: PhyCo는 ControlNet 기반의 spatially aligned physical property map을 사용해 pretrained diffusion backbone을 fine-tune하고 VLM-guided reward optimization을 추가한다.pretrained backbone은 Cosmos-Predict2 이며, conditioning architecture는 ControlNet 이다.
- 결과: Physics-IQ 와 human preference study에서 PhyCo는 physical realism과 controllable variation 측면에서 기존 video model보다 우수하며, 보지 못한 material, force, interaction에도 generalization한다.결과는 variation 전반의 compositionality도 보고하며, physical property prior가 제어 가능하고 물리적으로 일관된 generative world model 을 향한 확장 가능한 경로임을 뒷받침한다.
2. 관련 연구
기존 연구는 물리성이 풍부한 데이터셋, 제어 가능한 비디오 생성, reward optimization을 다루어 왔지만, 기존 접근법은 데이터셋 다양성 부족, test-time simulation 의존성, 또는 주로 운동학적 제어에 의해 제약된다. 이러한 공백은 생성 비디오 모델을 위한 물리적으로 근거 있는 simulator-free 제어와 reward alignment의 필요성을 제기한다.
- 물리성이 풍부한 데이터셋: 기존의 물리성이 풍부한 데이터셋은 다양한 물리적 속성, 사실적인 장면, 복잡한 상호작용이 부족한 경우가 많으며, Force-Prompting 역시 장면 다양성과 물리적 속성 주석이 제한적이다.이러한 한계로 인해 많은 데이터셋이 최신 generative video model에 대해 분포 밖에 놓이며, 더 규모가 크고 물리적으로 근거 있는 데이터 수집의 필요성이 제기된다.
- 제어 가능한 비디오 생성: ATI 와 Go-with-the-Flow [6] 같은 motion-control 방법은 trajectory-based 또는 정밀한 객체 운동 조정을 가능하게 하며, 다른 접근법은 카메라 운동 제어를 대상으로 한다.이러한 방법은 세밀한 제어 가능성을 확립하지만, 제시된 문맥에서는 물리적 속성에 대한 제어를 확립하지 않는다.
- 제어 가능한 비디오 생성: PhysGen, WonderPlay [22], 그리고 관련 MPM 또는 spring-mass 접근법 [7]을 포함한 simulator-integrated 방법은 물리적 일관성을 향상시키지만 복잡한 test-time simulation pipeline을 요구한다.PhysDreamer 는 생성된 운동으로부터 물리 파라미터를 역추정하고, PhysAnimator 는 sketch-based physics cue를 사용해 diffusion synthesis를 유도한다.
- 제어 가능한 비디오 생성: VLIPP 와 PhysCtrl 같은 simulator-free 방법은 diffusion model에 physics prior를 내장하지만, 더 폭넓은 물리 제어보다는 주로 운동학적 유도를 강조한다.Reward optimization은 ImageReward 와 DFTM 을 통해 이미지에서 시작한 alignment를 VADER 와 이후의 VLM-feedback 방법 을 통해 비디오로 확장한다.
3. 방법
PhyCo는 물리가 풍부한 simulation supervision, physical-property conditioning, VLM-guided optimization을 결합해 diffusion video generation에 friction, restitution, deformation, force를 연속적이고 해석 가능하게 제어하는 기능을 부여한다. 이 pipeline은 pretrained representation을 유지하면서 optimization을 inference-time generation에 맞춰, 물리적으로 일관되고 photorealistic한 video를 생성하는 것을 목표로 한다.
- 물리가 풍부한 simulation dataset: PhyCo는 제어된 시나리오를 포괄하고 friction, restitution, deformation, applied force를 체계적으로 변화시킨 100K개 이상의 simulation video를 구축한다.이 dataset은 물리적 속성이 motion에 명확히 나타나고 training domain을 넘어 일반화되도록 설계된, 물리가 풍부하고 시각적으로 깔끔한 simulation을 사용한다.
- 물리 조건부 generation: 이 방법은 spatially aligned physical-property map을 입력으로 받는 ControlNet conditioning을 적용해 pretrained Cosmos-Predict2-2B diffusion backbone을 fine-tuning한다.물리적 속성은 friction/restitution, Neo-Hookean deformation, force magnitude/direction으로 묶으며, ControlNet layer만 학습하고 base model과 tokenizer는 frozen 상태로 유지한다.
- 물리 조건부 generation: 각 속성이 관측된 dynamics에 나타나는 data로 별도의 ControlNet branch를 학습해, diffusion score-matching supervision 아래 compositional physical conditioning을 가능하게 한다.Property-map embedding은 별도의 branch를 통해 처리되어 더 빠른 training과 물리적 속성의 composition을 지원한다.
- VLM-guided optimization: PhyCo는 N-step denoising rollout과 이를 decoding한 predicted video를 VLM의 입력으로 사용하며, VLM의 structured physics query가 controllability와 physical-alignment feedback을 제공한다.이 feedback은 semantic 또는 aesthetic image alignment가 아니라 physical controllability를 대상으로 하며, 부분적으로 noise가 추가된 ground truth보다 inference-time generation process에 더 잘 부합한다.
- VLM-guided optimization: VLM reward optimization은 physical-property ControlNet layer만 fine-tuning하고 diffusion score matching은 제외해, 더 안정적이고 물리적으로 일관된 generation을 산출한다.Alignment loss는 정답과 오답에 대한 logit에 binary cross-entropy를 적용하며, feedback을 위해 10-step denoising rollout을 사용한다.
4. 실험 결과
PhyCo는 benchmark metric, human preference, 정성적 비교, ablation을 사용해 물리적 사실성, controllability, reward optimization, generalization을 평가한다. 실험 결과, 지각된 물리적 개연성이 향상되고 의도한 property를 더 충실히 따르며 force direction을 더 정밀하게 제어하는 것으로 나타난다.
- Physics-IQ Benchmark의 정량적 평가: PhyCo는 Solid Mechanics, Fluid Dynamics, Optics, Magnetism, Thermodynamics를 아우르는 Physics-IQ에서 real-world reference sequence와 비교한 396개의 generated video로 평가된다.benchmark score는 핵심 동작의 timing과 spatial alignment를 측정한다.
- User Study: Human evaluator는 physical realism에서 일관되게 baseline보다 PhyCo를 선호하며, 더 현실적인 동작과 더 명확한 변화를 보여준다.Table 3은 pairwise preference percentage를 보고하며, 50%를 초과하는 score는 PhyCo의 ControlNet generation을 선호함을 의미한다.
- PhyCo Data에 대한 Ablation: VLM-based reward optimization은 의도한 input property와 유의하게 더 나은 alignment를 달성해 controllability와 physical conditioning에 대한 adherence를 강화한다.ablation은 모든 attribute를 포함하는 100개의 in-domain simulation video에서 predicted property와 ground-truth conditioning input을 비교해 평가한다.
- Force Direction Adherence: Force-Prompting의 40.5°에 비해 15.2°의 mean force-direction error를 보인 결과는 25개의 real-world video에서 유도된 dynamics를 더 정밀하게 제어함을 입증한다.평가는 random force direction을 적용하고 의도한 motion과 관찰된 motion 사이의 angular deviation을 측정한다.
5. 결론
PhyCo는 명시적 물성 조건화와 VLM-guided reward optimization을 통해 물리적으로 근거 있는 prior를 diffusion model에 주입하며, 추론 시 simulator 없이 핵심 dynamics를 연속적으로 제어할 수 있게 한다. 평가 결과 물리적 현실성과 controllability가 향상되었고, 합성 학습 데이터를 넘어 일반화되는 성능을 보였다.
- 5. 결론: PhyCo는 추론 시 simulator 없이 마찰, 반발계수, 변형, 힘을 연속적으로 제어할 수 있게 한다.이 framework는 명시적 물성 조건화와 VLM-guided reward optimization을 결합한다.
- 5. 결론: 평가 결과 물리적 현실성과 controllability가 뚜렷하게 향상되었으며, 합성 학습 데이터를 넘어 강한 일반화 성능을 보였다.
보충 자료 · A. 웹페이지의 비디오 결과
보충 웹페이지에는 논문의 주요 및 추가 비디오 결과가 수록되어 있으며, 스타일 일반화, 연속적인 물리 속성 제어, 속성 조합, baseline 비교를 다룬다. 이러한 시연에는 interactive force-direction control과 어려운 매개변수 조합에서도 시각적으로 설득력 있는 동작이 포함된다.
- A. 웹페이지의 비디오 결과: 주요 논문 예시와 지면 제약으로 별도 제시된 추가 결과를 포함한 모든 비디오 결과는 phyco-video.github.io에서 확인할 수 있다.웹페이지는 보충 시연을 주제별로 구성한다.
- A. 웹페이지의 비디오 결과: 웹페이지에는 지면 제약으로 주요 논문에 제시하지 못한 추가 생성 비디오도 포함되어 있다.
- A. 웹페이지의 비디오 결과: 다양한 예술적 스타일에서 네 개의 핵심 프레임이 multistyle 스토리라인을 이끌어 물리적으로 일관된 시퀀스를 생성한다.Figure 8은 생성된 두 스토리라인 예시에 사용된 첫 프레임을 보여준다.
- A. 웹페이지의 비디오 결과: 비디오는 각 물리 속성에 대해 낮음, 중간, 높음 수준을 생성하여 매끄럽고 연속적인 제어를 보여준다.
- A. 웹페이지의 비디오 결과: 시연에서는 force+friction, force+bounciness, bounciness+deformation을 조합하며, 어려운 restitution-and-deformation 조합에서도 시각적으로 설득력 있는 동작을 생성한다.해당 문단은 이러한 조합 중 일부가 현재 physics engine에서 정확하게 시뮬레이션하기 어렵다고 지적한다.
- A. 웹페이지의 비디오 결과: 나란히 배치한 비디오는 이 접근법을 최신 video diffusion model과 비교하고, pregenerated result를 통해 interactive force-direction control을 제공한다.
B. PhyCo 데이터셋 세부사항 · C. 구현 세부사항
PhyCo는 시각 주석과 구조화된 물리 메타데이터가 동기화된 사실적 물리 시뮬레이션 비디오를 제공한다. 데이터셋은 강체, 변형 가능 물질, 외력을 나타내는 매개변수를 체계적으로 변화시키며, 구현에는 ControlNet fine-tuning과 VLM 기반 supervision 및 evaluation이 포함된다.
- B. PhyCo 데이터셋 세부사항: 각 샘플은 432 × 768 해상도로 렌더링된 4초, 24-FPS 비디오이며, 동기화된 RGB, depth, segmentation 및 구조화된 메타데이터를 포함한다.메타데이터에는 장면 geometry, 객체 material, 적용된 물리 매개변수와 표준화된 장면 수준 텍스트 설명이 기록된다.
- B. PhyCo 데이터셋 세부사항: 모든 비디오는 multimodal supervision과 VLM 기반 처리를 지원하기 위해 표준화된 장면 수준 텍스트 설명을 포함한다.텍스트 설명은 동기화된 시각 주석과 물리 메타데이터를 보완한다.
- B. PhyCo 데이터셋 세부사항: 데이터셋은 강체의 friction과 restitution을 0에서 1까지 균일하게 샘플링하여, 매끄러운 미끄러짐에서 높은 저항까지, 비탄성 충돌에서 매우 탄성적인 충돌까지 포괄한다.이러한 매개변수는 다양한 강체 dynamics를 포괄하도록 PyBullet에서 변화시킨다.
- B. PhyCo 데이터셋 세부사항: 변형 가능 물체 시뮬레이션에서는 Neo-Hookean Lamé coefficients µ와 λ, 그리고 damping γ를 변화시켜 거의 강체인 material부터 매우 변형 가능한 material까지 포괄한다.데이터셋은 변형 가능 물체에 FEM 기반 Neo-Hookean model을 사용한다.
- B. PhyCo 데이터셋 세부사항: 외력은 약한 상호작용부터 강한 충돌까지의 범위를 가지며, camera parameters를 사용해 3D world coordinates에서 렌더링된 2D frames로 투영된다.이 투영은 물리적 작용과 그 시각적 결과를 직접 정렬한다.
- C. 구현 세부사항: 제안 모델은 ControlNet fine-tuning과 VLM 기반 supervision을 사용하며, evaluation을 위해 Qwen2.5-VL fine-tuning을 수행한다.이는 PhyCo의 training 및 evaluation pipeline을 구성하는 구현 요소다.
C.1. PhyCo 구현 세부사항 · C.2. 평가를 위한 Qwen2.5-VL Fine-tuning
PhyCo는 pretrained video diffusion model과 tokenizer를 고정한 채 attribute-specific ControlNet branch를 학습한 다음, physics-aware supervision을 위해 VLM-guided reward optimization을 적용한다. LoRA-adapted Qwen2.5-VL-3B model은 physics-focused video query에 대해 fine-tuning되어 평가에 필요한 physical property를 추론한다.
- C.1. PhyCo 구현 세부사항: ControlNet training에서는 ControlNet layer만 업데이트하고, base video diffusion model과 tokenizer는 고정해 Cosmos World Foundation Model 에서 pretrained된 dynamics를 보존한다.
- C.1. PhyCo 구현 세부사항: 각 attribute-specific ControlNet branch는 4×H100 GPU에서 10k optimization steps 동안 학습하며, 약 반나절이 걸린다.
- C.1. PhyCo 구현 세부사항: ControlNet supervision에는 sequence당 57 frames를 24 FPS로 사용하고, device당 batch size는 1, gradient accumulation은 2 steps로 설정한다.
- C.1. PhyCo 구현 세부사항: VLM-guided reward loss는 각 ControlNet branch를 추가로 100 iterations 학습하며, 약 70분이 소요된다.
- C.1. PhyCo 구현 세부사항: VLM evaluation 전에 video를 half resolution로 downsample하고 temporal subsampling을 적용해 최대 16 frames로 줄인다. Training은 8×H200 GPU와 effective batch size 4를 사용한다.
- C.2. 평가를 위한 Qwen2.5-VL Fine-tuning: Qwen2.5-VL-3B 는 physics-focused query를 사용해 video에서 physical property를 추론하도록 PhyCo dataset으로 adapt한다.
- C.2. 평가를 위한 Qwen2.5-VL Fine-tuning: Evaluation model은 Yes/No response의 균형을 맞추고, video를 최대 16 frames로 subsample하며, force-direction query에는 강조된 blue sector overlay를 사용한다.
- C.2. 평가를 위한 Qwen2.5-VL Fine-tuning: Qwen2.5-VL은 LoRA를 사용해 200 iterations 동안 fine-tuning되며, rank와 α 설정은 implementation에 명시된 값을 따른다.
D. 추가 결과
추가 평가에서 PhyCo는 동작 사실성을 높이고, 다양한 video backbone에 걸쳐 일반화하며, 물리적 속성을 정확하게 예측하는 것으로 나타난다. 더 높은 FPS 학습과 강력한 temporal architecture는 flickering artifact를 추가로 줄인다.
- 동작 일관성 평가: PhyCo는 대부분의 Physics-IQ 도메인에서 최상위 또는 두 번째로 우수한 FVMD score를 달성하며, VLM reward optimization은 ControlNet만 사용한 경우보다 동작 통계를 추가로 개선한다.FVMD는 생성된 동작 feature와 reference 동작 feature 사이의 distributional distance를 측정하며, 값이 낮을수록 더 사실적인 동작을 의미한다. 이러한 개선은 solid mechanics, fluid dynamics, magnetism에서 특히 일관되게 나타난다.
- Backbone 간 일반화: PhyCo dataset에서 Wan2.2를 text-only LoRA로 fine-tuning하면 명시적인 ControlNet conditioning 없이도 평균 Physics-IQ 성능이 4.6% 향상된다.이는 text conditioning만으로도 dataset이 architecture를 넘어 물리적으로 의미 있는 prior를 전달함을 보여준다.
- 정성적 결과: PhyCo는 occlusion 이후에도 일관된 공의 궤적을 생성하고, kettlebell의 무게에 따른 pillow의 그럴듯한 압축을 재현하는 등 물리적으로 일관된 dynamics를 생성한다.이러한 정성적 사례는 비교 방법보다 향상된 temporal consistency와 접촉으로 유발되는 deformation response를 보여준다.
- VLM fine-tuning 결과: Fine-tuning한 VLM은 100개의 held-out PhyCo sample에서 네 가지 물리적 속성을 0.14 mean absolute error와 84.8% binary-response accuracy로 예측한다.평가한 속성은 friction, restitution, deformation, force다.
- Flickering artifact 분석: 학습 frame rate를 높이면 더 조밀한 temporal supervision이 제공되어 flickering을 완화하며, Wan2.2와 같은 강력한 backbone은 artifact를 크게 줄이고 동작 일관성을 향상한다.이러한 개선은 더 낮은 FVMD score와 일치하며, 학습 및 architecture 선택 전반에서 상호 보완적으로 작용한다.
E. 한계
PhyCo는 제어 가능성과 물리적 일관성을 향상하지만, 생성된 동역학은 여전히 실제 물리의 근사이며 현재의 prior는 주로 통제된 환경에서의 단순화된 강체 및 연체 거동을 다룬다.
- 생성된 동역학은 실제 물리의 정확한 재현이 아니라 근사에 머문다.
- 물리 prior는 주로 통제된 환경에서의 단순화된 강체 및 연체 거동을 모델링한다.
- 관절 운동, 유체-구조 연성, 다중 접촉 동역학은 여전히 부분적으로만 모델링된다.