Source-linked AI summary
PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation
Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou
TL;DR
현재 video generator는 물리적으로 타당하지 않은 접촉 중심 조작을 생성할 수 있어 visual world simulator로서의 신뢰성을 저해한다. PhysisForcing은 상호작용이 중요한 영역에서 pixel-level trajectory와 semantic relation을 정렬해 embodied video generation을 일관되게 개선하고, WorldArena closed-loop success를 16.0%에서 24.0%로 높인다.
문제
현재 video generator는 접촉 중심 조작 중 국소 motion과 전역 관계 위반을 일으켜 visual world simulator로서의 신뢰성을 저해한다.
방법
PhysisForcing은 pixel-level trajectory alignment와 semantic-level relational alignment를 통해 상호작용이 중요한 영역에 계층적 physics supervision을 집중한다.
결과
R-Bench, PAI-Bench, EZS-Bench 전반에서 PhysisForcing은 강력한 baseline을 일관되게 능가하며 WorldArena closed-loop success를 16.0%에서 24.0%로 높인다.
시사점 및 한계
물리적으로 정렬된 video model은 robotic manipulation을 위한 더 강한 representation을 제공하며, 평가된 protocol 내에서 downstream policy success를 개선한다.
시사점 및 한계
제한된 world knowledge와 장기 temporal reasoning이 달성 가능한 물리적 타당성을 제약하므로, PhysisForcing은 backbone의 capability ceiling을 그대로 물려받는다.
Abstract
from arXiv · showhide
Video generation models have emerged as a promising paradigm for embodied world simulation. However, both general-domain video generators and robot-specific data fine-tuned models can still produce physically implausible manipulations, including discontinuous motion trajectories and inconsistent robot-object interactions, which limits their reliability as world simulators. Through extensive experiments, we find that such physical instability mainly arises from two factors: deformation of moving objects and implausible spatio-temporal correlations among interacting entities, particularly during contact. Building on this observation, we propose PhysisForcing, a scalable training framework that strengthens physical consistency by focusing supervision on physics-informative regions through joint optimization of pixel-level and semantic-level features. The framework consists of a pixel-level trajectory alignment loss, which supervises DiT features using reference point trajectories, and a semantic-level relational alignment loss, which aligns DiT features with inter-region relations extracted from a frozen video understanding encoder. Extensive experiments on R-Bench, PAI-Bench, and EZS-Bench show that PhysisForcing consistently improves embodied video generation over strong baselines, improving the Wan2.2-I2V-A14B and Cosmos3-Nano base models on R-Bench by 22.3\% and 9.2\% (7.1\% and 3.7\% over vanilla finetuning), with the Cosmos3-Nano variant attaining the best overall score. Beyond generation, as a world model under the WorldArena action-planner protocol it raises the closed-loop success rate from 16.0\% to 24.0\% and further improves downstream policy success, indicating that physically aligned video models yield stronger representations for robotic manipulation.
1 서론
PhysisForcing은 계층적·영역 중심 정렬을 적용해 국소적 움직임과 의미적 상호작용을 다룸으로써, 접촉이 많은 로봇 비디오 생성에서 물리적으로 부자연스러운 현상을 해결한다. 여러 벤치마크와 backbone에서 embodied video generation을 개선하는 동시에 world model의 action planning과 downstream policy learning에도 이점을 제공한다.
- 동기: 기존 생성 모델은 접촉이 많은 조작 과정에서 불연속적인 gripper 움직임, 물체 관통, 반중력 움직임, 일관되지 않은 물체 반응을 생성한다.이러한 국소적·전역적 관계 위반은 로봇 행동의 타당한 시각적 결과로서 비디오의 신뢰성을 저해한다.
- 방법: Pixel-level alignment는 추적된 점을 사용해 연속적이고 접촉과 양립 가능한 DiT feature trajectory를 강제하는 반면, semantic-level alignment는 변화하는 영역 간 관계를 포착한다.이 두 수준은 국소적 움직임의 연속성과 gripper-object coupling, 물체 변위, 지지면 접촉과 같은 상호작용 의미를 각각 다룬다.
- 방법: PhysisForcing은 모든 픽셀을 균일하게 처리하는 대신 manipulator, 조작 대상 물체, 접촉 영역, 움직이는 부분에 supervision을 집중한다.이 framework는 물리적 타당성을 계층적·영역 중심 정렬 문제로 정식화한다.
- 실험 결과: R-Bench의 물리적 타당성 평가에서 Wan2.2-I2V-A14B와 Cosmos3-Nano를 사용했을 때 base model 대비 각각 22.3%와 9.2%, vanilla finetuning 대비 각각 7.1%와 3.7%의 향상을 달성한다.Cosmos3-Nano variant는 평가된 모델 중 R-Bench 종합 점수가 가장 높으며, PAI-Bench와 EZS-Bench에서도 향상이 보고된다.
- Downstream 영향: PhysisForcing은 video backbone으로 사용될 때 world model의 action planning과 downstream policy success를 강화해 embodied decision making을 개선한다.이 기여는 WorldArena action planning과 downstream embodied policy learning을 통해 평가된다.
2 관련 연구
기존 연구는 embodied intelligence를 위해 video generation을 활용해 왔지만, general-domain 모델은 robot–object interaction dynamics를 다루는 데 어려움을 겪는다. 이에 robotics-specific world model과 physics-aware alignment가 요구된다. 기존 접근법은 geometric consistency 또는 preference-based correction을 강조해 왔으며, trajectory와 semantic interaction을 모두 포착하는 hierarchical하고 localized된 supervision이 여전히 필요하다.
- 2 관련 연구: General-domain video model은 embodied intelligence를 위한 확장 가능한 visual simulation을 제공하지만, robot–object interaction dynamics를 다루는 데 자주 어려움을 겪어 robotics-specific world model의 필요성을 제기한다.관련 연구는 robotic data scarcity에 대한 대응으로 video generation을 제시하고, general-domain 모델과 robotics-specific 대안을 구분한다.
- 2 관련 연구: Geometry-based method는 depth prediction, keypoint tracking 또는 3D scene reconstruction을 통해 physical consistency를 강제하여 local spatial structure와 motion modeling을 개선한다.RoboScape는 temporal depth prediction과 keypoint dynamics를 jointly learning하고, RoboDreamer와 CTRL-World는 compositional imagination과 controllable world modeling을 다룬다.
- 2 관련 연구: Preference-based method는 post-training alignment를 적용해 object penetration과 anti-gravity motion 같은 물리적으로 타당하지 않은 generation을 억제한다.ABot-PhysWorld는 physics-aware discriminator와 함께 DPO를 사용하고, MIND-V는 Physical Foresight Coherence reward와 함께 GRPO를 사용한다.
- 2 관련 연구: 기존 physics-aware video model은 단일 수준 또는 전체 frame을 supervision하는 경우가 많지만, contact가 풍부한 manipulation에는 hierarchical하고 localized된 physical supervision이 필요하다.Pixel-level constraint는 point별 trajectory와 contact를 제어하고, semantic-level relational cue는 region 간 interaction을 포착한다. 유의미한 evidence는 manipulator와 contact interface 주변에 집중된다.
3 방법
PhysisForcing은 영역 중심의 계층적 물리 정렬을 통해 embodied video generation을 강화한다. 추론 비용을 추가하지 않으면서 물리 정보가 풍부한 robot-object interaction 영역에 pixel-level trajectory supervision과 semantic-level relational supervision을 결합한다.
- 영역 중심 물리 supervision: PhysisForcing은 trajectory motion과 depth-aware foreground relevance를 사용해 접촉이 많고 물리 정보가 풍부한 영역을 식별한 뒤 spatiotemporal physics mask를 구성한다.이 mask는 trajectory alignment와 semantic relational supervision이 interaction-relevant 영역에 집중하도록 유도한다.
- Pixel-level trajectory alignment: Pixel-level trajectory alignment는 intermediate DiT features를 사용해 추적된 point location을 예측하고, reference trajectories에 대한 masked mean squared error를 적용한다.이 supervision은 physics mask 내부에서 manipulator와 manipulated object의 point별 trajectory continuity를 직접 강제한다.
- Semantic-level relational alignment: Semantic-level relational alignment는 선택된 물리 정보가 풍부한 token에 대해 DiT의 pairwise token relations를 frozen video understanding encoder에서 얻은 관계와 일치시킨다.이를 통해 coordinated gripper-object motion과 contact-driven object movement 같은 영역 간 coupling을 포착한다.
- Joint training objective: Fine-tuning 동안 PhysisForcing은 intermediate DiT layer에서 standard flow matching과 pixel-level 및 semantic-level physics losses를 결합하며, auxiliary models는 inference 시 폐기된다.따라서 이 framework는 추가 inference cost를 도입하지 않는다.
4 실험
PhysisForcing은 R-Bench, PAI-Bench, EZS-Bench 전반에서 embodied video generation을 일관되게 개선하며, PF-Cosmos가 전체 benchmark에서 가장 우수한 성능을 달성한다. 또한 physics-aligned video representation은 downstream policy execution과 WorldArena action-planning success를 향상시킨다.
- EZS-Bench 평가: EZS-Bench에서 81.1을 기록한 PF-Cosmos는 vanilla finetuning(80.3→81.1)을 넘어 Abot-PhysWorld(80.3)와 다른 모든 baseline을 능가한다.이 benchmark는 196개의 미관측 robot-task-scene 조합에서 training-independent zero-shot generalization을 평가한다.
- PAI-Bench 평가: PAI-Bench에서 85.2를 기록한 PF-Cosmos는 vanilla finetuning(84.0→85.2), Wan2.5(81.0), Abot-PhysWorld(84.9)를 능가한다.Wan2.2-I2V-A14B도 79.9에서 81.7로 향상된다.
- R-Bench 평가: R-Bench에서 63.8을 기록한 PF-Cosmos는 base 대비 9.2% 향상되며 Wan2.6(60.7)을 능가하고, PF-Wan은 62.0을 달성한다(base 대비 +22.3%).PhysisForcing은 평가된 모든 백본의 성능을 향상했으며, PF-Wan은 전체 순위에서 두 번째를 기록했다.
- Downstream Policy 평가: downstream policy success 평균은 68.2%에서 72.8%로 상승하며, contact-rich placing은 41.5%→63.0%, pressing은 49.0%→60.0%로 증가한다.PhysisForcing-Wan2.2-TI2V-5B는 6개 RoboTwin 2.0 task에서 Fast-WAM의 video DiT를 대체하며, task당 200회의 rollout으로 평가된다.
- Action Planner로서의 World Model: WorldArena closed-loop success는 16.0%에서 24.0%로 상승하며, shared inverse dynamics model과 결합했을 때 WoW(20.5%)를 능가한다.이 protocol은 예측된 world-model rollout을 action으로 decode한 뒤 RoboTwin 2.0 simulator에서 실행한다.
5 결론
PhysisForcing은 상호작용 핵심 영역에서 pixel-level trajectory와 semantic-level relation을 정렬해 로봇 비디오 생성을 개선한다. 세 벤치마크에서 여러 baseline을 일관되게 능가하며 PF-Cosmos가 종합적으로 가장 우수하고, WorldArena와 downstream policy 성공률도 높인다.
- 결론: PhysisForcing은 상호작용 핵심 영역에서 pixel-level trajectory와 semantic-level relation을 정렬해 로봇 비디오 생성을 개선한다.이는 물리적 일관성을 강화하기 위한 training-time framework로 제시된다.
- 결론: PF-Cosmos는 base model, vanilla finetuning, 강력한 open-source·commercial·robotics-specific baseline을 일관되게 능가하며, R-Bench, PAI-Bench, zero-shot EZS-Bench에서 종합적으로 가장 우수한 결과를 달성한다.이 framework는 상호작용 핵심 영역에서 pixel-level trajectory와 semantic-level relation을 정렬한다.
- 결론: 16.0%에서 24.0%로: PhysisForcing은 WorldArena closed-loop 성공률을 높이고 downstream policy 성공률도 추가로 개선한다.이러한 향상은 물리적 개연성이 embodied intelligence에 구체적인 이점을 제공함을 보여준다.
조작 · 부록 · A 더 자세한 구현 세부사항
PhysisForcing은 동결된 보조 모델을 사용해 공유 물리 타깃을 추출하고, 세 가지 video diffusion backbone에 pixel-level 및 semantic-level supervision을 적용한다. backbone별 학습 설정은 유지하면서 dynamics를 형성하는 구성 요소를 특화한다.
- A 더 자세한 구현 세부사항: 동결된 보조 모델은 ground-truth clip에서 학습 중 물리 타깃을 online으로 추출하며, tracker와 depth 출력은 두 physics loss에서 공유된다.보조 모델은 학습 중 타깃 추출에만 사용된다.
- A 더 자세한 구현 세부사항: V-JEPA 2 [3]는 mask로 선택된 영역에서 정렬된 DiT 및 teacher token 간 pairwise-cosine 관계를 사용해 semantic supervision을 제공한다.Wan2.2-I2V-A14B DiT block을 V-JEPA 2의 feature space로 매핑하고 공유 32×16×16 grid에 resample하며, 관계 계산에는 최대 K=512개 token을 사용한다.
- A 더 자세한 구현 세부사항: CoTracker3 는 첫 프레임의 규칙적인 25×25 grid에서 625개 점을 추적하며, Depth-Anything-V2 [48]는 normalized relative depth로 motion에 가중치를 부여해 활성 foreground track을 유지한다.선택된 trajectory는 pixel-level supervision을 제공하고 rasterization 후 semantic-loss physics mask를 정의한다.
- A 더 자세한 구현 세부사항: Wan2.2-I2V-A14B [45]에서는 global dynamics와 physical structure를 형성하는 high-noise expert만 PhysisForcing으로 fine-tune한다.학습에서는 전체 diffusion schedule에 이 expert를 적용하고 low-noise expert는 변경하지 않는다.
- A 더 자세한 구현 세부사항: Cosmos3-Nano [1]는 Wan2.2-VAE와 mid-depth MoT block의 physics supervision을 사용해 720p robot-manipulation clip에서 image-to-video mode로 fine-tune한다.latent compression은 T×H×W = 4×16×16이며, patchification 후 유효 compression은 4×32×32다.
B 평가 벤치마크 세부 사항
평가는 물리적 개연성, 과업 준수, zero-shot cross-embodiment 일반화를 아우르는 R-Bench, robot-domain PAI-Bench, EZS-Bench를 대상으로 한다. R-Bench는 정규화된 5개 하위 지표를 결합해 인간 검증 기반 prompt별 점수로 집계하며, PAI-Bench와 EZS-Bench는 상호 보완적인 embodied-generation 조건을 평가한다.
- R-Bench: R-Bench는 5개 과업 범주에 걸친 650개의 robotic manipulation 및 locomotion prompt를 평가하고, 5개의 정규화된 하위 지표를 집계해 [0, 1] 점수로 산출한다.지표는 physical-semantic plausibility, task-adherence consistency, robot-subject stability, motion smoothness, motion amplitude를 평가하며, 25개 video generator에서 점수가 인간 선호도와 Spearman ρ=0.96의 상관을 보인다.
- R-Bench: R-Bench는 Qwen3-VL temporal-grid inspection으로 물리적 위반을 탐지하고 action order를 검증하며, pixel- 및 tracking-based 통계로 motion quality를 측정한다.평가는 floating component, object penetration, spontaneous appearance 또는 disappearance, non-contact attachment, temporal jitter, degenerate near-static output에 불이익을 부여한다.
- PAI-Bench: PAI-Bench 평가는 PAI-Bench-G generation track의 robot subset으로 제한되며, 각 쌍에 5–6개의 physical-semantic QA pair가 포함된 실제 robotic image-prompt pair 174개로 구성된다.PAI-Bench는 6개 domain과 3개 track을 아우르지만, 본 연구는 embodied manipulation에 가장 부합하는 subset을 선택한다.
- EZS-Bench: EZS-Bench는 robot morphology, environment, task가 완전히 fully out-of-distribution 조합을 이루는 조건에서 training-independent embodied zero-shot generation을 평가한다.이중 분기 구성은 robot, scene, task를 변화시키면서 training-data overlap 없이 cross-embodiment physical fidelity를 검증한다.
C 상세 벤치마크 결과
PhysisForcing은 두 backbone 모두에서 PAI-Bench와 EZS-Bench 전체 결과에 걸쳐 물리-의미적 성능과 종합 벤치마크 성능을 향상한다. PF-Cosmos는 Abot-PhysWorld 을 능가하며 가장 높은 종합 평균을 달성하고, Domain Score에서 가장 큰 향상을 보인다.
- C 상세 벤치마크 결과: Quality Score와 Domain Score는 Figures 3과 4에 보고된 평균 점수를 구성하는 세부 항목을 제공한다.
- C 상세 벤치마크 결과: PhysisForcing은 두 backbone 모두에서 vanilla finetuning 대비 PAI-Bench와 EZS-Bench의 Domain Score와 종합 평균을 향상한다.Tables 7과 8은 전체 벤치마크 결과를 제공한다.
- C 상세 벤치마크 결과: PF-Cosmos는 이러한 벤치마크에서 가장 높은 종합 평균을 달성하며, 가장 강력한 robotics-specific baseline인 Abot-PhysWorld 을 능가한다.
- C 상세 벤치마크 결과: 향상 폭은 물리-의미적 개연성을 측정하는 Domain Score에서 가장 두드러진다.
D 추가 정성적 결과 · E 광범위한 영향
PhysisForcing은 강력한 상용 및 로보틱스 특화 모델보다 물리적으로 일관된 로봇 조작 비디오를 생성하며, 다양한 embodiment, 장면, 지시문에 걸쳐 일반화된다. 광범위한 영향으로는 더 저렴한 시뮬레이션과 평가가 있지만, 기만적 합성 영상과 안전하지 않은 정책 학습의 위험도 따른다.
- D 추가 정성적 결과: single-arm, dual-arm, humanoid 작업 전반에서 PhysisForcing은 경쟁 최신 모델보다 더 연속적인 움직임과 일관된 로봇-객체 상호작용을 유지한다.Wan2.6, Seedance 1.5 Pro, Veo 3.1, Cosmos3-Super, Abot-PhysWorld는 자주 궤적이 어긋나고 접촉이 끊기거나 객체가 변형된다.
- D 추가 정성적 결과: 정성적 ablation 결과, PhysisForcing은 Wan2.2-I2V-A14B와 Cosmos3-Nano 모두에서 vanilla finetuning을 넘어 물리적 개연성을 향상시킨다.PF-Wan은 객체 형태와 grasp-and-place 궤적을 안정화하고, PF-Cosmos는 작업 유형 전반에서 접촉 동역학과 객체 간 관계를 더 잘 보존한다.
- D 추가 정성적 결과: 정성적 비교는 이러한 향상이 추가적인 in-domain finetuning이 아니라 계층적 physics alignment에 기인함을 보여준다.이 결론은 Figures 12 and 13의 동일 backbone 비교로 뒷받침된다.
- D 추가 정성적 결과: PhysisForcing은 다양한 embodiment, 장면, 지시문에서 기본적인 물리적 규칙성을 준수하면서 프롬프트를 일관되게 따른다.이 결과는 학습된 물리적 prior가 비교 프롬프트를 넘어 일반화됨을 보여준다.
- E 광범위한 영향: PhysisForcing은 생성된 로봇 조작 비디오의 물리적 개연성을 높여, 더 저렴한 시뮬레이션, 데이터 증강, 배포 전 정책 평가를 통해 embodied-AI 연구의 진입 장벽을 낮춘다.또한 downstream world model에 더 신뢰할 수 있는 학습 신호를 제공한다.
- E 광범위한 영향: 더 사실적인 로봇 비디오는 기만적 영상을 제작하거나 하드웨어 성능을 과장하거나 합성 시연으로 학습된 정책을 주입하는 데 악용될 수 있다.이러한 위험은 향상된 물리적 개연성의 이점을 제한한다.
F 제한점 및 향후 연구
PhysisForcing은 비디오 생성 backbone의 성능 상한을 물려받는다. 제한적인 세계 지식과 장기 시간 추론이 달성 가능한 물리적 개연성을 제약하기 때문이다. 저자들은 더 강력한 비디오 및 world-model foundation model과 결합할 때 성능이 더욱 누적될 것으로 기대한다.
- 제한점: 현재 Wan2.2 및 Cosmos3 모델은 제한적인 세계 지식과 장기 시간 추론 능력을 지니므로, PhysisForcing은 backbone의 성능 상한을 물려받는다.이러한 제한은 fine-tuning만으로 달성할 수 있는 물리적 개연성의 범위를 제한한다.
- 향후 연구: 저자들은 더 강력한 비디오 및 world-model foundation model이 등장하면 PhysisForcing의 효과가 이들과 결합되어 더욱 누적될 것으로 기대한다.