Source-linked AI summary

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

arXiv:2607.05390v1cs.ROcs.CV

TL;DR

Deformable object world modeling은 고차원 dynamics와 가려진 contact-induced deformation 때문에 어렵다. Deform360은 markerless 3D tracking을 포함한 대규모 visuotactile benchmark를 제시하고 2D video와 3D particle models를 비교해 visual scalability와 structural priors 사이의 trade-off를 밝힌다.

  • 문제

    Deformable object의 동작을 정확히 예측하기는 여전히 어렵다. Deformable body는 이론적으로 무한한 degrees of freedom을 가지며 contact deformation은 흔히 가려지기 때문이다.

  • 방법

    Deform360은 대규모 multi-view visuotactile dataset에 markerless 3D tracking과 2D video 및 3D particle world models의 체계적 평가를 결합한다.

  • 결과

    3D particle models는 데이터가 적은 future prediction에서 더 우수한 반면, 2D video models는 더 강한 visual reconstruction과 zero-shot visual generalizability를 제공한다.

  • 시사점 및 한계

    이 benchmark는 dynamics generalization을 뒷받침하는 structural priors와 visual synthesis 및 generalizability를 뒷받침하는 scalability 사이의 trade-off를 식별한다.

  • 시사점 및 한계

    심한 self-occlusion, highly plastic materials, 그리고 눈에 보이는 contact slip은 tracking quality를 저하시키거나 particle optimization assumptions를 위반할 수 있다.

Abstract

from arXiv · show

Predicting object dynamics (i.e., world modeling) is a fundamental challenge for robotic manipulation, and modeling deformable objects presents a particularly difficult case due to their high-dimensional state spaces and complex material properties. While current world models approach this through two distinct paradigms: learning the dynamics over the 2D pixel space or more explicit 3D geometric space. A systematic understanding of their relative strengths and limitations remains elusive due to the lack of diverse, large-scale real-world data. To address this, we present Deform360, a large-scale visuotactile dataset featuring 198 daily-life objects, 1,980 interaction sequences, and over 215 hours of observations from 41 surround-view cameras and bimanual tactile grippers to capture both global motion and contact-induced local deformations. Leveraging a novel markerless visuotactile 3D tracking pipeline to extract dense geometry and motion, we systematically evaluate current state-of-the-art world models, comparing 2D video models against 3D particle models. Finally, we provide a preliminary demonstration indicating the real-world applicability of our dataset by performing robot planning tasks on deformable objects. Our analysis reveals key insights into the trade-offs between structural priors and scalability, providing a solid benchmark for future research in generalizable deformable object-centric world modeling. Project website: https://deform360.lhy.xyz

1 서론

Deform360은 전역 및 접촉 유발 변형 관측을 포함하는 대규모·다양한 multi-view visuotactile 데이터셋을 제공해 변형 가능한 동역학 모델링의 어려움을 다룬다. contact prediction, 2D-versus-3D world model 비교 평가, 실제 로봇 planning을 지원한다.

  • 동기: 변형 가능한 동역학은 물체가 이론적으로 무한한 자유도를 가지며 접촉 유발 국소 변형이 자주 가려지기 때문에 여전히 어렵다.따라서 tactile sensing은 가려진 상호작용을 관측하고 ground-truth 신호를 제공하는 데 중요하다.
  • 동기: 현재 접근법은 2D pixel space 또는 3D geometric space에서 변형 가능한 동역학을 예측하지만, 두 공간의 상대적 강점을 평가하려면 다양하고 대규모인 multi-view 실세계 데이터셋이 필요하다.이러한 데이터셋은 일반화 가능성을 검증하고 ground-truth 3D 상태를 추출하는 데 필요하지만, 기존 데이터셋은 객체 다양성이 부족하거나 합성 데이터에 의존하는 경우가 많다.
  • 데이터셋 및 기여: Deform360은 41대의 surround-view 카메라와 양손 tactile-equipped UMI gripper를 사용해 수집한 198개의 일상용 객체와 1,980개의 상호작용 시퀀스를 포함한다.데이터셋은 215.7시간 이상의 관측 데이터와 23.3 million 프레임을 제공하며, 다양한 재료를 포괄하고 전역 동역학과 접촉으로 유발되는 미세 변형을 360° 관찰할 수 있게 한다.
  • 평가 과제: 이 데이터셋은 세 가지 평가 과제를 지원한다: contact prediction, state-of-the-art 2D video model 과 3D particle model 의 체계적 benchmarking, 그리고 실제 로봇 planning이다.이 과제들은 동기화된 tactile data를 사용해 시각-물리적 접촉 결합을 모델링하고 여러 설정에서의 일반화 성능을 평가한다.
  • Perception Pipeline: markerless multi-view visuotactile perception pipeline은 각 상호작용 에피소드에 대해 고품질 3D reconstruction과 tracking 결과를 생성한다.생성된 annotation은 데이터셋의 변형 가능한 객체 상호작용 전반에서 모델링과 평가를 지원한다.

2 관련 연구

기존 변형 가능 객체 데이터셋은 객체 범주, 시점 또는 센싱 모달리티가 제한적인 경우가 많았지만, Deform360은 dynamics 평가를 위한 대규모 멀티모달 실세계 데이터를 제공한다. 관련 world modeling 접근법은 확장 가능한 action-conditioned 2D video model과 구조적 근거를 갖춘 3D geometry model로 나뉜다.

  • 데이터셋 벤치마크: 초기 데이터셋은 cloth 과 같은 thin-shell 객체나 rope 및 cable 과 같은 선형 객체를 대상으로 했으며, 객체 다양성과 camera viewpoint가 제한적인 경우가 많았다.Robo360 은 범주를 확장하고 86 camera view를 제공했지만 h가 부족했다.
  • 데이터셋 벤치마크: Deform360은 198개의 다양한 객체에 대해 23.3 million frames와 215.7 hours의 41-view calibrated, synchronized video-tactile data를 제공하며, high-fidelity 2D/3D annotation을 포함한다.이러한 규모와 풍부한 센서 정보는 기존 benchmark를 크게 상회하며, 포괄적인 dynamics 평가를 지원한다.
  • Action-conditioned 2D Video Model: [71], Vid2World, PAN, Cosmos 를 포함한 action-conditioned video diffusion model은 latent space에서 3D dynamics를 암묵적으로 예측하면서도 뛰어난 확장성을 제공한다.이러한 model은 video diffusion을 world simulation의 패러다임으로 활용하는 연구 [15] [16]를 기반으로 한다.
  • 3D World Model: 3D world model은 explicit mesh 또는 particle 로 객체를 표현하며, physics-based optimization 또는 data-driven learning을 사용해 더 강한 structural prior를 통합한다.DiffCloth, PhysTwin, PhysGaussian 과 같은 differentiable-simulator 접근법은 mass conservation과 같은 physical prior를 내재화하고 장기 안정성을 달성하지만, 여전히 suscept

3 Deform360 데이터셋

Deform360은 198개의 일상생활 물체와 1,980개의 상호작용 시퀀스로 구성된 대규모 실세계 데이터셋으로, 동기화된 multi-view video, 양손 tactile sensing, 로봇 proprioception을 통해 수집된다. 폭넓은 재료 범주와 조밀한 annotation은 전역 변형과 접촉 물리를 일반화 가능하게 모델링하는 것을 목표로 한다.

  • 수집 설정: 각 시퀀스는 41대의 RGB camera와 양손 tactile signal을 30 Hz로 동기화해, 가려진 국소 변형과 접촉으로 유도된 재료 반응을 포착한다.Camera는 720×1280 해상도로 기록하며 고정된 intrinsic 및 extrinsic calibration을 사용한다. Tactile sensor는 UMI gripper에 장착된다.
  • 물체 범주: 198개의 물체는 다양한 재료와 기하학적 복잡성을 아우르는 28개의 1D deformable, 98개의 2D deformable, 72개의 3D volumetric deformable로 분류된다.범주에는 선형 물체, thin-shell 재료, 그리고 큰 형상 변화를 보이는 압착 가능한 volumetric 물체가 포함된다.
  • 상호작용 및 annotation: 에피소드에는 찌르기, 압착, 늘리기, 접기, 비틀기가 포함되며, 동작 추론을 위해 시각 및 촉각 stream과 함께 gripper pose와 개방도도 기록한다.Annotation pipeline은 동적 기하를 재구성하고, 2D 및 3D에서 물체를 markerless로 추적하며, 시간적·다중 시점·물리적 일관성을 강제한다.
  • 데이터셋 규모: 198개의 물체와 1,980개의 상호작용 시퀀스에서 74,850개의 raw video, 23.3 million frames, 215.7시간의 누적 multi-view footage가 생성된다.각 물체는 unimanual episode 5개와 bimanual episode 5개를 제공하며, 설정은 720p 및 30 FPS에서 41개의 시점을 사용한다.

4 Annotation Pipeline

annotation pipeline은 multi-view 2D trajectory를 3D로 lifting하고 visuotactile physics로 정제해, frame별 3D geometry recovery와 temporal consistency를 갖춘 particle tracking을 분리한다. 이를 통해 deformation과 occlusion 상황에서도 particle identity를 보존하는 warped point cloud를 생성한다.

  • Calibration: Multi-view calibration, undistortion, 그리고 ArUco-tracked gripper pose의 RANSAC aggregation을 통해 metric-scale geometry와 gripper motion을 확립한다.
  • Geometry Recovery: Object segmentation은 각 camera stream을 filtering한 뒤 frame별 3D Gaussian Splatting reconstruction을 수행해, recovered geometry를 interacting object로 제한한다.3DGS는 anisotropic Gaussian으로 scene을 표현하고 color 및 depth map을 rasterize한다.
  • Motion Tracking: 최대 M = 1,600개의 mask-filtered point를 CoTracker3로 여러 view에 걸쳐 tracking한 다음, 이를 3D로 lifting하고 RANSAC으로 fusion해 global velocity field를 구성한다.Self-occlusion으로 발생하는 invisible point를 처리하기 위해 tracking에는 stride 5의 15-frame clip을 사용한다.
  • Physics-Informed Tracking: physics-informed tracking objective는 shape alignment, local ARAP rigidity, Laplacian smoothness, tactile constraint를 결합해 particle motion을 temporal하게 coherent하고 physical하게 plausible하도록 만든다.Tactile의 영향을 받은 particle은 shape loss에서 제외하고, tactile feedback은 activated taxel 주변에서 soft localized no-slip regularizer로 작용한다.
  • Output: 최적화된 velocity를 initial particle position에서 적분해, large deformation과 self-occlusion 상황에서도 particle identity를 preserve하는 warped point cloud를 생성한다.실험에서는 λlocal = 20.0, λlap = 0.1, λtactile = 1.0을 사용한다.

5 실험

Deform360은 perception fidelity, visual-to-tactile contact prediction, cross-paradigm world-model benchmarking, zero-shot robot planning을 통해 평가된다. 실험 결과, 다양한 데이터 규모, 일반화 설정, 배포 조건에서 physics-based model과 video model이 상호보완적인 강점을 보인다.

  • 5.1 Perception 평가: Perception pipeline은 PSNR, SSIM, LPIPS를 사용해 held-out view에서 198개 객체와 1D, 2D, 3D volumetric category 전반에 걸쳐 일관되게 높은 reconstruction fidelity를 달성한다.성능은 Table 2에서 객체 category별로 보고된다.
  • 5.2 Visuotactile coupling: Visual observation은 36개의 synchronization-filtered view에서 binary tactile contact를 88.67% mean accuracy로 예측하며, dataset의 synchronized visuotactile coupling을 입증한다.Transformer encoder는 visual stream과 robot action을 contact prediction으로 매핑한다.
  • 5.3 World-model 평가: PhysTwin은 episode당 reconstruction과 prediction에서 PGND 및 ParticleFormer를 능가하며, low-data regime에서 명시적인 physical 및 structural prior의 중요성을 부각한다.Cosmos는 episode당 데이터가 극도로 제한되어 안정적인 post-training을 지원할 수 없으므로 제외된다.
  • 5.3 World-model 평가: Cosmos는 multi-episode reconstruction에서 우수한 성능을 보이는 반면, ParticleFormer는 future prediction에서 Cosmos를 능가하며 visual fidelity와 dynamics forecasting 사이의 trade-off를 드러낸다.Cosmos는 직접적인 2D modeling을 통해 texture와 surface detail을 더 잘 보존하고, ParticleFormer는 제한된 interaction episode를 prediction에 활용한다.
  • 5.3 World-model 평가: Cosmos는 zero-shot setting에서 novel object category로 더 잘 일반화하며, large-scale pretraining을 활용해 image-quality metric에서 3D counterpart를 능가한다.PhysTwin은 physical parameter를 특정 object geometry에 맞추므로 novel category로 본래 일반화할 수 없다.
  • 5.3 World-model 평가: Cosmos는 장기 horizon dynamics를 물리적으로 타당하게 생성하는 경우가 많지만 robot command를 엄격히 따르지 못하며, action misalignment가 핵심 failure mode임을 보여준다.이 문제를 해결하려면 더 많은 fine-tuning data 또는 더 정교한 action representation이 도움이 될 수 있다고 제시한다.
  • 5.4 Real-world planning: PhysTwin representation은 서로 다른 xArm setup과 다른 laboratory environment에서 zero-shot MPC planning을 가능하게 하며, preliminary real-world applicability를 입증한다.Cosmos는 appearance-shift sensitivity와 generated video에서 geometric reward를 직접 정의하기 어려운 문제로 인해 배포되지 않는다.

6 한계

Deform360은 장시간 지속되는 자기 가림, 높은 소성 재료, 가시적인 접촉 미끄러짐을 포함하는 어려운 변형 상호작용에서 여전히 tracking 및 modeling 과제에 직면한다.

  • 6 한계: 심한 자기 가림은 넓은 물체 영역이 장시간 대부분의 카메라에 보이지 않을 때 tracking 품질을 저하시킬 수 있다.이 한계는 일상적인 변형 상호작용을 폭넓게 포괄하는 Deform360에서도 어려운 사례에 영향을 미친다.
  • 6 한계: 높은 소성 재료는 particle optimization에 사용되는 국소 강체성 및 매끄러움 가정을 위반할 수 있다.
  • 6 한계: 접촉에서 가시적으로 발생하는 미끄러짐은 tactile no-slip regularizer가 주변 particle을 과도하게 구속하게 만들 수 있다.

7 결론 · A 그리퍼 포즈 및 개방도 추적 · B 사전 지식

Deform360은 변형 물체 동역학 모델링을 위한 대규모 multi-view visuotactile dataset과 markerless 3D tracking pipeline을 소개하고, 3D particle models와 2D action-conditioned video models를 비교 benchmark한다. 부속 방법론은 multi-view ArUco 관측을 통해 그리퍼 포즈와 개방도를 추적하며, 2D video와 명시적 3D particle 패러다임을 통해 변형 동역학을 정식화한다.

  • 7 결론: Deform360은 198개의 일상생활 물체에 대한 multi-view visuotactile 데이터를 제공하며, markerless 3D tracking pipeline을 통해 고정밀 particle 궤적과 동적 geometry를 추출한다.이 dataset은 3D particle dynamics models와 2D action-conditioned video generation models를 체계적으로 benchmark할 수 있도록 지원한다.
  • A 그리퍼 포즈 및 개방도 추적: 그리퍼 추적 방법은 그리퍼당 8개의 ArUco markers를 부착하고, 손목/베이스와 양쪽 손가락을 포함해 6D pose와 개방도를 추정한다.Marker에는 DICT_4X4_250 dictionary를 사용하며, 손목/베이스와 손가락 위치에 서로 다른 marker IDs를 할당한다.
  • A 그리퍼 포즈 및 개방도 추적: 각 가시 marker의 camera-frame 6D pose는 calibrated camera extrinsics와 CAD로 측정한 그리퍼 프레임 오프셋을 사용해 world frame으로 변환한다.이 변환은 world-to-camera, camera-to-marker, marker-to-gripper 변환을 결합한다.
  • A 그리퍼 포즈 및 개방도 추적: 강건한 multi-view fusion은 RANSAC으로 occlusion과 noise로 인해 발생한 이상치를 제거한 뒤, inlier의 translation과 rotation을 평균내 손목 pose를 추정한다.Rotation averaging에는 SVD를 사용해 결과가 SO(3)에 속하도록 유지한다.
  • A 그리퍼 포즈 및 개방도 추적: 그리퍼 개방도는 추적된 왼쪽 및 오른쪽 손가락 위치 사이의 Euclidean distance로 계산한다.이 개방도 신호는 interaction tracking 중 fusion된 손목 pose를 보완한다.
  • B 사전 지식: 변형 물체 중심 world models는 두 가지 패러다임을 따른다. 2D video models는 미래의 image-space 또는 latent-space 관측을 예측하는 반면, 3D particle models는 명시적 geometric dynamics를 예측한다.3D 접근법은 구조화된 geometric entities, 가장 일반적으로 particles를 사용해 물체를 표현한다.

B.1 행동 조건부 Video Models

행동 조건부 video world model은 과거 관측과 로봇 행동으로부터 미래 프레임을 예측하며, 일반적으로 계산 효율을 위해 latent diffusion을 사용한다. 본 평가에서는 Cosmos Predict 2.5 를 cross-attention을 통해 주입된 7D 로봇 행동으로 post-training한다.

  • 행동 조건부 Video Models: 이 모델은 과거 관측과 로봇 행동으로부터 미래 video frames를 예측한다.조건에는 과거 프레임 F1:t와 미래 행동 시퀀스 A1:t+k가 포함된다.
  • 행동 조건부 Video Models: Latent diffusion model은 VAE 를 사용해 RGB video를 압축된 latent representations로 인코딩하고, Diffusion Transformer 를 사용해 dynamics를 모델링한다.DiT는 과거 latent와 미래 행동을 조건으로 latent space에서 Gaussian denoising을 역으로 수행하는 방법을 학습한다.
  • 행동 조건부 Video Models: Internet-scale training을 통해 이 모델은 복잡한 visual and physical priors를 포착할 수 있다.Latent-space 연산은 computational efficiency를 향상시키기 위한 것이다.
  • 행동 조건부 Video Models: 본 평가는 DiT 기반 video model인 Cosmos Predict 2.5 를 cross-attention을 통해 DiT block에 7D robot actions를 주입하는 방식으로 post-training한다.행동 시퀀스는 6D wrist pose와 gripper openness로 구성되며, 미래 object state를 시뮬레이션할 수 있게 한다.

B.2 Particle-based Dynamics Models

Particle-based dynamics models는 deformable object를 position, velocity, attribute를 가진 particle로 표현하며, 각 particle의 state는 학습된 transition function 또는 physics-based transition function을 통해 변화한다. 이 절에서는 graph-based learning, differentiable spring-mass simulation, 그리고 평가에 사용된 구현을 다룬다.

  • Particle-based representation: Deformable object는 N particles로 표현되며, 각 particle은 position, velocity, mass나 material properties와 같은 attribute를 저장한다.System state G_t는 transition function T(G_t, A_t)를 통해 변화한다.
  • Learning-based Dynamics: Learning-based models는 대규모 trajectory로 학습한 neural network를 사용해 particle-state transition을 근사하며, graph message passing으로 상호작용을 모델링한다.평가에는 shape tracking을 위한 particle과 spatial grid를 결합한 PGND 를 사용한다.
  • Physics-based Differentiable Simulation: Physics-based differentiable models는 simulator를 learning loop에 통합하며, 일반적으로 elasticity, damping, external force를 포함하는 spring-mass systems를 사용한다.Differentiable simulation을 사용하면 prediction-error gradient를 initial state와 material properties로 backpropagation하여 physical parameter를 최적화할 수 있다.
  • Benchmark implementations: Benchmark에서는 Cosmos Predict 2.5, PhysTwin, PGND [86], 그리고 공식 구현을 사용할 수 없어 ParticleFormer를 충실하게 재현한 구현을 평가한다.앞의 세 모델은 공식 open-source 구현을 사용하며, ParticleFormer는 해당 논문의 implementation detail을 따른다.

C 다중 에피소드 일반화 시각화

Figure 9는 관측되지 않은 glove 및 sack 상호작용에서 ground-truth 시퀀스와 네 world model의 action-conditioned 예측을 비교해 다중 에피소드 일반화를 시각화한다. PhysTwin*은 최적화 기반 simulator가 관측되지 않은 에피소드를 zero-shot으로 예측할 수 없고 대신 transition의 80%를 관측하므로 다르게 평가한다.

  • 다중 에피소드 일반화 시각화: Figure 9는 관측되지 않은 glove 및 sack 상호작용에서 Cosmos, ParticleFormer, PGND, PhysTwin의 ground-truth 시퀀스와 action-conditioned 예측을 비교한다.시각화는 에피소드 일반화 설정에서 glove-cloth 및 sack-cloth 객체를 다룬다.
  • 다중 에피소드 일반화 시각화: PhysTwin*은 관측된 trajectory에서 system identification이 필요하므로 완전히 관측되지 않은 에피소드를 zero-shot으로 직접 예측할 수 없다.PhysTwin*의 경우 최적화 과정에서 transition의 80%를 관측할 수 있다.

D 데이터셋 객체 분류 체계와 다양성 … D.3 3D 체적 변형 객체

Deform360은 일상생활의 변형 가능한 객체 198개를 17개 일상 의미 범주에 걸쳐 1D, 2D, 3D 체적 클래스로 구성한다. 이 분류 체계는 매듭 형성 및 접힘부터 내부 응력에 의한 체적 변형까지 다양한 재료 반응과 상호작용 과제를 포괄한다.

  • D 데이터셋 객체 분류 체계와 다양성: Deform360은 198개 객체를 17개 일상 의미 범주에 걸쳐 28개 1D, 98개 2D, 72개 3D 체적 변형 객체로 분류한다.범주 분포는 자연스럽게 long-tailed하다.
  • D.1 1D 변형 객체: 1D 변형 객체에는 조작 중 매듭이 생기고, 서로 얽히며, 자기 가림이 발생할 수 있는 다양한 굽힘 강성, 두께, 표면 질감의 로프, 케이블, 와이어가 포함된다.두꺼운 로프형, 얇은 로프형, 강성 케이블형 하위 범주로 나뉜다.
  • D.1 1D 변형 객체: 1D 분류 체계는 높은 굽힘 강성을 지닌 두꺼운 로프형 객체, 높은 유연성을 지닌 얇은 로프형 객체, 탄성 기억과 비틀림 강성을 지닌 강성 케이블형 객체를 구분한다.예시로는 면 로프와 등반 로프, 실과 리본, USB 케이블, 호스, 체인이 있다.
  • D.2 2D 변형 객체: 2D 변형 객체는 접힘, 주름 형성, 다중 모달 접촉 동역학을 보이는 직물, 천, 의류, 종이형 재료로 구성된다.특성은 매우 순응적인 실크부터 상대적으로 강성이 높은 종이와 플라스틱까지 다양해 탄성과 소성 전반에 걸친 테스트가 가능하다.
  • D.2 2D 변형 객체: 2D 컬렉션에는 천과 직물, 의류, 가방형 및 종이형 객체, 복잡한 기하 구조나 비선형 반응을 보이는 기타 박막 셸 변형 객체도 포함된다.예시로는 셔츠, 양말, 모자, 장갑, 에어백, 쓰레기봉투, 종이가 있다.
  • D.3 3D 체적 변형 객체: 3D 체적 변형 객체는 무시할 수 없는 두께와 복잡한 내부 구조를 지니며, 봉제 인형, 봉제 동물, 폼 기반 객체를 포함한다.상호작용은 체적 보존 또는 체적 변화 형태 변화를 유발할 수 있으므로, 객체 체적 내부의 내부 응력과 장거리 의존성을 모델링해야 한다.
  • D.3 3D 체적 변형 객체: 3D 분류 체계는 봉제 동물과 봉제 인형, 그리고 밀도와 회복 속도가 다양한 폼 및 압착 가능 객체로 나눈다.예시로는 테디베어, 동물 장난감, 스펀지, 스트레스 볼, 손 소독제, 신발이 있다.

E 데이터셋 시각화

데이터셋 시각화는 동기화된 multi-view 캡처와 함께 다양한 1D, 2D, 3D volumetric deformable objects를 제시한다. 41-camera 구성은 조밀한 시점이 복잡한 상호작용을 포착하고 self-occlusion을 줄이는 방식을 보여준다.

  • E 데이터셋 시각화: Figures 10–16은 수집된 1D, 2D, 3D volumetric deformable objects를 시각화하여 데이터셋의 폭넓은 object diversity를 보여준다.시각화에는 1D, 2D, 3D deformables의 개별 예시가 포함된다.
  • E 데이터셋 시각화: Figures 14–16은 특히 3D deformables를 시각화하여 1D 및 2D objects의 single-view coverage를 보완한다.이 figure들은 volumetric deformables 전반에 걸친 데이터셋의 object-level visualization을 이어간다.
Loading 2607.05390v1…