Source-linked AI summary

VGGT: Visual Geometry Grounded Transformer

Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, David Novotny

arXiv:2503.11651v1cs.CV

TL;DR

3D 재구성은 흔히 태스크별 모델과 비용이 큰 visual-geometry optimization에 의존한다. VGGT는 한 번의 forward pass에서 여러 장면 속성을 직접 예측하며 여러 3D 태스크에서 state-of-the-art 결과를 달성한다.

  • 문제

    기존 3D 재구성 방법은 여전히 visual-geometry optimization에 의존하며, neural network는 흔히 개별 태스크에 특화된다.

  • 방법

    VGGT는 한 장부터 수백 장의 뷰에서 카메라 파라미터, depth map, point map, 3D point track을 공동으로 예측하는 feed-forward transformer다.

  • 결과

    VGGT는 카메라 추정, multiview depth, dense point-cloud reconstruction, 3D point tracking 전반에서 state-of-the-art 성능을 달성한다.

  • 시사점 및 한계

    단순성과 효율성 덕분에 VGGT는 태스크별 post-processing optimization 없이 실시간 3D 애플리케이션에 적합하다.

  • 시사점 및 한계

    VGGT는 fisheye 또는 panoramic 이미지를 지원하지 않으며, 극단적인 회전에서 성능이 저하되고, 상당한 비강체 변형이 있을 때 실패한다.

Abstract

from arXiv · show

We present VGGT, a feed-forward neural network that directly infers all key 3D attributes of a scene, including camera parameters, point maps, depth maps, and 3D point tracks, from one, a few, or hundreds of its views. This approach is a step forward in 3D computer vision, where models have typically been constrained to and specialized for single tasks. It is also simple and efficient, reconstructing images in under one second, and still outperforming alternatives that require post-processing with visual geometry optimization techniques. The network achieves state-of-the-art results in multiple 3D tasks, including camera parameter estimation, multi-view depth estimation, dense point cloud reconstruction, and 3D point tracking. We also show that using pretrained VGGT as a feature backbone significantly enhances downstream tasks, such as non-rigid point tracking and feed-forward novel view synthesis. Code and models are publicly available at https://github.com/facebookresearch/vggt.

1. 서론

VGGT는 feed-forward transformer를 사용해 geometry post-processing에 크게 의존하지 않고 한 개에서 수백 개의 뷰로부터 포괄적인 3D 속성을 예측함으로써 직접적인 3D scene reconstruction의 난제에 대응한다. 상호 연관된 예측에 하나의 backbone을 공유하면서 여러 3D task에서 state-of-the-art 성능을 달성한다.

  • 동기: VGGT는 한 번에 두 개의 이미지만 처리하고 더 큰 이미지 집합을 재구성하려면 후처리가 필요한 DUSt3R 와 MASt3R [62]를 넘어선다.더 큰 목표는 Bundle Adjustment (BA) 와 같은 반복적 visual-geometry optimization이 필요하지 않도록 하는 것이다.
  • 기여: VGGT는 단 한 번의 forward pass로 한 개, 소수, 또는 수백 개의 뷰에서 camera parameters, depth maps, point maps, 3D point tracks를 예측한다.이 네트워크는 수 초 안에 reconstruction을 수행하며 downstream 3D task에 직접 사용할 수 있는 예측을 생성한다.
  • 방법: VGGT는 표준 대형 transformer 를 기반으로 구축되며, 3D annotation이 포함된 다수의 공개 dataset으로 학습하고 특화된 3D inductive bias 대신 frame-wise attention과 global attention을 교대로 사용한다.추가 연구를 지원하기 위해 code와 model을 공개적으로 제공한다.
  • 기여: VGGT는 하나의 공유 backbone을 사용해 상호 연관된 3D quantity를 함께 예측하며, 잠재적인 중복성에도 불구하고 전반적인 정확도를 향상한다.이는 개별 3D task에 초점을 맞추는 DepthAnything, MoGe, LRM 과 같은 model과 대조된다.
  • 결과: VGGT는 여러 3D task에서 state-of-the-art 결과를 달성하며, 해당 task 중 일부에 특화된 method보다도 품질을 크게 향상하는 경우가 많다.VGGT의 예측은 느린 post-processing optimization을 사용하는 method와 견줄 만큼 경쟁력 있고, 대체로 더 우수하다.

2. 관련 연구

이 절에서는 3D vision 연구의 확립된 흐름인 Structure from Motion, Multi-view Stereo, Tracking-Any-Point 안에서 VGGT의 위치를 설명한다. 기존 방식 또는 특정 task에 특화된 formulation과, point tracking을 위한 feature backbone으로 VGGT가 입증한 활용을 대조한다.

  • Structure from Motion: Structure from Motion은 이미지에서 camera parameters와 sparse point clouds를 추정하며, 전통적으로 image matching, triangulation, bundle adjustment를 사용한다.COLMAP 은 전통적 pipeline에 기반한 가장 널리 사용되는 framework로 제시된다.
  • Multi-view Stereo: Multi-view Stereo는 서로 겹치는 이미지에서 scene geometry를 조밀하게 재구성하며, 일반적으로 SfM으로 추정한 camera parameters를 가정하고, 전통적·optimization-based·learning-based 방법을 사용한다 [37].DUSt3R 과 MASt3R [62]은 최근 learning-based 접근법으로 소개되지만, 제공된 문단은 이후 설명 전에 잘려 있다.
  • Tracking-Any-Point: Tracking-Any-Point는 dynamic motion을 포함해 video frame 전반에서 질의된 point의 2D correspondences를 예측하며, TAP-Vid [23]의 benchmark와 이후 방법인 TAPIR [24], CoTracker [55] 등이 있다.이 task는 Particle Video 에서 시작되었고 PIPs 에 의해 다시 활성화되었다.
  • Tracking-Any-Point: VGGT의 feature는 기존 point tracker와 결합했을 때 state-of-the-art tracking performance를 달성하며, 이는 앞서 설명한 특화 tracker와 대조된다 [13].관련 방법으로는 pointwise feature를 인접 영역으로 확장하는 LocoTrack [13]이 있다.

3. 방법

VGGT는 하나의 3D 장면을 촬영한 이미지 시퀀스를 프레임별 camera parameters, depth maps, point maps, dense tracking features로 매핑하는 대규모 transformer다. 교대식 frame-wise 및 global attention 아키처는 첫 이미지를 reference frame으로 사용하며, 별도의 head가 dense geometric predictions와 공동 학습된 tracking outputs를 생성한다.

  • 문제 정식화: VGGT는 각 이미지를 camera parameters, depth, viewpoint-invariant point map, 그리고 모든 이미지에서 2D tracks를 복원하는 데 사용되는 dense features로 매핑한다.Tracking은 query point와 transformer가 생성한 dense features를 입력으로 별도 module에서 계산되며, transformer와 tracking module은 end-to-end로 공동 학습된다.
  • 좌표계: 첫 번째 입력 이미지는 reference coordinate frame을 정의하고 extrinsics는 identity로 고정된다. 그 외의 prediction은 이미지 순서에 대해 permutation equivariant하다.특수한 learnable camera 및 register token은 첫 번째 frame과 나머지 frame을 구분하고, 3D prediction을 해당 coordinate system으로 표현한다.
  • 학습 설정: 학습 중 관련 camera, depth, point map을 명시적으로 prediction하면 성능이 substantially improves performance하며, 독립적으로 추정한 depth와 camera를 결합하면 inference 시점의 3D point가 개선된다.VGGT는 reconstruction을 위해 학습 장면을 canonical coordinate와 scale variant를 선택하도록 정규화한다.
  • Architecture: Alternating-Attention은 frame-wise self-attention과 global self-attention을 교대로 적용해 이미지 내부의 activation normalization과 이미지 간 정보 통합 사이의 균형을 맞추며, 기본적으로 24개 layer를 사용한다.이 architecture는 DINO image token을 처리하고 cross-attention layer는 사용하지 않는다.
  • Prediction head: Camera prediction에는 전용 attention-and-linear head를 사용하며, DPT 기반 dense head는 depth map, point map, tracking feature, aleatoric depth uncertainty를 생성한다.Camera representation은 rotation quaternion, translation vector, field of view를 concatenation하며, principal point가 이미지 중심에 있다고 가정한다.

4. 실험

VGGT는 camera pose, multiview depth, point-map, tracking 및 downstream task 전반에서 강력한 feed-forward 성능을 보이며, optimization이나 known camera에 의존하는 방법과 대등하거나 이를 능가하는 경우가 많다. 이러한 성능은 native multiview reasoning, task decomposition, multitask supervision 및 재사용 가능한 pretrained feature에 기반한다.

  • Point Tracking: VGGT의 tracking head는 two-view 설정에 특화되지 않았음에도 ScanNet-1500 two-view matching에서 Roma를 능가한다.Two-view matching은 표준 ScanNet protocol에 따라 rigid point-tracking benchmark로 평가된다.
  • Camera Pose Estimation: VGGT는 RealEstate10K와 CO3Dv2의 모든 metric에서 경쟁 camera-pose method를 능가하면서도, feed-forward inference에서 input set당 0.2 seconds만 소요된다.비교에는 일반적으로 10 seconds 이상이 필요한 Global Alignment 또는 Bundle Adjustment 사용 method가 포함되며, learnable method는 RealEstate10K가 아니라 CO3Dv2로 학습되었다.
  • Dense MVS Estimation: VGGT는 DUSt3R 대비 DTU Overall error를 1.741에서 0.382로 낮추며, test time에 ground-truth camera가 제공되는 method에 근접한다.저자들은 이 성능 향상이 pairwise camera triangulation을 임의로 평균내는 대신 native multiview triangulation을 가능하게 하는 multiimage training 덕분이라고 설명한다.
  • Point Map Estimation: VGGT가 예측한 depth와 camera head로 point cloud를 구성하는 방식이 point-map head를 직접 사용하는 것보다 더 정확하다.저자들은 모든 output을 joint supervision으로 학습했음에도 point-map estimation을 더 단순한 depth 및 camera prediction subproblem으로 분해했기 때문이라고 설명한다.
  • Qualitative Results: VGGT는 oil painting, non-overlapping frame, repeating 또는 homogeneous texture를 포함한 까다로운 out-of-domain scene에도 잘 일반화한다.in-the-wild scene에 대한 DUSt3R과의 qualitative comparison이 제시된다.
  • Downstream Applications: Pretrained VGGT feature는 downstream task로 transfer되어 LVSM보다 적은 training data로도 경쟁력 있는 novel-view synthesis를 달성하고, TAP-Vid RGB-S tracking을 78.9에서 84.0으로 향상한다.Feature extractor는 feed-forward novel-view synthesis와 dynamic point tracking에 재사용되며, 후자의 결과는 해당 설정을 명시적으로 설계하지 않았음에도 rapid-motion video로 일반화됨을 보여준다.

5. 논의

논의에서는 VGGT의 폭넓은 유연성과 single-view 기능을 강조하는 한편, 이미지 형식, 극단적 회전, 큰 비강체 변형, 계산 비용이 큰 differentiable bundle adjustment의 한계를 지적한다. 또한 patchifying, prediction normalization, scalable inference를 위한 실용적인 runtime–memory 절충과 설계 선택을 설명한다.

  • 한계: 이 모델은 fisheye이나 panoramic 이미지를 지원하지 않고, 극단적 회전에서 성능이 저하되며, 큰 비강체 변형에서는 실패한다. 그러나 대상 데이터셋에서 fine-tuning하면 아키텍처를 거의 변경하지 않고도 이러한 한계를 해결할 수 있다.이러한 적응성은 특수한 시나리오에 적용하려면 일반적으로 test-time re-engineering을 광범위하게 수행해야 하는 기존 접근법과 대조된다.
  • Runtime과 Memory: camera head는 feature backbone 대비 runtime을 약 5%, GPU memory를 2% 추가하며, DPT head는 프레임당 평균 0.03 seconds와 0.2 GB를 사용한다.측정은 336 × 518 해상도에서 flash attention v3 를 사용해 단일 NVIDIA H100 GPU로 수행했다. Table 9에는 입력 프레임 수에 따른 backbone runtime과 peak memory가 보고되어 있다.
  • Runtime과 Memory: 메모리가 허용되면 여러 프레임을 한 번의 forward pass에서 처리할 수 있다. 반면 자원이 제한된 사용자는 프레임별로 예측할 수 있는데, 프레임 간 관계는 backbone에만 국한되고 DPT head는 독립적으로 예측하기 때문이다.Fast3R [141]에서 사용한 tensor parallelism은 여러 GPU에 걸친 inference를 가속하는 직접 적용 가능한 방법으로 제시된다.
  • Patchifying: DINOv2 patchifying은 14 × 14 convolutional tokenizer보다 우수하고, 초기 학습을 안정화하며, learning-rate나 momentum 변화에 덜 민감하므로 기본 선택으로 사용된다.이 결과는 Sec. 3.2에서 검토한 patchifying 대안에 따른 것이다.
  • Differentiable BA: VGGSfM 과 같이 검토한 differentiable bundle adjustment는 가능성을 보였지만, Theseus 를 사용한 PyTorch training을 대략 4배 느리게 만들었다. 따라서 명시적인 3D annotation 없이 supervision으로 활용할 잠재적 가치가 있음에도 제외했다.저자들은 맞춤형 가속을 향후 과제로 남기며, large-scale unsupervised training을 유망한 응용으로 제시한다.
  • Single-view Reconstruction: VGGT는 frame-wise attention을 통해 single-image reconstruction을 기본적으로 지원하며, 해당 설정을 명시적으로 학습하지 않았음에도 놀라울 만큼 좋은 결과를 얻는다.DUSt3R와 MASt3R와 달리 VGGT는 pair를 구성하기 위해 이미지를 복제할 필요가 없다.

6. 결론

VGGT는 수백 개의 입력 뷰에서 핵심 3D 장면 속성을 직접 추정하는 feed-forward neural network다. 기존의 최적화 및 후처리 대신 neural-first 접근법을 사용하면서 여러 3D vision 과제에서 state-of-the-art 결과를 달성한다.

  • 결론: VGGT는 feed-forward neural network를 사용해 수백 개의 입력 뷰에서 핵심 3D 장면 속성을 직접 추정한다.추정하는 속성에는 camera parameters, multiview depth, dense point clouds, 3D point tracks가 포함된다.
  • 결론: VGGT는 camera parameter estimation, multiview depth estimation, dense point cloud reconstruction, 3D point tracking에서 state-of-the-art 결과를 달성한다.
  • 결론: 이 접근법은 neural-first이며, 최적화와 후처리에 의존하는 기존 visual geometry methods에서 벗어난다.

부록

부록에서는 형식적 정의, 구현 세부 사항, 추가 실험, 정성적 단일 뷰 재구성 예시, 그리고 확장된 관련 연구 검토를 제공한다.

  • 부록 A: 부록 A에서는 논문의 핵심 용어를 형식적으로 정의한다.
  • 부록 B: 부록 B에서는 아키텍처와 학습 하이퍼파라미터를 포함한 포괄적인 구현 세부 사항을 제공한다.
  • 부록 C: 부록 C에서는 추가 실험과 논의를 제시한다.
  • 부록 D: 부록 D에서는 단일 뷰 재구성의 정성적 예시를 제공한다.
  • 부록 E: 부록 E에서는 관련 연구 검토를 확장한다.

A. 형식적 정의

형식화는 첫 번째 camera의 world frame을 기준으로 camera geometry를 정의하고, scene surface가 픽셀별 depth와 3D point를 산출하는 방식을 명시한다.

  • Camera Geometry: Camera extrinsics는 첫 번째 camera의 coordinate system을 world reference frame으로 사용하며, γ는 rigid transformation을 적용하고 π는 perspective projection을 적용한다.γ는 world frame의 3D point를 camera coordinate로 매핑하고, π는 변환된 point를 2D image location으로 매핑한다.
  • Scene Representation: Scene은 regular surface S_i ⊂ R3로 모델링되며, 시간에 따라 i번째 input image에 맞춰 변할 수 있다.이 image-dependent formulation은 시간에 따른 scene change를 반영한다.
  • Depth and Point Maps: 각 pixel에서 depth는 해당 위치로 projection되는 scene point 중 minimum depth이며, point map은 이에 대응하는 minimum 3D point를 선택한다.D_i(y)는 minimum projected depth로 정의되며, P_i(y)는 그 minimum을 달성하는 camera-frame point다.

B. 구현 세부사항

VGGT는 1024차원, 16-head attention layer로 구성된 24-block attention architecture와 flash attention, QKNorm [4]을 사용한다. 학습에서는 장면별로 2–24개 프레임을 샘플링하면서 배치당 48개 프레임을 유지하고, 이미지 geometry를 표준화한다.

  • Architecture: VGGT는 각각 frame-wise 및 global self-attention layer를 결합하는 24개의 attention block으로 구성된다.
  • Architecture: 각 attention layer는 DINOv2 의 ViT-L model을 따라 feature dimension 1024와 16개 head를 사용하며, flash attention과 QKNorm [4]을 적용한다.
  • Training: 학습에서는 dataset을 무작위로 선택하고 장면을 균일하게 샘플링한 뒤, 배치당 총 48개 프레임을 유지하면서 2–24개 프레임을 선택한다.
  • Training: RGB frame, depth map, point map은 긴 변을 518-pixel로 맞추도록 isotropic resizing한 뒤 principal point를 중심으로 crop한다.

C. 추가 실험

IMC phototourism camera-pose benchmark에서 VGGT는 state-of-the-art 성능을 달성하면서 경쟁 방법보다 훨씬 빠른 feed-forward 추론을 제공했다. 비교 대상에는 classical incremental SfM, VGGSFmv2, DUSt3R, MASt3R [62]가 포함됐다.

  • IMC에서의 Camera Pose Estimation: 평가에서는 direct VGGT prediction과 VGGT + BA refinement를 incremental SfM 및 최근 제안된 deep method들과 비교했다.VGGT는 camera pose를 직접 출력하는 반면, VGGT + BA는 Bundle Adjustment 단계를 추가한다.
  • IMC에서의 Camera Pose Estimation: DUSt3R 와 MASt3R [62]는 MegaDepth의 상당 부분으로 학습됐으며, 서로 다른 이미지를 사용했음에도 해당 장면은 IMC와 overlap된다.
  • IMC에서의 Camera Pose Estimation: VGGT는 challenging IMC phototourism data에서 state-of-the-art camera-pose 성능을 달성해 VGGSFmv2 [125]를 능가했다.
  • IMC에서의 Camera Pose Estimation: AUC@10은 VGGT가 71.26, VGGSFmv2가 76.82였으며, runtime은 scene당 0.2초 대 10초였다.
  • IMC에서의 Camera Pose Estimation: VGGT는 모든 accuracy threshold에서 MASt3R [62]와 DUSt3R 를 크게 능가하면서도 훨씬 빨랐다.DUSt3R와 MASt3R는 feed-forward prediction이 frame pair만 처리하기 때문에 비용이 큰 global alignment가 필요하다.

D. 정성적 예시

논문은 Fig. 7에서 단일 뷰 재구성의 정성적 예시를 제시한다.

  • D. 정성적 예시: 정성적 예시는 Fig. 7에서 단일 뷰 재구성 결과를 보여준다.

E. 관련 연구

이 절에서는 Vision Transformer와 camera pose estimation의 맥락에서 본 연구를 위치시킨다. multi-view camera pose를 위한 SfM 및 regression 기반 접근법과 함께 Vision Transformer의 도입과 발전을 조명한다.

  • Vision Transformer: ViT 이후 Vision Transformer는 단순성, 용량, 유연성, 장거리 의존성 모델링 [4] [12]에 힘입어 computer vision에서 지배적인 접근법이 되었다.Transformer는 language processing [6] [22]에서 시작되었으며, 이후 연구에서는 training, self-supervised feature, attention dynamics를 개선했다 [10] [48].
  • Camera Pose Estimation: Structure from Motion은 multi-view camera pose estimation의 지배적인 접근법으로 남아 있으며, incremental 및 global method [17]를 모두 포함한다.최근 방법들은 pose estimation을 regression으로 정식화하고 sparse-view 설정에서 유망한 결과를 보고했다 [65] [109] [112].
Loading 2503.11651v1…