Source-linked AI summary
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan
TL;DR
단안 비디오만 사용할 수 있는 경우 visual-based 3D spatial intelligence는 여전히 어렵다. Spatial-MLLM은 semantic 및 structure-aware visual encoder를 spatial frame sampling과 결합해 여러 spatial understanding benchmark에서 state-of-the-art 성능을 달성한다.
문제
단안 비디오에서 visual-based 3D spatial intelligence가 어려운 이유는 각 프레임이 부분적인 장면 관측만 제공하고, 표준 encoder가 세밀한 구조적 단서를 포착하지 못하기 때문이다.
방법
Spatial-MLLM은 2D semantic encoder, geometry-initialized spatial encoder, connector 기반 fusion, space-aware frame sampling, spatial question-answering 데이터에 대한 supervised training을 결합한다.
결과
Spatial-MLLM은 여러 visual-based spatial understanding 및 reasoning benchmark에서 state-of-the-art 성능을 달성한다.
시사점 및 한계
이 모델은 추가적인 3D 또는 2.5D 입력 없이 순수한 2D visual input만으로 spatial understanding과 reasoning을 수행한다.
시사점 및 한계
평가는 visual-based spatial intelligence에 초점을 맞추므로, spatial structural information이 일반적인 video understanding 및 reasoning에 제공하는 이점은 탐구하지 않는다.
Abstract
from arXiv · showhide
Recent advancements in Multimodal Large Language Models (MLLMs) have significantly enhanced performance on 2D visual tasks. However, improving their spatial intelligence remains a challenge. Existing 3D MLLMs always rely on additional 3D or 2.5D data to incorporate spatial awareness, restricting their utility in scenarios with only 2D inputs, such as images or videos. In this paper, we present Spatial-MLLM, a novel framework for visual-based spatial reasoning from purely 2D observations. Unlike conventional video MLLMs which rely on CLIP-based visual encoders optimized for semantic understanding, our key insight is to unleash the strong structure prior from the feed-forward visual geometry foundation model. Specifically, we propose a dual-encoder architecture: a pretrained 2D visual encoder to extract semantic features, and a 3D spatial encoder-initialized from the backbone of the visual geometry model-to extract 3D structure features. A connector then integrates both features into unified visual tokens for enhanced spatial understanding. Furthermore, we propose a space-aware frame sampling strategy at inference time, which selects the spatially informative frames of a video sequence, ensuring that even under limited token length, the model focuses on frames critical for spatial reasoning. Beyond architecture improvements, we construct a training dataset from multiple sources and train the model on it using supervised fine-tuning and GRPO. Extensive experiments on various real-world datasets demonstrate that Spatial-MLLM achieves state-of-the-art performance in a wide range of visual-based spatial understanding and reasoning tasks. Project page: https://diankun-wu.github.io/Spatial-MLLM/.
1 서론
Spatial-MLLM은 2D 입력만으로 visual-based 3D spatial intelligence를 구현하며, 추가적인 3D 또는 2.5D 데이터에 의존하는 접근법의 한계를 해결한다. Semantic 및 structural visual feature를 space-aware frame sampling과 결합해 visual-based spatial understanding 및 reasoning task 전반에서 state-of-the-art 성능을 달성한다.
- 동기와 기여: Spatial-MLLM은 3D 또는 2.5D 입력 없이 visual-based 3D spatial intelligence를 향상한다.이는 2D 시각 입력만 사용할 수 있는 실제 환경을 대상으로 한다.
- 아키텍처: Dual-encoder와 connector는 표준 2D visual encoder에서 얻은 semantic feature와 feed-forward visual geometry foundation model로 초기화한 spatial encoder에서 얻은 structural feature를 통합한다.Geometry model은 범용 video MLLM visual encoder를 보완하는 강력한 structure prior를 제공한다.
- 추론 전략: Space-aware frame-sampling strategy는 VRAM 제한 등으로 input length가 제약될 때 spatially informative한 video frame을 선택한다.이 전략은 feed-forward visual geometry model의 정보를 활용해 제한된 input length에서 성능을 향상한다.
- 결과: Spatial-MLLM은 ScanQA, SQA3D 및 기타 visual-based spatial understanding 및 reasoning benchmark 전반에서 state-of-the-art 성능을 달성한다.이 모델은 폭넓은 visual-based spatial understanding 및 reasoning task에서 평가된다.
2 관련 연구
관련 연구는 일반적인 vision-language 융합에서 3D 장면 이해로 발전해 왔지만, 순수한 2D 입력만으로 visual-based 3D spatial reasoning을 수행하는 연구와 그 평가는 상대적으로 충분히 탐구되지 않았다. 새로운 benchmark는 video MLLM에서 spatial, kinematic, egocentric, spatiotemporal reasoning을 점점 더 폭넓게 평가한다.
- 2D Multimodal Large Language Models: MLLM은 token-level fusion, feature-level fusion 또는 MLP projection을 통해 vision과 language를 연결한다.BLIP-2 와 Flamingo 는 token-level fusion과 feature-level fusion을 사용하며, LLaVA, MiniGPT-4 [41] 및 후속 모델 [42] [43]은 MLP를 사용한다.
- 3D Scene Understanding: 3D MLLM은 point-cloud feature, 3D detector, object-centric representation 또는 기타 scene-level 3D input을 사용해 이러한 모델을 확장한다.이 절에서는 LL3DA, Grounded 3D-LLM [45], Chat3D [46], LEO [47], Chat-Scene, 3D-LLM, Scene-LLM [49]을 대표적인 접근법으로 제시한다.
- Visual-based 3D Spatial Intelligence: Visual-based 3D spatial intelligence는 순수한 2D visual input으로부터 3D 구조와 spatial relationship을 추론하려 하지만, 이 방향은 여전히 상대적으로 충분히 탐구되지 않았다.기존 video MLLM은 주로 2D 이해를 목표로 하며, visual-based 3D reasoning은 3D question answering [6] [53]과 robotic manipulation 같은 task를 통해 연구되어 왔다.
- Visual-based 3D Spatial Intelligence: 새로운 benchmark는 평가 범위를 spatial reasoning에서 physics, egocentric intelligence, motion dynamics, 4D spatiotemporal interaction으로 확장한다.Physics-aware question에는 velocity estimation이 포함되며, Ego-ST Bench [55]는 egocentric spatial intelligence를 평가하고 VLM4D 는 trajectory prediction과 motion dynamics를 평가한다.
3 방법
Spatial-MLLM은 dual-encoder architecture와 connector를 통해 semantic 2D feature와 dense 3D structural feature를 결합해 공간 이해와 추론을 수행한다. 또한 공간적으로 유익한 video frame을 선택하고, supervised fine-tuning 후 GRPO training을 적용한 구축형 spatial QA dataset을 사용한다.
- 3.1 Architecture: Spatial-MLLM은 Qwen2.5-VL 기반 2D encoder, VGGT-initialized 3D spatial encoder, connector, LLM backbone으로 구성된 dual-encoder architecture를 사용한다.2D branch는 의미적으로 풍부한 feature를 추출하고, spatial branch는 frame-wise 및 global self-attention을 사용해 frame 간 정보를 집계한다.
- 3.1 Architecture: Connector는 spatial 및 temporal 차원에서 3D feature를 2D feature에 정렬한 뒤, 경량 MLP-based design을 사용해 이를 unified visual tokens로 융합한다.입력 frame의 구조 정보를 포착하는 dense 3D feature만 fusion에 사용한다.
- 3.2 Space-Aware Frame Sampling: Space-aware frame sampling은 covered voxel을 최대화해 긴 scene video에서 공간적으로 유익한 Nk개 frame을 선택하며, 2,000개를 초과하는 frame으로 구성된 video를 8–32개 frame만으로 표현해야 하는 입력 문제를 해결한다.이 방법은 Nm개 frame을 균일하게 subsample하고, VGGT head로 camera 및 depth 정보를 decode한 뒤, greedy maximum coverage를 사용한다. 실제로는 Nm = 128 및 Nk = 16이다.
- 3.3 Training: Training dataset은 ScanQA, SQA3D 및 ScanNet training scene을 기반으로 추가로 자체 구축한 data에서 수집한 약 120k개의 visual-based 3D spatial QA pair로 구성된다.각 item은 question, answer, video ID 및 metadata로 표현된다.
- 3.3 Training: Training은 먼저 두 visual encoder를 모두 frozen한 상태에서 connector와 LLM backbone이 2D 및 3D feature를 융합하도록 supervised fine-tuning을 적용한 뒤, long-CoT spatial reasoning을 위해 cold start와 GRPO를 수행한다.GRPO는 question마다 여러 output을 sample하고 formatting reward와 task-dependent reward를 사용한다.
4 실험
Spatial-MLLM은 4.9B parameters와 16 frames만 사용하면서도 VSI-Bench에서 proprietary 및 open-source video MLLM을 크게 앞서며, ScanQA와 SQA3D에서는 video-input 및 task-specific model을 능가한다. Ablation 결과, space-aware sampling은 spatial coverage와 성능을 향상시키고, 제안 architecture와 dataset은 spatial reasoning을 강화하는 것으로 나타난다.
- VSI-Bench 결과: 4.9B parameters와 16 input frames만 사용함에도 Spatial-MLLM은 VSI-Bench에서 모든 proprietary 및 open-source MLLM을 유의하게 앞서며, substantially larger model도 능가한다.Gemini-1.5 Pro가 남은 model 중 가장 강력하며, Spatial-MLLM의 16 frames 대신 1 FPS로 video를 sampling한다.
- ScanQA 및 SQA3D 결과: Spatial-MLLM은 ScanQA와 SQA3D 모두에서 보고된 모든 metric에 걸쳐 모든 video-input 및 task-specific model을 유의하게 앞선다.평가는 common practice에 따라 ScanQA validation set과 SQA3D test set을 사용한다.
- Space-aware Frame Sampling의 효과: Space-aware frame sampling은 동일한 frame 수에서 uniform sampling을 일관되게 앞서며, sampled frame 수를 늘리면 두 strategy 모두에서 성능이 향상된다.비교는 VSI-Bench에서 8, 16, 32 frames를 대상으로 수행된다.
- Space-aware Frame Sampling의 효과: Space-aware sampling은 더 큰 spatial coverage를 갖는 frame을 선택하는 반면, uniform sampling은 일시적인 region을 놓치고 static-camera 구간에서 중복된 viewpoint를 생성할 수 있다.시각화에는 VGGT가 예측한 point map을 사용한다.
5 결론
Spatial-MLLM은 semantic encoder와 structure-aware encoder를 space-aware frame sampling과 결합해 순수한 2D visual input만으로 spatial understanding과 reasoning을 가능하게 한다. 이 모델은 기존 video MLLM보다 성능이 향상되며, 향후에는 model size와 training data를 확장하고 visual-based spatial intelligence를 넘어 평가 범위를 넓힐 수 있다.
- 결론: Spatial-MLLM은 semantic cue와 spatial cue를 결합한 dual-encoder 설계를 통해 순수한 2D visual input에서 spatial understanding과 reasoning을 가능하게 한다.spatial encoder는 visual geometry foundation model에서 초기화된다.
- 결론: Space-aware frame sampling은 제한된 input 제약에서도 성능을 더욱 향상시킨다.
- 한계와 향후 연구: 이 모델은 광범위한 visual-based spatial understanding 및 reasoning task에서 기존 video MLLM보다 성능이 향상된다.
- 한계와 향후 연구: 향후 연구에서는 Spatial-MLLM의 model size와 training data를 확장하고 visual-based spatial intelligence를 넘어 적용 범위를 넓힐 수 있다.현재 모델은 관련 visual-based dataset과 benchmark에 한정해 학습 및 평가된다.
기술 부록 및 보충 자료 · 더 넓은 영향
Spatial-MLLM은 순수한 2D 시각 입력만으로 3D spatial reasoning을 가능하게 하여, 고비용의 3D 데이터 없이도 spatial awareness를 갖춘 AI에 대한 접근성을 넓힐 가능성이 있다. 그러나 이를 배포할 때는 data privacy와 윤리적 고려사항을 다뤄야 한다.
- 더 넓은 영향: Spatial-MLLM은 순수한 2D 시각 입력만으로 3D understanding을 가능하게 한다.이 capability는 multimodal large language models의 spatial reasoning을 발전시킨다.
- 더 넓은 영향: 이 접근법은 고비용의 3D data를 요구하지 않고도 spatially aware AI에 대한 접근성을 넓힐 수 있다.
- 더 넓은 영향: 잠재적 적용 분야로는 robotics, autonomous systems, visual content understanding이 있다.
- 더 넓은 영향: 이 capability는 robotics에서 spatially aware AI를 지원할 수 있다.
- 더 넓은 영향: 이 capability는 autonomous systems에서 spatially aware AI를 지원할 수 있다.
- 더 넓은 영향: 이 capability는 visual content understanding을 위한 spatially aware AI를 지원할 수 있다.
- 더 넓은 영향: 긍정적인 사회적 결과를 보장하려면 data privacy와 윤리적 배포를 계속 중요하게 고려해야 한다.다른 vision-language models와 마찬가지로 이러한 고려사항이 적용된다.
B 추가 방법 세부사항 · B.1 Space-Aware Frame Sampling 세부사항 · B.2 Feature Fusion 세부사항
이 방법은 장면 기하를 재구성하고, 3D coverage를 voxelization하며, 정보량이 높은 frame을 greedy하게 선택하는 space-aware frame sampling을 추가한다. 또한 feature fusion은 대응하는 spatial-temporal merging을 통해 2D 및 3D encoder token을 정렬한다. Sampling 절차는 VGGT 기반 geometry를 사용하며 128개 후보 중 최대 16개 frame을 선택한다.
- B.1 Space-Aware Frame Sampling 세부사항: Space-aware frame sampling은 장면 기하 전처리, voxelization 및 coverage 계산, greedy maximum-coverage selection으로 구성된다.이 절차는 세 개의 연속 단계로 spatially informative한 video frame을 식별하도록 설계된다.
- B.1 Space-Aware Frame Sampling 세부사항: Sampler는 각 video를 균일하게 subsampling하여 128개 후보 frame으로 만든 다음, VGGT 를 사용해 geometry feature를 계산하고 depth reprojection으로 3D point map을 재구성한다.각 재구성 point에는 depth-head confidence value도 부여된다. Depth와 camera reconstruction은 point map을 직접 decoding하는 것보다 더 정확한 것으로 보고된다.
- B.1 Space-Aware Frame Sampling 세부사항: Sampler는 유효한 scene point를 둘러싸는 3D bounding box를 구성하고 이를 voxel로 이산화하며, voxel size를 box의 minimum dimension의 1/20로 적응적으로 설정한다.Scale factor는 λ로 제어되며 λ는 20으로 설정된다. 각 frame의 coverage는 해당 frame의 유효한 point로부터 계산된다.
- B.2 Feature Fusion 세부사항: 두 encoder 모두 spatial patch size 14를 사용하며, fusion 전에 2D encoder는 인접한 spatial token과 연속한 두 frame의 token을 각각 merge한다.이 병합으로 register token과 camera token을 제외하면 2D encoder의 sequence는 3D encoder의 token 수의 정확히 여덟 분의 일로 줄어든다.
- B.2 Feature Fusion 세부사항: Greedy algorithm은 selected frame, covered voxel, remaining candidate를 초기화한 뒤, coverage gain이 최대인 candidate를 반복적으로 추가하고 이 집합들을 갱신한다.Candidate pool이 소진되거나 남은 어떤 frame도 새로운 voxel coverage를 추가하지 못하면 selection을 종료한다.
- B.2 Feature Fusion 세부사항: 각 greedy 선택 후 algorithm은 선택된 frame의 voxel을 covered set에 union하고, 해당 frame을 candidate에서 제거한 뒤, selected index를 반환한다.이러한 갱신은 space-aware sampling에 대해 설명된 반복적 coverage maximization 절차를 구현한다.
B.3 데이터셋 구축 세부 사항 · B.4 Cold Start 세부 사항
데이터셋은 전처리, spatial-semantic metadata 계산, 다양한 spatial QA 생성 과정을 거쳐 ScanNet 동영상으로부터 구축된다. GRPO 전에 200-step cold start를 수행하며, 필터링된 multi-path reasoning 생성 결과를 사용해 2,459개의 training item을 만든다.
- B.3 데이터셋 구축 세부 사항: 데이터셋 구축은 과 유사한 방식으로 video preprocessing, metadata computation, QA pair generation의 세 단계로 진행된다.
- B.3 데이터셋 구축 세부 사항: Raw ScanNet scan을 640 × 480 해상도의 24-FPS videos로 변환하고, scene geometry를 정렬한 뒤 Open3D point cloud로 변환한다.
- B.3 데이터셋 구축 세부 사항: Metadata computation에서는 정렬된 scan과 annotation으로부터 room dimension과 center, 그리고 object-level oriented bounding box 및 semantic information을 산출한다.
- B.3 데이터셋 구축 세부 사항: 생성된 QA task는 object counting, object 및 room size, absolute 및 relative distance, appearance order, relative direction을 다룬다.
- B.3 데이터셋 구축 세부 사항: Relative-direction question에서는 position, facing, query triple로부터 horizontal angle을 계산한 뒤, 난이도에 따라 이를 directional class로 이산화한다.
- B.4 Cold Start 세부 사항: GRPO 전에 모델은 chain-of-thought annotation이 포함된 spatial reasoning dataset을 사용해 200-step cold start를 수행한다.
- B.4 Cold Start 세부 사항: 각 training item에 대해 Qwen2.5-VL-72B 가 K개의 독립적인 reasoning-answer pair를 생성하며, 이를 채점하고 global threshold가 아니라 question type별로 adaptively filtered한다.
- B.4 Cold Start 세부 사항: Ns = 5000개의 item에 K = 3을 적용한 결과, cold start set에는 2459개의 item이 남는다. 이는 question type별 generation의 대략적인 상위 50%를 보존하고 zero-reward output은 제거한 결과다.
B.5 SFT 및 GRPO 학습 세부 사항
SFT와 GRPO는 형식 및 과제별 reward를 사용하고, reasoning 길이 reward를 추가로 적용하며, Qwen2.5-VL 에 기반한 단계별 prompt를 사용한다. 과제 reward는 정답 유형에 따라 달라지며, exact match, 수치 정확도, 정규화된 서술형 답변 유사도를 포함한다.
- Reward 계산: 과제별 reward는 객관식 질문에 exact match, 수치 과제에 평균 상대 정확도, 서술형 답변에 Levenshtein-ratio 유사도를 사용한다.수치 채점은 값을 정규화하고, 0으로 나누는 것을 방지하기 위해 ϵ = 10−8을 사용하며, 임계값 T = {0.50, 0.55, ..., 0.95}에서 평가한다. 서술형 답변에는 정규화된 텍스트와 Levenshtein library를 사용한다.
- 기타 세부 사항: 두 단계 모두 Qwen2.5-VL의 기본 system prompt 를 사용하며, SFT에는 질문 및 유형 template를 추가하고 GRPO에는 질문 후속 문자열과 유형 template를 추가한다.실험은 80G NVIDIA A800 GPU가 장착된 Intel(R) Xeon(R) Gold 6430 시스템에서 수행한다.
C 추가 실험 · C.1 VSI-Bench 추가 결과
Figures 7–10은 Spatial-MLLM이 다양한 task 유형에 걸쳐 추론하고, 최종 답을 생성하며, self-verification과 task decomposition을 활용함을 보여 주는 정성적 VSI-Bench 예시를 제공한다.
- C.1 VSI-Bench 추가 결과: Spatial-MLLM은 Figures 7–10에서 VSI-Bench dataset에 대해 정성적으로 평가된다.
- C.1 VSI-Bench 추가 결과: 예시는 서로 다른 VSI-Bench task 유형을 다룬다.
- C.1 VSI-Bench 추가 결과: Spatial-MLLM은 이러한 task 전반에서 visual information을 활용해 추론한다.
- C.1 VSI-Bench 추가 결과: 모델은 visual reasoning을 통해 최종 답을 생성한다.
- C 추가 실험: Spatial-MLLM은 추론 과정에서 self-verification을 수행한다.
- C 추가 실험: Spatial-MLLM은 추론 과정에서 task decomposition을 수행한다.
C.2 ScanQA 및 SQA3D 추가 결과
Spatial-MLLM은 공간 추론 데이터로 학습된 모델을 포함해 ScanQA와 SQA3D에서 비디오 입력 모델을 일관되게 능가한다. 4.9십억 개의 파라미터만으로도 두 벤치마크와 여러 metric에서 Qwen2.5-VL-72B를 능가한다.
- C.2 ScanQA 및 SQA3D 추가 결과: Spatial-MLLM은 LLaVA-Video-7B 와 Oryx-34B [53]를 포함한 모든 video-input 모델을 ScanQA와 SQA3D에서 일관되게 능가한다.이 비교 모델들은 학습 과정에서 ScanQA 와 같은 공간 추론 데이터셋을 활용한다.
- C.2 ScanQA 및 SQA3D에 대한 추가 결과: +2.3 EM-1, +17.6 BLEU-1, +24.9 CIDEr: Spatial-MLLM은 4.9십억 개의 파라미터만 사용하면서도 ScanQA에서 Qwen2.5-VL-72B 를 능가한다.이러한 향상은 보고된 여러 ScanQA metric에 걸쳐 나타난다.
- C.2 ScanQA 및 SQA3D 추가 결과: +4.2 EM-1 및 +7.8 EM-R1 overall: Spatial-MLLM은 Is (+15.3)와 Which (+13.9)를 포함한 모든 SQA3D 질문 유형에서 Qwen2.5-VL-72B 를 능가한다.보고된 SQA3D 향상에는 전체 질문과 질문 유형별 category 전반의 평균 성능이 포함된다.