Source-linked AI summary

Orca: The World is in Your Mind

Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao, Huaihai Lyu, Senwei Xie, Euan Liu, Klara Tian, Tianfeng Long, Yichi Zhang, Zhengliang Cai, Ruike Chen, Jifan Zhao, Ruochuan Shi, Zihan Tang, Jing Lyu, Wenxing Tan, Ningbo Zhang, Yangtao Hu, Yuming Gao, Xiansheng Chen, Junkai Zhao, Congsheng Xu, Boan Zhu, Ziqi Wang, Yupu Feng, Qiongqiong Zhang, Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men, Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng, Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan Wang, Pengwei Wang

arXiv:2606.30534v2cs.CV

TL;DR

기존 접근법은 통합된 멀티모달 세계 상태 표현보다 서로 분리된 token, frame 또는 action을 모델링하는 경우가 많다. Orca는 next-state prediction을 통해 world latent space를 학습하고 text, image, action readout으로 이를 평가하며, pre-training 규모가 커질수록 성능이 일관되게 향상된다.

  • 문제

    핵심 연구 공백은 서로 분리된 task-specific prediction이 아니라 연속적으로 학습된 멀티모달 신호에서 변화하는 세계 상태를 모델링하는 방법이다.

  • 방법

    Orca는 next-state prediction을 통해 통합된 world latent space를 학습하며, 밀집된 video transition과 언어로 기술된 희소 event 및 VQA supervision을 결합해 멀티모달 readout을 지원한다.

  • 결과

    Orca의 pre-training 규모가 커질수록 text, image, action readout이 일관되게 향상되어, 제안한 world-learning paradigm의 실현 가능성과 확장성을 뒷받침한다.

  • 시사점 및 한계

    Orca는 모델링의 초점을 서로 분리된 출력에서 내부 world-state representation으로 전환함으로써 general-purpose world foundation model을 향한 초기 탐색적 이정표를 제시한다.

  • 시사점 및 한계

    실험은 주로 4B 및 0.8B 모델에 한정되며, 현재 학습에는 구축된 inventory data의 십분의 일만 사용된다.

Abstract

from arXiv · show

We introduce Orca, an initial instantiation of a general world foundation model. Orca learns a unified world latent space from multimodal world signals and exposes it through multimodal readout interfaces. Rather than optimizing isolated next-token, next-frame, or next-action prediction, we are centered on Next-State-Prediction modeling, offering a unified state-transition modeling route toward understanding, predicting, and acting upon the world. Orca learns through two complementary paradigms: unconscious learning captures dense natural state transitions from continuous videos, and conscious learning models sparse meaningful state transitions by language-described events and VQA supervision. For pre-training, we construct a large-scale world-learning inventory data, including 125K hours of video data and 160M event annotations. After pre-training, Orca learns a unified world latent space. To examine whether the learned latent supports downstream, we evaluate it by three representative downstream readouts: text generation, image prediction, and embodied action generation. Orca's backbone is frozen, and only the lightweight modality-specific decoders are trainable. Experiments show the scalability of the proposed paradigm and verify that stronger world latent enables stronger downstream readouts. Orca outperforms similar-sized specialized baselines. These results show that Orca, as a general world foundation model, presents a promising approach to understanding, predicting, and acting upon the world. Finally, we discuss the current limitations, aiming to provide useful insights and inspiration for the community.

1. 서론

Orca는 멀티모달 신호로부터 world latent space를 구축하는 world learner로 소개되며, 고립된 next-token, next-frame, next-action prediction을 넘어서는 지능을 다룬다. Orca는 무의식적 학습과 의식적 학습을 결합해 조밀한 자연적 상태 전이와 희소한 의미적 상태 전이를 모델링한 뒤, 멀티모달 readout을 통해 latent를 활용한다.

  • 동기: 서론은 일반 지능이 잠재 상태를 모델링하고 물리 법칙, 인과 관계, 동적 변화를 내재화하기 위해 멀티모달 세계 신호를 지속적으로 흡수해야 한다고 주장한다.이러한 동기는 Orca를 지속적으로 학습하고 스스로 진화하는 지능을 향한 초기 단계로 규정한다.
  • Orca 개요: Orca는 다운스트림 text, image, action readout을 위한 일반 인터페이스로서 멀티모달 시각 및 언어 신호로부터 world latent space를 학습한다.시각 신호에는 video와 image가 포함되며, 언어는 인과적 설명과 과업 의도를 제공한다.
  • 학습 패러다임: 무의식적 학습은 연속 video에서 next-frame latent를 예측해 라벨 태그 없이 자연적이고 조밀한 상태 전이를 포착한다.감독 신호는 연속 video 자체에서 제공된다.
  • 학습 패러다임: 의식적 학습은 텍스트 제약을 사용해 의사결정 및 과업 결과와 연결된 의미 있고 희소한 event-level 상태 전이를 학습한다.이 패러다임은 instruction 제약 아래의 상태 전이를 모델링한다.
  • 평가 범위: Orca는 과업별 SOTA를 목표로 하기보다, 제안한 패러다임의 실현 가능성과 확장성, 그리고 더 강한 world modeling이 다운스트림 readout을 향상시키는지를 평가한다.decoder post-training 동안 backbone은 고정되며, 경량 readout 모듈만 학습 가능하다.

2. Orca

Orca는 멀티모달 world signal을 latent state와 state transition으로 모델링하며, unconscious learning과 conscious learning을 사용해 조밀한 자연적 동역학과 희소한 의미 있는 동역학을 포착한다. 인코더는 통합된 world latent space를 학습하고, modality-specific decoder가 이를 readout한다.

  • Macro: Orca는 멀티모달 world signal을 latent state로 매핑하고, 보이지 않는 동역학과 명시적 조건에 의해 유도되는 transition을 모델링하며, future prediction과 past backtracking을 포함한다.Signal에는 language, vision, audio, physical measurement 및 그 밖의 human capability를 넘어선 modality가 포함될 수 있으며, 명시적 조건은 human instruction일 수 있다.
  • Encoder: Orca의 인코더는 pretrained vision-language model과 함께 visual signal과 language signal을 사용해 두 learning paradigm을 통해 통합된 world latent space를 학습한다.인코더는 state abstraction과 state transition modeling을 수행하도록 설계된다.
  • Details: Unconscious learning은 관찰만으로 조밀하고 자연적인 transition을 도출하는 반면, conscious learning은 language로 기술된 event, intention 또는 causal premise를 사용해 희소하고 의미 있는 transition을 모델링한다.Unconscious learning은 nearest-future observation을 사용하며, conscious learning은 인접한 future 또는 past event를 대상으로 삼을 수 있다.
  • Encoder: Unconscious learning에서 Orca는 current frame으로부터 next adjacent video frame의 latent representation을 예측하며, target은 frozen vision encoder로 인코딩된다.예측은 두 개의 MLP layer를 통해 생성되며 next-frame latent representation을 대상으로 학습된다.
  • Encoder: Conscious learning에서 Orca는 event-conditioned frame과 instruction으로부터 latent를 예측하고, video와 관련 question으로부터 VQA response generation도 수행한다.Event segment는 의미 있는 event로 정의되며, instruction은 인접한 future 또는 previous event를 가리킨다.
  • Decoder: Modality-specific decoder는 학습된 latent space에서 멀티모달 정보를 readout하며, decoder의 세부 사항은 Section 3.2로 미룬다.이 section에서는 decoder를 중점적으로 다루지 않는다.

3. 학습

Orca는 사전 학습에서 통합 world latent를 학습한 뒤 backbone을 고정하고, language·vision·action을 위한 경량 modality-specific readout을 학습한다. 사전 학습은 대규모 video·event·VQA 데이터에서 observation-only transition, event-conditioned transition, VQA response generation을 결합한다.

  • 학습 전략: Orca는 두 단계로 학습한다. 사전 학습에서는 world latent를 학습하고, downstream training에서는 backbone을 고정한 채 modality-specific readout module만 업데이트한다.readout은 language·vision·action 정보를 지원한다.
  • 학습 목표: 사전 학습은 transition objective를 위한 learnable query와 VQA를 위한 LM head를 사용해 observation-only state transition, event-conditioned state transition, VQA response generation을 결합한다.앞의 두 objective는 pixel을 재구성하는 대신 latent state를 감독하며, VQA에는 표준 next-token prediction을 사용한다.
  • 학습 데이터: 학습 inventory는 dense dynamics, language-described transition, world-state interpretation을 지원하는 real-world video·event·VQA 데이터로 구성된다.125K시간의 video, 160M개의 event annotation, 11.5M개의 VQA 예시를 포함하며, 이 버전에서는 video의 십분의 일만 사용된다.
  • Downstream Readout: 고정된 Orca latent를 별도의 language, image, action readout에 입력하며, trainable module은 text를 표현하고 pixel을 생성하거나 robot action chunk를 출력한다.vision readout은 frozen SD3.5 component와 MLP adaptor를 사용하고, action readout은 MLP adaptor와 DiT-based Action Expert를 사용한다.
  • 최적화: Throughput은 0.66에서 2.91 Samples/Sec/GPU로 증가하며, StarVLA 대비 약 4.4× acceleration을 달성한다.optimization 세부 사항과 결과는 Appendix D에 보고되어 있다.

4. 평가

Orca의 next-state-prediction 패러다임은 모델 크기와 pre-training 데이터에 따라 확장되며, 더 강한 frozen world latent는 zero-shot text, image, action readout을 향상시킨다. 이러한 평가 전반에서 Orca는 동일 크기 VLM과 대규모 world model 중 가장 우수한 종합 결과를 달성했으며, 상호보완적인 objective가 서로 다른 downstream capability를 형성한다.

  • Scaling analysis: pre-training video가 많아질수록 total loss가 감소하며, 4B model은 0.8B model보다 objective loss가 낮아 확장 가능한 학습을 보여준다.loss는 빠르게 수렴하지 않고 계속 하락하며, 이는 더 많은 데이터와 더 큰 모델이 지속적인 이점을 제공함을 나타낸다.
  • Scaling analysis: pre-training 데이터가 증가할수록 frozen backbone과 action-labeled pre-training data가 없는 조건에서도 text, image, action readout이 모두 향상된다.downstream 평가는 zero-shot으로 수행되며 benchmark-specific training data나 benchmark tuning을 사용하지 않는다.
  • Downstream evaluation: Orca는 동일 크기 VLM과 대규모 world model 중 가장 우수한 종합 결과를 달성해 제안한 learning paradigm의 이점을 입증한다.
  • Image prediction: Orca는 visual state-transition prediction을 향상시키며, morphology, scene consistency, contact relationship, instruction following을 유지하면서 가장 우수한 평균 PRICE 성능을 달성한다.image-generation baseline과 비교해 Orca는 irrelevant-object teleportation, hallucinated hand, 낮은 instruction adherence, prior-knowledge bias를 줄인다.
  • Action generation: Orca는 모든 out-of-distribution action setting에서 scratch부터 학습한 Qwen3.5를 능가하고, 0% success-rate baseline을 넘어서는 성능에 도달하며, pre-trained 𝜋0.5와 비교 가능한 수준을 유지한다.Orca의 trajectory는 더 많은 intermediate progress를 보이고, 덜 정체되며, execution error에서 더 효과적으로 회복한다.
  • Ablation analysis: observation, event, VQA objective를 joint로 사용하면 가장 균형 잡힌 readout을 제공하며, observation supervision은 특히 action을, event supervision은 특히 vision을 돕는다.VQA는 language interface를 보존하고 semantic grounding을 강화하며, 세 objective는 natural dynamics, semantic condition, language supervision을 제약한다.

5. 결론

Orca는 멀티모달 신호에서 학습한 통합 world latent space를 중심으로 world-learning 패러다임을 제시하고, 이를 전용 readout을 통해 노출한다. 또한 모달리티, supervision, 규모, 평가, 시간 범위, readout, 목적 함수, embodiment의 한계를 짚고, native world-state modeling과 더 폭넓은 평가를 위한 방향을 제안한다.

  • 결론: Orca는 개별 downstream task를 최적화하는 대신, 전용 readout interface를 통해 노출하기에 앞서 내부 world-state representation을 학습한다.이 패러다임은 여러 downstream capability를 지원하는 공유 world latent space로 모델링의 방향을 전환한다.
  • 논의 및 한계: Orca는 주로 vision-language signal에 의존하고, frozen ViT-space supervision을 사용하며, model scale이 충분하지 않고 benchmark coverage가 제한적이라는 한계를 가진다.논문은 더 풍부한 감각 및 물리 신호, 처음부터 수행하는 native world-space learning, 더 큰 모델, 더욱 포괄적인 real-world evaluation을 요구한다.
  • 논의 및 한계: 현재의 event annotation은 주로 short-horizon transition을 supervision하므로, 수 시간·수일 또는 그보다 긴 기간에 걸친 장기적 변화를 모델링하는 데 한계가 있다.논문은 pre-training이 진행됨에 따라 language, image, action readout 사이에 trade-off가 발생한다는 점도 지적하며, 특히 0.8B model에서 두드러진다고 설명한다.
  • 논의 및 한계: 현재 학습된 latent는 language, vision, and action을 통해서만 readout되며, loss design도 Next-State-Prediction과 충분히 일관되지 않는다.저자들은 hearing, quantum circuits, proteins, 더 단순한 supervision을 향후 확장이 필요한 영역으로 제시한다.
  • 논의 및 한계: Embodied evaluation은 엄격하지만 상대적으로 짧고 쉬운 task를 사용하므로, 더 폭넓은 embodied capability에 대한 결론을 내리는 데 한계가 있다.논문은 이를 해결된 evaluation scope가 아니라 현재 embodiment setting의 한계로 제시한다.
  • 향후 연구: 향후 연구에서는 prediction, intervention response, physical quantifiability, counterfactual inference를 포괄하는 통합 state-transition evaluation system을 제안한다.추가 방향으로는 더 많은 모달리티를 공유 state에 정렬하고, self-evolving data-generation loop를 구축하며, world representation을 scientific domain으로 확장하는 방안이 포함된다.

6. 저자 목록 · 부록

부록에는 핵심 기여자, 운영 및 데이터 역할을 맡은 기여자, 전문 자문위원, 연구 리드가 정리되어 있다. 기여 범위는 pre-training, 인프라, 평가, 실제 로봇 연구, 제품 운영, 연구 리더십을 아우른다.

  • 6.1. 핵심 기여자: 핵심 기여자는 모델 pre-training, 데이터 인프라, 평가, 실제 로봇 연구, downstream post-training에 기여한 인물로 명시되어 있다.핵심 기여자 목록에는 주요 기여자로 Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao도 포함되어 있다.
  • 6.1. 핵심 기여자: 핵심 기여 할당은 기술 개발과 평가 및 embodied deployment 책임을 구분한다.목록에 포함된 범주는 모델 pre-training, 데이터 인프라, 평가, 실제 로봇 연구, downstream post-training이다.
  • 6.2. 기여자: 추가 기여자는 인프라, 실제 로봇 데이터, 제품 및 운영, 브랜드 관리, 플랫폼 관리, 시스템 관리를 지원한다.이 기여자에는 Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men이 포함되어 있다.
  • 6.2. 기여자: 부록은 연구와 엔지니어링을 넘어 제품, 브랜드, 플랫폼, 시스템 관리 등 조직 내 역할도 인정한다.이 범주들은 기여자 목록에서 인프라 및 실제 로봇 데이터 기여와 함께 제시된다.
  • 6.3. 전문 자문위원 (영어 성의 알파벳순): 전문 자문위원은 영어 성의 알파벳순으로 나열되어 있다: Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng.부록은 이 그룹을 전문 자문위원으로 명시하고 정렬 기준을 설명한다.
  • 6.4. 연구 리드: 연구 리드는 Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan WangB, Pengwei WangB로 명시되어 있다.부록은 이 다섯 인물을 연구 리드 범주 아래에 별도로 제시한다.

A. Orca 개념 … B.2. 다음 토큰 예측

Orca는 multimodal next-state prediction을 중심으로 모델링하며, 상호보완적인 관찰 기반 전이와 의미 조건부 전이를 통해 통합된 world latent를 학습한다. 관련 연구에서는 이 정식화를 latent prediction, next-token, multimodal autoregressive 패러다임과 구분한다.

  • A. Orca 개념: Orca는 next-token, next-frame, next-action prediction에서 벗어나 이해, 예측, 개입을 위한 통합된 world latent를 모델링한다.언어, vision, action은 동일한 기저 world state에 대한 서로 다른 관찰 또는 readout으로 기능한다.
  • A. Orca 개념: Unconscious learning은 연속적인 시각 경험에서 조밀한 자연 동역학을 포착하는 반면, conscious learning은 언어, event, instruction, question을 사용해 의미 있는 state transition을 모델링한다.두 학습 방식은 인과적 설명 및 task intention과 관련된 물리적 규칙성과 의미 조건을 각각 대상으로 한다.
  • A. Orca 개념: 학습된 world latent는 설명과 추론을 위한 language, 예측과 상상을 위한 vision, 개입을 위한 action으로 readout을 지원한다.
  • B. 관련 연구: 관련 연구는 모델이 보일 수 있는 전체 downstream capability가 아니라 각 패러다임의 primary learning objective를 기준으로 구성된다.여러 capability domain을 아우르는 unified model은 지배적인 training formulation에 따라 분류된다.
  • B.1. Self-Supervised Learning: JEPA-style model은 self-supervised visual learning을 위해 semantic representation을 예측하는 반면, Orca는 latent prediction을 implicit dynamics와 explicit semantic condition하의 multimodal world-state transition으로 확장한다.이 비교에서 Orca의 observation-only state transition은 JEPA-style representation learning과 관련되지만 그보다 범위가 넓은 것으로 제시된다.
  • B.2. Next Token Prediction: 최근 multimodal system은 token prediction과 frame prediction의 경계를 흐리며, Emu3, Emu3.5 (Cui et al., 2025), BAGEL (Deng et al., 2025)은 next-token prediction 아래에서 multimodality를 통합한다.Emu3.5는 이 autoregressive 패러다임에서 지적된 느린 image generation 속도와 낮은 성능을 다룬다.
  • B.2. Next Token Prediction: autoregressive language modeling을 통해 지식을 구성하는 next-token model과 달리, Orca는 state transition을 target state로 유도하는 semantic condition으로 language를 사용한다.VQA response generation은 language interface를 유지하면서 commonsense와 semantic grounding을 강화한다.

B.3. 다음 프레임 예측 … C.1.1. 사전 학습 목적 함수 정의

Orca는 물리적으로 근거가 있고 상호작용에 의해 조건화된 상태 전이를 우선함으로써 world modeling을 frame synthesis 및 action 중심 학습과 구분한다. 사전 학습에서는 관찰 전용 및 event-conditioned latent transition과 VQA 생성을 가중 목적 함수 및 혼합 샘플링 스케줄로 결합한다.

  • B.3. 다음 프레임 예측: Image-generation model은 언어 또는 멀티모달 조건을 시각적 관찰로 매핑하고, video-generation model은 이 예측을 시간적으로 일관된 시각적 시퀀스로 확장한다.이 절에서는 이러한 model을 정적 이미지와 비디오를 아우르는 frame-level prediction 접근법으로 설명한다.
  • B.3. 다음 프레임 예측: Orca는 시각적으로 일관된 프레임을 단순히 합성하는 대신 물리적으로 제약된 상태 전이를 목표로 하며, action execution, 일관성, 개연성, 접촉 관계, instruction following을 강조한다.이러한 우선순위는 장면과 객체를 포함하는 interaction-conditioned transition에 적용된다.
  • B.4. 다음 행동 예측: action 또는 joint video-action prediction을 중심으로 하는 VLA 및 world-action model과 달리, Orca는 해당 representation을 action에 사용하기 전에 장면 변화, 객체 움직임, 국소적 물리 상호작용을 학습한다.Orca는 사전 학습 중 action label을 사용하지 않으며, world-learning-first 철학을 따른다.
  • C. Training Settings: 부록에서는 Section 3에서 설명한 training procedure의 구현 세부 사항을 제공한다.이는 제공된 본문에서 추가 절차를 명시하지 않고 training-settings 자료의 범위를 설정한다.
  • C.1.1. 사전 학습 목적 함수 정의: Orca의 사전 학습 목적 함수는 관찰 전용 상태 전이 loss, event-conditioned 상태 전이 loss, VQA response-generation loss를 결합한다.앞의 두 loss는 예측된 visual latent를 frozen vision-encoder latent에 맞추며, VQA는 표준 next-token prediction을 사용한다.
  • C.1.1. 사전 학습 목적 함수 정의: Lpre = 0.1 Lobs + 0.5 Levt + 0.4 Lvqa이며, 상태 전이 샘플과 VQA 샘플은 약 5 : 1 비율로 혼합한다.Event-conditioned loss는 언어 조건으로 선택한 인접한 이전 및 이후 event state를 향한 전이를 평균한다.

C.1.2. Query-Based Implementation … C.2.3. Action Readout

부록에서는 Orca의 query-based state-transition 구현과 downstream readout interface를 구체화한다. 이러한 readout은 경량 modality-specific training component를 사용해 language, image generation, robot action prediction을 통해 학습된 latent를 드러낸다.

  • C.1.2. Query-Based Implementation: Orca는 학습된 query를 사용해 observation-only transition을 구현하며, query의 hidden state는 two-layer visual transition head로 들어가고 target latent는 frozen vision encoder에서 얻는다.v_t와 Query 1이 주어지면 모델은 시간상 다음 frame의 latent를 예측하며, ground-truth latent는 frozen VLM vision encoder에서 얻는다.
  • C.1.2. Query-Based Implementation: event-conditioned transition에서는 instruction이 transition 방향과 target event를 지정하고, Query 2가 해당 instruction-conditioned predictive state를 read out한다.모델은 previous-event 및 next-event 방향을 사용해 instruction이 지정한 target event에서 무작위로 선택된 frame의 latent를 예측한다.
  • C.1.3. Pre-Training Hyperparameters: Table C1은 Orca의 pre-training hyperparameter를 model-scale, optimization, objective-specific setting으로 구성한다.부록에서는 주요 pre-training hyperparameter의 출처로 Table C1을 제시한다.
  • C.2.1. Language Readout: language readout은 VLM backbone의 language-modeling head를 재사용해 VQA, event interpretation, causal explanation에 대한 response를 autoregressive하게 생성한다.추가 trainable module은 도입하지 않으며, visual observation과 instruction을 입력으로 받는다.
  • C.2.2. Vision Readout: vision readout은 Orca가 예측한 visual latent를 MLP adaptor를 거쳐 pretrained Stable Diffusion 3.5 decoder에 넣고, VAE와 MMDiT weight는 고정한 채 adaptor와 decoder-attention LoRA만 학습한다.adaptor는 latent를 SD3.5의 joint conditioning space로 projection하며, 학습 중 target image는 768 × 768로 resize한다.
  • C.2.3. Action Readout: action readout은 flow-matching loss를 사용하는 DiT-based Action Expert로 Orca latent, time embedding이 포함된 noisy action, proprioception으로부터 short-horizon robot action chunk를 예측한다.ground-truth action chunk에는 Gaussian-noise perturbation을 적용하며, expert는 이에 대응하는 velocity를 예측한다.

D. 인프라 … E.2. 이미지 예측

Orca의 인프라 재설계는 분산화, 메모리 효율화, 통신 중첩 기법을 통해 멀티모달 학습의 높은 메모리 및 통신 비용을 해결한다. 제공된 평가 지문은 텍스트 생성 벤치마크와 baseline을 정의하지만, E.2 이미지 예측의 설정이나 결과를 설명하는 지문은 없다.

  • D. 인프라: Orca의 인프라는 분산 sharding, 메모리 효율적 실행, 통신 최적화를 통해 멀티모달 학습 병목을 해결한다.학습에는 visual embedding, language modeling, future visual-latent prediction, action-related branch가 통합되므로 standard VLM training보다 메모리 압박과 통신 비용이 증가한다.
  • D. 인프라: FSDP2는 parameter, gradient, optimizer-state sharding을 유연하게 지원하며, resharding은 peak GPU memory를 줄이고 sharding하지 않은 lightweight block은 불필요한 통신 오버헤드를 방지한다.이러한 변경은 DeepSpeed backend를 대체하며, training stability를 유지하면서 multi-GPU 효율을 높이는 것을 목표로 한다.
  • D. 인프라: Activation recomputation은 추가 연산과 상당한 activation-memory 절감을 맞바꾸어, 메모리 제약 상황에서 더 큰 batch size를 사용하고 throughput을 높인다.모든 intermediate activation을 유지하는 대신 선택한 activation 경계를 checkpointing하고 backpropagation 중 재구성한다.
  • D. 인프라: Chunked cross-entropy loss는 token dimension을 분할해 전체 logits tensor의 materialization을 방지하며, long-sequence 및 large-vocabulary 설정에서 peak memory를 줄인다.이 방법은 VLM forward stage에서 log-softmax intermediate tensor로 인해 발생하는 메모리 급증을 해결한다.
  • D. 인프라: Forward/backward pre-fetching은 다음 layer의 parameter all-gather와 현재 layer의 연산을 중첩해, 통신으로 인한 GPU idle time을 줄이고 device utilization을 높인다.이 기법은 FSDP2 all-gather operation으로 드러나는 stall을 해결한다.
  • D. 인프라: H100 GPU에서 2.91 samples/sec/GPU는 FSDP2 baseline보다 3.0×, StarVLA training pipeline보다 4.4× 높다.이 결과는 Table D1에 설명된 최적화된 인프라에서 얻어졌다.
  • E.1. 텍스트 생성: 텍스트 생성은 MVBench, TemporalBench, 3DSRBench를 사용해 평가하며, video understanding, 세밀한 temporal dynamics, 3D spatial reasoning을 포괄한다.MVBench는 multiple-choice QA를 사용하고, TemporalBench는 temporal property와 operational prediction을 평가하며, 3DSRBench는 height, location, orientation, multi-object reasoning을 평가한다.
  • E.1. 텍스트 생성: 텍스트 생성 baseline에는 latent world-model baseline인 V-JEPA 2.1과 unified discrete-token multimodal baseline인 Emu3가 포함된다.V-JEPA 2.1은 spatially grounded하고 temporally consistent한 visual understanding을 강조하는 반면, Emu3는 image, text, video 전반에서 next-token prediction을 사용한다.

E.2.1. 벤치마크 … E.3. 행동 생성

이 논문은 PRICE-V0.1을 사용해 실제 상호작용을 위한 instruction-conditioned image-to-image state prediction을 평가하며, 수행된 행동, 장면 일관성, 물리적으로 타당한 상태 변화를 중시하는 judge 기반 점수를 활용한다. 또한 embodied action outcome을 중심으로 과제를 정의하고, image-prediction 시스템을 기존 generative baseline과 비교한다.

  • E.2.1. 벤치마크: PRICE-V0.1은 초기 이미지에서 지시된 실제 상호작용을 수행한 뒤 모델이 목표 상태를 생성할 수 있는지 평가한다.이는 상호작용 시나리오를 위해 설계된 instruction-conditional image-to-image generation task다.
  • E.2.1. 벤치마크: 이 벤치마크는 AgiBot-World, HomeInteract, PE-Video, PSI-Ego의 robot 및 first-person interaction data를 instruction, initial-image, target-image sample과 결합한다.HomeInteract는 가정 환경에서 dual-arm wheeled robot이 수집한 closed-source data다.
  • E.2.2. 메트릭: 생성 결과는 Gemma 4-31B가 instruction following, scene consistency, resulting action execution을 평가해 1에서 5까지의 정수 점수를 부여한다.평가에는 Gemini 3.1 Pro, GPT 5.4, Doubao Seed 2.0 Pro도 closed-source system으로 사용된다.
  • E.3. 행동 생성: embodied action에서는 실행된 것이 아니라 순간이동한 것처럼 보이는 이미지에 감점을 적용하며, agent pose, position, contact state가 변하지 않은 경우를 포함한다.진행 중이거나 불완전한 실행도 허용하며, 경미한 occlusion이나 detail loss는 허용된다.
  • E.2.2. 메트릭: 점수 산정은 전체 1–5 범위를 사용하며, 경미한 blur, texture shift, 작은 artifact, 부분적 모호성만으로 결과를 자동 탈락시키지 않는다.이를 통해 의도한 결과를 평가할 수 있다면 제한적인 시각적 결함에는 관대한 평가가 이루어진다.
  • E.2.2. 메트릭: 이 메트릭은 moving, opening, picking up, lifting objects와 같은 명령된 state changes를 정확히 묘사하면서 입력 장면을 보존할 것을 요구한다.평가자는 일관성을 판단할 때 원래의 environment, viewpoint, major-object layout을 고려한다.
  • E.2.3. 베이스라인: Image prediction은 OmniGen2 (Wu et al., 2026)와 FLUX.1-Kontext (Black Forest Labs et al., 2025)를 기준으로 평가되며, 두 모델 모두 multimodal image-generation 또는 editing baseline으로 제시된다.OmniGen2는 text와 image를 위한 별도의 readout pathway를 사용하고, FLUX.1-Kontext는 in-context generation과 editing을 위한 flow-matching model이다.

E.3.1. 실제 로봇 벤치마크 … F. 추가 시각화

실제 로봇 평가는 다섯 가지 조작 과제, 통제된 OOD 설정, 상호보완적 metric, 동일 조건의 baseline을 통해 Orca를 검증한다. 상세 결과와 시각화는 과제 진행과 실패 복구를 강조한다.

  • E.3.1. 실제 로봇 벤치마크: Orca는 다섯 가지 양팔형 바퀴 달린 휴머노이드 조작 과제에서 평가되며, action-expert post-training을 위해 과제당 실제 로봇 trajectory 200개를 수집했다.과제는 Take Book, Stacked Bowls, Pull Out Tissue, Stamp, Scoop Sugar다.
  • E.3.2. Metric: 실제 로봇 성능은 과제별 rule-based completion score와 진행도 및 실행 품질을 진단하는 trajectory-level PRM-asa-Judge를 함께 사용해 평가한다.Rule-based score는 종료 전에 완료한 가장 높은 단계를 센다.
  • E.3.3. Baseline: Orca는 V-JEPA 2.1, Qwen3.5, π0.5와 비교되며, frozen backbone을 사용하고 앞의 두 비교에서는 과제당 trajectory 200개로 학습한 동일한 설정의 action expert를 사용한다.V-JEPA 2.1, Qwen3.5, Orca의 action expert는 무작위 초기화하고 global batch size 128로 20k step 동안 학습했다.
  • E.3.1. 실제 로봇 벤치마크: 이 벤치마크는 본 적 없는 tablecloth와 background 설정을 통해 environment OOD를, 의미적으로 관련 있지만 본 적 없는 task object 또는 container를 통해 object OOD를 검증한다.Environment OOD에서는 task object와 instruction을 변경하지 않는다.
  • E.3.4. 상세 실제 로봇 결과: 상세 appendix 결과는 실제 로봇 OOD 설정에서 수동으로 설계한 rule-based 기준에 따른 task-level completion을 보고한다.각 과제는 60초 이내에 평가하며, 심각한 충돌이나 복구할 수 없는 object fall이 발생하면 평가를 중단한다.
  • E.3.5. 추가 정성적 시각화: 추가 trajectory 시각화는 실패 trial에서도 Orca가 더 높은 중간 진행도를 유지하고 중간 grasp failure에서 복구하는 모습을 보여준다.예시는 Stamp, Pull Out Tissue, Stacked Bowls, Scoop Sugar를 포함한다.
  • F. 추가 시각화: 정성적 실패 사례에서 Orca는 멈추기 전에 Qwen3.5나 π0.5보다 조작 단계를 더 멀리 진행한다.예시는 stamp transport, tissue grasping, bowl stacking을 포함한다.
  • F. 추가 시각화: Scoop Sugar에서 Orca는 실패한 spoon grasp를 재시도하고 결국 복구할 수 있지만, Qwen3.5는 효과적인 재 grasp 없이 흔들리며 JEPA는 대부분 정체된 상태로 남는다.시각화는 부분적 복구와 반복적인 복구 시도를 모두 보여준다.

F.1. 텍스트 생성의 크로스 벤치마크 능력 분석

Orca의 크로스 벤치마크 텍스트 생성 능력은 상태 전이, 상식 추론, 공간 관계, 동적 움직임을 아우른다. 다양한 비디오 질문에서 Orca가 Qwen보다 인과·시간적 추론, 공간 추론, 움직임 추론을 더 강하게 수행하는 사례가 나타난다.

  • 능력 차원: Orca의 크로스 벤치마크 능력은 상태 전이, 상식 추론, 공간 관계, 동적 움직임을 포괄한다.이 차원들은 개별 벤치마크의 경계를 넘어서는 일반화된 능력으로 정의된다.
  • 상태 전이: Orca는 Qwen이 다른 답을 선택하는 상태 전이 질문에서 단기적인 결과를 정확히 예측한다.Orca는 시작 버튼을 누른 뒤 복사 과정에 대해 “A”, 문이 열리는 상황에 대해 “D”라고 답한 반면, Qwen은 각각 “D”와 “A”라고 답한다.
  • 상식 추론: Orca의 우위는 보이는 장면을 넘어 추론하고 가상의 결과를 유추해야 하는 복잡한 상식 VQA에서 특히 두드러진다.제공된 사례는 상식 추론을 크로스 벤치마크 능력으로 제시하지만, 구체적인 상식 답변 쌍은 제공하지 않는다.
  • 동적 움직임: Orca는 Qwen이 다른 방향을 선택하는 상황에서 노란색 큐브의 이동 방향을 정확히 식별하며 더 강한 동적 움직임 추론을 보인다.이 사례는 무의식적 학습을 통해 습득한 시간적 연속성과 움직임 관성이 더 강한 전방 시뮬레이션을 가능하게 한다고 설명한다.
  • 공간 관계: Orca는 거리, 근접성, 방향에 관한 질문에서 공간 관계를 처리하며, 세 사례 중 두 사례에서 Qwen을 능가한다.Orca는 탱크와 깃발 사이의 거리 및 트럭이 향한 방향에 관한 질문에서 Qwen과 다른 답을 내놓지만, 신호등의 근접성 질문에서는 두 모델이 같은 답을 한다.
Loading 2606.30534v2…