Source-linked AI summary

RLDX-1 Technical Report

Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon Choi, Dongsu Han, Donguk Lee, Heeseung Kwon, Hojin Jeon, Jaehyun Kang, Jaekyoung Bae, Jihyuk Lee, Jimin Lee, John Won, Joonwoo Ahn, Junhyeong Park, Junyoung Sung, Kyungmin Lee, Minseong Han, Minsung Yoon, Sejune Joo, Seonil Son, Seungcheol Park, Seunggeun Cho, Seungjun Moon, Seungku Kim, Yonghoon Dong, Yongjin Cho, Youngchan Kim, Chang Hwan Kim, Dohyeon Kim, Heecheol Kim, Heewon Lee, Hensen Ahn, Hyungkyu Ryu, Hyunsoo Choi, Hyunsoo Shin, Jaeheon Jung, Jaewoo Kim, Jinwook Kim, Joochul Chang, Joonsoo Kim, Junghun Park, Jungwoo Park, Junho Cho, Junhyeok Park, Junwon Lee, Kangwook Lee, Kwanghoon Kim, Kyoungwhan Choe, Manoj Bhadu, Nayoung Oh, Sangjun Kim, Sangwoo Kim, Seunghoon Shim, Seunghyun Kim, Seungjun Lee, Seungyup Ka, Sungryol Yang, Wook Jung, Yashu Shukla, Yeonjae Lee, Yeonwoo Bae, Jinwoo Shin

arXiv:2605.03269v2cs.ROcs.AIcs.LG

TL;DR

기존 VLA는 모션 인식, 장기 메모리, 물리적 센싱이 필요한 복잡한 실세계 조작에서 여전히 한계를 보인다. RLDX-1은 통합 아키텍처를 통해 이러한 기능을 결합하고, ALLEX 휴머노이드 태스크에서 π0.5와 GR00T N1.6의 약 40% 대비 86.8%의 성공률을 달성하며 frontier VLA를 능가한다.

  • 문제

    기존 VLA는 versatile intelligence를 강조하지만, 모션 인식, 장기 메모리, 물리적 센싱이 필요한 복잡한 실세계 조작에서는 여전히 한계가 있다.

  • 방법

    RLDX-1은 MSAT의 modality-specific stream과 joint self-attention, 희귀 시나리오를 위한 합성 데이터, 3단계 학습, inference optimization을 결합한다.

  • 결과

    RLDX-1은 시뮬레이션 및 실세계 태스크 전반에서 baseline을 일관되게 능가하며, ALLEX Object-in-Box Selection에서 91.7%의 성공률을 달성한다.

  • 시사점 및 한계

    이 결과는 RLDX-1이 실세계 환경에서 human-like dexterous manipulation을 수행하는 general-purpose VLA임을 뒷받침한다.

Abstract

from arXiv · show

While Vision-Language-Action models (VLAs) have shown remarkable progress toward human-like generalist robotic policies through the versatile intelligence (i.e. broad scene understanding and language-conditioned generalization) inherited from pre-trained Vision-Language Models, they still struggle with complex real-world tasks requiring broader functional capabilities (e.g. motion awareness, long-term memory, and physical sensing). To address this, we introduce RLDX-1, a general-purpose robotic policy for dexterous manipulation built on the Multi-Stream Action Transformer (MSAT), an architecture that unifies these capabilities by integrating heterogeneous modalities through modality-specific streams with cross-modal joint self-attention. RLDX-1 further combines this architecture with system-level design choices, including data synthesis for rare manipulation scenarios, learning procedures specialized for human-like manipulation, and inference optimizations for real-time deployment. Through empirical evaluation, we show that RLDX-1 consistently outperforms recent frontier VLAs (e.g. $π_{0.5}$ and GR00T N1.6) across both simulation benchmarks and real-world tasks that require broad functional capabilities beyond general versatility. In particular, RLDX-1 shows superiority in ALLEX humanoid tasks by achieving success rates of 86.8% while $π_{0.5}$ and GR00T N1.6 achieve around 40%, highlighting the ability of RLDX-1 to control a high-DoF humanoid robot under diverse functional demands. Together, these results position RLDX-1 as a promising step toward reliable VLAs for complex, contact-rich, and dynamic real-world dexterous manipulation.

1. 서론

RLDX-1은 통합 로봇 정책에 motion awareness, long-term memory, physical sensing을 결합해 versatile visual-language intelligence를 넘어서는 dexterous manipulation을 목표로 한다. 이 시스템은 MSAT architecture를 synthetic-data augmentation, staged training, inference optimization과 결합하며, 보고된 versatile-intelligence tasks에서 주요 baseline을 능가한다.

  • 시스템 설계: RLDX-1은 통합 multimodal architecture, 희귀 시나리오를 위한 synthetic data, three-stage training, real-time control을 위한 inference optimization을 결합한다.Inference pipeline은 static graph conversion과 operator fusion을 사용하며, synthetic data는 motion consistency를 기준으로 필터링된다.
  • 신경망 아키텍처: RLDX-1은 standard versatile intelligence에 부족한 functional capabilities로 motion awareness, long-term memory, physical sensing을 다룬다.각 모듈은 video dynamics를 처리하고, 과거 observation features의 queue를 유지하며, tactile 또는 torque signals를 입력으로 받아 미래의 physical sensory signals를 예측한다.
  • 신경망 아키텍처: Multi-Stream Action Transformer는 각 modality에 전용 stream을 할당하고, joint self-attention을 통해 stream들을 결합해 action을 생성한다.이 설계는 modality-specific representations를 보존하면서 multimodal information이 예측된 actions에 공동으로 기여하도록 한다.
  • 평가 및 분석: 평가는 simulation benchmarks와 real-world humanoid 및 single-arm manipulation tasks를 아우르며, RLDX-1을 GR00T N1.6과 π0.5를 포함한 최신 VLAs와 비교한다.Benchmark는 광범위한 VLA capabilities를 평가하고, real-world tasks는 versatile intelligence와 추가적인 functional capabilities를 평가한다.
  • 평가 및 분석: RLDX-1은 versatile-intelligence tasks의 Unseen Object에서 π0.5를 능가하며 37.5%에서 54.2%로, Unseen Task에서는 45.8%에서 54.2%로 향상된다.서론은 motion awareness, long-term memory, physical sensing을 포함하는 functional-capability evaluations에서 성능 격차가 더욱 두드러진다고 보고한다.

2. Neural Architecture

RLDX-1은 temporally aware VLM, 명시적 장기 메모리, MSAT 기반 action model을 결합해 이질적 입력을 처리하고 dexterous manipulation을 수행한다. 아키텍처는 cognition tokens, motion modeling, 그리고 cross-modal joint self-attention을 지원하는 전용 modality streams를 추가한다.

  • 2.1 Temporally Aware VLM: RLDX-1-VLM은 Qwen3-VL 8B로 video와 language를 인코딩하고, robot 관련 VQA training, cognition tokens, action decoding을 위한 intermediate-layer features를 통해 이를 조정한다.cognition tokens는 video와 language tokens에 추가되는 learnable queries로, action과 관련된 representations를 추출한다.
  • 2.1 Temporally Aware VLM: VLM은 multi-frame observations와 space-time self-similarity를 계산하고 visual features를 residual 방식으로 업데이트하는 temporal module을 결합해 motion을 모델링한다.이 module은 27개 vision-encoder layers 중 9번째 layer 뒤에 삽입되며, language backbone은 과거 observations를 temporal하게 집계하고 압축한다.
  • 2.1 Temporally Aware VLM: 명시적 memory module은 action-chunk intervals마다 최근 cognition features를 캐시해, 단기 observations만으로는 task state나 progress를 파악할 수 없을 때 historical context를 제공한다.memory queue는 VLM 이후 캐시된 cognition tokens 중 마지막 nmem개를 저장한다.
  • 2.2 Multimodal Action Model: action model은 cognition, memory, proprioception, 그리고 사용 가능한 physical signals를 조건으로 하는 flow-matching Diffusion Transformer를 사용해 H + 1 future actions를 생성한다.이 모델은 noisy action chunks를 clean actions로 이동시키는 neural vector field를 학습하고, denoising에 Euler integration을 사용한다.
  • 2.2 Multimodal Action Model: MSAT는 전용 streams를 통해 cognition, action, optional physical-signal inputs를 처리하며, joint self-attention으로 cross-modal interaction을 가능하게 한다.초기 블록에서는 인지 스트림과 행동 스트림을 분리해 사용하고, 필요에 따라 물리 스트림을 추가한다. 이후 블록에서는 공동 처리를 위해 스트림을 병합한다.

3. 학습 데이터

RLDX-1은 단일 팔, 양팔, humanoid embodiment를 아우르는 상호보완적 real-world 및 synthetic robot data로 학습된다. 이 파이프라인은 폭넓은 public dataset에 tactile·torque 증강 사내 수집 데이터와 특수 manipulation 시나리오를 위한 synthetic augmentation을 결합한다.

  • 3.1 Real-World Data: RLDX-1은 단일 팔 gripper, 양팔 robot, humanoid 전반의 public manipulation dataset을 선별해 다양한 embodiment에 걸친 action prior를 구축한다.수집 데이터에는 OXE, DROID, Galaxea Open-World, Agibot World, Fourier ActionNet, Humanoid Everyday가 포함된다.
  • 3.1 Real-World Data: Public data는 20개 embodiment에 걸친 over 1M OXE trajectories, 564개 scene과 86개 task에 걸친 92K DROID trajectories, 150개 task category에 걸친 100K Galaxea trajectories로 구성된다.Agibot World는 217개 task에 걸친 over 1M trajectories를 제공하고, Fourier ActionNet은 dexterous hand를 장착한 humanoid를 위한 30K bimanual trajectories를 제공한다.
  • 3.2 In-House Data: 사내 데이터는 tactile and torque sensors를 탑재한 FR3 platform과 torque feedback을 지원하는 ALLEX humanoid를 통해 물리적 sensing을 확장하며, high-DoF dexterous manipulation을 다룬다.FR3 setup은 AnySkin gripper sensor, joint torque 측정, VR end-effector teleoperation을 사용한다. ALLEX는 7-DoF arms, 15-DoF hands, 2-DoF waist, 2-DoF neck, stereo cameras, estimated joint torques를 갖춘다.
  • 3.3 Synthetic Data: Synthetic framework는 inverse dynamics model로 action label을 생성하고, simulated rollout이 생성된 video와 일치하는 sample을 유지한다.Data generation은 scene 및 task augmentation을 결합하며, filtering에는 simulation에서의 IDM replay와 motion-consistency classifier를 사용한다.
  • 3.3 Synthetic Data: Synthetic augmentation은 직접 수집으로 확장하기 어려운 specialized scenarios를 대상으로 하며, public GR-1 및 사내 ALLEX dataset에 video generative model을 적용한다.이 framework는 VLM을 사용해 task instruction을 다양화하고 image-to-image 및 video-to-video transformation으로 scene visual을 변형한 뒤, video quality와 motion consistency를 기준으로 생성 sample을 filtering한다.

4. 학습 절차

RLDX-1은 pre-training, embodiment-specific mid-training, task-specific post-training을 거쳐 학습된다. 이 절차는 synthetic 및 teleoperated data, adaptive demonstrations, reinforcement-learning refinement를 활용해 일반 조작을 넘어 기능 범위를 확장한다.

  • 개요: RLDX-1은 세 단계, 즉 multi-embodiment pre-training, embodiment-specific mid-training, task-specific post-training을 사용해 성능을 정교화한다.Pre-training은 일반적인 action prediction을 학습하고, mid-training은 embodiment 전문성과 기능을 추가하며, post-training은 task에 맞게 policy를 특화한다.
  • Pre-training: 150K synthetic GR-1 humanoid episodes가 single-arm, dual-arm, dexterous-hand humanoid embodiment를 아우르는 이질적인 pre-training data를 보완한다.이 혼합은 embodiment-agnostic representation을 유도하는 동시에 humanoid data 부족 문제를 완화하기 위한 것이다.
  • Mid-training: Mid-training은 RLDX-1을 ALLEX과 FR3에 특화하는 동시에 motion awareness, long-term memory, physical sensing을 추가한다.ALLEX은 48-DoF humanoid이고, FR3는 single-arm gripper robot이다.
  • Mid-training: ALLEX 학습은 in-house teleoperation과 72K synthetic episodes를 5:5로 혼합하고, FR3는 92K DROID episodes와 in-house data를 8:2로 결합한다.In-house data는 새로 추가된 memory, torque 및 FR3의 tactile input만을 독점적으로 감독한다.
  • Post-training: Adaptive data collection은 base demonstrations와 failure-focused refinement를 번갈아 수행해 target real-world task에서 policy를 개선한다.Refinement 단계에서는 scenario 정의 또는 variance factor를 확장하고, 관찰된 취약점을 겨냥한 demonstrations를 수집한다.
  • Post-training: Text-based VLM critic은 native number token을 사용해 value를 autoregressively 예측하며, critic과 policy를 joint optimization하지 않고 RECAP 기반 reinforcement-learning refinement를 지원한다.RECAP은 policy rollout, dataset expansion, 두 구성요소의 개선을 번갈아 수행한다. Text critic은 새로 초기화된 value head의 adaptation 문제를 다룬다 [Tan et al., 2025; Amin et al., 2025; Liang et al., 2026].

5. 추론 전략

RLDX-1은 forward pass를 단일 CUDA Graph로 변환하고 workload-aware fused kernel을 사용해 실제 로봇 추론 지연 시간을 줄인다. 이러한 최적화는 짧은 short-prefill 실행 패턴에서 graph fragmentation, kernel-launch overhead, memory traffic을 줄이는 데 초점을 둔다.

  • 동기: 관측이 추론과 작동을 기다리는 동안 동적 장면이 변할 수 있어 결과 동작이 낡은 것이 되므로, per-step latency를 줄이는 것이 중요하다.로봇은 perception, inference, actuation의 폐루프에서 작동하므로, 지연 시간이 증가할수록 관측된 상태와 실행된 동작 사이의 불일치가 커진다.
  • Static Graph Conversion: Static graph conversion은 rotary embedding과 attention-mask 구성을 forward pass 밖으로 옮겨, single-graph capture와 추론 단계당 한 번의 launch를 가능하게 한다.고정된 deployment 설정에서는 이러한 configuration-dependent 값을 미리 계산해 재사용하므로, CUDA Graph capture 중 subgraph fragmentation이 제거된다.
  • Short-Prefill Workload: RLDX-1의 short-prefill workload는 compute-bound matmul과 memory-bound operator를 교차 배치하므로, end-to-end latency를 위해 operator grouping과 data movement가 중요하다.전체 forward pass는 autoregressive token generation 없이 한 번에 실행되며, VLM backbone과 MSAT 전반에서 sequence length가 비교적 짧다.
  • Workload-Aware Kernel Design: Workload-aware kernel은 Torch Compile의 고정된 graph-driven fusion 경로를 넘어 operator fusion, on-chip memory reuse, compute ordering을 결합한다.이 방식은 profiling으로 식별한 비효율적인 operator group을 대체하고, 나머지 구현은 Torch Compile에 맡긴다.
  • Workload-Aware Kernel Design: Operator fusion은 중간 tensor를 kernel 사이에서 반복적으로 쓰고 다시 읽는 대신 on-chip에 유지해 memory traffic을 줄인다.Fusion이 없으면 memory round-trip이 실행 시간을 지배하지만, fusion을 사용하면 입력 로딩에서 한 번, 출력 저장에서 한 번만 memory에 접근한다.

6. 평가 및 분석

RLDX-1은 최신 frontier VLA를 대상으로 시뮬레이션 및 실제 로봇 manipulation benchmark 전반에서 평가된다. 특히 까다로운 humanoid, motion-aware, instruction-following task에서 일관되게 최고 수준의 성능을 달성한다.

  • 시뮬레이션 benchmark: LIBERO에서 97.8%, SIMPLER Google-VM에서 81.5%, SIMPLER WidowX에서 71.9%를 기록하며, RLDX-1은 시뮬레이션 benchmark suite 전반에서 가장 강력한 model로 자리매김한다.RLDX-1은 single-arm manipulation과 sim-to-real visual transfer를 포함한 보고된 simulation benchmark 전반에서 최신 frontier model을 일관되게 능가한다.
  • 시뮬레이션 benchmark: GR-1 Tabletop에서 58.7%, RoboCasa365에서 32.1%를 기록해 baseline을 능가하며, RoboCasa Kitchen 성능은 62–67%의 baseline 범위를 상회한다.대부분의 baseline이 GR-1 Tabletop에서 50% 미만, RoboCasa365에서 평균 14.8–26.9%에 머무는 가운데, 까다로운 humanoid manipulation 및 diverse-task benchmark에서 우위가 가장 크게 나타난다.
  • Instruction-following task: Basic Pick-and-Place에서 50%를 기록해 π0.5 (41.7%)와 GR00T N1.6 (37.5%)를 능가하며, directional task에서는 π0.5 대비 향상이 14.6%와 12.5%에 이른다.이 결과는 제한된 training data에서 deformable-object manipulation을 수행할 때 특히 강한 instruction-following 성능을 보인다는 것을 나타낸다.
  • Motion-awareness task: RLDX-1은 Conveyor Pick-and-Place task 전반에서 최상의 성능을 달성하는 반면, GR00T N1.6은 낮은 speed에서만 평균 50.0%를 기록하고 π0.5는 unseen speed에서 평균 29.2%를 기록한다.Baseline policy는 고정되었거나 이전에 관찰한 conveyor speed를 따르는 경향을 보여, 제한된 motion awareness와 generalization을 드러낸다.
  • Motion-awareness task: Motion-aware task에서 Spin Tracking의 97.9%와 Pong Game의 81.5%는 π0.5 (32.3%)와 GR00T N1.6 (26.0%)를 크게 능가한다.Baseline은 motion onset을 감지하거나 다양한 방향에 대응하는 데 어려움을 겪는 반면, RLDX-1은 dynamic motion을 추적하고 반응한다.

7. 관련 연구

관련 연구는 modular foundation-model 접근법, synthetic data generation, 그리고 dynamic·long-horizon·contact-rich manipulation을 위한 targeted capabilities를 통해 generalist robotic policies를 발전시킨다. 이러한 연구는 robotics의 제한된 데이터 문제와 motion awareness, long-term memory, physical sensing의 필요성에 대응한다.

  • Robotics의 Foundation Models: Foundation-model 연구는 modular 접근법을 포함해 다양한 task와 environment에서 지각하고 추론하며 행동하는 인간과 유사한 generalist robotic policies를 모색한다.
  • Robot Learning을 위한 Synthetic Data: Synthetic-data 연구는 imitation learning으로 학습한 policy를 통해 simulation에서 robot trajectory를 생성함으로써 robotics에 internet-scale training data가 부족한 문제에 대응한다.
  • Robot Manipulation을 위한 Functionalities: Robot manipulation은 vision만으로는 충분하지 않은 dynamic·long-horizon·contact-rich environment를 다루기 위해 motion awareness, long-term memory, physical sensing을 필요로 한다.

8. 결론 … Model Training Pipeline

RLDX-1은 human-like dexterous manipulation을 위한 general-purpose VLA로 제시되며, real-world deployment를 위해 motion awareness, long-term memory, physical sensing을 통합한다. 기여자 섹션에서는 architecture, synthetic data, model training 전반의 리더십과 구현을 정리한다.

  • 8. 결론: RLDX-1은 general-purpose VLA에서 motion awareness, long-term memory, physical sensing을 통합해 human-like dexterous manipulation을 목표로 한다.또한 dexterous manipulation을 위한 synthetic data augmentation을 포함하지만, 제공된 결론 부분은 전체 deployment design을 자세히 설명하기 전에 끝난다.
  • A. Contributors and Acknowledgments; A.1. Main Contributors; Project Leads: 프로젝트 리더들은 data and model training, data and architecture, model architecture, synthetic data, model training 전반에 기여했다.프로젝트 리더로는 Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim이 제시됐다.
  • Research Leads: Dongyoung Kim, Huiwon Jang, Jinwoo Shin은 전반적인 연구 방향을 이끌고 기여 영역 전반의 작업을 조율했다.해당 연구 리더들이 기여자 간 영역 간 조율을 주도했다고 기술한다.
  • A.2. Core Contributors: 핵심 기여자들은 영역별로 그룹화됐으며, 역할별 설명과 여러 역할을 맡은 구성원의 반복 등재가 포함됐다.각 그룹의 이름은 first name 기준 알파벳순으로 나열됐고, architecture, synthetic data, model training pipeline 작업을 포괄했다.
  • Model Architecture: Architecture 기여자들은 MSAT, motion module, physical sensory signal integration을 설계했으며, 다른 기여자들은 초기 설계와 검증을 지원했다.명시된 기여에는 초기 단계 MSAT 설계, motion-module 구현, physical-signal integration, 그리고 해당 integration의 검증이 포함된다.
  • Synthetic Data: Synthetic-data 기여자들은 task 및 scene augmentation, ALLEX와 GR-1 data generation, inverse-dynamics 지원, motion-consistency 또는 video-quality filtering을 개발했다.또한 synthetic-data evaluation, real-world validation experiments, ALLEX에서의 video-model fine-tuning을 지원했다.
  • Synthetic Data; Model Training Pipeline: 기여자 목록은 Junyoung Sung3이 ALLEX synthetic-data generation을 지원했다고 밝히며 KAIST 소속 인턴 designation을 덧붙인다.이 내용은 synthetic-data contributor 목록과 관련 각주에 제시된다.
  • Model Training Pipeline: Model-training pipeline 팀은 multi-node VLM/VLA training을 최적화하고 refactoring을 통해 codebase를 유지보수했다.추가 작업으로 baseline-model training, asynchronous inference, ALLEX deployment, real evaluation integration, automated demo evaluation을 지원했다.

실세계 로봇 평가 및 시연 … B.1. 이미지 전처리

보고된 작업은 실세계 평가, 강화학습, 배포 최적화, 인프라, 데이터 수집, 벤치마킹, 공개 릴리스 조정, 이미지 전처리를 아우른다. 이러한 기여는 RLDX-1의 로봇 실험, 학습 및 배포 파이프라인, 벤치마크 개발, 공개 릴리스, vision-token 사용량 절감을 뒷받침한다.

  • 실세계 로봇 평가 및 시연: 실세계 평가는 motion, memory, physical sensing, task-specific data refinement를 목표로 OpenArm, ALLEX, FR3 실험을 수행했다.OpenArm 평가를 지원하고, motion-specific 및 memory-related ALLEX 실험을 설계했으며, FR3와 ALLEX에서 physical sensing을 평가하고 ALLEX task를 위한 teleoperation 데이터 분포를 정제했다.
  • 강화학습: RECAP은 실제 ALLEX 로봇에서 reinforcement-learning training, value modeling, inference functionality, evaluation을 제공했다.RL task와 value model을 설계하고, RECAP training 및 inference를 개발했으며, 실제 로봇 ALLEX 평가를 수행했다.
  • 추론 최적화 및 배포: Inference deployment는 asynchronous execution을 static-graph conversion, CUDA Graphs, Triton 및 fused-attention kernels, real-time chunking evaluation과 결합했다.최적화 파이프라인은 graph break와 kernel performance를 다루면서 deployment component를 통합하고 평가했다.
  • 학습 인프라; 로봇 제어 시스템: 학습 및 로봇 제어 인프라는 GPU와 dataset management, teleoperation, low-level control, fine-tuning data pipeline을 통해 end-to-end experimentation을 지원했다.인프라는 training automation, robot interface, teleoperation control, RB-Y1 및 OpenArm을 위한 data collection을 포함했다.
  • 로봇 하드웨어 연구 및 프로토타이핑; Teleoperation System; Teleoperation Data Collection: Teleoperation system과 data collection은 camera, video-streaming, VR, automated evaluation component를 포함해 ALLEX, OpenArm, Franka 및 simulation workflow를 지원했다.작업에는 teleoperation backbone, operating environment, 여러 로봇에 걸친 data collection, automated simulation training-inference-evaluation pipeline이 포함됐다.
  • Human Data Pipeline; Live Demo Production: Human-data pipeline은 human demonstrations의 수집, 처리, retargeting, 학습 및 통합을 구축했으며, live-demo 팀은 데이터를 수집하고 RLDX-1을 fine-tuning했다.이러한 작업은 human demonstration을 통합하고 live demonstration을 준비하기 위한 기반을 제공했다.
  • 산업 전환을 위한 Dexterity Benchmark: DexBench는 industry-conversion scenario에서 RLDX-1을 평가하기 위한 industry-oriented dexterity benchmark와 표준을 정의했다.벤치마크 작업에는 큐레이션, narrative 및 figure 방향 설정, 팀 간 산출물 정렬이 포함됐다.
  • 프로젝트 조정 및 공개 릴리스; Executive Sponsorship; B. Datasets Details; B.1. Image Preprocessing: 프로젝트 조정 및 공개 릴리스 작업은 technical narrative, demo production, licensing, end-to-end release planning을 관리했으며, 이미지 전처리는 aspect-ratio를 보존하는 32-pixel 배수를 사용해 프레임을 최대 256^2 pixels로 리사이즈했다.전처리 절차는 학습 중 vision-token budget을 줄이기 위해 Qwen3-VL의 smart_resize 접근법을 따랐다.

B.2. 공개 실제 환경 실제 데이터 세부 사항 · B.3. 합성 데이터 세부 사항 · C. 강화학습(RL) 세부 사항

RLDX-1 사전학습에는 OXE Magic Soup 혼합물이 사용되며, 합성 trajectory는 embodiment별 video model과 inverse-dynamics action annotation을 통해 생성·필터링된다. RL 후학습은 VLM critic과 반복적인 advantage 기반 policy refinement, 실시간 chunked inference를 결합한다.

  • B.2. 공개 실제 환경 실제 데이터 세부 사항: RLDX-1 사전학습에는 OXE Magic Soup Open-X-Embodiment 혼합물이 사용되며, 세부 subset 구성은 Table 5에 보고된다.이 혼합물은 Octo와 OpenVLA에서 사용한 formulation을 따른다.
  • B.3. 합성 데이터 세부 사항: 합성 데이터에는 robot demonstration으로 fine-tuning한 video generative model이 사용되며, GR-1과 ALLEX humanoid의 시점 및 manipulation dynamics에 대한 novel trajectories를 생성한다.기성 video diffusion model은 egocentric robot perspective와 manipulation dynamics를 충분히 처리하지 못하므로, embodiment별 전용 model이 필요하다.
  • B.3. 합성 데이터 세부 사항: GR-1 video model은 3,027 ActionNet videos와 92개의 공개 NVIDIA GR-1 videos로 fine-tuning하며, Qwen3-VL caption은 short, medium, long 중 하나를 무작위로 샘플링한다.Cosmos-Predict2-14B를 기반으로 하며 rank 32의 LoRA fine-tuning을 사용한다.
  • B.3. 합성 데이터 세부 사항: ALLEX video model은 in-house ALLEX, OpenArm, 3,027 ActionNet episode를 2:1:1 ratio로 혼합해 manipulation-motion coverage를 확장한다.Cosmos-Predict2.5-2B를 기반으로 하며, 더 상세한 task description을 위해 Qwen3-VL captioning을 사용한다.
  • B.3. 합성 데이터 세부 사항: 생성된 video에는 inverse-dynamics model이 action label을 부여하며, 이 model은 flow matching을 사용해 observation frame 사이의 intermediate action을 예측한다.IDM은 SigLIP-2 vision encoder를 사용하는 0.1B Diffusion Transformer다.
  • C. 강화학습(RL) 세부 사항: RL 후학습에서는 target-task success demonstration으로 Gemma3-4b-it VLM critic을 학습한 뒤, frozen vision feature와 40-action chunk를 사용해 최대 30K steps 동안 policy를 학습한다.critic은 rank r = 128의 full-target LoRA를 사용하며, policy training에는 AdamW, learning rate 1 × 10−4, global batch size 128, 5% warmup을 포함한 cosine decay가 사용된다.

D. Parameter-Efficient Fine-Tuning … E.2. Implementation Details

RLDX-1의 계산 효율적인 adaptation과 이에 상응하는 inference-time Best-of-N reasoning을 연구하며, 평가 설정, critic architecture, optimization, sampling procedure를 상세히 다룬다.

  • D. Parameter-Efficient Fine-Tuning: action model에는 LoRA를 적용하고 backbone VLM의 top-4 layers는 full fine-tuning하여, 더 적은 compute로 성능이 full fine-tuning에 근접할 수 있는지 평가한다.제공된 passage는 이 설정이 full fine-까지 회복한다고 서술하지만, 결과의 나머지 부분은 잘려 있다.
  • D. Parameter-Efficient Fine-Tuning: Table 6은 Robocasa Kitchen에서 success rate, trainable parameters, peak VRAM을 기준으로 full fine-tuning과 세 가지 PEFT 변형을 비교한다.Success rate는 세 개의 multi-frame views와 총 12개 frames를 사용해 24 tasks × 50 episodes의 평균으로 계산된다. Full FT는 backbone VLM의 top-4 layers를 학습한다.
  • E. Test-time Sampling: Best-of-N sampling은 여러 action-chunk candidates를 생성하고, 가장 높은 critic score를 받은 candidate를 실행하여 RL training을 보완하는 inference-time reasoning을 제공한다.DEAS는 offline-trained chunk-level critic을 VLA features에 적용해 이 방식을 구현한다.
  • E.1. Test-time Sampling Technique: inference에서 RLDX-1은 temperature 1.5–2.0으로 다양한 candidate chunks를 sampling하고, N candidates 중 가장 높은-Q chunk를 선택한다.VLA 설정은 τ=0.7, γ1=0.9, γ2=0.99, action chunk length H + 1 = 16, AdamW learning rate 1×10^-4, batch size 64, 30K steps를 사용한다.
  • E.2. Implementation Details: critic은 frozen post-RECAP1 RLDX-1 backbone을 사용하고, final-layer tokens를 average-pooling한 뒤 shared 64-dimensional embedding으로 projection하며, 이를 proprioceptive state와 결합한다.Value와 Q-functions는 이 representation 위에 embodiment-conditioned 4-layer MLP를 사용해 구성된다.
  • E.2. Implementation Details: Critic training은 backbone features를 caching하고 critic만 AdamW로 optimization하며, 3×10^-5 learning rate, weight decay 10^-5, batch size 64, 10k steps, 5% warmup, clipping 1.0을 사용한다.learning rate는 1, 3×10^-5, 10^-4에 대한 sweep에서 선택되었다.
  • E.2. Implementation Details: RL critic은 γ1=0.9, γ2=0.99, τ=0.7, Polyak rate 0.005를 사용하는 DEAS를 따르며, shifted rewards는 [−100, 0] 구간의 101-atom HL-Gaussian distribution을 지원한다.Scalar Q와 V values는 bin centers에 대한 expectation을 취해 decoding하며, Gaussian smoothing σ=0.75 bin-widths를 적용한다.
  • E.2. Implementation Details: BoN inference는 flow-matching noise를 temperature T ∈[1.5, 2.0]로 rescale하며, T=1.5가 최적점으로 확인되었고 candidates 간 backbone pass 하나를 공유한다.implementation은 B·N-tiled observation batch와 N(0, T^2I)에서 sampling한 noise를 사용한다.

E.3. 실험 결과 · F. Kernel Optimization · G. 평가 및 분석

RLDX-1의 test-time best-of-N sampling은 충분히 수렴하지 않은 policy의 성능을 높이지만, 더 강한 checkpoint에서는 성능을 저하시킬 수 있으며, kernel optimization은 fused operator를 unfused sequence와 비교해 문서화한다.

  • E.3. 실험 결과: Best-of-N selection은 temperature T에서 N개의 candidate action chunk를 sampling하고, learned Q-critic으로 점수를 매긴 뒤 각 decision step에서 순위가 가장 높은 chunk를 실행한다.이 방법은 test-time compute와 task performance를 맞바꾸며, action diversity와 Q value에 대한 offline analysis를 통해 보정되었다.
  • E.3. 실험 결과: Offline analysis는 RECAP3에서 N = 10개의 action을 sampling하고 그 diversity와 Q value를 비교해 Q-based selection의 효과를 평가한다.이 analysis는 temperature가 selected action 간 격차에 미치는 영향과 episode 전반에서 Q improvement가 어떻게 달라지는지를 살펴본다.
  • E.3. 실험 결과: Test-time sampling의 영향은 policy convergence에 크게 좌우된다: RECAP1의 성능을 RECAP2 수준까지 거의 높이지만, 이미 더 강한 RECAP2와 RECAP3 checkpoint의 성능은 저하시킨다.동일한 BoN configuration이 덜 수렴한 checkpoint에는 이득을 주지만 이후 checkpoint의 성능은 저하시킨다.
  • G. 평가 및 분석: 제공된 passage에는 Evaluation & Analysis subsection에 대한 구체적인 실험 주장이나 결과가 없다.subsection G에 배정된 passage에는 위에서 요약한 결과 외에 evaluation finding이 보고되지 않는다.
  • E.3. 실험 결과: 4.9 ± 1.3 attempts 대 8.5 ± 2.8 (−3.6)은 BoN sampling이 Light Bulb Twisting에서 RECAP1을 개선하는 반면, RECAP2와 RECAP3은 각각 +2.3 및 +2.2 attempts만큼 악화됨을 보여준다.평가 설정은 N = 8 및 T = 1.5이며, 결과는 Figure 23에서 RECAP1–RECAP3에 걸쳐 제시된다.
  • E.3. 실험 결과: Sample 수를 8에서 32로 늘려도 RECAP1이 추가로 개선되지 does not further improve 않으며, 이는 이득이 단순히 더 많은 candidate를 사용하는 데서가 아니라 exploration에서 비롯됨을 나타낸다.Figure 23은 sample 수를 늘렸을 때 RECAP1이 추가로 개선되지 않음을 보고한다.
  • F. Kernel Optimization: Kernel optimization은 system에서 사용되는 fused kernels를 보고하고, 각 fused operator sequence를 원래의 unfused sequence와 비교한다.Table 7은 상세한 kernel optimization 결과를 제공하고 layer ℓ의 input 및 output hidden state를 식별한다.

G.1. Simulation Benchmark 세부 사항

RLDX-1은 tabletop, kitchen, household, humanoid, robustness, perturbation 기반 manipulation을 아우르는 다양한 simulation benchmark에서 평가된다. 각 benchmark는 task-specific dataset, camera configuration, evaluation episode, baseline protocol을 사용하며, fine-tuning convention은 공통으로 적용된다.

  • Benchmarks: simulation suite는 LIBERO, LIBERO-Plus, SIMPLER Google-VM/VA, SIMPLER WidowX, RoboCasa Kitchen, GR-1 Tabletop, RoboCasa365를 포함한다.이 benchmark들은 single-arm tabletop 및 kitchen manipulation, 다양한 perturbation에 대한 robustness, humanoid tabletop task, 더 폭넓은 household manipulation을 포괄한다.
  • LIBERO: LIBERO는 Spatial, Object, Goal, Long 전반에 걸쳐 40개 task를 평가하며, 256×256 해상도의 고정 front camera와 wrist camera를 사용하고 task당 50회 trial을 수행한다.RLDX-1은 각 sub-benchmark의 training dataset을 연결한 데이터로 학습되며, average success rate를 보고한다. LIBERO는 parallel gripper가 장착된 Franka Research 3 arm을 기반으로 한다 (Liu et al., 2023).
  • LIBERO-Plus: LIBERO-Plus는 object layout, viewpoint, initial state, language, lighting, background, sensor-noise perturbation 전반에서 robustness를 측정한다.π0와 π0-FAST의 결과는 Fei et al. (2025)에서 가져왔으며, 나머지 method는 전체 10,300개 perturbation task에서 평가된다.
  • SIMPLER: SIMPLER Google-VM/VA와 WidowX는 각각 4개 task를 포함하며, randomized benchmark seed를 사용해 task당 200회 evaluation을 수행하고 average success rate를 보고한다.RLDX-1은 Google-VM/VA에 대해 Fractal에서, WidowX에 대해 BridgeV2에서 학습하며, Li et al. (2024b)의 공통 설정을 따른다.
  • RoboCasa Kitchen: RoboCasa Kitchen에는 24개의 mobile-Panda 주방 작업이 포함되며, 256×256 해상도의 고정식 외부 카메라 두 대와 손목 카메라 한 대를 사용한다.작업에는 pick-and-place, 문과 서랍 조작, 가전 제어가 포함되며, RLDX-1은 연결된 machine-generated demonstration으로 학습된다.
  • GR-1 Tabletop: GR-1 Tabletop은 24개 humanoid tabletop task를 포함하며, task당 1,000개의 machine-generated demonstration으로 학습한 뒤 task당 50개 episode에 대한 average success를 보고한다.이 benchmark는 18개의 object-rearrangement task와 6개의 articulated-object manipulation task로 구성되며, 256×256 ego-centric camera를 사용한다 (Bjorck et al., 2025).

G.2. OpenArm 실험 세부 사항 · G.3. ALLEX 실험 세부 사항 · G.4. Franka Research 3 실험 세부 사항

이 논문은 OpenArm, ALLEX, Franka Research 3에서 task-specific demonstrations, sensing modalities, hardware, evaluation protocols을 활용해 language-conditioned manipulation tasks에 대한 RLDX-1의 성능을 평가한다. 실험은 tabletop pick-and-place, high-DoF humanoid manipulation, dynamic interactions, tactile sensing, physical-signal control을 아우른다.

  • G.2. OpenArm 실험 세부 사항: OpenArm은 세 물체 tabletop scene에서 language-conditioned pick-and-place를 평가하며, 네 object category, 세 initial location, target placement instruction을 사용한다.Training category는 bottle, snack, cup, doll이며, distractor는 서로 다른 category에서 선택한다.
  • G.2. OpenArm 실험 세부 사항: OpenArm demonstration은 Directional 및 Basic PnP family에 걸쳐 Bottle to Shelf, Snack to Shelf, Cup to Dish Rack, Doll to Box를 포함한다.Bottle to Shelf와 Snack to Shelf는 Directional PnP (Shelf)이고, Cup to Dish Rack은 Directional PnP (Dish Rack)이며, Doll to Box는 Basic PnP다.
  • G.2. OpenArm 실험 세부 사항: OpenArm은 7-DoF arms, 6-DoF hands, 2-DoF neck를 갖춘 two-arm OpenArm humanoid를 사용하며, ExoArm-7 teleoperation을 통해 stereo egocentric vision을 수집한다.Setup은 neck에 장착된 ZED 2i stereo camera를 사용하고, left 및 right view를 모두 visual input으로 사용한다.
  • G.3. ALLEX 실험 세부 사항: ALLEX은 task-specific environment에서 language-conditioned manipulation을 평가하며, 과제당 24 trials를 사용하고 conveyor speed, box, desk height 및 기타 task condition을 변화시킨다.Training에서는 spatial generalization이나 language following처럼 평가 대상 functional capability와 무관한 factor를 제외한다.
  • G.3. ALLEX 실험 세부 사항: ALLEX은 dual 7-DoF arms, two 15-DoF hands, 2-DoF waist, 2-DoF neck를 포함한 48 manipulation joints를 제공하며, 모든 joint에서 egocentric vision과 torque signal을 사용한다.Benchmark는 head-mounted stereo camera만 사용하고, motor current에서 joint torque를 도출한다.
  • G.4. Franka Research 3 실험 세부 사항: Franka Research 3 실험은 과제당 24 trials로 language-conditioned manipulation을 평가하지만, Spin Tracking은 96 interactions, Pong Game은 54 interactions를 사용한다.Spin Tracking은 네 initial position에서 clockwise 및 counterclockwise motion을 다루고 success rate를 측정한다.
  • G.4. Franka Research 3 실험 세부 사항: Franka Research 3은 7-DoF arm, Robotiq 2F-85 gripper, joint torque sensing, 15-dimensional AnySkin tactile signal을 갖춘 DROID setup을 따른다.Tactile feature는 left gripper의 다섯 sensing unit에서 얻으며, 각 unit은 세 dimension을 측정한다.

G.5. 추가 ALLEX 실험

ALLEX의 양손 Pot-to-Cup Pouring grasping task에서 synthetic data와 RLDX-1을 co-finetuning하자 다양한 cup 및 coffeepot 위치에서 success가 향상됐다. Overall success는 66.7%에서 83.3%로 상승했으며, failure 감소와 full success 증가가 이를 이끌었다.

  • Training Data: 학습에는 teleoperated real demonstration과 ALLEX video generative model이 생성한 synthetic multi-turn rollout을 함께 사용했다.Real demonstration에서는 nominal location 주변의 Gaussian distribution에서 cup 및 coffeepot 위치를 샘플링했으며, synthetic generation에서는 직전 turn의 final frame을 conditioning으로 재사용했다.
  • Implementation Details: Co-finetuning 설정에서는 real data와 synthetic data를 동일한 비율로 혼합하고, 각 dataset을 대응하는 embodiment slot으로 라우팅했다.RLDX-1은 batch size 128, AdamW, learning rate 1 × 10^-4, 5% warmup, state dropout 0.4, action horizon 40으로 30K step 동안 fine-tuning했다.
  • Results: Synthetic data를 추가한 뒤 failure는 7에서 2로 감소했고 full success는 9에서 14로 증가했다.이는 다양한 cup 및 coffeepot 위치에서 spatial generalization과 stable grasping이 향상됐음을 보여준다.
  • Results: 24회의 Pot-to-Cup Pouring grasping trial에서 synthetic data를 사용한 co-finetuning으로 overall success 83.3%를 달성했으며, 이는 66.7%에서 상승한 수치다.각 trial은 full, partial, failure 중 하나로 평가했으며, 평가는 세 cup 위치와 네 coffeepot 위치, 각 configuration당 두 trial을 포함했다.

G.6. 추가 시뮬레이션 결과 / 전체 결과

이 절에서는 더 큰 training batch size가 RLDX-1의 simulation 성능을 향상한다는 점을 보고하고, LIBERO, LIBERO-Plus, SIMPLER, RoboCasa Kitchen, GR-1 Tabletop, RoboCasa365 전반의 benchmark 전체 결과를 제시한다.

  • Batch Size의 효과: 더 큰 training batch size는 simulation benchmark에서 RLDX-1의 성능을 향상한다.이 효과는 Table 10의 batch-size 비교에서 보고된다.
  • 전체 결과: LIBERO, LIBERO-Plus, SIMPLER, RoboCasa Kitchen, GR-1 Tabletop, RoboCasa365 benchmark에서 RLDX-1의 전체 결과를 제시한다.Tables 11–15는 이러한 benchmark 결과를 다루며, RoboCasa Kitchen, GR-1 Tabletop, RoboCasa365 평가의 task별 success rate를 포함한다.
  • 전체 결과: Open Stand Mixer Head에서는 92.2% success가 보고된 반면, Categorize Condiments, Gather Tableware, Heat Kebab Sandwich, Pan Transfer, Separate Freezer Rack에서는 0.0%가 보고된다.제공된 task별 결과에는 PnP Toaster to Counter의 92.0%와 Close Fridge의 88.0%도 포함된다.
Loading 2605.03269v2…