Robotics
Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
3,121 to 3,180 of 3,242
Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
Hongyan Feng, Sunlai Chen, Xuanyu Liu +9
cs.ROarXiv:2608.17512v12026Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory
Bingxin Xu, Yuzhang Shang, Emilio Ferrara
cs.ROcs.AIcs.CVarXiv:2608.16889v12026HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction
Jiahao Ji, Ji Ma, Runhan Zhang +12
cs.ROcs.AIarXiv:2608.16222v12026GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation
Boxiang Qiu, Liliang Chen, Yue Liao +12
cs.ROarXiv:2605.27491v12026When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents
Jiawei Liu, Jiacheng Guo, Tian Zhang +7
cs.ROcs.AIarXiv:2608.16806v12026Neurosymbolic Embodied Agents
Mohammad Albinhassan, Yuming Feng, Alessandra Russo +1
cs.ROcs.AIcs.CLarXiv:2608.16794v12026X$^2$Localizer: Cross-grained Alignment for Progressive Cross-view Video Geo-localization
Zichao Zeng, Weijia Fan, Yufan Chen +7
cs.CVcs.AIcs.ROarXiv:2608.16658v12026Learning Varying Physical Therapist-Patient Interactions for Robot-mediated Upper Limb Task-Specific Training
Jia Quan Loh, Vincent Crocher, Marlena Klaic +2
cs.ROcs.LGarXiv:2608.15995v12026Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models
Yifu Yuan, Yaoting Huang, Xianze Yao +20
cs.ROcs.AIcs.LGarXiv:2606.11324v22026World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
Yi Yang, Zhihong Liu, Siqi Kou +9
cs.ROcs.AIarXiv:2606.05979v12026PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation
Yuhang Huang, Xuan Lv, Junyan Xu +25
cs.ROarXiv:2606.18375v32026IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation
Shijie Lian, Bin Yu, Xiaopeng Lin +8
cs.ROcs.AIcs.CLarXiv:2605.14712v22026VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments
Haolin Yang, Yuxing Long, Zihan Yang +1
cs.ROcs.AIcs.CLarXiv:2608.15284v12026ActiveMimic: Egocentric Video Pretraining with Active Perception
Xingyao Lin, Guojin Zhong, Tianyi Lu +4
cs.ROcs.CVarXiv:2606.06194v12026VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation
Siyi Chen, Hugo Hadfield, Alex Zook +9
cs.ROarXiv:2606.07723v12026NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation
Cong Zhao, Shuai Tian, Xu Zhang +11
cs.ROcs.AIarXiv:2608.16503v12026Trajectory-Level Automatic Curriculum Learning for Legged Locomotion on Unstructured Terrain
Rocky Liu, Tengyu Liu, Baoxiong Jia +4
cs.AIcs.ROarXiv:2608.16164v12026Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
Wenyao Zhang, Bozhou Zhang, Zekun Qi +3
cs.ROcs.CVarXiv:2604.16391v12026DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
Hanwen Wang, Weizhi Zhao, Xiangyu Wang +11
cs.ROarXiv:2605.16257v12026LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset
Yousef Emami, Mohammadhossein Homaei, Hao Zhou +3
cs.ROcs.AIarXiv:2608.15175v12026Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
Qi Li, Bo Yin, Weiqi Huang +6
cs.ROarXiv:2604.23775v12026FrameSkip: Learning from Fewer but More Informative Frames in VLA Training
Bin Yu, Shijie Lian, Xiaopeng Lin +8
cs.ROarXiv:2605.13757v12026HumanNet: Scaling Human-centric Video Learning to One Million Hours
Yufan Deng, Daquan Zhou
cs.CVcs.ROarXiv:2605.06747v12026WALL-WM: Carving World Action Modeling at the Event Joints
Shalfun Li, Victor Yao, Charles Yang +28
cs.ROcs.CVarXiv:2606.01955v12026AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov +6
cs.ROcs.AIarXiv:2603.10126v22026$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
Pengfei Zhou, Shengcong Chen, Di Chen +17
cs.ROarXiv:2606.01027v12026When to Trust Imagination: Adaptive Action Execution for World Action Models
Rui Wang, Yue Zhang, Jiehong Lin +4
cs.ROcs.AIarXiv:2605.06222v22026ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop
Yining Hong, Jiageng Liu, Han Yin +5
cs.CVcs.AIcs.CLarXiv:2605.18746v22026AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
Jisong Cai, Long Ling, Shiwei Chu +10
cs.ROcs.AIcs.CVarXiv:2606.09811v12026NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving
Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li +5
cs.CVcs.AIcs.CLarXiv:2608.14767v12026PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies
Yufei Guo, Yinan Wu, Haoran Duan +2
cs.ROcs.AIarXiv:2608.15285v12026HumanCLAW: Can Vision-Language Models Act Through a Body?
Li Siyao, Jiawei Gu, Shuai Liu +15
cs.CVcs.ROarXiv:2607.27180v22026SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments
Yang Xu, Gurpreet Singh Mukker, Raymond Wang +3
cs.ROarXiv:2607.20207v12026RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
Haoyu Zhao, Xingyue Zhao, Siteng Huang +3
cs.ROarXiv:2607.06559v12026OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies
Kelin Yu, Haode Zhang, Harish Ravichandar +2
cs.ROcs.AIarXiv:2607.03723v12026EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots
Heqing Yang, Yang Yi, Liyao Wang +8
cs.ROcs.CVarXiv:2607.02646v12026World Action Models: The Next Frontier in Embodied AI
Siyin Wang, Junhao Shi, Zhaoyang Fu +11
cs.ROcs.CLcs.CVarXiv:2605.12090v12026Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
Qiuyue Wang, Mingsheng Li, Jian Guan +37
cs.ROcs.AIcs.CLarXiv:2605.30280v22026LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies
Jialei Chen, Kai Wang, Kang Chen +9
cs.ROcs.AIarXiv:2606.15768v12026Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
Jun Guo, Qiwei Li, Peiyan Li +7
cs.ROcs.AIcs.CVarXiv:2604.26694v22026World Model for Robot Learning: A Comprehensive Survey
Bohan Hou, Gen Li, Jindou Jia +15
cs.ROcs.CVarXiv:2605.00080v12026RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
Huashuo Lei, Wenxuan Song, Huarui Zhang +10
cs.ROarXiv:2605.10921v12026MolmoAct2: Action Reasoning Models for Real-world Deployment
Haoquan Fang, Jiafei Duan, Donovan Clay +26
cs.ROarXiv:2605.02881v22026ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?
Yuyang Zhang, Wenyao Zhang, Zekun Qi +7
cs.CVcs.ROarXiv:2606.19531v12026Cosmos 3: Omnimodal World Models for Physical AI
NVIDIA, :, Aditi +293
cs.CVcs.AIcs.LGarXiv:2606.02800v42026RocketSmith: Agentic Additive Manufacturing of High-Powered Rockets
Peter Pak, Jesse Barkley, Rumi Loghmani +3
cs.ROcs.MAarXiv:2606.00097v32026Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
Guoheng Sun, Kaixi Feng, Shwai He +8
cs.ROcs.AIarXiv:2606.27755v12026Critique of Agent Model
Eric Xing, Mingkai Deng, Jinyu Hou
cs.AIcs.LGcs.MAarXiv:2606.23991v12026InSight: Self-Guided Skill Acquisition via Steerable VLAs
Maggie Wang, Lars Osterberg, Stephen Tian +3
cs.ROcs.AIcs.LGarXiv:2606.24884v12026Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?
Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu +1
cs.ROcs.AIarXiv:2606.26428v22026In-Context World Modeling for Robotic Control
Siyin Wang, Junhao Shi, Senyu Fei +4
cs.ROcs.CVarXiv:2606.26025v32026Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)
Ilia Larchenko
cs.ROcs.AIcs.LGarXiv:2606.27163v22026Learning Transferable Dynamics Priors from Action to World Modeling
Ze Huang, Jiahui Zhang, Hairuo Liu +3
cs.ROarXiv:2606.29501v120263D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
Dongyoon Hwang, Byungkun Lee, Dongjin Kim +7
cs.ROcs.AIarXiv:2606.31329v22026Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
Yoonhyung Park, Minji Kim, Sungwon Moon +1
cs.CVcs.MMcs.ROarXiv:2607.00302v12026GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
Kaiyuan Chen, Shuangyu Xie, Letian Fu +21
cs.ROcs.AIcs.CLarXiv:2607.05369v12026SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
Changti Wu, Bin Yu, Zhaolong Shen +6
cs.ROarXiv:2607.06442v12026RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
Haoyu Zhao, Xingyue Zhao, Hangyu Li +6
cs.ROarXiv:2607.06558v22026Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation
Seulbin Hwang, Kiyoung Om, Daejung Kim +1
cs.ROcs.LGarXiv:2607.06957v12026ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
Jiayi Tian, Shiao Liu, Yuting Xu +30
cs.AIcs.ROarXiv:2607.10350v32026