Robotics

Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,121 to 3,180 of 3,242

  1. Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

    Hongyan Feng, Sunlai Chen, Xuanyu Liu +9

    cs.ROarXiv:2608.17512v12026
  2. Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

    Bingxin Xu, Yuzhang Shang, Emilio Ferrara

    cs.ROcs.AIcs.CVarXiv:2608.16889v12026
  3. HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

    Jiahao Ji, Ji Ma, Runhan Zhang +12

    cs.ROcs.AIarXiv:2608.16222v12026
  4. GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

    Boxiang Qiu, Liliang Chen, Yue Liao +12

    cs.ROarXiv:2605.27491v12026
  5. When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

    Jiawei Liu, Jiacheng Guo, Tian Zhang +7

    cs.ROcs.AIarXiv:2608.16806v12026
  6. Neurosymbolic Embodied Agents

    Mohammad Albinhassan, Yuming Feng, Alessandra Russo +1

    cs.ROcs.AIcs.CLarXiv:2608.16794v12026
  7. X$^2$Localizer: Cross-grained Alignment for Progressive Cross-view Video Geo-localization

    Zichao Zeng, Weijia Fan, Yufan Chen +7

    cs.CVcs.AIcs.ROarXiv:2608.16658v12026
  8. Learning Varying Physical Therapist-Patient Interactions for Robot-mediated Upper Limb Task-Specific Training

    Jia Quan Loh, Vincent Crocher, Marlena Klaic +2

    cs.ROcs.LGarXiv:2608.15995v12026
  9. Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

    Yifu Yuan, Yaoting Huang, Xianze Yao +20

    cs.ROcs.AIcs.LGarXiv:2606.11324v22026
  10. World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis

    Yi Yang, Zhihong Liu, Siqi Kou +9

    cs.ROcs.AIarXiv:2606.05979v12026
  11. PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

    Yuhang Huang, Xuan Lv, Junyan Xu +25

    cs.ROarXiv:2606.18375v32026
  12. IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

    Shijie Lian, Bin Yu, Xiaopeng Lin +8

    cs.ROcs.AIcs.CLarXiv:2605.14712v22026
  13. VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

    Haolin Yang, Yuxing Long, Zihan Yang +1

    cs.ROcs.AIcs.CLarXiv:2608.15284v12026
  14. ActiveMimic: Egocentric Video Pretraining with Active Perception

    Xingyao Lin, Guojin Zhong, Tianyi Lu +4

    cs.ROcs.CVarXiv:2606.06194v12026
  15. VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

    Siyi Chen, Hugo Hadfield, Alex Zook +9

    cs.ROarXiv:2606.07723v12026
  16. NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation

    Cong Zhao, Shuai Tian, Xu Zhang +11

    cs.ROcs.AIarXiv:2608.16503v12026
  17. Trajectory-Level Automatic Curriculum Learning for Legged Locomotion on Unstructured Terrain

    Rocky Liu, Tengyu Liu, Baoxiong Jia +4

    cs.AIcs.ROarXiv:2608.16164v12026
  18. Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

    Wenyao Zhang, Bozhou Zhang, Zekun Qi +3

    cs.ROcs.CVarXiv:2604.16391v12026
  19. DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

    Hanwen Wang, Weizhi Zhao, Xiangyu Wang +11

    cs.ROarXiv:2605.16257v12026
  20. LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset

    Yousef Emami, Mohammadhossein Homaei, Hao Zhou +3

    cs.ROcs.AIarXiv:2608.15175v12026
  21. Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

    Qi Li, Bo Yin, Weiqi Huang +6

    cs.ROarXiv:2604.23775v12026
  22. FrameSkip: Learning from Fewer but More Informative Frames in VLA Training

    Bin Yu, Shijie Lian, Xiaopeng Lin +8

    cs.ROarXiv:2605.13757v12026
  23. HumanNet: Scaling Human-centric Video Learning to One Million Hours

    Yufan Deng, Daquan Zhou

    cs.CVcs.ROarXiv:2605.06747v12026
  24. WALL-WM: Carving World Action Modeling at the Event Joints

    Shalfun Li, Victor Yao, Charles Yang +28

    cs.ROcs.CVarXiv:2606.01955v12026
  25. AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models

    Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov +6

    cs.ROcs.AIarXiv:2603.10126v22026
  26. $τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

    Pengfei Zhou, Shengcong Chen, Di Chen +17

    cs.ROarXiv:2606.01027v12026
  27. When to Trust Imagination: Adaptive Action Execution for World Action Models

    Rui Wang, Yue Zhang, Jiehong Lin +4

    cs.ROcs.AIarXiv:2605.06222v22026
  28. ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

    Yining Hong, Jiageng Liu, Han Yin +5

    cs.CVcs.AIcs.CLarXiv:2605.18746v22026
  29. AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

    Jisong Cai, Long Ling, Shiwei Chu +10

    cs.ROcs.AIcs.CVarXiv:2606.09811v12026
  30. NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving

    Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li +5

    cs.CVcs.AIcs.CLarXiv:2608.14767v12026
  31. PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies

    Yufei Guo, Yinan Wu, Haoran Duan +2

    cs.ROcs.AIarXiv:2608.15285v12026
  32. HumanCLAW: Can Vision-Language Models Act Through a Body?

    Li Siyao, Jiawei Gu, Shuai Liu +15

    cs.CVcs.ROarXiv:2607.27180v22026
  33. SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

    Yang Xu, Gurpreet Singh Mukker, Raymond Wang +3

    cs.ROarXiv:2607.20207v12026
  34. RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

    Haoyu Zhao, Xingyue Zhao, Siteng Huang +3

    cs.ROarXiv:2607.06559v12026
  35. OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies

    Kelin Yu, Haode Zhang, Harish Ravichandar +2

    cs.ROcs.AIarXiv:2607.03723v12026
  36. EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

    Heqing Yang, Yang Yi, Liyao Wang +8

    cs.ROcs.CVarXiv:2607.02646v12026
  37. World Action Models: The Next Frontier in Embodied AI

    Siyin Wang, Junhao Shi, Zhaoyang Fu +11

    cs.ROcs.CLcs.CVarXiv:2605.12090v12026
  38. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

    Qiuyue Wang, Mingsheng Li, Jian Guan +37

    cs.ROcs.AIcs.CLarXiv:2605.30280v22026
  39. LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

    Jialei Chen, Kai Wang, Kang Chen +9

    cs.ROcs.AIarXiv:2606.15768v12026
  40. Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

    Jun Guo, Qiwei Li, Peiyan Li +7

    cs.ROcs.AIcs.CVarXiv:2604.26694v22026
  41. World Model for Robot Learning: A Comprehensive Survey

    Bohan Hou, Gen Li, Jindou Jia +15

    cs.ROcs.CVarXiv:2605.00080v12026
  42. RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

    Huashuo Lei, Wenxuan Song, Huarui Zhang +10

    cs.ROarXiv:2605.10921v12026
  43. MolmoAct2: Action Reasoning Models for Real-world Deployment

    Haoquan Fang, Jiafei Duan, Donovan Clay +26

    cs.ROarXiv:2605.02881v22026
  44. ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

    Yuyang Zhang, Wenyao Zhang, Zekun Qi +7

    cs.CVcs.ROarXiv:2606.19531v12026
  45. Cosmos 3: Omnimodal World Models for Physical AI

    NVIDIA, :, Aditi +293

    cs.CVcs.AIcs.LGarXiv:2606.02800v42026
  46. RocketSmith: Agentic Additive Manufacturing of High-Powered Rockets

    Peter Pak, Jesse Barkley, Rumi Loghmani +3

    cs.ROcs.MAarXiv:2606.00097v32026
  47. Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

    Guoheng Sun, Kaixi Feng, Shwai He +8

    cs.ROcs.AIarXiv:2606.27755v12026
  48. Critique of Agent Model

    Eric Xing, Mingkai Deng, Jinyu Hou

    cs.AIcs.LGcs.MAarXiv:2606.23991v12026
  49. InSight: Self-Guided Skill Acquisition via Steerable VLAs

    Maggie Wang, Lars Osterberg, Stephen Tian +3

    cs.ROcs.AIcs.LGarXiv:2606.24884v12026
  50. Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

    Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu +1

    cs.ROcs.AIarXiv:2606.26428v22026
  51. In-Context World Modeling for Robotic Control

    Siyin Wang, Junhao Shi, Senyu Fei +4

    cs.ROcs.CVarXiv:2606.26025v32026
  52. Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

    Ilia Larchenko

    cs.ROcs.AIcs.LGarXiv:2606.27163v22026
  53. Learning Transferable Dynamics Priors from Action to World Modeling

    Ze Huang, Jiahui Zhang, Hairuo Liu +3

    cs.ROarXiv:2606.29501v12026
  54. 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

    Dongyoon Hwang, Byungkun Lee, Dongjin Kim +7

    cs.ROcs.AIarXiv:2606.31329v22026
  55. Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

    Yoonhyung Park, Minji Kim, Sungwon Moon +1

    cs.CVcs.MMcs.ROarXiv:2607.00302v12026
  56. GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

    Kaiyuan Chen, Shuangyu Xie, Letian Fu +21

    cs.ROcs.AIcs.CLarXiv:2607.05369v12026
  57. SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

    Changti Wu, Bin Yu, Zhaolong Shen +6

    cs.ROarXiv:2607.06442v12026
  58. RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

    Haoyu Zhao, Xingyue Zhao, Hangyu Li +6

    cs.ROarXiv:2607.06558v22026
  59. Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

    Seulbin Hwang, Kiyoung Om, Daejung Kim +1

    cs.ROcs.LGarXiv:2607.06957v12026
  60. ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

    Jiayi Tian, Shiao Liu, Yuting Xu +30

    cs.AIcs.ROarXiv:2607.10350v32026