Robotics

Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

1,141 to 1,200 of 3,242

  1. Are We Ready for Service Robots? The OpenLORIS-Scene Datasets for Lifelong SLAM

    Xuesong Shi, Dongjiang Li, Pengpeng Zhao +15

    cs.ROcs.CVarXiv:1911.05603v22019
  2. Ditto: Building Digital Twins of Articulated Objects from Interaction

    Zhenyu Jiang, Cheng-Chun Hsu, Yuke Zhu

    cs.CVcs.AIcs.ROarXiv:2202.08227v32022
  3. LARC: Lazy Adaptive Reachability Certification of Robot Manipulator Trajectories

    Yu Feng, Hao Wu, Yuzhe Wang +1

    cs.ROarXiv:2608.29767v12026
  4. ArtGS: Building Interactable Replicas of Complex Articulated Objects via Gaussian Splatting

    Yu Liu, Baoxiong Jia, Ruijie Lu +3

    cs.CVcs.GRcs.LGarXiv:2502.19459v22025
  5. InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy

    Yang Tian, Yuyin Yang, Yiman Xie +13

    cs.ROarXiv:2511.16651v12025
  6. Phantom: Training Robots Without Robots Using Only Human Videos

    Marion Lepert, Jiaying Fang, Jeannette Bohg

    cs.ROarXiv:2503.00779v22025
  7. HDMI: Learning Interactive Humanoid Whole-Body Control from Human Videos

    Haoyang Weng, Yitang Li, Nikhil Sobanbabu +5

    cs.ROarXiv:2509.16757v32025
  8. Q-learning with Adjoint Matching

    Qiyang Li, Sergey Levine

    cs.LGcs.AIcs.ROarXiv:2601.14234v42026
  9. WoW: Towards a World omniscient World model Through Embodied Interaction

    Xiaowei Chi, Peidong Jia, Chun-Kai Fan +33

    cs.ROcs.CVcs.MMarXiv:2509.22642v22025
  10. Translating Natural Language to Planning Goals with Large-Language Models

    Yaqi Xie, Chen Yu, Tongyao Zhu +3

    cs.CLcs.AIcs.ROarXiv:2302.05128v12023
  11. MemER: Scaling Up Memory for Robot Control via Experience Retrieval

    Ajay Sridhar, Jennifer Pan, Satvik Sharma +1

    cs.ROcs.AIcs.LGarXiv:2510.20328v12025
  12. Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control

    NVIDIA, :, Hassan Abu Alhaija +38

    cs.CVcs.AIcs.LGarXiv:2503.14492v22025
  13. StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

    Jinhui Ye, Ning Gao, Senqiao Yang +7

    cs.ROcs.AIcs.CVarXiv:2604.11757v12026
  14. Connectivity-Aware Graph Extension for Decentralized Multi-Robot Exploration

    Béatrice Garcia Cegarra, Elena Vanneaux, Quentin Picard +1

    cs.ROarXiv:2609.00804v12026
  15. Domain Randomization and Generative Models for Robotic Grasping

    Joshua Tobin, Lukas Biewald, Rocky Duan +8

    cs.ROcs.LGarXiv:1710.06425v22017
  16. Semi-Dense 3D Reconstruction with a Stereo Event Camera

    Yi Zhou, Guillermo Gallego, Henri Rebecq +3

    cs.CVcs.ROarXiv:1807.07429v12018
  17. BayesSim: adaptive domain randomization via probabilistic inference for robotics simulators

    Fabio Ramos, Rafael Carvalhaes Possas, Dieter Fox

    cs.ROcs.LGarXiv:1906.01728v12019
  18. DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

    Zhenjie Yang, Yilin Chai, Xiaosong Jia +5

    cs.CVcs.AIcs.ROarXiv:2505.16278v22025
  19. MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation

    Zhijian Qiao, Xinjiang Wang, Jiajie Chen +5

    cs.CVcs.ROarXiv:2609.01252v12026
  20. LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent

    Jianing Yang, Xuweiyi Chen, Shengyi Qian +4

    cs.CVcs.AIcs.CLarXiv:2309.12311v12023
  21. PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs

    Soroush Nasiriany, Fei Xia, Wenhao Yu +20

    cs.ROcs.CLcs.CVarXiv:2402.07872v12024
  22. Video models are zero-shot learners and reasoners

    Thaddäus Wiedemer, Yuxuan Li, Paul Vicol +6

    cs.LGcs.AIcs.CVarXiv:2509.20328v22025
  23. GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

    GigaWorld Team, Angen Ye, Angyuan Ma +26

    cs.ROarXiv:2607.13960v32026
  24. World Simulation with Video Foundation Models for Physical AI

    NVIDIA, :, Arslan Ali +87

    cs.CVcs.AIcs.LGarXiv:2511.00062v22025
  25. VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

    Junxiang Xu, Ruisi Wang, Fanyi Pu +49

    cs.CVcs.AIcs.LGarXiv:2608.26105v12026
  26. Model-Based Reinforcement Learning for Heterogeneous Multi-Robot Task Assignment Under Distribution Shifts

    Daniel Garces, Sara Castro, Adrian Haimovich +2

    cs.ROcs.LGcs.MAarXiv:2608.21554v12026
  27. A Very Big Video Reasoning Suite

    Maijunxian Wang, Ruisi Wang, Juyi Lin +53

    cs.CVcs.AIcs.LGarXiv:2602.20159v22026
  28. RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design

    Tianxing Chen, Yuran Wang, Mingleyang Li +16

    cs.ROcs.AIarXiv:2603.01229v32026
  29. Cosmos World Foundation Model Platform for Physical AI

    NVIDIA, :, Niket Agarwal +76

    cs.CVcs.AIcs.LGarXiv:2501.03575v32025
  30. Self-Improving Vision-Language-Action Models with Data Generation via Residual RL

    Wenli Xiao, Haotian Lin, Andy Peng +9

    cs.CVcs.ROarXiv:2511.00091v12025
  31. Attention-Based Map Encoding for Learning Generalized Legged Locomotion

    Junzhe He, Chong Zhang, Fabian Jenelten +3

    cs.ROarXiv:2506.09588v12025
  32. RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

    Tianxing Chen, Yue Chen, Zixuan Li +41

    cs.ROcs.AIcs.CVarXiv:2607.04434v32026
  33. Learning Humanoid Standing-up Control across Diverse Postures

    Tao Huang, Junli Ren, Huayi Wang +6

    cs.ROcs.AIcs.LGarXiv:2502.08378v22025
  34. EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World

    Ryan Punamiya, Simar Kareer, Zeyi Liu +37

    cs.ROcs.CVarXiv:2604.07607v22026
  35. SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation

    Haoquan Fang, Markus Grotz, Wilbert Pumacay +4

    cs.ROarXiv:2501.18564v42025
  36. PointVLA: Injecting the 3D World into Vision-Language-Action Models

    Chengmeng Li, Junjie Wen, Yan Peng +3

    cs.ROcs.CVcs.LGarXiv:2503.07511v12025
  37. ADAPT: Agile Diffusion Action Priors for Robust and Steerable Online Text-Driven Humanoid Control

    Yan Wu, Chenhao Li, Kaifeng Zhao +3

    cs.ROarXiv:2609.00677v12026
  38. RL Token: Bootstrapping Online RL with Vision-Language-Action Models

    Charles Xu, Jost Tobias Springenberg, Michael Equi +4

    cs.LGcs.ROarXiv:2604.23073v22026
  39. A Survey on Vision-Language-Action Models: An Action Tokenization Perspective

    Yifan Zhong, Fengshuo Bai, Shaofei Cai +11

    cs.ROarXiv:2507.01925v12025
  40. Edge-Assisted Multi-Robot Visual-Inertial SLAM with Efficient Communication

    Xin Liu, Shuhuan Wen, Jing Zhao +2

    cs.ROcs.CVcs.MAarXiv:2603.11085v12026
  41. BeamDojo: Learning Agile Humanoid Locomotion on Sparse Footholds

    Huayi Wang, Zirui Wang, Junli Ren +4

    cs.ROcs.AIcs.LGarXiv:2502.10363v32025
  42. Variational Gaussian Process State-Space Models

    Roger Frigola, Yutian Chen, Carl E. Rasmussen

    cs.LGcs.ROeess.SYarXiv:1406.4905v22014
  43. RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation

    Shihan Wu, Xuecheng Liu, Shaoxuan Xie +81

    cs.ROarXiv:2511.17441v32025
  44. Diffusion Beats Autoregressive in Data-Constrained Settings

    Mihir Prabhudesai, Mengning Wu, Amir Zadeh +2

    cs.LGcs.AIcs.CVarXiv:2507.15857v72025
  45. Graspness Discovery in Clutters for Fast and Accurate Grasp Detection

    Chenxi Wang, Hao-Shu Fang, Minghao Gou +3

    cs.ROcs.CVarXiv:2406.11142v12024
  46. The Curious Robot: Learning Visual Representations via Physical Interactions

    Lerrel Pinto, Dhiraj Gandhi, Yuanfeng Han +2

    cs.CVcs.AIcs.ROarXiv:1604.01360v22016
  47. Inverse kinematic solution for generic 3R positional robots using Conformal Geometric Algebra

    Abhilash Nayak, Durgesh Haribhau Salunkhe

    cs.ROarXiv:2609.00311v12026
  48. NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance

    Wenzhe Cai, Jiaqi Peng, Yuqiang Yang +6

    cs.ROarXiv:2505.08712v32025
  49. SAFE: Multitask Failure Detection for Vision-Language-Action Models

    Qiao Gu, Yuanliang Ju, Shengxiang Sun +4

    cs.ROcs.AIarXiv:2506.09937v22025
  50. Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos

    Qixiu Li, Yu Deng, Yaobo Liang +14

    cs.ROcs.AIcs.CVarXiv:2510.21571v12025
  51. RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies

    Pranav Atreya, Karl Pertsch, Tony Lee +29

    cs.ROcs.LGarXiv:2506.18123v22025
  52. LightEMMA: A Longitudinal Evaluation of Vision-Language Models for Autonomous Driving

    Zhijie Qiao, Haowei Li, Zhong Cao +1

    cs.ROcs.AIarXiv:2505.00284v32025
  53. FLARE: Robot Learning with Implicit World Modeling

    Ruijie Zheng, Jing Wang, Scott Reed +18

    cs.ROcs.LGarXiv:2505.15659v12025
  54. Message-Aware Graph Attention Networks for Large-Scale Multi-Robot Path Planning

    Qingbiao Li, Weizhe Lin, Zhe Liu +1

    cs.ROcs.DCcs.LGarXiv:2011.13219v22020
  55. Visual Imitation Enables Contextual Humanoid Control

    Arthur Allshire, Hongsuk Choi, Junyi Zhang +7

    cs.ROcs.CVarXiv:2505.03729v52025
  56. Vision-Based Leader-Follower Formation Control for Cooperative UAVs in GPS-Degraded Environments

    Deekshitha Angadi, Naveena Budda, Vikas Agarwal +4

    cs.ROarXiv:2609.01420v12026
  57. Obstacle-Aware Autonomous Coverage and Navigation for Outdoor Robots

    Leonardo Gargani, Matteo Frosi, Matteo Matteucci

    cs.ROarXiv:2609.01384v12026
  58. Behavior--Realization Separation for Constrained Physical Human--Robot Interaction

    Yongyan Cao

    cs.ROeess.SYarXiv:2609.00669v12026
  59. VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

    Zhixin Wang, Chengzheyi Yao, Leyuan Liu +2

    cs.ROcs.CVarXiv:2609.00920v12026
  60. AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning

    Bo Jiang, Shaoyu Chen, Qian Zhang +2

    cs.CVcs.ROarXiv:2503.07608v12025