Robotics
Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
1,141 to 1,200 of 3,242
Are We Ready for Service Robots? The OpenLORIS-Scene Datasets for Lifelong SLAM
Xuesong Shi, Dongjiang Li, Pengpeng Zhao +15
cs.ROcs.CVarXiv:1911.05603v22019Ditto: Building Digital Twins of Articulated Objects from Interaction
Zhenyu Jiang, Cheng-Chun Hsu, Yuke Zhu
cs.CVcs.AIcs.ROarXiv:2202.08227v32022LARC: Lazy Adaptive Reachability Certification of Robot Manipulator Trajectories
Yu Feng, Hao Wu, Yuzhe Wang +1
cs.ROarXiv:2608.29767v12026ArtGS: Building Interactable Replicas of Complex Articulated Objects via Gaussian Splatting
Yu Liu, Baoxiong Jia, Ruijie Lu +3
cs.CVcs.GRcs.LGarXiv:2502.19459v22025InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy
Yang Tian, Yuyin Yang, Yiman Xie +13
cs.ROarXiv:2511.16651v12025Phantom: Training Robots Without Robots Using Only Human Videos
Marion Lepert, Jiaying Fang, Jeannette Bohg
cs.ROarXiv:2503.00779v22025HDMI: Learning Interactive Humanoid Whole-Body Control from Human Videos
Haoyang Weng, Yitang Li, Nikhil Sobanbabu +5
cs.ROarXiv:2509.16757v32025Q-learning with Adjoint Matching
Qiyang Li, Sergey Levine
cs.LGcs.AIcs.ROarXiv:2601.14234v42026WoW: Towards a World omniscient World model Through Embodied Interaction
Xiaowei Chi, Peidong Jia, Chun-Kai Fan +33
cs.ROcs.CVcs.MMarXiv:2509.22642v22025Translating Natural Language to Planning Goals with Large-Language Models
Yaqi Xie, Chen Yu, Tongyao Zhu +3
cs.CLcs.AIcs.ROarXiv:2302.05128v12023MemER: Scaling Up Memory for Robot Control via Experience Retrieval
Ajay Sridhar, Jennifer Pan, Satvik Sharma +1
cs.ROcs.AIcs.LGarXiv:2510.20328v12025Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
NVIDIA, :, Hassan Abu Alhaija +38
cs.CVcs.AIcs.LGarXiv:2503.14492v22025StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
Jinhui Ye, Ning Gao, Senqiao Yang +7
cs.ROcs.AIcs.CVarXiv:2604.11757v12026Connectivity-Aware Graph Extension for Decentralized Multi-Robot Exploration
Béatrice Garcia Cegarra, Elena Vanneaux, Quentin Picard +1
cs.ROarXiv:2609.00804v12026Domain Randomization and Generative Models for Robotic Grasping
Joshua Tobin, Lukas Biewald, Rocky Duan +8
cs.ROcs.LGarXiv:1710.06425v22017Semi-Dense 3D Reconstruction with a Stereo Event Camera
Yi Zhou, Guillermo Gallego, Henri Rebecq +3
cs.CVcs.ROarXiv:1807.07429v12018BayesSim: adaptive domain randomization via probabilistic inference for robotics simulators
Fabio Ramos, Rafael Carvalhaes Possas, Dieter Fox
cs.ROcs.LGarXiv:1906.01728v12019DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
Zhenjie Yang, Yilin Chai, Xiaosong Jia +5
cs.CVcs.AIcs.ROarXiv:2505.16278v22025MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation
Zhijian Qiao, Xinjiang Wang, Jiajie Chen +5
cs.CVcs.ROarXiv:2609.01252v12026LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent
Jianing Yang, Xuweiyi Chen, Shengyi Qian +4
cs.CVcs.AIcs.CLarXiv:2309.12311v12023PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs
Soroush Nasiriany, Fei Xia, Wenhao Yu +20
cs.ROcs.CLcs.CVarXiv:2402.07872v12024Video models are zero-shot learners and reasoners
Thaddäus Wiedemer, Yuxuan Li, Paul Vicol +6
cs.LGcs.AIcs.CVarXiv:2509.20328v22025GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
GigaWorld Team, Angen Ye, Angyuan Ma +26
cs.ROarXiv:2607.13960v32026World Simulation with Video Foundation Models for Physical AI
NVIDIA, :, Arslan Ali +87
cs.CVcs.AIcs.LGarXiv:2511.00062v22025VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
Junxiang Xu, Ruisi Wang, Fanyi Pu +49
cs.CVcs.AIcs.LGarXiv:2608.26105v12026Model-Based Reinforcement Learning for Heterogeneous Multi-Robot Task Assignment Under Distribution Shifts
Daniel Garces, Sara Castro, Adrian Haimovich +2
cs.ROcs.LGcs.MAarXiv:2608.21554v12026A Very Big Video Reasoning Suite
Maijunxian Wang, Ruisi Wang, Juyi Lin +53
cs.CVcs.AIcs.LGarXiv:2602.20159v22026RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
Tianxing Chen, Yuran Wang, Mingleyang Li +16
cs.ROcs.AIarXiv:2603.01229v32026Cosmos World Foundation Model Platform for Physical AI
NVIDIA, :, Niket Agarwal +76
cs.CVcs.AIcs.LGarXiv:2501.03575v32025Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
Wenli Xiao, Haotian Lin, Andy Peng +9
cs.CVcs.ROarXiv:2511.00091v12025Attention-Based Map Encoding for Learning Generalized Legged Locomotion
Junzhe He, Chong Zhang, Fabian Jenelten +3
cs.ROarXiv:2506.09588v12025RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
Tianxing Chen, Yue Chen, Zixuan Li +41
cs.ROcs.AIcs.CVarXiv:2607.04434v32026Learning Humanoid Standing-up Control across Diverse Postures
Tao Huang, Junli Ren, Huayi Wang +6
cs.ROcs.AIcs.LGarXiv:2502.08378v22025EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World
Ryan Punamiya, Simar Kareer, Zeyi Liu +37
cs.ROcs.CVarXiv:2604.07607v22026SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
Haoquan Fang, Markus Grotz, Wilbert Pumacay +4
cs.ROarXiv:2501.18564v42025PointVLA: Injecting the 3D World into Vision-Language-Action Models
Chengmeng Li, Junjie Wen, Yan Peng +3
cs.ROcs.CVcs.LGarXiv:2503.07511v12025ADAPT: Agile Diffusion Action Priors for Robust and Steerable Online Text-Driven Humanoid Control
Yan Wu, Chenhao Li, Kaifeng Zhao +3
cs.ROarXiv:2609.00677v12026RL Token: Bootstrapping Online RL with Vision-Language-Action Models
Charles Xu, Jost Tobias Springenberg, Michael Equi +4
cs.LGcs.ROarXiv:2604.23073v22026A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
Yifan Zhong, Fengshuo Bai, Shaofei Cai +11
cs.ROarXiv:2507.01925v12025Edge-Assisted Multi-Robot Visual-Inertial SLAM with Efficient Communication
Xin Liu, Shuhuan Wen, Jing Zhao +2
cs.ROcs.CVcs.MAarXiv:2603.11085v12026BeamDojo: Learning Agile Humanoid Locomotion on Sparse Footholds
Huayi Wang, Zirui Wang, Junli Ren +4
cs.ROcs.AIcs.LGarXiv:2502.10363v32025Variational Gaussian Process State-Space Models
Roger Frigola, Yutian Chen, Carl E. Rasmussen
cs.LGcs.ROeess.SYarXiv:1406.4905v22014RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation
Shihan Wu, Xuecheng Liu, Shaoxuan Xie +81
cs.ROarXiv:2511.17441v32025Diffusion Beats Autoregressive in Data-Constrained Settings
Mihir Prabhudesai, Mengning Wu, Amir Zadeh +2
cs.LGcs.AIcs.CVarXiv:2507.15857v72025Graspness Discovery in Clutters for Fast and Accurate Grasp Detection
Chenxi Wang, Hao-Shu Fang, Minghao Gou +3
cs.ROcs.CVarXiv:2406.11142v12024The Curious Robot: Learning Visual Representations via Physical Interactions
Lerrel Pinto, Dhiraj Gandhi, Yuanfeng Han +2
cs.CVcs.AIcs.ROarXiv:1604.01360v22016Inverse kinematic solution for generic 3R positional robots using Conformal Geometric Algebra
Abhilash Nayak, Durgesh Haribhau Salunkhe
cs.ROarXiv:2609.00311v12026NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance
Wenzhe Cai, Jiaqi Peng, Yuqiang Yang +6
cs.ROarXiv:2505.08712v32025SAFE: Multitask Failure Detection for Vision-Language-Action Models
Qiao Gu, Yuanliang Ju, Shengxiang Sun +4
cs.ROcs.AIarXiv:2506.09937v22025Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
Qixiu Li, Yu Deng, Yaobo Liang +14
cs.ROcs.AIcs.CVarXiv:2510.21571v12025RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies
Pranav Atreya, Karl Pertsch, Tony Lee +29
cs.ROcs.LGarXiv:2506.18123v22025LightEMMA: A Longitudinal Evaluation of Vision-Language Models for Autonomous Driving
Zhijie Qiao, Haowei Li, Zhong Cao +1
cs.ROcs.AIarXiv:2505.00284v32025FLARE: Robot Learning with Implicit World Modeling
Ruijie Zheng, Jing Wang, Scott Reed +18
cs.ROcs.LGarXiv:2505.15659v12025Message-Aware Graph Attention Networks for Large-Scale Multi-Robot Path Planning
Qingbiao Li, Weizhe Lin, Zhe Liu +1
cs.ROcs.DCcs.LGarXiv:2011.13219v22020Visual Imitation Enables Contextual Humanoid Control
Arthur Allshire, Hongsuk Choi, Junyi Zhang +7
cs.ROcs.CVarXiv:2505.03729v52025Vision-Based Leader-Follower Formation Control for Cooperative UAVs in GPS-Degraded Environments
Deekshitha Angadi, Naveena Budda, Vikas Agarwal +4
cs.ROarXiv:2609.01420v12026Obstacle-Aware Autonomous Coverage and Navigation for Outdoor Robots
Leonardo Gargani, Matteo Frosi, Matteo Matteucci
cs.ROarXiv:2609.01384v12026Behavior--Realization Separation for Constrained Physical Human--Robot Interaction
Yongyan Cao
cs.ROeess.SYarXiv:2609.00669v12026VerNav: Verifier-First Low-Latency Vision-and-Language Navigation
Zhixin Wang, Chengzheyi Yao, Leyuan Liu +2
cs.ROcs.CVarXiv:2609.00920v12026AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
Bo Jiang, Shaoyu Chen, Qian Zhang +2
cs.CVcs.ROarXiv:2503.07608v12025