Robotics
Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
781 to 840 of 3,241
Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot
Chenghao Yin, Da Huang, Di Yang +16
cs.ROarXiv:2601.02078v42026BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks
Yixiang Chen, Peiyan Li, Jiabing Yang +8
cs.ROcs.CVarXiv:2602.03793v12026EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks
Yihang Li, Xuelong Wei, Jingzhou Luo +26
cs.ROarXiv:2604.23570v12026How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf
Wenqi Jiang, Jason Clemons, Karu Sankaralingam +1
cs.ROarXiv:2602.18397v12026PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
Yuanzhe Liu, Jingyuan Zhu, Yuchen Mo +9
cs.ROarXiv:2601.07060v22026DriveVA: Video Action Models are Zero-Shot Drivers
Mengmeng Liu, Diankun Zhang, Jiuming Liu +7
cs.CVcs.ROarXiv:2604.04198v22026Brain-Computer Interface Controlled Robotic Gait Orthosis
An H. Do, Po T. Wang, Christine E. King +2
cs.HCcs.ROarXiv:1208.5024v32012UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos
Gu Zhang, Qicheng Xu, Haozhe Zhang +16
cs.ROarXiv:2603.22264v12026Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments
Yihao Cai, Yanbing Mao, Christian Lebiere
cs.ROarXiv:2608.28677v12026OAT: Ordered Action Tokenization
Chaoqi Liu, Xiaoshen Han, Jiawei Gao +3
cs.ROcs.AIcs.LGarXiv:2602.04215v22026HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations
Xiaomeng Xu, Jisang Park, Han Zhang +6
cs.ROarXiv:2603.03243v22026MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving
Junli Wang, Yinan Zheng, Xueyi Liu +9
cs.CVcs.ROarXiv:2602.20060v22026Learning to be Safe: Deep RL with a Safety Critic
Krishnan Srinivasan, Benjamin Eysenbach, Sehoon Ha +2
cs.LGcs.ROarXiv:2010.14603v12020Slip Detection with Combined Tactile and Visual Information
Jianhua Li, Siyuan Dong, Edward Adelson
cs.ROarXiv:1802.10153v12018Dual Park-Ravani Interpolation of Rigid Motions: Acceleration-Field Continuity and Holonomic Hermite Repair
Daniel Condurache
cs.ROarXiv:2608.28826v12026VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation
Wei Zhao, Pengxiang Ding, Min Zhang +4
cs.ROarXiv:2502.13508v22025ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation
Yang Li, Zhaxizhuoma, Hongru Jiang +11
cs.ROarXiv:2603.15169v12026VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model
Wenhao Li, Xiu Su, Yichao Cao +5
cs.ROarXiv:2605.01194v22026VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation
Shuai Tian, Yupeng Zheng, Yuhang Zheng +7
cs.ROarXiv:2607.02503v12026Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions
Cunxin Fan, Xiaosong Jia, Yihang Sun +8
cs.ROarXiv:2505.02152v22025Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
Zaijing Li, Bing Hu, Rui Shao +5
cs.ROcs.AIcs.CVarXiv:2602.20200v22026Structured World Models from Human Videos
Russell Mendonca, Shikhar Bahl, Deepak Pathak
cs.ROcs.AIcs.CVarXiv:2308.10901v12023RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
Yufei Wang, Zhanyi Sun, Jesse Zhang +4
cs.ROcs.AIcs.LGarXiv:2402.03681v42024Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks
Wenpeng Xing, Minghao Li, Mohan Li +1
cs.CRcs.AIcs.ROarXiv:2502.13175v22025Articraft: An Agentic System for Scalable Articulated 3D Asset Generation
Matt Zhou, Ruining Li, Xiaoyang Lyu +6
cs.CVcs.GRcs.ROarXiv:2605.15187v12026RPL: Learning Robust Humanoid Perceptive Locomotion on Challenging Terrains
Yuanhang Zhang, Younggyo Seo, Juyue Chen +7
cs.ROarXiv:2602.03002v22026EGAD! an Evolved Grasping Analysis Dataset for diversity and reproducibility in robotic manipulation
Douglas Morrison, Peter Corke, Jürgen Leitner
cs.ROarXiv:2003.01314v32020A Survey of World Models for Autonomous Driving
Tuo Feng, Wenguan Wang, Yi Yang
cs.ROcs.CVarXiv:2501.11260v42025AerialVLN: Vision-and-Language Navigation for UAVs
Shubo Liu, Hongsheng Zhang, Yuankai Qi +3
cs.CVcs.AIcs.ROarXiv:2308.06735v12023Learning Whole-Body Humanoid Locomotion via Motion Generation and Motion Tracking
Zewei Zhang, Kehan Wen, Michael Xu +7
cs.ROarXiv:2604.17335v22026Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
Jiazhao Zhang, Kunyu Wang, Shaoan Wang +6
cs.ROcs.CVarXiv:2412.06224v22024LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
Zhuoyang Liu, Jiaming Liu, Hao Chen +11
cs.ROarXiv:2601.05248v42026SGE: Semantically-Guided Exploration for Unstructured Environments via Image-Space Waypoint Sampling
Christopher Tatsch, Yu Gu
cs.ROcs.AIarXiv:2608.29315v12026Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
Jacky Kwok, Xilun Zhang, Mengdi Xu +4
cs.ROcs.AIeess.SYarXiv:2602.12281v22026$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
Yuqi Ye, Zijian Zhang, Junhong Lin +3
cs.ROcs.CVarXiv:2603.28116v12026AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models
Sunghwan Han, Youngtae Han, Youngmin Yi
cs.ROcs.LGarXiv:2608.29208v12026Soft Biomimetic Optical Tactile Sensing with the TacTip: A Review
Nathan F. Lepora
cs.ROarXiv:2105.14455v22021Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
Yuanchang Liang, Xiaobo Wang, Kai Wang +5
cs.ROarXiv:2604.04161v22026Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
Zhikai Zhang, Haofei Lu, Yunrui Lian +12
cs.ROarXiv:2603.12686v12026NeuralSim: Augmenting Differentiable Simulators with Neural Networks
Eric Heiden, David Millard, Erwin Coumans +2
cs.ROarXiv:2011.04217v22020S3CNet: A Sparse Semantic Scene Completion Network for LiDAR Point Clouds
Ran Cheng, Christopher Agia, Yuan Ren +2
cs.CVcs.AIcs.LGarXiv:2012.09242v12020RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies
Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das +5
cs.ROcs.CVarXiv:2608.28656v12026TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks
Tailai Cheng, Kejia Chen, Lingyun Chen +8
cs.ROarXiv:2601.14550v12026JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
Shangchen Miao, Ningya Feng, Jialong Wu +4
cs.CVcs.ROarXiv:2602.11832v12026Towards Monocular Vision based Obstacle Avoidance through Deep Reinforcement Learning
Linhai Xie, Sen Wang, Andrew Markham +1
cs.ROarXiv:1706.09829v12017System Identification of Admittance Models for Large Real-World Objects
Nathan I. Baum, Nathaniel G. Luttmer, Mark A. Minor
cs.ROarXiv:2608.29935v12026EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy
Zhirui Fang, Qingchi Yu, Ziyang Chen +18
cs.ROarXiv:2608.29896v12026Visuo-Tactile World Models
Carolina Higuera, Sergio Arnaud, Byron Boots +3
cs.ROarXiv:2602.06001v12026BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames
Max Sobol Mark, Jacky Liang, Maria Attarian +4
cs.ROcs.LGarXiv:2602.15010v22026DexterityGen: Foundation Controller for Unprecedented Dexterity
Zhao-Heng Yin, Changhao Wang, Luis Pineda +11
cs.ROcs.AIcs.LGarXiv:2502.04307v12025Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning
Cameron Voloshin, Hoang M. Le, Nan Jiang +1
cs.LGcs.AIcs.ROarXiv:1911.06854v32019LingoQA: Visual Question Answering for Autonomous Driving
Ana-Maria Marcu, Long Chen, Jan Hünermann +9
cs.ROcs.AIcs.CVarXiv:2312.14115v42023RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction
Tianyi Wang, Jiazhou Chen, Yiming Xu +7
cs.ROcs.AIcs.CVarXiv:2608.28718v12026Endo-Depth-and-Motion: Reconstruction and Tracking in Endoscopic Videos using Depth Networks and Photometric Constraints
David Recasens, José Lamarca, José M. Fácil +2
cs.CVcs.LGcs.ROarXiv:2103.16525v22021VDO-SLAM: A Visual Dynamic Object-aware SLAM System
Jun Zhang, Mina Henein, Robert Mahony +1
cs.ROarXiv:2005.11052v32020MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models
Hanyang Yu, Haitao Lin, Jingbo Zhang +4
cs.CVcs.LGcs.ROarXiv:2606.13515v12026Connecting Touch and Vision via Cross-Modal Prediction
Yunzhu Li, Jun-Yan Zhu, Russ Tedrake +1
cs.CVcs.LGcs.ROarXiv:1906.06322v12019DSG: Dynamic 3D Scene Graph Construction for Embodied Agents in Changing Indoor Environments
Ming Liao, Chao Ye, Jianing Fei +1
cs.ROarXiv:2609.00619v12026ProxPI: Proximal Prior Injection for Sampling-Based MPC under Learned-Prior Mismatch
Euncheol Im, Myotaeg Lim, Yisoo Lee
cs.ROeess.SYarXiv:2609.00941v12026AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception
Ruoxuan Feng, Yuxuan Zhou, Siyu Mei +6
cs.ROcs.AIcs.CVarXiv:2602.09617v12026