Robotics

Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

781 to 840 of 3,241

  1. Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot

    Chenghao Yin, Da Huang, Di Yang +16

    cs.ROarXiv:2601.02078v42026
  2. BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks

    Yixiang Chen, Peiyan Li, Jiabing Yang +8

    cs.ROcs.CVarXiv:2602.03793v12026
  3. EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks

    Yihang Li, Xuelong Wei, Jingzhou Luo +26

    cs.ROarXiv:2604.23570v12026
  4. How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf

    Wenqi Jiang, Jason Clemons, Karu Sankaralingam +1

    cs.ROarXiv:2602.18397v12026
  5. PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation

    Yuanzhe Liu, Jingyuan Zhu, Yuchen Mo +9

    cs.ROarXiv:2601.07060v22026
  6. DriveVA: Video Action Models are Zero-Shot Drivers

    Mengmeng Liu, Diankun Zhang, Jiuming Liu +7

    cs.CVcs.ROarXiv:2604.04198v22026
  7. Brain-Computer Interface Controlled Robotic Gait Orthosis

    An H. Do, Po T. Wang, Christine E. King +2

    cs.HCcs.ROarXiv:1208.5024v32012
  8. UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

    Gu Zhang, Qicheng Xu, Haozhe Zhang +16

    cs.ROarXiv:2603.22264v12026
  9. Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

    Yihao Cai, Yanbing Mao, Christian Lebiere

    cs.ROarXiv:2608.28677v12026
  10. OAT: Ordered Action Tokenization

    Chaoqi Liu, Xiaoshen Han, Jiawei Gao +3

    cs.ROcs.AIcs.LGarXiv:2602.04215v22026
  11. HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

    Xiaomeng Xu, Jisang Park, Han Zhang +6

    cs.ROarXiv:2603.03243v22026
  12. MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

    Junli Wang, Yinan Zheng, Xueyi Liu +9

    cs.CVcs.ROarXiv:2602.20060v22026
  13. Learning to be Safe: Deep RL with a Safety Critic

    Krishnan Srinivasan, Benjamin Eysenbach, Sehoon Ha +2

    cs.LGcs.ROarXiv:2010.14603v12020
  14. Slip Detection with Combined Tactile and Visual Information

    Jianhua Li, Siyuan Dong, Edward Adelson

    cs.ROarXiv:1802.10153v12018
  15. Dual Park-Ravani Interpolation of Rigid Motions: Acceleration-Field Continuity and Holonomic Hermite Repair

    Daniel Condurache

    cs.ROarXiv:2608.28826v12026
  16. VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation

    Wei Zhao, Pengxiang Ding, Min Zhang +4

    cs.ROarXiv:2502.13508v22025
  17. ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation

    Yang Li, Zhaxizhuoma, Hongru Jiang +11

    cs.ROarXiv:2603.15169v12026
  18. VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

    Wenhao Li, Xiu Su, Yichao Cao +5

    cs.ROarXiv:2605.01194v22026
  19. VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

    Shuai Tian, Yupeng Zheng, Yuhang Zheng +7

    cs.ROarXiv:2607.02503v12026
  20. Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions

    Cunxin Fan, Xiaosong Jia, Yihang Sun +8

    cs.ROarXiv:2505.02152v22025
  21. Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

    Zaijing Li, Bing Hu, Rui Shao +5

    cs.ROcs.AIcs.CVarXiv:2602.20200v22026
  22. Structured World Models from Human Videos

    Russell Mendonca, Shikhar Bahl, Deepak Pathak

    cs.ROcs.AIcs.CVarXiv:2308.10901v12023
  23. RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

    Yufei Wang, Zhanyi Sun, Jesse Zhang +4

    cs.ROcs.AIcs.LGarXiv:2402.03681v42024
  24. Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks

    Wenpeng Xing, Minghao Li, Mohan Li +1

    cs.CRcs.AIcs.ROarXiv:2502.13175v22025
  25. Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

    Matt Zhou, Ruining Li, Xiaoyang Lyu +6

    cs.CVcs.GRcs.ROarXiv:2605.15187v12026
  26. RPL: Learning Robust Humanoid Perceptive Locomotion on Challenging Terrains

    Yuanhang Zhang, Younggyo Seo, Juyue Chen +7

    cs.ROarXiv:2602.03002v22026
  27. EGAD! an Evolved Grasping Analysis Dataset for diversity and reproducibility in robotic manipulation

    Douglas Morrison, Peter Corke, Jürgen Leitner

    cs.ROarXiv:2003.01314v32020
  28. A Survey of World Models for Autonomous Driving

    Tuo Feng, Wenguan Wang, Yi Yang

    cs.ROcs.CVarXiv:2501.11260v42025
  29. AerialVLN: Vision-and-Language Navigation for UAVs

    Shubo Liu, Hongsheng Zhang, Yuankai Qi +3

    cs.CVcs.AIcs.ROarXiv:2308.06735v12023
  30. Learning Whole-Body Humanoid Locomotion via Motion Generation and Motion Tracking

    Zewei Zhang, Kehan Wen, Michael Xu +7

    cs.ROarXiv:2604.17335v22026
  31. Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks

    Jiazhao Zhang, Kunyu Wang, Shaoan Wang +6

    cs.ROcs.CVarXiv:2412.06224v22024
  32. LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model

    Zhuoyang Liu, Jiaming Liu, Hao Chen +11

    cs.ROarXiv:2601.05248v42026
  33. SGE: Semantically-Guided Exploration for Unstructured Environments via Image-Space Waypoint Sampling

    Christopher Tatsch, Yu Gu

    cs.ROcs.AIarXiv:2608.29315v12026
  34. Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

    Jacky Kwok, Xilun Zhang, Mengdi Xu +4

    cs.ROcs.AIeess.SYarXiv:2602.12281v22026
  35. $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

    Yuqi Ye, Zijian Zhang, Junhong Lin +3

    cs.ROcs.CVarXiv:2603.28116v12026
  36. AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models

    Sunghwan Han, Youngtae Han, Youngmin Yi

    cs.ROcs.LGarXiv:2608.29208v12026
  37. Soft Biomimetic Optical Tactile Sensing with the TacTip: A Review

    Nathan F. Lepora

    cs.ROarXiv:2105.14455v22021
  38. Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

    Yuanchang Liang, Xiaobo Wang, Kai Wang +5

    cs.ROarXiv:2604.04161v22026
  39. Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data

    Zhikai Zhang, Haofei Lu, Yunrui Lian +12

    cs.ROarXiv:2603.12686v12026
  40. NeuralSim: Augmenting Differentiable Simulators with Neural Networks

    Eric Heiden, David Millard, Erwin Coumans +2

    cs.ROarXiv:2011.04217v22020
  41. S3CNet: A Sparse Semantic Scene Completion Network for LiDAR Point Clouds

    Ran Cheng, Christopher Agia, Yuan Ren +2

    cs.CVcs.AIcs.LGarXiv:2012.09242v12020
  42. RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

    Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das +5

    cs.ROcs.CVarXiv:2608.28656v12026
  43. TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks

    Tailai Cheng, Kejia Chen, Lingyun Chen +8

    cs.ROarXiv:2601.14550v12026
  44. JEPA-VLA: Video Predictive Embedding is Needed for VLA Models

    Shangchen Miao, Ningya Feng, Jialong Wu +4

    cs.CVcs.ROarXiv:2602.11832v12026
  45. Towards Monocular Vision based Obstacle Avoidance through Deep Reinforcement Learning

    Linhai Xie, Sen Wang, Andrew Markham +1

    cs.ROarXiv:1706.09829v12017
  46. System Identification of Admittance Models for Large Real-World Objects

    Nathan I. Baum, Nathaniel G. Luttmer, Mark A. Minor

    cs.ROarXiv:2608.29935v12026
  47. EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

    Zhirui Fang, Qingchi Yu, Ziyang Chen +18

    cs.ROarXiv:2608.29896v12026
  48. Visuo-Tactile World Models

    Carolina Higuera, Sergio Arnaud, Byron Boots +3

    cs.ROarXiv:2602.06001v12026
  49. BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames

    Max Sobol Mark, Jacky Liang, Maria Attarian +4

    cs.ROcs.LGarXiv:2602.15010v22026
  50. DexterityGen: Foundation Controller for Unprecedented Dexterity

    Zhao-Heng Yin, Changhao Wang, Luis Pineda +11

    cs.ROcs.AIcs.LGarXiv:2502.04307v12025
  51. Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning

    Cameron Voloshin, Hoang M. Le, Nan Jiang +1

    cs.LGcs.AIcs.ROarXiv:1911.06854v32019
  52. LingoQA: Visual Question Answering for Autonomous Driving

    Ana-Maria Marcu, Long Chen, Jan Hünermann +9

    cs.ROcs.AIcs.CVarXiv:2312.14115v42023
  53. RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction

    Tianyi Wang, Jiazhou Chen, Yiming Xu +7

    cs.ROcs.AIcs.CVarXiv:2608.28718v12026
  54. Endo-Depth-and-Motion: Reconstruction and Tracking in Endoscopic Videos using Depth Networks and Photometric Constraints

    David Recasens, José Lamarca, José M. Fácil +2

    cs.CVcs.LGcs.ROarXiv:2103.16525v22021
  55. VDO-SLAM: A Visual Dynamic Object-aware SLAM System

    Jun Zhang, Mina Henein, Robert Mahony +1

    cs.ROarXiv:2005.11052v32020
  56. MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

    Hanyang Yu, Haitao Lin, Jingbo Zhang +4

    cs.CVcs.LGcs.ROarXiv:2606.13515v12026
  57. Connecting Touch and Vision via Cross-Modal Prediction

    Yunzhu Li, Jun-Yan Zhu, Russ Tedrake +1

    cs.CVcs.LGcs.ROarXiv:1906.06322v12019
  58. DSG: Dynamic 3D Scene Graph Construction for Embodied Agents in Changing Indoor Environments

    Ming Liao, Chao Ye, Jianing Fei +1

    cs.ROarXiv:2609.00619v12026
  59. ProxPI: Proximal Prior Injection for Sampling-Based MPC under Learned-Prior Mismatch

    Euncheol Im, Myotaeg Lim, Yisoo Lee

    cs.ROeess.SYarXiv:2609.00941v12026
  60. AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception

    Ruoxuan Feng, Yuxuan Zhou, Siyu Mei +6

    cs.ROcs.AIcs.CVarXiv:2602.09617v12026