Robotics

Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

901 to 960 of 3,241

  1. Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis

    Yuan Gao, Mattia Piccinini, Yuchen Zhang +12

    cs.ROcs.AIarXiv:2506.11526v42025
  2. OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction

    Huang Huang, Fangchen Liu, Letian Fu +5

    cs.ROcs.CVarXiv:2503.03734v42025
  3. SPNets: Differentiable Fluid Dynamics for Deep Neural Networks

    Connor Schenck, Dieter Fox

    cs.ROarXiv:1806.06094v22018
  4. SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning

    Borong Zhang, Yuhao Zhang, Jiaming Ji +5

    cs.ROcs.AIarXiv:2503.03480v42025
  5. Plan Explicability and Predictability for Robot Task Planning

    Yu Zhang, Sarath Sreedharan, Anagha Kulkarni +3

    cs.AIcs.ROarXiv:1511.08158v22015
  6. Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation

    Abhiram Maddukuri, Zhenyu Jiang, Lawrence Yunliang Chen +12

    cs.ROcs.AIcs.LGarXiv:2503.24361v22025
  7. Strict Modes Everywhere - Bringing Order Into Dynamics of Mechanical Systems by a Potential Compatible With the Geodesic Flow

    Arne Sachtler, Alin Albu-Schäffer

    cs.ROarXiv:2609.04817v12026
  8. Enhancing Visual Domain Robustness in Behaviour Cloning via Saliency-Guided Augmentation

    Zheyu Zhuang, Ruiyu Wang, Nils Ingelhag +2

    cs.ROarXiv:2608.11870v12026
  9. LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction

    Haoru Xue, Xiaoyu Huang, Dantong Niu +8

    cs.ROcs.AIarXiv:2506.13751v32025
  10. Imitation Is Not Enough: Robustifying Imitation with Reinforcement Learning for Challenging Driving Scenarios

    Yiren Lu, Justin Fu, George Tucker +9

    cs.AIcs.ROarXiv:2212.11419v22022
  11. Distilling Multi-modal Large Language Models for Autonomous Driving

    Deepti Hegde, Rajeev Yasarla, Hong Cai +7

    cs.CVcs.ROarXiv:2501.09757v12025
  12. OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation

    Yuhang Zheng, Songen Gu, Yupeng Zheng +11

    cs.ROarXiv:2603.19201v32026
  13. RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

    Zifan Wang, Ziang Ren, Pengyang Shi +7

    cs.ROcs.CVarXiv:2608.28693v12026
  14. Diffusion Models for Robotic Manipulation: A Survey

    Rosa Wolf, Yitian Shi, Sheng Liu +1

    cs.ROstat.MLarXiv:2504.08438v32025
  15. OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints

    Mingjie Pan, Jiyao Zhang, Tianshu Wu +3

    cs.ROarXiv:2501.03841v12025
  16. A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models

    Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam +3

    cs.LGcs.AIcs.ROarXiv:2502.13187v32025
  17. From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment

    Yilin Wu, Ran Tian, Gokul Swamy +1

    cs.ROcs.LGarXiv:2502.01828v32025
  18. SGS-SLAM: Semantic Gaussian Splatting For Neural Dense SLAM

    Mingrui Li, Shuhong Liu, Heng Zhou +4

    cs.CVcs.AIcs.ROarXiv:2402.03246v62024
  19. VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback

    Jianxin Bi, Kevin Yuchen Ma, Ce Hao +2

    cs.ROcs.LGarXiv:2507.17294v22025
  20. Synergies Between Affordance and Geometry: 6-DoF Grasp Detection via Implicit Representations

    Zhenyu Jiang, Yifeng Zhu, Maxwell Svetlik +2

    cs.ROcs.AIcs.CVarXiv:2104.01542v22021
  21. World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy

    Xiaokang Liu, Zechen Bai, Hai Ci +2

    cs.ROarXiv:2602.06508v22026
  22. World-Gymnast: Training Robots with Reinforcement Learning in a World Model

    Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu +3

    cs.ROcs.AIarXiv:2602.02454v12026
  23. Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation

    Nicklas Hansen, Hao Su, Xiaolong Wang

    cs.LGcs.CVcs.ROarXiv:2107.00644v22021
  24. Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

    Yunfan Lou, Yifan Ye, Yankai Fu +7

    cs.ROarXiv:2606.08737v12026
  25. DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving

    Feiyang jia, Lin Liu, Ziying Song +4

    cs.CVcs.ROarXiv:2602.06521v12026
  26. Agilicious: Open-Source and Open-Hardware Agile Quadrotor for Vision-Based Flight

    Philipp Foehn, Elia Kaufmann, Angel Romero +8

    cs.ROarXiv:2307.06100v12023
  27. BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household Activities

    Yunfan Jiang, Ruohan Zhang, Josiah Wong +7

    cs.ROcs.AIcs.CVarXiv:2503.05652v22025
  28. Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning

    Bozhou Zhang, Nan Song, Xin Jin +1

    cs.ROcs.CVarXiv:2503.14182v12025
  29. SmoothRL: Online Reinforcement Learning During Asynchronous Execution

    Guang Gao, Yuxuan Nong, Baifu Huang +1

    cs.ROarXiv:2608.29768v12026
  30. Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations

    Ruiqian Nai, Boyuan Zheng, Junming Zhao +8

    cs.ROcs.AIcs.LGarXiv:2602.06643v22026
  31. Pure Vision Language Action (VLA) Models: A Comprehensive Survey

    Dapeng Zhang, Jing Sun, Chenghui Hu +5

    cs.ROcs.AIarXiv:2509.19012v32025
  32. GCNv2: Efficient Correspondence Prediction for Real-Time SLAM

    Jiexiong Tang, Ludvig Ericson, John Folkesson +1

    cs.ROcs.CVarXiv:1902.11046v32019
  33. VeloBins: Learning Velocity and Its Uncertainty via Bins and Error-Conditioned Gaussian Labels for Aerial Inertial Odometry

    Maulana Bisyir Azhari, Seungwook Lee, Donghun Han +2

    cs.ROarXiv:2608.29720v12026
  34. ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation

    Liang Heng, Haoran Geng, Kaifeng Zhang +2

    cs.ROarXiv:2506.15953v22025
  35. RoboGround: Robotic Manipulation with Grounded Vision-Language Priors

    Haifeng Huang, Xinyi Chen, Yilun Chen +6

    cs.ROcs.CVarXiv:2504.21530v12025
  36. Native Video-Action Pretraining for Generalizable Robot Control

    Qihang Zhang, Lin Li, Luyao Zhang +26

    cs.ROcs.CVarXiv:2607.08639v22026
  37. MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation

    Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu +7

    cs.ROarXiv:2502.13451v52025
  38. Parkour in the Wild: Learning a General and Extensible Agile Locomotion Policy Using Multi-expert Distillation and RL Fine-tuning

    Nikita Rudin, Junzhe He, Joshua Aurand +1

    cs.ROarXiv:2505.11164v12025
  39. Clinically Ready Magnetic Microrobots for Targeted Therapies

    Fabian C. Landers, Lukas Hertle, Vitaly Pustovalov +25

    cs.ROcond-mat.mtrl-scieess.SYarXiv:2501.11553v12025
  40. PathBridger: Subgoal Bridges for Offline Goal-Conditioned Reinforcement Learning

    Soohyun Choi, Seonvin Cho, Songnam Hong

    cs.LGcs.ROarXiv:2608.29061v12026
  41. Generation of High-Level Concepts in 3D Scene Graphs via Autoregressive Diffusion

    Jose Andres Millan-Romera, Samuel Cognolato, Holger Voos +2

    cs.ROcs.LGarXiv:2608.28733v12026
  42. UniTracker: Learning Universal Whole-Body Motion Tracker for Humanoid Robots

    Kangning Yin, Weishuai Zeng, Ke Fan +7

    cs.ROarXiv:2507.07356v32025
  43. LAMP 2.0: A Robust Multi-Robot SLAM System for Operation in Challenging Large-Scale Underground Environments

    Yun Chang, Kamak Ebadi, Christopher E. Denniston +9

    cs.ROcs.MAarXiv:2205.13135v32022
  44. Perceptive Humanoid Parkour: Chaining Dynamic Human Skills via Motion Matching

    Zhen Wu, Xiaoyu Huang, Lujie Yang +8

    cs.ROcs.AIcs.LGarXiv:2602.15827v22026
  45. Interactive World Simulator for Robot Policy Training and Evaluation

    Yixuan Wang, Rhythm Syed, Fangyu Wu +7

    cs.ROcs.CVcs.LGarXiv:2603.08546v12026
  46. STAMP: Scalable Task And Model-agnostic Collaborative Perception

    Xiangbo Gao, Runsheng Xu, Jiachen Li +3

    cs.CVcs.AIcs.ROarXiv:2501.18616v12025
  47. A*3D Dataset: Towards Autonomous Driving in Challenging Environments

    Quang-Hieu Pham, Pierre Sevestre, Ramanpreet Singh Pahwa +6

    cs.CVcs.ROarXiv:1909.07541v12019
  48. Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

    Tao Lin, Gen Li, Yilei Zhong +5

    cs.ROcs.CVarXiv:2507.00416v32025
  49. UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking

    Baijun Chen, Weijie Wan, Tianxing Chen +13

    cs.ROarXiv:2602.10093v12026
  50. Medical Technologies and Challenges of Robot Assisted Minimally Invasive Intervention and Diagnostics

    Nabil Simaan, Rashid M. Yasin, Long Wang

    cs.ROarXiv:1807.03731v12018
  51. General In-Hand Object Rotation with Vision and Touch

    Haozhi Qi, Brent Yi, Sudharshan Suresh +4

    cs.ROcs.AIcs.CVarXiv:2309.09979v22023
  52. Comparative Analysis of Control Barrier Functions and Artificial Potential Fields for Obstacle Avoidance

    Andrew Singletary, Karl Klingebiel, Joseph Bourne +3

    cs.ROeess.SYarXiv:2010.09819v12020
  53. Self-Supervised Learning of State Estimation for Manipulating Deformable Linear Objects

    Mengyuan Yan, Yilin Zhu, Ning Jin +1

    cs.ROcs.CVcs.LGarXiv:1911.06283v32019
  54. From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots

    Runjiao Bao, Lin Zhang, Yongkang Xu +1

    cs.ROarXiv:2608.29108v12026
  55. Task-Relevant Feature-Dynamics Fidelity Enables Zero-Shot Sim-to-Real Transfer for Robotic Ultrasound Scanning

    Yizhao Qian, Jiayuan Luo, Wanyi Zhu +4

    cs.ROarXiv:2608.29516v12026
  56. MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation

    Zhenyu Wu, Yuheng Zhou, Xiuwei Xu +2

    cs.ROcs.CVarXiv:2503.13446v12025
  57. Scalable Multi-Robot Collaboration with Large Language Models: Centralized or Decentralized Systems?

    Yongchao Chen, Jacob Arkin, Yang Zhang +2

    cs.ROarXiv:2309.15943v22023
  58. Safety Guardrails for LLM-Enabled Robots

    Zachary Ravichandran, Alexander Robey, Vijay Kumar +2

    cs.ROcs.AIarXiv:2503.07885v22025
  59. Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

    Mohammad Nazeri, Alexandyr Card, Samira Huber +6

    cs.ROcs.CVarXiv:2608.28995v12026
  60. TLA: Tactile-Language-Action Model for Contact-Rich Manipulation

    Peng Hao, Chaofan Zhang, Dingzhe Li +4

    cs.ROcs.CVarXiv:2503.08548v12025