Robotics
Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
901 to 960 of 3,241
Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis
Yuan Gao, Mattia Piccinini, Yuchen Zhang +12
cs.ROcs.AIarXiv:2506.11526v42025OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
Huang Huang, Fangchen Liu, Letian Fu +5
cs.ROcs.CVarXiv:2503.03734v42025SPNets: Differentiable Fluid Dynamics for Deep Neural Networks
Connor Schenck, Dieter Fox
cs.ROarXiv:1806.06094v22018SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
Borong Zhang, Yuhao Zhang, Jiaming Ji +5
cs.ROcs.AIarXiv:2503.03480v42025Plan Explicability and Predictability for Robot Task Planning
Yu Zhang, Sarath Sreedharan, Anagha Kulkarni +3
cs.AIcs.ROarXiv:1511.08158v22015Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation
Abhiram Maddukuri, Zhenyu Jiang, Lawrence Yunliang Chen +12
cs.ROcs.AIcs.LGarXiv:2503.24361v22025Strict Modes Everywhere - Bringing Order Into Dynamics of Mechanical Systems by a Potential Compatible With the Geodesic Flow
Arne Sachtler, Alin Albu-Schäffer
cs.ROarXiv:2609.04817v12026Enhancing Visual Domain Robustness in Behaviour Cloning via Saliency-Guided Augmentation
Zheyu Zhuang, Ruiyu Wang, Nils Ingelhag +2
cs.ROarXiv:2608.11870v12026LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction
Haoru Xue, Xiaoyu Huang, Dantong Niu +8
cs.ROcs.AIarXiv:2506.13751v32025Imitation Is Not Enough: Robustifying Imitation with Reinforcement Learning for Challenging Driving Scenarios
Yiren Lu, Justin Fu, George Tucker +9
cs.AIcs.ROarXiv:2212.11419v22022Distilling Multi-modal Large Language Models for Autonomous Driving
Deepti Hegde, Rajeev Yasarla, Hong Cai +7
cs.CVcs.ROarXiv:2501.09757v12025OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
Yuhang Zheng, Songen Gu, Yupeng Zheng +11
cs.ROarXiv:2603.19201v32026RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction
Zifan Wang, Ziang Ren, Pengyang Shi +7
cs.ROcs.CVarXiv:2608.28693v12026Diffusion Models for Robotic Manipulation: A Survey
Rosa Wolf, Yitian Shi, Sheng Liu +1
cs.ROstat.MLarXiv:2504.08438v32025OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints
Mingjie Pan, Jiyao Zhang, Tianshu Wu +3
cs.ROarXiv:2501.03841v12025A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models
Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam +3
cs.LGcs.AIcs.ROarXiv:2502.13187v32025From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment
Yilin Wu, Ran Tian, Gokul Swamy +1
cs.ROcs.LGarXiv:2502.01828v32025SGS-SLAM: Semantic Gaussian Splatting For Neural Dense SLAM
Mingrui Li, Shuhong Liu, Heng Zhou +4
cs.CVcs.AIcs.ROarXiv:2402.03246v62024VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback
Jianxin Bi, Kevin Yuchen Ma, Ce Hao +2
cs.ROcs.LGarXiv:2507.17294v22025Synergies Between Affordance and Geometry: 6-DoF Grasp Detection via Implicit Representations
Zhenyu Jiang, Yifeng Zhu, Maxwell Svetlik +2
cs.ROcs.AIcs.CVarXiv:2104.01542v22021World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy
Xiaokang Liu, Zechen Bai, Hai Ci +2
cs.ROarXiv:2602.06508v22026World-Gymnast: Training Robots with Reinforcement Learning in a World Model
Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu +3
cs.ROcs.AIarXiv:2602.02454v12026Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation
Nicklas Hansen, Hao Su, Xiaolong Wang
cs.LGcs.CVcs.ROarXiv:2107.00644v22021Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation
Yunfan Lou, Yifan Ye, Yankai Fu +7
cs.ROarXiv:2606.08737v12026DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
Feiyang jia, Lin Liu, Ziying Song +4
cs.CVcs.ROarXiv:2602.06521v12026Agilicious: Open-Source and Open-Hardware Agile Quadrotor for Vision-Based Flight
Philipp Foehn, Elia Kaufmann, Angel Romero +8
cs.ROarXiv:2307.06100v12023BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household Activities
Yunfan Jiang, Ruohan Zhang, Josiah Wong +7
cs.ROcs.AIcs.CVarXiv:2503.05652v22025Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning
Bozhou Zhang, Nan Song, Xin Jin +1
cs.ROcs.CVarXiv:2503.14182v12025SmoothRL: Online Reinforcement Learning During Asynchronous Execution
Guang Gao, Yuxuan Nong, Baifu Huang +1
cs.ROarXiv:2608.29768v12026Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations
Ruiqian Nai, Boyuan Zheng, Junming Zhao +8
cs.ROcs.AIcs.LGarXiv:2602.06643v22026Pure Vision Language Action (VLA) Models: A Comprehensive Survey
Dapeng Zhang, Jing Sun, Chenghui Hu +5
cs.ROcs.AIarXiv:2509.19012v32025GCNv2: Efficient Correspondence Prediction for Real-Time SLAM
Jiexiong Tang, Ludvig Ericson, John Folkesson +1
cs.ROcs.CVarXiv:1902.11046v32019VeloBins: Learning Velocity and Its Uncertainty via Bins and Error-Conditioned Gaussian Labels for Aerial Inertial Odometry
Maulana Bisyir Azhari, Seungwook Lee, Donghun Han +2
cs.ROarXiv:2608.29720v12026ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation
Liang Heng, Haoran Geng, Kaifeng Zhang +2
cs.ROarXiv:2506.15953v22025RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
Haifeng Huang, Xinyi Chen, Yilun Chen +6
cs.ROcs.CVarXiv:2504.21530v12025Native Video-Action Pretraining for Generalizable Robot Control
Qihang Zhang, Lin Li, Luyao Zhang +26
cs.ROcs.CVarXiv:2607.08639v22026MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu +7
cs.ROarXiv:2502.13451v52025Parkour in the Wild: Learning a General and Extensible Agile Locomotion Policy Using Multi-expert Distillation and RL Fine-tuning
Nikita Rudin, Junzhe He, Joshua Aurand +1
cs.ROarXiv:2505.11164v12025Clinically Ready Magnetic Microrobots for Targeted Therapies
Fabian C. Landers, Lukas Hertle, Vitaly Pustovalov +25
cs.ROcond-mat.mtrl-scieess.SYarXiv:2501.11553v12025PathBridger: Subgoal Bridges for Offline Goal-Conditioned Reinforcement Learning
Soohyun Choi, Seonvin Cho, Songnam Hong
cs.LGcs.ROarXiv:2608.29061v12026Generation of High-Level Concepts in 3D Scene Graphs via Autoregressive Diffusion
Jose Andres Millan-Romera, Samuel Cognolato, Holger Voos +2
cs.ROcs.LGarXiv:2608.28733v12026UniTracker: Learning Universal Whole-Body Motion Tracker for Humanoid Robots
Kangning Yin, Weishuai Zeng, Ke Fan +7
cs.ROarXiv:2507.07356v32025LAMP 2.0: A Robust Multi-Robot SLAM System for Operation in Challenging Large-Scale Underground Environments
Yun Chang, Kamak Ebadi, Christopher E. Denniston +9
cs.ROcs.MAarXiv:2205.13135v32022Perceptive Humanoid Parkour: Chaining Dynamic Human Skills via Motion Matching
Zhen Wu, Xiaoyu Huang, Lujie Yang +8
cs.ROcs.AIcs.LGarXiv:2602.15827v22026Interactive World Simulator for Robot Policy Training and Evaluation
Yixuan Wang, Rhythm Syed, Fangyu Wu +7
cs.ROcs.CVcs.LGarXiv:2603.08546v12026STAMP: Scalable Task And Model-agnostic Collaborative Perception
Xiangbo Gao, Runsheng Xu, Jiachen Li +3
cs.CVcs.AIcs.ROarXiv:2501.18616v12025A*3D Dataset: Towards Autonomous Driving in Challenging Environments
Quang-Hieu Pham, Pierre Sevestre, Ramanpreet Singh Pahwa +6
cs.CVcs.ROarXiv:1909.07541v12019Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
Tao Lin, Gen Li, Yilei Zhong +5
cs.ROcs.CVarXiv:2507.00416v32025UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking
Baijun Chen, Weijie Wan, Tianxing Chen +13
cs.ROarXiv:2602.10093v12026Medical Technologies and Challenges of Robot Assisted Minimally Invasive Intervention and Diagnostics
Nabil Simaan, Rashid M. Yasin, Long Wang
cs.ROarXiv:1807.03731v12018General In-Hand Object Rotation with Vision and Touch
Haozhi Qi, Brent Yi, Sudharshan Suresh +4
cs.ROcs.AIcs.CVarXiv:2309.09979v22023Comparative Analysis of Control Barrier Functions and Artificial Potential Fields for Obstacle Avoidance
Andrew Singletary, Karl Klingebiel, Joseph Bourne +3
cs.ROeess.SYarXiv:2010.09819v12020Self-Supervised Learning of State Estimation for Manipulating Deformable Linear Objects
Mengyuan Yan, Yilin Zhu, Ning Jin +1
cs.ROcs.CVcs.LGarXiv:1911.06283v32019From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots
Runjiao Bao, Lin Zhang, Yongkang Xu +1
cs.ROarXiv:2608.29108v12026Task-Relevant Feature-Dynamics Fidelity Enables Zero-Shot Sim-to-Real Transfer for Robotic Ultrasound Scanning
Yizhao Qian, Jiayuan Luo, Wanyi Zhu +4
cs.ROarXiv:2608.29516v12026MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
Zhenyu Wu, Yuheng Zhou, Xiuwei Xu +2
cs.ROcs.CVarXiv:2503.13446v12025Scalable Multi-Robot Collaboration with Large Language Models: Centralized or Decentralized Systems?
Yongchao Chen, Jacob Arkin, Yang Zhang +2
cs.ROarXiv:2309.15943v22023Safety Guardrails for LLM-Enabled Robots
Zachary Ravichandran, Alexander Robey, Vijay Kumar +2
cs.ROcs.AIarXiv:2503.07885v22025Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution
Mohammad Nazeri, Alexandyr Card, Samira Huber +6
cs.ROcs.CVarXiv:2608.28995v12026TLA: Tactile-Language-Action Model for Contact-Rich Manipulation
Peng Hao, Chaofan Zhang, Dingzhe Li +4
cs.ROcs.CVarXiv:2503.08548v12025