Robotics

Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

721 to 780 of 3,241

  1. A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation

    Fanqi Lin, Kushal Arora, Jean Mercat +9

    cs.ROarXiv:2602.01067v12026
  2. HumanX: Toward Agile and Generalizable Humanoid Interaction Skills from Human Videos

    Yinhuai Wang, Qihan Zhao, Yuen Fui Lau +6

    cs.ROcs.LGarXiv:2602.02473v12026
  3. Dual-Part Multi-Lateral Branched Network for Multi-Class Segmentation in Cardiovascular Catheterization Angiograms

    Olatunji Omisore, Ahmed Elazab, Ali Shahidinejad +1

    cs.CVcs.AIcs.ROarXiv:2609.04590v12026
  4. 6-PACK: Category-level 6D Pose Tracker with Anchor-Based Keypoints

    Chen Wang, Roberto Martín-Martín, Danfei Xu +5

    cs.CVcs.ROarXiv:1910.10750v12019
  5. DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

    Sicheng Zuo, Zixun Xie, Wenzhao Zheng +6

    cs.CVcs.AIcs.ROarXiv:2604.00813v32026
  6. DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

    Zebin Yang, Yijiahao Qi, Tong Xie +3

    cs.ROarXiv:2602.22896v32026
  7. Mask World Model: Predicting What Matters for Robust Robot Policy Learning

    Yunfan Lou, Xiaowei Chi, Xiaojie Zhang +9

    cs.ROarXiv:2604.19683v22026
  8. Safety Beyond the Training Data: Robust Out-of-Distribution MPC via Conformalized System Level Synthesis

    Anutam Srinivasan, Antoine Leeman, Glen Chou

    cs.ROcs.LGeess.SYarXiv:2602.12047v12026
  9. SalsaNet: Fast Road and Vehicle Segmentation in LiDAR Point Clouds for Autonomous Driving

    Eren Erdal Aksoy, Saimir Baci, Selcuk Cavdar

    cs.CVcs.ROarXiv:1909.08291v12019
  10. Advances in Global Solvers for 3D Vision

    Zhenjun Zhao, Heng Yang, Bangyan Liao +7

    cs.CVcs.ROarXiv:2602.14662v12026
  11. Goal-Driven Autonomous Exploration Through Deep Reinforcement Learning

    Reinis Cimurs, Il Hong Suh, Jin Han Lee

    cs.ROarXiv:2103.07119v22021
  12. Chain of Code: Reasoning with a Language Model-Augmented Code Emulator

    Chengshu Li, Jacky Liang, Andy Zeng +7

    cs.CLcs.AIcs.LGarXiv:2312.04474v42023
  13. Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation

    Yang Tian, Sizhe Yang, Jia Zeng +4

    cs.ROarXiv:2412.15109v12024
  14. AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

    Xiaolou Sun, Wufei Si, Wenhui Ni +10

    cs.ROarXiv:2602.09657v12026
  15. SOP: A Scalable Online Post-Training System for Vision-Language-Action Models

    Mingjie Pan, Siyuan Feng, Qinglin Zhang +9

    cs.ROarXiv:2601.03044v12026
  16. PlayWorld: Learning Robot World Models from Autonomous Play

    Tenny Yin, Zhiting Mei, Zhonghe Zheng +8

    cs.ROcs.AIarXiv:2603.09030v32026
  17. Efficient and Probabilistic Adaptive Voxel Mapping for Accurate Online LiDAR Odometry

    Chongjian Yuan, Wei xu, Xiyuan Liu +2

    cs.ROarXiv:2109.07082v52021
  18. Formal Specification and Verification of Autonomous Robotic Systems: A Survey

    Matt Luckcuck, Marie Farrell, Louise Dennis +2

    cs.FLcs.ROarXiv:1807.00048v32018
  19. Denoising IMU Gyroscopes with Deep Learning for Open-Loop Attitude Estimation

    Martin Brossard, Silvere Bonnabel, Axel Barrau

    cs.ROstat.MLarXiv:2002.10718v22020
  20. DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving

    Shuyao Shang, Bing Zhan, Yunfei Yan +9

    cs.CVcs.ROarXiv:2603.11041v22026
  21. X-View: Graph-Based Semantic Multi-View Localization

    Abel Gawel, Carlo Del Don, Roland Siegwart +2

    cs.ROcs.CVarXiv:1709.09905v32017
  22. Lyapunov-stable neural-network control

    Hongkai Dai, Benoit Landry, Lujie Yang +2

    cs.ROeess.SYarXiv:2109.14152v12021
  23. Robocentric Visual-Inertial Odometry

    Zheng Huai, Guoquan Huang

    cs.ROarXiv:1805.04031v12018
  24. Towards Real-Time Monocular Depth Estimation for Robotics: A Survey

    Xingshuai Dong, Matthew A. Garratt, Sreenatha G. Anavatti +1

    cs.ROarXiv:2111.08600v12021
  25. SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation

    Jiwen Zhang, Zejun Li, Siyuan Wang +3

    cs.CVcs.AIcs.ROarXiv:2601.06806v12026
  26. Omni-swarm: A Decentralized Omnidirectional Visual-Inertial-UWB State Estimation System for Aerial Swarms

    Hao Xu, Yichen Zhang, Boyu Zhou +4

    cs.ROarXiv:2103.04131v52021
  27. ARM: Advantage Reward Modeling for Long-Horizon Manipulation

    Yiming Mao, Zixi Yu, Weixin Mao +5

    cs.ROcs.AIcs.CVarXiv:2604.03037v22026
  28. HoloBrain-0 Technical Report

    Xuewu Lin, Tianwei Lin, Yun Du +12

    cs.ROarXiv:2602.12062v12026
  29. 3D Human Pose Estimation in RGBD Images for Robotic Task Learning

    Christian Zimmermann, Tim Welschehold, Christian Dornhege +2

    cs.CVcs.ROarXiv:1803.02622v22018
  30. AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots

    Likui Zhang, Tao Tang, Zhihao Zhan +9

    cs.ROcs.AIcs.CVarXiv:2603.07648v12026
  31. ActionCodec: What Makes for Good Action Tokenizers

    Zibin Dong, Yicheng Liu, Shiduo Zhang +8

    cs.ROcs.AIarXiv:2602.15397v12026
  32. Observing and Controlling Features in Vision-Language-Action Models

    Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann +1

    cs.ROarXiv:2603.05487v12026
  33. TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation

    Kaidi Zhang, Heng Zhang, Zhengtong Xu +7

    cs.ROarXiv:2603.12665v32026
  34. Coarse-to-Fine Imitation Learning: Robot Manipulation from a Single Demonstration

    Edward Johns

    cs.ROcs.LGarXiv:2105.06411v22021
  35. RLOC: Terrain-Aware Legged Locomotion using Reinforcement Learning and Optimal Control

    Siddhant Gangapurwala, Mathieu Geisert, Romeo Orsolino +2

    cs.ROcs.LGarXiv:2012.03094v32020
  36. Long-Range Indoor Navigation with PRM-RL

    Anthony Francis, Aleksandra Faust, Hao-Tien Lewis Chiang +4

    cs.ROcs.AIcs.LGarXiv:1902.09458v22019
  37. AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

    Liaoyuan Fan, Zetian Xu, Chen Cao +3

    cs.ROcs.LGarXiv:2604.11135v12026
  38. DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos

    Juncheng Mu, Sizhe Yang, Yiming Bao +6

    cs.ROarXiv:2602.10105v12026
  39. Action-to-Action Flow Matching

    Jindou Jia, Gen Li, Xiangyu Chen +5

    cs.ROcs.AIarXiv:2602.07322v22026
  40. DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning

    Zhenyu Jiang, Yuqi Xie, Kevin Lin +5

    cs.ROcs.AIcs.CVarXiv:2410.24185v22024
  41. VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks

    Shiduo Zhang, Zhe Xu, Peiju Liu +8

    cs.ROcs.AIcs.CLarXiv:2412.18194v12024
  42. cuRoboV2: Dynamics-Aware Motion Generation with Depth-Fused Distance Fields for High-DoF Robots

    Balakumar Sundaralingam, Adithyavairavan Murali, Stan Birchfield

    cs.ROarXiv:2603.05493v22026
  43. Sparse Autoencoders Reveal Interpretable and Steerable Features in VLA Models

    Aiden Swann, Lachlain McGranahan, Hugo Buurmeijer +2

    cs.ROarXiv:2603.19183v22026
  44. Object Handovers: a Review for Robotics

    Valerio Ortenzi, Akansel Cosgun, Tommaso Pardi +3

    cs.ROeess.SYarXiv:2007.12952v22020
  45. Synthesizing Diverse and Physically Stable Grasps with Arbitrary Hand Structures using Differentiable Force Closure Estimator

    Tengyu Liu, Zeyu Liu, Ziyuan Jiao +2

    cs.ROarXiv:2104.09194v42021
  46. Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning

    Shixiang Gu, Timothy Lillicrap, Zoubin Ghahramani +3

    cs.LGcs.AIcs.ROarXiv:1706.00387v12017
  47. ManipulationNet: An Infrastructure for Benchmarking Real-World Robot Manipulation with Physical Skill Challenges and Embodied Multimodal Reasoning

    Yiting Chen, Kenneth Kimble, Edward H. Adelson +20

    cs.ROarXiv:2603.04363v12026
  48. Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

    Tao Lin, Yuxin Du, Jiting Liu +14

    cs.CVcs.ROarXiv:2605.14950v12026
  49. PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics

    Zhiao Huang, Yuanming Hu, Tao Du +4

    cs.LGcs.AIcs.CVarXiv:2104.03311v12021
  50. Real-Time Robot Execution with Masked Action Chunking

    Haoxuan Wang, Gengyu Zhang, Yan Yan +3

    cs.ROarXiv:2601.20130v12026
  51. Goal Staying Makes Sum-of-Costs Anonymous Multi-Agent Path Finding NP-Hard

    Hang Ma

    cs.MAcs.CCcs.ROarXiv:2608.28658v12026
  52. Patchwork: Concentric Zone-based Region-wise Ground Segmentation with Ground Likelihood Estimation Using a 3D LiDAR Sensor

    Hyungtae Lim, Minho Oh, Hyun Myung

    cs.ROcs.CVarXiv:2108.05560v22021
  53. Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models

    Canyu Chen, Yuguang Yang, Zhewen Tan +10

    cs.CVcs.ROarXiv:2603.06049v12026
  54. S4G: Amodal Single-view Single-Shot SE(3) Grasp Detection in Cluttered Scenes

    Yuzhe Qin, Rui Chen, Hao Zhu +3

    cs.ROcs.CVarXiv:1910.14218v12019
  55. ZEST: Zero-shot Embodied Skill Transfer for Athletic Robot Control

    Jean Pierre Sleiman, He Li, Alphonsus Adu-Bredu +25

    cs.ROcs.AIarXiv:2602.00401v12026
  56. AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models

    Xiaoquan Sun, Zetian Xu, Chen Cao +9

    cs.ROarXiv:2603.08519v12026
  57. Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models

    Nilaksh, Saurav Jha, Artem Zholus +1

    cs.CVcs.LGcs.ROarXiv:2605.06388v12026
  58. Towards Better Generalization: Joint Depth-Pose Learning without PoseNet

    Wang Zhao, Shaohui Liu, Yezhi Shu +1

    cs.CVcs.ROarXiv:2004.01314v22020
  59. OmniXtreme: Breaking the Generality Barrier in High-Dynamic Humanoid Control

    Yunshen Wang, Shaohang Zhu, Peiyuan Zhi +7

    cs.ROarXiv:2602.23843v12026
  60. Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

    Shuanghao Bai, Jing Lyu, Wanqi Zhou +9

    cs.ROarXiv:2602.01166v22026