Robotics

Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,181 to 3,240 of 3,242

  1. See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models

    Byungkun Lee, Dongyoon Hwang, Dongjin Kim +3

    cs.ROcs.AIarXiv:2607.11498v12026
  2. ABot-N1: Toward a General Visual Language Navigation Foundation Model

    Ruiyan Gong, Yingnan Guo, Junjun Hu +43

    cs.CVcs.AIcs.ROarXiv:2607.10383v32026
  3. Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving

    Yuan Gao, Wenting Miao, Mattia Piccinini +3

    cs.AIcs.ROarXiv:2607.14387v12026
  4. SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

    Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera +2

    cs.CVcs.ROarXiv:2607.15058v12026
  5. Fast LeWorldModel

    Yuntian Gao, Xiangyu Xu

    cs.LGcs.CVcs.ROarXiv:2606.26217v12026
  6. Hallucination in World Models is Predictable and Preventable

    Nicklas Hansen, Xiaolong Wang

    cs.LGcs.CVcs.ROarXiv:2606.27326v12026
  7. Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

    Sijin Chen, Kaixuan Jiang, Haixin Shi +6

    cs.ROcs.CVarXiv:2606.28133v12026
  8. Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

    Hongyu Qu, Jianzhe Gao, Xiaobin Hu +6

    cs.ROcs.CVarXiv:2607.07608v12026
  9. ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

    Kaifeng Zhao, Mathis Petrovich, Haotian Zhang +3

    cs.GRcs.CVcs.LGarXiv:2607.08741v12026
  10. RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

    Haotian Liang, Mingkang Chen, Yufei Huang +27

    cs.AIcs.ROarXiv:2607.14187v12026
  11. Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents

    Haoran Zhang, Yifu Lu, Boyang Wang +5

    cs.ROarXiv:2606.23085v12026
  12. Vesta: A Generalist Embodied Reasoning Model

    Johan Bjorck, Zhiqi Li, Yunze Man +29

    cs.ROcs.AIarXiv:2606.20905v12026
  13. EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies

    Ning Gao, Jinliang Zheng, Xing Gao +22

    cs.ROarXiv:2606.18239v22026
  14. SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation

    Nadun Ranawaka, Josiah Wong, Wei-Lin Pai +15

    cs.ROarXiv:2606.28276v42026
  15. SPEAR: A Simulator for Photorealistic Embodied AI Research

    Mike Roberts, Renhan Wang, Rushikesh Zawar +10

    cs.CVcs.AIcs.GRarXiv:2607.06701v12026
  16. TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

    Boyuan Wang, Yue Zhang, Xutao Xue +2

    cs.ROarXiv:2607.21017v12026
  17. SLAM in Low-Light Environments: Project Report

    Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan +1

    cs.ROcs.CVarXiv:2607.17699v12026
  18. Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

    Jiaxin Bai, Jiaxuan Xiong

    cs.CLcs.ROarXiv:2607.25337v22026
  19. Robostral Navigate

    Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra +273

    cs.ROcs.AIarXiv:2607.20785v32026
  20. WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

    Sen Wang, R. Gnana Praveen, Bidhan Roy +1

    cs.LGcs.ROarXiv:2607.23909v22026
  21. One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA

    Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

    cs.ROarXiv:2607.28443v32026
  22. CORAL: Curriculum-Optimized Reward Adaptation for LiDAR-Based Goal-Directed Urban Driving

    Anisa Saleem, Duksu Kim

    cs.ROcs.LGarXiv:2608.14332v12026
  23. RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

    Kehan Li, Bohan Hou, Minghao Zhu +28

    cs.ROarXiv:2607.17977v22026
  24. Masked Visual Actions for Unified World Modeling

    Hadi Alzayer, Wenlong Huang, Haonan Chen +8

    cs.CVcs.ROarXiv:2607.19343v12026
  25. SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing

    Zhouheng Li, Fangguo Zhao, Mattia Piccinini +6

    cs.ROarXiv:2607.25388v12026
  26. ReferTrack: Referring Then Tracking for Embodied Visual Tracking

    Hanjing Ye, Tianle Zeng, Jiazhao Zhang +6

    cs.ROarXiv:2607.20061v12026
  27. QQWorld: Quantile-Quantile Matching for World Model Regularization

    Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

    cs.LGcs.AIcs.CVarXiv:2607.28415v12026
  28. $π\mathbf{R}^2$: Reactive Real-time Flow Policies

    Sungjae Park, Shubham Tulsiani

    cs.ROcs.AIcs.LGarXiv:2607.26055v12026
  29. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

    Jianshu Zhang, Keliang Wu, Haoran Lu +8

    cs.ROcs.CLarXiv:2607.21655v12026
  30. HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

    Simple AI, :, Yuteng Wei +16

    cs.ROcs.CVcs.LGarXiv:2607.25895v12026
  31. $N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

    NeoteAI Team, Fudan TEAI Team

    cs.ROarXiv:2607.23783v12026
  32. Ensuring Safe Physical AI in Urban Mobility via Hazard-Informed Synthesized Envelopes

    Alexei Odinokov, Rostislav Yavorskiy

    cs.ROcs.AIarXiv:2608.14481v12026
  33. Data Pyramid for Embodied Manipulation: A Survey

    Yifan Ye, Yankai Fu, Yaoxu Lv +26

    cs.ROcs.CVarXiv:2607.24744v22026
  34. ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

    Dongxiu Liu, Haoyi Niu, Peng Cheng +5

    cs.LGcs.CVcs.ROarXiv:2607.27924v22026
  35. Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

    Zishuo Li, Bowen Yang, Changtao Miao +29

    cs.ROcs.CVarXiv:2607.14183v22026
  36. TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

    Hengyi Xie, Chenfei Yao, Xianjin Wu +7

    cs.CVcs.ROarXiv:2607.27205v12026
  37. Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

    Yuxuan Chen, Wanruo Zhang, Xiao Li

    cs.ROcs.AIarXiv:2608.14379v12026
  38. Active Perception for Embodied Disambiguation

    Yiwei Liu, Luwei Yang

    cs.AIcs.ROarXiv:2608.13605v12026
  39. Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories

    Renhao Lu, Mingxin Wang, Chenyang Cao +5

    cs.ROarXiv:2608.00730v12026
  40. Simulation-Aware In-Context Policy Improvement for LLM-Aided Analog Layout Refinement

    Bingyang Liu, Ziming Wei, Xiaohan Gao +1

    cs.AIcs.ROarXiv:2608.13767v12026
  41. Adjacency-Based Spectral Proxy Control of Mobile Communication Agents

    Mariana del Castillo, Federico Larroca

    cs.ROcs.LGcs.MAarXiv:2608.13616v12026
  42. Articulated Object Reconstruction from Rest-State Observation

    Daeun Lee, Jaeah Lee, Woosung Kim +2

    cs.CVcs.ROarXiv:2607.27749v12026
  43. ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

    Mingxin Wang, Bin Hu, Bin Qian +12

    cs.ROcs.CVarXiv:2607.28993v12026
  44. Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis

    Lingwei Dang, Ziyan Qiu, Jiajia Cheng +9

    cs.ROcs.CVarXiv:2608.01973v12026
  45. AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

    Guiyu Zhao, Longteng Guo, Yanghong Mei +7

    cs.ROcs.CVarXiv:2608.06729v12026
  46. Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

    Ye Wang, Pei Lin, Xiong-Hui Chen +12

    cs.ROarXiv:2608.02580v12026
  47. WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

    Senyu Fei, Xiaopeng Yu, Siyin Wang +3

    cs.ROcs.CLcs.CVarXiv:2607.29613v12026
  48. AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

    Zhiyue Zhao, Jingyi Wu, Hairuo Liu +5

    cs.ROcs.AIarXiv:2608.14028v12026
  49. AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning

    Wenhao Tang, Tianyang Chen, Zhejun Cui +9

    cs.ROcs.LGarXiv:2608.14135v12026
  50. Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

    Yi Ding, Yanzhao Yu, Xili Dai +5

    cs.ROcs.AIcs.CVarXiv:2608.14047v12026
  51. DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation

    Junfeng Li, Junjie He, Zhide Zhong +12

    cs.ROarXiv:2608.06374v12026
  52. Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

    Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore +3

    cs.CVcs.ARcs.ROarXiv:2608.08285v22026
  53. Expected Free Energy-based Informative Path Planning for Robotic Mars Exploration

    Ajith Anil Meera, Pablo Lanillos, Wouter Kouw

    cs.ROcs.ITcs.LGarXiv:2608.14466v12026
  54. Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control

    Weili Zeng, Yitong Xing, Fulong Liu +10

    cs.ROcs.CVarXiv:2607.26657v32026
  55. DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

    DreamX Team, Rui Chen, Xiangxiang Chu +7

    cs.CVcs.ROarXiv:2608.13489v12026
    Summaries:한국어
  56. Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

    Haoqi Yuan, Zhixuan Liang, Anzhe Chen +20

    cs.ROcs.CVcs.LGarXiv:2606.17846v22026
    Summaries:한국어
  57. GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

    GigaWorld Team, Angyuan Ma, Boyuan Wang +24

    cs.ROarXiv:2607.02642v12026
  58. Self-Evolving Embodied Agents via Skill-Harness Evolution

    Peidong Wang, Zhiming Ma, Ying Chang +5

    cs.CLcs.ROarXiv:2608.11350v12026
  59. InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

    Haoxiang Ma, Junhao Cai, Xiaoxu Xu +26

    cs.ROarXiv:2607.04988v12026
  60. From Foundation to Application: Improving VLA Models in Practice

    Wei Wu, Fangjing Wang, Fan Lu +21

    cs.ROarXiv:2607.06403v12026