Robotics
Papers filed under cs.RO on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
3,181 to 3,240 of 3,242
See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
Byungkun Lee, Dongyoon Hwang, Dongjin Kim +3
cs.ROcs.AIarXiv:2607.11498v12026ABot-N1: Toward a General Visual Language Navigation Foundation Model
Ruiyan Gong, Yingnan Guo, Junjun Hu +43
cs.CVcs.AIcs.ROarXiv:2607.10383v32026Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving
Yuan Gao, Wenting Miao, Mattia Piccinini +3
cs.AIcs.ROarXiv:2607.14387v12026SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera +2
cs.CVcs.ROarXiv:2607.15058v12026Fast LeWorldModel
Yuntian Gao, Xiangyu Xu
cs.LGcs.CVcs.ROarXiv:2606.26217v12026Hallucination in World Models is Predictable and Preventable
Nicklas Hansen, Xiaolong Wang
cs.LGcs.CVcs.ROarXiv:2606.27326v12026Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
Sijin Chen, Kaixuan Jiang, Haixin Shi +6
cs.ROcs.CVarXiv:2606.28133v12026Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
Hongyu Qu, Jianzhe Gao, Xiaobin Hu +6
cs.ROcs.CVarXiv:2607.07608v12026ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
Kaifeng Zhao, Mathis Petrovich, Haotian Zhang +3
cs.GRcs.CVcs.LGarXiv:2607.08741v12026RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
Haotian Liang, Mingkang Chen, Yufei Huang +27
cs.AIcs.ROarXiv:2607.14187v12026Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents
Haoran Zhang, Yifu Lu, Boyang Wang +5
cs.ROarXiv:2606.23085v12026Vesta: A Generalist Embodied Reasoning Model
Johan Bjorck, Zhiqi Li, Yunze Man +29
cs.ROcs.AIarXiv:2606.20905v12026EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies
Ning Gao, Jinliang Zheng, Xing Gao +22
cs.ROarXiv:2606.18239v22026SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation
Nadun Ranawaka, Josiah Wong, Wei-Lin Pai +15
cs.ROarXiv:2606.28276v42026SPEAR: A Simulator for Photorealistic Embodied AI Research
Mike Roberts, Renhan Wang, Rushikesh Zawar +10
cs.CVcs.AIcs.GRarXiv:2607.06701v12026TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation
Boyuan Wang, Yue Zhang, Xutao Xue +2
cs.ROarXiv:2607.21017v12026SLAM in Low-Light Environments: Project Report
Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan +1
cs.ROcs.CVarXiv:2607.17699v12026Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control
Jiaxin Bai, Jiaxuan Xiong
cs.CLcs.ROarXiv:2607.25337v22026Robostral Navigate
Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra +273
cs.ROcs.AIarXiv:2607.20785v32026WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
Sen Wang, R. Gnana Praveen, Bidhan Roy +1
cs.LGcs.ROarXiv:2607.23909v22026One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA
Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov
cs.ROarXiv:2607.28443v32026CORAL: Curriculum-Optimized Reward Adaptation for LiDAR-Based Goal-Directed Urban Driving
Anisa Saleem, Duksu Kim
cs.ROcs.LGarXiv:2608.14332v12026RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
Kehan Li, Bohan Hou, Minghao Zhu +28
cs.ROarXiv:2607.17977v22026Masked Visual Actions for Unified World Modeling
Hadi Alzayer, Wenlong Huang, Haonan Chen +8
cs.CVcs.ROarXiv:2607.19343v12026SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing
Zhouheng Li, Fangguo Zhao, Mattia Piccinini +6
cs.ROarXiv:2607.25388v12026ReferTrack: Referring Then Tracking for Embodied Visual Tracking
Hanjing Ye, Tianle Zeng, Jiazhao Zhang +6
cs.ROarXiv:2607.20061v12026QQWorld: Quantile-Quantile Matching for World Model Regularization
Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu
cs.LGcs.AIcs.CVarXiv:2607.28415v12026$π\mathbf{R}^2$: Reactive Real-time Flow Policies
Sungjae Park, Shubham Tulsiani
cs.ROcs.AIcs.LGarXiv:2607.26055v12026Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
Jianshu Zhang, Keliang Wu, Haoran Lu +8
cs.ROcs.CLarXiv:2607.21655v12026HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
Simple AI, :, Yuteng Wei +16
cs.ROcs.CVcs.LGarXiv:2607.25895v12026$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
NeoteAI Team, Fudan TEAI Team
cs.ROarXiv:2607.23783v12026Ensuring Safe Physical AI in Urban Mobility via Hazard-Informed Synthesized Envelopes
Alexei Odinokov, Rostislav Yavorskiy
cs.ROcs.AIarXiv:2608.14481v12026Data Pyramid for Embodied Manipulation: A Survey
Yifan Ye, Yankai Fu, Yaoxu Lv +26
cs.ROcs.CVarXiv:2607.24744v22026ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow
Dongxiu Liu, Haoyi Niu, Peng Cheng +5
cs.LGcs.CVcs.ROarXiv:2607.27924v22026Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Zishuo Li, Bowen Yang, Changtao Miao +29
cs.ROcs.CVarXiv:2607.14183v22026TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Hengyi Xie, Chenfei Yao, Xianjin Wu +7
cs.CVcs.ROarXiv:2607.27205v12026Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation
Yuxuan Chen, Wanruo Zhang, Xiao Li
cs.ROcs.AIarXiv:2608.14379v12026Active Perception for Embodied Disambiguation
Yiwei Liu, Luwei Yang
cs.AIcs.ROarXiv:2608.13605v12026Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories
Renhao Lu, Mingxin Wang, Chenyang Cao +5
cs.ROarXiv:2608.00730v12026Simulation-Aware In-Context Policy Improvement for LLM-Aided Analog Layout Refinement
Bingyang Liu, Ziming Wei, Xiaohan Gao +1
cs.AIcs.ROarXiv:2608.13767v12026Adjacency-Based Spectral Proxy Control of Mobile Communication Agents
Mariana del Castillo, Federico Larroca
cs.ROcs.LGcs.MAarXiv:2608.13616v12026Articulated Object Reconstruction from Rest-State Observation
Daeun Lee, Jaeah Lee, Woosung Kim +2
cs.CVcs.ROarXiv:2607.27749v12026ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
Mingxin Wang, Bin Hu, Bin Qian +12
cs.ROcs.CVarXiv:2607.28993v12026Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis
Lingwei Dang, Ziyan Qiu, Jiajia Cheng +9
cs.ROcs.CVarXiv:2608.01973v12026AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
Guiyu Zhao, Longteng Guo, Yanghong Mei +7
cs.ROcs.CVarXiv:2608.06729v12026Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
Ye Wang, Pei Lin, Xiong-Hui Chen +12
cs.ROarXiv:2608.02580v12026WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
Senyu Fei, Xiaopeng Yu, Siyin Wang +3
cs.ROcs.CLcs.CVarXiv:2607.29613v12026AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning
Zhiyue Zhao, Jingyi Wu, Hairuo Liu +5
cs.ROcs.AIarXiv:2608.14028v12026AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning
Wenhao Tang, Tianyang Chen, Zhejun Cui +9
cs.ROcs.LGarXiv:2608.14135v12026Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use
Yi Ding, Yanzhao Yu, Xili Dai +5
cs.ROcs.AIcs.CVarXiv:2608.14047v12026DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation
Junfeng Li, Junjie He, Zhide Zhong +12
cs.ROarXiv:2608.06374v12026Ego-OSCAR: Egocentric Open source Stereo CAptuRe System
Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore +3
cs.CVcs.ARcs.ROarXiv:2608.08285v22026Expected Free Energy-based Informative Path Planning for Robotic Mars Exploration
Ajith Anil Meera, Pablo Lanillos, Wouter Kouw
cs.ROcs.ITcs.LGarXiv:2608.14466v12026Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control
Weili Zeng, Yitong Xing, Fulong Liu +10
cs.ROcs.CVarXiv:2607.26657v32026DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
DreamX Team, Rui Chen, Xiangxiang Chu +7
cs.CVcs.ROarXiv:2608.13489v12026Summaries:한국어Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
Haoqi Yuan, Zhixuan Liang, Anzhe Chen +20
cs.ROcs.CVcs.LGarXiv:2606.17846v22026Summaries:한국어GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
GigaWorld Team, Angyuan Ma, Boyuan Wang +24
cs.ROarXiv:2607.02642v12026Self-Evolving Embodied Agents via Skill-Harness Evolution
Peidong Wang, Zhiming Ma, Ying Chang +5
cs.CLcs.ROarXiv:2608.11350v12026InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
Haoxiang Ma, Junhao Cai, Xiaoxu Xu +26
cs.ROarXiv:2607.04988v12026From Foundation to Application: Improving VLA Models in Practice
Wei Wu, Fangjing Wang, Fan Lu +21
cs.ROarXiv:2607.06403v12026