Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,501 to 16,560 of 18,817

  1. Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation

    Hongzhou Zhu, Min Zhao, Guande He +3

    cs.CVarXiv:2602.02214v52026
  2. GigaWorld-Policy: An Efficient Action-Centered World--Action Model

    Angen Ye, Boyuan Wang, Chaojun Ni +21

    cs.CVarXiv:2603.17240v22026
  3. Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

    Christopher Clark, Jieyu Zhang, Zixian Ma +18

    cs.CVcs.AIarXiv:2601.10611v42026
  4. Causal World Modeling for Robot Control

    Lin Li, Qihang Zhang, Yiming Luo +9

    cs.CVcs.ROarXiv:2601.21998v22026
  5. SkillNet: Create, Evaluate, and Connect AI Skills

    Yuan Liang, Ruobin Zhong, Haoming Xu +47

    cs.AIcs.CLcs.CVarXiv:2603.04448v22026
  6. One-step Latent-free Image Generation with Pixel Mean Flows

    Yiyang Lu, Susie Lu, Qiao Sun +6

    cs.CVarXiv:2601.22158v32026
  7. Helios: Real Real-Time Long Video Generation Model

    Shenghai Yuan, Yuanyang Yin, Zongjian Li +3

    cs.CVarXiv:2603.04379v12026
  8. VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

    Jingwen Sun, Wenyao Zhang, Zekun Qi +6

    cs.ROcs.CVarXiv:2602.10098v22026
  9. OpenClaw-RL: Train Any Agent Simply by Talking

    Yinjie Wang, Xuyang Chen, Xiaolong Jin +2

    cs.CLcs.AIcs.CVarXiv:2603.10165v22026
  10. ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning

    Yandan Yang, Shuang Zeng, Tong Lin +11

    cs.CVcs.CLcs.ROarXiv:2602.11236v22026
  11. A Pragmatic VLA Foundation Model

    Wei Wu, Fan Lu, Yunnan Wang +22

    cs.ROcs.CVarXiv:2601.18692v42026
  12. SAM 3D Body: Robust Full-Body Human Mesh Recovery

    Xitong Yang, Devansh Kukreja, Don Pinkus +11

    cs.CVarXiv:2602.15989v12026
  13. V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning

    Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar +6

    cs.CVarXiv:2603.14482v32026
  14. Advancing Open-source World Models

    Robbyant Team, Zelin Gao, Qiuyu Wang +21

    cs.CVarXiv:2601.20540v12026
  15. DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

    Shenyuan Gao, William Liang, Kaiyuan Zheng +27

    cs.ROcs.AIcs.CVarXiv:2602.06949v12026
  16. World Action Models are Zero-shot Policies

    Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng +33

    cs.ROcs.CVcs.LGarXiv:2602.15922v12026
  17. Human-Centric Intelligence in the Era of Foundation Models: A Survey

    Yang Chen, Tianqi Wang, Xiaorui Jiang +13

    cs.CVarXiv:2608.18184v12026
    Summaries:한국어
  18. EgoSim: Egocentric World Simulator for Embodied Interaction Generation

    Jinkun Hao, Mingda Jia, Ruiyan Wang +7

    cs.CVcs.AIarXiv:2604.01001v22026
  19. RecGen3D: Reconstruction-Guided 3D Generation in a Shared Canonical Space

    Zhisheng Huang, Jiahao Chen, Cheng Lin +10

    cs.CVarXiv:2604.01479v32026
  20. PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding

    Nan Wang, Zhiwei Jin, Chen Chen +1

    cs.CVcs.AIcs.CLarXiv:2604.00886v12026
  21. Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

    Zhuchenyang Liu, Yao Zhang, Yu Xiao

    cs.CVcs.CLarXiv:2604.00913v22026
  22. FlowSlider: Training-Free Continuous Image Editing via Fidelity-Steering Decomposition

    Taichi Endo, Guoqing Hao, Kazuhiko Sumi

    cs.CVarXiv:2604.02088v12026
  23. DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

    Wonjoon Jin, Jiyun Won, Janghyeok Han +4

    cs.CVarXiv:2604.01666v12026
  24. VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

    Jiahao Meng, Tan Yue, Qi Xu +7

    cs.CVcs.MMarXiv:2604.01569v12026
  25. VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

    Haz Sameen Shahgir, Xiaofu Chen, Yu Fu +4

    cs.CVcs.CLarXiv:2604.02486v32026
  26. Generative World Renderer

    Zheng-Hui Huang, Zhixiang Wang, Jiaming Tan +6

    cs.CVarXiv:2604.02329v12026
  27. LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation

    Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar +2

    cs.CVcs.CLarXiv:2604.00829v32026
  28. All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

    Xinyu Tian, Shu Zou, Zhaoyuan Yang +3

    cs.CVarXiv:2604.00479v12026
  29. AutoMIA: Improved Baselines for Membership Inference Attack via Agentic Self-Exploration

    Ruhao Liu, Weiqi Huang, Qi Li +1

    cs.CRcs.CVarXiv:2604.01014v12026
  30. HippoCamp: Benchmarking Contextual Agents on Personal Computers

    Zhe Yang, Shulin Tian, Kairui Hu +9

    cs.AIcs.CVarXiv:2604.01221v12026
    Summaries:한국어
  31. ActionParty: Multi-Subject Action Binding in Generative Video Games

    Alexander Pondaven, Ziyi Wu, Igor Gilitschenski +4

    cs.CVcs.AIcs.LGarXiv:2604.02330v22026
  32. Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models

    Jiawei Chen, Simin Huang, Jiawei Du +5

    cs.CVcs.AIarXiv:2604.01618v12026
  33. Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

    Chongjie Ye, Cheng Cao, Chuanyu Pan +4

    cs.CVcs.AIarXiv:2604.02289v12026
  34. UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

    Yongkang Li, Lijun Zhou, Sixu Yan +11

    cs.CVcs.ROarXiv:2604.02190v12026
  35. GPA: Learning GUI Process Automation from Demonstrations

    Zirui Zhao, Jun Hao Liew, Yan Yang +5

    cs.CVcs.AIcs.SEarXiv:2604.01676v22026
  36. LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

    Jiachun Jin, Zetong Zhou, Xiao Yang +4

    cs.CVcs.LGarXiv:2604.02097v12026
  37. Steerable Visual Representations

    Jona Ruthardt, Manu Gaur, Deva Ramanan +2

    cs.CVcs.AIarXiv:2604.02327v22026
  38. DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

    Yang Zhou, Xiaofeng Wang, Hao Shao +8

    cs.CVcs.AIcs.ROarXiv:2604.01765v12026
  39. A Simple Baseline for Streaming Video Understanding

    Yujiao Shen, Shulin Tian, Jingkang Yang +1

    cs.CVarXiv:2604.02317v12026
  40. Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

    Xingtong Ge, Yi Zhang, Yushi Huang +6

    cs.CVeess.IVarXiv:2604.03118v22026
  41. Token Warping Helps MLLMs Look from Nearby Viewpoints

    Phillip Y. Lee, Chanho Park, Mingue Park +3

    cs.CVarXiv:2604.02870v12026
  42. Significance and Stability Analysis of Genotype-Environment Interaction using GxEStat

    Meng'en Qin, Zhe Li, Hui Huang +1

    cs.CVstat.AParXiv:2604.03337v32026
  43. Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

    Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee +7

    cs.CVarXiv:2606.11180v12026
  44. Addressable Memory for Video World Models

    Xindi Wu, Sven Elflein, James Lucas +5

    cs.CVcs.LGarXiv:2608.07408v12026
  45. PLUME: Latent Reasoning Based Universal Multimodal Embedding

    Chenwei He, Xiangzhao Hao, Tianyu Yang +6

    cs.CVarXiv:2604.02073v32026
    Summaries:한국어
  46. Watch Before You Answer: Learning from Visually Grounded Post-Training

    Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang +8

    cs.CVcs.AIcs.CLarXiv:2604.05117v12026
  47. SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing

    Yicheng Xiao, Wenhu Zhang, Lin Song +10

    cs.CVarXiv:2604.04911v22026
  48. SciLT: Long-tailed Image Classification under Scientific Image Domains

    Jiahao Chen, Bing Su

    cs.CVarXiv:2604.03687v32026
  49. TriAttention: Efficient Long Reasoning with Trigonometric KV Compression

    Weian Mao, Xi Lin, Wei Huang +5

    cs.CLcs.CVarXiv:2604.04921v12026
  50. Training a Student Expert via Semi-Supervised Foundation Model Distillation

    Pardis Taghavi, Tian Liu, Renjie Li +2

    cs.CVarXiv:2604.03841v12026
  51. Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling?

    Peter Yongho Kim, Juhyeon Park, Jungwoo Park +4

    cs.CVarXiv:2604.03619v12026
  52. AURA: Always-On Understanding and Real-Time Assistance via Video Streams

    Xudong Lu, Yang Bo, Jinpeng Chen +9

    cs.CVarXiv:2604.04184v12026
  53. A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

    Tianle Chen, Deepti Ghadiyaram

    cs.CVcs.SDarXiv:2604.03995v12026
  54. CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models

    Xiangzhao Hao, Zefeng Zhang, Zhenyu Zhang +6

    cs.CVarXiv:2604.04780v12026
  55. AvatarPointillist: AutoRegressive 4D Gaussian Avatarization

    Hongyu Liu, Xuan Wang, Zijian Wu +7

    cs.CVarXiv:2604.04787v22026
  56. Vero: An Open RL Recipe for General Visual Reasoning

    Gabriel Sarch, Linrong Cai, Qunzhong Wang +3

    cs.CVcs.AIcs.CLarXiv:2604.04917v32026
  57. Less Detail, Better Answers: Degradation-Driven Prompting for VQA

    Haoxuan Han, Weijie Wang, Zeyu Zhang +2

    cs.CVarXiv:2604.04838v22026
  58. FileGram: Grounding Agent Personalization in File-System Behavioral Traces

    Shuai Liu, Shulin Tian, Kairui Hu +6

    cs.CVcs.AIarXiv:2604.04901v12026
  59. OpenWorldLib: A Unified Codebase and Definition of Advanced World Models

    DataFlow Team, Bohan Zeng, Daili Hua +39

    cs.CVarXiv:2604.04707v22026
  60. MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale

    Bin Wang, Tianyao He, Linke Ouyang +40

    cs.CVcs.CLarXiv:2604.04771v22026