Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

6,541 to 6,600 of 18,839

  1. Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

    Junlin Han, Shengbang Tong, David Fan +4

    cs.CVcs.LGcs.MMarXiv:2608.05000v22026
  2. Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

    Kejian Zhu, Zhuoran Jin, Dongqi Huang +4

    cs.CVarXiv:2608.03571v22026
  3. Quo Vadis, World Modeling?

    Yu Yang, Xuemeng Yang, Licheng Wen +17

    cs.CVcs.AIcs.ROarXiv:2608.02713v12026
  4. Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement

    Yuqi Liu, Bohao Peng, Zhisheng Zhong +4

    cs.CVcs.MMarXiv:2503.06520v32025
  5. SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift

    Sagar Lekhak, Prasanna Reddy Pulakurthi, Lalit Joshi +2

    cs.CVarXiv:2607.28996v12026
  6. MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

    Jiajia Lin, Mingxuan Du, Tuowen Zhou +2

    cs.CVarXiv:2607.27616v12026
  7. Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

    Xiaomi Robotics Team, Jun Guo, Piaopiao Jin +31

    cs.ROcs.CVarXiv:2607.15330v22026
    Summaries:한국어
  8. OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

    Jinsen Su, Yongdong Luo, Yuexiao Ma +3

    cs.CVarXiv:2607.23193v32026
  9. VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

    Xinhao Li, Yuhan Zhu, Xiangyu Zeng +24

    cs.CVarXiv:2607.14935v12026
  10. Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

    Zhishan Zou, Guoyan Sun, Zhiwei Wei +4

    cs.CVarXiv:2607.12477v22026
  11. RoarNet: A Robust 3D Object Detection based on RegiOn Approximation Refinement

    Kiwoo Shin, Youngwook Paul Kwon, Masayoshi Tomizuka

    cs.CVarXiv:1811.03818v12018
  12. Self-Forcing++: Towards Minute-Scale High-Quality Video Generation

    Justin Cui, Jie Wu, Ming Li +6

    cs.CVcs.AIarXiv:2510.02283v12025
  13. advertorch v0.1: An Adversarial Robustness Toolbox based on PyTorch

    Gavin Weiguang Ding, Luyu Wang, Xiaomeng Jin

    cs.LGcs.CRcs.CVarXiv:1902.07623v12019
  14. HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

    Gengluo Li, Xingyu Wan, Shangpin Peng +20

    cs.CVarXiv:2607.04884v22026
  15. Representation Distribution Matching for One-Step Visual Generation

    Lan Feng, Wuyang Li, Eloi Zablocki +2

    cs.CVarXiv:2607.02375v12026
  16. WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

    Hanlin Wang, Hao Ouyang, Qiuyu Wang +10

    cs.CVarXiv:2607.02517v12026
  17. AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

    Rintaro Otsubo, Ryo Fujii, Reina Ishikawa +6

    cs.CVcs.AIarXiv:2607.02269v12026
  18. Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

    Xingyu Zheng, Xianglong Liu, Yifu Ding +4

    cs.CVarXiv:2607.01642v12026
    Summaries:한국어
  19. MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

    Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi +7

    cs.CLcs.AIcs.CVarXiv:2607.01420v32026
  20. Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

    Hongxing Li, Xiufeng Huang, Dingming Li +11

    cs.CVarXiv:2607.01191v12026
  21. SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE

    Or Hirschorn, Aaron Olender, Eli Alshan +3

    cs.CVarXiv:2606.32033v12026
  22. Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

    Shijie Li, Yilin Gao, Siyuan Yang +7

    cs.CVarXiv:2607.00461v12026
  23. MuSViT: A Foundation Vision Model for Sheet Music Representation

    Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez +4

    cs.CVarXiv:2606.31811v12026
  24. DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

    Siyu Yan, Yizhen Gao, Yilin Wang +2

    cs.CVcs.MAarXiv:2606.31537v12026
  25. Physics-Informed Machine Learning: A Survey on Problems, Methods and Applications

    Zhongkai Hao, Songming Liu, Yichi Zhang +4

    cs.LGcs.AIcs.CVarXiv:2211.08064v22022
  26. Comprehensive Review of Deep Learning-Based 3D Point Cloud Completion Processing and Analysis

    Ben Fei, Weidong Yang, Wenming Chen +5

    cs.CVarXiv:2203.03311v32022
  27. The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

    Yuxi Wang, Chengkai Jin, Yufei Liu +6

    cs.CVarXiv:2606.30308v22026
    Summaries:한국어
  28. PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising

    Koorosh Roohi, Javad Rajabi, Andrew Fleet +1

    cs.CVarXiv:2606.30968v12026
  29. LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

    Xinyu Wang, Chongbo Zhao, Fangneng Zhan +1

    cs.CVarXiv:2606.26740v22026
  30. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

    Lianghua Huang, Zhi-Fan Wu, Wei Wang +22

    cs.CVcs.AIcs.GRarXiv:2606.25041v32026
  31. SkyReels-V2: Infinite-length Film Generative Model

    Guibin Chen, Dixuan Lin, Jiangping Yang +22

    cs.CVarXiv:2504.13074v32025
  32. FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows

    Daniel Gilo, Sven Elflein, Ido Sobol +1

    cs.CVarXiv:2606.20404v12026
  33. EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies

    Ganlin Yang, Zhangzheng Tu, Yuqiang Yang +10

    cs.CVarXiv:2606.20092v22026
  34. BadWorld: Adversarial Attacks on World Models

    Linghui Shen, Mingyue Cui, Xingyi Yang

    cs.CVarXiv:2606.16519v12026
  35. SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control

    Zhengyi Luo, Ye Yuan, Tingwu Wang +25

    cs.ROcs.AIcs.CVarXiv:2511.07820v42025
  36. GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

    Sujay Belsare, Sudarshan Nikhil, Sushant Kumar +2

    cs.CVarXiv:2606.14740v12026
  37. Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

    Weichen Fan, Haiwen Diao, Penghao Wu +1

    cs.CVarXiv:2606.15236v22026
  38. Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

    Xin Jin, Huanqia Cai, Zhen Li +9

    cs.CVarXiv:2606.09076v32026
  39. AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

    Qize Yu, Jiadi You, Yuran Wang +10

    cs.ROcs.CVcs.MMarXiv:2606.06155v12026
  40. MAOAM: Unified Object and Material Selection with Vision-Language Models

    Jaden Park, Valentin Deschaintre, Jason Kuen +5

    cs.CVarXiv:2606.04880v12026
  41. SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

    Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3

    cs.CVarXiv:2605.31597v32026
  42. VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

    Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral +4

    cs.CVcs.AIarXiv:2605.30351v12026
  43. AdaState: Self-Evolving Anchors for Streaming Video Generation

    Yusuf Dalva, Pinar Yanardag

    cs.CVarXiv:2605.30349v12026
  44. Geo-Align: Video Generation Alignment via Metric Geometry Reward

    Zizun Li, Haoyu Guo, Runzhe Teng +2

    cs.CVarXiv:2605.23903v12026
  45. Registers Matter for Pixel-Space Diffusion Transformers

    Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy +2

    cs.CVarXiv:2605.16147v22026
  46. DrawMotion: Generating 3D Human Motions by Freehand Drawing

    Tao Wang, Lei Jin, Zhihua Wu +7

    cs.CVarXiv:2605.20955v12026
  47. UniT: Unified Geometry Learning with Group Autoregressive Transformer

    Haotian Wang, Yusong Huang, Zhaonian Kuang +4

    cs.CVarXiv:2605.21131v12026
  48. SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

    Komal Kumar, Ankan Deria, Abhishek Basu +3

    cs.CVarXiv:2605.18719v12026
  49. Generative Modeling via Drifting

    Mingyang Deng, He Li, Tianhong Li +2

    cs.LGcs.CVarXiv:2602.04770v22026
  50. Aligning Latent Geometry for Spherical Flow Matching in Image Generation

    Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe +2

    cs.CVarXiv:2605.15193v12026
  51. ReactiveGWM: Steering NPC in Reactive Game World Models

    Zeqing Wang, Danze Chen, Zhaohu Xing +4

    cs.CVarXiv:2605.15256v12026
  52. Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

    Ming Qian, Zimin Xia, Changkun Liu +6

    cs.CVcs.AIarXiv:2605.14984v12026
  53. Roto-Translation Covariant Convolutional Networks for Medical Image Analysis

    Erik J Bekkers, Maxime W Lafarge, Mitko Veta +3

    cs.CVcs.LGmath.GRarXiv:1804.03393v32018
  54. End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

    Wenda Chu, Bingliang Zhang, Jiaqi Han +4

    cs.CVcs.LGarXiv:2605.00503v22026
  55. Linear-Time Global Visual Modeling without Explicit Attention

    Ruize He, Dongchen Han, Gao Huang

    cs.CVarXiv:2605.01711v22026
  56. ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

    Fanqing Meng, Lingxiao Du, Zijian Wu +46

    cs.CVcs.SEarXiv:2604.23781v22026
  57. On the Global Photometric Alignment for Low-Level Vision

    Mingjia Li, Tianle Du, Hainuo Wang +2

    cs.CVarXiv:2604.08172v12026
  58. DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

    Tianjiao Yu, Xinzhuo Li, Muntasir Wahed +4

    cs.CVcs.AIcs.LGarXiv:2603.19216v22026
  59. Video-CoE: Reinforcing Video Event Prediction via Chain of Events

    Qile Su, Jing Tang, Rui Chen +2

    cs.CVarXiv:2603.14935v12026
  60. AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

    Changwoo Baek, Jouwon Song, Sohyeon Kim +1

    cs.CVcs.LGarXiv:2603.01236v12026