Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,381 to 16,440 of 18,866

  1. Multimodal OCR: Parse Anything from Documents

    Handong Zheng, Yumeng Li, Kaile Zhang +22

    cs.CVarXiv:2603.13032v22026
  2. Code2World: A GUI World Model via Renderable Code Generation

    Yuhao Zheng, Li'an Zhong, Yi Wang +6

    cs.CVcs.AIcs.CLarXiv:2602.09856v12026
  3. LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models

    Zicheng Duan, Jiatong Xia, Zeyu Zhang +7

    cs.CVarXiv:2603.07145v22026
  4. Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis

    Hongyuan Chen, Xingyu Chen, Youjia Zhang +2

    cs.CVarXiv:2601.14253v12026
  5. Auto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image Segmentation

    Chenxi Liu, Liang-Chieh Chen, Florian Schroff +4

    cs.CVcs.LGarXiv:1901.02985v22019
  6. Robust Validation to Geometric Perturbations for Autonomous Pose Estimation

    Gregoire Theau, Melanie Ducoffe

    cs.CVarXiv:2608.21066v12026
  7. Social-STGCNN: A Social Spatio-Temporal Graph Convolutional Neural Network for Human Trajectory Prediction

    Abduallah Mohamed, Kun Qian, Mohamed Elhoseiny +1

    cs.CVarXiv:2002.11927v32020
  8. LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR

    Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin

    cs.CVarXiv:2601.14251v22026
  9. Generating Adversarial Examples with Adversarial Networks

    Chaowei Xiao, Bo Li, Jun-Yan Zhu +3

    cs.CRcs.CVstat.MLarXiv:1801.02610v52018
  10. An Intriguing Failing of Convolutional Neural Networks and the CoordConv Solution

    Rosanne Liu, Joel Lehman, Piero Molino +4

    cs.CVcs.LGstat.MLarXiv:1807.03247v22018
  11. Feature Generating Networks for Zero-Shot Learning

    Yongqin Xian, Tobias Lorenz, Bernt Schiele +1

    cs.CVarXiv:1712.00981v22017
  12. Deep Learning vs. Traditional Computer Vision

    Niall O' Mahony, Sean Campbell, Anderson Carvalho +5

    cs.CVcs.LGarXiv:1910.13796v12019
  13. Feature Pyramid and Hierarchical Boosting Network for Pavement Crack Detection

    Fan Yang, Lei Zhang, Sijia Yu +3

    cs.CVarXiv:1901.06340v22019
  14. Utonia: Toward One Encoder for All Point Clouds

    Yujia Zhang, Xiaoyang Wu, Yunhan Yang +6

    cs.CVarXiv:2603.03283v22026
  15. Domain Generalization with MixStyle

    Kaiyang Zhou, Yongxin Yang, Yu Qiao +1

    cs.CVcs.LGarXiv:2104.02008v12021
  16. LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference

    Ben Graham, Alaaeldin El-Nouby, Hugo Touvron +4

    cs.CVarXiv:2104.01136v22021
  17. VarifocalNet: An IoU-aware Dense Object Detector

    Haoyang Zhang, Ying Wang, Feras Dayoub +1

    cs.CVarXiv:2008.13367v22020
  18. DropBlock: A regularization method for convolutional networks

    Golnaz Ghiasi, Tsung-Yi Lin, Quoc V. Le

    cs.CVarXiv:1810.12890v12018
  19. Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

    Amandeep Kumar, Vishal M. Patel

    cs.LGcs.CVarXiv:2602.10099v22026
  20. Density-aware Single Image De-raining using a Multi-stream Dense Network

    He Zhang, Vishal M. Patel

    cs.CVarXiv:1802.07412v12018
  21. BEVDepth: Acquisition of Reliable Depth for Multi-view 3D Object Detection

    Yinhao Li, Zheng Ge, Guanyi Yu +5

    cs.CVarXiv:2206.10092v22022
  22. Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

    Daxiang Dong, Mingming Zheng, Dong Xu +17

    cs.CVarXiv:2603.13398v12026
  23. Discriminative Unsupervised Feature Learning with Exemplar Convolutional Neural Networks

    Alexey Dosovitskiy, Philipp Fischer, Jost Tobias Springenberg +2

    cs.LGcs.CVcs.NEarXiv:1406.6909v22014
  24. ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

    António Loison, Quentin Macé, Antoine Edy +7

    cs.AIcs.CVarXiv:2601.08620v22026
  25. Conditional DETR for Fast Training Convergence

    Depu Meng, Xiaokang Chen, Zejia Fan +5

    cs.CVarXiv:2108.06152v32021
  26. A Diagram Is Worth A Dozen Images

    Aniruddha Kembhavi, Mike Salvato, Eric Kolve +3

    cs.CVcs.AIarXiv:1603.07396v12016
  27. LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries

    Shijie Lian, Bin Yu, Xiaopeng Lin +6

    cs.AIcs.CLcs.CVarXiv:2601.15197v72026
  28. Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation

    Jun He, Junyan Ye, Zilong Huang +6

    cs.CVarXiv:2602.01756v12026
  29. Unified Latents (UL): How to train your latents

    Jonathan Heek, Emiel Hoogeboom, Thomas Mensink +1

    cs.LGcs.CVarXiv:2602.17270v12026
  30. VisTa3D: A Dataset and Benchmark for Thin Object Reconstruction from Vision, Tactile, and 3D Point Clouds

    Shania Guo, Yeongsik Seo, Andrew Fu +7

    cs.CVarXiv:2608.20740v12026
  31. Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

    Chi-Pin Huang, Yunze Man, Zhiding Yu +4

    cs.CVcs.AIcs.LGarXiv:2601.09708v22026
  32. WorldCompass: Reinforcement Learning for Long-Horizon World Models

    Zehan Wang, Tengfei Wang, Haiyu Zhang +9

    cs.CVarXiv:2602.09022v12026
  33. COVID-19 Image Data Collection

    Joseph Paul Cohen, Paul Morrison, Lan Dao

    eess.IVcs.CVcs.LGarXiv:2003.11597v12020
  34. FastVMT: Eliminating Redundancy in Video Motion Transfer

    Yue Ma, Zhikai Wang, Tianhao Ren +9

    cs.CVarXiv:2602.05551v32026
  35. An End-to-End Spatio-Temporal Attention Model for Human Action Recognition from Skeleton Data

    Sijie Song, Cuiling Lan, Junliang Xing +2

    cs.CVarXiv:1611.06067v12016
  36. Learning a Single Convolutional Super-Resolution Network for Multiple Degradations

    Kai Zhang, Wangmeng Zuo, Lei Zhang

    cs.CVarXiv:1712.06116v22017
  37. Medical SAM3: A Foundation Model for Universal Prompt-Driven Medical Image Segmentation

    Chongcong Jiang, Tianxingjian Ding, Chuhan Song +7

    cs.CVcs.AIarXiv:2601.10880v12026
  38. OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

    Bowen Yang, Kaiming Jin, Zhenyu Wu +12

    cs.MAcs.AIcs.CLarXiv:2601.07779v12026
  39. VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

    Wenlong Huang, Chen Wang, Ruohan Zhang +3

    cs.ROcs.AIcs.CLarXiv:2307.05973v22023
  40. Learning from Synthetic Humans

    Gül Varol, Javier Romero, Xavier Martin +4

    cs.CVarXiv:1701.01370v32017
  41. nnU-Net: Self-adapting Framework for U-Net-Based Medical Image Segmentation

    Fabian Isensee, Jens Petersen, Andre Klein +8

    cs.CVarXiv:1809.10486v12018
  42. Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale

    Yicheng Zou, Dongsheng Zhu, Lin Zhu +174

    cs.LGcs.CLcs.CVarXiv:2603.25040v22026
  43. AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

    Zhaochen Su, Jincheng Gao, Hangyu Guo +10

    cs.CVarXiv:2602.23166v22026
  44. MVDream: Multi-view Diffusion for 3D Generation

    Yichun Shi, Peng Wang, Jianglong Ye +3

    cs.CVarXiv:2308.16512v42023
  45. Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

    Haonan Jiang, Yuji Wang, Yongjie Zhu +5

    cs.CVarXiv:2602.13823v32026
  46. Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs

    Haiming Li, Yingsheng Liu, Jingmin Zhu +5

    cs.CVarXiv:2608.20999v12026
  47. On human motion prediction using recurrent neural networks

    Julieta Martinez, Michael J. Black, Javier Romero

    cs.CVarXiv:1705.02445v12017
  48. Grounding Image Matching in 3D with MASt3R

    Vincent Leroy, Yohann Cabon, Jérôme Revaud

    cs.CVarXiv:2406.09756v12024
  49. Unified Vision-Language Pre-Training for Image Captioning and VQA

    Luowei Zhou, Hamid Palangi, Lei Zhang +3

    cs.CVarXiv:1909.11059v32019
  50. Learning Representations for Automatic Colorization

    Gustav Larsson, Michael Maire, Gregory Shakhnarovich

    cs.CVarXiv:1603.06668v32016
  51. Top-down Neural Attention by Excitation Backprop

    Jianming Zhang, Zhe Lin, Jonathan Brandt +2

    cs.CVarXiv:1608.00507v12016
  52. M2Depth: Unifying Monocular Depth Foundation Priors with Multi-View Stereo

    Byeonggwon Lee, Sanggi Lee, Siwoo Lee +2

    cs.CVarXiv:2608.20788v12026
  53. Tracking without bells and whistles

    Philipp Bergmann, Tim Meinhardt, Laura Leal-Taixe

    cs.CVarXiv:1903.05625v32019
  54. EmotionDialogCN: A Spontaneous Multimodal Dataset for Mandarin Emotional Dialogue

    Yi Zheng, Yifan Xu, Yan Zhou +8

    cs.CVarXiv:2608.20905v12026
  55. Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

    Qi Song, Ziyuan Luo, Haoliang Han +1

    cs.CVarXiv:2608.20748v12026
  56. Gradient based sample selection for online continual learning

    Rahaf Aljundi, Min Lin, Baptiste Goujaud +1

    cs.LGcs.AIcs.CVarXiv:1903.08671v52019
  57. DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

    Xu Guo, Fulong Ye, Qichao Sun +7

    cs.CVarXiv:2602.12160v12026
  58. Revisiting Point Cloud Classification: A New Benchmark Dataset and Classification Model on Real-World Data

    Mikaela Angelina Uy, Quang-Hieu Pham, Binh-Son Hua +2

    cs.CVarXiv:1908.04616v22019
  59. DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

    Dianyi Wang, Ruihang Li, Feng Han +17

    cs.CVcs.AIarXiv:2602.12205v22026
  60. Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

    Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller +2

    eess.IVcs.CVarXiv:2608.21180v12026