Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,381 to 16,440 of 18,866
Multimodal OCR: Parse Anything from Documents
Handong Zheng, Yumeng Li, Kaile Zhang +22
cs.CVarXiv:2603.13032v22026Code2World: A GUI World Model via Renderable Code Generation
Yuhao Zheng, Li'an Zhong, Yi Wang +6
cs.CVcs.AIcs.CLarXiv:2602.09856v12026LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models
Zicheng Duan, Jiatong Xia, Zeyu Zhang +7
cs.CVarXiv:2603.07145v22026Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis
Hongyuan Chen, Xingyu Chen, Youjia Zhang +2
cs.CVarXiv:2601.14253v12026Auto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image Segmentation
Chenxi Liu, Liang-Chieh Chen, Florian Schroff +4
cs.CVcs.LGarXiv:1901.02985v22019Robust Validation to Geometric Perturbations for Autonomous Pose Estimation
Gregoire Theau, Melanie Ducoffe
cs.CVarXiv:2608.21066v12026Social-STGCNN: A Social Spatio-Temporal Graph Convolutional Neural Network for Human Trajectory Prediction
Abduallah Mohamed, Kun Qian, Mohamed Elhoseiny +1
cs.CVarXiv:2002.11927v32020LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin
cs.CVarXiv:2601.14251v22026Generating Adversarial Examples with Adversarial Networks
Chaowei Xiao, Bo Li, Jun-Yan Zhu +3
cs.CRcs.CVstat.MLarXiv:1801.02610v52018An Intriguing Failing of Convolutional Neural Networks and the CoordConv Solution
Rosanne Liu, Joel Lehman, Piero Molino +4
cs.CVcs.LGstat.MLarXiv:1807.03247v22018Feature Generating Networks for Zero-Shot Learning
Yongqin Xian, Tobias Lorenz, Bernt Schiele +1
cs.CVarXiv:1712.00981v22017Deep Learning vs. Traditional Computer Vision
Niall O' Mahony, Sean Campbell, Anderson Carvalho +5
cs.CVcs.LGarXiv:1910.13796v12019Feature Pyramid and Hierarchical Boosting Network for Pavement Crack Detection
Fan Yang, Lei Zhang, Sijia Yu +3
cs.CVarXiv:1901.06340v22019Utonia: Toward One Encoder for All Point Clouds
Yujia Zhang, Xiaoyang Wu, Yunhan Yang +6
cs.CVarXiv:2603.03283v22026Domain Generalization with MixStyle
Kaiyang Zhou, Yongxin Yang, Yu Qiao +1
cs.CVcs.LGarXiv:2104.02008v12021LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference
Ben Graham, Alaaeldin El-Nouby, Hugo Touvron +4
cs.CVarXiv:2104.01136v22021VarifocalNet: An IoU-aware Dense Object Detector
Haoyang Zhang, Ying Wang, Feras Dayoub +1
cs.CVarXiv:2008.13367v22020DropBlock: A regularization method for convolutional networks
Golnaz Ghiasi, Tsung-Yi Lin, Quoc V. Le
cs.CVarXiv:1810.12890v12018Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders
Amandeep Kumar, Vishal M. Patel
cs.LGcs.CVarXiv:2602.10099v22026Density-aware Single Image De-raining using a Multi-stream Dense Network
He Zhang, Vishal M. Patel
cs.CVarXiv:1802.07412v12018BEVDepth: Acquisition of Reliable Depth for Multi-view 3D Object Detection
Yinhao Li, Zheng Ge, Guanyi Yu +5
cs.CVarXiv:2206.10092v22022Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
Daxiang Dong, Mingming Zheng, Dong Xu +17
cs.CVarXiv:2603.13398v12026Discriminative Unsupervised Feature Learning with Exemplar Convolutional Neural Networks
Alexey Dosovitskiy, Philipp Fischer, Jost Tobias Springenberg +2
cs.LGcs.CVcs.NEarXiv:1406.6909v22014ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios
António Loison, Quentin Macé, Antoine Edy +7
cs.AIcs.CVarXiv:2601.08620v22026Conditional DETR for Fast Training Convergence
Depu Meng, Xiaokang Chen, Zejia Fan +5
cs.CVarXiv:2108.06152v32021A Diagram Is Worth A Dozen Images
Aniruddha Kembhavi, Mike Salvato, Eric Kolve +3
cs.CVcs.AIarXiv:1603.07396v12016LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries
Shijie Lian, Bin Yu, Xiaopeng Lin +6
cs.AIcs.CLcs.CVarXiv:2601.15197v72026Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
Jun He, Junyan Ye, Zilong Huang +6
cs.CVarXiv:2602.01756v12026Unified Latents (UL): How to train your latents
Jonathan Heek, Emiel Hoogeboom, Thomas Mensink +1
cs.LGcs.CVarXiv:2602.17270v12026VisTa3D: A Dataset and Benchmark for Thin Object Reconstruction from Vision, Tactile, and 3D Point Clouds
Shania Guo, Yeongsik Seo, Andrew Fu +7
cs.CVarXiv:2608.20740v12026Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
Chi-Pin Huang, Yunze Man, Zhiding Yu +4
cs.CVcs.AIcs.LGarXiv:2601.09708v22026WorldCompass: Reinforcement Learning for Long-Horizon World Models
Zehan Wang, Tengfei Wang, Haiyu Zhang +9
cs.CVarXiv:2602.09022v12026COVID-19 Image Data Collection
Joseph Paul Cohen, Paul Morrison, Lan Dao
eess.IVcs.CVcs.LGarXiv:2003.11597v12020FastVMT: Eliminating Redundancy in Video Motion Transfer
Yue Ma, Zhikai Wang, Tianhao Ren +9
cs.CVarXiv:2602.05551v32026An End-to-End Spatio-Temporal Attention Model for Human Action Recognition from Skeleton Data
Sijie Song, Cuiling Lan, Junliang Xing +2
cs.CVarXiv:1611.06067v12016Learning a Single Convolutional Super-Resolution Network for Multiple Degradations
Kai Zhang, Wangmeng Zuo, Lei Zhang
cs.CVarXiv:1712.06116v22017Medical SAM3: A Foundation Model for Universal Prompt-Driven Medical Image Segmentation
Chongcong Jiang, Tianxingjian Ding, Chuhan Song +7
cs.CVcs.AIarXiv:2601.10880v12026OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent
Bowen Yang, Kaiming Jin, Zhenyu Wu +12
cs.MAcs.AIcs.CLarXiv:2601.07779v12026VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models
Wenlong Huang, Chen Wang, Ruohan Zhang +3
cs.ROcs.AIcs.CLarXiv:2307.05973v22023Learning from Synthetic Humans
Gül Varol, Javier Romero, Xavier Martin +4
cs.CVarXiv:1701.01370v32017nnU-Net: Self-adapting Framework for U-Net-Based Medical Image Segmentation
Fabian Isensee, Jens Petersen, Andre Klein +8
cs.CVarXiv:1809.10486v12018Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale
Yicheng Zou, Dongsheng Zhu, Lin Zhu +174
cs.LGcs.CLcs.CVarXiv:2603.25040v22026AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
Zhaochen Su, Jincheng Gao, Hangyu Guo +10
cs.CVarXiv:2602.23166v22026MVDream: Multi-view Diffusion for 3D Generation
Yichun Shi, Peng Wang, Jianglong Ye +3
cs.CVarXiv:2308.16512v42023Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
Haonan Jiang, Yuji Wang, Yongjie Zhu +5
cs.CVarXiv:2602.13823v32026Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs
Haiming Li, Yingsheng Liu, Jingmin Zhu +5
cs.CVarXiv:2608.20999v12026On human motion prediction using recurrent neural networks
Julieta Martinez, Michael J. Black, Javier Romero
cs.CVarXiv:1705.02445v12017Grounding Image Matching in 3D with MASt3R
Vincent Leroy, Yohann Cabon, Jérôme Revaud
cs.CVarXiv:2406.09756v12024Unified Vision-Language Pre-Training for Image Captioning and VQA
Luowei Zhou, Hamid Palangi, Lei Zhang +3
cs.CVarXiv:1909.11059v32019Learning Representations for Automatic Colorization
Gustav Larsson, Michael Maire, Gregory Shakhnarovich
cs.CVarXiv:1603.06668v32016Top-down Neural Attention by Excitation Backprop
Jianming Zhang, Zhe Lin, Jonathan Brandt +2
cs.CVarXiv:1608.00507v12016M2Depth: Unifying Monocular Depth Foundation Priors with Multi-View Stereo
Byeonggwon Lee, Sanggi Lee, Siwoo Lee +2
cs.CVarXiv:2608.20788v12026Tracking without bells and whistles
Philipp Bergmann, Tim Meinhardt, Laura Leal-Taixe
cs.CVarXiv:1903.05625v32019EmotionDialogCN: A Spontaneous Multimodal Dataset for Mandarin Emotional Dialogue
Yi Zheng, Yifan Xu, Yan Zhou +8
cs.CVarXiv:2608.20905v12026Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
Qi Song, Ziyuan Luo, Haoliang Han +1
cs.CVarXiv:2608.20748v12026Gradient based sample selection for online continual learning
Rahaf Aljundi, Min Lin, Baptiste Goujaud +1
cs.LGcs.AIcs.CVarXiv:1903.08671v52019DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
Xu Guo, Fulong Ye, Qichao Sun +7
cs.CVarXiv:2602.12160v12026Revisiting Point Cloud Classification: A New Benchmark Dataset and Classification Model on Real-World Data
Mikaela Angelina Uy, Quang-Hieu Pham, Binh-Son Hua +2
cs.CVarXiv:1908.04616v22019DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing
Dianyi Wang, Ruihang Li, Feng Han +17
cs.CVcs.AIarXiv:2602.12205v22026Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning
Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller +2
eess.IVcs.CVarXiv:2608.21180v12026