Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
17,221 to 17,280 of 18,799
Your Embedding Model is SMARTer Than You Think
Jianrui Zhang, Hyun Jung Lee, Sukanta Ganguly +3
cs.IRcs.AIcs.CVarXiv:2605.24938v12026OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge
Kenneth Marino, Mohammad Rastegari, Ali Farhadi +1
cs.CVcs.CLarXiv:1906.00067v22019The Open Images Dataset V4: Unified image classification, object detection, and visual relationship detection at scale
Alina Kuznetsova, Hassan Rom, Neil Alldrin +9
cs.CVarXiv:1811.00982v22018DeepGCNs: Can GCNs Go as Deep as CNNs?
Guohao Li, Matthias Müller, Ali Thabet +1
cs.CVcs.LGarXiv:1904.03751v22019Hypercolumns for Object Segmentation and Fine-grained Localization
Bharath Hariharan, Pablo Arbeláez, Ross Girshick +1
cs.CVarXiv:1411.5752v22014Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification
Yuting Yang, Haichao Jiang, Tianming Liang +2
cs.CVarXiv:2605.17531v22026Staple: Complementary Learners for Real-Time Tracking
Luca Bertinetto, Jack Valmadre, Stuart Golodetz +2
cs.CVarXiv:1512.01355v22015Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation
Aviral Chharia, Fernando De la Torre
cs.CVcs.GRcs.ROarXiv:2605.25220v12026Countering Adversarial Images using Input Transformations
Chuan Guo, Mayank Rana, Moustapha Cisse +1
cs.CVarXiv:1711.00117v32017Gradient Magnitude Similarity Deviation: A Highly Efficient Perceptual Image Quality Index
Wufeng Xue, Lei Zhang, Xuanqin Mou +1
cs.CVarXiv:1308.3052v22013Pixel-Level Pavement Distress Assessment Using Instance Segmentation
Logan Dewick, Bibesh Pyakurel, Kong Pheng Yang +2
cs.CVarXiv:2605.26095v22026AugMix: A Simple Data Processing Method to Improve Robustness and Uncertainty
Dan Hendrycks, Norman Mu, Ekin D. Cubuk +3
stat.MLcs.CVcs.LGarXiv:1912.02781v22019Domain Generalization: A Survey
Kaiyang Zhou, Ziwei Liu, Yu Qiao +2
cs.LGcs.AIcs.CVarXiv:2103.02503v72021On-Policy Adversarial Flow Distillation for Autoregressive Video Generation
Yang Luo, Shengju Qian, Xiaohang Tang +4
cs.CVarXiv:2605.26105v12026Channel-wise Vector Quantization
Wei Song, Tianhang Wang, Yitong Chen +5
cs.CVcs.AIarXiv:2605.26089v22026CSRNet: Dilated Convolutional Neural Networks for Understanding the Highly Congested Scenes
Yuhong Li, Xiaofan Zhang, Deming Chen
cs.CVarXiv:1802.10062v42018Unsupervised CNN for Single View Depth Estimation: Geometry to the Rescue
Ravi Garg, Vijay Kumar BG, Gustavo Carneiro +1
cs.CVarXiv:1603.04992v22016Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution
Zixin Jessie Chen, Zhuo Chen, Archer Wang +4
cs.CVcond-mat.stat-mechcs.AIarXiv:2605.26032v12026AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
Yuwei Guo, Ceyuan Yang, Anyi Rao +6
cs.CVcs.GRcs.LGarXiv:2307.04725v22023Rethinking VLM Representation for VLA Initialization
Weifeng Lin, Siyuan Huang, Hao Li +5
cs.CVarXiv:2605.25802v12026Enhanced-alignment Measure for Binary Foreground Map Evaluation
Deng-Ping Fan, Cheng Gong, Yang Cao +3
cs.CVarXiv:1805.10421v22018The One Hundred Layers Tiramisu: Fully Convolutional DenseNets for Semantic Segmentation
Simon Jégou, Michal Drozdzal, David Vazquez +2
cs.CVarXiv:1611.09326v32016MetaphorVU: Towards Metaphorical Video Understanding
Zhuoqun Li, Boxi Cao, Guiping Jiang +13
cs.CVarXiv:2605.25461v12026Helix4D: Complex 4D Mesh Generation
Jiraphon Yenphraphai, Jianqi Chen, Jian Wang +6
cs.CVarXiv:2605.26109v12026Volumetric and Multi-View CNNs for Object Classification on 3D Data
Charles R. Qi, Hao Su, Matthias Niessner +3
cs.CVcs.AIarXiv:1604.03265v22016Re-ranking Person Re-identification with k-reciprocal Encoding
Zhun Zhong, Liang Zheng, Donglin Cao +1
cs.CVarXiv:1701.08398v42017ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement
Yufeng Yang, Jianzhuang Liu, Jisheng Chu +4
cs.CVarXiv:2605.25569v22026Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction
Jin Hyeon Kim, Jaeeun Lee, Claire Kim +8
cs.CVarXiv:2605.26230v12026Argoverse: 3D Tracking and Forecasting with Rich Maps
Ming-Fang Chang, John Lambert, Patsorn Sangkloy +8
cs.CVcs.ROarXiv:1911.02620v12019How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?
Benjamin Herb, Steve Göring, Alexander Raake +1
eess.IVcs.CVarXiv:2605.25940v12026Rethinking the Value of Network Pruning
Zhuang Liu, Mingjie Sun, Tinghui Zhou +2
cs.LGcs.CVstat.MLarXiv:1810.05270v22018MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale
Zhicong Tang, Zhao Zhang, Jingye Chen +6
cs.CVarXiv:2605.27235v12026HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face
Yongliang Shen, Kaitao Song, Xu Tan +3
cs.CLcs.AIcs.CVarXiv:2303.17580v42023Contrastive Multiview Coding
Yonglong Tian, Dilip Krishnan, Phillip Isola
cs.CVcs.LGarXiv:1906.05849v52019Deep Convolutional Networks on Graph-Structured Data
Mikael Henaff, Joan Bruna, Yann LeCun
cs.LGcs.CVcs.NEarXiv:1506.05163v12015Cascaded Pyramid Network for Multi-Person Pose Estimation
Yilun Chen, Zhicheng Wang, Yuxiang Peng +3
cs.CVarXiv:1711.07319v22017Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models
Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell +1
cs.CLcs.CVarXiv:2605.27311v12026Joint Autoregressive and Hierarchical Priors for Learned Image Compression
David Minnen, Johannes Ballé, George Toderici
cs.CVarXiv:1809.02736v12018Cross-scale Aligned Supervision for Training GANs
Sangeek Hyun, MinKyu Lee, Jae-Pil Heo
cs.CVcs.AIarXiv:2605.26449v12026Cell Detection with Star-convex Polygons
Uwe Schmidt, Martin Weigert, Coleman Broaddus +1
cs.CVarXiv:1806.03535v22018Recursive Flow Matching
Jiahe Huang, Sihan Xu, Sharvaree Vadgama +1
cs.LGcs.AIcs.CVarXiv:2605.26535v12026SpatialBench: Is Your Spatial Foundation Model an All-Round Player?
Haosong Peng, Hao Li, Jiaqi Chen +10
cs.CVarXiv:2605.27367v22026Measuring the Effects of Non-Identical Data Distribution for Federated Visual Classification
Tzu-Ming Harry Hsu, Hang Qi, Matthew Brown
cs.LGcs.CVstat.MLarXiv:1909.06335v12019EAST: An Efficient and Accurate Scene Text Detector
Xinyu Zhou, Cong Yao, He Wen +4
cs.CVarXiv:1704.03155v22017BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation
Zhijian Liu, Haotian Tang, Alexander Amini +4
cs.CVarXiv:2205.13542v32022JLT: Clean-Latent Prediction in Latent Diffusion Transformers
Funing Fu, Tenghui Wang, Guanyu Zhou +2
cs.CVcs.LGarXiv:2605.27102v22026Contrastive Learning for Unpaired Image-to-Image Translation
Taesung Park, Alexei A. Efros, Richard Zhang +1
cs.CVcs.LGarXiv:2007.15651v32020CoAtNet: Marrying Convolution and Attention for All Data Sizes
Zihang Dai, Hanxiao Liu, Quoc V. Le +1
cs.CVcs.LGarXiv:2106.04803v22021How far are we from solving the 2D & 3D Face Alignment problem? (and a dataset of 230,000 3D facial landmarks)
Adrian Bulat, Georgios Tzimiropoulos
cs.CVcs.LGarXiv:1703.07332v32017MentorNet: Learning Data-Driven Curriculum for Very Deep Neural Networks on Corrupted Labels
Lu Jiang, Zhengyuan Zhou, Thomas Leung +2
cs.CVarXiv:1712.05055v22017Cascaded Diffusion Models for High Fidelity Image Generation
Jonathan Ho, Chitwan Saharia, William Chan +3
cs.CVcs.AIcs.LGarXiv:2106.15282v32021Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time
Mitchell Wortsman, Gabriel Ilharco, Samir Yitzhak Gadre +8
cs.LGcs.CLcs.CVarXiv:2203.05482v32022Deep Facial Expression Recognition: A Survey
Shan Li, Weihong Deng
cs.CVarXiv:1804.08348v22018BiSeNet V2: Bilateral Network with Guided Aggregation for Real-time Semantic Segmentation
Changqian Yu, Changxin Gao, Jingbo Wang +3
cs.CVarXiv:2004.02147v12020DeblurGAN: Blind Motion Deblurring Using Conditional Adversarial Networks
Orest Kupyn, Volodymyr Budzan, Mykola Mykhailych +2
cs.CVarXiv:1711.07064v42017Wild Patterns: Ten Years After the Rise of Adversarial Machine Learning
Battista Biggio, Fabio Roli
cs.CVcs.CRcs.GTarXiv:1712.03141v22017ImageBind: One Embedding Space To Bind Them All
Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu +4
cs.CVcs.AIcs.LGarXiv:2305.05665v22023IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models
Hu Ye, Jun Zhang, Sibo Liu +2
cs.CVcs.AIarXiv:2308.06721v12023MVSNet: Depth Inference for Unstructured Multi-view Stereo
Yao Yao, Zixin Luo, Shiwei Li +2
cs.CVarXiv:1804.02505v22018Multiscale Vision Transformers
Haoqi Fan, Bo Xiong, Karttikeya Mangalam +4
cs.CVcs.AIcs.LGarXiv:2104.11227v12021