Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

17,221 to 17,280 of 18,799

  1. Your Embedding Model is SMARTer Than You Think

    Jianrui Zhang, Hyun Jung Lee, Sukanta Ganguly +3

    cs.IRcs.AIcs.CVarXiv:2605.24938v12026
  2. OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge

    Kenneth Marino, Mohammad Rastegari, Ali Farhadi +1

    cs.CVcs.CLarXiv:1906.00067v22019
  3. The Open Images Dataset V4: Unified image classification, object detection, and visual relationship detection at scale

    Alina Kuznetsova, Hassan Rom, Neil Alldrin +9

    cs.CVarXiv:1811.00982v22018
  4. DeepGCNs: Can GCNs Go as Deep as CNNs?

    Guohao Li, Matthias Müller, Ali Thabet +1

    cs.CVcs.LGarXiv:1904.03751v22019
  5. Hypercolumns for Object Segmentation and Fine-grained Localization

    Bharath Hariharan, Pablo Arbeláez, Ross Girshick +1

    cs.CVarXiv:1411.5752v22014
  6. Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification

    Yuting Yang, Haichao Jiang, Tianming Liang +2

    cs.CVarXiv:2605.17531v22026
  7. Staple: Complementary Learners for Real-Time Tracking

    Luca Bertinetto, Jack Valmadre, Stuart Golodetz +2

    cs.CVarXiv:1512.01355v22015
  8. Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation

    Aviral Chharia, Fernando De la Torre

    cs.CVcs.GRcs.ROarXiv:2605.25220v12026
  9. Countering Adversarial Images using Input Transformations

    Chuan Guo, Mayank Rana, Moustapha Cisse +1

    cs.CVarXiv:1711.00117v32017
  10. Gradient Magnitude Similarity Deviation: A Highly Efficient Perceptual Image Quality Index

    Wufeng Xue, Lei Zhang, Xuanqin Mou +1

    cs.CVarXiv:1308.3052v22013
  11. Pixel-Level Pavement Distress Assessment Using Instance Segmentation

    Logan Dewick, Bibesh Pyakurel, Kong Pheng Yang +2

    cs.CVarXiv:2605.26095v22026
  12. AugMix: A Simple Data Processing Method to Improve Robustness and Uncertainty

    Dan Hendrycks, Norman Mu, Ekin D. Cubuk +3

    stat.MLcs.CVcs.LGarXiv:1912.02781v22019
  13. Domain Generalization: A Survey

    Kaiyang Zhou, Ziwei Liu, Yu Qiao +2

    cs.LGcs.AIcs.CVarXiv:2103.02503v72021
  14. On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

    Yang Luo, Shengju Qian, Xiaohang Tang +4

    cs.CVarXiv:2605.26105v12026
  15. Channel-wise Vector Quantization

    Wei Song, Tianhang Wang, Yitong Chen +5

    cs.CVcs.AIarXiv:2605.26089v22026
  16. CSRNet: Dilated Convolutional Neural Networks for Understanding the Highly Congested Scenes

    Yuhong Li, Xiaofan Zhang, Deming Chen

    cs.CVarXiv:1802.10062v42018
  17. Unsupervised CNN for Single View Depth Estimation: Geometry to the Rescue

    Ravi Garg, Vijay Kumar BG, Gustavo Carneiro +1

    cs.CVarXiv:1603.04992v22016
  18. Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution

    Zixin Jessie Chen, Zhuo Chen, Archer Wang +4

    cs.CVcond-mat.stat-mechcs.AIarXiv:2605.26032v12026
  19. AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning

    Yuwei Guo, Ceyuan Yang, Anyi Rao +6

    cs.CVcs.GRcs.LGarXiv:2307.04725v22023
  20. Rethinking VLM Representation for VLA Initialization

    Weifeng Lin, Siyuan Huang, Hao Li +5

    cs.CVarXiv:2605.25802v12026
  21. Enhanced-alignment Measure for Binary Foreground Map Evaluation

    Deng-Ping Fan, Cheng Gong, Yang Cao +3

    cs.CVarXiv:1805.10421v22018
  22. The One Hundred Layers Tiramisu: Fully Convolutional DenseNets for Semantic Segmentation

    Simon Jégou, Michal Drozdzal, David Vazquez +2

    cs.CVarXiv:1611.09326v32016
  23. MetaphorVU: Towards Metaphorical Video Understanding

    Zhuoqun Li, Boxi Cao, Guiping Jiang +13

    cs.CVarXiv:2605.25461v12026
  24. Helix4D: Complex 4D Mesh Generation

    Jiraphon Yenphraphai, Jianqi Chen, Jian Wang +6

    cs.CVarXiv:2605.26109v12026
  25. Volumetric and Multi-View CNNs for Object Classification on 3D Data

    Charles R. Qi, Hao Su, Matthias Niessner +3

    cs.CVcs.AIarXiv:1604.03265v22016
  26. Re-ranking Person Re-identification with k-reciprocal Encoding

    Zhun Zhong, Liang Zheng, Donglin Cao +1

    cs.CVarXiv:1701.08398v42017
  27. ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement

    Yufeng Yang, Jianzhuang Liu, Jisheng Chu +4

    cs.CVarXiv:2605.25569v22026
  28. Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction

    Jin Hyeon Kim, Jaeeun Lee, Claire Kim +8

    cs.CVarXiv:2605.26230v12026
  29. Argoverse: 3D Tracking and Forecasting with Rich Maps

    Ming-Fang Chang, John Lambert, Patsorn Sangkloy +8

    cs.CVcs.ROarXiv:1911.02620v12019
  30. How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?

    Benjamin Herb, Steve Göring, Alexander Raake +1

    eess.IVcs.CVarXiv:2605.25940v12026
  31. Rethinking the Value of Network Pruning

    Zhuang Liu, Mingjie Sun, Tinghui Zhou +2

    cs.LGcs.CVstat.MLarXiv:1810.05270v22018
  32. MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

    Zhicong Tang, Zhao Zhang, Jingye Chen +6

    cs.CVarXiv:2605.27235v12026
  33. HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face

    Yongliang Shen, Kaitao Song, Xu Tan +3

    cs.CLcs.AIcs.CVarXiv:2303.17580v42023
  34. Contrastive Multiview Coding

    Yonglong Tian, Dilip Krishnan, Phillip Isola

    cs.CVcs.LGarXiv:1906.05849v52019
  35. Deep Convolutional Networks on Graph-Structured Data

    Mikael Henaff, Joan Bruna, Yann LeCun

    cs.LGcs.CVcs.NEarXiv:1506.05163v12015
  36. Cascaded Pyramid Network for Multi-Person Pose Estimation

    Yilun Chen, Zhicheng Wang, Yuxiang Peng +3

    cs.CVarXiv:1711.07319v22017
  37. Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

    Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell +1

    cs.CLcs.CVarXiv:2605.27311v12026
  38. Joint Autoregressive and Hierarchical Priors for Learned Image Compression

    David Minnen, Johannes Ballé, George Toderici

    cs.CVarXiv:1809.02736v12018
  39. Cross-scale Aligned Supervision for Training GANs

    Sangeek Hyun, MinKyu Lee, Jae-Pil Heo

    cs.CVcs.AIarXiv:2605.26449v12026
  40. Cell Detection with Star-convex Polygons

    Uwe Schmidt, Martin Weigert, Coleman Broaddus +1

    cs.CVarXiv:1806.03535v22018
  41. Recursive Flow Matching

    Jiahe Huang, Sihan Xu, Sharvaree Vadgama +1

    cs.LGcs.AIcs.CVarXiv:2605.26535v12026
  42. SpatialBench: Is Your Spatial Foundation Model an All-Round Player?

    Haosong Peng, Hao Li, Jiaqi Chen +10

    cs.CVarXiv:2605.27367v22026
  43. Measuring the Effects of Non-Identical Data Distribution for Federated Visual Classification

    Tzu-Ming Harry Hsu, Hang Qi, Matthew Brown

    cs.LGcs.CVstat.MLarXiv:1909.06335v12019
  44. EAST: An Efficient and Accurate Scene Text Detector

    Xinyu Zhou, Cong Yao, He Wen +4

    cs.CVarXiv:1704.03155v22017
  45. BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation

    Zhijian Liu, Haotian Tang, Alexander Amini +4

    cs.CVarXiv:2205.13542v32022
  46. JLT: Clean-Latent Prediction in Latent Diffusion Transformers

    Funing Fu, Tenghui Wang, Guanyu Zhou +2

    cs.CVcs.LGarXiv:2605.27102v22026
  47. Contrastive Learning for Unpaired Image-to-Image Translation

    Taesung Park, Alexei A. Efros, Richard Zhang +1

    cs.CVcs.LGarXiv:2007.15651v32020
  48. CoAtNet: Marrying Convolution and Attention for All Data Sizes

    Zihang Dai, Hanxiao Liu, Quoc V. Le +1

    cs.CVcs.LGarXiv:2106.04803v22021
  49. How far are we from solving the 2D & 3D Face Alignment problem? (and a dataset of 230,000 3D facial landmarks)

    Adrian Bulat, Georgios Tzimiropoulos

    cs.CVcs.LGarXiv:1703.07332v32017
  50. MentorNet: Learning Data-Driven Curriculum for Very Deep Neural Networks on Corrupted Labels

    Lu Jiang, Zhengyuan Zhou, Thomas Leung +2

    cs.CVarXiv:1712.05055v22017
  51. Cascaded Diffusion Models for High Fidelity Image Generation

    Jonathan Ho, Chitwan Saharia, William Chan +3

    cs.CVcs.AIcs.LGarXiv:2106.15282v32021
  52. Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time

    Mitchell Wortsman, Gabriel Ilharco, Samir Yitzhak Gadre +8

    cs.LGcs.CLcs.CVarXiv:2203.05482v32022
  53. Deep Facial Expression Recognition: A Survey

    Shan Li, Weihong Deng

    cs.CVarXiv:1804.08348v22018
  54. BiSeNet V2: Bilateral Network with Guided Aggregation for Real-time Semantic Segmentation

    Changqian Yu, Changxin Gao, Jingbo Wang +3

    cs.CVarXiv:2004.02147v12020
  55. DeblurGAN: Blind Motion Deblurring Using Conditional Adversarial Networks

    Orest Kupyn, Volodymyr Budzan, Mykola Mykhailych +2

    cs.CVarXiv:1711.07064v42017
  56. Wild Patterns: Ten Years After the Rise of Adversarial Machine Learning

    Battista Biggio, Fabio Roli

    cs.CVcs.CRcs.GTarXiv:1712.03141v22017
  57. ImageBind: One Embedding Space To Bind Them All

    Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu +4

    cs.CVcs.AIcs.LGarXiv:2305.05665v22023
  58. IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models

    Hu Ye, Jun Zhang, Sibo Liu +2

    cs.CVcs.AIarXiv:2308.06721v12023
  59. MVSNet: Depth Inference for Unstructured Multi-view Stereo

    Yao Yao, Zixin Luo, Shiwei Li +2

    cs.CVarXiv:1804.02505v22018
  60. Multiscale Vision Transformers

    Haoqi Fan, Bo Xiong, Karttikeya Mangalam +4

    cs.CVcs.AIcs.LGarXiv:2104.11227v12021