Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

17,941 to 18,000 of 18,820

  1. Instance Normalization: The Missing Ingredient for Fast Stylization

    Dmitry Ulyanov, Andrea Vedaldi, Victor Lempitsky

    cs.CVarXiv:1607.08022v32016
  2. CSPNet: A New Backbone that can Enhance Learning Capability of CNN

    Chien-Yao Wang, Hong-Yuan Mark Liao, I-Hau Yeh +3

    cs.CVarXiv:1911.11929v12019
  3. Bernstein-Vazirani Networks: Quantum Machine Learning by Interference

    Natacha Kuete Meli, Tolga Birdal, Prayag Tiwari +2

    quant-phcs.AIcs.CVarXiv:2608.19043v12026
  4. Masked-attention Mask Transformer for Universal Image Segmentation

    Bowen Cheng, Ishan Misra, Alexander G. Schwing +2

    cs.CVcs.AIcs.LGarXiv:2112.01527v32021
  5. FiLM: Visual Reasoning with a General Conditioning Layer

    Ethan Perez, Florian Strub, Harm de Vries +2

    cs.CVcs.AIcs.CLarXiv:1709.07871v22017
  6. GhostNet: More Features from Cheap Operations

    Kai Han, Yunhe Wang, Qi Tian +3

    cs.CVarXiv:1911.11907v22019
  7. YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information

    Chien-Yao Wang, I-Hau Yeh, Hong-Yuan Mark Liao

    cs.CVarXiv:2402.13616v22024
  8. Temporal Segment Networks: Towards Good Practices for Deep Action Recognition

    Limin Wang, Yuanjun Xiong, Zhe Wang +4

    cs.CVarXiv:1608.00859v12016
  9. Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics

    Alex Kendall, Yarin Gal, Roberto Cipolla

    cs.CVarXiv:1705.07115v32017
  10. Improved Regularization of Convolutional Neural Networks with Cutout

    Terrance DeVries, Graham W. Taylor

    cs.CVarXiv:1708.04552v22017
  11. Scalability in Perception for Autonomous Driving: Waymo Open Dataset

    Pei Sun, Henrik Kretzschmar, Xerxes Dotiwalla +22

    cs.CVcs.LGstat.MLarXiv:1912.04838v72019
  12. Learning to Prompt for Vision-Language Models

    Kaiyang Zhou, Jingkang Yang, Chen Change Loy +1

    cs.CVcs.AIcs.LGarXiv:2109.01134v62021
  13. SlowFast Networks for Video Recognition

    Christoph Feichtenhofer, Haoqi Fan, Jitendra Malik +1

    cs.CVarXiv:1812.03982v32018
  14. Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift

    Longtian Wang, Zhengyu Zhao, Chenhao Lin +5

    cs.CVcs.AIarXiv:2608.19088v12026
  15. RandAugment: Practical automated data augmentation with a reduced search space

    Ekin D. Cubuk, Barret Zoph, Jonathon Shlens +1

    cs.CVarXiv:1909.13719v22019
  16. Learning Deconvolution Network for Semantic Segmentation

    Hyeonwoo Noh, Seunghoon Hong, Bohyung Han

    cs.CVarXiv:1505.04366v12015
  17. GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting

    Yechan Park, HyunJin Kim

    cs.CVcs.AIarXiv:2608.19066v12026
  18. Counterfactual Contrastive Analysis

    Yunlong He, Pietro Gori

    cs.CVcs.AIarXiv:2608.19032v12026
  19. One-Stage Object Detectors in Autonomous Driving

    Jonel Roman, Ryan Sirjue, Peter Nguyen +3

    cs.CVcs.AIarXiv:2608.19014v12026
  20. GrabVG: Graph-Attentive Binding for Visual Grounding in UAV Imagery

    Chaowei Wang, Yan Di, Jingjun Sun +5

    cs.CVcs.AIarXiv:2608.18996v12026
  21. Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering

    Yash Goyal, Tejas Khot, Douglas Summers-Stay +2

    cs.CVcs.AIcs.CLarXiv:1612.00837v32016
  22. High-Resolution Image Synthesis and Semantic Manipulation with Conditional GANs

    Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu +3

    cs.CVcs.GRcs.LGarXiv:1711.11585v22017
  23. Taming Transformers for High-Resolution Image Synthesis

    Patrick Esser, Robin Rombach, Björn Ommer

    cs.CVarXiv:2012.09841v32020
  24. Markerless tracking of user-defined features with deep learning

    Alexander Mathis, Pranav Mamidanna, Taiga Abe +4

    cs.CVq-bio.NCq-bio.QMarXiv:1804.03142v12018
  25. A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation

    Steven Landgraf, Joceline Hinz, Markus Ulrich

    cs.CVcs.AIcs.LGarXiv:2608.18709v12026
  26. DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation

    Nataniel Ruiz, Yuanzhen Li, Varun Jampani +3

    cs.CVcs.GRcs.LGarXiv:2208.12242v22022
  27. Group Normalization

    Yuxin Wu, Kaiming He

    cs.CVcs.LGarXiv:1803.08494v32018
  28. Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets

    Ting Xiang, Chenxi Deng, Jinhui Zhao +4

    cs.CVcs.AIarXiv:2608.18907v12026
  29. A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks

    Dan Hendrycks, Kevin Gimpel

    cs.NEcs.CVcs.LGarXiv:1610.02136v32016
  30. The Mythos of Model Interpretability

    Zachary C. Lipton

    cs.LGcs.AIcs.CVarXiv:1606.03490v32016
  31. ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks

    Jiasen Lu, Dhruv Batra, Devi Parikh +1

    cs.CVcs.CLarXiv:1908.02265v12019
  32. Benchmarking Neural Network Robustness to Common Corruptions and Perturbations

    Dan Hendrycks, Thomas Dietterich

    cs.LGcs.CVstat.MLarXiv:1903.12261v12019
  33. VoxelNet: End-to-End Learning for Point Cloud Based 3D Object Detection

    Yin Zhou, Oncel Tuzel

    cs.CVarXiv:1711.06396v12017
  34. FlowNet: Learning Optical Flow with Convolutional Networks

    Philipp Fischer, Alexey Dosovitskiy, Eddy Ilg +6

    cs.CVcs.LGarXiv:1504.06852v22015
  35. End to End Learning for Self-Driving Cars

    Mariusz Bojarski, Davide Del Testa, Daniel Dworakowski +10

    cs.CVcs.LGcs.NEarXiv:1604.07316v12016
  36. A Few Cases Are All You Need: An Empirical Study of Annotation-Efficient LoRA Fine-Tuning of MedSAM3

    Sachin Dudda Nagaraju, Bendik Skarre Abrahamsen, Ashkan Moradi +1

    cs.CVcs.AIarXiv:2608.18731v12026
  37. PointPillars: Fast Encoders for Object Detection from Point Clouds

    Alex H. Lang, Sourabh Vora, Holger Caesar +3

    cs.LGcs.CVstat.MLarXiv:1812.05784v22018
  38. The Impact of CutMix on Reliability and Robustness in Semantic Segmentation

    Steven Landgraf, Markus Ulrich

    cs.CVcs.AIcs.LGarXiv:2608.18715v12026
  39. EfficientNetV2: Smaller Models and Faster Training

    Mingxing Tan, Quoc V. Le

    cs.CVarXiv:2104.00298v32021
  40. Depth Map Prediction from a Single Image using a Multi-Scale Deep Network

    David Eigen, Christian Puhrsch, Rob Fergus

    cs.CVarXiv:1406.2283v12014
  41. Learning to Compare: Relation Network for Few-Shot Learning

    Flood Sung, Yongxin Yang, Li Zhang +3

    cs.CVarXiv:1711.06025v22017
  42. XNOR-Net: ImageNet Classification Using Binary Convolutional Neural Networks

    Mohammad Rastegari, Vicente Ordonez, Joseph Redmon +1

    cs.CVarXiv:1603.05279v42016
  43. Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

    Peng Wang, Shuai Bai, Sinan Tan +16

    cs.CVcs.AIcs.CLarXiv:2409.12191v22024
  44. GPT-4o System Card

    OpenAI, :, Aaron Hurst +417

    cs.CLcs.AIcs.CVarXiv:2410.21276v12024
  45. DeCAF: A Deep Convolutional Activation Feature for Generic Visual Recognition

    Jeff Donahue, Yangqing Jia, Oriol Vinyals +4

    cs.CVarXiv:1310.1531v12013
  46. Deep Convolutional Neural Networks for Computer-Aided Detection: CNN Architectures, Dataset Characteristics and Transfer Learning

    Hoo-Chang Shin, Holger R. Roth, Mingchen Gao +6

    cs.CVarXiv:1602.03409v12016
  47. Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering

    Peter Anderson, Xiaodong He, Chris Buehler +4

    cs.CVarXiv:1707.07998v32017
  48. Impact of Iterative Fine-Tuning on Transcription Accuracy in Complex Historical Sanskrit Manuscripts

    Kartik Chincholikar, Kaushik Gopalan, Mihir Hasabnis

    cs.CVcs.AIarXiv:2608.18696v12026
  49. Simple Online and Realtime Tracking with a Deep Association Metric

    Nicolai Wojke, Alex Bewley, Dietrich Paulus

    cs.CVarXiv:1703.07402v12017
  50. FixMatch: Simplifying Semi-Supervised Learning with Consistency and Confidence

    Kihyuk Sohn, David Berthelot, Chun-Liang Li +6

    cs.LGcs.CVstat.MLarXiv:2001.07685v22020
  51. Composed Historical Image Retrieval by Modeling Temporal Representations

    Adrià Molina Rodríguez, Oriol Ramos Terrades, Josep Lladós Canet

    cs.CVcs.AIcs.IRarXiv:2608.18694v12026
  52. Learning Important Features Through Propagating Activation Differences

    Avanti Shrikumar, Peyton Greenside, Anshul Kundaje

    cs.CVcs.LGcs.NEarXiv:1704.02685v22017
  53. GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models

    Alex Nichol, Prafulla Dhariwal, Aditya Ramesh +5

    cs.CVcs.GRcs.LGarXiv:2112.10741v32021
  54. ESRGAN: Enhanced Super-Resolution Generative Adversarial Networks

    Xintao Wang, Ke Yu, Shixiang Wu +6

    cs.CVarXiv:1809.00219v22018
  55. Deep High-Resolution Representation Learning for Visual Recognition

    Jingdong Wang, Ke Sun, Tianheng Cheng +9

    cs.CVarXiv:1908.07919v22019
  56. OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

    Zinuo Guo, Min Zhang, Bo Jiang

    cs.CVcs.AIarXiv:2608.18586v12026
  57. iCaRL: Incremental Classifier and Representation Learning

    Sylvestre-Alvise Rebuffi, Alexander Kolesnikov, Georg Sperl +1

    cs.CVcs.LGstat.MLarXiv:1611.07725v22016
  58. SwinIR: Image Restoration Using Swin Transformer

    Jingyun Liang, Jiezhang Cao, Guolei Sun +3

    eess.IVcs.CVarXiv:2108.10257v12021
  59. CNN Features off-the-shelf: an Astounding Baseline for Recognition

    Ali Sharif Razavian, Hossein Azizpour, Josephine Sullivan +1

    cs.CVarXiv:1403.6382v32014
  60. Least Squares Generative Adversarial Networks

    Xudong Mao, Qing Li, Haoran Xie +3

    cs.CVarXiv:1611.04076v32016