Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
17,941 to 18,000 of 18,820
Instance Normalization: The Missing Ingredient for Fast Stylization
Dmitry Ulyanov, Andrea Vedaldi, Victor Lempitsky
cs.CVarXiv:1607.08022v32016CSPNet: A New Backbone that can Enhance Learning Capability of CNN
Chien-Yao Wang, Hong-Yuan Mark Liao, I-Hau Yeh +3
cs.CVarXiv:1911.11929v12019Bernstein-Vazirani Networks: Quantum Machine Learning by Interference
Natacha Kuete Meli, Tolga Birdal, Prayag Tiwari +2
quant-phcs.AIcs.CVarXiv:2608.19043v12026Masked-attention Mask Transformer for Universal Image Segmentation
Bowen Cheng, Ishan Misra, Alexander G. Schwing +2
cs.CVcs.AIcs.LGarXiv:2112.01527v32021FiLM: Visual Reasoning with a General Conditioning Layer
Ethan Perez, Florian Strub, Harm de Vries +2
cs.CVcs.AIcs.CLarXiv:1709.07871v22017GhostNet: More Features from Cheap Operations
Kai Han, Yunhe Wang, Qi Tian +3
cs.CVarXiv:1911.11907v22019YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information
Chien-Yao Wang, I-Hau Yeh, Hong-Yuan Mark Liao
cs.CVarXiv:2402.13616v22024Temporal Segment Networks: Towards Good Practices for Deep Action Recognition
Limin Wang, Yuanjun Xiong, Zhe Wang +4
cs.CVarXiv:1608.00859v12016Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics
Alex Kendall, Yarin Gal, Roberto Cipolla
cs.CVarXiv:1705.07115v32017Improved Regularization of Convolutional Neural Networks with Cutout
Terrance DeVries, Graham W. Taylor
cs.CVarXiv:1708.04552v22017Scalability in Perception for Autonomous Driving: Waymo Open Dataset
Pei Sun, Henrik Kretzschmar, Xerxes Dotiwalla +22
cs.CVcs.LGstat.MLarXiv:1912.04838v72019Learning to Prompt for Vision-Language Models
Kaiyang Zhou, Jingkang Yang, Chen Change Loy +1
cs.CVcs.AIcs.LGarXiv:2109.01134v62021SlowFast Networks for Video Recognition
Christoph Feichtenhofer, Haoqi Fan, Jitendra Malik +1
cs.CVarXiv:1812.03982v32018Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift
Longtian Wang, Zhengyu Zhao, Chenhao Lin +5
cs.CVcs.AIarXiv:2608.19088v12026RandAugment: Practical automated data augmentation with a reduced search space
Ekin D. Cubuk, Barret Zoph, Jonathon Shlens +1
cs.CVarXiv:1909.13719v22019Learning Deconvolution Network for Semantic Segmentation
Hyeonwoo Noh, Seunghoon Hong, Bohyung Han
cs.CVarXiv:1505.04366v12015GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting
Yechan Park, HyunJin Kim
cs.CVcs.AIarXiv:2608.19066v12026Counterfactual Contrastive Analysis
Yunlong He, Pietro Gori
cs.CVcs.AIarXiv:2608.19032v12026One-Stage Object Detectors in Autonomous Driving
Jonel Roman, Ryan Sirjue, Peter Nguyen +3
cs.CVcs.AIarXiv:2608.19014v12026GrabVG: Graph-Attentive Binding for Visual Grounding in UAV Imagery
Chaowei Wang, Yan Di, Jingjun Sun +5
cs.CVcs.AIarXiv:2608.18996v12026Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering
Yash Goyal, Tejas Khot, Douglas Summers-Stay +2
cs.CVcs.AIcs.CLarXiv:1612.00837v32016High-Resolution Image Synthesis and Semantic Manipulation with Conditional GANs
Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu +3
cs.CVcs.GRcs.LGarXiv:1711.11585v22017Taming Transformers for High-Resolution Image Synthesis
Patrick Esser, Robin Rombach, Björn Ommer
cs.CVarXiv:2012.09841v32020Markerless tracking of user-defined features with deep learning
Alexander Mathis, Pranav Mamidanna, Taiga Abe +4
cs.CVq-bio.NCq-bio.QMarXiv:1804.03142v12018A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation
Steven Landgraf, Joceline Hinz, Markus Ulrich
cs.CVcs.AIcs.LGarXiv:2608.18709v12026DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
Nataniel Ruiz, Yuanzhen Li, Varun Jampani +3
cs.CVcs.GRcs.LGarXiv:2208.12242v22022Group Normalization
Yuxin Wu, Kaiming He
cs.CVcs.LGarXiv:1803.08494v32018Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets
Ting Xiang, Chenxi Deng, Jinhui Zhao +4
cs.CVcs.AIarXiv:2608.18907v12026A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks
Dan Hendrycks, Kevin Gimpel
cs.NEcs.CVcs.LGarXiv:1610.02136v32016The Mythos of Model Interpretability
Zachary C. Lipton
cs.LGcs.AIcs.CVarXiv:1606.03490v32016ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks
Jiasen Lu, Dhruv Batra, Devi Parikh +1
cs.CVcs.CLarXiv:1908.02265v12019Benchmarking Neural Network Robustness to Common Corruptions and Perturbations
Dan Hendrycks, Thomas Dietterich
cs.LGcs.CVstat.MLarXiv:1903.12261v12019VoxelNet: End-to-End Learning for Point Cloud Based 3D Object Detection
Yin Zhou, Oncel Tuzel
cs.CVarXiv:1711.06396v12017FlowNet: Learning Optical Flow with Convolutional Networks
Philipp Fischer, Alexey Dosovitskiy, Eddy Ilg +6
cs.CVcs.LGarXiv:1504.06852v22015End to End Learning for Self-Driving Cars
Mariusz Bojarski, Davide Del Testa, Daniel Dworakowski +10
cs.CVcs.LGcs.NEarXiv:1604.07316v12016A Few Cases Are All You Need: An Empirical Study of Annotation-Efficient LoRA Fine-Tuning of MedSAM3
Sachin Dudda Nagaraju, Bendik Skarre Abrahamsen, Ashkan Moradi +1
cs.CVcs.AIarXiv:2608.18731v12026PointPillars: Fast Encoders for Object Detection from Point Clouds
Alex H. Lang, Sourabh Vora, Holger Caesar +3
cs.LGcs.CVstat.MLarXiv:1812.05784v22018The Impact of CutMix on Reliability and Robustness in Semantic Segmentation
Steven Landgraf, Markus Ulrich
cs.CVcs.AIcs.LGarXiv:2608.18715v12026EfficientNetV2: Smaller Models and Faster Training
Mingxing Tan, Quoc V. Le
cs.CVarXiv:2104.00298v32021Depth Map Prediction from a Single Image using a Multi-Scale Deep Network
David Eigen, Christian Puhrsch, Rob Fergus
cs.CVarXiv:1406.2283v12014Learning to Compare: Relation Network for Few-Shot Learning
Flood Sung, Yongxin Yang, Li Zhang +3
cs.CVarXiv:1711.06025v22017XNOR-Net: ImageNet Classification Using Binary Convolutional Neural Networks
Mohammad Rastegari, Vicente Ordonez, Joseph Redmon +1
cs.CVarXiv:1603.05279v42016Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
Peng Wang, Shuai Bai, Sinan Tan +16
cs.CVcs.AIcs.CLarXiv:2409.12191v22024GPT-4o System Card
OpenAI, :, Aaron Hurst +417
cs.CLcs.AIcs.CVarXiv:2410.21276v12024DeCAF: A Deep Convolutional Activation Feature for Generic Visual Recognition
Jeff Donahue, Yangqing Jia, Oriol Vinyals +4
cs.CVarXiv:1310.1531v12013Deep Convolutional Neural Networks for Computer-Aided Detection: CNN Architectures, Dataset Characteristics and Transfer Learning
Hoo-Chang Shin, Holger R. Roth, Mingchen Gao +6
cs.CVarXiv:1602.03409v12016Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering
Peter Anderson, Xiaodong He, Chris Buehler +4
cs.CVarXiv:1707.07998v32017Impact of Iterative Fine-Tuning on Transcription Accuracy in Complex Historical Sanskrit Manuscripts
Kartik Chincholikar, Kaushik Gopalan, Mihir Hasabnis
cs.CVcs.AIarXiv:2608.18696v12026Simple Online and Realtime Tracking with a Deep Association Metric
Nicolai Wojke, Alex Bewley, Dietrich Paulus
cs.CVarXiv:1703.07402v12017FixMatch: Simplifying Semi-Supervised Learning with Consistency and Confidence
Kihyuk Sohn, David Berthelot, Chun-Liang Li +6
cs.LGcs.CVstat.MLarXiv:2001.07685v22020Composed Historical Image Retrieval by Modeling Temporal Representations
Adrià Molina Rodríguez, Oriol Ramos Terrades, Josep Lladós Canet
cs.CVcs.AIcs.IRarXiv:2608.18694v12026Learning Important Features Through Propagating Activation Differences
Avanti Shrikumar, Peyton Greenside, Anshul Kundaje
cs.CVcs.LGcs.NEarXiv:1704.02685v22017GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
Alex Nichol, Prafulla Dhariwal, Aditya Ramesh +5
cs.CVcs.GRcs.LGarXiv:2112.10741v32021ESRGAN: Enhanced Super-Resolution Generative Adversarial Networks
Xintao Wang, Ke Yu, Shixiang Wu +6
cs.CVarXiv:1809.00219v22018Deep High-Resolution Representation Learning for Visual Recognition
Jingdong Wang, Ke Sun, Tianheng Cheng +9
cs.CVarXiv:1908.07919v22019OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios
Zinuo Guo, Min Zhang, Bo Jiang
cs.CVcs.AIarXiv:2608.18586v12026iCaRL: Incremental Classifier and Representation Learning
Sylvestre-Alvise Rebuffi, Alexander Kolesnikov, Georg Sperl +1
cs.CVcs.LGstat.MLarXiv:1611.07725v22016SwinIR: Image Restoration Using Swin Transformer
Jingyun Liang, Jiezhang Cao, Guolei Sun +3
eess.IVcs.CVarXiv:2108.10257v12021CNN Features off-the-shelf: an Astounding Baseline for Recognition
Ali Sharif Razavian, Hossein Azizpour, Josephine Sullivan +1
cs.CVarXiv:1403.6382v32014Least Squares Generative Adversarial Networks
Xudong Mao, Qing Li, Haoran Xie +3
cs.CVarXiv:1611.04076v32016