Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

6,421 to 6,480 of 18,822

  1. MERLOT: Multimodal Neural Script Knowledge Models

    Rowan Zellers, Ximing Lu, Jack Hessel +5

    cs.CVcs.CLcs.LGarXiv:2106.02636v32021
  2. Preservation of the Global Knowledge by Not-True Distillation in Federated Learning

    Gihun Lee, Minchan Jeong, Yongjin Shin +2

    cs.LGcs.AIcs.CVarXiv:2106.03097v52021
  3. BRECQ: Pushing the Limit of Post-Training Quantization by Block Reconstruction

    Yuhang Li, Ruihao Gong, Xu Tan +6

    cs.LGcs.CVarXiv:2102.05426v22021
  4. VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

    Zhiwen Fan, Jian Zhang, Renjie Li +15

    cs.CVcs.CLarXiv:2505.20279v52025
  5. pixelNeRF: Neural Radiance Fields from One or Few Images

    Alex Yu, Vickie Ye, Matthew Tancik +1

    cs.CVcs.GRcs.LGarXiv:2012.02190v32020
  6. Distribution Matching for Crowd Counting

    Boyu Wang, Huidong Liu, Dimitris Samaras +1

    cs.CVarXiv:2009.13077v22020
  7. Understanding the Role of Individual Units in a Deep Neural Network

    David Bau, Jun-Yan Zhu, Hendrik Strobelt +3

    cs.CVcs.LGcs.NEarXiv:2009.05041v22020
  8. Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning

    Kaizhen Tan, Yang Feng, Heqing Du +3

    cs.CVarXiv:2609.00658v12026
  9. Self-supervised Video Representation Learning by Pace Prediction

    Jiangliu Wang, Jianbo Jiao, Yun-Hui Liu

    cs.CVarXiv:2008.05861v22020
  10. Action2Motion: Conditioned Generation of 3D Human Motions

    Chuan Guo, Xinxin Zuo, Sen Wang +5

    cs.CVarXiv:2007.15240v12020
  11. Self-Supervised Monocular Depth Estimation: Solving the Dynamic Object Problem by Semantic Guidance

    Marvin Klingner, Jan-Aike Termöhlen, Jonas Mikolajczyk +1

    cs.CVarXiv:2007.06936v22020
  12. Early-Learning Regularization Prevents Memorization of Noisy Labels

    Sheng Liu, Jonathan Niles-Weed, Narges Razavian +1

    cs.LGcs.CVstat.MLarXiv:2007.00151v22020
  13. Bootstrap your own latent: A new approach to self-supervised Learning

    Jean-Bastien Grill, Florian Strub, Florent Altché +11

    cs.LGcs.CVstat.MLarXiv:2006.07733v32020
  14. Handwritten Optical Character Recognition (OCR): A Comprehensive Systematic Literature Review (SLR)

    Jamshed Memon, Maira Sami, Rizwan Ahmed Khan

    cs.CVcs.LGarXiv:2001.00139v12020
  15. MambaHSI: Spatial-Spectral Mamba for Hyperspectral Image Classification

    Yapeng Li, Yong Luo, Lefei Zhang +2

    cs.CVarXiv:2501.04944v12025
  16. Once-for-All: Train One Network and Specialize it for Efficient Deployment

    Han Cai, Chuang Gan, Tianzhe Wang +2

    cs.LGcs.CVstat.MLarXiv:1908.09791v52019
  17. REFUGE Challenge: A Unified Framework for Evaluating Automated Methods for Glaucoma Assessment from Fundus Photographs

    José Ignacio Orlando, Huazhu Fu, João Barbossa Breda +29

    cs.CVarXiv:1910.03667v12019
  18. Lightweight Image Super-Resolution with Information Multi-distillation Network

    Zheng Hui, Xinbo Gao, Yunchu Yang +1

    eess.IVcs.CVcs.MMarXiv:1909.11856v12019
  19. Adversarial Sensor Attack on LiDAR-based Perception in Autonomous Driving

    Yulong Cao, Chaowei Xiao, Benjamin Cyr +6

    cs.CRcs.CVeess.SParXiv:1907.06826v22019
  20. Large Scale Adversarial Representation Learning

    Jeff Donahue, Karen Simonyan

    cs.CVcs.LGstat.MLarXiv:1907.02544v22019
  21. Graph Neural Tangent Kernel: Fusing Graph Neural Networks with Graph Kernels

    Simon S. Du, Kangcheng Hou, Barnabás Póczos +3

    cs.LGcs.AIcs.CVarXiv:1905.13192v22019
  22. On Exact Computation with an Infinitely Wide Neural Net

    Sanjeev Arora, Simon S. Du, Wei Hu +3

    cs.LGcs.CVcs.NEarXiv:1904.11955v22019
  23. UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler

    Luigi Piccinelli, Christos Sakaridis, Yung-Hsu Yang +4

    cs.CVarXiv:2502.20110v22025
  24. Three scenarios for continual learning

    Gido M. van de Ven, Andreas S. Tolias

    cs.LGcs.AIcs.CVarXiv:1904.07734v12019
  25. The Liver Tumor Segmentation Benchmark (LiTS)

    Patrick Bilic, Patrick Christ, Hongwei Bran Li +106

    cs.CVarXiv:1901.04056v22019
  26. Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution

    Yunpeng Chen, Haoqi Fan, Bing Xu +5

    cs.CVarXiv:1904.05049v32019
  27. Physics-Constrained Deep Learning for High-dimensional Surrogate Modeling and Uncertainty Quantification without Labeled Data

    Yinhao Zhu, Nicholas Zabaras, Phaedon-Stelios Koutsourelakis +1

    physics.comp-phcs.CVcs.LGarXiv:1901.06314v12019
  28. GaitSet: Regarding Gait as a Set for Cross-View Gait Recognition

    Hanqing Chao, Yiwei He, Junping Zhang +1

    cs.CVarXiv:1811.06186v42018
  29. Spike-driven Transformer V2: Meta Spiking Neural Network Architecture Inspiring the Design of Next-generation Neuromorphic Chips

    Man Yao, Jiakui Hu, Tianxiang Hu +5

    cs.NEcs.CVarXiv:2404.03663v12024
  30. DARTS: Differentiable Architecture Search

    Hanxiao Liu, Karen Simonyan, Yiming Yang

    cs.LGcs.CLcs.CVarXiv:1806.09055v22018
  31. A General Framework for Inference-time Scaling and Steering of Diffusion Models

    Raghav Singhal, Zachary Horvitz, Ryan Teehan +4

    cs.LGcs.CLcs.CVarXiv:2501.06848v52025
  32. Deep Sequence Learning with Auxiliary Information for Traffic Prediction

    Binbing Liao, Jingqing Zhang, Chao Wu +5

    cs.CVcs.AIarXiv:1806.07380v12018
  33. Robustness May Be at Odds with Accuracy

    Dimitris Tsipras, Shibani Santurkar, Logan Engstrom +2

    stat.MLcs.CVcs.LGarXiv:1805.12152v52018
  34. TADAM: Task dependent adaptive metric for improved few-shot learning

    Boris N. Oreshkin, Pau Rodriguez, Alexandre Lacoste

    cs.LGcs.AIcs.CVarXiv:1805.10123v42018
  35. Adversarially Learned One-Class Classifier for Novelty Detection

    Mohammad Sabokrou, Mohammad Khalooei, Mahmood Fathy +1

    cs.CVarXiv:1802.09088v22018
  36. Bayesian Deep Convolutional Encoder-Decoder Networks for Surrogate Modeling and Uncertainty Quantification

    Yinhao Zhu, Nicholas Zabaras

    physics.comp-phcs.CVcs.LGarXiv:1801.06879v12018
  37. REPA-E: Unlocking VAE for End-to-End Tuning with Latent Diffusion Transformers

    Xingjian Leng, Jaskirat Singh, Yunzhong Hou +3

    cs.CVcs.LGarXiv:2504.10483v32025
  38. Mitigating Adversarial Effects Through Randomization

    Cihang Xie, Jianyu Wang, Zhishuai Zhang +2

    cs.CVarXiv:1711.01991v32017
  39. Ensembles of Multiple Models and Architectures for Robust Brain Tumour Segmentation

    Konstantinos Kamnitsas, Wenjia Bai, Enzo Ferrante +8

    cs.CVcs.AIcs.LGarXiv:1711.01468v12017
  40. A systematic study of the class imbalance problem in convolutional neural networks

    Mateusz Buda, Atsuto Maki, Maciej A. Mazurowski

    cs.CVcs.AIcs.LGarXiv:1710.05381v22017
  41. Deep Bilateral Learning for Real-Time Image Enhancement

    Michaël Gharbi, Jiawen Chen, Jonathan T. Barron +2

    cs.GRcs.CVarXiv:1707.02880v22017
  42. Multi-View Spectral Clustering via Structured Low-Rank Matrix Factorization

    Yang Wang, Lin Wu

    cs.CVarXiv:1709.01212v32017
  43. Multi-task Self-Supervised Visual Learning

    Carl Doersch, Andrew Zisserman

    cs.CVarXiv:1708.07860v12017
  44. Crafting a Toolchain for Image Restoration by Deep Reinforcement Learning

    Ke Yu, Chao Dong, Liang Lin +1

    cs.CVarXiv:1804.03312v12018
  45. Adversarial Feature Learning

    Jeff Donahue, Philipp Krähenbühl, Trevor Darrell

    cs.LGcs.AIcs.CVarXiv:1605.09782v72016
  46. Rotation Invariant Convolutions for 3D Point Clouds Deep Learning

    Zhiyuan Zhang, Binh-Son Hua, David W. Rosen +1

    cs.CVarXiv:1908.06297v12019
  47. Efficient Multi-Scale 3D CNN with Fully Connected CRF for Accurate Brain Lesion Segmentation

    Konstantinos Kamnitsas, Christian Ledig, Virginia F. J. Newcombe +5

    cs.CVcs.AIarXiv:1603.05959v32016
  48. DoDNet: Learning to segment multi-organ and tumors from multiple partially labeled datasets

    Jianpeng Zhang, Yutong Xie, Yong Xia +1

    cs.CVarXiv:2011.10217v12020
  49. HiLRP: Toward One Trustworthy Explanation for Vision Transformer: Conservation-Valid Attribution via Attention Primitives

    Sathiyamohan Nishankar, Pubudu Sanjeewani, Asanka Perera +1

    cs.CVcs.AIarXiv:2609.01282v12026
  50. Direct Intrinsics: Learning Albedo-Shading Decomposition by Convolutional Regression

    Takuya Narihira, Michael Maire, Stella X. Yu

    cs.CVarXiv:1512.02311v12015
  51. StainPresetNet: Stain Preset Network for Fast Multi-to-Multi Stain Normalization

    Hongtao Kang, Die Luo, Li Chen +4

    cs.CVcs.AIarXiv:2609.01146v12026
  52. Stochastic Gradient Descent, Weighted Sampling, and the Randomized Kaczmarz algorithm

    Deanna Needell, Nathan Srebro, Rachel Ward

    math.NAcs.CVcs.LGarXiv:1310.5715v52013
  53. Integrating Generic Sensor Fusion Algorithms with Sound State Representations through Encapsulation of Manifolds

    Christoph Hertzberg, René Wagner, Udo Frese +1

    cs.ROcs.CVcs.MSarXiv:1107.1119v12011
  54. Group Invariant Scattering

    Stéphane Mallat

    math.FAcs.CVarXiv:1101.2286v32011
  55. HVI: A New Color Space for Low-light Image Enhancement

    Qingsen Yan, Yixu Feng, Cheng Zhang +6

    cs.CVcs.AIcs.LGarXiv:2502.20272v22025
  56. Adv-Makeup: A New Imperceptible and Transferable Attack on Face Recognition

    Bangjie Yin, Wenxuan Wang, Taiping Yao +5

    cs.CVarXiv:2105.03162v12021
  57. Masked Face Recognition for Secure Authentication

    Aqeel Anwar, Arijit Raychowdhury

    cs.CVcs.LGeess.IVarXiv:2008.11104v12020
  58. Deep Adaptive Attention for Joint Facial Action Unit Detection and Face Alignment

    Zhiwen Shao, Zhilei Liu, Jianfei Cai +1

    cs.CVarXiv:1803.05588v22018
  59. Monkeypox Skin Lesion Detection Using Deep Learning Models: A Feasibility Study

    Shams Nafisa Ali, Md. Tazuddin Ahmed, Joydip Paul +4

    cs.CVcs.AIeess.IVarXiv:2207.03342v12022
  60. Solaris: Towards Interfaces That Are Generated, Not Coded

    Yuval Alaluf, Omri Avrahami, Guy Bukchin Leshem +18

    cs.CVcs.AIarXiv:2609.00776v12026