Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

11,401 to 11,460 of 18,780

  1. DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior

    Xinqi Lin, Jingwen He, Ziyan Chen +6

    cs.CVarXiv:2308.15070v32023
  2. Relay Backpropagation for Effective Learning of Deep Convolutional Neural Networks

    Li Shen, Zhouchen Lin, Qingming Huang

    cs.CVcs.LGarXiv:1512.05830v22015
  3. Deep Imbalanced Learning for Face Recognition and Attribute Prediction

    Chen Huang, Yining Li, Chen Change Loy +1

    cs.CVarXiv:1806.00194v22018
  4. Legged Locomotion in Challenging Terrains using Egocentric Vision

    Ananye Agarwal, Ashish Kumar, Jitendra Malik +1

    cs.ROcs.AIcs.CVarXiv:2211.07638v12022
  5. Feature Distillation: DNN-Oriented JPEG Compression Against Adversarial Examples

    Zihao Liu, Qi Liu, Tao Liu +4

    cs.CVcs.CRarXiv:1803.05787v22018
  6. Invisible for both Camera and LiDAR: Security of Multi-Sensor Fusion based Perception in Autonomous Driving Under Physical-World Attacks

    Yulong Cao*, Ningfei Wang*, Chaowei Xiao* +6

    cs.CRcs.CVcs.LGarXiv:2106.09249v12021
  7. PP-OCR: A Practical Ultra Lightweight OCR System

    Yuning Du, Chenxia Li, Ruoyu Guo +8

    cs.CVarXiv:2009.09941v32020
  8. SwinNet: Swin Transformer drives edge-aware RGB-D and RGB-T salient object detection

    Zhengyi Liu, Yacheng Tan, Qian He +1

    cs.CVarXiv:2204.05585v12022
  9. LST: Ladder Side-Tuning for Parameter and Memory Efficient Transfer Learning

    Yi-Lin Sung, Jaemin Cho, Mohit Bansal

    cs.CLcs.AIcs.CVarXiv:2206.06522v22022
  10. Bit-Flip Attack: Crushing Neural Network with Progressive Bit Search

    Adnan Siraj Rakin, Zhezhi He, Deliang Fan

    cs.CVcs.CRarXiv:1903.12269v22019
  11. RDD2022: A multi-national image dataset for automatic Road Damage Detection

    Deeksha Arya, Hiroya Maeda, Sanjay Kumar Ghosh +2

    cs.CVcs.AIcs.LGarXiv:2209.08538v12022
  12. Deep Learning for Multi-Task Medical Image Segmentation in Multiple Modalities

    Pim Moeskops, Jelmer M. Wolterink, Bas H. M. van der Velden +4

    cs.CVarXiv:1704.03379v12017
  13. Scaling Up Vision-Language Pre-training for Image Captioning

    Xiaowei Hu, Zhe Gan, Jianfeng Wang +4

    cs.CVcs.CLarXiv:2111.12233v22021
  14. Scalable Person Re-identification on Supervised Smoothed Manifold

    Song Bai, Xiang Bai, Qi Tian

    cs.CVarXiv:1703.08359v12017
  15. Rosetta: Large scale system for text detection and recognition in images

    Fedor Borisyuk, Albert Gordo, Viswanath Sivakumar

    cs.CVarXiv:1910.05085v12019
  16. COIN: COmpression with Implicit Neural representations

    Emilien Dupont, Adam Goliński, Milad Alizadeh +2

    eess.IVcs.CVcs.LGarXiv:2103.03123v22021
  17. Pixel-Adaptive Convolutional Neural Networks

    Hang Su, Varun Jampani, Deqing Sun +3

    cs.CVcs.GRcs.LGarXiv:1904.05373v12019
  18. Feature Importance-aware Transferable Adversarial Attacks

    Zhibo Wang, Hengchang Guo, Zhifei Zhang +3

    cs.CVarXiv:2107.14185v32021
  19. Distribution-Free, Risk-Controlling Prediction Sets

    Stephen Bates, Anastasios Angelopoulos, Lihua Lei +2

    cs.LGcs.AIcs.CVarXiv:2101.02703v32021
  20. Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation

    Shuai Yang, Yifan Zhou, Ziwei Liu +1

    cs.CVarXiv:2306.07954v22023
  21. Large Language Model Guided Tree-of-Thought

    Jieyi Long

    cs.AIcs.CLcs.CVarXiv:2305.08291v12023
  22. How would surround vehicles move? A Unified Framework for Maneuver Classification and Motion Prediction

    Nachiket Deo, Akshay Rangesh, Mohan M. Trivedi

    cs.CVarXiv:1801.06523v12018
  23. Deep Reinforcement Learning-based Image Captioning with Embedding Reward

    Zhou Ren, Xiaoyu Wang, Ning Zhang +2

    cs.CVcs.AIarXiv:1704.03899v12017
  24. Multi-Oriented Scene Text Detection via Corner Localization and Region Segmentation

    Pengyuan Lyu, Cong Yao, Wenhao Wu +2

    cs.CVarXiv:1802.08948v22018
  25. CellViT: Vision Transformers for Precise Cell Segmentation and Classification

    Fabian Hörst, Moritz Rempe, Lukas Heine +8

    eess.IVcs.CVcs.LGarXiv:2306.15350v22023
  26. Diversify and Match: A Domain Adaptive Representation Learning Paradigm for Object Detection

    Taekyung Kim, Minki Jeong, Seunghyeon Kim +2

    cs.CVarXiv:1905.05396v12019
  27. Comparing Kullback-Leibler Divergence and Mean Squared Error Loss in Knowledge Distillation

    Taehyeon Kim, Jaehoon Oh, NakYil Kim +2

    cs.LGcs.CVarXiv:2105.08919v12021
  28. Efficiently Identifying Task Groupings for Multi-Task Learning

    Christopher Fifty, Ehsan Amid, Zhe Zhao +3

    cs.LGcs.AIcs.CVarXiv:2109.04617v22021
  29. Mastering Atari Games with Limited Data

    Weirui Ye, Shaohuai Liu, Thanard Kurutach +2

    cs.LGcs.AIcs.CVarXiv:2111.00210v22021
  30. Semi-Supervised Medical Image Segmentation via Cross Teaching between CNN and Transformer

    Xiangde Luo, Minhao Hu, Tao Song +2

    eess.IVcs.CVarXiv:2112.04894v22021
  31. Video Captioning with Transferred Semantic Attributes

    Yingwei Pan, Ting Yao, Houqiang Li +1

    cs.CVarXiv:1611.07675v12016
  32. Super-Resolution with Deep Convolutional Sufficient Statistics

    Joan Bruna, Pablo Sprechmann, Yann LeCun

    cs.CVarXiv:1511.05666v42015
  33. Automatic Moth Detection from Trap Images for Pest Management

    Weiguang Ding, Graham Taylor

    cs.CVcs.LGcs.NEarXiv:1602.07383v12016
  34. FVC: A New Framework towards Deep Video Compression in Feature Space

    Zhihao Hu, Guo Lu, Dong Xu

    eess.IVcs.CVarXiv:2105.09600v22021
  35. Skin Lesion Classification Using Ensembles of Multi-Resolution EfficientNets with Meta Data

    Nils Gessert, Maximilian Nielsen, Mohsin Shaikh +2

    cs.CVarXiv:1910.03910v12019
  36. Deep Exemplar-based Colorization

    Mingming He, Dongdong Chen, Jing Liao +2

    cs.CVarXiv:1807.06587v22018
  37. Patch-based Probabilistic Image Quality Assessment for Face Selection and Improved Video-based Face Recognition

    Yongkang Wong, Shaokang Chen, Sandra Mau +2

    cs.CVstat.AParXiv:1304.0869v22013
  38. Learning the Best Pooling Strategy for Visual Semantic Embedding

    Jiacheng Chen, Hexiang Hu, Hao Wu +2

    cs.CVarXiv:2011.04305v52020
  39. DilateFormer: Multi-Scale Dilated Transformer for Visual Recognition

    Jiayu Jiao, Yu-Ming Tang, Kun-Yu Lin +4

    cs.CVarXiv:2302.01791v12023
  40. Unsupervised Misaligned Infrared and Visible Image Fusion via Cross-Modality Image Generation and Registration

    Di Wang, Jinyuan Liu, Xin Fan +1

    cs.CVarXiv:2205.11876v12022
  41. In Defense of Classical Image Processing: Fast Depth Completion on the CPU

    Jason Ku, Ali Harakeh, Steven L. Waslander

    cs.CVarXiv:1802.00036v12018
  42. Image Inpainting via Generative Multi-column Convolutional Neural Networks

    Yi Wang, Xin Tao, Xiaojuan Qi +2

    cs.CVarXiv:1810.08771v12018
  43. OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation

    Kepan Nan, Rui Xie, Penghao Zhou +6

    cs.CVarXiv:2407.02371v32024
  44. Fully Convolutional Cross-Scale-Flows for Image-based Defect Detection

    Marco Rudolph, Tom Wehrbein, Bodo Rosenhahn +1

    cs.CVarXiv:2110.02855v12021
  45. FastFCN: Rethinking Dilated Convolution in the Backbone for Semantic Segmentation

    Huikai Wu, Junge Zhang, Kaiqi Huang +2

    cs.CVarXiv:1903.11816v12019
  46. Occlusion Aware Unsupervised Learning of Optical Flow

    Yang Wang, Yi Yang, Zhenheng Yang +3

    cs.CVarXiv:1711.05890v22017
  47. Toward Driving Scene Understanding: A Dataset for Learning Driver Behavior and Causal Reasoning

    Vasili Ramanishka, Yi-Ting Chen, Teruhisa Misu +1

    cs.CVarXiv:1811.02307v12018
  48. A robust and efficient video representation for action recognition

    Heng Wang, Dan Oneata, Jakob Verbeek +1

    cs.CVarXiv:1504.05524v12015
  49. Rethinking Knowledge Graph Propagation for Zero-Shot Learning

    Michael Kampffmeyer, Yinbo Chen, Xiaodan Liang +3

    cs.CVarXiv:1805.11724v32018
  50. LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models

    Kaichen Zhang, Bo Li, Peiyuan Zhang +8

    cs.CLcs.CVarXiv:2407.12772v22024
  51. Back to the Feature: Learning Robust Camera Localization from Pixels to Pose

    Paul-Edouard Sarlin, Ajaykumar Unagar, Måns Larsson +8

    cs.CVarXiv:2103.09213v22021
  52. GPS-Net: Graph Property Sensing Network for Scene Graph Generation

    Xin Lin, Changxing Ding, Jinquan Zeng +1

    cs.CVarXiv:2003.12962v12020
  53. MOS: Towards Scaling Out-of-distribution Detection for Large Semantic Space

    Rui Huang, Yixuan Li

    cs.CVcs.LGarXiv:2105.01879v12021
  54. Spike-driven Transformer

    Man Yao, Jiakui Hu, Zhaokun Zhou +4

    cs.NEcs.CVarXiv:2307.01694v12023
  55. SelFlow: Self-Supervised Learning of Optical Flow

    Pengpeng Liu, Michael Lyu, Irwin King +1

    cs.CVcs.LGarXiv:1904.09117v12019
  56. Surgical Data Science -- from Concepts toward Clinical Translation

    Lena Maier-Hein, Matthias Eisenmann, Duygu Sarikaya +47

    cs.CYcs.CVcs.LGarXiv:2011.02284v22020
  57. AdaViT: Adaptive Vision Transformers for Efficient Image Recognition

    Lingchen Meng, Hengduo Li, Bor-Chun Chen +4

    cs.CVarXiv:2111.15668v12021
  58. 3D Neural Field Generation using Triplane Diffusion

    J. Ryan Shue, Eric Ryan Chan, Ryan Po +3

    cs.CVcs.AIcs.GRarXiv:2211.16677v12022
  59. BA-Net: Dense Bundle Adjustment Network

    Chengzhou Tang, Ping Tan

    cs.CVarXiv:1806.04807v32018
  60. RSGPT: A Remote Sensing Vision Language Model and Benchmark

    Yuan Hu, Jianlong Yuan, Congcong Wen +2

    cs.CVarXiv:2307.15266v12023