Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
11,401 to 11,460 of 18,780
DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior
Xinqi Lin, Jingwen He, Ziyan Chen +6
cs.CVarXiv:2308.15070v32023Relay Backpropagation for Effective Learning of Deep Convolutional Neural Networks
Li Shen, Zhouchen Lin, Qingming Huang
cs.CVcs.LGarXiv:1512.05830v22015Deep Imbalanced Learning for Face Recognition and Attribute Prediction
Chen Huang, Yining Li, Chen Change Loy +1
cs.CVarXiv:1806.00194v22018Legged Locomotion in Challenging Terrains using Egocentric Vision
Ananye Agarwal, Ashish Kumar, Jitendra Malik +1
cs.ROcs.AIcs.CVarXiv:2211.07638v12022Feature Distillation: DNN-Oriented JPEG Compression Against Adversarial Examples
Zihao Liu, Qi Liu, Tao Liu +4
cs.CVcs.CRarXiv:1803.05787v22018Invisible for both Camera and LiDAR: Security of Multi-Sensor Fusion based Perception in Autonomous Driving Under Physical-World Attacks
Yulong Cao*, Ningfei Wang*, Chaowei Xiao* +6
cs.CRcs.CVcs.LGarXiv:2106.09249v12021PP-OCR: A Practical Ultra Lightweight OCR System
Yuning Du, Chenxia Li, Ruoyu Guo +8
cs.CVarXiv:2009.09941v32020SwinNet: Swin Transformer drives edge-aware RGB-D and RGB-T salient object detection
Zhengyi Liu, Yacheng Tan, Qian He +1
cs.CVarXiv:2204.05585v12022LST: Ladder Side-Tuning for Parameter and Memory Efficient Transfer Learning
Yi-Lin Sung, Jaemin Cho, Mohit Bansal
cs.CLcs.AIcs.CVarXiv:2206.06522v22022Bit-Flip Attack: Crushing Neural Network with Progressive Bit Search
Adnan Siraj Rakin, Zhezhi He, Deliang Fan
cs.CVcs.CRarXiv:1903.12269v22019RDD2022: A multi-national image dataset for automatic Road Damage Detection
Deeksha Arya, Hiroya Maeda, Sanjay Kumar Ghosh +2
cs.CVcs.AIcs.LGarXiv:2209.08538v12022Deep Learning for Multi-Task Medical Image Segmentation in Multiple Modalities
Pim Moeskops, Jelmer M. Wolterink, Bas H. M. van der Velden +4
cs.CVarXiv:1704.03379v12017Scaling Up Vision-Language Pre-training for Image Captioning
Xiaowei Hu, Zhe Gan, Jianfeng Wang +4
cs.CVcs.CLarXiv:2111.12233v22021Scalable Person Re-identification on Supervised Smoothed Manifold
Song Bai, Xiang Bai, Qi Tian
cs.CVarXiv:1703.08359v12017Rosetta: Large scale system for text detection and recognition in images
Fedor Borisyuk, Albert Gordo, Viswanath Sivakumar
cs.CVarXiv:1910.05085v12019COIN: COmpression with Implicit Neural representations
Emilien Dupont, Adam Goliński, Milad Alizadeh +2
eess.IVcs.CVcs.LGarXiv:2103.03123v22021Pixel-Adaptive Convolutional Neural Networks
Hang Su, Varun Jampani, Deqing Sun +3
cs.CVcs.GRcs.LGarXiv:1904.05373v12019Feature Importance-aware Transferable Adversarial Attacks
Zhibo Wang, Hengchang Guo, Zhifei Zhang +3
cs.CVarXiv:2107.14185v32021Distribution-Free, Risk-Controlling Prediction Sets
Stephen Bates, Anastasios Angelopoulos, Lihua Lei +2
cs.LGcs.AIcs.CVarXiv:2101.02703v32021Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation
Shuai Yang, Yifan Zhou, Ziwei Liu +1
cs.CVarXiv:2306.07954v22023Large Language Model Guided Tree-of-Thought
Jieyi Long
cs.AIcs.CLcs.CVarXiv:2305.08291v12023How would surround vehicles move? A Unified Framework for Maneuver Classification and Motion Prediction
Nachiket Deo, Akshay Rangesh, Mohan M. Trivedi
cs.CVarXiv:1801.06523v12018Deep Reinforcement Learning-based Image Captioning with Embedding Reward
Zhou Ren, Xiaoyu Wang, Ning Zhang +2
cs.CVcs.AIarXiv:1704.03899v12017Multi-Oriented Scene Text Detection via Corner Localization and Region Segmentation
Pengyuan Lyu, Cong Yao, Wenhao Wu +2
cs.CVarXiv:1802.08948v22018CellViT: Vision Transformers for Precise Cell Segmentation and Classification
Fabian Hörst, Moritz Rempe, Lukas Heine +8
eess.IVcs.CVcs.LGarXiv:2306.15350v22023Diversify and Match: A Domain Adaptive Representation Learning Paradigm for Object Detection
Taekyung Kim, Minki Jeong, Seunghyeon Kim +2
cs.CVarXiv:1905.05396v12019Comparing Kullback-Leibler Divergence and Mean Squared Error Loss in Knowledge Distillation
Taehyeon Kim, Jaehoon Oh, NakYil Kim +2
cs.LGcs.CVarXiv:2105.08919v12021Efficiently Identifying Task Groupings for Multi-Task Learning
Christopher Fifty, Ehsan Amid, Zhe Zhao +3
cs.LGcs.AIcs.CVarXiv:2109.04617v22021Mastering Atari Games with Limited Data
Weirui Ye, Shaohuai Liu, Thanard Kurutach +2
cs.LGcs.AIcs.CVarXiv:2111.00210v22021Semi-Supervised Medical Image Segmentation via Cross Teaching between CNN and Transformer
Xiangde Luo, Minhao Hu, Tao Song +2
eess.IVcs.CVarXiv:2112.04894v22021Video Captioning with Transferred Semantic Attributes
Yingwei Pan, Ting Yao, Houqiang Li +1
cs.CVarXiv:1611.07675v12016Super-Resolution with Deep Convolutional Sufficient Statistics
Joan Bruna, Pablo Sprechmann, Yann LeCun
cs.CVarXiv:1511.05666v42015Automatic Moth Detection from Trap Images for Pest Management
Weiguang Ding, Graham Taylor
cs.CVcs.LGcs.NEarXiv:1602.07383v12016FVC: A New Framework towards Deep Video Compression in Feature Space
Zhihao Hu, Guo Lu, Dong Xu
eess.IVcs.CVarXiv:2105.09600v22021Skin Lesion Classification Using Ensembles of Multi-Resolution EfficientNets with Meta Data
Nils Gessert, Maximilian Nielsen, Mohsin Shaikh +2
cs.CVarXiv:1910.03910v12019Deep Exemplar-based Colorization
Mingming He, Dongdong Chen, Jing Liao +2
cs.CVarXiv:1807.06587v22018Patch-based Probabilistic Image Quality Assessment for Face Selection and Improved Video-based Face Recognition
Yongkang Wong, Shaokang Chen, Sandra Mau +2
cs.CVstat.AParXiv:1304.0869v22013Learning the Best Pooling Strategy for Visual Semantic Embedding
Jiacheng Chen, Hexiang Hu, Hao Wu +2
cs.CVarXiv:2011.04305v52020DilateFormer: Multi-Scale Dilated Transformer for Visual Recognition
Jiayu Jiao, Yu-Ming Tang, Kun-Yu Lin +4
cs.CVarXiv:2302.01791v12023Unsupervised Misaligned Infrared and Visible Image Fusion via Cross-Modality Image Generation and Registration
Di Wang, Jinyuan Liu, Xin Fan +1
cs.CVarXiv:2205.11876v12022In Defense of Classical Image Processing: Fast Depth Completion on the CPU
Jason Ku, Ali Harakeh, Steven L. Waslander
cs.CVarXiv:1802.00036v12018Image Inpainting via Generative Multi-column Convolutional Neural Networks
Yi Wang, Xin Tao, Xiaojuan Qi +2
cs.CVarXiv:1810.08771v12018OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
Kepan Nan, Rui Xie, Penghao Zhou +6
cs.CVarXiv:2407.02371v32024Fully Convolutional Cross-Scale-Flows for Image-based Defect Detection
Marco Rudolph, Tom Wehrbein, Bodo Rosenhahn +1
cs.CVarXiv:2110.02855v12021FastFCN: Rethinking Dilated Convolution in the Backbone for Semantic Segmentation
Huikai Wu, Junge Zhang, Kaiqi Huang +2
cs.CVarXiv:1903.11816v12019Occlusion Aware Unsupervised Learning of Optical Flow
Yang Wang, Yi Yang, Zhenheng Yang +3
cs.CVarXiv:1711.05890v22017Toward Driving Scene Understanding: A Dataset for Learning Driver Behavior and Causal Reasoning
Vasili Ramanishka, Yi-Ting Chen, Teruhisa Misu +1
cs.CVarXiv:1811.02307v12018A robust and efficient video representation for action recognition
Heng Wang, Dan Oneata, Jakob Verbeek +1
cs.CVarXiv:1504.05524v12015Rethinking Knowledge Graph Propagation for Zero-Shot Learning
Michael Kampffmeyer, Yinbo Chen, Xiaodan Liang +3
cs.CVarXiv:1805.11724v32018LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
Kaichen Zhang, Bo Li, Peiyuan Zhang +8
cs.CLcs.CVarXiv:2407.12772v22024Back to the Feature: Learning Robust Camera Localization from Pixels to Pose
Paul-Edouard Sarlin, Ajaykumar Unagar, Måns Larsson +8
cs.CVarXiv:2103.09213v22021GPS-Net: Graph Property Sensing Network for Scene Graph Generation
Xin Lin, Changxing Ding, Jinquan Zeng +1
cs.CVarXiv:2003.12962v12020MOS: Towards Scaling Out-of-distribution Detection for Large Semantic Space
Rui Huang, Yixuan Li
cs.CVcs.LGarXiv:2105.01879v12021Spike-driven Transformer
Man Yao, Jiakui Hu, Zhaokun Zhou +4
cs.NEcs.CVarXiv:2307.01694v12023SelFlow: Self-Supervised Learning of Optical Flow
Pengpeng Liu, Michael Lyu, Irwin King +1
cs.CVcs.LGarXiv:1904.09117v12019Surgical Data Science -- from Concepts toward Clinical Translation
Lena Maier-Hein, Matthias Eisenmann, Duygu Sarikaya +47
cs.CYcs.CVcs.LGarXiv:2011.02284v22020AdaViT: Adaptive Vision Transformers for Efficient Image Recognition
Lingchen Meng, Hengduo Li, Bor-Chun Chen +4
cs.CVarXiv:2111.15668v120213D Neural Field Generation using Triplane Diffusion
J. Ryan Shue, Eric Ryan Chan, Ryan Po +3
cs.CVcs.AIcs.GRarXiv:2211.16677v12022BA-Net: Dense Bundle Adjustment Network
Chengzhou Tang, Ping Tan
cs.CVarXiv:1806.04807v32018RSGPT: A Remote Sensing Vision Language Model and Benchmark
Yuan Hu, Jianlong Yuan, Congcong Wen +2
cs.CVarXiv:2307.15266v12023