Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
9,481 to 9,540 of 18,807
RedNet: Residual Encoder-Decoder Network for indoor RGB-D Semantic Segmentation
Jindong Jiang, Lunan Zheng, Fei Luo +1
cs.CVarXiv:1806.01054v22018Pose-guided Visible Part Matching for Occluded Person ReID
Shang Gao, Jingya Wang, Huchuan Lu +1
cs.CVarXiv:2004.00230v12020Learning Type-Aware Embeddings for Fashion Compatibility
Mariya I. Vasileva, Bryan A. Plummer, Krishna Dusad +3
cs.CVarXiv:1803.09196v22018LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving
Hao Sha, Yao Mu, Yuxuan Jiang +7
cs.ROcs.AIcs.CLarXiv:2310.03026v32023Resource Aware Person Re-identification across Multiple Resolutions
Yan Wang, Lequn Wang, Yurong You +6
cs.CVarXiv:1805.08805v32018Residual Local Feature Network for Efficient Super-Resolution
Fangyuan Kong, Mingxi Li, Songwei Liu +5
cs.CVarXiv:2205.07514v12022Image Quality Assessment using Contrastive Learning
Pavan C. Madhusudana, Neil Birkbeck, Yilin Wang +2
cs.CVcs.MMeess.IVarXiv:2110.13266v12021AUTSL: A Large Scale Multi-modal Turkish Sign Language Dataset and Baseline Methods
Ozge Mercanoglu Sincan, Hacer Yalim Keles
cs.CVarXiv:2008.00932v22020Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent Scene Representations
Mehdi S. M. Sajjadi, Henning Meyer, Etienne Pot +10
cs.CVcs.AIcs.GRarXiv:2111.13152v32021Lossy Image Compression with Conditional Diffusion Models
Ruihan Yang, Stephan Mandt
eess.IVcs.CVcs.LGarXiv:2209.06950v82022AIM: Adapting Image Models for Efficient Video Action Recognition
Taojiannan Yang, Yi Zhu, Yusheng Xie +3
cs.CVarXiv:2302.03024v12023Can Tainted Pixels Expose Deepfake Videos?
Juan Hu, Shaojing Fan, Sanjay Saha +2
cs.CRcs.CVarXiv:2608.27492v12026Exact Feature Distribution Matching for Arbitrary Style Transfer and Domain Generalization
Yabin Zhang, Minghan Li, Ruihuang Li +2
cs.CVarXiv:2203.07740v22022Camera-aware Proxies for Unsupervised Person Re-Identification
Menglin Wang, Baisheng Lai, Jianqiang Huang +2
cs.CVarXiv:2012.10674v22020XRAI: Better Attributions Through Regions
Andrei Kapishnikov, Tolga Bolukbasi, Fernanda Viégas +1
cs.CVstat.MLarXiv:1906.02825v22019ArtFlow: Unbiased Image Style Transfer via Reversible Neural Flows
Jie An, Siyu Huang, Yibing Song +3
cs.CVeess.IVarXiv:2103.16877v22021Parser-Free Virtual Try-on via Distilling Appearance Flows
Yuying Ge, Yibing Song, Ruimao Zhang +3
cs.CVarXiv:2103.04559v22021From Hand-Crafted to Deep Learning-based Cancer Radiomics: Challenges and Opportunities
Parnian Afshar, Arash Mohammadi, Konstantinos N. Plataniotis +2
cs.CVarXiv:1808.07954v32018Deep Learning based Computer-Aided Diagnosis Systems for Diabetic Retinopathy: A Survey
Norah Asiri, Muhammad Hussain, Fadwa Al Adel +1
cs.CVarXiv:1811.01238v22018Image-to-image translation for cross-domain disentanglement
Abel Gonzalez-Garcia, Joost van de Weijer, Yoshua Bengio
cs.CVarXiv:1805.09730v32018Deep Variation-structured Reinforcement Learning for Visual Relationship and Attribute Detection
Xiaodan Liang, Lisa Lee, Eric P. Xing
cs.CVcs.AIcs.LGarXiv:1703.03054v12017QuickNAT: A Fully Convolutional Network for Quick and Accurate Segmentation of Neuroanatomy
Abhijit Guha Roy, Sailesh Conjeti, Nassir Navab +1
cs.CVarXiv:1801.04161v22018SCSampler: Sampling Salient Clips from Video for Efficient Action Recognition
Bruno Korbar, Du Tran, Lorenzo Torresani
cs.CVarXiv:1904.04289v22019Dual Adversarial Network: Toward Real-world Noise Removal and Noise Generation
Zongsheng Yue, Qian Zhao, Lei Zhang +1
cs.CVeess.IVarXiv:2007.05946v12020FrankMocap: A Monocular 3D Whole-Body Pose Estimation System via Regression and Integration
Yu Rong, Takaaki Shiratori, Hanbyul Joo
cs.CVarXiv:2108.06428v12021HIT-UAV: A high-altitude infrared thermal dataset for Unmanned Aerial Vehicle-based object detection
Jiashun Suo, Tianyi Wang, Xingzhou Zhang +3
cs.CVcs.AIarXiv:2204.03245v22022Pixel Recursive Super Resolution
Ryan Dahl, Mohammad Norouzi, Jonathon Shlens
cs.CVcs.LGarXiv:1702.00783v22017Scalable 3D Captioning with Pretrained Models
Tiange Luo, Chris Rockwell, Honglak Lee +1
cs.CVarXiv:2306.07279v22023Hyperspectral Image Classification with Markov Random Fields and a Convolutional Neural Network
Xiangyong Cao, Feng Zhou, Lin Xu +3
cs.CVarXiv:1705.00727v22017Underwater Ranker: Learn Which Is Better and How to Be Better
Chunle Guo, Ruiqi Wu, Xin Jin +4
cs.CVarXiv:2208.06857v22022Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
Ling Yang, Zhaochen Yu, Chenlin Meng +3
cs.CVcs.AIcs.LGarXiv:2401.11708v32024Decoupled Contrastive Learning
Chun-Hsiao Yeh, Cheng-Yao Hong, Yen-Chi Hsu +3
cs.LGcs.CVarXiv:2110.06848v32021AdaFrame: Adaptive Frame Selection for Fast Video Recognition
Zuxuan Wu, Caiming Xiong, Chih-Yao Ma +2
cs.CVarXiv:1811.12432v22018Stochastic Scene-Aware Motion Prediction
Mohamed Hassan, Duygu Ceylan, Ruben Villegas +4
cs.CVarXiv:2108.08284v12021Decoupled Multimodal Distilling for Emotion Recognition
Yong Li, Yuanzhi Wang, Zhen Cui
cs.CVarXiv:2303.13802v12023Cascaded Refinement Network for Point Cloud Completion
Xiaogang Wang, Marcelo H Ang, Gim Hee Lee
cs.CVarXiv:2004.03327v32020VisEvent: Reliable Object Tracking via Collaboration of Frame and Event Flows
Xiao Wang, Jianing Li, Lin Zhu +6
cs.CVcs.AIarXiv:2108.05015v42021Learning To Count Everything
Viresh Ranjan, Udbhav Sharma, Thu Nguyen +1
cs.CVarXiv:2104.08391v12021Collaborative Perception in Autonomous Driving: Methods, Datasets and Challenges
Yushan Han, Hui Zhang, Huifang Li +3
cs.CVarXiv:2301.06262v42023The Effects of Super-Resolution on Object Detection Performance in Satellite Imagery
Jacob Shermeyer, Adam Van Etten
cs.CVarXiv:1812.04098v32018CF-YOLO: Context-Aware Feature Refinement for Camouflaged Industrial Micro-Defect Detection
Xinda Yu, Kunxin Zheng, Chunan Yu +4
cs.CVarXiv:2608.28070v12026X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval
Satya Krishna Gorti, Noel Vouitsis, Junwei Ma +4
cs.CVarXiv:2203.15086v12022Visual Token Coding for Video Multimodal Large Language Models
Chenxin Fang, Tao Chen, JunChao You +3
cs.CVarXiv:2608.28008v12026Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding
Ziling Huang, Shin'ichi Satoh
cs.CVarXiv:2608.27871v12026uScenes: A Multimodal RGB and 3D Sonar Dataset for Underwater Robot Perception
Trung Tien Dong, Zhenqi Wu, Aditya Penumarti +4
cs.CVarXiv:2608.27795v12026Land cover mapping at very high resolution with rotation equivariant CNNs: towards small yet accurate models
Diego Marcos, Michele Volpi, Benjamin Kellenberger +1
cs.CVarXiv:1803.06253v12018A Comprehensive Study of Class Incremental Learning Algorithms for Visual Tasks
Eden Belouadah, Adrian Popescu, Ioannis Kanellos
cs.LGcs.CVarXiv:2011.01844v42020Spatial-Temporal Relation Networks for Multi-Object Tracking
Jiarui Xu, Yue Cao, Zheng Zhang +1
cs.CVarXiv:1904.11489v12019CLIP2Scene: Towards Label-efficient 3D Scene Understanding by CLIP
Runnan Chen, Youquan Liu, Lingdong Kong +6
cs.CVarXiv:2301.04926v22023PSGAN: A Generative Adversarial Network for Remote Sensing Image Pan-Sharpening
Qingjie Liu, Huanyu Zhou, Qizhi Xu +2
cs.CVarXiv:1805.03371v42018HoMM: Higher-order Moment Matching for Unsupervised Domain Adaptation
Chao Chen, Zhihang Fu, Zhihong Chen +4
cs.CVarXiv:1912.11976v12019A Dataset And Benchmark Of Underwater Object Detection For Robot Picking
Chongwei Liu, Haojie Li, Shuchang Wang +4
cs.CVarXiv:2106.05681v12021MeMOT: Multi-Object Tracking with Memory
Jiarui Cai, Mingze Xu, Wei Li +4
cs.CVarXiv:2203.16761v12022GenAD: Generative End-to-End Autonomous Driving
Wenzhao Zheng, Ruiqi Song, Xianda Guo +2
cs.CVarXiv:2402.11502v32024ECG arrhythmia classification using a 2-D convolutional neural network
Tae Joon Jun, Hoang Minh Nguyen, Daeyoun Kang +3
cs.CVarXiv:1804.06812v12018BIMCV COVID-19+: a large annotated dataset of RX and CT images from COVID-19 patients
Maria de la Iglesia Vayá, Jose Manuel Saborit, Joaquim Angel Montell +10
eess.IVcs.CVcs.LGarXiv:2006.01174v32020All about Structure: Adapting Structural Information across Domains for Boosting Semantic Segmentation
Wei-Lun Chang, Hui-Po Wang, Wen-Hsiao Peng +1
cs.CVarXiv:1903.12212v12019DisturbLabel: Regularizing CNN on the Loss Layer
Lingxi Xie, Jingdong Wang, Zhen Wei +2
cs.CVarXiv:1605.00055v12016Boundary-Guided Camouflaged Object Detection
Yujia Sun, Shuo Wang, Chenglizhao Chen +1
cs.CVarXiv:2207.00794v12022Michelangelo: Conditional 3D Shape Generation based on Shape-Image-Text Aligned Latent Representation
Zibo Zhao, Wen Liu, Xin Chen +7
cs.CVarXiv:2306.17115v22023