Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

9,481 to 9,540 of 18,807

  1. RedNet: Residual Encoder-Decoder Network for indoor RGB-D Semantic Segmentation

    Jindong Jiang, Lunan Zheng, Fei Luo +1

    cs.CVarXiv:1806.01054v22018
  2. Pose-guided Visible Part Matching for Occluded Person ReID

    Shang Gao, Jingya Wang, Huchuan Lu +1

    cs.CVarXiv:2004.00230v12020
  3. Learning Type-Aware Embeddings for Fashion Compatibility

    Mariya I. Vasileva, Bryan A. Plummer, Krishna Dusad +3

    cs.CVarXiv:1803.09196v22018
  4. LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving

    Hao Sha, Yao Mu, Yuxuan Jiang +7

    cs.ROcs.AIcs.CLarXiv:2310.03026v32023
  5. Resource Aware Person Re-identification across Multiple Resolutions

    Yan Wang, Lequn Wang, Yurong You +6

    cs.CVarXiv:1805.08805v32018
  6. Residual Local Feature Network for Efficient Super-Resolution

    Fangyuan Kong, Mingxi Li, Songwei Liu +5

    cs.CVarXiv:2205.07514v12022
  7. Image Quality Assessment using Contrastive Learning

    Pavan C. Madhusudana, Neil Birkbeck, Yilin Wang +2

    cs.CVcs.MMeess.IVarXiv:2110.13266v12021
  8. AUTSL: A Large Scale Multi-modal Turkish Sign Language Dataset and Baseline Methods

    Ozge Mercanoglu Sincan, Hacer Yalim Keles

    cs.CVarXiv:2008.00932v22020
  9. Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent Scene Representations

    Mehdi S. M. Sajjadi, Henning Meyer, Etienne Pot +10

    cs.CVcs.AIcs.GRarXiv:2111.13152v32021
  10. Lossy Image Compression with Conditional Diffusion Models

    Ruihan Yang, Stephan Mandt

    eess.IVcs.CVcs.LGarXiv:2209.06950v82022
  11. AIM: Adapting Image Models for Efficient Video Action Recognition

    Taojiannan Yang, Yi Zhu, Yusheng Xie +3

    cs.CVarXiv:2302.03024v12023
  12. Can Tainted Pixels Expose Deepfake Videos?

    Juan Hu, Shaojing Fan, Sanjay Saha +2

    cs.CRcs.CVarXiv:2608.27492v12026
  13. Exact Feature Distribution Matching for Arbitrary Style Transfer and Domain Generalization

    Yabin Zhang, Minghan Li, Ruihuang Li +2

    cs.CVarXiv:2203.07740v22022
  14. Camera-aware Proxies for Unsupervised Person Re-Identification

    Menglin Wang, Baisheng Lai, Jianqiang Huang +2

    cs.CVarXiv:2012.10674v22020
  15. XRAI: Better Attributions Through Regions

    Andrei Kapishnikov, Tolga Bolukbasi, Fernanda Viégas +1

    cs.CVstat.MLarXiv:1906.02825v22019
  16. ArtFlow: Unbiased Image Style Transfer via Reversible Neural Flows

    Jie An, Siyu Huang, Yibing Song +3

    cs.CVeess.IVarXiv:2103.16877v22021
  17. Parser-Free Virtual Try-on via Distilling Appearance Flows

    Yuying Ge, Yibing Song, Ruimao Zhang +3

    cs.CVarXiv:2103.04559v22021
  18. From Hand-Crafted to Deep Learning-based Cancer Radiomics: Challenges and Opportunities

    Parnian Afshar, Arash Mohammadi, Konstantinos N. Plataniotis +2

    cs.CVarXiv:1808.07954v32018
  19. Deep Learning based Computer-Aided Diagnosis Systems for Diabetic Retinopathy: A Survey

    Norah Asiri, Muhammad Hussain, Fadwa Al Adel +1

    cs.CVarXiv:1811.01238v22018
  20. Image-to-image translation for cross-domain disentanglement

    Abel Gonzalez-Garcia, Joost van de Weijer, Yoshua Bengio

    cs.CVarXiv:1805.09730v32018
  21. Deep Variation-structured Reinforcement Learning for Visual Relationship and Attribute Detection

    Xiaodan Liang, Lisa Lee, Eric P. Xing

    cs.CVcs.AIcs.LGarXiv:1703.03054v12017
  22. QuickNAT: A Fully Convolutional Network for Quick and Accurate Segmentation of Neuroanatomy

    Abhijit Guha Roy, Sailesh Conjeti, Nassir Navab +1

    cs.CVarXiv:1801.04161v22018
  23. SCSampler: Sampling Salient Clips from Video for Efficient Action Recognition

    Bruno Korbar, Du Tran, Lorenzo Torresani

    cs.CVarXiv:1904.04289v22019
  24. Dual Adversarial Network: Toward Real-world Noise Removal and Noise Generation

    Zongsheng Yue, Qian Zhao, Lei Zhang +1

    cs.CVeess.IVarXiv:2007.05946v12020
  25. FrankMocap: A Monocular 3D Whole-Body Pose Estimation System via Regression and Integration

    Yu Rong, Takaaki Shiratori, Hanbyul Joo

    cs.CVarXiv:2108.06428v12021
  26. HIT-UAV: A high-altitude infrared thermal dataset for Unmanned Aerial Vehicle-based object detection

    Jiashun Suo, Tianyi Wang, Xingzhou Zhang +3

    cs.CVcs.AIarXiv:2204.03245v22022
  27. Pixel Recursive Super Resolution

    Ryan Dahl, Mohammad Norouzi, Jonathon Shlens

    cs.CVcs.LGarXiv:1702.00783v22017
  28. Scalable 3D Captioning with Pretrained Models

    Tiange Luo, Chris Rockwell, Honglak Lee +1

    cs.CVarXiv:2306.07279v22023
  29. Hyperspectral Image Classification with Markov Random Fields and a Convolutional Neural Network

    Xiangyong Cao, Feng Zhou, Lin Xu +3

    cs.CVarXiv:1705.00727v22017
  30. Underwater Ranker: Learn Which Is Better and How to Be Better

    Chunle Guo, Ruiqi Wu, Xin Jin +4

    cs.CVarXiv:2208.06857v22022
  31. Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

    Ling Yang, Zhaochen Yu, Chenlin Meng +3

    cs.CVcs.AIcs.LGarXiv:2401.11708v32024
  32. Decoupled Contrastive Learning

    Chun-Hsiao Yeh, Cheng-Yao Hong, Yen-Chi Hsu +3

    cs.LGcs.CVarXiv:2110.06848v32021
  33. AdaFrame: Adaptive Frame Selection for Fast Video Recognition

    Zuxuan Wu, Caiming Xiong, Chih-Yao Ma +2

    cs.CVarXiv:1811.12432v22018
  34. Stochastic Scene-Aware Motion Prediction

    Mohamed Hassan, Duygu Ceylan, Ruben Villegas +4

    cs.CVarXiv:2108.08284v12021
  35. Decoupled Multimodal Distilling for Emotion Recognition

    Yong Li, Yuanzhi Wang, Zhen Cui

    cs.CVarXiv:2303.13802v12023
  36. Cascaded Refinement Network for Point Cloud Completion

    Xiaogang Wang, Marcelo H Ang, Gim Hee Lee

    cs.CVarXiv:2004.03327v32020
  37. VisEvent: Reliable Object Tracking via Collaboration of Frame and Event Flows

    Xiao Wang, Jianing Li, Lin Zhu +6

    cs.CVcs.AIarXiv:2108.05015v42021
  38. Learning To Count Everything

    Viresh Ranjan, Udbhav Sharma, Thu Nguyen +1

    cs.CVarXiv:2104.08391v12021
  39. Collaborative Perception in Autonomous Driving: Methods, Datasets and Challenges

    Yushan Han, Hui Zhang, Huifang Li +3

    cs.CVarXiv:2301.06262v42023
  40. The Effects of Super-Resolution on Object Detection Performance in Satellite Imagery

    Jacob Shermeyer, Adam Van Etten

    cs.CVarXiv:1812.04098v32018
  41. CF-YOLO: Context-Aware Feature Refinement for Camouflaged Industrial Micro-Defect Detection

    Xinda Yu, Kunxin Zheng, Chunan Yu +4

    cs.CVarXiv:2608.28070v12026
  42. X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval

    Satya Krishna Gorti, Noel Vouitsis, Junwei Ma +4

    cs.CVarXiv:2203.15086v12022
  43. Visual Token Coding for Video Multimodal Large Language Models

    Chenxin Fang, Tao Chen, JunChao You +3

    cs.CVarXiv:2608.28008v12026
  44. Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

    Ziling Huang, Shin'ichi Satoh

    cs.CVarXiv:2608.27871v12026
  45. uScenes: A Multimodal RGB and 3D Sonar Dataset for Underwater Robot Perception

    Trung Tien Dong, Zhenqi Wu, Aditya Penumarti +4

    cs.CVarXiv:2608.27795v12026
  46. Land cover mapping at very high resolution with rotation equivariant CNNs: towards small yet accurate models

    Diego Marcos, Michele Volpi, Benjamin Kellenberger +1

    cs.CVarXiv:1803.06253v12018
  47. A Comprehensive Study of Class Incremental Learning Algorithms for Visual Tasks

    Eden Belouadah, Adrian Popescu, Ioannis Kanellos

    cs.LGcs.CVarXiv:2011.01844v42020
  48. Spatial-Temporal Relation Networks for Multi-Object Tracking

    Jiarui Xu, Yue Cao, Zheng Zhang +1

    cs.CVarXiv:1904.11489v12019
  49. CLIP2Scene: Towards Label-efficient 3D Scene Understanding by CLIP

    Runnan Chen, Youquan Liu, Lingdong Kong +6

    cs.CVarXiv:2301.04926v22023
  50. PSGAN: A Generative Adversarial Network for Remote Sensing Image Pan-Sharpening

    Qingjie Liu, Huanyu Zhou, Qizhi Xu +2

    cs.CVarXiv:1805.03371v42018
  51. HoMM: Higher-order Moment Matching for Unsupervised Domain Adaptation

    Chao Chen, Zhihang Fu, Zhihong Chen +4

    cs.CVarXiv:1912.11976v12019
  52. A Dataset And Benchmark Of Underwater Object Detection For Robot Picking

    Chongwei Liu, Haojie Li, Shuchang Wang +4

    cs.CVarXiv:2106.05681v12021
  53. MeMOT: Multi-Object Tracking with Memory

    Jiarui Cai, Mingze Xu, Wei Li +4

    cs.CVarXiv:2203.16761v12022
  54. GenAD: Generative End-to-End Autonomous Driving

    Wenzhao Zheng, Ruiqi Song, Xianda Guo +2

    cs.CVarXiv:2402.11502v32024
  55. ECG arrhythmia classification using a 2-D convolutional neural network

    Tae Joon Jun, Hoang Minh Nguyen, Daeyoun Kang +3

    cs.CVarXiv:1804.06812v12018
  56. BIMCV COVID-19+: a large annotated dataset of RX and CT images from COVID-19 patients

    Maria de la Iglesia Vayá, Jose Manuel Saborit, Joaquim Angel Montell +10

    eess.IVcs.CVcs.LGarXiv:2006.01174v32020
  57. All about Structure: Adapting Structural Information across Domains for Boosting Semantic Segmentation

    Wei-Lun Chang, Hui-Po Wang, Wen-Hsiao Peng +1

    cs.CVarXiv:1903.12212v12019
  58. DisturbLabel: Regularizing CNN on the Loss Layer

    Lingxi Xie, Jingdong Wang, Zhen Wei +2

    cs.CVarXiv:1605.00055v12016
  59. Boundary-Guided Camouflaged Object Detection

    Yujia Sun, Shuo Wang, Chenglizhao Chen +1

    cs.CVarXiv:2207.00794v12022
  60. Michelangelo: Conditional 3D Shape Generation based on Shape-Image-Text Aligned Latent Representation

    Zibo Zhao, Wen Liu, Xin Chen +7

    cs.CVarXiv:2306.17115v22023