Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

9,661 to 9,720 of 18,811

  1. Diagnosis of Alzheimer's Disease via Multi-modality 3D Convolutional Neural Network

    Yechong Huang, Jiahang Xu, Yuncheng Zhou +3

    cs.CVarXiv:1902.09904v12019
  2. Global Wheat Head Detection (GWHD) dataset: a large and diverse dataset of high resolution RGB labelled images to develop and benchmark wheat head detection methods

    E. David, S. Madec, P. Sadeghi-Tehran +14

    cs.CVcs.LGstat.MLarXiv:2005.02162v22020
  3. CascadePSP: Toward Class-Agnostic and Very High-Resolution Segmentation via Global and Local Refinement

    Ho Kei Cheng, Jihoon Chung, Yu-Wing Tai +1

    cs.CVarXiv:2005.02551v12020
  4. Motion-Appearance Co-Memory Networks for Video Question Answering

    Jiyang Gao, Runzhou Ge, Kan Chen +1

    cs.CVarXiv:1803.10906v12018
  5. NullHop: A Flexible Convolutional Neural Network Accelerator Based on Sparse Representations of Feature Maps

    Alessandro Aimar, Hesham Mostafa, Enrico Calabrese +8

    cs.CVcs.NEarXiv:1706.01406v22017
  6. VisualVoice: Audio-Visual Speech Separation with Cross-Modal Consistency

    Ruohan Gao, Kristen Grauman

    cs.CVcs.SDeess.IVarXiv:2101.03149v22021
  7. SynSeg-Net: Synthetic Segmentation Without Target Modality Ground Truth

    Yuankai Huo, Zhoubing Xu, Hyeonsoo Moon +6

    cs.CVarXiv:1810.06498v22018
  8. Volumetric Instance-Aware Semantic Mapping and 3D Object Discovery

    Margarita Grinvald, Fadri Furrer, Tonci Novkovic +4

    cs.ROcs.CVarXiv:1903.00268v22019
  9. PanNuke Dataset Extension, Insights and Baselines

    Jevgenij Gamper, Navid Alemi Koohbanani, Ksenija Benes +6

    eess.IVcs.CVq-bio.QMarXiv:2003.10778v72020
  10. Image Inpainting with Learnable Bidirectional Attention Maps

    Chaohao Xie, Shaohui Liu, Chao Li +5

    cs.CVarXiv:1909.00968v32019
  11. Neural Rays for Occlusion-aware Image-based Rendering

    Yuan Liu, Sida Peng, Lingjie Liu +5

    cs.CVcs.GRarXiv:2107.13421v22021
  12. NAS-FAS: Static-Dynamic Central Difference Network Search for Face Anti-Spoofing

    Zitong Yu, Jun Wan, Yunxiao Qin +3

    cs.CVarXiv:2011.02062v12020
  13. GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception

    Jingpu Yang, Debin Tang, Yilin Sun +4

    cs.CVarXiv:2608.27971v12026
  14. TResNet: High Performance GPU-Dedicated Architecture

    Tal Ridnik, Hussam Lawen, Asaf Noy +3

    cs.CVcs.LGeess.IVarXiv:2003.13630v32020
  15. Explainable Diabetic Retinopathy Classification Using Vision Foundation Models

    Abhishek Verma, Anila Krishna, Abhishek Gajanan Bankar +1

    cs.CVcs.LGarXiv:2608.28207v12026
  16. Self-produced Guidance for Weakly-supervised Object Localization

    Xiaolin Zhang, Yunchao Wei, Guoliang Kang +2

    cs.CVarXiv:1807.08902v22018
  17. Machine Learning for Precipitation Nowcasting from Radar Images

    Shreya Agrawal, Luke Barrington, Carla Bromberg +3

    cs.CVcs.LGstat.MLarXiv:1912.12132v12019
  18. ZeroCap: Zero-Shot Image-to-Text Generation for Visual-Semantic Arithmetic

    Yoad Tewel, Yoav Shalev, Idan Schwartz +1

    cs.CVcs.AIcs.CLarXiv:2111.14447v22021
  19. GAN-Based Semantic Communication for Image Transmission in IoV

    Ruixing Ren, Shan Chen, Junhui Zhao +1

    cs.CVeess.SYarXiv:2608.27989v12026
  20. Semantic Segmentation for Real Point Cloud Scenes via Bilateral Augmentation and Adaptive Fusion

    Shi Qiu, Saeed Anwar, Nick Barnes

    cs.CVarXiv:2103.07074v22021
  21. LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and Planning

    Sijin Chen, Xin Chen, Chi Zhang +6

    cs.CVarXiv:2311.18651v12023
  22. CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning

    Yajiao Xu, Jin Zhang, Jiangbo Ai +4

    cs.CVarXiv:2608.27893v12026
  23. Quilt-1M: One Million Image-Text Pairs for Histopathology

    Wisdom Oluchi Ikezogwo, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo +5

    cs.CVcs.CLcs.LGarXiv:2306.11207v42023
  24. Illuminating Pedestrians via Simultaneous Detection & Segmentation

    Garrick Brazil, Xi Yin, Xiaoming Liu

    cs.CVarXiv:1706.08564v12017
  25. Visual Question Answering: Datasets, Algorithms, and Future Challenges

    Kushal Kafle, Christopher Kanan

    cs.CVcs.AIcs.CLarXiv:1610.01465v42016
  26. ET-Net: A Generic Edge-aTtention Guidance Network for Medical Image Segmentation

    Zhijie Zhang, Huazhu Fu, Hang Dai +3

    cs.CVarXiv:1907.10936v12019
    Summaries:한국어
  27. Adversarial Diversity and Hard Positive Generation

    Andras Rozsa, Ethan M. Rudd, Terrance E. Boult

    cs.CVarXiv:1605.01775v22016
  28. TransNet V2: An effective deep network architecture for fast shot transition detection

    Tomáš Souček, Jakub Lokoč

    cs.CVarXiv:2008.04838v12020
  29. Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V

    Jianwei Yang, Hao Zhang, Feng Li +3

    cs.CVcs.AIcs.CLarXiv:2310.11441v22023
  30. MemSeg: A semi-supervised method for image surface defect detection using differences and commonalities

    Minghui Yang, Peng Wu, Jing Liu +1

    cs.CVarXiv:2205.00908v12022
  31. X2CT-GAN: Reconstructing CT from Biplanar X-Rays with Generative Adversarial Networks

    Xingde Ying, Heng Guo, Kai Ma +3

    eess.IVcs.CVarXiv:1905.06902v12019
  32. Structured Feature Learning for Pose Estimation

    Xiao Chu, Wanli Ouyang, Hongsheng Li +1

    cs.CVarXiv:1603.09065v12016
  33. Affect Analysis in-the-wild: Valence-Arousal, Expressions, Action Units and a Unified Framework

    Dimitrios Kollias, Stefanos Zafeiriou

    cs.CVcs.AIcs.LGarXiv:2103.15792v12021
  34. Gotta Go Fast When Generating Data with Score-Based Models

    Alexia Jolicoeur-Martineau, Ke Li, Rémi Piché-Taillefer +2

    cs.LGcs.CVmath.OCarXiv:2105.14080v12021
  35. Self-Supervised Video Hashing with Hierarchical Binary Auto-encoder

    Jingkuan Song, Hanwang Zhang, Xiangpeng Li +3

    cs.CVarXiv:1802.02305v12018
  36. Do Datasets Have Politics? Disciplinary Values in Computer Vision Dataset Development

    Morgan Klaus Scheuerman, Emily Denton, Alex Hanna

    cs.CVcs.HCarXiv:2108.04308v22021
  37. A Hybrid Deep Learning Architecture for Privacy-Preserving Mobile Analytics

    Seyed Ali Osia, Ali Shahin Shamsabadi, Sina Sajadmanesh +5

    cs.LGcs.CVarXiv:1703.02952v72017
  38. Kernel Methods on Riemannian Manifolds with Gaussian RBF Kernels

    Sadeep Jayasumana, Richard Hartley, Mathieu Salzmann +2

    cs.CVarXiv:1412.0265v22014
  39. Learning by Aligning: Visible-Infrared Person Re-identification using Cross-Modal Correspondences

    Hyunjong Park, Sanghoon Lee, Junghyup Lee +1

    cs.CVarXiv:2108.07422v12021
  40. FixBi: Bridging Domain Spaces for Unsupervised Domain Adaptation

    Jaemin Na, Heechul Jung, Hyung Jin Chang +1

    cs.CVarXiv:2011.09230v22020
  41. Two-Stream Network for Sign Language Recognition and Translation

    Yutong Chen, Ronglai Zuo, Fangyun Wei +3

    cs.CVarXiv:2211.01367v22022
  42. See Better Before Looking Closer: Weakly Supervised Data Augmentation Network for Fine-Grained Visual Classification

    Tao Hu, Honggang Qi, Qingming Huang +1

    cs.CVarXiv:1901.09891v22019
  43. FourLLIE: Boosting Low-Light Image Enhancement by Fourier Frequency Information

    Chenxi Wang, Hongjun Wu, Zhi Jin

    cs.CVeess.IVarXiv:2308.03033v12023
  44. Rethinking on Multi-Stage Networks for Human Pose Estimation

    Wenbo Li, Zhicheng Wang, Binyi Yin +7

    cs.CVarXiv:1901.00148v42019
  45. RIO: 3D Object Instance Re-Localization in Changing Indoor Environments

    Johanna Wald, Armen Avetisyan, Nassir Navab +2

    cs.CVarXiv:1908.06109v12019
  46. ACRONYM: A Large-Scale Grasp Dataset Based on Simulation

    Clemens Eppner, Arsalan Mousavian, Dieter Fox

    cs.ROcs.CVarXiv:2011.09584v12020
  47. NumBench: Diagnosing Counting Failures in Text-to-Image Models

    Sandeep Wadhwa, Mayank Vatsa, Richa Singh +2

    cs.CVcs.DBarXiv:2608.28206v12026
  48. Crowd counting via scale-adaptive convolutional neural network

    Lu Zhang, Miaojing Shi, Qiaobo Chen

    cs.CVarXiv:1711.04433v42017
  49. The Sound of Motions

    Hang Zhao, Chuang Gan, Wei-Chiu Ma +1

    cs.CVcs.SDeess.ASarXiv:1904.05979v12019
  50. Fast End-to-End Trainable Guided Filter

    Huikai Wu, Shuai Zheng, Junge Zhang +1

    cs.CVarXiv:1803.05619v22018
  51. Universal Instance Perception as Object Discovery and Retrieval

    Bin Yan, Yi Jiang, Jiannan Wu +4

    cs.CVarXiv:2303.06674v22023
  52. Self-Chained Image-Language Model for Video Localization and Question Answering

    Shoubin Yu, Jaemin Cho, Prateek Yadav +1

    cs.CVcs.AIcs.CLarXiv:2305.06988v22023
  53. 3D Reconstruction with Spatial Memory

    Hengyi Wang, Lourdes Agapito

    cs.CVarXiv:2408.16061v12024
  54. End-to-End Human Object Interaction Detection with HOI Transformer

    Cheng Zou, Bohan Wang, Yue Hu +8

    cs.CVarXiv:2103.04503v12021
  55. Pinwheel-shaped Convolution and Scale-based Dynamic Loss for Infrared Small Target Detection

    Jiangnan Yang, Shuangli Liu, Jingjun Wu +3

    cs.CVarXiv:2412.16986v12024
  56. DensityKV: Density-Guided KV Cache Compression for Long Video Generation

    Wenqu Zhao, Xuemin Chi, Xin Zhang +6

    cs.CVarXiv:2608.27922v12026
  57. Equivariant Multi-Modality Image Fusion

    Zixiang Zhao, Haowen Bai, Jiangshe Zhang +6

    cs.CVarXiv:2305.11443v22023
  58. Towards Visually Explaining Variational Autoencoders

    Wenqian Liu, Runze Li, Meng Zheng +5

    cs.CVcs.LGarXiv:1911.07389v72019
  59. Federated Learning for Medical Applications: A Taxonomy, Current Trends, Challenges, and Future Research Directions

    Ashish Rauniyar, Desta Haileselassie Hagos, Debesh Jha +4

    cs.LGcs.CRcs.CVarXiv:2208.03392v52022
  60. Efficient and Accurate Approximations of Nonlinear Convolutional Networks

    Xiangyu Zhang, Jianhua Zou, Xiang Ming +2

    cs.CVarXiv:1411.4229v12014