Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
9,661 to 9,720 of 18,811
Diagnosis of Alzheimer's Disease via Multi-modality 3D Convolutional Neural Network
Yechong Huang, Jiahang Xu, Yuncheng Zhou +3
cs.CVarXiv:1902.09904v12019Global Wheat Head Detection (GWHD) dataset: a large and diverse dataset of high resolution RGB labelled images to develop and benchmark wheat head detection methods
E. David, S. Madec, P. Sadeghi-Tehran +14
cs.CVcs.LGstat.MLarXiv:2005.02162v22020CascadePSP: Toward Class-Agnostic and Very High-Resolution Segmentation via Global and Local Refinement
Ho Kei Cheng, Jihoon Chung, Yu-Wing Tai +1
cs.CVarXiv:2005.02551v12020Motion-Appearance Co-Memory Networks for Video Question Answering
Jiyang Gao, Runzhou Ge, Kan Chen +1
cs.CVarXiv:1803.10906v12018NullHop: A Flexible Convolutional Neural Network Accelerator Based on Sparse Representations of Feature Maps
Alessandro Aimar, Hesham Mostafa, Enrico Calabrese +8
cs.CVcs.NEarXiv:1706.01406v22017VisualVoice: Audio-Visual Speech Separation with Cross-Modal Consistency
Ruohan Gao, Kristen Grauman
cs.CVcs.SDeess.IVarXiv:2101.03149v22021SynSeg-Net: Synthetic Segmentation Without Target Modality Ground Truth
Yuankai Huo, Zhoubing Xu, Hyeonsoo Moon +6
cs.CVarXiv:1810.06498v22018Volumetric Instance-Aware Semantic Mapping and 3D Object Discovery
Margarita Grinvald, Fadri Furrer, Tonci Novkovic +4
cs.ROcs.CVarXiv:1903.00268v22019PanNuke Dataset Extension, Insights and Baselines
Jevgenij Gamper, Navid Alemi Koohbanani, Ksenija Benes +6
eess.IVcs.CVq-bio.QMarXiv:2003.10778v72020Image Inpainting with Learnable Bidirectional Attention Maps
Chaohao Xie, Shaohui Liu, Chao Li +5
cs.CVarXiv:1909.00968v32019Neural Rays for Occlusion-aware Image-based Rendering
Yuan Liu, Sida Peng, Lingjie Liu +5
cs.CVcs.GRarXiv:2107.13421v22021NAS-FAS: Static-Dynamic Central Difference Network Search for Face Anti-Spoofing
Zitong Yu, Jun Wan, Yunxiao Qin +3
cs.CVarXiv:2011.02062v12020GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception
Jingpu Yang, Debin Tang, Yilin Sun +4
cs.CVarXiv:2608.27971v12026TResNet: High Performance GPU-Dedicated Architecture
Tal Ridnik, Hussam Lawen, Asaf Noy +3
cs.CVcs.LGeess.IVarXiv:2003.13630v32020Explainable Diabetic Retinopathy Classification Using Vision Foundation Models
Abhishek Verma, Anila Krishna, Abhishek Gajanan Bankar +1
cs.CVcs.LGarXiv:2608.28207v12026Self-produced Guidance for Weakly-supervised Object Localization
Xiaolin Zhang, Yunchao Wei, Guoliang Kang +2
cs.CVarXiv:1807.08902v22018Machine Learning for Precipitation Nowcasting from Radar Images
Shreya Agrawal, Luke Barrington, Carla Bromberg +3
cs.CVcs.LGstat.MLarXiv:1912.12132v12019ZeroCap: Zero-Shot Image-to-Text Generation for Visual-Semantic Arithmetic
Yoad Tewel, Yoav Shalev, Idan Schwartz +1
cs.CVcs.AIcs.CLarXiv:2111.14447v22021GAN-Based Semantic Communication for Image Transmission in IoV
Ruixing Ren, Shan Chen, Junhui Zhao +1
cs.CVeess.SYarXiv:2608.27989v12026Semantic Segmentation for Real Point Cloud Scenes via Bilateral Augmentation and Adaptive Fusion
Shi Qiu, Saeed Anwar, Nick Barnes
cs.CVarXiv:2103.07074v22021LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and Planning
Sijin Chen, Xin Chen, Chi Zhang +6
cs.CVarXiv:2311.18651v12023CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning
Yajiao Xu, Jin Zhang, Jiangbo Ai +4
cs.CVarXiv:2608.27893v12026Quilt-1M: One Million Image-Text Pairs for Histopathology
Wisdom Oluchi Ikezogwo, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo +5
cs.CVcs.CLcs.LGarXiv:2306.11207v42023Illuminating Pedestrians via Simultaneous Detection & Segmentation
Garrick Brazil, Xi Yin, Xiaoming Liu
cs.CVarXiv:1706.08564v12017Visual Question Answering: Datasets, Algorithms, and Future Challenges
Kushal Kafle, Christopher Kanan
cs.CVcs.AIcs.CLarXiv:1610.01465v42016ET-Net: A Generic Edge-aTtention Guidance Network for Medical Image Segmentation
Zhijie Zhang, Huazhu Fu, Hang Dai +3
cs.CVarXiv:1907.10936v12019Summaries:한국어Adversarial Diversity and Hard Positive Generation
Andras Rozsa, Ethan M. Rudd, Terrance E. Boult
cs.CVarXiv:1605.01775v22016TransNet V2: An effective deep network architecture for fast shot transition detection
Tomáš Souček, Jakub Lokoč
cs.CVarXiv:2008.04838v12020Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V
Jianwei Yang, Hao Zhang, Feng Li +3
cs.CVcs.AIcs.CLarXiv:2310.11441v22023MemSeg: A semi-supervised method for image surface defect detection using differences and commonalities
Minghui Yang, Peng Wu, Jing Liu +1
cs.CVarXiv:2205.00908v12022X2CT-GAN: Reconstructing CT from Biplanar X-Rays with Generative Adversarial Networks
Xingde Ying, Heng Guo, Kai Ma +3
eess.IVcs.CVarXiv:1905.06902v12019Structured Feature Learning for Pose Estimation
Xiao Chu, Wanli Ouyang, Hongsheng Li +1
cs.CVarXiv:1603.09065v12016Affect Analysis in-the-wild: Valence-Arousal, Expressions, Action Units and a Unified Framework
Dimitrios Kollias, Stefanos Zafeiriou
cs.CVcs.AIcs.LGarXiv:2103.15792v12021Gotta Go Fast When Generating Data with Score-Based Models
Alexia Jolicoeur-Martineau, Ke Li, Rémi Piché-Taillefer +2
cs.LGcs.CVmath.OCarXiv:2105.14080v12021Self-Supervised Video Hashing with Hierarchical Binary Auto-encoder
Jingkuan Song, Hanwang Zhang, Xiangpeng Li +3
cs.CVarXiv:1802.02305v12018Do Datasets Have Politics? Disciplinary Values in Computer Vision Dataset Development
Morgan Klaus Scheuerman, Emily Denton, Alex Hanna
cs.CVcs.HCarXiv:2108.04308v22021A Hybrid Deep Learning Architecture for Privacy-Preserving Mobile Analytics
Seyed Ali Osia, Ali Shahin Shamsabadi, Sina Sajadmanesh +5
cs.LGcs.CVarXiv:1703.02952v72017Kernel Methods on Riemannian Manifolds with Gaussian RBF Kernels
Sadeep Jayasumana, Richard Hartley, Mathieu Salzmann +2
cs.CVarXiv:1412.0265v22014Learning by Aligning: Visible-Infrared Person Re-identification using Cross-Modal Correspondences
Hyunjong Park, Sanghoon Lee, Junghyup Lee +1
cs.CVarXiv:2108.07422v12021FixBi: Bridging Domain Spaces for Unsupervised Domain Adaptation
Jaemin Na, Heechul Jung, Hyung Jin Chang +1
cs.CVarXiv:2011.09230v22020Two-Stream Network for Sign Language Recognition and Translation
Yutong Chen, Ronglai Zuo, Fangyun Wei +3
cs.CVarXiv:2211.01367v22022See Better Before Looking Closer: Weakly Supervised Data Augmentation Network for Fine-Grained Visual Classification
Tao Hu, Honggang Qi, Qingming Huang +1
cs.CVarXiv:1901.09891v22019FourLLIE: Boosting Low-Light Image Enhancement by Fourier Frequency Information
Chenxi Wang, Hongjun Wu, Zhi Jin
cs.CVeess.IVarXiv:2308.03033v12023Rethinking on Multi-Stage Networks for Human Pose Estimation
Wenbo Li, Zhicheng Wang, Binyi Yin +7
cs.CVarXiv:1901.00148v42019RIO: 3D Object Instance Re-Localization in Changing Indoor Environments
Johanna Wald, Armen Avetisyan, Nassir Navab +2
cs.CVarXiv:1908.06109v12019ACRONYM: A Large-Scale Grasp Dataset Based on Simulation
Clemens Eppner, Arsalan Mousavian, Dieter Fox
cs.ROcs.CVarXiv:2011.09584v12020NumBench: Diagnosing Counting Failures in Text-to-Image Models
Sandeep Wadhwa, Mayank Vatsa, Richa Singh +2
cs.CVcs.DBarXiv:2608.28206v12026Crowd counting via scale-adaptive convolutional neural network
Lu Zhang, Miaojing Shi, Qiaobo Chen
cs.CVarXiv:1711.04433v42017The Sound of Motions
Hang Zhao, Chuang Gan, Wei-Chiu Ma +1
cs.CVcs.SDeess.ASarXiv:1904.05979v12019Fast End-to-End Trainable Guided Filter
Huikai Wu, Shuai Zheng, Junge Zhang +1
cs.CVarXiv:1803.05619v22018Universal Instance Perception as Object Discovery and Retrieval
Bin Yan, Yi Jiang, Jiannan Wu +4
cs.CVarXiv:2303.06674v22023Self-Chained Image-Language Model for Video Localization and Question Answering
Shoubin Yu, Jaemin Cho, Prateek Yadav +1
cs.CVcs.AIcs.CLarXiv:2305.06988v220233D Reconstruction with Spatial Memory
Hengyi Wang, Lourdes Agapito
cs.CVarXiv:2408.16061v12024End-to-End Human Object Interaction Detection with HOI Transformer
Cheng Zou, Bohan Wang, Yue Hu +8
cs.CVarXiv:2103.04503v12021Pinwheel-shaped Convolution and Scale-based Dynamic Loss for Infrared Small Target Detection
Jiangnan Yang, Shuangli Liu, Jingjun Wu +3
cs.CVarXiv:2412.16986v12024DensityKV: Density-Guided KV Cache Compression for Long Video Generation
Wenqu Zhao, Xuemin Chi, Xin Zhang +6
cs.CVarXiv:2608.27922v12026Equivariant Multi-Modality Image Fusion
Zixiang Zhao, Haowen Bai, Jiangshe Zhang +6
cs.CVarXiv:2305.11443v22023Towards Visually Explaining Variational Autoencoders
Wenqian Liu, Runze Li, Meng Zheng +5
cs.CVcs.LGarXiv:1911.07389v72019Federated Learning for Medical Applications: A Taxonomy, Current Trends, Challenges, and Future Research Directions
Ashish Rauniyar, Desta Haileselassie Hagos, Debesh Jha +4
cs.LGcs.CRcs.CVarXiv:2208.03392v52022Efficient and Accurate Approximations of Nonlinear Convolutional Networks
Xiangyu Zhang, Jianhua Zou, Xiang Ming +2
cs.CVarXiv:1411.4229v12014