Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
9,241 to 9,300 of 18,815
Explainable Deep One-Class Classification
Philipp Liznerski, Lukas Ruff, Robert A. Vandermeulen +3
cs.CVcs.LGstat.MLarXiv:2007.01760v32020Implicit Neural Representation for Cooperative Low-light Image Enhancement
Shuzhou Yang, Moxuan Ding, Yanmin Wu +2
cs.CVarXiv:2303.11722v32023Spatially Supervised Recurrent Convolutional Neural Networks for Visual Object Tracking
Guanghan Ning, Zhi Zhang, Chen Huang +3
cs.CVarXiv:1607.05781v12016Trunk-Branch Ensemble Convolutional Neural Networks for Video-based Face Recognition
Changxing Ding, Dacheng Tao
cs.CVarXiv:1607.05427v22016Spectral Unmixing via Data-guided Sparsity
Feiyun Zhu, Ying Wang, Bin Fan +3
cs.CVarXiv:1403.3155v42014GNN3DMOT: Graph Neural Network for 3D Multi-Object Tracking with Multi-Feature Learning
Xinshuo Weng, Yongxin Wang, Yunze Man +1
cs.CVcs.LGeess.IVarXiv:2006.07327v12020UniVTG: Towards Unified Video-Language Temporal Grounding
Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen +5
cs.CVarXiv:2307.16715v22023Seeing Beyond the Brain: Conditional Diffusion Model with Sparse Masked Modeling for Vision Decoding
Zijiao Chen, Jiaxin Qing, Tiange Xiang +2
cs.CVarXiv:2211.06956v32022Learning to Synthesize a 4D RGBD Light Field from a Single Image
Pratul P. Srinivasan, Tongzhou Wang, Ashwin Sreelal +2
cs.CVcs.GRarXiv:1708.03292v12017ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
Dong An, Hanqing Wang, Wenguan Wang +4
cs.CVcs.CLcs.ROarXiv:2304.03047v32023FILM: Frame Interpolation for Large Motion
Fitsum Reda, Janne Kontkanen, Eric Tabellion +3
cs.CVarXiv:2202.04901v42022A Unified Survey on Anomaly, Novelty, Open-Set, and Out-of-Distribution Detection: Solutions and Future Challenges
Mohammadreza Salehi, Hossein Mirzaei, Dan Hendrycks +3
cs.CVcs.LGarXiv:2110.14051v52021Zero-Shot Composed Image Retrieval with Textual Inversion
Alberto Baldrati, Lorenzo Agnolucci, Marco Bertini +1
cs.CVcs.CLcs.IRarXiv:2303.15247v22023Face Behavior a la carte: Expressions, Affect and Action Units in a Single Network
Dimitrios Kollias, Viktoriia Sharmanska, Stefanos Zafeiriou
cs.CVcs.HCcs.LGarXiv:1910.11111v32019EDiffSR: An Efficient Diffusion Probabilistic Model for Remote Sensing Image Super-Resolution
Yi Xiao, Qiangqiang Yuan, Kui Jiang +3
eess.IVcs.CVarXiv:2310.19288v12023Deep Learning Methods for Vessel Trajectory Prediction based on Recurrent Neural Networks
Samuele Capobianco, Leonardo M. Millefiori, Nicola Forti +2
cs.CVarXiv:2101.02486v22021Guided Open Vocabulary Image Captioning with Constrained Beam Search
Peter Anderson, Basura Fernando, Mark Johnson +1
cs.CVarXiv:1612.00576v22016SigNet: Convolutional Siamese Network for Writer Independent Offline Signature Verification
Sounak Dey, Anjan Dutta, J. Ignacio Toledo +3
cs.CVarXiv:1707.02131v22017All in One: Exploring Unified Video-Language Pre-training
Alex Jinpeng Wang, Yixiao Ge, Rui Yan +7
cs.CVarXiv:2203.07303v12022OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
Yutao Hu, Tianbin Li, Quanfeng Lu +4
eess.IVcs.CVarXiv:2402.09181v22024Self-Adaptive Training: beyond Empirical Risk Minimization
Lang Huang, Chao Zhang, Hongyang Zhang
cs.LGcs.CVstat.MLarXiv:2002.10319v22020Fourier Contour Embedding for Arbitrary-Shaped Text Detection
Yiqin Zhu, Jianyong Chen, Lingyu Liang +3
cs.CVarXiv:2104.10442v22021Training Binary Neural Networks with Real-to-Binary Convolutions
Brais Martinez, Jing Yang, Adrian Bulat +1
cs.CVarXiv:2003.11535v12020AO2-DETR: Arbitrary-Oriented Object Detection Transformer
Linhui Dai, Hong Liu, Hao Tang +2
cs.CVarXiv:2205.12785v12022Language-Conditioned Imitation Learning for Robot Manipulation Tasks
Simon Stepputtis, Joseph Campbell, Mariano Phielipp +3
cs.ROcs.CLcs.CVarXiv:2010.12083v12020Visualization of Very Large High-Dimensional Data Sets as Minimum Spanning Trees
Daniel Probst, Jean-Louis Reymond
cs.HCcs.CVcs.DSarXiv:1908.10410v32019SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction
Xinyuan Chen, Yaohui Wang, Lingjun Zhang +7
cs.CVarXiv:2310.20700v22023Patch-based Output Space Adversarial Learning for Joint Optic Disc and Cup Segmentation
Shujun Wang, Lequan Yu, Xin Yang +2
cs.CVarXiv:1902.07519v12019Patch2Pix: Epipolar-Guided Pixel-Level Correspondences
Qunjie Zhou, Torsten Sattler, Laura Leal-Taixe
cs.CVarXiv:2012.01909v32020PolarFormer: Multi-camera 3D Object Detection with Polar Transformer
Yanqin Jiang, Li Zhang, Zhenwei Miao +4
cs.CVcs.AIarXiv:2206.15398v62022Classification of Alzheimer's Disease using fMRI Data and Deep Learning Convolutional Neural Networks
Saman Sarraf, Ghassem Tofighi
cs.CVarXiv:1603.08631v12016Video Anomaly Detection and Localization via Gaussian Mixture Fully Convolutional Variational Autoencoder
Yaxiang Fan, Gongjian Wen, Deren Li +2
cs.CVarXiv:1805.11223v12018Deep-Person: Learning Discriminative Deep Features for Person Re-Identification
Xiang Bai, Mingkun Yang, Tengteng Huang +3
cs.CVarXiv:1711.10658v42017Leaf Classification Using Shape, Color, and Texture Features
Abdul Kadir, Lukito Edi Nugroho, Adhi Susanto +1
cs.CVcs.CYarXiv:1401.4447v12013Audiovisual SlowFast Networks for Video Recognition
Fanyi Xiao, Yong Jae Lee, Kristen Grauman +2
cs.CVarXiv:2001.08740v22020Detailed Human Avatars from Monocular Video
Thiemo Alldieck, Marcus Magnor, Weipeng Xu +2
cs.CVarXiv:1808.01338v12018Old is Gold: Redefining the Adversarially Learned One-Class Classifier Training Paradigm
Muhammad Zaigham Zaheer, Jin-ha Lee, Marcella Astrid +1
cs.CVarXiv:2004.07657v42020Structure Inference Machines: Recurrent Neural Networks for Analyzing Relations in Group Activity Recognition
Zhiwei Deng, Arash Vahdat, Hexiang Hu +1
cs.CVarXiv:1511.04196v22015One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale
Fan Bao, Shen Nie, Kaiwen Xue +7
cs.LGcs.CVarXiv:2303.06555v22023Exploiting temporal context for 3D human pose estimation in the wild
Anurag Arnab, Carl Doersch, Andrew Zisserman
cs.CVarXiv:1905.04266v12019Learning Semantic Segmentation of Large-Scale Point Clouds with Random Sampling
Qingyong Hu, Bo Yang, Linhai Xie +5
cs.CVcs.AIcs.ROarXiv:2107.02389v12021TransCrowd: weakly-supervised crowd counting with transformers
Dingkang Liang, Xiwu Chen, Wei Xu +2
cs.CVarXiv:2104.09116v32021Associative Domain Adaptation
Philip Haeusser, Thomas Frerix, Alexander Mordvintsev +1
cs.CVarXiv:1708.00938v12017Depth Completion from Sparse LiDAR Data with Depth-Normal Constraints
Yan Xu, Xinge Zhu, Jianping Shi +3
cs.CVarXiv:1910.06727v12019Detect-and-Track: Efficient Pose Estimation in Videos
Rohit Girdhar, Georgia Gkioxari, Lorenzo Torresani +2
cs.CVarXiv:1712.09184v22017Look More Than Once: An Accurate Detector for Text of Arbitrary Shapes
Chengquan Zhang, Borong Liang, Zuming Huang +4
cs.CVarXiv:1904.06535v12019Transforming medical imaging with Transformers? A comparative review of key properties, current progresses, and future perspectives
Jun Li, Junyu Chen, Yucheng Tang +3
cs.CVarXiv:2206.01136v32022Toward Transformer-Based Object Detection
Josh Beal, Eric Kim, Eric Tzeng +3
cs.CVcs.AIcs.LGarXiv:2012.09958v12020SignRR: Retrieve and Refine Real Motion for Sign Language Production
Fidel Omar Tito Cruz, Angie Sanchez Marquina, Summy Farfan +1
cs.CVarXiv:2608.28568v12026GeBDA: Building Damage Assessment as Text-Based Sequence Prediction
Olivier Dietrich, Krishna Sapkota, Konrad Schindler +1
cs.CVarXiv:2608.28567v12026GLU-Net: Global-Local Universal Network for Dense Flow and Correspondences
Prune Truong, Martin Danelljan, Radu Timofte
cs.CVarXiv:1912.05524v32019An OpenCL(TM) Deep Learning Accelerator on Arria 10
Utku Aydonat, Shane O'Connell, Davor Capalija +2
cs.DCcs.ARcs.CVarXiv:1701.03534v12017No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images
Botao Ye, Sifei Liu, Haofei Xu +4
cs.CVarXiv:2410.24207v12024BEAT: A Large-Scale Semantic and Emotional Multi-Modal Dataset for Conversational Gestures Synthesis
Haiyang Liu, Zihao Zhu, Naoya Iwamoto +5
cs.CVcs.CLcs.GRarXiv:2203.05297v52022Human-to-Robot Imitation in the Wild
Shikhar Bahl, Abhinav Gupta, Deepak Pathak
cs.ROcs.AIcs.CVarXiv:2207.09450v12022A Survey of Single-Scene Video Anomaly Detection
Bharathkumar Ramachandra, Michael J. Jones, Ranga Raju Vatsavai
cs.CVarXiv:2004.05993v22020Escaping Plato's Cave: 3D Shape From Adversarial Rendering
Philipp Henzler, Niloy Mitra, Tobias Ritschel
cs.CVcs.GRarXiv:1811.11606v42018What Will This Copper Look Like Later? Forecasting Surface Appearance and Rendering It as a PBR Material
Teejuta Sriwaranon, Borworntat Dendumrongkul, Tanapat Chamted +1
cs.GRcs.CVarXiv:2608.28102v12026Skin Lesion Classification Using Hybrid Deep Neural Networks
Amirreza Mahbod, Gerald Schaefer, Chunliang Wang +2
cs.CVarXiv:1702.08434v22017PCC Net: Perspective Crowd Counting via Spatial Convolutional Network
Junyu Gao, Qi Wang, Xuelong Li
cs.CVcs.AIarXiv:1905.10085v12019