Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

9,241 to 9,300 of 18,815

  1. Explainable Deep One-Class Classification

    Philipp Liznerski, Lukas Ruff, Robert A. Vandermeulen +3

    cs.CVcs.LGstat.MLarXiv:2007.01760v32020
  2. Implicit Neural Representation for Cooperative Low-light Image Enhancement

    Shuzhou Yang, Moxuan Ding, Yanmin Wu +2

    cs.CVarXiv:2303.11722v32023
  3. Spatially Supervised Recurrent Convolutional Neural Networks for Visual Object Tracking

    Guanghan Ning, Zhi Zhang, Chen Huang +3

    cs.CVarXiv:1607.05781v12016
  4. Trunk-Branch Ensemble Convolutional Neural Networks for Video-based Face Recognition

    Changxing Ding, Dacheng Tao

    cs.CVarXiv:1607.05427v22016
  5. Spectral Unmixing via Data-guided Sparsity

    Feiyun Zhu, Ying Wang, Bin Fan +3

    cs.CVarXiv:1403.3155v42014
  6. GNN3DMOT: Graph Neural Network for 3D Multi-Object Tracking with Multi-Feature Learning

    Xinshuo Weng, Yongxin Wang, Yunze Man +1

    cs.CVcs.LGeess.IVarXiv:2006.07327v12020
  7. UniVTG: Towards Unified Video-Language Temporal Grounding

    Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen +5

    cs.CVarXiv:2307.16715v22023
  8. Seeing Beyond the Brain: Conditional Diffusion Model with Sparse Masked Modeling for Vision Decoding

    Zijiao Chen, Jiaxin Qing, Tiange Xiang +2

    cs.CVarXiv:2211.06956v32022
  9. Learning to Synthesize a 4D RGBD Light Field from a Single Image

    Pratul P. Srinivasan, Tongzhou Wang, Ashwin Sreelal +2

    cs.CVcs.GRarXiv:1708.03292v12017
  10. ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments

    Dong An, Hanqing Wang, Wenguan Wang +4

    cs.CVcs.CLcs.ROarXiv:2304.03047v32023
  11. FILM: Frame Interpolation for Large Motion

    Fitsum Reda, Janne Kontkanen, Eric Tabellion +3

    cs.CVarXiv:2202.04901v42022
  12. A Unified Survey on Anomaly, Novelty, Open-Set, and Out-of-Distribution Detection: Solutions and Future Challenges

    Mohammadreza Salehi, Hossein Mirzaei, Dan Hendrycks +3

    cs.CVcs.LGarXiv:2110.14051v52021
  13. Zero-Shot Composed Image Retrieval with Textual Inversion

    Alberto Baldrati, Lorenzo Agnolucci, Marco Bertini +1

    cs.CVcs.CLcs.IRarXiv:2303.15247v22023
  14. Face Behavior a la carte: Expressions, Affect and Action Units in a Single Network

    Dimitrios Kollias, Viktoriia Sharmanska, Stefanos Zafeiriou

    cs.CVcs.HCcs.LGarXiv:1910.11111v32019
  15. EDiffSR: An Efficient Diffusion Probabilistic Model for Remote Sensing Image Super-Resolution

    Yi Xiao, Qiangqiang Yuan, Kui Jiang +3

    eess.IVcs.CVarXiv:2310.19288v12023
  16. Deep Learning Methods for Vessel Trajectory Prediction based on Recurrent Neural Networks

    Samuele Capobianco, Leonardo M. Millefiori, Nicola Forti +2

    cs.CVarXiv:2101.02486v22021
  17. Guided Open Vocabulary Image Captioning with Constrained Beam Search

    Peter Anderson, Basura Fernando, Mark Johnson +1

    cs.CVarXiv:1612.00576v22016
  18. SigNet: Convolutional Siamese Network for Writer Independent Offline Signature Verification

    Sounak Dey, Anjan Dutta, J. Ignacio Toledo +3

    cs.CVarXiv:1707.02131v22017
  19. All in One: Exploring Unified Video-Language Pre-training

    Alex Jinpeng Wang, Yixiao Ge, Rui Yan +7

    cs.CVarXiv:2203.07303v12022
  20. OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM

    Yutao Hu, Tianbin Li, Quanfeng Lu +4

    eess.IVcs.CVarXiv:2402.09181v22024
  21. Self-Adaptive Training: beyond Empirical Risk Minimization

    Lang Huang, Chao Zhang, Hongyang Zhang

    cs.LGcs.CVstat.MLarXiv:2002.10319v22020
  22. Fourier Contour Embedding for Arbitrary-Shaped Text Detection

    Yiqin Zhu, Jianyong Chen, Lingyu Liang +3

    cs.CVarXiv:2104.10442v22021
  23. Training Binary Neural Networks with Real-to-Binary Convolutions

    Brais Martinez, Jing Yang, Adrian Bulat +1

    cs.CVarXiv:2003.11535v12020
  24. AO2-DETR: Arbitrary-Oriented Object Detection Transformer

    Linhui Dai, Hong Liu, Hao Tang +2

    cs.CVarXiv:2205.12785v12022
  25. Language-Conditioned Imitation Learning for Robot Manipulation Tasks

    Simon Stepputtis, Joseph Campbell, Mariano Phielipp +3

    cs.ROcs.CLcs.CVarXiv:2010.12083v12020
  26. Visualization of Very Large High-Dimensional Data Sets as Minimum Spanning Trees

    Daniel Probst, Jean-Louis Reymond

    cs.HCcs.CVcs.DSarXiv:1908.10410v32019
  27. SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction

    Xinyuan Chen, Yaohui Wang, Lingjun Zhang +7

    cs.CVarXiv:2310.20700v22023
  28. Patch-based Output Space Adversarial Learning for Joint Optic Disc and Cup Segmentation

    Shujun Wang, Lequan Yu, Xin Yang +2

    cs.CVarXiv:1902.07519v12019
  29. Patch2Pix: Epipolar-Guided Pixel-Level Correspondences

    Qunjie Zhou, Torsten Sattler, Laura Leal-Taixe

    cs.CVarXiv:2012.01909v32020
  30. PolarFormer: Multi-camera 3D Object Detection with Polar Transformer

    Yanqin Jiang, Li Zhang, Zhenwei Miao +4

    cs.CVcs.AIarXiv:2206.15398v62022
  31. Classification of Alzheimer's Disease using fMRI Data and Deep Learning Convolutional Neural Networks

    Saman Sarraf, Ghassem Tofighi

    cs.CVarXiv:1603.08631v12016
  32. Video Anomaly Detection and Localization via Gaussian Mixture Fully Convolutional Variational Autoencoder

    Yaxiang Fan, Gongjian Wen, Deren Li +2

    cs.CVarXiv:1805.11223v12018
  33. Deep-Person: Learning Discriminative Deep Features for Person Re-Identification

    Xiang Bai, Mingkun Yang, Tengteng Huang +3

    cs.CVarXiv:1711.10658v42017
  34. Leaf Classification Using Shape, Color, and Texture Features

    Abdul Kadir, Lukito Edi Nugroho, Adhi Susanto +1

    cs.CVcs.CYarXiv:1401.4447v12013
  35. Audiovisual SlowFast Networks for Video Recognition

    Fanyi Xiao, Yong Jae Lee, Kristen Grauman +2

    cs.CVarXiv:2001.08740v22020
  36. Detailed Human Avatars from Monocular Video

    Thiemo Alldieck, Marcus Magnor, Weipeng Xu +2

    cs.CVarXiv:1808.01338v12018
  37. Old is Gold: Redefining the Adversarially Learned One-Class Classifier Training Paradigm

    Muhammad Zaigham Zaheer, Jin-ha Lee, Marcella Astrid +1

    cs.CVarXiv:2004.07657v42020
  38. Structure Inference Machines: Recurrent Neural Networks for Analyzing Relations in Group Activity Recognition

    Zhiwei Deng, Arash Vahdat, Hexiang Hu +1

    cs.CVarXiv:1511.04196v22015
  39. One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale

    Fan Bao, Shen Nie, Kaiwen Xue +7

    cs.LGcs.CVarXiv:2303.06555v22023
  40. Exploiting temporal context for 3D human pose estimation in the wild

    Anurag Arnab, Carl Doersch, Andrew Zisserman

    cs.CVarXiv:1905.04266v12019
  41. Learning Semantic Segmentation of Large-Scale Point Clouds with Random Sampling

    Qingyong Hu, Bo Yang, Linhai Xie +5

    cs.CVcs.AIcs.ROarXiv:2107.02389v12021
  42. TransCrowd: weakly-supervised crowd counting with transformers

    Dingkang Liang, Xiwu Chen, Wei Xu +2

    cs.CVarXiv:2104.09116v32021
  43. Associative Domain Adaptation

    Philip Haeusser, Thomas Frerix, Alexander Mordvintsev +1

    cs.CVarXiv:1708.00938v12017
  44. Depth Completion from Sparse LiDAR Data with Depth-Normal Constraints

    Yan Xu, Xinge Zhu, Jianping Shi +3

    cs.CVarXiv:1910.06727v12019
  45. Detect-and-Track: Efficient Pose Estimation in Videos

    Rohit Girdhar, Georgia Gkioxari, Lorenzo Torresani +2

    cs.CVarXiv:1712.09184v22017
  46. Look More Than Once: An Accurate Detector for Text of Arbitrary Shapes

    Chengquan Zhang, Borong Liang, Zuming Huang +4

    cs.CVarXiv:1904.06535v12019
  47. Transforming medical imaging with Transformers? A comparative review of key properties, current progresses, and future perspectives

    Jun Li, Junyu Chen, Yucheng Tang +3

    cs.CVarXiv:2206.01136v32022
  48. Toward Transformer-Based Object Detection

    Josh Beal, Eric Kim, Eric Tzeng +3

    cs.CVcs.AIcs.LGarXiv:2012.09958v12020
  49. SignRR: Retrieve and Refine Real Motion for Sign Language Production

    Fidel Omar Tito Cruz, Angie Sanchez Marquina, Summy Farfan +1

    cs.CVarXiv:2608.28568v12026
  50. GeBDA: Building Damage Assessment as Text-Based Sequence Prediction

    Olivier Dietrich, Krishna Sapkota, Konrad Schindler +1

    cs.CVarXiv:2608.28567v12026
  51. GLU-Net: Global-Local Universal Network for Dense Flow and Correspondences

    Prune Truong, Martin Danelljan, Radu Timofte

    cs.CVarXiv:1912.05524v32019
  52. An OpenCL(TM) Deep Learning Accelerator on Arria 10

    Utku Aydonat, Shane O'Connell, Davor Capalija +2

    cs.DCcs.ARcs.CVarXiv:1701.03534v12017
  53. No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images

    Botao Ye, Sifei Liu, Haofei Xu +4

    cs.CVarXiv:2410.24207v12024
  54. BEAT: A Large-Scale Semantic and Emotional Multi-Modal Dataset for Conversational Gestures Synthesis

    Haiyang Liu, Zihao Zhu, Naoya Iwamoto +5

    cs.CVcs.CLcs.GRarXiv:2203.05297v52022
  55. Human-to-Robot Imitation in the Wild

    Shikhar Bahl, Abhinav Gupta, Deepak Pathak

    cs.ROcs.AIcs.CVarXiv:2207.09450v12022
  56. A Survey of Single-Scene Video Anomaly Detection

    Bharathkumar Ramachandra, Michael J. Jones, Ranga Raju Vatsavai

    cs.CVarXiv:2004.05993v22020
  57. Escaping Plato's Cave: 3D Shape From Adversarial Rendering

    Philipp Henzler, Niloy Mitra, Tobias Ritschel

    cs.CVcs.GRarXiv:1811.11606v42018
  58. What Will This Copper Look Like Later? Forecasting Surface Appearance and Rendering It as a PBR Material

    Teejuta Sriwaranon, Borworntat Dendumrongkul, Tanapat Chamted +1

    cs.GRcs.CVarXiv:2608.28102v12026
  59. Skin Lesion Classification Using Hybrid Deep Neural Networks

    Amirreza Mahbod, Gerald Schaefer, Chunliang Wang +2

    cs.CVarXiv:1702.08434v22017
  60. PCC Net: Perspective Crowd Counting via Spatial Convolutional Network

    Junyu Gao, Qi Wang, Xuelong Li

    cs.CVcs.AIarXiv:1905.10085v12019