Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

7,621 to 7,680 of 18,839

  1. Alpha-CLIP: A CLIP Model Focusing on Wherever You Want

    Zeyi Sun, Ye Fang, Tong Wu +6

    cs.CVcs.AIcs.CLarXiv:2312.03818v22023
  2. UV-GAN: Adversarial Facial UV Map Completion for Pose-invariant Face Recognition

    Jiankang Deng, Shiyang Cheng, Niannan Xue +2

    cs.CVarXiv:1712.04695v12017
  3. CORA: Adapting CLIP for Open-Vocabulary Detection with Region Prompting and Anchor Pre-Matching

    Xiaoshi Wu, Feng Zhu, Rui Zhao +1

    cs.CVcs.AIarXiv:2303.13076v12023
  4. MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding

    Xinyu Fang, Kangrui Mao, Haodong Duan +4

    cs.CVcs.MMarXiv:2406.14515v32024
  5. Feedback Networks

    Amir R. Zamir, Te-Lin Wu, Lin Sun +3

    cs.CVarXiv:1612.09508v32016
  6. Cycle-Consistency for Robust Visual Question Answering

    Meet Shah, Xinlei Chen, Marcus Rohrbach +1

    cs.CVarXiv:1902.05660v12019
  7. Local Descriptors Optimized for Average Precision

    Kun He, Yan Lu, Stan Sclaroff

    cs.CVarXiv:1804.05312v22018
  8. Interactive Gibson Benchmark (iGibson 0.5): A Benchmark for Interactive Navigation in Cluttered Environments

    Fei Xia, William B. Shen, Chengshu Li +6

    cs.ROcs.AIcs.CVarXiv:1910.14442v32019
  9. 11K Hands: Gender recognition and biometric identification using a large dataset of hand images

    Mahmoud Afifi

    cs.CVarXiv:1711.04322v92017
  10. Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese

    An Yang, Junshu Pan, Junyang Lin +4

    cs.CVcs.CLarXiv:2211.01335v32022
  11. Gaussian Process Morphable Models

    Marcel Lüthi, Christoph Jud, Thomas Gerig +1

    cs.CVarXiv:1603.07254v12016
  12. Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos

    Gunnar A. Sigurdsson, Abhinav Gupta, Cordelia Schmid +2

    cs.CVarXiv:1804.09626v22018
  13. Why Can't I Dance in the Mall? Learning to Mitigate Scene Bias in Action Recognition

    Jinwoo Choi, Chen Gao, Joseph C. E. Messou +1

    cs.CVarXiv:1912.05534v12019
  14. METransformer: Radiology Report Generation by Transformer with Multiple Learnable Expert Tokens

    Zhanyu Wang, Lingqiao Liu, Lei Wang +1

    cs.CVarXiv:2304.02211v12023
  15. MuyBridge: Mobile Human Center-of-Mass Estimation from Monocular Video via Sparse Fusion

    Aidan Bradshaw, Marco Giordano, David Rode +8

    cs.CVarXiv:2609.02854v12026
  16. Aff-Wild2: Extending the Aff-Wild Database for Affect Recognition

    Dimitrios Kollias, Stefanos Zafeiriou

    cs.CVcs.AIcs.LGarXiv:1811.07770v22018
  17. BOLD5000: A public fMRI dataset of 5000 images

    Nadine Chang, John A. Pyles, Abhinav Gupta +2

    q-bio.NCcs.CVarXiv:1809.01281v12018
  18. OctFormer: Octree-based Transformers for 3D Point Clouds

    Peng-Shuai Wang

    cs.CVcs.GRarXiv:2305.03045v22023
  19. Perceptually Regularized Diffusion Model for Image Super-Resolution

    Chuxiangbo Wang, Pavithra Venkatachalapathy, Ying Liang +4

    eess.IVcs.CVcs.LGarXiv:2609.02016v12026
  20. Neural 3D Scene Reconstruction with the Manhattan-world Assumption

    Haoyu Guo, Sida Peng, Haotong Lin +4

    cs.CVarXiv:2205.02836v22022
  21. Adversarial AutoAugment

    Xinyu Zhang, Qiang Wang, Jian Zhang +1

    cs.CVcs.LGstat.MLarXiv:1912.11188v12019
  22. AP-BSN: Self-Supervised Denoising for Real-World Images via Asymmetric PD and Blind-Spot Network

    Wooseok Lee, Sanghyun Son, Kyoung Mu Lee

    cs.CVeess.IVarXiv:2203.11799v22022
  23. Doodle to Search: Practical Zero-Shot Sketch-based Image Retrieval

    Sounak Dey, Pau Riba, Anjan Dutta +2

    cs.CVarXiv:1904.03451v22019
  24. No Pixel Left Behind: Filling Gaps in Anime Colorization

    Masahiro Kono, Akinobu Maejima, Yuki Koyama +2

    cs.HCcs.CVcs.GRarXiv:2609.00800v12026
  25. A Coarse-to-Fine Adaptive Network for Appearance-Based Gaze Estimation

    Yihua Cheng, Shiyao Huang, Fei Wang +2

    cs.CVarXiv:2001.00187v12020
  26. Stochastic Primal-Dual Hybrid Gradient Algorithm with Arbitrary Sampling and Imaging Applications

    Antonin Chambolle, Matthias J. Ehrhardt, Peter Richtárik +1

    math.OCcs.CVmath.NAarXiv:1706.04957v22017
  27. Vision Transformer for Fast and Efficient Scene Text Recognition

    Rowel Atienza

    cs.CVarXiv:2105.08582v12021
  28. SLCA: Slow Learner with Classifier Alignment for Continual Learning on a Pre-trained Model

    Gengwei Zhang, Liyuan Wang, Guoliang Kang +2

    cs.CVcs.AIcs.LGarXiv:2303.05118v42023
  29. From Detection to Localization: A Unified Forensics Framework for Fully Synthetic and Tampered Images

    Annalisa Gallina, Marco Fiorucci, Marco Brigo +2

    cs.CVarXiv:2609.02640v12026
  30. Deep Relational Reasoning Graph Network for Arbitrary Shape Text Detection

    Shi-Xue Zhang, Xiaobin Zhu, Jie-Bo Hou +4

    cs.CVarXiv:2003.07493v22020
  31. A Simple LLM Framework for Long-Range Video Question-Answering

    Ce Zhang, Taixi Lu, Md Mohaiminul Islam +4

    cs.CVarXiv:2312.17235v32023
  32. Learning by Analogy: Reliable Supervision from Transformations for Unsupervised Optical Flow Estimation

    Liang Liu, Jiangning Zhang, Ruifei He +7

    cs.CVarXiv:2003.13045v22020
  33. AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model

    Teng Hu, Jiangning Zhang, Ran Yi +5

    cs.CVarXiv:2312.05767v22023
  34. SCUT-FBP5500: A Diverse Benchmark Dataset for Multi-Paradigm Facial Beauty Prediction

    Lingyu Liang, Luojun Lin, Lianwen Jin +2

    cs.CVarXiv:1801.06345v12018
  35. Simple-BEV: What Really Matters for Multi-Sensor BEV Perception?

    Adam W. Harley, Zhaoyuan Fang, Jie Li +2

    cs.CVarXiv:2206.07959v22022
  36. Deep Convolutional AutoEncoder-based Lossy Image Compression

    Zhengxue Cheng, Heming Sun, Masaru Takeuchi +1

    cs.CVarXiv:1804.09535v12018
  37. Detecting GAN-generated Imagery using Color Cues

    Scott McCloskey, Michael Albright

    cs.CVarXiv:1812.08247v12018
  38. Continuous-Time Visual-Inertial Odometry for Event Cameras

    Elias Mueggler, Guillermo Gallego, Henri Rebecq +1

    cs.ROcs.CVarXiv:1702.07389v22017
  39. A Realistic Fish-Habitat Dataset to Evaluate Algorithms for Underwater Visual Analysis

    Alzayat Saleh, Issam H. Laradji, Dmitry A. Konovalov +3

    cs.CVcs.LGeess.IVarXiv:2008.12603v12020
  40. Dex-NeRF: Using a Neural Radiance Field to Grasp Transparent Objects

    Jeffrey Ichnowski, Yahav Avigal, Justin Kerr +1

    cs.ROcs.CVarXiv:2110.14217v12021
  41. Encoder Fusion Network with Co-Attention Embedding for Referring Image Segmentation

    Guang Feng, Zhiwei Hu, Lihe Zhang +1

    cs.CVarXiv:2105.01839v12021
  42. WiFlow: Estimating Optical Flow using WiFi Channel State Information

    Thomas Weigel, Simon Kiefhaber, Fabian Portner +2

    cs.CVarXiv:2609.02452v12026
  43. Supervised Fitting of Geometric Primitives to 3D Point Clouds

    Lingxiao Li, Minhyuk Sung, Anastasia Dubrovina +2

    cs.CVarXiv:1811.08988v42018
  44. What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data

    Oier Mees, Lukas Hermann, Wolfram Burgard

    cs.ROcs.AIcs.CLarXiv:2204.06252v22022
  45. DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models

    Weijia Wu, Yuzhong Zhao, Mike Zheng Shou +2

    cs.CVarXiv:2303.11681v42023
  46. S4NN: temporal backpropagation for spiking neural networks with one spike per neuron

    Saeed Reza Kheradpisheh, Timothée Masquelier

    cs.NEcs.CVcs.LGarXiv:1910.09495v42019
  47. Patch Slimming for Efficient Vision Transformers

    Yehui Tang, Kai Han, Yunhe Wang +4

    cs.CVcs.LGarXiv:2106.02852v22021
  48. Semantic Hierarchy Emerges in Deep Generative Representations for Scene Synthesis

    Ceyuan Yang, Yujun Shen, Bolei Zhou

    cs.CVcs.GRcs.LGarXiv:1911.09267v32019
  49. Learning Image Matching by Simply Watching Video

    Gucan Long, Laurent Kneip, Jose M. Alvarez +1

    cs.CVarXiv:1603.06041v22016
  50. MV-dVRK: A Multi-Viewpoint Benchmark for Spatial Surgical Perception

    Guido Caccianiga, Sergey Prokudin, Yutong Chen +9

    cs.CVcs.ROarXiv:2609.02717v12026
  51. Camera Relocalization by Computing Pairwise Relative Poses Using Convolutional Neural Network

    Zakaria Laskar, Iaroslav Melekhov, Surya Kalia +1

    cs.CVarXiv:1707.09733v22017
  52. Generating Useful Accident-Prone Driving Scenarios via a Learned Traffic Prior

    Davis Rempe, Jonah Philion, Leonidas J. Guibas +2

    cs.CVcs.LGcs.ROarXiv:2112.05077v22021
  53. UnCapsTSR: An Unsupervised Transformer-based Image Super-Resolution Approach for Capsule Endoscopy Images

    Anjali Sarvaiya, Shubh Kawa, Lalit Agrawal +3

    cs.CVarXiv:2609.02476v12026
  54. Semi-Supervised Semantic Segmentation via Adaptive Equalization Learning

    Hanzhe Hu, Fangyun Wei, Han Hu +3

    cs.CVarXiv:2110.05474v12021
  55. PRISM: An Agentic Multi-Model Architecture for Proactive Safety in Autonomous Transportation Systems

    Joyjit Roy, Samaresh Kumar Singh, Sushanta Das

    cs.MAcs.CVcs.ETarXiv:2609.01623v12026
  56. The Devil of Face Recognition is in the Noise

    Fei Wang, Liren Chen, Cheng Li +4

    cs.CVarXiv:1807.11649v12018
  57. Towards Long-Form Video Understanding

    Chao-Yuan Wu, Philipp Krähenbühl

    cs.CVarXiv:2106.11310v12021
  58. Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models

    Junyu Chen, Han Cai, Junsong Chen +6

    cs.CVcs.AIarXiv:2410.10733v82024
  59. Clockwork Convnets for Video Semantic Segmentation

    Evan Shelhamer, Kate Rakelly, Judy Hoffman +1

    cs.CVarXiv:1608.03609v12016
  60. Person Search via A Mask-Guided Two-Stream CNN Model

    Di Chen, Shanshan Zhang, Wanli Ouyang +2

    cs.CVarXiv:1807.08107v12018