Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
7,621 to 7,680 of 18,839
Alpha-CLIP: A CLIP Model Focusing on Wherever You Want
Zeyi Sun, Ye Fang, Tong Wu +6
cs.CVcs.AIcs.CLarXiv:2312.03818v22023UV-GAN: Adversarial Facial UV Map Completion for Pose-invariant Face Recognition
Jiankang Deng, Shiyang Cheng, Niannan Xue +2
cs.CVarXiv:1712.04695v12017CORA: Adapting CLIP for Open-Vocabulary Detection with Region Prompting and Anchor Pre-Matching
Xiaoshi Wu, Feng Zhu, Rui Zhao +1
cs.CVcs.AIarXiv:2303.13076v12023MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
Xinyu Fang, Kangrui Mao, Haodong Duan +4
cs.CVcs.MMarXiv:2406.14515v32024Feedback Networks
Amir R. Zamir, Te-Lin Wu, Lin Sun +3
cs.CVarXiv:1612.09508v32016Cycle-Consistency for Robust Visual Question Answering
Meet Shah, Xinlei Chen, Marcus Rohrbach +1
cs.CVarXiv:1902.05660v12019Local Descriptors Optimized for Average Precision
Kun He, Yan Lu, Stan Sclaroff
cs.CVarXiv:1804.05312v22018Interactive Gibson Benchmark (iGibson 0.5): A Benchmark for Interactive Navigation in Cluttered Environments
Fei Xia, William B. Shen, Chengshu Li +6
cs.ROcs.AIcs.CVarXiv:1910.14442v3201911K Hands: Gender recognition and biometric identification using a large dataset of hand images
Mahmoud Afifi
cs.CVarXiv:1711.04322v92017Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese
An Yang, Junshu Pan, Junyang Lin +4
cs.CVcs.CLarXiv:2211.01335v32022Gaussian Process Morphable Models
Marcel Lüthi, Christoph Jud, Thomas Gerig +1
cs.CVarXiv:1603.07254v12016Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos
Gunnar A. Sigurdsson, Abhinav Gupta, Cordelia Schmid +2
cs.CVarXiv:1804.09626v22018Why Can't I Dance in the Mall? Learning to Mitigate Scene Bias in Action Recognition
Jinwoo Choi, Chen Gao, Joseph C. E. Messou +1
cs.CVarXiv:1912.05534v12019METransformer: Radiology Report Generation by Transformer with Multiple Learnable Expert Tokens
Zhanyu Wang, Lingqiao Liu, Lei Wang +1
cs.CVarXiv:2304.02211v12023MuyBridge: Mobile Human Center-of-Mass Estimation from Monocular Video via Sparse Fusion
Aidan Bradshaw, Marco Giordano, David Rode +8
cs.CVarXiv:2609.02854v12026Aff-Wild2: Extending the Aff-Wild Database for Affect Recognition
Dimitrios Kollias, Stefanos Zafeiriou
cs.CVcs.AIcs.LGarXiv:1811.07770v22018BOLD5000: A public fMRI dataset of 5000 images
Nadine Chang, John A. Pyles, Abhinav Gupta +2
q-bio.NCcs.CVarXiv:1809.01281v12018OctFormer: Octree-based Transformers for 3D Point Clouds
Peng-Shuai Wang
cs.CVcs.GRarXiv:2305.03045v22023Perceptually Regularized Diffusion Model for Image Super-Resolution
Chuxiangbo Wang, Pavithra Venkatachalapathy, Ying Liang +4
eess.IVcs.CVcs.LGarXiv:2609.02016v12026Neural 3D Scene Reconstruction with the Manhattan-world Assumption
Haoyu Guo, Sida Peng, Haotong Lin +4
cs.CVarXiv:2205.02836v22022Adversarial AutoAugment
Xinyu Zhang, Qiang Wang, Jian Zhang +1
cs.CVcs.LGstat.MLarXiv:1912.11188v12019AP-BSN: Self-Supervised Denoising for Real-World Images via Asymmetric PD and Blind-Spot Network
Wooseok Lee, Sanghyun Son, Kyoung Mu Lee
cs.CVeess.IVarXiv:2203.11799v22022Doodle to Search: Practical Zero-Shot Sketch-based Image Retrieval
Sounak Dey, Pau Riba, Anjan Dutta +2
cs.CVarXiv:1904.03451v22019No Pixel Left Behind: Filling Gaps in Anime Colorization
Masahiro Kono, Akinobu Maejima, Yuki Koyama +2
cs.HCcs.CVcs.GRarXiv:2609.00800v12026A Coarse-to-Fine Adaptive Network for Appearance-Based Gaze Estimation
Yihua Cheng, Shiyao Huang, Fei Wang +2
cs.CVarXiv:2001.00187v12020Stochastic Primal-Dual Hybrid Gradient Algorithm with Arbitrary Sampling and Imaging Applications
Antonin Chambolle, Matthias J. Ehrhardt, Peter Richtárik +1
math.OCcs.CVmath.NAarXiv:1706.04957v22017Vision Transformer for Fast and Efficient Scene Text Recognition
Rowel Atienza
cs.CVarXiv:2105.08582v12021SLCA: Slow Learner with Classifier Alignment for Continual Learning on a Pre-trained Model
Gengwei Zhang, Liyuan Wang, Guoliang Kang +2
cs.CVcs.AIcs.LGarXiv:2303.05118v42023From Detection to Localization: A Unified Forensics Framework for Fully Synthetic and Tampered Images
Annalisa Gallina, Marco Fiorucci, Marco Brigo +2
cs.CVarXiv:2609.02640v12026Deep Relational Reasoning Graph Network for Arbitrary Shape Text Detection
Shi-Xue Zhang, Xiaobin Zhu, Jie-Bo Hou +4
cs.CVarXiv:2003.07493v22020A Simple LLM Framework for Long-Range Video Question-Answering
Ce Zhang, Taixi Lu, Md Mohaiminul Islam +4
cs.CVarXiv:2312.17235v32023Learning by Analogy: Reliable Supervision from Transformations for Unsupervised Optical Flow Estimation
Liang Liu, Jiangning Zhang, Ruifei He +7
cs.CVarXiv:2003.13045v22020AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model
Teng Hu, Jiangning Zhang, Ran Yi +5
cs.CVarXiv:2312.05767v22023SCUT-FBP5500: A Diverse Benchmark Dataset for Multi-Paradigm Facial Beauty Prediction
Lingyu Liang, Luojun Lin, Lianwen Jin +2
cs.CVarXiv:1801.06345v12018Simple-BEV: What Really Matters for Multi-Sensor BEV Perception?
Adam W. Harley, Zhaoyuan Fang, Jie Li +2
cs.CVarXiv:2206.07959v22022Deep Convolutional AutoEncoder-based Lossy Image Compression
Zhengxue Cheng, Heming Sun, Masaru Takeuchi +1
cs.CVarXiv:1804.09535v12018Detecting GAN-generated Imagery using Color Cues
Scott McCloskey, Michael Albright
cs.CVarXiv:1812.08247v12018Continuous-Time Visual-Inertial Odometry for Event Cameras
Elias Mueggler, Guillermo Gallego, Henri Rebecq +1
cs.ROcs.CVarXiv:1702.07389v22017A Realistic Fish-Habitat Dataset to Evaluate Algorithms for Underwater Visual Analysis
Alzayat Saleh, Issam H. Laradji, Dmitry A. Konovalov +3
cs.CVcs.LGeess.IVarXiv:2008.12603v12020Dex-NeRF: Using a Neural Radiance Field to Grasp Transparent Objects
Jeffrey Ichnowski, Yahav Avigal, Justin Kerr +1
cs.ROcs.CVarXiv:2110.14217v12021Encoder Fusion Network with Co-Attention Embedding for Referring Image Segmentation
Guang Feng, Zhiwei Hu, Lihe Zhang +1
cs.CVarXiv:2105.01839v12021WiFlow: Estimating Optical Flow using WiFi Channel State Information
Thomas Weigel, Simon Kiefhaber, Fabian Portner +2
cs.CVarXiv:2609.02452v12026Supervised Fitting of Geometric Primitives to 3D Point Clouds
Lingxiao Li, Minhyuk Sung, Anastasia Dubrovina +2
cs.CVarXiv:1811.08988v42018What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data
Oier Mees, Lukas Hermann, Wolfram Burgard
cs.ROcs.AIcs.CLarXiv:2204.06252v22022DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models
Weijia Wu, Yuzhong Zhao, Mike Zheng Shou +2
cs.CVarXiv:2303.11681v42023S4NN: temporal backpropagation for spiking neural networks with one spike per neuron
Saeed Reza Kheradpisheh, Timothée Masquelier
cs.NEcs.CVcs.LGarXiv:1910.09495v42019Patch Slimming for Efficient Vision Transformers
Yehui Tang, Kai Han, Yunhe Wang +4
cs.CVcs.LGarXiv:2106.02852v22021Semantic Hierarchy Emerges in Deep Generative Representations for Scene Synthesis
Ceyuan Yang, Yujun Shen, Bolei Zhou
cs.CVcs.GRcs.LGarXiv:1911.09267v32019Learning Image Matching by Simply Watching Video
Gucan Long, Laurent Kneip, Jose M. Alvarez +1
cs.CVarXiv:1603.06041v22016MV-dVRK: A Multi-Viewpoint Benchmark for Spatial Surgical Perception
Guido Caccianiga, Sergey Prokudin, Yutong Chen +9
cs.CVcs.ROarXiv:2609.02717v12026Camera Relocalization by Computing Pairwise Relative Poses Using Convolutional Neural Network
Zakaria Laskar, Iaroslav Melekhov, Surya Kalia +1
cs.CVarXiv:1707.09733v22017Generating Useful Accident-Prone Driving Scenarios via a Learned Traffic Prior
Davis Rempe, Jonah Philion, Leonidas J. Guibas +2
cs.CVcs.LGcs.ROarXiv:2112.05077v22021UnCapsTSR: An Unsupervised Transformer-based Image Super-Resolution Approach for Capsule Endoscopy Images
Anjali Sarvaiya, Shubh Kawa, Lalit Agrawal +3
cs.CVarXiv:2609.02476v12026Semi-Supervised Semantic Segmentation via Adaptive Equalization Learning
Hanzhe Hu, Fangyun Wei, Han Hu +3
cs.CVarXiv:2110.05474v12021PRISM: An Agentic Multi-Model Architecture for Proactive Safety in Autonomous Transportation Systems
Joyjit Roy, Samaresh Kumar Singh, Sushanta Das
cs.MAcs.CVcs.ETarXiv:2609.01623v12026The Devil of Face Recognition is in the Noise
Fei Wang, Liren Chen, Cheng Li +4
cs.CVarXiv:1807.11649v12018Towards Long-Form Video Understanding
Chao-Yuan Wu, Philipp Krähenbühl
cs.CVarXiv:2106.11310v12021Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
Junyu Chen, Han Cai, Junsong Chen +6
cs.CVcs.AIarXiv:2410.10733v82024Clockwork Convnets for Video Semantic Segmentation
Evan Shelhamer, Kate Rakelly, Judy Hoffman +1
cs.CVarXiv:1608.03609v12016Person Search via A Mask-Guided Two-Stream CNN Model
Di Chen, Shanshan Zhang, Wanli Ouyang +2
cs.CVarXiv:1807.08107v12018