Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
10,201 to 10,260 of 18,840
Scan2Cap: Context-aware Dense Captioning in RGB-D Scans
Dave Zhenyu Chen, Ali Gholami, Matthias Nießner +1
cs.CVcs.LGeess.IVarXiv:2012.02206v12020Clothes-Changing Person Re-identification with RGB Modality Only
Xinqian Gu, Hong Chang, Bingpeng Ma +3
cs.CVarXiv:2204.06890v12022Facial Expression Recognition using Convolutional Neural Networks: State of the Art
Christopher Pramerdorfer, Martin Kampel
cs.CVarXiv:1612.02903v12016RFAConv: Receptive-Field Attention Convolution for Improving Convolutional Neural Networks
Xin Zhang, Chen Liu, Degang Yang +4
cs.CVarXiv:2304.03198v72023DeepFake Detection Based on the Discrepancy Between the Face and its Context
Yuval Nirkin, Lior Wolf, Yosi Keller +1
cs.CVcs.LGarXiv:2008.12262v120203DRegNet: A Deep Neural Network for 3D Point Registration
G. Dias Pais, Srikumar Ramalingam, Venu Madhav Govindu +3
cs.CVarXiv:1904.01701v22019Single Image Deraining: From Model-Based to Data-Driven and Beyond
Wenhan Yang, Robby T. Tan, Shiqi Wang +2
eess.IVcs.CVarXiv:1912.07150v22019Unsupervised 3D End-to-End Medical Image Registration with Volume Tweening Network
Shengyu Zhao, Tingfung Lau, Ji Luo +2
cs.CVarXiv:1902.05020v32019Dual Diffusion Implicit Bridges for Image-to-Image Translation
Xuan Su, Jiaming Song, Chenlin Meng +1
cs.CVcs.AIcs.LGarXiv:2203.08382v42022Contrastive Learning Inverts the Data Generating Process
Roland S. Zimmermann, Yash Sharma, Steffen Schneider +2
cs.LGcs.CVarXiv:2102.08850v42021Parallel Tracking and Verifying: A Framework for Real-Time and High Accuracy Visual Tracking
Heng Fan, Haibin Ling
cs.CVarXiv:1708.00153v12017FQ-ViT: Post-Training Quantization for Fully Quantized Vision Transformer
Yang Lin, Tianyu Zhang, Peiqin Sun +2
cs.CVarXiv:2111.13824v42021SegGPT: Segmenting Everything In Context
Xinlong Wang, Xiaosong Zhang, Yue Cao +3
cs.CVarXiv:2304.03284v12023TeCNO: Surgical Phase Recognition with Multi-Stage Temporal Convolutional Networks
Tobias Czempiel, Magdalini Paschali, Matthias Keicher +4
eess.IVcs.CVcs.LGarXiv:2003.10751v12020Sequential Modeling Enables Scalable Learning for Large Vision Models
Yutong Bai, Xinyang Geng, Karttikeya Mangalam +5
cs.CVarXiv:2312.00785v12023Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
Yiqi Zhu, Feiyu Gao, Jiaxing Fan +7
cs.AIcs.CVarXiv:2608.27477v12026Densely Residual Laplacian Super-Resolution
Saeed Anwar, Nick Barnes
eess.IVcs.CVarXiv:1906.12021v22019Diversified Texture Synthesis with Feed-forward Networks
Yijun Li, Chen Fang, Jimei Yang +3
cs.CVarXiv:1703.01664v12017Factorizable Net: An Efficient Subgraph-based Framework for Scene Graph Generation
Yikang Li, Wanli Ouyang, Bolei Zhou +3
cs.CVarXiv:1806.11538v22018PONI: Potential Functions for ObjectGoal Navigation with Interaction-free Learning
Santhosh Kumar Ramakrishnan, Devendra Singh Chaplot, Ziad Al-Halah +2
cs.CVcs.AIarXiv:2201.10029v22022Break-A-Scene: Extracting Multiple Concepts from a Single Image
Omri Avrahami, Kfir Aberman, Ohad Fried +2
cs.CVcs.GRcs.LGarXiv:2305.16311v22023Polysemous Visual-Semantic Embedding for Cross-Modal Retrieval
Yale Song, Mohammad Soleymani
cs.CVarXiv:1906.04402v22019Biometric Face Presentation Attack Detection with Multi-Channel Convolutional Neural Network
Anjith George, Zohreh Mostaani, David Geissenbuhler +3
cs.CVcs.CRarXiv:1909.08848v12019Local Texture Estimator for Implicit Representation Function
Jaewon Lee, Kyong Hwan Jin
cs.CVeess.IVarXiv:2111.08918v62021A Comprehensive Survey on Source-free Domain Adaptation
Zhiqi Yu, Jingjing Li, Zhekai Du +2
cs.LGcs.CVcs.MMarXiv:2302.11803v12023MARCO: Navigating the Unseen Space of Semantic Correspondence
Claudia Cuttano, Gabriele Trivigno, Carlo Masone +1
cs.CVarXiv:2604.18267v12026VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion
Yiming Li, Zhiding Yu, Christopher Choy +5
cs.CVcs.AIcs.LGarXiv:2302.12251v22023CirCNN: Accelerating and Compressing Deep Neural Networks Using Block-CirculantWeight Matrices
Caiwen Ding, Siyu Liao, Yanzhi Wang +13
cs.CVcs.AIcs.LGarXiv:1708.08917v12017Co$^2$L: Contrastive Continual Learning
Hyuntak Cha, Jaeho Lee, Jinwoo Shin
cs.LGcs.CVarXiv:2106.14413v12021Group-Free 3D Object Detection via Transformers
Ze Liu, Zheng Zhang, Yue Cao +2
cs.CVarXiv:2104.00678v22021Vision Transformers for Dense Prediction
René Ranftl, Alexey Bochkovskiy, Vladlen Koltun
cs.CVarXiv:2103.13413v12021SINet: A Scale-insensitive Convolutional Neural Network for Fast Vehicle Detection
Xiaowei Hu, Xuemiao Xu, Yongjie Xiao +4
cs.CVarXiv:1804.00433v22018FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose Estimation
Yisheng He, Haibin Huang, Haoqiang Fan +2
cs.CVcs.ROarXiv:2103.02242v12021Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
Senqiao Yang, Chengyao Wang, Yuxin Chen +13
cs.ROcs.CVarXiv:2608.27550v12026Single-Stage Semantic Segmentation from Image Labels
Nikita Araslanov, Stefan Roth
cs.CVcs.LGarXiv:2005.08104v12020Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions
Hongwei Xue, Tiankai Hang, Yanhong Zeng +5
cs.CVarXiv:2111.10337v22021ASLFeat: Learning Local Features of Accurate Shape and Localization
Zixin Luo, Lei Zhou, Xuyang Bai +6
cs.CVarXiv:2003.10071v22020Towards Fairer Datasets: Filtering and Balancing the Distribution of the People Subtree in the ImageNet Hierarchy
Kaiyu Yang, Klint Qinami, Li Fei-Fei +2
cs.CVarXiv:1912.07726v12019Learning Open Set Network with Discriminative Reciprocal Points
Guangyao Chen, Limeng Qiao, Yemin Shi +5
cs.CVcs.LGarXiv:2011.00178v12020PlotQA: Reasoning over Scientific Plots
Nitesh Methani, Pritha Ganguly, Mitesh M. Khapra +1
cs.CVcs.AIcs.CLarXiv:1909.00997v32019Enforcing geometric constraints of virtual normal for depth prediction
Wei Yin, Yifan Liu, Chunhua Shen +1
cs.CVarXiv:1907.12209v22019HoVer-Net: Simultaneous Segmentation and Classification of Nuclei in Multi-Tissue Histology Images
Simon Graham, Quoc Dang Vu, Shan E Ahmed Raza +4
cs.CVarXiv:1812.06499v52018Graph Stacked Hourglass Networks for 3D Human Pose Estimation
Tianhan Xu, Wataru Takano
cs.CVarXiv:2103.16385v12021In Ictu Oculi: Exposing AI Generated Fake Face Videos by Detecting Eye Blinking
Yuezun Li, Ming-Ching Chang, Siwei Lyu
cs.CVarXiv:1806.02877v22018Event-based Moving Object Detection and Tracking
Anton Mitrokhin, Cornelia Fermuller, Chethan Parameshwara +1
cs.CVarXiv:1803.04523v32018Video Generative Models as Geometry Learner
Haosen Yang, Jifei Song, Zhensong Zhang +2
cs.CVcs.AIarXiv:2608.28549v12026Towards Safe Autonomous Driving: Capture Uncertainty in the Deep Neural Network For Lidar 3D Vehicle Detection
Di Feng, Lars Rosenbaum, Klaus Dietmayer
cs.ROcs.CVarXiv:1804.05132v22018FVQA: Fact-based Visual Question Answering
Peng Wang, Qi Wu, Chunhua Shen +2
cs.CVarXiv:1606.05433v42016Playing hard exploration games by watching YouTube
Yusuf Aytar, Tobias Pfaff, David Budden +3
cs.LGcs.AIcs.CVarXiv:1805.11592v22018Multi-view Face Detection Using Deep Convolutional Neural Networks
Sachin Sudhakar Farfade, Mohammad Saberian, Li-Jia Li
cs.CVarXiv:1502.02766v32015Correlation Filters with Limited Boundaries
Hamed Kiani Galoogahi, Terence Sim, Simon Lucey
cs.CVarXiv:1403.7876v12014Marginal multi-Bernoulli filters: RFS derivation of MHT, JIPDA and association-based MeMBer
Jason L. Williams
eess.SYcs.CVarXiv:1203.2995v62012A-CNN: Annularly Convolutional Neural Networks on Point Clouds
Artem Komarichev, Zichun Zhong, Jing Hua
cs.CVarXiv:1904.08017v12019Symmetric Graph Convolutional Autoencoder for Unsupervised Graph Representation Learning
Jiwoong Park, Minsik Lee, Hyung Jin Chang +2
cs.LGcs.CVstat.MLarXiv:1908.02441v12019Versatile Diffusion: Text, Images and Variations All in One Diffusion Model
Xingqian Xu, Zhangyang Wang, Eric Zhang +2
cs.CVarXiv:2211.08332v42022ContactDB: Analyzing and Predicting Grasp Contact via Thermal Imaging
Samarth Brahmbhatt, Cusuh Ham, Charles C. Kemp +1
cs.CVarXiv:1904.06830v12019Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
Jiarong Han, Jincheng Xiong, Yuzhou Liu +6
cs.CVarXiv:2608.27529v12026BEVerse: Unified Perception and Prediction in Birds-Eye-View for Vision-Centric Autonomous Driving
Yunpeng Zhang, Zheng Zhu, Wenzhao Zheng +4
cs.CVarXiv:2205.09743v12022Scan2CAD: Learning CAD Model Alignment in RGB-D Scans
Armen Avetisyan, Manuel Dahnert, Angela Dai +3
cs.CVarXiv:1811.11187v12018End-to-End Model-Free Reinforcement Learning for Urban Driving using Implicit Affordances
Marin Toromanoff, Emilie Wirbel, Fabien Moutarde
cs.LGcs.AIcs.CVarXiv:1911.10868v22019