Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

10,201 to 10,260 of 18,840

  1. Scan2Cap: Context-aware Dense Captioning in RGB-D Scans

    Dave Zhenyu Chen, Ali Gholami, Matthias Nießner +1

    cs.CVcs.LGeess.IVarXiv:2012.02206v12020
  2. Clothes-Changing Person Re-identification with RGB Modality Only

    Xinqian Gu, Hong Chang, Bingpeng Ma +3

    cs.CVarXiv:2204.06890v12022
  3. Facial Expression Recognition using Convolutional Neural Networks: State of the Art

    Christopher Pramerdorfer, Martin Kampel

    cs.CVarXiv:1612.02903v12016
  4. RFAConv: Receptive-Field Attention Convolution for Improving Convolutional Neural Networks

    Xin Zhang, Chen Liu, Degang Yang +4

    cs.CVarXiv:2304.03198v72023
  5. DeepFake Detection Based on the Discrepancy Between the Face and its Context

    Yuval Nirkin, Lior Wolf, Yosi Keller +1

    cs.CVcs.LGarXiv:2008.12262v12020
  6. 3DRegNet: A Deep Neural Network for 3D Point Registration

    G. Dias Pais, Srikumar Ramalingam, Venu Madhav Govindu +3

    cs.CVarXiv:1904.01701v22019
  7. Single Image Deraining: From Model-Based to Data-Driven and Beyond

    Wenhan Yang, Robby T. Tan, Shiqi Wang +2

    eess.IVcs.CVarXiv:1912.07150v22019
  8. Unsupervised 3D End-to-End Medical Image Registration with Volume Tweening Network

    Shengyu Zhao, Tingfung Lau, Ji Luo +2

    cs.CVarXiv:1902.05020v32019
  9. Dual Diffusion Implicit Bridges for Image-to-Image Translation

    Xuan Su, Jiaming Song, Chenlin Meng +1

    cs.CVcs.AIcs.LGarXiv:2203.08382v42022
  10. Contrastive Learning Inverts the Data Generating Process

    Roland S. Zimmermann, Yash Sharma, Steffen Schneider +2

    cs.LGcs.CVarXiv:2102.08850v42021
  11. Parallel Tracking and Verifying: A Framework for Real-Time and High Accuracy Visual Tracking

    Heng Fan, Haibin Ling

    cs.CVarXiv:1708.00153v12017
  12. FQ-ViT: Post-Training Quantization for Fully Quantized Vision Transformer

    Yang Lin, Tianyu Zhang, Peiqin Sun +2

    cs.CVarXiv:2111.13824v42021
  13. SegGPT: Segmenting Everything In Context

    Xinlong Wang, Xiaosong Zhang, Yue Cao +3

    cs.CVarXiv:2304.03284v12023
  14. TeCNO: Surgical Phase Recognition with Multi-Stage Temporal Convolutional Networks

    Tobias Czempiel, Magdalini Paschali, Matthias Keicher +4

    eess.IVcs.CVcs.LGarXiv:2003.10751v12020
  15. Sequential Modeling Enables Scalable Learning for Large Vision Models

    Yutong Bai, Xinyang Geng, Karttikeya Mangalam +5

    cs.CVarXiv:2312.00785v12023
  16. Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

    Yiqi Zhu, Feiyu Gao, Jiaxing Fan +7

    cs.AIcs.CVarXiv:2608.27477v12026
  17. Densely Residual Laplacian Super-Resolution

    Saeed Anwar, Nick Barnes

    eess.IVcs.CVarXiv:1906.12021v22019
  18. Diversified Texture Synthesis with Feed-forward Networks

    Yijun Li, Chen Fang, Jimei Yang +3

    cs.CVarXiv:1703.01664v12017
  19. Factorizable Net: An Efficient Subgraph-based Framework for Scene Graph Generation

    Yikang Li, Wanli Ouyang, Bolei Zhou +3

    cs.CVarXiv:1806.11538v22018
  20. PONI: Potential Functions for ObjectGoal Navigation with Interaction-free Learning

    Santhosh Kumar Ramakrishnan, Devendra Singh Chaplot, Ziad Al-Halah +2

    cs.CVcs.AIarXiv:2201.10029v22022
  21. Break-A-Scene: Extracting Multiple Concepts from a Single Image

    Omri Avrahami, Kfir Aberman, Ohad Fried +2

    cs.CVcs.GRcs.LGarXiv:2305.16311v22023
  22. Polysemous Visual-Semantic Embedding for Cross-Modal Retrieval

    Yale Song, Mohammad Soleymani

    cs.CVarXiv:1906.04402v22019
  23. Biometric Face Presentation Attack Detection with Multi-Channel Convolutional Neural Network

    Anjith George, Zohreh Mostaani, David Geissenbuhler +3

    cs.CVcs.CRarXiv:1909.08848v12019
  24. Local Texture Estimator for Implicit Representation Function

    Jaewon Lee, Kyong Hwan Jin

    cs.CVeess.IVarXiv:2111.08918v62021
  25. A Comprehensive Survey on Source-free Domain Adaptation

    Zhiqi Yu, Jingjing Li, Zhekai Du +2

    cs.LGcs.CVcs.MMarXiv:2302.11803v12023
  26. MARCO: Navigating the Unseen Space of Semantic Correspondence

    Claudia Cuttano, Gabriele Trivigno, Carlo Masone +1

    cs.CVarXiv:2604.18267v12026
  27. VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion

    Yiming Li, Zhiding Yu, Christopher Choy +5

    cs.CVcs.AIcs.LGarXiv:2302.12251v22023
  28. CirCNN: Accelerating and Compressing Deep Neural Networks Using Block-CirculantWeight Matrices

    Caiwen Ding, Siyu Liao, Yanzhi Wang +13

    cs.CVcs.AIcs.LGarXiv:1708.08917v12017
  29. Co$^2$L: Contrastive Continual Learning

    Hyuntak Cha, Jaeho Lee, Jinwoo Shin

    cs.LGcs.CVarXiv:2106.14413v12021
  30. Group-Free 3D Object Detection via Transformers

    Ze Liu, Zheng Zhang, Yue Cao +2

    cs.CVarXiv:2104.00678v22021
  31. Vision Transformers for Dense Prediction

    René Ranftl, Alexey Bochkovskiy, Vladlen Koltun

    cs.CVarXiv:2103.13413v12021
  32. SINet: A Scale-insensitive Convolutional Neural Network for Fast Vehicle Detection

    Xiaowei Hu, Xuemiao Xu, Yongjie Xiao +4

    cs.CVarXiv:1804.00433v22018
  33. FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose Estimation

    Yisheng He, Haibin Huang, Haoqiang Fan +2

    cs.CVcs.ROarXiv:2103.02242v12021
  34. Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

    Senqiao Yang, Chengyao Wang, Yuxin Chen +13

    cs.ROcs.CVarXiv:2608.27550v12026
  35. Single-Stage Semantic Segmentation from Image Labels

    Nikita Araslanov, Stefan Roth

    cs.CVcs.LGarXiv:2005.08104v12020
  36. Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions

    Hongwei Xue, Tiankai Hang, Yanhong Zeng +5

    cs.CVarXiv:2111.10337v22021
  37. ASLFeat: Learning Local Features of Accurate Shape and Localization

    Zixin Luo, Lei Zhou, Xuyang Bai +6

    cs.CVarXiv:2003.10071v22020
  38. Towards Fairer Datasets: Filtering and Balancing the Distribution of the People Subtree in the ImageNet Hierarchy

    Kaiyu Yang, Klint Qinami, Li Fei-Fei +2

    cs.CVarXiv:1912.07726v12019
  39. Learning Open Set Network with Discriminative Reciprocal Points

    Guangyao Chen, Limeng Qiao, Yemin Shi +5

    cs.CVcs.LGarXiv:2011.00178v12020
  40. PlotQA: Reasoning over Scientific Plots

    Nitesh Methani, Pritha Ganguly, Mitesh M. Khapra +1

    cs.CVcs.AIcs.CLarXiv:1909.00997v32019
  41. Enforcing geometric constraints of virtual normal for depth prediction

    Wei Yin, Yifan Liu, Chunhua Shen +1

    cs.CVarXiv:1907.12209v22019
  42. HoVer-Net: Simultaneous Segmentation and Classification of Nuclei in Multi-Tissue Histology Images

    Simon Graham, Quoc Dang Vu, Shan E Ahmed Raza +4

    cs.CVarXiv:1812.06499v52018
  43. Graph Stacked Hourglass Networks for 3D Human Pose Estimation

    Tianhan Xu, Wataru Takano

    cs.CVarXiv:2103.16385v12021
  44. In Ictu Oculi: Exposing AI Generated Fake Face Videos by Detecting Eye Blinking

    Yuezun Li, Ming-Ching Chang, Siwei Lyu

    cs.CVarXiv:1806.02877v22018
  45. Event-based Moving Object Detection and Tracking

    Anton Mitrokhin, Cornelia Fermuller, Chethan Parameshwara +1

    cs.CVarXiv:1803.04523v32018
  46. Video Generative Models as Geometry Learner

    Haosen Yang, Jifei Song, Zhensong Zhang +2

    cs.CVcs.AIarXiv:2608.28549v12026
  47. Towards Safe Autonomous Driving: Capture Uncertainty in the Deep Neural Network For Lidar 3D Vehicle Detection

    Di Feng, Lars Rosenbaum, Klaus Dietmayer

    cs.ROcs.CVarXiv:1804.05132v22018
  48. FVQA: Fact-based Visual Question Answering

    Peng Wang, Qi Wu, Chunhua Shen +2

    cs.CVarXiv:1606.05433v42016
  49. Playing hard exploration games by watching YouTube

    Yusuf Aytar, Tobias Pfaff, David Budden +3

    cs.LGcs.AIcs.CVarXiv:1805.11592v22018
  50. Multi-view Face Detection Using Deep Convolutional Neural Networks

    Sachin Sudhakar Farfade, Mohammad Saberian, Li-Jia Li

    cs.CVarXiv:1502.02766v32015
  51. Correlation Filters with Limited Boundaries

    Hamed Kiani Galoogahi, Terence Sim, Simon Lucey

    cs.CVarXiv:1403.7876v12014
  52. Marginal multi-Bernoulli filters: RFS derivation of MHT, JIPDA and association-based MeMBer

    Jason L. Williams

    eess.SYcs.CVarXiv:1203.2995v62012
  53. A-CNN: Annularly Convolutional Neural Networks on Point Clouds

    Artem Komarichev, Zichun Zhong, Jing Hua

    cs.CVarXiv:1904.08017v12019
  54. Symmetric Graph Convolutional Autoencoder for Unsupervised Graph Representation Learning

    Jiwoong Park, Minsik Lee, Hyung Jin Chang +2

    cs.LGcs.CVstat.MLarXiv:1908.02441v12019
  55. Versatile Diffusion: Text, Images and Variations All in One Diffusion Model

    Xingqian Xu, Zhangyang Wang, Eric Zhang +2

    cs.CVarXiv:2211.08332v42022
  56. ContactDB: Analyzing and Predicting Grasp Contact via Thermal Imaging

    Samarth Brahmbhatt, Cusuh Ham, Charles C. Kemp +1

    cs.CVarXiv:1904.06830v12019
  57. Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

    Jiarong Han, Jincheng Xiong, Yuzhou Liu +6

    cs.CVarXiv:2608.27529v12026
  58. BEVerse: Unified Perception and Prediction in Birds-Eye-View for Vision-Centric Autonomous Driving

    Yunpeng Zhang, Zheng Zhu, Wenzhao Zheng +4

    cs.CVarXiv:2205.09743v12022
  59. Scan2CAD: Learning CAD Model Alignment in RGB-D Scans

    Armen Avetisyan, Manuel Dahnert, Angela Dai +3

    cs.CVarXiv:1811.11187v12018
  60. End-to-End Model-Free Reinforcement Learning for Urban Driving using Implicit Affordances

    Marin Toromanoff, Emilie Wirbel, Fabien Moutarde

    cs.LGcs.AIcs.CVarXiv:1911.10868v22019