Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
12,541 to 12,600 of 18,866
NeRV: Neural Representations for Videos
Hao Chen, Bo He, Hanyu Wang +3
cs.CVeess.IVarXiv:2110.13903v12021Unsupervised Learning of 3D Structure from Images
Danilo Jimenez Rezende, S. M. Ali Eslami, Shakir Mohamed +3
cs.CVcs.LGstat.MLarXiv:1607.00662v22016MMTM: Multimodal Transfer Module for CNN Fusion
Hamid Reza Vaezi Joze, Amirreza Shaban, Michael L. Iuzzolino +1
cs.CVcs.LGarXiv:1911.08670v22019Topology-Preserving Deep Image Segmentation
Xiaoling Hu, Li Fuxin, Dimitris Samaras +1
cs.CVcs.CGarXiv:1906.05404v12019Point-Based Multi-View Stereo Network
Rui Chen, Songfang Han, Jing Xu +1
cs.CVarXiv:1908.04422v12019Neural Unsigned Distance Fields for Implicit Function Learning
Julian Chibane, Aymen Mir, Gerard Pons-Moll
cs.CVcs.LGarXiv:2010.13938v12020RAVEN: A Dataset for Relational and Analogical Visual rEasoNing
Chi Zhang, Feng Gao, Baoxiong Jia +2
cs.CVcs.AIcs.LGarXiv:1903.02741v12019ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve Network
Yuliang Liu, Hao Chen, Chunhua Shen +3
cs.CVarXiv:2002.10200v22020SpinNet: Learning a General Surface Descriptor for 3D Point Cloud Registration
Sheng Ao, Qingyong Hu, Bo Yang +2
cs.CVcs.AIcs.LGarXiv:2011.12149v22020Unsupervised Degradation Representation Learning for Blind Super-Resolution
Longguang Wang, Yingqian Wang, Xiaoyu Dong +4
cs.CVarXiv:2104.00416v12021GLAD: Global-Local-Alignment Descriptor for Pedestrian Retrieval
Longhui Wei, Shiliang Zhang, Hantao Yao +2
cs.CVarXiv:1709.04329v12017Ordinal Depth Supervision for 3D Human Pose Estimation
Georgios Pavlakos, Xiaowei Zhou, Kostas Daniilidis
cs.CVarXiv:1805.04095v12018Stratified Transformer for 3D Point Cloud Segmentation
Xin Lai, Jianhui Liu, Li Jiang +5
cs.CVcs.AIarXiv:2203.14508v12022Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos
Baixuan Xu, Yinyui Xu, Tianshi Zheng +9
cs.CVcs.LGarXiv:2608.26355v12026UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation
Huaishao Luo, Lei Ji, Botian Shi +6
cs.CVcs.CLcs.LGarXiv:2002.06353v32020IDD: A Dataset for Exploring Problems of Autonomous Navigation in Unconstrained Environments
Girish Varma, Anbumani Subramanian, Anoop Namboodiri +2
cs.CVcs.ROarXiv:1811.10200v12018Transformers in Medical Image Analysis: A Review
Kelei He, Chen Gan, Zhuoyuan Li +7
cs.CVarXiv:2202.12165v32022RankSRGAN: Generative Adversarial Networks with Ranker for Image Super-Resolution
Wenlong Zhang, Yihao Liu, Chao Dong +1
cs.CVarXiv:1908.06382v22019InterHand2.6M: A Dataset and Baseline for 3D Interacting Hand Pose Estimation from a Single RGB Image
Gyeongsik Moon, Shoou-i Yu, He Wen +2
cs.CVarXiv:2008.09309v12020DeepCut: Object Segmentation from Bounding Box Annotations using Convolutional Neural Networks
Martin Rajchl, Matthew C. H. Lee, Ozan Oktay +8
cs.CVarXiv:1605.07866v22016Light Field Networks: Neural Scene Representations with Single-Evaluation Rendering
Vincent Sitzmann, Semon Rezchikov, William T. Freeman +2
cs.CVcs.AIcs.GRarXiv:2106.02634v220213D Human Pose Estimation from a Single Image via Distance Matrix Regression
Francesc Moreno-Noguer
cs.CVarXiv:1611.09010v12016Boosting the accuracy of multi-spectral image pan-sharpening by learning a deep residual network
Yancong Wei, Qiangqiang Yuan, Huanfeng Shen +1
cs.CVarXiv:1705.07556v22017Coded aperture compressive temporal imaging
Patrick Llull, Xuejun Liao, Xin Yuan +5
cs.CVcs.ITarXiv:1302.2575v12013Siamese Cascaded Region Proposal Networks for Real-Time Visual Tracking
Heng Fan, Haibin Ling
cs.CVarXiv:1812.06148v12018PyramidBox: A Context-assisted Single Shot Face Detector
Xu Tang, Daniel K. Du, Zeqiang He +1
cs.CVarXiv:1803.07737v22018DIDFuse: Deep Image Decomposition for Infrared and Visible Image Fusion
Zixiang Zhao, Shuang Xu, Chunxia Zhang +3
eess.IVcs.CVarXiv:2003.09210v32020Fast Convergence of DETR with Spatially Modulated Co-Attention
Peng Gao, Minghang Zheng, Xiaogang Wang +2
cs.CVarXiv:2101.07448v12021A Comprehensive Review of Image Enhancement Techniques
Raman Maini, Himanshu Aggarwal
cs.CVarXiv:1003.4053v12010Improving Calibration for Long-Tailed Recognition
Zhisheng Zhong, Jiequan Cui, Shu Liu +1
cs.CVarXiv:2104.00466v12021A Hierarchical Approach for Generating Descriptive Image Paragraphs
Jonathan Krause, Justin Johnson, Ranjay Krishna +1
cs.CVcs.CLarXiv:1611.06607v22016Dataset Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses
Micah Goldblum, Dimitris Tsipras, Chulin Xie +6
cs.LGcs.AIcs.CRarXiv:2012.10544v42020Robust Motion In-betweening
Félix G. Harvey, Mike Yurick, Derek Nowrouzezahrai +1
cs.CVcs.GRcs.LGarXiv:2102.04942v12021Contrastive Test-Time Adaptation
Dian Chen, Dequan Wang, Trevor Darrell +1
cs.CVarXiv:2204.10377v12022Learning Deep Features for One-Class Classification
Pramuditha Perera, Vishal M. Patel
cs.CVarXiv:1801.05365v22018HAWQ-V2: Hessian Aware trace-Weighted Quantization of Neural Networks
Zhen Dong, Zhewei Yao, Yaohui Cai +4
cs.CVarXiv:1911.03852v12019Learning Attentive Pairwise Interaction for Fine-Grained Classification
Peiqin Zhuang, Yali Wang, Yu Qiao
cs.CVarXiv:2002.10191v12020Mask-guided Spectral-wise Transformer for Efficient Hyperspectral Image Reconstruction
Yuanhao Cai, Jing Lin, Xiaowan Hu +5
eess.IVcs.CVarXiv:2111.07910v22021RobustNet: Improving Domain Generalization in Urban-Scene Segmentation via Instance Selective Whitening
Sungha Choi, Sanghun Jung, Huiwon Yun +3
cs.CVarXiv:2103.15597v22021EmoNets: Multimodal deep learning approaches for emotion recognition in video
Samira Ebrahimi Kahou, Xavier Bouthillier, Pascal Lamblin +15
cs.LGcs.CVarXiv:1503.01800v22015Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling
Sibo Dong, Sarah Adel Bargal
cs.CVarXiv:2608.27280v12026SVDiff: Compact Parameter Space for Diffusion Fine-Tuning
Ligong Han, Yinxiao Li, Han Zhang +3
cs.CVarXiv:2303.11305v42023Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models
Ziyue Wang, Shiqi Huang, Weiwen Xu +2
cs.CVarXiv:2608.27065v12026Continual Learning of Context-dependent Processing in Neural Networks
Guanxiong Zeng, Yang Chen, Bo Cui +1
cs.LGcs.AIcs.CVarXiv:1810.01256v32018Unsupervised Intra-domain Adaptation for Semantic Segmentation through Self-Supervision
Fei Pan, Inkyu Shin, Francois Rameau +2
cs.CVcs.LGcs.ROarXiv:2004.07703v42020RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
Zijian Kan, Wei Wang, Long Luo +6
cs.CVarXiv:2608.26956v12026Multi-Image Visual Token Pruning in Large Visual Language Models
Rongyang Zhang, Chengqiang Lu, Cong Li +9
cs.CVarXiv:2608.26806v12026Cross-Architecture Knowledge Distillation from a Vision Foundation Model to a Lightweight Visual State Space Model for Tea Leaf Disease Classification
Zibo Zhou, Zongsen Qiu, Rui Chen +3
cs.CVarXiv:2608.26771v12026DistancePPG: Robust non-contact vital signs monitoring using a camera
Mayank Kumar, Ashok Veeraraghavan, Ashutosh Sabharval
cs.CVarXiv:1502.08040v22015Part-aware Prototype Network for Few-shot Semantic Segmentation
Yongfei Liu, Xiangyi Zhang, Songyang Zhang +1
cs.CVarXiv:2007.06309v32020Dose-PlanNet: Physics Based Radiotherapy Dose Prediction with Deep Learning
Ankit Bhattacharjee, Sougata Maity, Santam Chakraborty +1
physics.med-phcs.CVcs.LGarXiv:2608.26901v12026VOLO: Vision Outlooker for Visual Recognition
Li Yuan, Qibin Hou, Zihang Jiang +2
cs.CVarXiv:2106.13112v22021Unbiased Mean Teacher for Cross-domain Object Detection
Jinhong Deng, Wen Li, Yuhua Chen +1
cs.CVarXiv:2003.00707v22020How Much Position Information Do Convolutional Neural Networks Encode?
Md Amirul Islam, Sen Jia, Neil D. B. Bruce
cs.CVcs.LGarXiv:2001.08248v12020MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model
Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew +5
cs.CVcs.GRarXiv:2311.16498v12023Understanding Human Hands in Contact at Internet Scale
Dandan Shan, Jiaqi Geng, Michelle Shu +1
cs.CVarXiv:2006.06669v12020Robust Face Recognition via Multimodal Deep Face Representation
Changxing Ding, Dacheng Tao
cs.CVarXiv:1509.00244v12015GeoMAD: Geometry-Aware Multi-View Anomaly Detection via Deformable Fusion and Distributional Alignment
Shang-Fu Chen, Jhih-Ciang Wu, Kuan-Chuan Peng +2
cs.CVarXiv:2608.26724v12026UniGeo: A Multi-modal Large Language Model for Text-Guided Cross-View Geo-Localization
Jiahao Wen, Hang Yu, Zhedong Zheng
cs.CVarXiv:2608.26722v12026Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion
Tianpei Gu, Guangyi Chen, Junlong Li +4
cs.CVcs.LGarXiv:2203.13777v12022