Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
7,921 to 7,980 of 18,839
Non-Salient Region Object Mining for Weakly Supervised Semantic Segmentation
Yazhou Yao, Tao Chen, Guosen Xie +5
cs.CVarXiv:2103.14581v12021Resource Efficient 3D Convolutional Neural Networks
Okan Köpüklü, Neslihan Kose, Ahmet Gunduz +1
cs.CVarXiv:1904.02422v52019Holistic Evaluation of Text-To-Image Models
Tony Lee, Michihiro Yasunaga, Chenlin Meng +15
cs.CVcs.LGarXiv:2311.04287v12023Richly Activated Graph Convolutional Network for Robust Skeleton-based Action Recognition
Yi-Fan Song, Zhang Zhang, Caifeng Shan +1
cs.CVarXiv:2008.03791v22020P-STMO: Pre-Trained Spatial Temporal Many-to-One Model for 3D Human Pose Estimation
Wenkang Shan, Zhenhua Liu, Xinfeng Zhang +3
cs.CVarXiv:2203.07628v22022Distortion Agnostic Deep Watermarking
Xiyang Luo, Ruohan Zhan, Huiwen Chang +2
cs.MMcs.CVcs.LGarXiv:2001.04580v12020Rethinking Architecture Selection in Differentiable NAS
Ruochen Wang, Minhao Cheng, Xiangning Chen +2
cs.LGcs.CVarXiv:2108.04392v12021Fast Guided Filter
Kaiming He, Jian Sun
cs.CVarXiv:1505.00996v12015Using a single RGB frame for real time 3D hand pose estimation in the wild
Paschalis Panteleris, Iason Oikonomidis, Antonis Argyros
cs.CVarXiv:1712.03866v12017Recurrent Topic-Transition GAN for Visual Paragraph Generation
Xiaodan Liang, Zhiting Hu, Hao Zhang +2
cs.CVcs.AIcs.LGarXiv:1703.07022v22017Parallel Multiscale Autoregressive Density Estimation
Scott Reed, Aäron van den Oord, Nal Kalchbrenner +4
cs.CVcs.NEarXiv:1703.03664v12017TEACH: Temporal Action Composition for 3D Humans
Nikos Athanasiou, Mathis Petrovich, Michael J. Black +1
cs.CVarXiv:2209.04066v22022Temporally Distributed Networks for Fast Video Semantic Segmentation
Ping Hu, Fabian Caba Heilbron, Oliver Wang +3
cs.CVcs.LGcs.MMarXiv:2004.01800v22020Rad-R: A Raw-ADC Radar Dataset and Capture-Invariant SSM for Hardware-Fault Diagnosis
Mainak Mallick, Junghwan Yim, Seung-Kyum Choi
cs.CVarXiv:2608.30896v12026Semantic Relation Reasoning for Shot-Stable Few-Shot Object Detection
Chenchen Zhu, Fangyi Chen, Uzair Ahmed +2
cs.CVarXiv:2103.01903v22021Coming Down to Earth: Satellite-to-Street View Synthesis for Geo-Localization
Aysim Toker, Qunjie Zhou, Maxim Maximov +1
cs.CVarXiv:2103.06818v12021Combining Implicit Function Learning and Parametric Models for 3D Human Reconstruction
Bharat Lal Bhatnagar, Cristian Sminchisescu, Christian Theobalt +1
cs.CVarXiv:2007.11432v22020Ranking Based Locality Sensitive Hashing Enabled Cancelable Biometrics: Index-of-Max Hashing
Zhe Jin, Yen-Lung Lai, Jung-Yeon Hwang +2
cs.CVarXiv:1703.05455v22017TorchXRayVision: A library of chest X-ray datasets and models
Joseph Paul Cohen, Joseph D. Viviano, Paul Bertin +8
eess.IVcs.AIcs.CVarXiv:2111.00595v12021Background Matting: The World is Your Green Screen
Soumyadip Sengupta, Vivek Jayaram, Brian Curless +2
cs.CVarXiv:2004.00626v22020OptiGeo: Efficient Monocular Geometry for Embodied Perception in Optically Challenging Scenes
Muxin Liu, Tianbo Liu, Jing Xia +7
cs.CVarXiv:2608.29881v12026PolyFormer: Referring Image Segmentation as Sequential Polygon Generation
Jiang Liu, Hui Ding, Zhaowei Cai +4
cs.CVarXiv:2302.07387v22023Knowing Beyond the Known: Reinforced Knowledge Specification for Multi-Label Class-Incremental Learning
Aoting Zhang, Dongbao Yang, Chang Liu +3
cs.CVarXiv:2608.30316v12026Hierarchical Aggregation for 3D Instance Segmentation
Shaoyu Chen, Jiemin Fang, Qian Zhang +2
cs.CVarXiv:2108.02350v12021Prithvi-EO-2.0: A Versatile Multi-Temporal Foundation Model for Earth Observation Applications
Daniela Szwarcman, Sujit Roy, Paolo Fraccaro +33
cs.CVarXiv:2412.02732v32024CitySim: A Drone-Based Vehicle Trajectory Dataset for Safety Oriented Research and Digital Twins
Ou Zheng, Mohamed Abdel-Aty, Lishengsa Yue +3
cs.CVstat.MLarXiv:2208.11036v22022A Survey on Visual Mamba
Hanwei Zhang, Ying Zhu, Dan Wang +3
cs.CVarXiv:2404.15956v22024Visual Speech Recognition for Multiple Languages in the Wild
Pingchuan Ma, Stavros Petridis, Maja Pantic
cs.CVcs.SDeess.ASarXiv:2202.13084v22022InfLoRA: Interference-Free Low-Rank Adaptation for Continual Learning
Yan-Shuo Liang, Wu-Jun Li
cs.LGcs.AIcs.CVarXiv:2404.00228v32024SS-IL: Separated Softmax for Incremental Learning
Hongjoon Ahn, Jihwan Kwak, Subin Lim +3
cs.CVarXiv:2003.13947v32020Entropy Maximization and Meta Classification for Out-Of-Distribution Detection in Semantic Segmentation
Robin Chan, Matthias Rottmann, Hanno Gottschalk
cs.CVcs.LGarXiv:2012.06575v22020FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models
Vladimir Kulikov, Matan Kleiner, Inbar Huberman-Spiegelglas +1
cs.CVcs.LGarXiv:2412.08629v22024Semantic Amodal Segmentation
Yan Zhu, Yuandong Tian, Dimitris Mexatas +1
cs.CVarXiv:1509.01329v22015Leveraging Real Talking Faces via Self-Supervision for Robust Forgery Detection
Alexandros Haliassos, Rodrigo Mira, Stavros Petridis +1
cs.CVarXiv:2201.07131v32022Delivering Arbitrary-Modal Semantic Segmentation
Jiaming Zhang, Ruiping Liu, Hao Shi +6
cs.CVarXiv:2303.01480v12023UNIT-DDPM: UNpaired Image Translation with Denoising Diffusion Probabilistic Models
Hiroshi Sasaki, Chris G. Willcocks, Toby P. Breckon
cs.CVcs.LGeess.IVarXiv:2104.05358v12021Deep Learning for Instance Retrieval: A Survey
Wei Chen, Yu Liu, Weiping Wang +5
cs.CVarXiv:2101.11282v42021Instance-Level Segmentation for Autonomous Driving with Deep Densely Connected MRFs
Ziyu Zhang, Sanja Fidler, Raquel Urtasun
cs.CVarXiv:1512.06735v22015Segmentation and Classification of Skin Lesions for Disease Diagnosis
Sumithra R, Mahamad Suhil, D. S. Guru
cs.CVarXiv:1609.03277v12016Physical Adversarial Examples for Person Detectors in Thermal Images Based on 3D Modeling
Xiaopei Zhu, Siyuan Huang, Zhanhao Hu +3
cs.CVarXiv:2608.30839v12026Ambiguous Medical Image Segmentation using Diffusion Models
Aimon Rahman, Jeya Maria Jose Valanarasu, Ilker Hacihaliloglu +1
cs.CVarXiv:2304.04745v12023Predicting Cognitive Decline with Deep Learning of Brain Metabolism and Amyloid Imaging
Hongyoon Choi, Kyong Hwan Jin
cs.CVcs.AIstat.MLarXiv:1704.06033v12017EgoMimic: Scaling Imitation Learning via Egocentric Video
Simar Kareer, Dhruv Patel, Ryan Punamiya +5
cs.ROcs.CVarXiv:2410.24221v12024A Comprehensive Study of Deep Video Action Recognition
Yi Zhu, Xinyu Li, Chunhui Liu +7
cs.CVcs.MMarXiv:2012.06567v12020Biomechanical 3D Body: Self-Supervised Distillation of Biomechanical Pose from a 3D Body Foundation Model
R. James Cotton, J. D. Peiffer, Lucinda Williamson +2
cs.CVarXiv:2608.29928v12026DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation
Guosheng Zhao, Xiaofeng Wang, Zheng Zhu +4
cs.CVarXiv:2403.06845v22024Revisiting Batch Normalization for Training Low-latency Deep Spiking Neural Networks from Scratch
Youngeun Kim, Priyadarshini Panda
cs.CVcs.AIcs.NEarXiv:2010.01729v52020Weakly Supervised Action Learning with RNN based Fine-to-coarse Modeling
Alexander Richard, Hilde Kuehne, Juergen Gall
cs.CVarXiv:1703.08132v32017Pretrained, Curriculum-Tuned, and Ensembled: A Tracer-Aware Interactive Segmentation Pipeline for AutoPET V
Xinglong Liang, Chunyao Lu, Tianyu Zhang +4
cs.CVcs.AIarXiv:2608.30844v12026Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum
Xingjian Wang, Shijian Wang, Yibo Wang +4
cs.CVarXiv:2608.30584v12026Learning Representations for Neural Network-Based Classification Using the Information Bottleneck Principle
Rana Ali Amjad, Bernhard C. Geiger
cs.LGcs.CVcs.ITarXiv:1802.09766v62018Language-Driven Representation Learning for Robotics
Siddharth Karamcheti, Suraj Nair, Annie S. Chen +4
cs.ROcs.AIcs.CLarXiv:2302.12766v12023Detection and Segmentation of Manufacturing Defects with Convolutional Neural Networks and Transfer Learning
Max Ferguson, Ronay Ak, Yung-Tsun Tina Lee +1
cs.CVarXiv:1808.02518v22018Conducting Stylistic Analysis of Paintings through an Art-History Agent
Marc S. Walton, Astrid Harth
cs.CVcs.AIcs.CLarXiv:2608.29644v12026Jointly Optimize Data Augmentation and Network Training: Adversarial Data Augmentation in Human Pose Estimation
Xi Peng, Zhiqiang Tang, Fei Yang +2
cs.CVarXiv:1805.09707v12018Masked World Models for Visual Control
Younggyo Seo, Danijar Hafner, Hao Liu +4
cs.ROcs.AIcs.CVarXiv:2206.14244v32022Improving Object Detection with Deep Convolutional Networks via Bayesian Optimization and Structured Prediction
Yuting Zhang, Kihyuk Sohn, Ruben Villegas +2
cs.CVarXiv:1504.03293v32015Learning a Deep Model for Human Action Recognition from Novel Viewpoints
Hossein Rahmani, Ajmal Mian, Mubarak Shah
cs.CVarXiv:1602.00828v12016Rethinking Soft Labels for Knowledge Distillation: A Bias-Variance Tradeoff Perspective
Helong Zhou, Liangchen Song, Jiajie Chen +4
cs.LGcs.CVarXiv:2102.00650v12021SPICE: Semantic Pseudo-labeling for Image Clustering
Chuang Niu, Hongming Shan, Ge Wang
cs.CVcs.AIarXiv:2103.09382v32021