Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

7,921 to 7,980 of 18,839

  1. Non-Salient Region Object Mining for Weakly Supervised Semantic Segmentation

    Yazhou Yao, Tao Chen, Guosen Xie +5

    cs.CVarXiv:2103.14581v12021
  2. Resource Efficient 3D Convolutional Neural Networks

    Okan Köpüklü, Neslihan Kose, Ahmet Gunduz +1

    cs.CVarXiv:1904.02422v52019
  3. Holistic Evaluation of Text-To-Image Models

    Tony Lee, Michihiro Yasunaga, Chenlin Meng +15

    cs.CVcs.LGarXiv:2311.04287v12023
  4. Richly Activated Graph Convolutional Network for Robust Skeleton-based Action Recognition

    Yi-Fan Song, Zhang Zhang, Caifeng Shan +1

    cs.CVarXiv:2008.03791v22020
  5. P-STMO: Pre-Trained Spatial Temporal Many-to-One Model for 3D Human Pose Estimation

    Wenkang Shan, Zhenhua Liu, Xinfeng Zhang +3

    cs.CVarXiv:2203.07628v22022
  6. Distortion Agnostic Deep Watermarking

    Xiyang Luo, Ruohan Zhan, Huiwen Chang +2

    cs.MMcs.CVcs.LGarXiv:2001.04580v12020
  7. Rethinking Architecture Selection in Differentiable NAS

    Ruochen Wang, Minhao Cheng, Xiangning Chen +2

    cs.LGcs.CVarXiv:2108.04392v12021
  8. Fast Guided Filter

    Kaiming He, Jian Sun

    cs.CVarXiv:1505.00996v12015
  9. Using a single RGB frame for real time 3D hand pose estimation in the wild

    Paschalis Panteleris, Iason Oikonomidis, Antonis Argyros

    cs.CVarXiv:1712.03866v12017
  10. Recurrent Topic-Transition GAN for Visual Paragraph Generation

    Xiaodan Liang, Zhiting Hu, Hao Zhang +2

    cs.CVcs.AIcs.LGarXiv:1703.07022v22017
  11. Parallel Multiscale Autoregressive Density Estimation

    Scott Reed, Aäron van den Oord, Nal Kalchbrenner +4

    cs.CVcs.NEarXiv:1703.03664v12017
  12. TEACH: Temporal Action Composition for 3D Humans

    Nikos Athanasiou, Mathis Petrovich, Michael J. Black +1

    cs.CVarXiv:2209.04066v22022
  13. Temporally Distributed Networks for Fast Video Semantic Segmentation

    Ping Hu, Fabian Caba Heilbron, Oliver Wang +3

    cs.CVcs.LGcs.MMarXiv:2004.01800v22020
  14. Rad-R: A Raw-ADC Radar Dataset and Capture-Invariant SSM for Hardware-Fault Diagnosis

    Mainak Mallick, Junghwan Yim, Seung-Kyum Choi

    cs.CVarXiv:2608.30896v12026
  15. Semantic Relation Reasoning for Shot-Stable Few-Shot Object Detection

    Chenchen Zhu, Fangyi Chen, Uzair Ahmed +2

    cs.CVarXiv:2103.01903v22021
  16. Coming Down to Earth: Satellite-to-Street View Synthesis for Geo-Localization

    Aysim Toker, Qunjie Zhou, Maxim Maximov +1

    cs.CVarXiv:2103.06818v12021
  17. Combining Implicit Function Learning and Parametric Models for 3D Human Reconstruction

    Bharat Lal Bhatnagar, Cristian Sminchisescu, Christian Theobalt +1

    cs.CVarXiv:2007.11432v22020
  18. Ranking Based Locality Sensitive Hashing Enabled Cancelable Biometrics: Index-of-Max Hashing

    Zhe Jin, Yen-Lung Lai, Jung-Yeon Hwang +2

    cs.CVarXiv:1703.05455v22017
  19. TorchXRayVision: A library of chest X-ray datasets and models

    Joseph Paul Cohen, Joseph D. Viviano, Paul Bertin +8

    eess.IVcs.AIcs.CVarXiv:2111.00595v12021
  20. Background Matting: The World is Your Green Screen

    Soumyadip Sengupta, Vivek Jayaram, Brian Curless +2

    cs.CVarXiv:2004.00626v22020
  21. OptiGeo: Efficient Monocular Geometry for Embodied Perception in Optically Challenging Scenes

    Muxin Liu, Tianbo Liu, Jing Xia +7

    cs.CVarXiv:2608.29881v12026
  22. PolyFormer: Referring Image Segmentation as Sequential Polygon Generation

    Jiang Liu, Hui Ding, Zhaowei Cai +4

    cs.CVarXiv:2302.07387v22023
  23. Knowing Beyond the Known: Reinforced Knowledge Specification for Multi-Label Class-Incremental Learning

    Aoting Zhang, Dongbao Yang, Chang Liu +3

    cs.CVarXiv:2608.30316v12026
  24. Hierarchical Aggregation for 3D Instance Segmentation

    Shaoyu Chen, Jiemin Fang, Qian Zhang +2

    cs.CVarXiv:2108.02350v12021
  25. Prithvi-EO-2.0: A Versatile Multi-Temporal Foundation Model for Earth Observation Applications

    Daniela Szwarcman, Sujit Roy, Paolo Fraccaro +33

    cs.CVarXiv:2412.02732v32024
  26. CitySim: A Drone-Based Vehicle Trajectory Dataset for Safety Oriented Research and Digital Twins

    Ou Zheng, Mohamed Abdel-Aty, Lishengsa Yue +3

    cs.CVstat.MLarXiv:2208.11036v22022
  27. A Survey on Visual Mamba

    Hanwei Zhang, Ying Zhu, Dan Wang +3

    cs.CVarXiv:2404.15956v22024
  28. Visual Speech Recognition for Multiple Languages in the Wild

    Pingchuan Ma, Stavros Petridis, Maja Pantic

    cs.CVcs.SDeess.ASarXiv:2202.13084v22022
  29. InfLoRA: Interference-Free Low-Rank Adaptation for Continual Learning

    Yan-Shuo Liang, Wu-Jun Li

    cs.LGcs.AIcs.CVarXiv:2404.00228v32024
  30. SS-IL: Separated Softmax for Incremental Learning

    Hongjoon Ahn, Jihwan Kwak, Subin Lim +3

    cs.CVarXiv:2003.13947v32020
  31. Entropy Maximization and Meta Classification for Out-Of-Distribution Detection in Semantic Segmentation

    Robin Chan, Matthias Rottmann, Hanno Gottschalk

    cs.CVcs.LGarXiv:2012.06575v22020
  32. FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models

    Vladimir Kulikov, Matan Kleiner, Inbar Huberman-Spiegelglas +1

    cs.CVcs.LGarXiv:2412.08629v22024
  33. Semantic Amodal Segmentation

    Yan Zhu, Yuandong Tian, Dimitris Mexatas +1

    cs.CVarXiv:1509.01329v22015
  34. Leveraging Real Talking Faces via Self-Supervision for Robust Forgery Detection

    Alexandros Haliassos, Rodrigo Mira, Stavros Petridis +1

    cs.CVarXiv:2201.07131v32022
  35. Delivering Arbitrary-Modal Semantic Segmentation

    Jiaming Zhang, Ruiping Liu, Hao Shi +6

    cs.CVarXiv:2303.01480v12023
  36. UNIT-DDPM: UNpaired Image Translation with Denoising Diffusion Probabilistic Models

    Hiroshi Sasaki, Chris G. Willcocks, Toby P. Breckon

    cs.CVcs.LGeess.IVarXiv:2104.05358v12021
  37. Deep Learning for Instance Retrieval: A Survey

    Wei Chen, Yu Liu, Weiping Wang +5

    cs.CVarXiv:2101.11282v42021
  38. Instance-Level Segmentation for Autonomous Driving with Deep Densely Connected MRFs

    Ziyu Zhang, Sanja Fidler, Raquel Urtasun

    cs.CVarXiv:1512.06735v22015
  39. Segmentation and Classification of Skin Lesions for Disease Diagnosis

    Sumithra R, Mahamad Suhil, D. S. Guru

    cs.CVarXiv:1609.03277v12016
  40. Physical Adversarial Examples for Person Detectors in Thermal Images Based on 3D Modeling

    Xiaopei Zhu, Siyuan Huang, Zhanhao Hu +3

    cs.CVarXiv:2608.30839v12026
  41. Ambiguous Medical Image Segmentation using Diffusion Models

    Aimon Rahman, Jeya Maria Jose Valanarasu, Ilker Hacihaliloglu +1

    cs.CVarXiv:2304.04745v12023
  42. Predicting Cognitive Decline with Deep Learning of Brain Metabolism and Amyloid Imaging

    Hongyoon Choi, Kyong Hwan Jin

    cs.CVcs.AIstat.MLarXiv:1704.06033v12017
  43. EgoMimic: Scaling Imitation Learning via Egocentric Video

    Simar Kareer, Dhruv Patel, Ryan Punamiya +5

    cs.ROcs.CVarXiv:2410.24221v12024
  44. A Comprehensive Study of Deep Video Action Recognition

    Yi Zhu, Xinyu Li, Chunhui Liu +7

    cs.CVcs.MMarXiv:2012.06567v12020
  45. Biomechanical 3D Body: Self-Supervised Distillation of Biomechanical Pose from a 3D Body Foundation Model

    R. James Cotton, J. D. Peiffer, Lucinda Williamson +2

    cs.CVarXiv:2608.29928v12026
  46. DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation

    Guosheng Zhao, Xiaofeng Wang, Zheng Zhu +4

    cs.CVarXiv:2403.06845v22024
  47. Revisiting Batch Normalization for Training Low-latency Deep Spiking Neural Networks from Scratch

    Youngeun Kim, Priyadarshini Panda

    cs.CVcs.AIcs.NEarXiv:2010.01729v52020
  48. Weakly Supervised Action Learning with RNN based Fine-to-coarse Modeling

    Alexander Richard, Hilde Kuehne, Juergen Gall

    cs.CVarXiv:1703.08132v32017
  49. Pretrained, Curriculum-Tuned, and Ensembled: A Tracer-Aware Interactive Segmentation Pipeline for AutoPET V

    Xinglong Liang, Chunyao Lu, Tianyu Zhang +4

    cs.CVcs.AIarXiv:2608.30844v12026
  50. Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum

    Xingjian Wang, Shijian Wang, Yibo Wang +4

    cs.CVarXiv:2608.30584v12026
  51. Learning Representations for Neural Network-Based Classification Using the Information Bottleneck Principle

    Rana Ali Amjad, Bernhard C. Geiger

    cs.LGcs.CVcs.ITarXiv:1802.09766v62018
  52. Language-Driven Representation Learning for Robotics

    Siddharth Karamcheti, Suraj Nair, Annie S. Chen +4

    cs.ROcs.AIcs.CLarXiv:2302.12766v12023
  53. Detection and Segmentation of Manufacturing Defects with Convolutional Neural Networks and Transfer Learning

    Max Ferguson, Ronay Ak, Yung-Tsun Tina Lee +1

    cs.CVarXiv:1808.02518v22018
  54. Conducting Stylistic Analysis of Paintings through an Art-History Agent

    Marc S. Walton, Astrid Harth

    cs.CVcs.AIcs.CLarXiv:2608.29644v12026
  55. Jointly Optimize Data Augmentation and Network Training: Adversarial Data Augmentation in Human Pose Estimation

    Xi Peng, Zhiqiang Tang, Fei Yang +2

    cs.CVarXiv:1805.09707v12018
  56. Masked World Models for Visual Control

    Younggyo Seo, Danijar Hafner, Hao Liu +4

    cs.ROcs.AIcs.CVarXiv:2206.14244v32022
  57. Improving Object Detection with Deep Convolutional Networks via Bayesian Optimization and Structured Prediction

    Yuting Zhang, Kihyuk Sohn, Ruben Villegas +2

    cs.CVarXiv:1504.03293v32015
  58. Learning a Deep Model for Human Action Recognition from Novel Viewpoints

    Hossein Rahmani, Ajmal Mian, Mubarak Shah

    cs.CVarXiv:1602.00828v12016
  59. Rethinking Soft Labels for Knowledge Distillation: A Bias-Variance Tradeoff Perspective

    Helong Zhou, Liangchen Song, Jiajie Chen +4

    cs.LGcs.CVarXiv:2102.00650v12021
  60. SPICE: Semantic Pseudo-labeling for Image Clustering

    Chuang Niu, Hongming Shan, Ge Wang

    cs.CVcs.AIarXiv:2103.09382v32021