Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

7,981 to 8,040 of 18,848

  1. Language-Driven Representation Learning for Robotics

    Siddharth Karamcheti, Suraj Nair, Annie S. Chen +4

    cs.ROcs.AIcs.CLarXiv:2302.12766v12023
  2. Detection and Segmentation of Manufacturing Defects with Convolutional Neural Networks and Transfer Learning

    Max Ferguson, Ronay Ak, Yung-Tsun Tina Lee +1

    cs.CVarXiv:1808.02518v22018
  3. Conducting Stylistic Analysis of Paintings through an Art-History Agent

    Marc S. Walton, Astrid Harth

    cs.CVcs.AIcs.CLarXiv:2608.29644v12026
  4. Jointly Optimize Data Augmentation and Network Training: Adversarial Data Augmentation in Human Pose Estimation

    Xi Peng, Zhiqiang Tang, Fei Yang +2

    cs.CVarXiv:1805.09707v12018
  5. Masked World Models for Visual Control

    Younggyo Seo, Danijar Hafner, Hao Liu +4

    cs.ROcs.AIcs.CVarXiv:2206.14244v32022
  6. Improving Object Detection with Deep Convolutional Networks via Bayesian Optimization and Structured Prediction

    Yuting Zhang, Kihyuk Sohn, Ruben Villegas +2

    cs.CVarXiv:1504.03293v32015
  7. Learning a Deep Model for Human Action Recognition from Novel Viewpoints

    Hossein Rahmani, Ajmal Mian, Mubarak Shah

    cs.CVarXiv:1602.00828v12016
  8. Rethinking Soft Labels for Knowledge Distillation: A Bias-Variance Tradeoff Perspective

    Helong Zhou, Liangchen Song, Jiajie Chen +4

    cs.LGcs.CVarXiv:2102.00650v12021
  9. SPICE: Semantic Pseudo-labeling for Image Clustering

    Chuang Niu, Hongming Shan, Ge Wang

    cs.CVcs.AIarXiv:2103.09382v32021
  10. SCAR: Spatial-/Channel-wise Attention Regression Networks for Crowd Counting

    Junyu Gao, Qi Wang, Yuan Yuan

    cs.CVarXiv:1908.03716v12019
  11. Dense Text-to-Image Generation with Attention Modulation

    Yunji Kim, Jiyoung Lee, Jin-Hwa Kim +2

    cs.CVcs.GRcs.LGarXiv:2308.12964v12023
  12. COVIDNet-CT: A Tailored Deep Convolutional Neural Network Design for Detection of COVID-19 Cases from Chest CT Images

    Hayden Gunraj, Linda Wang, Alexander Wong

    eess.IVcs.CVcs.LGarXiv:2009.05383v12020
  13. Towards Universal Object Detection by Domain Attention

    Xudong Wang, Zhaowei Cai, Dashan Gao +1

    cs.CVarXiv:1904.04402v42019
  14. Temporal Attention Unit: Towards Efficient Spatiotemporal Predictive Learning

    Cheng Tan, Zhangyang Gao, Lirong Wu +4

    cs.CVcs.AIarXiv:2206.12126v32022
  15. Decorrelated Batch Normalization

    Lei Huang, Dawei Yang, Bo Lang +1

    cs.CVcs.LGstat.MLarXiv:1804.08450v12018
  16. Continual Test-Time Adaptation via Entropy Sensitivity-Guidance in Strict Online Setting

    Chandler Timm C. Doloriel, Yunbei Zhang, Muhammad Salman Siddiqui +4

    cs.CVcs.LGarXiv:2608.29920v12026
  17. MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance

    Yuang Zhang, Jiaxi Gu, Li-Wen Wang +4

    cs.CVcs.AIcs.MMarXiv:2406.19680v22024
  18. Relation Distillation Networks for Video Object Detection

    Jiajun Deng, Yingwei Pan, Ting Yao +3

    cs.CVarXiv:1908.09511v12019
  19. A Zero-Shot Framework for Sketch-based Image Retrieval

    Sasi Kiran Yelamarthi, Shiva Krishna Reddy, Ashish Mishra +1

    cs.CVarXiv:1807.11724v12018
  20. Universal Physical Camouflage Attacks on Object Detectors

    Lifeng Huang, Chengying Gao, Yuyin Zhou +4

    cs.CVarXiv:1909.04326v22019
  21. UltraLight VM-UNet: Parallel Vision Mamba Significantly Reduces Parameters for Skin Lesion Segmentation

    Renkai Wu, Yinghao Liu, Pengchen Liang +1

    eess.IVcs.CVarXiv:2403.20035v32024
  22. Direct Prediction of 3D Body Poses from Motion Compensated Sequences

    Bugra Tekin, Artem Rozantsev, Vincent Lepetit +1

    cs.CVarXiv:1511.06692v42015
  23. XDG: Accelerated Visual Disambiguation

    Gonglin Chen, Ben Southall, Hanyuan Xiao +8

    cs.CVarXiv:2608.29733v12026
  24. DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis

    Birgit Pfitzmann, Christoph Auer, Michele Dolfi +2

    cs.CVcs.LGarXiv:2206.01062v12022
  25. Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation

    Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana +5

    cs.CVcs.LGarXiv:2608.29923v12026
  26. Evidential Deep Learning for Open Set Action Recognition

    Wentao Bao, Qi Yu, Yu Kong

    cs.CVarXiv:2107.10161v22021
  27. What Matters in Unsupervised Optical Flow

    Rico Jonschkowski, Austin Stone, Jonathan T. Barron +3

    cs.CVcs.LGeess.IVarXiv:2006.04902v22020
  28. CROMA: Remote Sensing Representations with Contrastive Radar-Optical Masked Autoencoders

    Anthony Fuller, Koreen Millard, James R. Green

    cs.CVarXiv:2311.00566v12023
  29. Joint Multi-Person Pose Estimation and Semantic Part Segmentation

    Fangting Xia, Peng Wang, Xianjie Chen +1

    cs.CVarXiv:1708.03383v12017
  30. Orthogonal Convolutional Neural Networks

    Jiayun Wang, Yubei Chen, Rudrasis Chakraborty +1

    cs.CVarXiv:1911.12207v32019
  31. Evaluating 2D and 3D-Aware Vision Foundation Models for Vehicle Attribute Recognition

    Alexandre V. Delazeri, Gabriel E. Lima, Eduil Nascimento +2

    cs.CVarXiv:2608.29929v12026
  32. Presence-Only Geographical Priors for Fine-Grained Image Classification

    Oisin Mac Aodha, Elijah Cole, Pietro Perona

    cs.CVcs.LGarXiv:1906.05272v32019
  33. Detection in Crowded Scenes: One Proposal, Multiple Predictions

    Xuangeng Chu, Anlin Zheng, Xiangyu Zhang +1

    cs.CVarXiv:2003.09163v22020
  34. TIPCB: A Simple but Effective Part-based Convolutional Baseline for Text-based Person Search

    Yuhao Chen, Guoqing Zhang, Yujiang Lu +3

    cs.CVarXiv:2105.11628v12021
  35. SUNet: Swin Transformer UNet for Image Denoising

    Chi-Mao Fan, Tsung-Jung Liu, Kuan-Hsien Liu

    eess.IVcs.CVcs.LGarXiv:2202.14009v12022
  36. PhasorNet: Learning Structure from Frequency for Real-Time Stereo Matching

    Md Raqib Khan, Santosh Kumar Vipparthi, Subrahmanyam Murala

    cs.CVarXiv:2608.29819v12026
  37. Multimodal Shared Latent Representation of Narration, Microscope and iOCT Images for Phase Recognition in Vitreoretinal Surgery

    Onur Izmitlioglu, Shervin Dehghani, Tarek Ghannoum +2

    cs.CVarXiv:2608.31065v12026
  38. Machine learning in resting-state fMRI analysis

    Meenakshi Khosla, Keith Jamison, Gia H. Ngo +2

    cs.LGcs.CVq-bio.QMarXiv:1812.11477v12018
  39. Deep Mesh Reconstruction from Single RGB Images via Topology Modification Networks

    Junyi Pan, Xiaoguang Han, Weikai Chen +2

    cs.CVarXiv:1909.00321v12019
  40. Classification of Arrhythmia by Using Deep Learning with 2-D ECG Spectral Image Representation

    Amin Ullah, Syed M. Anwar, Muhammad Bilal +1

    eess.SPcs.CVcs.LGarXiv:2005.06902v22020
  41. Attention Guided Network for Retinal Image Segmentation

    Shihao Zhang, Huazhu Fu, Yuguang Yan +5

    eess.IVcs.CVarXiv:1907.12930v32019
  42. Dynamic ReLU

    Yinpeng Chen, Xiyang Dai, Mengchen Liu +3

    cs.CVarXiv:2003.10027v22020
  43. Memory-augmented Dense Predictive Coding for Video Representation Learning

    Tengda Han, Weidi Xie, Andrew Zisserman

    cs.CVarXiv:2008.01065v12020
  44. Dynamic Dual-Attentive Aggregation Learning for Visible-Infrared Person Re-Identification

    Mang Ye, Jianbing Shen, David J. Crandall +2

    cs.CVarXiv:2007.09314v12020
  45. SqueezeSegV3: Spatially-Adaptive Convolution for Efficient Point-Cloud Segmentation

    Chenfeng Xu, Bichen Wu, Zining Wang +4

    cs.CVarXiv:2004.01803v22020
  46. Diverse Image-to-Image Translation via Disentangled Representations

    Hsin-Ying Lee, Hung-Yu Tseng, Jia-Bin Huang +2

    cs.CVarXiv:1808.00948v12018
  47. ContextNet: Exploring Context and Detail for Semantic Segmentation in Real-time

    Rudra P K Poudel, Ujwal Bonde, Stephan Liwicki +1

    cs.CVarXiv:1805.04554v42018
  48. Unsupervised Geometry-Aware Representation for 3D Human Pose Estimation

    Helge Rhodin, Mathieu Salzmann, Pascal Fua

    cs.CVcs.AIarXiv:1804.01110v12018
  49. A Large Contextual Dataset for Classification, Detection and Counting of Cars with Deep Learning

    T. Nathan Mundhenk, Goran Konjevod, Wesam A. Sakla +1

    cs.CVcs.DCcs.NEarXiv:1609.04453v12016
  50. Camera trap classification with deep learning under ground truth uncertainty

    Leonard Hockerts, Peter S. Stewart, Sarthak Arora +1

    cs.CVarXiv:2608.30789v12026
  51. Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention

    Bingde Liu, Wu Ran, Jinglei Zhang +2

    cs.CVarXiv:2608.30129v12026
  52. CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

    Jirong Li, Satoshi Ikehata, Shuhei Kurita +1

    cs.CVarXiv:2608.30342v12026
  53. Whole-Body MRI Classification via Prompt-Based Clinical Conditioning

    Laura Daza, Marta Hasny, Cristina González +1

    cs.CVarXiv:2608.30824v12026
  54. Robust Multi-Modality Multi-Object Tracking

    Wenwei Zhang, Hui Zhou, Shuyang Sun +3

    cs.CVarXiv:1909.03850v12019
  55. Temporal Context Aggregation Network for Temporal Action Proposal Refinement

    Zhiwu Qing, Haisheng Su, Weihao Gan +7

    cs.CVarXiv:2103.13141v12021
  56. Social Biases through the Text-to-Image Generation Lens

    Ranjita Naik, Besmira Nushi

    cs.CYcs.AIcs.CLarXiv:2304.06034v12023
  57. Fast Camouflaged Object Detection via Edge-based Reversible Re-calibration Network

    Ge-Peng Ji, Lei Zhu, Mingchen Zhuge +1

    cs.CVarXiv:2111.03216v12021
  58. Stacked Deconvolutional Network for Semantic Segmentation

    Jun Fu, Jing Liu, Yuhang Wang +1

    cs.CVarXiv:1708.04943v12017
  59. Image Super-Resolution as a Defense Against Adversarial Attacks

    Aamir Mustafa, Salman H. Khan, Munawar Hayat +2

    cs.CVarXiv:1901.01677v22019
  60. SePArate: Segmenting Patterns from Defects in Wafer Manufacturing Using Weak Supervision

    Dain Kwon, Changmin Shin, Sunjong Park +5

    cs.CVcs.AIarXiv:2608.30410v12026