Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
7,981 to 8,040 of 18,848
Language-Driven Representation Learning for Robotics
Siddharth Karamcheti, Suraj Nair, Annie S. Chen +4
cs.ROcs.AIcs.CLarXiv:2302.12766v12023Detection and Segmentation of Manufacturing Defects with Convolutional Neural Networks and Transfer Learning
Max Ferguson, Ronay Ak, Yung-Tsun Tina Lee +1
cs.CVarXiv:1808.02518v22018Conducting Stylistic Analysis of Paintings through an Art-History Agent
Marc S. Walton, Astrid Harth
cs.CVcs.AIcs.CLarXiv:2608.29644v12026Jointly Optimize Data Augmentation and Network Training: Adversarial Data Augmentation in Human Pose Estimation
Xi Peng, Zhiqiang Tang, Fei Yang +2
cs.CVarXiv:1805.09707v12018Masked World Models for Visual Control
Younggyo Seo, Danijar Hafner, Hao Liu +4
cs.ROcs.AIcs.CVarXiv:2206.14244v32022Improving Object Detection with Deep Convolutional Networks via Bayesian Optimization and Structured Prediction
Yuting Zhang, Kihyuk Sohn, Ruben Villegas +2
cs.CVarXiv:1504.03293v32015Learning a Deep Model for Human Action Recognition from Novel Viewpoints
Hossein Rahmani, Ajmal Mian, Mubarak Shah
cs.CVarXiv:1602.00828v12016Rethinking Soft Labels for Knowledge Distillation: A Bias-Variance Tradeoff Perspective
Helong Zhou, Liangchen Song, Jiajie Chen +4
cs.LGcs.CVarXiv:2102.00650v12021SPICE: Semantic Pseudo-labeling for Image Clustering
Chuang Niu, Hongming Shan, Ge Wang
cs.CVcs.AIarXiv:2103.09382v32021SCAR: Spatial-/Channel-wise Attention Regression Networks for Crowd Counting
Junyu Gao, Qi Wang, Yuan Yuan
cs.CVarXiv:1908.03716v12019Dense Text-to-Image Generation with Attention Modulation
Yunji Kim, Jiyoung Lee, Jin-Hwa Kim +2
cs.CVcs.GRcs.LGarXiv:2308.12964v12023COVIDNet-CT: A Tailored Deep Convolutional Neural Network Design for Detection of COVID-19 Cases from Chest CT Images
Hayden Gunraj, Linda Wang, Alexander Wong
eess.IVcs.CVcs.LGarXiv:2009.05383v12020Towards Universal Object Detection by Domain Attention
Xudong Wang, Zhaowei Cai, Dashan Gao +1
cs.CVarXiv:1904.04402v42019Temporal Attention Unit: Towards Efficient Spatiotemporal Predictive Learning
Cheng Tan, Zhangyang Gao, Lirong Wu +4
cs.CVcs.AIarXiv:2206.12126v32022Decorrelated Batch Normalization
Lei Huang, Dawei Yang, Bo Lang +1
cs.CVcs.LGstat.MLarXiv:1804.08450v12018Continual Test-Time Adaptation via Entropy Sensitivity-Guidance in Strict Online Setting
Chandler Timm C. Doloriel, Yunbei Zhang, Muhammad Salman Siddiqui +4
cs.CVcs.LGarXiv:2608.29920v12026MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
Yuang Zhang, Jiaxi Gu, Li-Wen Wang +4
cs.CVcs.AIcs.MMarXiv:2406.19680v22024Relation Distillation Networks for Video Object Detection
Jiajun Deng, Yingwei Pan, Ting Yao +3
cs.CVarXiv:1908.09511v12019A Zero-Shot Framework for Sketch-based Image Retrieval
Sasi Kiran Yelamarthi, Shiva Krishna Reddy, Ashish Mishra +1
cs.CVarXiv:1807.11724v12018Universal Physical Camouflage Attacks on Object Detectors
Lifeng Huang, Chengying Gao, Yuyin Zhou +4
cs.CVarXiv:1909.04326v22019UltraLight VM-UNet: Parallel Vision Mamba Significantly Reduces Parameters for Skin Lesion Segmentation
Renkai Wu, Yinghao Liu, Pengchen Liang +1
eess.IVcs.CVarXiv:2403.20035v32024Direct Prediction of 3D Body Poses from Motion Compensated Sequences
Bugra Tekin, Artem Rozantsev, Vincent Lepetit +1
cs.CVarXiv:1511.06692v42015XDG: Accelerated Visual Disambiguation
Gonglin Chen, Ben Southall, Hanyuan Xiao +8
cs.CVarXiv:2608.29733v12026DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis
Birgit Pfitzmann, Christoph Auer, Michele Dolfi +2
cs.CVcs.LGarXiv:2206.01062v12022Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation
Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana +5
cs.CVcs.LGarXiv:2608.29923v12026Evidential Deep Learning for Open Set Action Recognition
Wentao Bao, Qi Yu, Yu Kong
cs.CVarXiv:2107.10161v22021What Matters in Unsupervised Optical Flow
Rico Jonschkowski, Austin Stone, Jonathan T. Barron +3
cs.CVcs.LGeess.IVarXiv:2006.04902v22020CROMA: Remote Sensing Representations with Contrastive Radar-Optical Masked Autoencoders
Anthony Fuller, Koreen Millard, James R. Green
cs.CVarXiv:2311.00566v12023Joint Multi-Person Pose Estimation and Semantic Part Segmentation
Fangting Xia, Peng Wang, Xianjie Chen +1
cs.CVarXiv:1708.03383v12017Orthogonal Convolutional Neural Networks
Jiayun Wang, Yubei Chen, Rudrasis Chakraborty +1
cs.CVarXiv:1911.12207v32019Evaluating 2D and 3D-Aware Vision Foundation Models for Vehicle Attribute Recognition
Alexandre V. Delazeri, Gabriel E. Lima, Eduil Nascimento +2
cs.CVarXiv:2608.29929v12026Presence-Only Geographical Priors for Fine-Grained Image Classification
Oisin Mac Aodha, Elijah Cole, Pietro Perona
cs.CVcs.LGarXiv:1906.05272v32019Detection in Crowded Scenes: One Proposal, Multiple Predictions
Xuangeng Chu, Anlin Zheng, Xiangyu Zhang +1
cs.CVarXiv:2003.09163v22020TIPCB: A Simple but Effective Part-based Convolutional Baseline for Text-based Person Search
Yuhao Chen, Guoqing Zhang, Yujiang Lu +3
cs.CVarXiv:2105.11628v12021SUNet: Swin Transformer UNet for Image Denoising
Chi-Mao Fan, Tsung-Jung Liu, Kuan-Hsien Liu
eess.IVcs.CVcs.LGarXiv:2202.14009v12022PhasorNet: Learning Structure from Frequency for Real-Time Stereo Matching
Md Raqib Khan, Santosh Kumar Vipparthi, Subrahmanyam Murala
cs.CVarXiv:2608.29819v12026Multimodal Shared Latent Representation of Narration, Microscope and iOCT Images for Phase Recognition in Vitreoretinal Surgery
Onur Izmitlioglu, Shervin Dehghani, Tarek Ghannoum +2
cs.CVarXiv:2608.31065v12026Machine learning in resting-state fMRI analysis
Meenakshi Khosla, Keith Jamison, Gia H. Ngo +2
cs.LGcs.CVq-bio.QMarXiv:1812.11477v12018Deep Mesh Reconstruction from Single RGB Images via Topology Modification Networks
Junyi Pan, Xiaoguang Han, Weikai Chen +2
cs.CVarXiv:1909.00321v12019Classification of Arrhythmia by Using Deep Learning with 2-D ECG Spectral Image Representation
Amin Ullah, Syed M. Anwar, Muhammad Bilal +1
eess.SPcs.CVcs.LGarXiv:2005.06902v22020Attention Guided Network for Retinal Image Segmentation
Shihao Zhang, Huazhu Fu, Yuguang Yan +5
eess.IVcs.CVarXiv:1907.12930v32019Dynamic ReLU
Yinpeng Chen, Xiyang Dai, Mengchen Liu +3
cs.CVarXiv:2003.10027v22020Memory-augmented Dense Predictive Coding for Video Representation Learning
Tengda Han, Weidi Xie, Andrew Zisserman
cs.CVarXiv:2008.01065v12020Dynamic Dual-Attentive Aggregation Learning for Visible-Infrared Person Re-Identification
Mang Ye, Jianbing Shen, David J. Crandall +2
cs.CVarXiv:2007.09314v12020SqueezeSegV3: Spatially-Adaptive Convolution for Efficient Point-Cloud Segmentation
Chenfeng Xu, Bichen Wu, Zining Wang +4
cs.CVarXiv:2004.01803v22020Diverse Image-to-Image Translation via Disentangled Representations
Hsin-Ying Lee, Hung-Yu Tseng, Jia-Bin Huang +2
cs.CVarXiv:1808.00948v12018ContextNet: Exploring Context and Detail for Semantic Segmentation in Real-time
Rudra P K Poudel, Ujwal Bonde, Stephan Liwicki +1
cs.CVarXiv:1805.04554v42018Unsupervised Geometry-Aware Representation for 3D Human Pose Estimation
Helge Rhodin, Mathieu Salzmann, Pascal Fua
cs.CVcs.AIarXiv:1804.01110v12018A Large Contextual Dataset for Classification, Detection and Counting of Cars with Deep Learning
T. Nathan Mundhenk, Goran Konjevod, Wesam A. Sakla +1
cs.CVcs.DCcs.NEarXiv:1609.04453v12016Camera trap classification with deep learning under ground truth uncertainty
Leonard Hockerts, Peter S. Stewart, Sarthak Arora +1
cs.CVarXiv:2608.30789v12026Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention
Bingde Liu, Wu Ran, Jinglei Zhang +2
cs.CVarXiv:2608.30129v12026CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels
Jirong Li, Satoshi Ikehata, Shuhei Kurita +1
cs.CVarXiv:2608.30342v12026Whole-Body MRI Classification via Prompt-Based Clinical Conditioning
Laura Daza, Marta Hasny, Cristina González +1
cs.CVarXiv:2608.30824v12026Robust Multi-Modality Multi-Object Tracking
Wenwei Zhang, Hui Zhou, Shuyang Sun +3
cs.CVarXiv:1909.03850v12019Temporal Context Aggregation Network for Temporal Action Proposal Refinement
Zhiwu Qing, Haisheng Su, Weihao Gan +7
cs.CVarXiv:2103.13141v12021Social Biases through the Text-to-Image Generation Lens
Ranjita Naik, Besmira Nushi
cs.CYcs.AIcs.CLarXiv:2304.06034v12023Fast Camouflaged Object Detection via Edge-based Reversible Re-calibration Network
Ge-Peng Ji, Lei Zhu, Mingchen Zhuge +1
cs.CVarXiv:2111.03216v12021Stacked Deconvolutional Network for Semantic Segmentation
Jun Fu, Jing Liu, Yuhang Wang +1
cs.CVarXiv:1708.04943v12017Image Super-Resolution as a Defense Against Adversarial Attacks
Aamir Mustafa, Salman H. Khan, Munawar Hayat +2
cs.CVarXiv:1901.01677v22019SePArate: Segmenting Patterns from Defects in Wafer Manufacturing Using Weak Supervision
Dain Kwon, Changmin Shin, Sunjong Park +5
cs.CVcs.AIarXiv:2608.30410v12026