Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
4,861 to 4,920 of 18,817
ViTAMINS: An Empirical Study of Training Self-Supervised Vision Transformers with Synthetic Hard Negatives
Nikos Giakoumoglou, Andreas Floros, Kleanthis-Marios Papadopoulos +1
cs.CVcs.AIcs.LGarXiv:2609.01041v12026Data Augmentation for Skin Lesion Analysis
Fábio Perez, Cristina Vasconcelos, Sandra Avila +1
cs.CVarXiv:1809.01442v12018Momentum Contrastive Learning for Few-Shot COVID-19 Diagnosis from Chest CT Images
Xiaocong Chen, Lina Yao, Tao Zhou +2
eess.IVcs.CVcs.LGarXiv:2006.13276v12020Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human Videos
Annie S. Chen, Suraj Nair, Chelsea Finn
cs.ROcs.AIcs.CVarXiv:2103.16817v12021DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning
Ruowen Zhao, Junliang Ye, Zhengyi Wang +4
cs.CVarXiv:2503.15265v12025PMP-Net++: Point Cloud Completion by Transformer-Enhanced Multi-step Point Moving Paths
Xin Wen, Peng Xiang, Zhizhong Han +4
cs.CVarXiv:2202.09507v32022FlexiViT: One Model for All Patch Sizes
Lucas Beyer, Pavel Izmailov, Alexander Kolesnikov +7
cs.CVcs.AIcs.LGarXiv:2212.08013v22022Context-aware Biaffine Localizing Network for Temporal Sentence Grounding
Daizong Liu, Xiaoye Qu, Jianfeng Dong +5
cs.CVarXiv:2103.11555v12021Accelerating Data Processing and Benchmarking of AI Models for Pathology
Andrew Zhang, Guillaume Jaume, Anurag Vaidya +2
cs.CVarXiv:2502.06750v12025Reconstructing Training Data from Trained Neural Networks
Niv Haim, Gal Vardi, Gilad Yehudai +2
cs.LGcs.CRcs.CVarXiv:2206.07758v32022VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
Yating Wang, Haoyi Zhu, Mingyu Liu +3
cs.ROcs.CVarXiv:2507.01016v12025Psi-Net: Shape and boundary aware joint multi-task deep network for medical image segmentation
Balamurali Murugesan, Kaushik Sarveswaran, Sharath M Shankaranarayana +2
cs.CVarXiv:1902.04099v32019Efficient Large-Scale Multi-Modal Classification
D. Kiela, E. Grave, A. Joulin +1
cs.CLcs.AIcs.CVarXiv:1802.02892v12018Coronary Artery Centerline Extraction in Cardiac CT Angiography Using a CNN-Based Orientation Classifier
Jelmer M. Wolterink, Robbert W. van Hamersvelt, Max A. Viergever +2
cs.CVarXiv:1810.03143v22018MaskRNN: Instance Level Video Object Segmentation
Yuan-Ting Hu, Jia-Bin Huang, Alexander G. Schwing
cs.CVarXiv:1803.11187v12018An Attention Free Transformer
Shuangfei Zhai, Walter Talbott, Nitish Srivastava +4
cs.LGcs.CLcs.CVarXiv:2105.14103v22021Molecular-driven Foundation Model for Oncologic Pathology
Anurag Vaidya, Andrew Zhang, Guillaume Jaume +15
cs.CVcs.AIarXiv:2501.16652v12025WordSup: Exploiting Word Annotations for Character based Text Detection
Han Hu, Chengquan Zhang, Yuxuan Luo +3
cs.CVarXiv:1708.06720v12017MLRSNet: A Multi-label High Spatial Resolution Remote Sensing Dataset for Semantic Scene Understanding
Xiaoman Qi, PanPan Zhu, Yuebin Wang +7
cs.CVarXiv:2010.00243v12020TrackVLA: Embodied Visual Tracking in the Wild
Shaoan Wang, Jiazhao Zhang, Minghan Li +7
cs.ROcs.CVarXiv:2505.23189v12025Sekai: A Video Dataset towards World Exploration
Zhen Li, Chuanhao Li, Xiaofeng Mao +17
cs.CVcs.AIarXiv:2506.15675v32025MariSat: A Maritime Dataset for Instance Segmentation of Objects in Satellite and Aerial Images
Amir Abbes, Ines Harrabi, Lucas Justin Yirepoa Kinda +3
cs.CVarXiv:2608.29852v12026Hallucinated Neural Radiance Fields in the Wild
Xingyu Chen, Qi Zhang, Xiaoyu Li +4
cs.CVcs.AIarXiv:2111.15246v32021Generalized Trajectory Scoring for End-to-end Multimodal Planning
Zhenxin Li, Wenhao Yao, Zi Wang +7
cs.ROcs.CVarXiv:2506.06664v12025Complete & Label: A Domain Adaptation Approach to Semantic Segmentation of LiDAR Point Clouds
Li Yi, Boqing Gong, Thomas Funkhouser
cs.CVcs.LGarXiv:2007.08488v22020Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
Rui Shao, Wei Li, Lingsen Zhang +4
cs.ROcs.CVarXiv:2508.13073v32025One-for-All: Bridge the Gap Between Heterogeneous Architectures in Knowledge Distillation
Zhiwei Hao, Jianyuan Guo, Kai Han +4
cs.CVarXiv:2310.19444v12023Towards High-fidelity Nonlinear 3D Face Morphable Model
Luan Tran, Feng Liu, Xiaoming Liu
cs.CVarXiv:1904.04933v12019Self-supervised Single-view 3D Reconstruction via Semantic Consistency
Xueting Li, Sifei Liu, Kihwan Kim +4
cs.CVarXiv:2003.06473v12020SceneScape: Text-Driven Consistent Scene Generation
Rafail Fridman, Amit Abecasis, Yoni Kasten +1
cs.CVarXiv:2302.01133v22023SHViT: Single-Head Vision Transformer with Memory Efficient Macro Design
Seokju Yun, Youngmin Ro
cs.CVarXiv:2401.16456v22024DEFOM-Stereo: Depth Foundation Model Based Stereo Matching
Hualie Jiang, Zhiqiang Lou, Laiyan Ding +4
cs.CVarXiv:2501.09466v32025Learning to Detect and Track Visible and Occluded Body Joints in a Virtual World
Matteo Fabbri, Fabio Lanzi, Simone Calderara +3
cs.CVarXiv:1803.08319v32018See the Change, Keep the Flow: Unsupervised Action Segmentation via Spectral-Temporal Representation Learning
Yun Li, Jun Xiao, Cong Zhang +1
cs.CVarXiv:2608.29611v12026Towards Understanding Camera Motions in Any Video
Zhiqiu Lin, Siyuan Cen, Daniel Jiang +12
cs.CVcs.AIcs.CLarXiv:2504.15376v22025Urban Driver: Learning to Drive from Real-world Demonstrations Using Policy Gradients
Oliver Scheel, Luca Bergamini, Maciej Wołczyk +2
cs.ROcs.AIcs.CVarXiv:2109.13333v12021Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM
Peiyang Xu, Xiaopei Zhu, Jun Zhu +1
cs.CVarXiv:2609.00231v12026A feature agnostic approach for glaucoma detection in OCT volumes
Stefan Maetschke, Bhavna Antony, Hiroshi Ishikawa +3
cs.CVcs.LGstat.MLarXiv:1807.04855v42018STEm-Seg: Spatio-temporal Embeddings for Instance Segmentation in Videos
Ali Athar, Sabarinath Mahadevan, Aljoša Ošep +2
cs.CVcs.LGeess.IVarXiv:2003.08429v42020Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges
Ranjan Sapkota, Yang Cao, Konstantinos I. Roumeliotis +1
cs.CVarXiv:2505.04769v22025Dense Extreme Inception Network for Edge Detection
Xavier Soria, Angel Sappa, Patricio Humanante +1
cs.CVcs.LGarXiv:2112.02250v22021LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds
Lingteng Qiu, Xiaodong Gu, Peihao Li +8
cs.CVcs.AIarXiv:2503.10625v12025Location-aware Graph Convolutional Networks for Video Question Answering
Deng Huang, Peihao Chen, Runhao Zeng +3
cs.CVcs.CLarXiv:2008.09105v120203D Gaussian Ray Tracing: Fast Tracing of Particle Scenes
Nicolas Moenne-Loccoz, Ashkan Mirzaei, Or Perel +6
cs.GRcs.CVarXiv:2407.07090v32024AdaMatch: A Unified Approach to Semi-Supervised Learning and Domain Adaptation
David Berthelot, Rebecca Roelofs, Kihyuk Sohn +2
cs.LGcs.AIcs.CVarXiv:2106.04732v22021A Survey on Vision-Language-Action Models for Autonomous Driving
Sicong Jiang, Zilin Huang, Kangan Qian +17
cs.CVcs.AIcs.ROarXiv:2506.24044v12025Image Restoration Using Joint Statistical Modeling in Space-Transform Domain
Jian Zhang, Debin Zhao, Ruiqin Xiong +2
cs.MMcs.CVarXiv:1405.3173v12014AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
Mike Ranzinger, Greg Heinrich, Jan Kautz +1
cs.CVarXiv:2312.06709v52023Mix3D: Out-of-Context Data Augmentation for 3D Scenes
Alexey Nekrasov, Jonas Schult, Or Litany +2
cs.CVarXiv:2110.02210v22021Weakly Supervised Video Anomaly Detection via Center-guided Discriminative Learning
Boyang Wan, Yuming Fang, Xue Xia +1
cs.CVarXiv:2104.07268v12021Robust Visual Tracking via Hierarchical Convolutional Features
Chao Ma, Jia-Bin Huang, Xiaokang Yang +1
cs.CVarXiv:1707.03816v22017Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting
Siru Zhong, Weilin Ruan, Ming Jin +3
cs.CVcs.LGarXiv:2502.04395v22025The Norm Must Go On: Dynamic Unsupervised Domain Adaptation by Normalization
M. Jehanzeb Mirza, Jakub Micorek, Horst Possegger +1
cs.CVarXiv:2112.00463v22021Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction
Jing He, Haodong Li, Wei Yin +6
cs.CVarXiv:2409.18124v52024DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding
Geng Li, Jinglin Xu, Yunzhen Zhao +1
cs.CVarXiv:2504.14920v12025Aligning Bag of Regions for Open-Vocabulary Object Detection
Size Wu, Wenwei Zhang, Sheng Jin +2
cs.CVarXiv:2302.13996v12023Instance Credibility Inference for Few-Shot Learning
Yikai Wang, Chengming Xu, Chen Liu +2
cs.CVcs.LGarXiv:2003.11853v22020Deformed Implicit Field: Modeling 3D Shapes with Learned Dense Correspondence
Yu Deng, Jiaolong Yang, Xin Tong
cs.CVarXiv:2011.13650v32020OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics Generation
Yuchen Lin, Chenguo Lin, Jianjin Xu +1
cs.CVarXiv:2501.18982v12025Regularizing Generative Adversarial Networks under Limited Data
Hung-Yu Tseng, Lu Jiang, Ce Liu +2
cs.LGcs.CVarXiv:2104.03310v12021