Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

4,861 to 4,920 of 18,817

  1. ViTAMINS: An Empirical Study of Training Self-Supervised Vision Transformers with Synthetic Hard Negatives

    Nikos Giakoumoglou, Andreas Floros, Kleanthis-Marios Papadopoulos +1

    cs.CVcs.AIcs.LGarXiv:2609.01041v12026
  2. Data Augmentation for Skin Lesion Analysis

    Fábio Perez, Cristina Vasconcelos, Sandra Avila +1

    cs.CVarXiv:1809.01442v12018
  3. Momentum Contrastive Learning for Few-Shot COVID-19 Diagnosis from Chest CT Images

    Xiaocong Chen, Lina Yao, Tao Zhou +2

    eess.IVcs.CVcs.LGarXiv:2006.13276v12020
  4. Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human Videos

    Annie S. Chen, Suraj Nair, Chelsea Finn

    cs.ROcs.AIcs.CVarXiv:2103.16817v12021
  5. DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning

    Ruowen Zhao, Junliang Ye, Zhengyi Wang +4

    cs.CVarXiv:2503.15265v12025
  6. PMP-Net++: Point Cloud Completion by Transformer-Enhanced Multi-step Point Moving Paths

    Xin Wen, Peng Xiang, Zhizhong Han +4

    cs.CVarXiv:2202.09507v32022
  7. FlexiViT: One Model for All Patch Sizes

    Lucas Beyer, Pavel Izmailov, Alexander Kolesnikov +7

    cs.CVcs.AIcs.LGarXiv:2212.08013v22022
  8. Context-aware Biaffine Localizing Network for Temporal Sentence Grounding

    Daizong Liu, Xiaoye Qu, Jianfeng Dong +5

    cs.CVarXiv:2103.11555v12021
  9. Accelerating Data Processing and Benchmarking of AI Models for Pathology

    Andrew Zhang, Guillaume Jaume, Anurag Vaidya +2

    cs.CVarXiv:2502.06750v12025
  10. Reconstructing Training Data from Trained Neural Networks

    Niv Haim, Gal Vardi, Gilad Yehudai +2

    cs.LGcs.CRcs.CVarXiv:2206.07758v32022
  11. VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers

    Yating Wang, Haoyi Zhu, Mingyu Liu +3

    cs.ROcs.CVarXiv:2507.01016v12025
  12. Psi-Net: Shape and boundary aware joint multi-task deep network for medical image segmentation

    Balamurali Murugesan, Kaushik Sarveswaran, Sharath M Shankaranarayana +2

    cs.CVarXiv:1902.04099v32019
  13. Efficient Large-Scale Multi-Modal Classification

    D. Kiela, E. Grave, A. Joulin +1

    cs.CLcs.AIcs.CVarXiv:1802.02892v12018
  14. Coronary Artery Centerline Extraction in Cardiac CT Angiography Using a CNN-Based Orientation Classifier

    Jelmer M. Wolterink, Robbert W. van Hamersvelt, Max A. Viergever +2

    cs.CVarXiv:1810.03143v22018
  15. MaskRNN: Instance Level Video Object Segmentation

    Yuan-Ting Hu, Jia-Bin Huang, Alexander G. Schwing

    cs.CVarXiv:1803.11187v12018
  16. An Attention Free Transformer

    Shuangfei Zhai, Walter Talbott, Nitish Srivastava +4

    cs.LGcs.CLcs.CVarXiv:2105.14103v22021
  17. Molecular-driven Foundation Model for Oncologic Pathology

    Anurag Vaidya, Andrew Zhang, Guillaume Jaume +15

    cs.CVcs.AIarXiv:2501.16652v12025
  18. WordSup: Exploiting Word Annotations for Character based Text Detection

    Han Hu, Chengquan Zhang, Yuxuan Luo +3

    cs.CVarXiv:1708.06720v12017
  19. MLRSNet: A Multi-label High Spatial Resolution Remote Sensing Dataset for Semantic Scene Understanding

    Xiaoman Qi, PanPan Zhu, Yuebin Wang +7

    cs.CVarXiv:2010.00243v12020
  20. TrackVLA: Embodied Visual Tracking in the Wild

    Shaoan Wang, Jiazhao Zhang, Minghan Li +7

    cs.ROcs.CVarXiv:2505.23189v12025
  21. Sekai: A Video Dataset towards World Exploration

    Zhen Li, Chuanhao Li, Xiaofeng Mao +17

    cs.CVcs.AIarXiv:2506.15675v32025
  22. MariSat: A Maritime Dataset for Instance Segmentation of Objects in Satellite and Aerial Images

    Amir Abbes, Ines Harrabi, Lucas Justin Yirepoa Kinda +3

    cs.CVarXiv:2608.29852v12026
  23. Hallucinated Neural Radiance Fields in the Wild

    Xingyu Chen, Qi Zhang, Xiaoyu Li +4

    cs.CVcs.AIarXiv:2111.15246v32021
  24. Generalized Trajectory Scoring for End-to-end Multimodal Planning

    Zhenxin Li, Wenhao Yao, Zi Wang +7

    cs.ROcs.CVarXiv:2506.06664v12025
  25. Complete & Label: A Domain Adaptation Approach to Semantic Segmentation of LiDAR Point Clouds

    Li Yi, Boqing Gong, Thomas Funkhouser

    cs.CVcs.LGarXiv:2007.08488v22020
  26. Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

    Rui Shao, Wei Li, Lingsen Zhang +4

    cs.ROcs.CVarXiv:2508.13073v32025
  27. One-for-All: Bridge the Gap Between Heterogeneous Architectures in Knowledge Distillation

    Zhiwei Hao, Jianyuan Guo, Kai Han +4

    cs.CVarXiv:2310.19444v12023
  28. Towards High-fidelity Nonlinear 3D Face Morphable Model

    Luan Tran, Feng Liu, Xiaoming Liu

    cs.CVarXiv:1904.04933v12019
  29. Self-supervised Single-view 3D Reconstruction via Semantic Consistency

    Xueting Li, Sifei Liu, Kihwan Kim +4

    cs.CVarXiv:2003.06473v12020
  30. SceneScape: Text-Driven Consistent Scene Generation

    Rafail Fridman, Amit Abecasis, Yoni Kasten +1

    cs.CVarXiv:2302.01133v22023
  31. SHViT: Single-Head Vision Transformer with Memory Efficient Macro Design

    Seokju Yun, Youngmin Ro

    cs.CVarXiv:2401.16456v22024
  32. DEFOM-Stereo: Depth Foundation Model Based Stereo Matching

    Hualie Jiang, Zhiqiang Lou, Laiyan Ding +4

    cs.CVarXiv:2501.09466v32025
  33. Learning to Detect and Track Visible and Occluded Body Joints in a Virtual World

    Matteo Fabbri, Fabio Lanzi, Simone Calderara +3

    cs.CVarXiv:1803.08319v32018
  34. See the Change, Keep the Flow: Unsupervised Action Segmentation via Spectral-Temporal Representation Learning

    Yun Li, Jun Xiao, Cong Zhang +1

    cs.CVarXiv:2608.29611v12026
  35. Towards Understanding Camera Motions in Any Video

    Zhiqiu Lin, Siyuan Cen, Daniel Jiang +12

    cs.CVcs.AIcs.CLarXiv:2504.15376v22025
  36. Urban Driver: Learning to Drive from Real-world Demonstrations Using Policy Gradients

    Oliver Scheel, Luca Bergamini, Maciej Wołczyk +2

    cs.ROcs.AIcs.CVarXiv:2109.13333v12021
  37. Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM

    Peiyang Xu, Xiaopei Zhu, Jun Zhu +1

    cs.CVarXiv:2609.00231v12026
  38. A feature agnostic approach for glaucoma detection in OCT volumes

    Stefan Maetschke, Bhavna Antony, Hiroshi Ishikawa +3

    cs.CVcs.LGstat.MLarXiv:1807.04855v42018
  39. STEm-Seg: Spatio-temporal Embeddings for Instance Segmentation in Videos

    Ali Athar, Sabarinath Mahadevan, Aljoša Ošep +2

    cs.CVcs.LGeess.IVarXiv:2003.08429v42020
  40. Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges

    Ranjan Sapkota, Yang Cao, Konstantinos I. Roumeliotis +1

    cs.CVarXiv:2505.04769v22025
  41. Dense Extreme Inception Network for Edge Detection

    Xavier Soria, Angel Sappa, Patricio Humanante +1

    cs.CVcs.LGarXiv:2112.02250v22021
  42. LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds

    Lingteng Qiu, Xiaodong Gu, Peihao Li +8

    cs.CVcs.AIarXiv:2503.10625v12025
  43. Location-aware Graph Convolutional Networks for Video Question Answering

    Deng Huang, Peihao Chen, Runhao Zeng +3

    cs.CVcs.CLarXiv:2008.09105v12020
  44. 3D Gaussian Ray Tracing: Fast Tracing of Particle Scenes

    Nicolas Moenne-Loccoz, Ashkan Mirzaei, Or Perel +6

    cs.GRcs.CVarXiv:2407.07090v32024
  45. AdaMatch: A Unified Approach to Semi-Supervised Learning and Domain Adaptation

    David Berthelot, Rebecca Roelofs, Kihyuk Sohn +2

    cs.LGcs.AIcs.CVarXiv:2106.04732v22021
  46. A Survey on Vision-Language-Action Models for Autonomous Driving

    Sicong Jiang, Zilin Huang, Kangan Qian +17

    cs.CVcs.AIcs.ROarXiv:2506.24044v12025
  47. Image Restoration Using Joint Statistical Modeling in Space-Transform Domain

    Jian Zhang, Debin Zhao, Ruiqin Xiong +2

    cs.MMcs.CVarXiv:1405.3173v12014
  48. AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One

    Mike Ranzinger, Greg Heinrich, Jan Kautz +1

    cs.CVarXiv:2312.06709v52023
  49. Mix3D: Out-of-Context Data Augmentation for 3D Scenes

    Alexey Nekrasov, Jonas Schult, Or Litany +2

    cs.CVarXiv:2110.02210v22021
  50. Weakly Supervised Video Anomaly Detection via Center-guided Discriminative Learning

    Boyang Wan, Yuming Fang, Xue Xia +1

    cs.CVarXiv:2104.07268v12021
  51. Robust Visual Tracking via Hierarchical Convolutional Features

    Chao Ma, Jia-Bin Huang, Xiaokang Yang +1

    cs.CVarXiv:1707.03816v22017
  52. Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting

    Siru Zhong, Weilin Ruan, Ming Jin +3

    cs.CVcs.LGarXiv:2502.04395v22025
  53. The Norm Must Go On: Dynamic Unsupervised Domain Adaptation by Normalization

    M. Jehanzeb Mirza, Jakub Micorek, Horst Possegger +1

    cs.CVarXiv:2112.00463v22021
  54. Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction

    Jing He, Haodong Li, Wei Yin +6

    cs.CVarXiv:2409.18124v52024
  55. DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding

    Geng Li, Jinglin Xu, Yunzhen Zhao +1

    cs.CVarXiv:2504.14920v12025
  56. Aligning Bag of Regions for Open-Vocabulary Object Detection

    Size Wu, Wenwei Zhang, Sheng Jin +2

    cs.CVarXiv:2302.13996v12023
  57. Instance Credibility Inference for Few-Shot Learning

    Yikai Wang, Chengming Xu, Chen Liu +2

    cs.CVcs.LGarXiv:2003.11853v22020
  58. Deformed Implicit Field: Modeling 3D Shapes with Learned Dense Correspondence

    Yu Deng, Jiaolong Yang, Xin Tong

    cs.CVarXiv:2011.13650v32020
  59. OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics Generation

    Yuchen Lin, Chenguo Lin, Jianjin Xu +1

    cs.CVarXiv:2501.18982v12025
  60. Regularizing Generative Adversarial Networks under Limited Data

    Hung-Yu Tseng, Lu Jiang, Ce Liu +2

    cs.LGcs.CVarXiv:2104.03310v12021