Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

4,561 to 4,620 of 18,816

  1. C-HiLasso: A Collaborative Hierarchical Sparse Modeling Framework

    Pablo Sprechmann, Ignacio Ramírez, Guillermo Sapiro +1

    stat.MLcs.CVarXiv:1006.1346v22010
  2. Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision

    Xiaofeng Han, Shunpeng Chen, Zenghuang Fu +9

    cs.ROcs.CVarXiv:2504.02477v32025
  3. Semantic Object Accuracy for Generative Text-to-Image Synthesis

    Tobias Hinz, Stefan Heinrich, Stefan Wermter

    cs.CVcs.LGcs.NEarXiv:1910.13321v22019
  4. Few-shot Object Detection on Remote Sensing Images

    Jingyu Deng, Xiang Li, Yi Fang

    cs.CVarXiv:2006.07826v22020
  5. Learning Graphical Model Parameters with Approximate Marginal Inference

    Justin Domke

    cs.LGcs.CVarXiv:1301.3193v12013
  6. Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector

    Xiao Guo, Xiufeng Song, Yue Zhang +2

    cs.CVarXiv:2503.20188v12025
  7. Object Detection with Spiking Neural Networks on Automotive Event Data

    Loïc Cordone, Benoît Miramond, Philippe Thierion

    cs.CVarXiv:2205.04339v12022
  8. MotionLCM: Real-time Controllable Motion Generation via Latent Consistency Model

    Wenxun Dai, Ling-Hao Chen, Jingbo Wang +3

    cs.CVarXiv:2404.19759v32024
  9. VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

    Jianke Zhang, Xiaoyu Chen, Qiuyue Wang +7

    cs.CVcs.AIarXiv:2601.03309v22026
  10. Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation

    Shanchuan Lin, Ceyuan Yang, Hao He +6

    cs.CVcs.AIcs.LGarXiv:2506.09350v22025
  11. TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

    Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant +3

    cs.CVarXiv:2608.30068v22026
  12. NAF: Neural Attenuation Fields for Sparse-View CBCT Reconstruction

    Ruyi Zha, Yanhao Zhang, Hongdong Li

    eess.IVcs.CVarXiv:2209.14540v12022
  13. A Free Lunch for Unsupervised Domain Adaptive Object Detection without Source Data

    Xianfeng Li, Weijie Chen, Di Xie +4

    cs.CVarXiv:2012.05400v12020
  14. Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization

    Aditi Sarker, Rafi Ibn Sultan, Hui Zhu +2

    cs.CVcs.AIcs.LGarXiv:2608.29924v12026
  15. Integer Discrete Flows and Lossless Compression

    Emiel Hoogeboom, Jorn W. T. Peters, Rianne van den Berg +1

    cs.LGcs.CVstat.MLarXiv:1905.07376v42019
  16. Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness

    Haochen Wang, Yucheng Zhao, Tiancai Wang +3

    cs.CVcs.AIcs.CLarXiv:2504.01901v12025
  17. Deep Hyperspectral Prior: Denoising, Inpainting, Super-Resolution

    Oleksii Sidorov, Jon Yngve Hardeberg

    cs.CVarXiv:1902.00301v22019
  18. (De)Randomized Smoothing for Certifiable Defense against Patch Attacks

    Alexander Levine, Soheil Feizi

    cs.LGcs.CVstat.MLarXiv:2002.10733v32020
  19. Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose Estimation

    Shreyas Hampali, Sayan Deb Sarkar, Mahdi Rad +1

    cs.CVarXiv:2104.14639v22021
  20. InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection

    Weifei Chen, Honghao Zhang, Zhiyuan You +1

    cs.CVarXiv:2608.29783v12026
  21. Cross-Domain Transferability of Adversarial Perturbations

    Muzammal Naseer, Salman H. Khan, Harris Khan +2

    cs.CVarXiv:1905.11736v52019
  22. M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models

    Fan Bai, Yuxin Du, Tiejun Huang +2

    cs.CVarXiv:2404.00578v12024
  23. StreamMapNet: Streaming Mapping Network for Vectorized Online HD Map Construction

    Tianyuan Yuan, Yicheng Liu, Yue Wang +2

    cs.CVarXiv:2308.12570v22023
  24. NBS: No Bias Stereo

    Vage Taamazyan, Zhuowen Shen, Stefan Hinterstoisser +6

    cs.CVarXiv:2608.28933v12026
  25. The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering

    Zhuowei Li, Haizhou Shi, Yunhe Gao +7

    cs.CVcs.AIcs.LGarXiv:2502.03628v22025
  26. VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation

    Hanzhi Chen, Boyang Sun, Anran Zhang +2

    cs.ROcs.CVarXiv:2503.07135v22025
  27. Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?

    Zichen Wen, Yifeng Gao, Weijia Li +2

    cs.CLcs.CVarXiv:2502.11501v22025
  28. AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos

    Laura Smith, Nikita Dhawan, Marvin Zhang +2

    cs.ROcs.CVcs.LGarXiv:1912.04443v32019
  29. Synthetic Medical Images from Dual Generative Adversarial Networks

    John T. Guibas, Tejpal S. Virdi, Peter S. Li

    cs.CVarXiv:1709.01872v32017
  30. WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation

    Dujun Nie, Xianda Guo, Yiqun Duan +2

    cs.CVcs.ROarXiv:2503.02247v52025
  31. The University of California San Francisco Preoperative Diffuse Glioma MRI (UCSF-PDGM) Dataset

    Evan Calabrese, Javier E. Villanueva-Meyer, Jeffrey D. Rudie +6

    cs.CVeess.IVarXiv:2109.00356v22021
  32. Deep Learning based Retinal OCT Segmentation

    Mike Pekala, Neil Joshi, David E. Freund +3

    cs.CVarXiv:1801.09749v12018
  33. Few-shot Medical Image Segmentation using a Global Correlation Network with Discriminative Embedding

    Liyan Sun, Chenxin Li, Xinghao Ding +3

    cs.CVarXiv:2012.05440v12020
  34. Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance

    Li Hu, Guangyuan Wang, Zhen Shen +6

    cs.CVarXiv:2502.06145v12025
  35. Feature Level Fusion of Face and Fingerprint Biometrics

    Ajita Rattani, Dakshina Ranjan Kisku, Manuele Bicego +1

    cs.CVcs.AIarXiv:1002.2523v12010
  36. One Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image Fusion

    Chunyang Cheng, Tianyang Xu, Zhenhua Feng +7

    cs.CVarXiv:2502.19854v22025
  37. GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation

    Tianwei Xiong, Jun Hao Liew, Zilong Huang +2

    cs.CVarXiv:2504.08736v22025
  38. Kimodo: Scaling Controllable Human Motion Generation

    Davis Rempe, Mathis Petrovich, Ye Yuan +21

    cs.CVcs.GRcs.ROarXiv:2603.15546v12026
  39. Underwater Image Restoration Through a Prior Guided Hybrid Sense Approach and Extensive Benchmark Analysis

    Xiaojiao Guo, Xuhang Chen, Shuqiang Wang +1

    cs.CVarXiv:2501.02701v12025
  40. Urban Driving with Conditional Imitation Learning

    Jeffrey Hawke, Richard Shen, Corina Gurau +8

    cs.CVcs.AIcs.LGarXiv:1912.00177v22019
  41. SCSegamba: Lightweight Structure-Aware Vision Mamba for Crack Segmentation in Structures

    Hui Liu, Chen Jia, Fan Shi +2

    cs.CVarXiv:2503.01113v32025
  42. EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI

    Tai Wang, Xiaohan Mao, Chenming Zhu +11

    cs.CVcs.AIcs.ROarXiv:2312.16170v12023
  43. FS-Net: Fast Shape-based Network for Category-Level 6D Object Pose Estimation with Decoupled Rotation Mechanism

    Wei Chen, Xi Jia, Hyung Jin Chang +3

    cs.CVarXiv:2103.07054v22021
  44. Learning to Learn with Variational Information Bottleneck for Domain Generalization

    Yingjun Du, Jun Xu, Huan Xiong +4

    cs.CVarXiv:2007.07645v12020
  45. A Comprehensive Survey on World Models for Embodied AI

    Xinqing Li, Xin He, Le Zhang +3

    cs.CVarXiv:2510.16732v32025
  46. Uncertainty-aware Self-ensembling Model for Semi-supervised 3D Left Atrium Segmentation

    Lequan Yu, Shujun Wang, Xiaomeng Li +2

    cs.CVarXiv:1907.07034v12019
  47. R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

    Yi-Fan Zhang, Xingyu Lu, Xiao Hu +13

    cs.CVcs.CLarXiv:2505.02835v22025
  48. Learning a Dilated Residual Network for SAR Image Despeckling

    Qiang Zhang, Qiangqiang Yuan, Jie Li +2

    cs.CVarXiv:1709.02898v32017
  49. Bayesian Fusion of Multi-Band Images

    Qi Wei, Nicolas Dobigeon, Jean-Yves Tourneret

    cs.CVphysics.data-anstat.MEarXiv:1307.5996v22013
  50. GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing

    Akashah Shabbir, Mohammed Zumri, Mohammed Bennamoun +2

    cs.CVarXiv:2501.13925v12025
  51. DFR: Deep Feature Reconstruction for Unsupervised Anomaly Segmentation

    Jie Yang, Yong Shi, Zhiquan Qi

    cs.CVarXiv:2012.07122v12020
  52. Training-Free Hidden-State Refinement for Flow-Matching Image Generators

    Yuanyi Yan, Xinzhe Rao, Canyu Shen +5

    cs.CVcs.AIarXiv:2608.29160v12026
  53. UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions

    Zhucun Xue, Jiangning Zhang, Teng Hu +8

    cs.CVarXiv:2506.13691v12025
  54. Drift Calibration in Geometric Eye Tracking Systems

    Jiaqi Liu, Zixuan Wang, Yuhong Zhang +4

    cs.CVarXiv:2608.29739v12026
  55. Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers

    Lirui Wang, Xinlei Chen, Jialiang Zhao +1

    cs.ROcs.CVcs.LGarXiv:2409.20537v12024
  56. 3D and 4D World Modeling: A Survey

    Lingdong Kong, Yu Yang, Jianbiao Mei +20

    cs.CVcs.ROarXiv:2509.07996v42025
  57. Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation

    Lu Ling, Chen-Hsuan Lin, Tsung-Yi Lin +7

    cs.CVarXiv:2505.02836v12025
  58. Multi-Column Deep Neural Networks for Offline Handwritten Chinese Character Classification

    Dan Cireşan, Jürgen Schmidhuber

    cs.CVarXiv:1309.0261v12013
  59. Joint Learning of Motion Estimation and Segmentation for Cardiac MR Image Sequences

    Chen Qin, Wenjia Bai, Jo Schlemper +4

    cs.CVarXiv:1806.04066v12018
  60. Look-Back: Implicit Visual Re-focusing in MLLM Reasoning

    Shuo Yang, Yuwei Niu, Yuyang Liu +3

    cs.CVcs.LGarXiv:2507.03019v12025