Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
4,561 to 4,620 of 18,816
C-HiLasso: A Collaborative Hierarchical Sparse Modeling Framework
Pablo Sprechmann, Ignacio Ramírez, Guillermo Sapiro +1
stat.MLcs.CVarXiv:1006.1346v22010Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
Xiaofeng Han, Shunpeng Chen, Zenghuang Fu +9
cs.ROcs.CVarXiv:2504.02477v32025Semantic Object Accuracy for Generative Text-to-Image Synthesis
Tobias Hinz, Stefan Heinrich, Stefan Wermter
cs.CVcs.LGcs.NEarXiv:1910.13321v22019Few-shot Object Detection on Remote Sensing Images
Jingyu Deng, Xiang Li, Yi Fang
cs.CVarXiv:2006.07826v22020Learning Graphical Model Parameters with Approximate Marginal Inference
Justin Domke
cs.LGcs.CVarXiv:1301.3193v12013Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
Xiao Guo, Xiufeng Song, Yue Zhang +2
cs.CVarXiv:2503.20188v12025Object Detection with Spiking Neural Networks on Automotive Event Data
Loïc Cordone, Benoît Miramond, Philippe Thierion
cs.CVarXiv:2205.04339v12022MotionLCM: Real-time Controllable Motion Generation via Latent Consistency Model
Wenxun Dai, Ling-Hao Chen, Jingbo Wang +3
cs.CVarXiv:2404.19759v32024VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
Jianke Zhang, Xiaoyu Chen, Qiuyue Wang +7
cs.CVcs.AIarXiv:2601.03309v22026Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
Shanchuan Lin, Ceyuan Yang, Hao He +6
cs.CVcs.AIcs.LGarXiv:2506.09350v22025TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film
Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant +3
cs.CVarXiv:2608.30068v22026NAF: Neural Attenuation Fields for Sparse-View CBCT Reconstruction
Ruyi Zha, Yanhao Zhang, Hongdong Li
eess.IVcs.CVarXiv:2209.14540v12022A Free Lunch for Unsupervised Domain Adaptive Object Detection without Source Data
Xianfeng Li, Weijie Chen, Di Xie +4
cs.CVarXiv:2012.05400v12020Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization
Aditi Sarker, Rafi Ibn Sultan, Hui Zhu +2
cs.CVcs.AIcs.LGarXiv:2608.29924v12026Integer Discrete Flows and Lossless Compression
Emiel Hoogeboom, Jorn W. T. Peters, Rianne van den Berg +1
cs.LGcs.CVstat.MLarXiv:1905.07376v42019Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness
Haochen Wang, Yucheng Zhao, Tiancai Wang +3
cs.CVcs.AIcs.CLarXiv:2504.01901v12025Deep Hyperspectral Prior: Denoising, Inpainting, Super-Resolution
Oleksii Sidorov, Jon Yngve Hardeberg
cs.CVarXiv:1902.00301v22019(De)Randomized Smoothing for Certifiable Defense against Patch Attacks
Alexander Levine, Soheil Feizi
cs.LGcs.CVstat.MLarXiv:2002.10733v32020Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose Estimation
Shreyas Hampali, Sayan Deb Sarkar, Mahdi Rad +1
cs.CVarXiv:2104.14639v22021InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection
Weifei Chen, Honghao Zhang, Zhiyuan You +1
cs.CVarXiv:2608.29783v12026Cross-Domain Transferability of Adversarial Perturbations
Muzammal Naseer, Salman H. Khan, Harris Khan +2
cs.CVarXiv:1905.11736v52019M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
Fan Bai, Yuxin Du, Tiejun Huang +2
cs.CVarXiv:2404.00578v12024StreamMapNet: Streaming Mapping Network for Vectorized Online HD Map Construction
Tianyuan Yuan, Yicheng Liu, Yue Wang +2
cs.CVarXiv:2308.12570v22023NBS: No Bias Stereo
Vage Taamazyan, Zhuowen Shen, Stefan Hinterstoisser +6
cs.CVarXiv:2608.28933v12026The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
Zhuowei Li, Haizhou Shi, Yunhe Gao +7
cs.CVcs.AIcs.LGarXiv:2502.03628v22025VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation
Hanzhi Chen, Boyang Sun, Anran Zhang +2
cs.ROcs.CVarXiv:2503.07135v22025Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
Zichen Wen, Yifeng Gao, Weijia Li +2
cs.CLcs.CVarXiv:2502.11501v22025AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos
Laura Smith, Nikita Dhawan, Marvin Zhang +2
cs.ROcs.CVcs.LGarXiv:1912.04443v32019Synthetic Medical Images from Dual Generative Adversarial Networks
John T. Guibas, Tejpal S. Virdi, Peter S. Li
cs.CVarXiv:1709.01872v32017WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation
Dujun Nie, Xianda Guo, Yiqun Duan +2
cs.CVcs.ROarXiv:2503.02247v52025The University of California San Francisco Preoperative Diffuse Glioma MRI (UCSF-PDGM) Dataset
Evan Calabrese, Javier E. Villanueva-Meyer, Jeffrey D. Rudie +6
cs.CVeess.IVarXiv:2109.00356v22021Deep Learning based Retinal OCT Segmentation
Mike Pekala, Neil Joshi, David E. Freund +3
cs.CVarXiv:1801.09749v12018Few-shot Medical Image Segmentation using a Global Correlation Network with Discriminative Embedding
Liyan Sun, Chenxin Li, Xinghao Ding +3
cs.CVarXiv:2012.05440v12020Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance
Li Hu, Guangyuan Wang, Zhen Shen +6
cs.CVarXiv:2502.06145v12025Feature Level Fusion of Face and Fingerprint Biometrics
Ajita Rattani, Dakshina Ranjan Kisku, Manuele Bicego +1
cs.CVcs.AIarXiv:1002.2523v12010One Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image Fusion
Chunyang Cheng, Tianyang Xu, Zhenhua Feng +7
cs.CVarXiv:2502.19854v22025GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
Tianwei Xiong, Jun Hao Liew, Zilong Huang +2
cs.CVarXiv:2504.08736v22025Kimodo: Scaling Controllable Human Motion Generation
Davis Rempe, Mathis Petrovich, Ye Yuan +21
cs.CVcs.GRcs.ROarXiv:2603.15546v12026Underwater Image Restoration Through a Prior Guided Hybrid Sense Approach and Extensive Benchmark Analysis
Xiaojiao Guo, Xuhang Chen, Shuqiang Wang +1
cs.CVarXiv:2501.02701v12025Urban Driving with Conditional Imitation Learning
Jeffrey Hawke, Richard Shen, Corina Gurau +8
cs.CVcs.AIcs.LGarXiv:1912.00177v22019SCSegamba: Lightweight Structure-Aware Vision Mamba for Crack Segmentation in Structures
Hui Liu, Chen Jia, Fan Shi +2
cs.CVarXiv:2503.01113v32025EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI
Tai Wang, Xiaohan Mao, Chenming Zhu +11
cs.CVcs.AIcs.ROarXiv:2312.16170v12023FS-Net: Fast Shape-based Network for Category-Level 6D Object Pose Estimation with Decoupled Rotation Mechanism
Wei Chen, Xi Jia, Hyung Jin Chang +3
cs.CVarXiv:2103.07054v22021Learning to Learn with Variational Information Bottleneck for Domain Generalization
Yingjun Du, Jun Xu, Huan Xiong +4
cs.CVarXiv:2007.07645v12020A Comprehensive Survey on World Models for Embodied AI
Xinqing Li, Xin He, Le Zhang +3
cs.CVarXiv:2510.16732v32025Uncertainty-aware Self-ensembling Model for Semi-supervised 3D Left Atrium Segmentation
Lequan Yu, Shujun Wang, Xiaomeng Li +2
cs.CVarXiv:1907.07034v12019R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
Yi-Fan Zhang, Xingyu Lu, Xiao Hu +13
cs.CVcs.CLarXiv:2505.02835v22025Learning a Dilated Residual Network for SAR Image Despeckling
Qiang Zhang, Qiangqiang Yuan, Jie Li +2
cs.CVarXiv:1709.02898v32017Bayesian Fusion of Multi-Band Images
Qi Wei, Nicolas Dobigeon, Jean-Yves Tourneret
cs.CVphysics.data-anstat.MEarXiv:1307.5996v22013GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
Akashah Shabbir, Mohammed Zumri, Mohammed Bennamoun +2
cs.CVarXiv:2501.13925v12025DFR: Deep Feature Reconstruction for Unsupervised Anomaly Segmentation
Jie Yang, Yong Shi, Zhiquan Qi
cs.CVarXiv:2012.07122v12020Training-Free Hidden-State Refinement for Flow-Matching Image Generators
Yuanyi Yan, Xinzhe Rao, Canyu Shen +5
cs.CVcs.AIarXiv:2608.29160v12026UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
Zhucun Xue, Jiangning Zhang, Teng Hu +8
cs.CVarXiv:2506.13691v12025Drift Calibration in Geometric Eye Tracking Systems
Jiaqi Liu, Zixuan Wang, Yuhong Zhang +4
cs.CVarXiv:2608.29739v12026Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers
Lirui Wang, Xinlei Chen, Jialiang Zhao +1
cs.ROcs.CVcs.LGarXiv:2409.20537v120243D and 4D World Modeling: A Survey
Lingdong Kong, Yu Yang, Jianbiao Mei +20
cs.CVcs.ROarXiv:2509.07996v42025Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation
Lu Ling, Chen-Hsuan Lin, Tsung-Yi Lin +7
cs.CVarXiv:2505.02836v12025Multi-Column Deep Neural Networks for Offline Handwritten Chinese Character Classification
Dan Cireşan, Jürgen Schmidhuber
cs.CVarXiv:1309.0261v12013Joint Learning of Motion Estimation and Segmentation for Cardiac MR Image Sequences
Chen Qin, Wenjia Bai, Jo Schlemper +4
cs.CVarXiv:1806.04066v12018Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
Shuo Yang, Yuwei Niu, Yuyang Liu +3
cs.CVcs.LGarXiv:2507.03019v12025