Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
4,321 to 4,380 of 18,799
GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models
Pedram MohajerAnsari, Amir Salarpour, Run Wang +1
cs.CVarXiv:2608.29395v12026SAM2-UNet: Segment Anything 2 Makes Strong Encoder for Natural and Medical Image Segmentation
Xinyu Xiong, Zihuang Wu, Shuangyi Tan +6
cs.CVarXiv:2408.08870v12024Unpaired Image Super-Resolution using Pseudo-Supervision
Shunta Maeda
eess.IVcs.CVarXiv:2002.11397v12020MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle
Pranav Durai, Gary Doran
cs.CVarXiv:2608.28724v12026Captioning Images with Diverse Objects
Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3
cs.CVcs.CLarXiv:1606.07770v32016Spring: A High-Resolution High-Detail Dataset and Benchmark for Scene Flow, Optical Flow and Stereo
Lukas Mehl, Jenny Schmalfuss, Azin Jahedi +2
cs.CVarXiv:2303.01943v12023RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss
Andong Lu, Chenglong Li, Yuqing Yan +2
cs.CVarXiv:2011.07189v32020Online Learning of Correspondences between Images
Michael Felsberg, Fredrik Larsson, Johan Wiklund +2
cs.CVarXiv:2608.13104v12026Beyond Max-Margin: Class Margin Equilibrium for Few-shot Object Detection
Bohao Li, Boyu Yang, Chang Liu +3
cs.CVarXiv:2103.04612v32021SGTR: End-to-end Scene Graph Generation with Transformer
Rongjie Li, Songyang Zhang, Xuming He
cs.CVcs.LGarXiv:2112.12970v32021OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
Yihe Deng, Hritik Bansal, Fan Yin +3
cs.CVcs.CLarXiv:2503.17352v32025Interpreting CLIP with Hierarchical Sparse Autoencoders
Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek
cs.CVcs.AIcs.LGarXiv:2502.20578v22025Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images
Basudha Pal, Arjun Narayanan, Neha Ajith +2
cs.CVarXiv:2608.29456v12026Adaptive Homophily Clustering: Structure Homophily Graph Learning with Adaptive Filter for Hyperspectral Image
Yao Ding, Weijie Kang, Aitao Yang +5
cs.CVarXiv:2501.01595v22025High-for-Low and Low-for-High: Efficient Boundary Detection from Deep Object Features and its Applications to High-Level Vision
Gedas Bertasius, Jianbo Shi, Lorenzo Torresani
cs.CVarXiv:1504.06201v32015Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs
Yu Cheng, Arushi Goel, Hakan Bilen
cs.CVarXiv:2608.29374v12026CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution
Xin Liu, Jie Liu, Jie Tang +1
cs.CVarXiv:2503.06896v12025DeepStory: Video Story QA by Deep Embedded Memory Networks
Kyung-Min Kim, Min-Oh Heo, Seong-Ho Choi +1
cs.CVcs.AIcs.CLarXiv:1707.00836v12017RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation
Yuhan Li, Xianfeng Tan, Fangao Zeng +6
cs.CVcs.AIarXiv:2608.29280v12026MNN: A Universal and Efficient Inference Engine
Xiaotang Jiang, Huan Wang, Yiliu Chen +9
cs.CVcs.DCcs.LGarXiv:2002.12418v12020Pooled Motion Features for First-Person Videos
M. S. Ryoo, Brandon Rothrock, Larry Matthies
cs.CVarXiv:1412.6505v22014VideoRAG: Retrieval-Augmented Generation over Video Corpus
Soyeong Jeong, Kangsan Kim, Jinheon Baek +1
cs.CVcs.AIcs.CLarXiv:2501.05874v32025DiffuScene: Denoising Diffusion Models for Generative Indoor Scene Synthesis
Jiapeng Tang, Yinyu Nie, Lev Markhasin +3
cs.CVarXiv:2303.14207v22023Wavelet-Assisted Multi-Frequency Attention Network for Pansharpening
Jie Huang, Rui Huang, Jinghao Xu +3
eess.IVcs.AIcs.CVarXiv:2502.04903v12025ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-Shot
Jiarui Cai, Yizhou Wang, Jenq-Neng Hwang
cs.CVarXiv:2108.02385v12021Image Processing using Smooth Ordering of its Patches
Idan Ram, Michael Elad, Israel Cohen
cs.CVarXiv:1210.3832v12012Graph-Based Blind Image Deblurring From a Single Photograph
Yuanchao Bai, Gene Cheung, Xianming Liu +1
cs.CVarXiv:1802.07929v12018Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network
Bairui Wang, Lin Ma, Wei Zhang +3
cs.CVarXiv:1908.10072v12019PolSAR Image Classification using a Hybrid Complex-Valued Network (HybridCVNet)
Mohammed Q. Alkhatib
cs.CVarXiv:2605.31137v12026Collaborative Global-Local Networks for Memory-Efficient Segmentation of Ultra-High Resolution Images
Wuyang Chen, Ziyu Jiang, Zhangyang Wang +2
cs.CVarXiv:1905.06368v32019Meta Batch-Instance Normalization for Generalizable Person Re-Identification
Seokeon Choi, Taekyung Kim, Minki Jeong +2
cs.CVarXiv:2011.14670v22020R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
Huanjin Yao, Qixiang Yin, Jingyi Zhang +8
cs.CVcs.AIcs.CLarXiv:2505.16673v12025Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion
Nikolaos Livathinos, Christoph Auer, Maksym Lysak +14
cs.CLcs.CVcs.SEarXiv:2501.17887v12025Deep convolutional networks for pancreas segmentation in CT imaging
Holger R. Roth, Amal Farag, Le Lu +2
cs.CVarXiv:1504.03967v12015The Third Challenge on Image Denoising at NTIRE 2026: Methods and Results
Lei Sun, Hang Guo, Bin Ren +6
cs.CVarXiv:2606.16031v12026NAFSSR: Stereo Image Super-Resolution Using NAFNet
Xiaojie Chu, Liangyu Chen, Wenqing Yu
cs.CVarXiv:2204.08714v22022Auto-Exposure Fusion for Single-Image Shadow Removal
Lan Fu, Changqing Zhou, Qing Guo +5
cs.CVarXiv:2103.01255v22021Interactive World Simulator for Robot Policy Training and Evaluation
Yixuan Wang, Rhythm Syed, Fangyu Wu +7
cs.ROcs.CVcs.LGarXiv:2603.08546v12026STAMP: Scalable Task And Model-agnostic Collaborative Perception
Xiangbo Gao, Runsheng Xu, Jiachen Li +3
cs.CVcs.AIcs.ROarXiv:2501.18616v12025Joint Inference of Groups, Events and Human Roles in Aerial Videos
Tianmin Shu, Dan Xie, Brandon Rothrock +2
cs.CVarXiv:1505.05957v12015Graph Edge Convolutional Neural Networks for Skeleton Based Action Recognition
Xikun Zhang, Chang Xu, Xinmei Tian +1
cs.CVarXiv:1805.06184v22018Recovering 3D Human Mesh from Monocular Images: A Survey
Yating Tian, Hongwen Zhang, Yebin Liu +1
cs.CVcs.GRarXiv:2203.01923v62022Foundation Models in Remote Sensing: Evolving from Unimodality to Multimodality
Danfeng Hong, Chenyu Li, Xuyang Li +2
cs.CVcs.SEarXiv:2603.00988v12026Shape Inpainting using 3D Generative Adversarial Network and Recurrent Convolutional Networks
Weiyue Wang, Qiangui Huang, Suya You +2
cs.CVarXiv:1711.06375v12017Detection of Coronavirus (COVID-19) Associated Pneumonia based on Generative Adversarial Networks and a Fine-Tuned Deep Transfer Learning Model using Chest X-ray Dataset
Nour Eldeen M. Khalifa, Mohamed Hamed N. Taha, Aboul Ella Hassanien +1
eess.IVcs.CVcs.LGarXiv:2004.01184v12020Galileo: Learning Global & Local Features of Many Remote Sensing Modalities
Gabriel Tseng, Anthony Fuller, Marlena Reil +7
cs.CVarXiv:2502.09356v32025Centering before Pruning: Lightweight Geometry Correction for Diversity-Based Visual Token Pruning in LVLMs
Shunjie Wen, Jaeyeon Lee, Dong-Wan Choi
cs.CVcs.AIarXiv:2608.30263v12026NVIDIA FLARE: Federated Learning from Simulation to Real-World
Holger R. Roth, Yan Cheng, Yuhong Wen +20
cs.LGcs.AIcs.CVarXiv:2210.13291v32022MCSeg: Pre-training and Fine-tuning Volumetric Pyramid Transformer for Multi-modal Cardiac Image Segmentation
Zhiyu Ye, Hairong Zheng, Tong Zhang
cs.CVarXiv:2608.30371v12026A*3D Dataset: Towards Autonomous Driving in Challenging Environments
Quang-Hieu Pham, Pierre Sevestre, Ramanpreet Singh Pahwa +6
cs.CVcs.ROarXiv:1909.07541v12019Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
Tao Lin, Gen Li, Yilei Zhong +5
cs.ROcs.CVarXiv:2507.00416v32025Thinking with Generated Images
Ethan Chern, Zhulin Hu, Steffi Chern +5
cs.CVcs.AIcs.CLarXiv:2505.22525v12025WESPE: Weakly Supervised Photo Enhancer for Digital Cameras
Andrey Ignatov, Nikolay Kobyshev, Radu Timofte +2
cs.CVarXiv:1709.01118v22017Amortized Anchor Refinement for Deployable Continuous-Time 4D Gaussian Reconstruction
Jingong Chen, Qingwen Zhang, Sanghyeon Jun +3
cs.CVarXiv:2608.30218v12026Interlaced Sparse Self-Attention for Semantic Segmentation
Lang Huang, Yuhui Yuan, Jianyuan Guo +3
cs.CVarXiv:1907.12273v22019Avat3r: Large Animatable Gaussian Reconstruction Model for High-fidelity 3D Head Avatars
Tobias Kirschstein, Javier Romero, Artem Sevastopolsky +2
cs.CVarXiv:2502.20220v22025OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection
Xiaoyan Wei, Zhimin Yao, Ruilin Yang +4
cs.CVarXiv:2608.30247v12026DiffTalk: Crafting Diffusion Models for Generalized Audio-Driven Portraits Animation
Shuai Shen, Wenliang Zhao, Zibin Meng +4
cs.CVarXiv:2301.03786v22023Implicit Neural Representation in Medical Imaging: A Comparative Survey
Amirali Molaei, Amirhossein Aminimehr, Armin Tavakoli +4
eess.IVcs.CVarXiv:2307.16142v12023General In-Hand Object Rotation with Vision and Touch
Haozhi Qi, Brent Yi, Sudharshan Suresh +4
cs.ROcs.AIcs.CVarXiv:2309.09979v22023