Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

4,321 to 4,380 of 18,799

  1. GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models

    Pedram MohajerAnsari, Amir Salarpour, Run Wang +1

    cs.CVarXiv:2608.29395v12026
  2. SAM2-UNet: Segment Anything 2 Makes Strong Encoder for Natural and Medical Image Segmentation

    Xinyu Xiong, Zihuang Wu, Shuangyi Tan +6

    cs.CVarXiv:2408.08870v12024
  3. Unpaired Image Super-Resolution using Pseudo-Supervision

    Shunta Maeda

    eess.IVcs.CVarXiv:2002.11397v12020
  4. MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle

    Pranav Durai, Gary Doran

    cs.CVarXiv:2608.28724v12026
  5. Captioning Images with Diverse Objects

    Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3

    cs.CVcs.CLarXiv:1606.07770v32016
  6. Spring: A High-Resolution High-Detail Dataset and Benchmark for Scene Flow, Optical Flow and Stereo

    Lukas Mehl, Jenny Schmalfuss, Azin Jahedi +2

    cs.CVarXiv:2303.01943v12023
  7. RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss

    Andong Lu, Chenglong Li, Yuqing Yan +2

    cs.CVarXiv:2011.07189v32020
  8. Online Learning of Correspondences between Images

    Michael Felsberg, Fredrik Larsson, Johan Wiklund +2

    cs.CVarXiv:2608.13104v12026
  9. Beyond Max-Margin: Class Margin Equilibrium for Few-shot Object Detection

    Bohao Li, Boyu Yang, Chang Liu +3

    cs.CVarXiv:2103.04612v32021
  10. SGTR: End-to-end Scene Graph Generation with Transformer

    Rongjie Li, Songyang Zhang, Xuming He

    cs.CVcs.LGarXiv:2112.12970v32021
  11. OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles

    Yihe Deng, Hritik Bansal, Fan Yin +3

    cs.CVcs.CLarXiv:2503.17352v32025
  12. Interpreting CLIP with Hierarchical Sparse Autoencoders

    Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek

    cs.CVcs.AIcs.LGarXiv:2502.20578v22025
  13. Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images

    Basudha Pal, Arjun Narayanan, Neha Ajith +2

    cs.CVarXiv:2608.29456v12026
  14. Adaptive Homophily Clustering: Structure Homophily Graph Learning with Adaptive Filter for Hyperspectral Image

    Yao Ding, Weijie Kang, Aitao Yang +5

    cs.CVarXiv:2501.01595v22025
  15. High-for-Low and Low-for-High: Efficient Boundary Detection from Deep Object Features and its Applications to High-Level Vision

    Gedas Bertasius, Jianbo Shi, Lorenzo Torresani

    cs.CVarXiv:1504.06201v32015
  16. Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

    Yu Cheng, Arushi Goel, Hakan Bilen

    cs.CVarXiv:2608.29374v12026
  17. CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution

    Xin Liu, Jie Liu, Jie Tang +1

    cs.CVarXiv:2503.06896v12025
  18. DeepStory: Video Story QA by Deep Embedded Memory Networks

    Kyung-Min Kim, Min-Oh Heo, Seong-Ho Choi +1

    cs.CVcs.AIcs.CLarXiv:1707.00836v12017
  19. RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation

    Yuhan Li, Xianfeng Tan, Fangao Zeng +6

    cs.CVcs.AIarXiv:2608.29280v12026
  20. MNN: A Universal and Efficient Inference Engine

    Xiaotang Jiang, Huan Wang, Yiliu Chen +9

    cs.CVcs.DCcs.LGarXiv:2002.12418v12020
  21. Pooled Motion Features for First-Person Videos

    M. S. Ryoo, Brandon Rothrock, Larry Matthies

    cs.CVarXiv:1412.6505v22014
  22. VideoRAG: Retrieval-Augmented Generation over Video Corpus

    Soyeong Jeong, Kangsan Kim, Jinheon Baek +1

    cs.CVcs.AIcs.CLarXiv:2501.05874v32025
  23. DiffuScene: Denoising Diffusion Models for Generative Indoor Scene Synthesis

    Jiapeng Tang, Yinyu Nie, Lev Markhasin +3

    cs.CVarXiv:2303.14207v22023
  24. Wavelet-Assisted Multi-Frequency Attention Network for Pansharpening

    Jie Huang, Rui Huang, Jinghao Xu +3

    eess.IVcs.AIcs.CVarXiv:2502.04903v12025
  25. ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-Shot

    Jiarui Cai, Yizhou Wang, Jenq-Neng Hwang

    cs.CVarXiv:2108.02385v12021
  26. Image Processing using Smooth Ordering of its Patches

    Idan Ram, Michael Elad, Israel Cohen

    cs.CVarXiv:1210.3832v12012
  27. Graph-Based Blind Image Deblurring From a Single Photograph

    Yuanchao Bai, Gene Cheung, Xianming Liu +1

    cs.CVarXiv:1802.07929v12018
  28. Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network

    Bairui Wang, Lin Ma, Wei Zhang +3

    cs.CVarXiv:1908.10072v12019
  29. PolSAR Image Classification using a Hybrid Complex-Valued Network (HybridCVNet)

    Mohammed Q. Alkhatib

    cs.CVarXiv:2605.31137v12026
  30. Collaborative Global-Local Networks for Memory-Efficient Segmentation of Ultra-High Resolution Images

    Wuyang Chen, Ziyu Jiang, Zhangyang Wang +2

    cs.CVarXiv:1905.06368v32019
  31. Meta Batch-Instance Normalization for Generalizable Person Re-Identification

    Seokeon Choi, Taekyung Kim, Minki Jeong +2

    cs.CVarXiv:2011.14670v22020
  32. R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO

    Huanjin Yao, Qixiang Yin, Jingyi Zhang +8

    cs.CVcs.AIcs.CLarXiv:2505.16673v12025
  33. Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion

    Nikolaos Livathinos, Christoph Auer, Maksym Lysak +14

    cs.CLcs.CVcs.SEarXiv:2501.17887v12025
  34. Deep convolutional networks for pancreas segmentation in CT imaging

    Holger R. Roth, Amal Farag, Le Lu +2

    cs.CVarXiv:1504.03967v12015
  35. The Third Challenge on Image Denoising at NTIRE 2026: Methods and Results

    Lei Sun, Hang Guo, Bin Ren +6

    cs.CVarXiv:2606.16031v12026
  36. NAFSSR: Stereo Image Super-Resolution Using NAFNet

    Xiaojie Chu, Liangyu Chen, Wenqing Yu

    cs.CVarXiv:2204.08714v22022
  37. Auto-Exposure Fusion for Single-Image Shadow Removal

    Lan Fu, Changqing Zhou, Qing Guo +5

    cs.CVarXiv:2103.01255v22021
  38. Interactive World Simulator for Robot Policy Training and Evaluation

    Yixuan Wang, Rhythm Syed, Fangyu Wu +7

    cs.ROcs.CVcs.LGarXiv:2603.08546v12026
  39. STAMP: Scalable Task And Model-agnostic Collaborative Perception

    Xiangbo Gao, Runsheng Xu, Jiachen Li +3

    cs.CVcs.AIcs.ROarXiv:2501.18616v12025
  40. Joint Inference of Groups, Events and Human Roles in Aerial Videos

    Tianmin Shu, Dan Xie, Brandon Rothrock +2

    cs.CVarXiv:1505.05957v12015
  41. Graph Edge Convolutional Neural Networks for Skeleton Based Action Recognition

    Xikun Zhang, Chang Xu, Xinmei Tian +1

    cs.CVarXiv:1805.06184v22018
  42. Recovering 3D Human Mesh from Monocular Images: A Survey

    Yating Tian, Hongwen Zhang, Yebin Liu +1

    cs.CVcs.GRarXiv:2203.01923v62022
  43. Foundation Models in Remote Sensing: Evolving from Unimodality to Multimodality

    Danfeng Hong, Chenyu Li, Xuyang Li +2

    cs.CVcs.SEarXiv:2603.00988v12026
  44. Shape Inpainting using 3D Generative Adversarial Network and Recurrent Convolutional Networks

    Weiyue Wang, Qiangui Huang, Suya You +2

    cs.CVarXiv:1711.06375v12017
  45. Detection of Coronavirus (COVID-19) Associated Pneumonia based on Generative Adversarial Networks and a Fine-Tuned Deep Transfer Learning Model using Chest X-ray Dataset

    Nour Eldeen M. Khalifa, Mohamed Hamed N. Taha, Aboul Ella Hassanien +1

    eess.IVcs.CVcs.LGarXiv:2004.01184v12020
  46. Galileo: Learning Global & Local Features of Many Remote Sensing Modalities

    Gabriel Tseng, Anthony Fuller, Marlena Reil +7

    cs.CVarXiv:2502.09356v32025
  47. Centering before Pruning: Lightweight Geometry Correction for Diversity-Based Visual Token Pruning in LVLMs

    Shunjie Wen, Jaeyeon Lee, Dong-Wan Choi

    cs.CVcs.AIarXiv:2608.30263v12026
  48. NVIDIA FLARE: Federated Learning from Simulation to Real-World

    Holger R. Roth, Yan Cheng, Yuhong Wen +20

    cs.LGcs.AIcs.CVarXiv:2210.13291v32022
  49. MCSeg: Pre-training and Fine-tuning Volumetric Pyramid Transformer for Multi-modal Cardiac Image Segmentation

    Zhiyu Ye, Hairong Zheng, Tong Zhang

    cs.CVarXiv:2608.30371v12026
  50. A*3D Dataset: Towards Autonomous Driving in Challenging Environments

    Quang-Hieu Pham, Pierre Sevestre, Ramanpreet Singh Pahwa +6

    cs.CVcs.ROarXiv:1909.07541v12019
  51. Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

    Tao Lin, Gen Li, Yilei Zhong +5

    cs.ROcs.CVarXiv:2507.00416v32025
  52. Thinking with Generated Images

    Ethan Chern, Zhulin Hu, Steffi Chern +5

    cs.CVcs.AIcs.CLarXiv:2505.22525v12025
  53. WESPE: Weakly Supervised Photo Enhancer for Digital Cameras

    Andrey Ignatov, Nikolay Kobyshev, Radu Timofte +2

    cs.CVarXiv:1709.01118v22017
  54. Amortized Anchor Refinement for Deployable Continuous-Time 4D Gaussian Reconstruction

    Jingong Chen, Qingwen Zhang, Sanghyeon Jun +3

    cs.CVarXiv:2608.30218v12026
  55. Interlaced Sparse Self-Attention for Semantic Segmentation

    Lang Huang, Yuhui Yuan, Jianyuan Guo +3

    cs.CVarXiv:1907.12273v22019
  56. Avat3r: Large Animatable Gaussian Reconstruction Model for High-fidelity 3D Head Avatars

    Tobias Kirschstein, Javier Romero, Artem Sevastopolsky +2

    cs.CVarXiv:2502.20220v22025
  57. OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection

    Xiaoyan Wei, Zhimin Yao, Ruilin Yang +4

    cs.CVarXiv:2608.30247v12026
  58. DiffTalk: Crafting Diffusion Models for Generalized Audio-Driven Portraits Animation

    Shuai Shen, Wenliang Zhao, Zibin Meng +4

    cs.CVarXiv:2301.03786v22023
  59. Implicit Neural Representation in Medical Imaging: A Comparative Survey

    Amirali Molaei, Amirhossein Aminimehr, Armin Tavakoli +4

    eess.IVcs.CVarXiv:2307.16142v12023
  60. General In-Hand Object Rotation with Vision and Touch

    Haozhi Qi, Brent Yi, Sudharshan Suresh +4

    cs.ROcs.AIcs.CVarXiv:2309.09979v22023