Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

4,381 to 4,440 of 18,855

  1. Captioning Images with Diverse Objects

    Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3

    cs.CVcs.CLarXiv:1606.07770v32016
  2. Spring: A High-Resolution High-Detail Dataset and Benchmark for Scene Flow, Optical Flow and Stereo

    Lukas Mehl, Jenny Schmalfuss, Azin Jahedi +2

    cs.CVarXiv:2303.01943v12023
  3. RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss

    Andong Lu, Chenglong Li, Yuqing Yan +2

    cs.CVarXiv:2011.07189v32020
  4. Online Learning of Correspondences between Images

    Michael Felsberg, Fredrik Larsson, Johan Wiklund +2

    cs.CVarXiv:2608.13104v12026
  5. Beyond Max-Margin: Class Margin Equilibrium for Few-shot Object Detection

    Bohao Li, Boyu Yang, Chang Liu +3

    cs.CVarXiv:2103.04612v32021
  6. SGTR: End-to-end Scene Graph Generation with Transformer

    Rongjie Li, Songyang Zhang, Xuming He

    cs.CVcs.LGarXiv:2112.12970v32021
  7. OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles

    Yihe Deng, Hritik Bansal, Fan Yin +3

    cs.CVcs.CLarXiv:2503.17352v32025
  8. Interpreting CLIP with Hierarchical Sparse Autoencoders

    Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek

    cs.CVcs.AIcs.LGarXiv:2502.20578v22025
  9. Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images

    Basudha Pal, Arjun Narayanan, Neha Ajith +2

    cs.CVarXiv:2608.29456v12026
  10. Adaptive Homophily Clustering: Structure Homophily Graph Learning with Adaptive Filter for Hyperspectral Image

    Yao Ding, Weijie Kang, Aitao Yang +5

    cs.CVarXiv:2501.01595v22025
  11. High-for-Low and Low-for-High: Efficient Boundary Detection from Deep Object Features and its Applications to High-Level Vision

    Gedas Bertasius, Jianbo Shi, Lorenzo Torresani

    cs.CVarXiv:1504.06201v32015
  12. Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

    Yu Cheng, Arushi Goel, Hakan Bilen

    cs.CVarXiv:2608.29374v12026
  13. CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution

    Xin Liu, Jie Liu, Jie Tang +1

    cs.CVarXiv:2503.06896v12025
  14. DeepStory: Video Story QA by Deep Embedded Memory Networks

    Kyung-Min Kim, Min-Oh Heo, Seong-Ho Choi +1

    cs.CVcs.AIcs.CLarXiv:1707.00836v12017
  15. RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation

    Yuhan Li, Xianfeng Tan, Fangao Zeng +6

    cs.CVcs.AIarXiv:2608.29280v12026
  16. MNN: A Universal and Efficient Inference Engine

    Xiaotang Jiang, Huan Wang, Yiliu Chen +9

    cs.CVcs.DCcs.LGarXiv:2002.12418v12020
  17. Pooled Motion Features for First-Person Videos

    M. S. Ryoo, Brandon Rothrock, Larry Matthies

    cs.CVarXiv:1412.6505v22014
  18. VideoRAG: Retrieval-Augmented Generation over Video Corpus

    Soyeong Jeong, Kangsan Kim, Jinheon Baek +1

    cs.CVcs.AIcs.CLarXiv:2501.05874v32025
  19. DiffuScene: Denoising Diffusion Models for Generative Indoor Scene Synthesis

    Jiapeng Tang, Yinyu Nie, Lev Markhasin +3

    cs.CVarXiv:2303.14207v22023
  20. Wavelet-Assisted Multi-Frequency Attention Network for Pansharpening

    Jie Huang, Rui Huang, Jinghao Xu +3

    eess.IVcs.AIcs.CVarXiv:2502.04903v12025
  21. ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-Shot

    Jiarui Cai, Yizhou Wang, Jenq-Neng Hwang

    cs.CVarXiv:2108.02385v12021
  22. Image Processing using Smooth Ordering of its Patches

    Idan Ram, Michael Elad, Israel Cohen

    cs.CVarXiv:1210.3832v12012
  23. Graph-Based Blind Image Deblurring From a Single Photograph

    Yuanchao Bai, Gene Cheung, Xianming Liu +1

    cs.CVarXiv:1802.07929v12018
  24. Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network

    Bairui Wang, Lin Ma, Wei Zhang +3

    cs.CVarXiv:1908.10072v12019
  25. PolSAR Image Classification using a Hybrid Complex-Valued Network (HybridCVNet)

    Mohammed Q. Alkhatib

    cs.CVarXiv:2605.31137v12026
  26. Collaborative Global-Local Networks for Memory-Efficient Segmentation of Ultra-High Resolution Images

    Wuyang Chen, Ziyu Jiang, Zhangyang Wang +2

    cs.CVarXiv:1905.06368v32019
  27. Meta Batch-Instance Normalization for Generalizable Person Re-Identification

    Seokeon Choi, Taekyung Kim, Minki Jeong +2

    cs.CVarXiv:2011.14670v22020
  28. R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO

    Huanjin Yao, Qixiang Yin, Jingyi Zhang +8

    cs.CVcs.AIcs.CLarXiv:2505.16673v12025
  29. Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion

    Nikolaos Livathinos, Christoph Auer, Maksym Lysak +14

    cs.CLcs.CVcs.SEarXiv:2501.17887v12025
  30. Deep convolutional networks for pancreas segmentation in CT imaging

    Holger R. Roth, Amal Farag, Le Lu +2

    cs.CVarXiv:1504.03967v12015
  31. The Third Challenge on Image Denoising at NTIRE 2026: Methods and Results

    Lei Sun, Hang Guo, Bin Ren +6

    cs.CVarXiv:2606.16031v12026
  32. NAFSSR: Stereo Image Super-Resolution Using NAFNet

    Xiaojie Chu, Liangyu Chen, Wenqing Yu

    cs.CVarXiv:2204.08714v22022
  33. Auto-Exposure Fusion for Single-Image Shadow Removal

    Lan Fu, Changqing Zhou, Qing Guo +5

    cs.CVarXiv:2103.01255v22021
  34. Interactive World Simulator for Robot Policy Training and Evaluation

    Yixuan Wang, Rhythm Syed, Fangyu Wu +7

    cs.ROcs.CVcs.LGarXiv:2603.08546v12026
  35. STAMP: Scalable Task And Model-agnostic Collaborative Perception

    Xiangbo Gao, Runsheng Xu, Jiachen Li +3

    cs.CVcs.AIcs.ROarXiv:2501.18616v12025
  36. Joint Inference of Groups, Events and Human Roles in Aerial Videos

    Tianmin Shu, Dan Xie, Brandon Rothrock +2

    cs.CVarXiv:1505.05957v12015
  37. Graph Edge Convolutional Neural Networks for Skeleton Based Action Recognition

    Xikun Zhang, Chang Xu, Xinmei Tian +1

    cs.CVarXiv:1805.06184v22018
  38. Recovering 3D Human Mesh from Monocular Images: A Survey

    Yating Tian, Hongwen Zhang, Yebin Liu +1

    cs.CVcs.GRarXiv:2203.01923v62022
  39. Foundation Models in Remote Sensing: Evolving from Unimodality to Multimodality

    Danfeng Hong, Chenyu Li, Xuyang Li +2

    cs.CVcs.SEarXiv:2603.00988v12026
  40. Shape Inpainting using 3D Generative Adversarial Network and Recurrent Convolutional Networks

    Weiyue Wang, Qiangui Huang, Suya You +2

    cs.CVarXiv:1711.06375v12017
  41. Detection of Coronavirus (COVID-19) Associated Pneumonia based on Generative Adversarial Networks and a Fine-Tuned Deep Transfer Learning Model using Chest X-ray Dataset

    Nour Eldeen M. Khalifa, Mohamed Hamed N. Taha, Aboul Ella Hassanien +1

    eess.IVcs.CVcs.LGarXiv:2004.01184v12020
  42. Galileo: Learning Global & Local Features of Many Remote Sensing Modalities

    Gabriel Tseng, Anthony Fuller, Marlena Reil +7

    cs.CVarXiv:2502.09356v32025
  43. Centering before Pruning: Lightweight Geometry Correction for Diversity-Based Visual Token Pruning in LVLMs

    Shunjie Wen, Jaeyeon Lee, Dong-Wan Choi

    cs.CVcs.AIarXiv:2608.30263v12026
  44. NVIDIA FLARE: Federated Learning from Simulation to Real-World

    Holger R. Roth, Yan Cheng, Yuhong Wen +20

    cs.LGcs.AIcs.CVarXiv:2210.13291v32022
  45. MCSeg: Pre-training and Fine-tuning Volumetric Pyramid Transformer for Multi-modal Cardiac Image Segmentation

    Zhiyu Ye, Hairong Zheng, Tong Zhang

    cs.CVarXiv:2608.30371v12026
  46. A*3D Dataset: Towards Autonomous Driving in Challenging Environments

    Quang-Hieu Pham, Pierre Sevestre, Ramanpreet Singh Pahwa +6

    cs.CVcs.ROarXiv:1909.07541v12019
  47. Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

    Tao Lin, Gen Li, Yilei Zhong +5

    cs.ROcs.CVarXiv:2507.00416v32025
  48. Thinking with Generated Images

    Ethan Chern, Zhulin Hu, Steffi Chern +5

    cs.CVcs.AIcs.CLarXiv:2505.22525v12025
  49. WESPE: Weakly Supervised Photo Enhancer for Digital Cameras

    Andrey Ignatov, Nikolay Kobyshev, Radu Timofte +2

    cs.CVarXiv:1709.01118v22017
  50. Amortized Anchor Refinement for Deployable Continuous-Time 4D Gaussian Reconstruction

    Jingong Chen, Qingwen Zhang, Sanghyeon Jun +3

    cs.CVarXiv:2608.30218v12026
  51. Interlaced Sparse Self-Attention for Semantic Segmentation

    Lang Huang, Yuhui Yuan, Jianyuan Guo +3

    cs.CVarXiv:1907.12273v22019
  52. Avat3r: Large Animatable Gaussian Reconstruction Model for High-fidelity 3D Head Avatars

    Tobias Kirschstein, Javier Romero, Artem Sevastopolsky +2

    cs.CVarXiv:2502.20220v22025
  53. OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection

    Xiaoyan Wei, Zhimin Yao, Ruilin Yang +4

    cs.CVarXiv:2608.30247v12026
  54. DiffTalk: Crafting Diffusion Models for Generalized Audio-Driven Portraits Animation

    Shuai Shen, Wenliang Zhao, Zibin Meng +4

    cs.CVarXiv:2301.03786v22023
  55. Implicit Neural Representation in Medical Imaging: A Comparative Survey

    Amirali Molaei, Amirhossein Aminimehr, Armin Tavakoli +4

    eess.IVcs.CVarXiv:2307.16142v12023
  56. General In-Hand Object Rotation with Vision and Touch

    Haozhi Qi, Brent Yi, Sudharshan Suresh +4

    cs.ROcs.AIcs.CVarXiv:2309.09979v22023
  57. Evaluating the Effects of Inter-Observer and Model Variability on Radiological Peritoneal Cancer Index Assessment

    Savvas Saragiotis, Pieter C. Gort, Lotte J. S. Fleurkens-Ewals +5

    eess.IVcs.CVarXiv:2608.28716v12026
  58. TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning

    Xingjian Zhang, Siwei Wen, Wenjun Wu +1

    cs.CVarXiv:2504.09641v12025
  59. Comprehension-guided referring expressions

    Ruotian Luo, Gregory Shakhnarovich

    cs.CVarXiv:1701.03439v12017
  60. A Generative Deep Learning Approach to Stochastic Downscaling of Precipitation Forecasts

    Lucy Harris, Andrew T. T. McRae, Matthew Chantry +2

    physics.ao-phcs.AIcs.CVarXiv:2204.02028v22022