Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

17,101 to 17,160 of 18,855

  1. Resolution-robust Large Mask Inpainting with Fourier Convolutions

    Roman Suvorov, Elizaveta Logacheva, Anton Mashikhin +7

    cs.CVeess.IVarXiv:2109.07161v22021
  2. VideoBERT: A Joint Model for Video and Language Representation Learning

    Chen Sun, Austin Myers, Carl Vondrick +2

    cs.CVcs.AIarXiv:1904.01766v22019
  3. Optical Flow Estimation using a Spatial Pyramid Network

    Anurag Ranjan, Michael J. Black

    cs.CVarXiv:1611.00850v22016
  4. Gibbs-Ringing Artifact Removal Based on Local Subvoxel-shifts

    Elias Kellner, Bibek Dhital, Marco Reisert

    physics.med-phcs.CVarXiv:1501.07758v12015
  5. Deep Learning for Anomaly Detection: A Review

    Guansong Pang, Chunhua Shen, Longbing Cao +1

    cs.LGcs.CVstat.MLarXiv:2007.02500v32020
  6. Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding

    Gunnar A. Sigurdsson, Gül Varol, Xiaolong Wang +3

    cs.CVarXiv:1604.01753v32016
  7. PIFu: Pixel-Aligned Implicit Function for High-Resolution Clothed Human Digitization

    Shunsuke Saito, Zeng Huang, Ryota Natsume +3

    cs.CVcs.GRarXiv:1905.05172v32019
  8. Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction

    Haoyu Zhang, Zeyu Zhang, Zedong Zhou +2

    cs.CVarXiv:2605.11354v12026
  9. Scene Representation Networks: Continuous 3D-Structure-Aware Neural Scene Representations

    Vincent Sitzmann, Michael Zollhöfer, Gordon Wetzstein

    cs.CVcs.AIarXiv:1906.01618v22019
  10. Scene Graph Generation by Iterative Message Passing

    Danfei Xu, Yuke Zhu, Christopher B. Choy +1

    cs.CVarXiv:1701.02426v22017
  11. Fast, Accurate, and Lightweight Super-Resolution with Cascading Residual Network

    Namhyuk Ahn, Byungkon Kang, Kyung-Ah Sohn

    cs.CVarXiv:1803.08664v52018
  12. WildRelight: A Real-World Benchmark and Physics-Guided Adaptation for Single-Image Relighting

    Lezhong Wang, Mehmet Onurcan Kaya, Siavash Bigdeli +1

    cs.CVcs.AIcs.GRarXiv:2605.11696v12026
  13. AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

    Runhui Huang, Jie Wu, Rui Yang +2

    cs.CVcs.AIcs.LGarXiv:2605.12495v12026
  14. ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes

    Shivam Kumar

    cs.CVarXiv:2605.11680v12026
  15. Harmonious Attention Network for Person Re-Identification

    Wei Li, Xiatian Zhu, Shaogang Gong

    cs.CVarXiv:1802.08122v12018
  16. End-to-end representation learning for Correlation Filter based tracking

    Jack Valmadre, Luca Bertinetto, João F. Henriques +2

    cs.CVcs.LGarXiv:1704.06036v12017
  17. Semantic Foggy Scene Understanding with Synthetic Data

    Christos Sakaridis, Dengxin Dai, Luc Van Gool

    cs.CVarXiv:1708.07819v32017
  18. Meta-Learning with Differentiable Convex Optimization

    Kwonjoon Lee, Subhransu Maji, Avinash Ravichandran +1

    cs.CVcs.LGarXiv:1904.03758v22019
  19. Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

    Miaosen Zhang, Xiaohan Zhao, Zhihong Tan +14

    cs.CVarXiv:2605.12501v12026
  20. Meta-Learning for Semi-Supervised Few-Shot Classification

    Mengye Ren, Eleni Triantafillou, Sachin Ravi +5

    cs.LGcs.CVstat.MLarXiv:1803.00676v12018
  21. Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

    Xuanyu Zhu, Yan Bai, Yang Shi +4

    cs.CVcs.AIarXiv:2605.10780v22026
  22. Medical Transformer: Gated Axial-Attention for Medical Image Segmentation

    Jeya Maria Jose Valanarasu, Poojan Oza, Ilker Hacihaliloglu +1

    cs.CVarXiv:2102.10662v22021
  23. Generative Visual Manipulation on the Natural Image Manifold

    Jun-Yan Zhu, Philipp Krähenbühl, Eli Shechtman +1

    cs.CVarXiv:1609.03552v32016
  24. SpectralFormer: Rethinking Hyperspectral Image Classification with Transformers

    Danfeng Hong, Zhu Han, Jing Yao +4

    cs.CVcs.AIarXiv:2107.02988v22021
  25. Low Dose CT Image Denoising Using a Generative Adversarial Network with Wasserstein Distance and Perceptual Loss

    Qingsong Yang, Pingkun Yan, Yanbo Zhang +5

    cs.CVarXiv:1708.00961v22017
  26. Large-Scale Long-Tailed Recognition in an Open World

    Ziwei Liu, Zhongqi Miao, Xiaohang Zhan +3

    cs.CVcs.LGarXiv:1904.05160v22019
  27. The DAWN of World-Action Interactive Models

    Hongbo Lu, Liang Yao, Chenghao He +6

    cs.CVarXiv:2605.11550v12026
  28. Scaled-YOLOv4: Scaling Cross Stage Partial Network

    Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao

    cs.CVcs.LGarXiv:2011.08036v22020
  29. Efficient Object Localization Using Convolutional Networks

    Jonathan Tompson, Ross Goroshin, Arjun Jain +2

    cs.CVarXiv:1411.4280v32014
  30. DocAtlas: Multilingual Document Understanding Across 80+ Languages

    Ahmed Heakl, Youssef Mohamed, Abdullah Sohail +6

    cs.CLcs.CVcs.LGarXiv:2605.12623v22026
  31. MedMNIST v2 -- A large-scale lightweight benchmark for 2D and 3D biomedical image classification

    Jiancheng Yang, Rui Shi, Donglai Wei +5

    cs.CVcs.AIcs.LGarXiv:2110.14795v22021
  32. 3D MRI brain tumor segmentation using autoencoder regularization

    Andriy Myronenko

    cs.CVq-bio.NCarXiv:1810.11654v32018
  33. Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions

    Wenhai Wang, Enze Xie, Xiang Li +6

    cs.CVarXiv:2102.12122v22021
  34. MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

    Mingqiao Ye, Zhaochong An, Zhitong Gao +11

    cs.CVcs.AIcs.LGarXiv:2607.25948v12026
  35. Toward Multimodal Image-to-Image Translation

    Jun-Yan Zhu, Richard Zhang, Deepak Pathak +4

    cs.CVcs.GRstat.MLarXiv:1711.11586v42017
  36. Large-scale Point Cloud Semantic Segmentation with Superpoint Graphs

    Loic Landrieu, Martin Simonovsky

    cs.CVcs.LGcs.NEarXiv:1711.09869v22017
  37. PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution

    Zihang Xu, Xiaoyang Liu, Zheng Chen +2

    cs.CVarXiv:2605.13027v12026
  38. Do Vision Transformers See Like Convolutional Neural Networks?

    Maithra Raghu, Thomas Unterthiner, Simon Kornblith +2

    cs.CVcs.AIcs.LGarXiv:2108.08810v22021
  39. FBNet: Hardware-Aware Efficient ConvNet Design via Differentiable Neural Architecture Search

    Bichen Wu, Xiaoliang Dai, Peizhao Zhang +7

    cs.CVarXiv:1812.03443v32018
  40. StyleCLIP: Text-Driven Manipulation of StyleGAN Imagery

    Or Patashnik, Zongze Wu, Eli Shechtman +2

    cs.CVcs.CLcs.GRarXiv:2103.17249v12021
  41. LoREnc: Low-Rank Encryption for Securing Foundation Models and LoRA Adapters

    Beomjin Ahn, Jungmin Kwon, Chanyong Jung +1

    cs.CRcs.CVcs.LGarXiv:2605.13163v12026
  42. Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models

    Ryan Kiros, Ruslan Salakhutdinov, Richard S. Zemel

    cs.LGcs.CLcs.CVarXiv:1411.2539v12014
  43. Deep Convolutional Neural Networks and Data Augmentation for Environmental Sound Classification

    Justin Salamon, Juan Pablo Bello

    cs.SDcs.CVcs.LGarXiv:1608.04363v22016
  44. Stereo Matching by Training a Convolutional Neural Network to Compare Image Patches

    Jure Žbontar, Yann LeCun

    cs.CVcs.LGcs.NEarXiv:1510.05970v22015
  45. Bag of Tricks and A Strong Baseline for Deep Person Re-identification

    Hao Luo, Youzhi Gu, Xingyu Liao +2

    cs.CVarXiv:1903.07071v32019
  46. Exploring the Limits of Weakly Supervised Pretraining

    Dhruv Mahajan, Ross Girshick, Vignesh Ramanathan +5

    cs.CVarXiv:1805.00932v12018
  47. Image Quality Assessment: Unifying Structure and Texture Similarity

    Keyan Ding, Kede Ma, Shiqi Wang +1

    cs.CVarXiv:2004.07728v32020
  48. Adversarial Training for Free!

    Ali Shafahi, Mahyar Najibi, Amin Ghiasi +6

    cs.LGcs.CRcs.CVarXiv:1904.12843v22019
  49. ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing

    Blaž Rolih, Matic Fučka, Filip Wolf +1

    cs.CVcs.AIarXiv:2605.15375v22026
  50. Does Synthetic Layered Design Data Benefit Layered Design Decomposition?

    Kam Man Wu, Haolin Yang, Qingyu Chen +3

    cs.CVarXiv:2605.15167v12026
  51. ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware

    Han Cai, Ligeng Zhu, Song Han

    cs.LGcs.CVstat.MLarXiv:1812.00332v22018
  52. Deep Ordinal Regression Network for Monocular Depth Estimation

    Huan Fu, Mingming Gong, Chaohui Wang +2

    cs.CVarXiv:1806.02446v12018
  53. Learning to Compare Image Patches via Convolutional Neural Networks

    Sergey Zagoruyko, Nikos Komodakis

    cs.CVcs.LGcs.NEarXiv:1504.03641v12015
  54. TransFuse: Fusing Transformers and CNNs for Medical Image Segmentation

    Yundong Zhang, Huiye Liu, Qiang Hu

    cs.CVcs.AIarXiv:2102.08005v22021
  55. From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing

    Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee

    cs.CVarXiv:2605.15181v12026
  56. HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips

    Antoine Miech, Dimitri Zhukov, Jean-Baptiste Alayrac +3

    cs.CVarXiv:1906.03327v22019
  57. Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning

    Hanbo Cheng, Limin Lin, Ruo Zhang +2

    cs.CVcs.AIarXiv:2605.14876v22026
  58. Scaling Vision Transformers

    Xiaohua Zhai, Alexander Kolesnikov, Neil Houlsby +1

    cs.CVcs.AIcs.LGarXiv:2106.04560v22021
  59. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

    Chaoyou Fu, Yuhan Dai, Yongdong Luo +18

    cs.CVcs.CLarXiv:2405.21075v32024
  60. Improving Transferability of Adversarial Examples with Input Diversity

    Cihang Xie, Zhishuai Zhang, Yuyin Zhou +4

    cs.CVcs.LGstat.MLarXiv:1803.06978v42018