Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
17,101 to 17,160 of 18,855
Resolution-robust Large Mask Inpainting with Fourier Convolutions
Roman Suvorov, Elizaveta Logacheva, Anton Mashikhin +7
cs.CVeess.IVarXiv:2109.07161v22021VideoBERT: A Joint Model for Video and Language Representation Learning
Chen Sun, Austin Myers, Carl Vondrick +2
cs.CVcs.AIarXiv:1904.01766v22019Optical Flow Estimation using a Spatial Pyramid Network
Anurag Ranjan, Michael J. Black
cs.CVarXiv:1611.00850v22016Gibbs-Ringing Artifact Removal Based on Local Subvoxel-shifts
Elias Kellner, Bibek Dhital, Marco Reisert
physics.med-phcs.CVarXiv:1501.07758v12015Deep Learning for Anomaly Detection: A Review
Guansong Pang, Chunhua Shen, Longbing Cao +1
cs.LGcs.CVstat.MLarXiv:2007.02500v32020Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding
Gunnar A. Sigurdsson, Gül Varol, Xiaolong Wang +3
cs.CVarXiv:1604.01753v32016PIFu: Pixel-Aligned Implicit Function for High-Resolution Clothed Human Digitization
Shunsuke Saito, Zeng Huang, Ryota Natsume +3
cs.CVcs.GRarXiv:1905.05172v32019Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction
Haoyu Zhang, Zeyu Zhang, Zedong Zhou +2
cs.CVarXiv:2605.11354v12026Scene Representation Networks: Continuous 3D-Structure-Aware Neural Scene Representations
Vincent Sitzmann, Michael Zollhöfer, Gordon Wetzstein
cs.CVcs.AIarXiv:1906.01618v22019Scene Graph Generation by Iterative Message Passing
Danfei Xu, Yuke Zhu, Christopher B. Choy +1
cs.CVarXiv:1701.02426v22017Fast, Accurate, and Lightweight Super-Resolution with Cascading Residual Network
Namhyuk Ahn, Byungkon Kang, Kyung-Ah Sohn
cs.CVarXiv:1803.08664v52018WildRelight: A Real-World Benchmark and Physics-Guided Adaptation for Single-Image Relighting
Lezhong Wang, Mehmet Onurcan Kaya, Siavash Bigdeli +1
cs.CVcs.AIcs.GRarXiv:2605.11696v12026AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
Runhui Huang, Jie Wu, Rui Yang +2
cs.CVcs.AIcs.LGarXiv:2605.12495v12026ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes
Shivam Kumar
cs.CVarXiv:2605.11680v12026Harmonious Attention Network for Person Re-Identification
Wei Li, Xiatian Zhu, Shaogang Gong
cs.CVarXiv:1802.08122v12018End-to-end representation learning for Correlation Filter based tracking
Jack Valmadre, Luca Bertinetto, João F. Henriques +2
cs.CVcs.LGarXiv:1704.06036v12017Semantic Foggy Scene Understanding with Synthetic Data
Christos Sakaridis, Dengxin Dai, Luc Van Gool
cs.CVarXiv:1708.07819v32017Meta-Learning with Differentiable Convex Optimization
Kwonjoon Lee, Subhransu Maji, Avinash Ravichandran +1
cs.CVcs.LGarXiv:1904.03758v22019Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
Miaosen Zhang, Xiaohan Zhao, Zhihong Tan +14
cs.CVarXiv:2605.12501v12026Meta-Learning for Semi-Supervised Few-Shot Classification
Mengye Ren, Eleni Triantafillou, Sachin Ravi +5
cs.LGcs.CVstat.MLarXiv:1803.00676v12018Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
Xuanyu Zhu, Yan Bai, Yang Shi +4
cs.CVcs.AIarXiv:2605.10780v22026Medical Transformer: Gated Axial-Attention for Medical Image Segmentation
Jeya Maria Jose Valanarasu, Poojan Oza, Ilker Hacihaliloglu +1
cs.CVarXiv:2102.10662v22021Generative Visual Manipulation on the Natural Image Manifold
Jun-Yan Zhu, Philipp Krähenbühl, Eli Shechtman +1
cs.CVarXiv:1609.03552v32016SpectralFormer: Rethinking Hyperspectral Image Classification with Transformers
Danfeng Hong, Zhu Han, Jing Yao +4
cs.CVcs.AIarXiv:2107.02988v22021Low Dose CT Image Denoising Using a Generative Adversarial Network with Wasserstein Distance and Perceptual Loss
Qingsong Yang, Pingkun Yan, Yanbo Zhang +5
cs.CVarXiv:1708.00961v22017Large-Scale Long-Tailed Recognition in an Open World
Ziwei Liu, Zhongqi Miao, Xiaohang Zhan +3
cs.CVcs.LGarXiv:1904.05160v22019The DAWN of World-Action Interactive Models
Hongbo Lu, Liang Yao, Chenghao He +6
cs.CVarXiv:2605.11550v12026Scaled-YOLOv4: Scaling Cross Stage Partial Network
Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
cs.CVcs.LGarXiv:2011.08036v22020Efficient Object Localization Using Convolutional Networks
Jonathan Tompson, Ross Goroshin, Arjun Jain +2
cs.CVarXiv:1411.4280v32014DocAtlas: Multilingual Document Understanding Across 80+ Languages
Ahmed Heakl, Youssef Mohamed, Abdullah Sohail +6
cs.CLcs.CVcs.LGarXiv:2605.12623v22026MedMNIST v2 -- A large-scale lightweight benchmark for 2D and 3D biomedical image classification
Jiancheng Yang, Rui Shi, Donglai Wei +5
cs.CVcs.AIcs.LGarXiv:2110.14795v220213D MRI brain tumor segmentation using autoencoder regularization
Andriy Myronenko
cs.CVq-bio.NCarXiv:1810.11654v32018Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions
Wenhai Wang, Enze Xie, Xiang Li +6
cs.CVarXiv:2102.12122v22021MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
Mingqiao Ye, Zhaochong An, Zhitong Gao +11
cs.CVcs.AIcs.LGarXiv:2607.25948v12026Toward Multimodal Image-to-Image Translation
Jun-Yan Zhu, Richard Zhang, Deepak Pathak +4
cs.CVcs.GRstat.MLarXiv:1711.11586v42017Large-scale Point Cloud Semantic Segmentation with Superpoint Graphs
Loic Landrieu, Martin Simonovsky
cs.CVcs.LGcs.NEarXiv:1711.09869v22017PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution
Zihang Xu, Xiaoyang Liu, Zheng Chen +2
cs.CVarXiv:2605.13027v12026Do Vision Transformers See Like Convolutional Neural Networks?
Maithra Raghu, Thomas Unterthiner, Simon Kornblith +2
cs.CVcs.AIcs.LGarXiv:2108.08810v22021FBNet: Hardware-Aware Efficient ConvNet Design via Differentiable Neural Architecture Search
Bichen Wu, Xiaoliang Dai, Peizhao Zhang +7
cs.CVarXiv:1812.03443v32018StyleCLIP: Text-Driven Manipulation of StyleGAN Imagery
Or Patashnik, Zongze Wu, Eli Shechtman +2
cs.CVcs.CLcs.GRarXiv:2103.17249v12021LoREnc: Low-Rank Encryption for Securing Foundation Models and LoRA Adapters
Beomjin Ahn, Jungmin Kwon, Chanyong Jung +1
cs.CRcs.CVcs.LGarXiv:2605.13163v12026Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models
Ryan Kiros, Ruslan Salakhutdinov, Richard S. Zemel
cs.LGcs.CLcs.CVarXiv:1411.2539v12014Deep Convolutional Neural Networks and Data Augmentation for Environmental Sound Classification
Justin Salamon, Juan Pablo Bello
cs.SDcs.CVcs.LGarXiv:1608.04363v22016Stereo Matching by Training a Convolutional Neural Network to Compare Image Patches
Jure Žbontar, Yann LeCun
cs.CVcs.LGcs.NEarXiv:1510.05970v22015Bag of Tricks and A Strong Baseline for Deep Person Re-identification
Hao Luo, Youzhi Gu, Xingyu Liao +2
cs.CVarXiv:1903.07071v32019Exploring the Limits of Weakly Supervised Pretraining
Dhruv Mahajan, Ross Girshick, Vignesh Ramanathan +5
cs.CVarXiv:1805.00932v12018Image Quality Assessment: Unifying Structure and Texture Similarity
Keyan Ding, Kede Ma, Shiqi Wang +1
cs.CVarXiv:2004.07728v32020Adversarial Training for Free!
Ali Shafahi, Mahyar Najibi, Amin Ghiasi +6
cs.LGcs.CRcs.CVarXiv:1904.12843v22019ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing
Blaž Rolih, Matic Fučka, Filip Wolf +1
cs.CVcs.AIarXiv:2605.15375v22026Does Synthetic Layered Design Data Benefit Layered Design Decomposition?
Kam Man Wu, Haolin Yang, Qingyu Chen +3
cs.CVarXiv:2605.15167v12026ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware
Han Cai, Ligeng Zhu, Song Han
cs.LGcs.CVstat.MLarXiv:1812.00332v22018Deep Ordinal Regression Network for Monocular Depth Estimation
Huan Fu, Mingming Gong, Chaohui Wang +2
cs.CVarXiv:1806.02446v12018Learning to Compare Image Patches via Convolutional Neural Networks
Sergey Zagoruyko, Nikos Komodakis
cs.CVcs.LGcs.NEarXiv:1504.03641v12015TransFuse: Fusing Transformers and CNNs for Medical Image Segmentation
Yundong Zhang, Huiye Liu, Qiang Hu
cs.CVcs.AIarXiv:2102.08005v22021From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing
Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee
cs.CVarXiv:2605.15181v12026HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips
Antoine Miech, Dimitri Zhukov, Jean-Baptiste Alayrac +3
cs.CVarXiv:1906.03327v22019Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
Hanbo Cheng, Limin Lin, Ruo Zhang +2
cs.CVcs.AIarXiv:2605.14876v22026Scaling Vision Transformers
Xiaohua Zhai, Alexander Kolesnikov, Neil Houlsby +1
cs.CVcs.AIcs.LGarXiv:2106.04560v22021Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
Chaoyou Fu, Yuhan Dai, Yongdong Luo +18
cs.CVcs.CLarXiv:2405.21075v32024Improving Transferability of Adversarial Examples with Input Diversity
Cihang Xie, Zhishuai Zhang, Yuyin Zhou +4
cs.CVcs.LGstat.MLarXiv:1803.06978v42018