Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
17,521 to 17,580 of 18,829
YOLACT: Real-time Instance Segmentation
Daniel Bolya, Chong Zhou, Fanyi Xiao +1
cs.CVarXiv:1904.02689v22019ZipSplat: Fewer Gaussians, Better Splats
Alexander Veicht, Sunghwan Hong, Dániel Baráth +1
cs.CVarXiv:2606.05102v22026M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks
Jie Huang, Ruixun Liu, Sirui Sun +4
cs.CVcs.AIcs.CLarXiv:2606.05008v12026Make-A-Video: Text-to-Video Generation without Text-Video Data
Uriel Singer, Adam Polyak, Thomas Hayes +10
cs.CVcs.AIcs.LGarXiv:2209.14792v12022MOT16: A Benchmark for Multi-Object Tracking
Anton Milan, Laura Leal-Taixe, Ian Reid +2
cs.CVarXiv:1603.00831v22016TSM: Temporal Shift Module for Efficient Video Understanding
Ji Lin, Chuang Gan, Song Han
cs.CVarXiv:1811.08383v32018World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning
Yucheng Zhou, Wei Tao, Yiwen Guo +1
cs.CVcs.CLarXiv:2606.03603v12026Exact solutions to the nonlinear dynamics of learning in deep linear neural networks
Andrew M. Saxe, James L. McClelland, Surya Ganguli
cs.NEcond-mat.dis-nncs.CVarXiv:1312.6120v32013Stateful Visual Encoders for Vision-Language Models
Zirui Wang, Junwei Yu, Adam Yala +3
cs.CVcs.CLcs.LGarXiv:2606.04433v12026Adversarial Examples Are Not Bugs, They Are Features
Andrew Ilyas, Shibani Santurkar, Dimitris Tsipras +3
stat.MLcs.CRcs.CVarXiv:1905.02175v42019VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
Zhan Tong, Yibing Song, Jue Wang +1
cs.CVarXiv:2203.12602v32022Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms
Chong Zhang, Xiang Li, Jia Wang +2
cs.LGcs.CVarXiv:2606.04767v12026BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding
Muhammad Usama, Didier Stricker, Mohammad Sadil Khan +1
cs.CVarXiv:2606.05515v12026Bridging the Gap Between Anchor-based and Anchor-free Detection via Adaptive Training Sample Selection
Shifeng Zhang, Cheng Chi, Yongqiang Yao +2
cs.CVarXiv:1912.02424v42019CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation
Yurim Jeon, Dongseong Seo, Seung-Woo Seo
cs.CVcs.ROarXiv:2606.05011v12026CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification
Chun-Fu Chen, Quanfu Fan, Rameswar Panda
cs.CVarXiv:2103.14899v22021Open3D: A Modern Library for 3D Data Processing
Qian-Yi Zhou, Jaesik Park, Vladlen Koltun
cs.CVcs.GRcs.ROarXiv:1801.09847v12018Designing Network Design Spaces
Ilija Radosavovic, Raj Prateek Kosaraju, Ross Girshick +2
cs.CVcs.LGarXiv:2003.13678v12020Learning Face Representation from Scratch
Dong Yi, Zhen Lei, Shengcai Liao +1
cs.CVarXiv:1411.7923v12014MS-Celeb-1M: A Dataset and Benchmark for Large-Scale Face Recognition
Yandong Guo, Lei Zhang, Yuxiao Hu +2
cs.CVarXiv:1607.08221v12016Deep metric learning using Triplet network
Elad Hoffer, Nir Ailon
cs.LGcs.CVstat.MLarXiv:1412.6622v42014Deep Learning for Person Re-identification: A Survey and Outlook
Mang Ye, Jianbing Shen, Gaojie Lin +3
cs.CVarXiv:2001.04193v22020Object Detection in Optical Remote Sensing Images: A Survey and A New Benchmark
Ke Li, Gang Wan, Gong Cheng +2
cs.CVarXiv:1909.00133v22019Personal AI Agent for Camera Roll VQA
Thao Nguyen, Krishna Kumar Singh, Donghyun Kim +2
cs.CVcs.AIarXiv:2606.05275v12026Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models
Haibo Wang, Lifu Huang
cs.CVcs.AIarXiv:2606.05833v22026RePaint: Inpainting using Denoising Diffusion Probabilistic Models
Andreas Lugmayr, Martin Danelljan, Andres Romero +3
cs.CVarXiv:2201.09865v42022Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks
Xiujun Li, Xi Yin, Chunyuan Li +9
cs.CVcs.CLcs.IRarXiv:2004.06165v52020AffectNet: A Database for Facial Expression, Valence, and Arousal Computing in the Wild
Ali Mollahosseini, Behzad Hasani, Mohammad H. Mahoor
cs.CVarXiv:1708.03985v42017Benchmarking Single Image Dehazing and Beyond
Boyi Li, Wenqi Ren, Dengpan Fu +4
cs.CVcs.AIcs.LGarXiv:1712.04143v42017Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents
XiuYu Zhang, Junfeng Fang, Zhenkai Liang
cs.CVarXiv:2606.05753v12026DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models
Zhuoming Liu, Jinhong Lin, Kwan Man Cheng +3
cs.CVcs.AIcs.LGarXiv:2606.05758v12026In-Context Multiple Instance Learning
Alexander Möllers, Marvin Sextro, Julius Hense +2
cs.LGcs.AIcs.CVarXiv:2606.06458v12026CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
Zhuoyi Yang, Jiayan Teng, Wendi Zheng +15
cs.CVarXiv:2408.06072v32024Complexity-Balanced Diffusion Splitting
Noam Issachar, Dani Lischinski, Raanan Fattal
cs.CVarXiv:2606.06477v12026PCT: Point cloud transformer
Meng-Hao Guo, Jun-Xiong Cai, Zheng-Ning Liu +3
cs.CVarXiv:2012.09688v42020SiamRPN++: Evolution of Siamese Visual Tracking with Very Deep Networks
Bo Li, Wei Wu, Qiang Wang +3
cs.CVarXiv:1812.11703v12018Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?
Rui Zhao, Kaiming Yang, Jifeng Zhu +6
cs.CVarXiv:2606.04811v22026Video Swin Transformer
Ze Liu, Jia Ning, Yue Cao +4
cs.CVcs.AIcs.LGarXiv:2106.13230v12021Towards VQA Models That Can Read
Amanpreet Singh, Vivek Natarajan, Meet Shah +5
cs.CLcs.CVcs.LGarXiv:1904.08920v22019U$^2$-Net: Going Deeper with Nested U-Structure for Salient Object Detection
Xuebin Qin, Zichen Zhang, Chenyang Huang +3
cs.CVarXiv:2005.09007v32020Autoencoding beyond pixels using a learned similarity metric
Anders Boesen Lindbo Larsen, Søren Kaae Sønderby, Hugo Larochelle +1
cs.LGcs.CVstat.MLarXiv:1512.09300v22015Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet?
Kensho Hara, Hirokatsu Kataoka, Yutaka Satoh
cs.CVarXiv:1711.09577v22017Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection
Sergey Levine, Peter Pastor, Alex Krizhevsky +1
cs.LGcs.AIcs.CVarXiv:1603.02199v42016Multi-Stage Progressive Image Restoration
Syed Waqas Zamir, Aditya Arora, Salman Khan +4
cs.CVarXiv:2102.02808v22021RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling
Chensheng Dai, Shengjun Zhang, Yifan Li +3
cs.CVarXiv:2606.06309v12026AID: A Benchmark Dataset for Performance Evaluation of Aerial Scene Classification
Gui-Song Xia, Jingwen Hu, Fan Hu +4
cs.CVarXiv:1608.05167v12016Uformer: A General U-Shaped Transformer for Image Restoration
Zhendong Wang, Xiaodong Cun, Jianmin Bao +3
cs.CVarXiv:2106.03106v22021Face2Face: Real-time Face Capture and Reenactment of RGB Videos
Justus Thies, Michael Zollhöfer, Marc Stamminger +2
cs.CVarXiv:2007.14808v12020Understanding the Effective Receptive Field in Deep Convolutional Neural Networks
Wenjie Luo, Yujia Li, Raquel Urtasun +1
cs.CVcs.AIcs.LGarXiv:1701.04128v22017Palette: Image-to-Image Diffusion Models
Chitwan Saharia, William Chan, Huiwen Chang +5
cs.CVcs.LGarXiv:2111.05826v22021Deep Learning Face Representation by Joint Identification-Verification
Yi Sun, Xiaogang Wang, Xiaoou Tang
cs.CVarXiv:1406.4773v12014Zero-Reference Deep Curve Estimation for Low-Light Image Enhancement
Chunle Guo, Chongyi Li, Jichang Guo +4
cs.CVarXiv:2001.06826v22020Deep Generative Image Models using a Laplacian Pyramid of Adversarial Networks
Emily Denton, Soumith Chintala, Arthur Szlam +1
cs.CVarXiv:1506.05751v12015Playing for Data: Ground Truth from Computer Games
Stephan R. Richter, Vibhav Vineet, Stefan Roth +1
cs.CVarXiv:1608.02192v12016VisualBERT: A Simple and Performant Baseline for Vision and Language
Liunian Harold Li, Mark Yatskar, Da Yin +2
cs.CVcs.CLcs.LGarXiv:1908.03557v12019Plenoxels: Radiance Fields without Neural Networks
Alex Yu, Sara Fridovich-Keil, Matthew Tancik +3
cs.CVcs.GRarXiv:2112.05131v12021Pre-Trained Image Processing Transformer
Hanting Chen, Yunhe Wang, Tianyu Guo +7
cs.CVcs.LGarXiv:2012.00364v42020Image Inpainting for Irregular Holes Using Partial Convolutions
Guilin Liu, Fitsum A. Reda, Kevin J. Shih +3
cs.CVarXiv:1804.07723v22018Do ImageNet Classifiers Generalize to ImageNet?
Benjamin Recht, Rebecca Roelofs, Ludwig Schmidt +1
cs.CVcs.LGstat.MLarXiv:1902.10811v22019PV-RCNN: Point-Voxel Feature Set Abstraction for 3D Object Detection
Shaoshuai Shi, Chaoxu Guo, Li Jiang +4
cs.CVcs.LGeess.IVarXiv:1912.13192v22019