Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

17,521 to 17,580 of 18,829

  1. YOLACT: Real-time Instance Segmentation

    Daniel Bolya, Chong Zhou, Fanyi Xiao +1

    cs.CVarXiv:1904.02689v22019
  2. ZipSplat: Fewer Gaussians, Better Splats

    Alexander Veicht, Sunghwan Hong, Dániel Baráth +1

    cs.CVarXiv:2606.05102v22026
  3. M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

    Jie Huang, Ruixun Liu, Sirui Sun +4

    cs.CVcs.AIcs.CLarXiv:2606.05008v12026
  4. Make-A-Video: Text-to-Video Generation without Text-Video Data

    Uriel Singer, Adam Polyak, Thomas Hayes +10

    cs.CVcs.AIcs.LGarXiv:2209.14792v12022
  5. MOT16: A Benchmark for Multi-Object Tracking

    Anton Milan, Laura Leal-Taixe, Ian Reid +2

    cs.CVarXiv:1603.00831v22016
  6. TSM: Temporal Shift Module for Efficient Video Understanding

    Ji Lin, Chuang Gan, Song Han

    cs.CVarXiv:1811.08383v32018
  7. World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

    Yucheng Zhou, Wei Tao, Yiwen Guo +1

    cs.CVcs.CLarXiv:2606.03603v12026
  8. Exact solutions to the nonlinear dynamics of learning in deep linear neural networks

    Andrew M. Saxe, James L. McClelland, Surya Ganguli

    cs.NEcond-mat.dis-nncs.CVarXiv:1312.6120v32013
  9. Stateful Visual Encoders for Vision-Language Models

    Zirui Wang, Junwei Yu, Adam Yala +3

    cs.CVcs.CLcs.LGarXiv:2606.04433v12026
  10. Adversarial Examples Are Not Bugs, They Are Features

    Andrew Ilyas, Shibani Santurkar, Dimitris Tsipras +3

    stat.MLcs.CRcs.CVarXiv:1905.02175v42019
  11. VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training

    Zhan Tong, Yibing Song, Jue Wang +1

    cs.CVarXiv:2203.12602v32022
  12. Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms

    Chong Zhang, Xiang Li, Jia Wang +2

    cs.LGcs.CVarXiv:2606.04767v12026
  13. BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding

    Muhammad Usama, Didier Stricker, Mohammad Sadil Khan +1

    cs.CVarXiv:2606.05515v12026
  14. Bridging the Gap Between Anchor-based and Anchor-free Detection via Adaptive Training Sample Selection

    Shifeng Zhang, Cheng Chi, Yongqiang Yao +2

    cs.CVarXiv:1912.02424v42019
  15. CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation

    Yurim Jeon, Dongseong Seo, Seung-Woo Seo

    cs.CVcs.ROarXiv:2606.05011v12026
  16. CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification

    Chun-Fu Chen, Quanfu Fan, Rameswar Panda

    cs.CVarXiv:2103.14899v22021
  17. Open3D: A Modern Library for 3D Data Processing

    Qian-Yi Zhou, Jaesik Park, Vladlen Koltun

    cs.CVcs.GRcs.ROarXiv:1801.09847v12018
  18. Designing Network Design Spaces

    Ilija Radosavovic, Raj Prateek Kosaraju, Ross Girshick +2

    cs.CVcs.LGarXiv:2003.13678v12020
  19. Learning Face Representation from Scratch

    Dong Yi, Zhen Lei, Shengcai Liao +1

    cs.CVarXiv:1411.7923v12014
  20. MS-Celeb-1M: A Dataset and Benchmark for Large-Scale Face Recognition

    Yandong Guo, Lei Zhang, Yuxiao Hu +2

    cs.CVarXiv:1607.08221v12016
  21. Deep metric learning using Triplet network

    Elad Hoffer, Nir Ailon

    cs.LGcs.CVstat.MLarXiv:1412.6622v42014
  22. Deep Learning for Person Re-identification: A Survey and Outlook

    Mang Ye, Jianbing Shen, Gaojie Lin +3

    cs.CVarXiv:2001.04193v22020
  23. Object Detection in Optical Remote Sensing Images: A Survey and A New Benchmark

    Ke Li, Gang Wan, Gong Cheng +2

    cs.CVarXiv:1909.00133v22019
  24. Personal AI Agent for Camera Roll VQA

    Thao Nguyen, Krishna Kumar Singh, Donghyun Kim +2

    cs.CVcs.AIarXiv:2606.05275v12026
  25. Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

    Haibo Wang, Lifu Huang

    cs.CVcs.AIarXiv:2606.05833v22026
  26. RePaint: Inpainting using Denoising Diffusion Probabilistic Models

    Andreas Lugmayr, Martin Danelljan, Andres Romero +3

    cs.CVarXiv:2201.09865v42022
  27. Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks

    Xiujun Li, Xi Yin, Chunyuan Li +9

    cs.CVcs.CLcs.IRarXiv:2004.06165v52020
  28. AffectNet: A Database for Facial Expression, Valence, and Arousal Computing in the Wild

    Ali Mollahosseini, Behzad Hasani, Mohammad H. Mahoor

    cs.CVarXiv:1708.03985v42017
  29. Benchmarking Single Image Dehazing and Beyond

    Boyi Li, Wenqi Ren, Dengpan Fu +4

    cs.CVcs.AIcs.LGarXiv:1712.04143v42017
  30. Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

    XiuYu Zhang, Junfeng Fang, Zhenkai Liang

    cs.CVarXiv:2606.05753v12026
  31. DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

    Zhuoming Liu, Jinhong Lin, Kwan Man Cheng +3

    cs.CVcs.AIcs.LGarXiv:2606.05758v12026
  32. In-Context Multiple Instance Learning

    Alexander Möllers, Marvin Sextro, Julius Hense +2

    cs.LGcs.AIcs.CVarXiv:2606.06458v12026
  33. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

    Zhuoyi Yang, Jiayan Teng, Wendi Zheng +15

    cs.CVarXiv:2408.06072v32024
  34. Complexity-Balanced Diffusion Splitting

    Noam Issachar, Dani Lischinski, Raanan Fattal

    cs.CVarXiv:2606.06477v12026
  35. PCT: Point cloud transformer

    Meng-Hao Guo, Jun-Xiong Cai, Zheng-Ning Liu +3

    cs.CVarXiv:2012.09688v42020
  36. SiamRPN++: Evolution of Siamese Visual Tracking with Very Deep Networks

    Bo Li, Wei Wu, Qiang Wang +3

    cs.CVarXiv:1812.11703v12018
  37. Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?

    Rui Zhao, Kaiming Yang, Jifeng Zhu +6

    cs.CVarXiv:2606.04811v22026
  38. Video Swin Transformer

    Ze Liu, Jia Ning, Yue Cao +4

    cs.CVcs.AIcs.LGarXiv:2106.13230v12021
  39. Towards VQA Models That Can Read

    Amanpreet Singh, Vivek Natarajan, Meet Shah +5

    cs.CLcs.CVcs.LGarXiv:1904.08920v22019
  40. U$^2$-Net: Going Deeper with Nested U-Structure for Salient Object Detection

    Xuebin Qin, Zichen Zhang, Chenyang Huang +3

    cs.CVarXiv:2005.09007v32020
  41. Autoencoding beyond pixels using a learned similarity metric

    Anders Boesen Lindbo Larsen, Søren Kaae Sønderby, Hugo Larochelle +1

    cs.LGcs.CVstat.MLarXiv:1512.09300v22015
  42. Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet?

    Kensho Hara, Hirokatsu Kataoka, Yutaka Satoh

    cs.CVarXiv:1711.09577v22017
  43. Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection

    Sergey Levine, Peter Pastor, Alex Krizhevsky +1

    cs.LGcs.AIcs.CVarXiv:1603.02199v42016
  44. Multi-Stage Progressive Image Restoration

    Syed Waqas Zamir, Aditya Arora, Salman Khan +4

    cs.CVarXiv:2102.02808v22021
  45. RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling

    Chensheng Dai, Shengjun Zhang, Yifan Li +3

    cs.CVarXiv:2606.06309v12026
  46. AID: A Benchmark Dataset for Performance Evaluation of Aerial Scene Classification

    Gui-Song Xia, Jingwen Hu, Fan Hu +4

    cs.CVarXiv:1608.05167v12016
  47. Uformer: A General U-Shaped Transformer for Image Restoration

    Zhendong Wang, Xiaodong Cun, Jianmin Bao +3

    cs.CVarXiv:2106.03106v22021
  48. Face2Face: Real-time Face Capture and Reenactment of RGB Videos

    Justus Thies, Michael Zollhöfer, Marc Stamminger +2

    cs.CVarXiv:2007.14808v12020
  49. Understanding the Effective Receptive Field in Deep Convolutional Neural Networks

    Wenjie Luo, Yujia Li, Raquel Urtasun +1

    cs.CVcs.AIcs.LGarXiv:1701.04128v22017
  50. Palette: Image-to-Image Diffusion Models

    Chitwan Saharia, William Chan, Huiwen Chang +5

    cs.CVcs.LGarXiv:2111.05826v22021
  51. Deep Learning Face Representation by Joint Identification-Verification

    Yi Sun, Xiaogang Wang, Xiaoou Tang

    cs.CVarXiv:1406.4773v12014
  52. Zero-Reference Deep Curve Estimation for Low-Light Image Enhancement

    Chunle Guo, Chongyi Li, Jichang Guo +4

    cs.CVarXiv:2001.06826v22020
  53. Deep Generative Image Models using a Laplacian Pyramid of Adversarial Networks

    Emily Denton, Soumith Chintala, Arthur Szlam +1

    cs.CVarXiv:1506.05751v12015
  54. Playing for Data: Ground Truth from Computer Games

    Stephan R. Richter, Vibhav Vineet, Stefan Roth +1

    cs.CVarXiv:1608.02192v12016
  55. VisualBERT: A Simple and Performant Baseline for Vision and Language

    Liunian Harold Li, Mark Yatskar, Da Yin +2

    cs.CVcs.CLcs.LGarXiv:1908.03557v12019
  56. Plenoxels: Radiance Fields without Neural Networks

    Alex Yu, Sara Fridovich-Keil, Matthew Tancik +3

    cs.CVcs.GRarXiv:2112.05131v12021
  57. Pre-Trained Image Processing Transformer

    Hanting Chen, Yunhe Wang, Tianyu Guo +7

    cs.CVcs.LGarXiv:2012.00364v42020
  58. Image Inpainting for Irregular Holes Using Partial Convolutions

    Guilin Liu, Fitsum A. Reda, Kevin J. Shih +3

    cs.CVarXiv:1804.07723v22018
  59. Do ImageNet Classifiers Generalize to ImageNet?

    Benjamin Recht, Rebecca Roelofs, Ludwig Schmidt +1

    cs.CVcs.LGstat.MLarXiv:1902.10811v22019
  60. PV-RCNN: Point-Voxel Feature Set Abstraction for 3D Object Detection

    Shaoshuai Shi, Chaoxu Guo, Li Jiang +4

    cs.CVcs.LGeess.IVarXiv:1912.13192v22019