Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,721 to 15,780 of 18,841
Deep Image Retrieval: Learning global representations for image search
Albert Gordo, Jon Almazan, Jerome Revaud +1
cs.CVarXiv:1604.01325v22016Learning to Refine Object Segments
Pedro O. Pinheiro, Tsung-Yi Lin, Ronan Collobert +1
cs.CVarXiv:1603.08695v22016Summaries:한국어Everybody Dance Now
Caroline Chan, Shiry Ginosar, Tinghui Zhou +1
cs.GRcs.CVarXiv:1808.07371v22018Summaries:한국어Coarse-Guided Visual Generation via Weighted h-Transform Sampling
Yanghao Wang, Ziqi Jiang, Zhen Wang +1
cs.CVcs.AIarXiv:2603.12057v22026Point-Voxel CNN for Efficient 3D Deep Learning
Zhijian Liu, Haotian Tang, Yujun Lin +1
cs.CVarXiv:1907.03739v22019Characterizing Adversarial Subspaces Using Local Intrinsic Dimensionality
Xingjun Ma, Bo Li, Yisen Wang +6
cs.LGcs.CRcs.CVarXiv:1801.02613v32018Residual Dense Network for Image Restoration
Yulun Zhang, Yapeng Tian, Yu Kong +2
cs.CVarXiv:1812.10477v22018Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models
Zhiming Yang, Zhuoxi Xiong, Donglin Zhou +3
cs.AIcs.CLcs.CVarXiv:2608.22232v12026Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
Haomin Wang, Qi Wei, Qianli Ma +4
cs.CVarXiv:2603.16189v12026WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments
Xuweiyi Chen, Wentao Zhou, Zezhou Cheng
cs.CVarXiv:2601.10716v12026As-Rigid-As-Possible Regularization for Implicit Surfaces
Tobias Djuren, Markus Worchel, Ugo Finnendahl +1
cs.GRcs.CVarXiv:2608.15933v12026Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation
Xiangyu Zhao, Peiyuan Zhang, Junming Lin +7
cs.CVarXiv:2603.12247v12026Pruning neural networks without any data by iteratively conserving synaptic flow
Hidenori Tanaka, Daniel Kunin, Daniel L. K. Yamins +1
cs.LGcond-mat.dis-nncs.CVarXiv:2006.05467v32020DVC: An End-to-end Deep Video Compression Framework
Guo Lu, Wanli Ouyang, Dong Xu +3
eess.IVcs.CVarXiv:1812.00101v32018Large-Scale Image Retrieval with Attentive Deep Local Features
Hyeonwoo Noh, Andre Araujo, Jack Sim +2
cs.CVarXiv:1612.06321v42016Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments
Hansen Jin Lillemark, Benhao Huang, Fangneng Zhan +2
cs.LGcs.AIcs.CVarXiv:2601.01075v22026RegNeRF: Regularizing Neural Radiance Fields for View Synthesis from Sparse Inputs
Michael Niemeyer, Jonathan T. Barron, Ben Mildenhall +3
cs.CVcs.AIcs.GRarXiv:2112.00724v12021Compact Bilinear Pooling
Yang Gao, Oscar Beijbom, Ning Zhang +1
cs.CVarXiv:1511.06062v22015Vega: Learning to Drive with Natural Language Instructions
Sicheng Zuo, Yuxuan Li, Wenzhao Zheng +3
cs.CVcs.AIcs.ROarXiv:2603.25741v22026Label-Embedding for Image Classification
Zeynep Akata, Florent Perronnin, Zaid Harchaoui +1
cs.CVarXiv:1503.08677v22015EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment
Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer +1
cs.CVarXiv:2608.21486v12026Noise2Self: Blind Denoising by Self-Supervision
Joshua Batson, Loic Royer
cs.CVcs.LGstat.MLarXiv:1901.11365v22019Learning an Animatable Detailed 3D Face Model from In-The-Wild Images
Yao Feng, Haiwen Feng, Michael J. Black +1
cs.CVarXiv:2012.04012v22020DVD: Deterministic Video Depth Estimation with Generative Priors
Hongfei Zhang, Harold Haodong Chen, Chenfei Liao +12
cs.CVarXiv:2603.12250v12026Object Hallucination in Image Captioning
Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns +2
cs.CLcs.CVarXiv:1809.02156v22018Autoregressive Image Generation with Masked Bit Modeling
Qihang Yu, Qihao Liu, Ju He +4
cs.CVarXiv:2602.09024v12026Unbiased Scene Graph Generation from Biased Training
Kaihua Tang, Yulei Niu, Jianqiang Huang +2
cs.CVcs.LGarXiv:2002.11949v42020GenMask: Adapting DiT for Segmentation via Direct Mask Generation
Yuhuan Yang, Xianwei Zhuang, Yuxuan Cai +6
cs.CVarXiv:2603.23906v22026Segment Everything Everywhere All at Once
Xueyan Zou, Jianwei Yang, Hao Zhang +6
cs.CVarXiv:2304.06718v42023Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection
Guray Ozgur, Fadi Boutros, Naser Damer
cs.CVarXiv:2608.21455v12026BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation
Yan Li, Zezi Zeng, Ziwei Zhou +13
cs.CVarXiv:2603.25732v12026EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing
Yehonathan Litman, Shikun Liu, Dario Seyb +5
cs.CVarXiv:2602.15031v22026GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation
Nicolas von Lützow, Barbara Rössle, Katharina Schmid +1
cs.CVarXiv:2603.26661v22026S4L: Self-Supervised Semi-Supervised Learning
Xiaohua Zhai, Avital Oliver, Alexander Kolesnikov +1
cs.CVcs.LGarXiv:1905.03670v22019A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5
Xingjun Ma, Yixu Wang, Hengyuan Xu +18
cs.AIcs.CLcs.CVarXiv:2601.10527v22026Few-shot Object Detection via Feature Reweighting
Bingyi Kang, Zhuang Liu, Xin Wang +3
cs.CVarXiv:1812.01866v22018MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows
Weixiang Shen, Chengzhi Shen, Yanzhu Hu +12
cs.CVarXiv:2603.24649v22026CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin +5
cs.LGcs.AIcs.CVarXiv:2603.24440v12026Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation
Mohit Shridhar, Lucas Manuelli, Dieter Fox
cs.ROcs.AIcs.CLarXiv:2209.05451v22022ShowUI-Aloha: Human-Taught GUI Agent
Yichun Zhang, Xiangwu Guo, Yauhong Goh +5
cs.CVarXiv:2601.07181v12026Siamese Box Adaptive Network for Visual Tracking
Zedu Chen, Bineng Zhong, Guorong Li +2
cs.CVarXiv:2003.06761v22020TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
Yu Xu, Hongbin Yan, Juan Cao +11
cs.CVcs.AIarXiv:2601.08881v22026DM4CT: Benchmarking Diffusion Models for Computed Tomography Reconstruction
Jiayang Shi, Daniel M. Pelt, K. Joost Batenburg
eess.IVcs.AIcs.CVarXiv:2602.18589v12026SAPIEN: A SimulAted Part-based Interactive ENvironment
Fanbo Xiang, Yuzhe Qin, Kaichun Mo +11
cs.CVcs.ROarXiv:2003.08515v12020MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
Zhang Li, Zhibo Lin, Qiang Liu +7
cs.CVcs.AIarXiv:2603.28130v12026How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers
Andreas Steiner, Alexander Kolesnikov, Xiaohua Zhai +3
cs.CVcs.AIcs.LGarXiv:2106.10270v22021MolmoPoint: Better Pointing for VLMs with Grounding Tokens
Christopher Clark, Yue Yang, Jae Sung Park +8
cs.CVcs.AIarXiv:2603.28069v12026The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision
Jiayuan Mao, Chuang Gan, Pushmeet Kohli +2
cs.CVcs.AIcs.CLarXiv:1904.12584v12019AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation
Zhaohe Liao, Kaixun Jiang, Zhihang Liu +11
cs.CVarXiv:2603.28068v22026LLVIP: A Visible-infrared Paired Dataset for Low-light Vision
Xinyu Jia, Chuang Zhu, Minzhen Li +3
cs.CVcs.AIarXiv:2108.10831v42021Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators
Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan +4
cs.CVarXiv:2303.13439v12023EchoWM: Open and Enterable Omnimodal World Models
Songchun Zhang, Yaowei Li, Junhao Zhuang +19
cs.CVarXiv:2608.23189v12026Deep Image Prior
Dmitry Ulyanov, Andrea Vedaldi, Victor Lempitsky
cs.CVstat.MLarXiv:1711.10925v42017Semantic Understanding of Scenes through the ADE20K Dataset
Bolei Zhou, Hang Zhao, Xavier Puig +4
cs.CVarXiv:1608.05442v22016DiffusionBench: On Holistic Evaluation of Diffusion Transformers
Xingjian Leng, Jaskirat Singh, Zhanhao Liang +5
cs.CVarXiv:2606.24888v12026Deeply learned face representations are sparse, selective, and robust
Yi Sun, Xiaogang Wang, Xiaoou Tang
cs.CVarXiv:1412.1265v12014Enriching ImageNet with Human Similarity Judgments and Psychological Embeddings
Brett D. Roads, Bradley C. Love
cs.CVcs.LGarXiv:2011.11015v12020Summaries:한국어Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges
Michael M. Bronstein, Joan Bruna, Taco Cohen +1
cs.LGcs.AIcs.CGarXiv:2104.13478v22021Neural Motifs: Scene Graph Parsing with Global Context
Rowan Zellers, Mark Yatskar, Sam Thomson +1
cs.CVarXiv:1711.06640v22017EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration
Wuyang Li, Yang Gao, Mariam Hassan +4
cs.CVcs.AIarXiv:2605.15042v12026