Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,721 to 15,780 of 18,841

  1. Deep Image Retrieval: Learning global representations for image search

    Albert Gordo, Jon Almazan, Jerome Revaud +1

    cs.CVarXiv:1604.01325v22016
  2. Learning to Refine Object Segments

    Pedro O. Pinheiro, Tsung-Yi Lin, Ronan Collobert +1

    cs.CVarXiv:1603.08695v22016
    Summaries:한국어
  3. Everybody Dance Now

    Caroline Chan, Shiry Ginosar, Tinghui Zhou +1

    cs.GRcs.CVarXiv:1808.07371v22018
    Summaries:한국어
  4. Coarse-Guided Visual Generation via Weighted h-Transform Sampling

    Yanghao Wang, Ziqi Jiang, Zhen Wang +1

    cs.CVcs.AIarXiv:2603.12057v22026
  5. Point-Voxel CNN for Efficient 3D Deep Learning

    Zhijian Liu, Haotian Tang, Yujun Lin +1

    cs.CVarXiv:1907.03739v22019
  6. Characterizing Adversarial Subspaces Using Local Intrinsic Dimensionality

    Xingjun Ma, Bo Li, Yisen Wang +6

    cs.LGcs.CRcs.CVarXiv:1801.02613v32018
  7. Residual Dense Network for Image Restoration

    Yulun Zhang, Yapeng Tian, Yu Kong +2

    cs.CVarXiv:1812.10477v22018
  8. Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

    Zhiming Yang, Zhuoxi Xiong, Donglin Zhou +3

    cs.AIcs.CLcs.CVarXiv:2608.22232v12026
  9. Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

    Haomin Wang, Qi Wei, Qianli Ma +4

    cs.CVarXiv:2603.16189v12026
  10. WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments

    Xuweiyi Chen, Wentao Zhou, Zezhou Cheng

    cs.CVarXiv:2601.10716v12026
  11. As-Rigid-As-Possible Regularization for Implicit Surfaces

    Tobias Djuren, Markus Worchel, Ugo Finnendahl +1

    cs.GRcs.CVarXiv:2608.15933v12026
  12. Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation

    Xiangyu Zhao, Peiyuan Zhang, Junming Lin +7

    cs.CVarXiv:2603.12247v12026
  13. Pruning neural networks without any data by iteratively conserving synaptic flow

    Hidenori Tanaka, Daniel Kunin, Daniel L. K. Yamins +1

    cs.LGcond-mat.dis-nncs.CVarXiv:2006.05467v32020
  14. DVC: An End-to-end Deep Video Compression Framework

    Guo Lu, Wanli Ouyang, Dong Xu +3

    eess.IVcs.CVarXiv:1812.00101v32018
  15. Large-Scale Image Retrieval with Attentive Deep Local Features

    Hyeonwoo Noh, Andre Araujo, Jack Sim +2

    cs.CVarXiv:1612.06321v42016
  16. Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments

    Hansen Jin Lillemark, Benhao Huang, Fangneng Zhan +2

    cs.LGcs.AIcs.CVarXiv:2601.01075v22026
  17. RegNeRF: Regularizing Neural Radiance Fields for View Synthesis from Sparse Inputs

    Michael Niemeyer, Jonathan T. Barron, Ben Mildenhall +3

    cs.CVcs.AIcs.GRarXiv:2112.00724v12021
  18. Compact Bilinear Pooling

    Yang Gao, Oscar Beijbom, Ning Zhang +1

    cs.CVarXiv:1511.06062v22015
  19. Vega: Learning to Drive with Natural Language Instructions

    Sicheng Zuo, Yuxuan Li, Wenzhao Zheng +3

    cs.CVcs.AIcs.ROarXiv:2603.25741v22026
  20. Label-Embedding for Image Classification

    Zeynep Akata, Florent Perronnin, Zaid Harchaoui +1

    cs.CVarXiv:1503.08677v22015
  21. EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

    Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer +1

    cs.CVarXiv:2608.21486v12026
  22. Noise2Self: Blind Denoising by Self-Supervision

    Joshua Batson, Loic Royer

    cs.CVcs.LGstat.MLarXiv:1901.11365v22019
  23. Learning an Animatable Detailed 3D Face Model from In-The-Wild Images

    Yao Feng, Haiwen Feng, Michael J. Black +1

    cs.CVarXiv:2012.04012v22020
  24. DVD: Deterministic Video Depth Estimation with Generative Priors

    Hongfei Zhang, Harold Haodong Chen, Chenfei Liao +12

    cs.CVarXiv:2603.12250v12026
  25. Object Hallucination in Image Captioning

    Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns +2

    cs.CLcs.CVarXiv:1809.02156v22018
  26. Autoregressive Image Generation with Masked Bit Modeling

    Qihang Yu, Qihao Liu, Ju He +4

    cs.CVarXiv:2602.09024v12026
  27. Unbiased Scene Graph Generation from Biased Training

    Kaihua Tang, Yulei Niu, Jianqiang Huang +2

    cs.CVcs.LGarXiv:2002.11949v42020
  28. GenMask: Adapting DiT for Segmentation via Direct Mask Generation

    Yuhuan Yang, Xianwei Zhuang, Yuxuan Cai +6

    cs.CVarXiv:2603.23906v22026
  29. Segment Everything Everywhere All at Once

    Xueyan Zou, Jianwei Yang, Hao Zhang +6

    cs.CVarXiv:2304.06718v42023
  30. Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection

    Guray Ozgur, Fadi Boutros, Naser Damer

    cs.CVarXiv:2608.21455v12026
  31. BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

    Yan Li, Zezi Zeng, Ziwei Zhou +13

    cs.CVarXiv:2603.25732v12026
  32. EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

    Yehonathan Litman, Shikun Liu, Dario Seyb +5

    cs.CVarXiv:2602.15031v22026
  33. GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation

    Nicolas von Lützow, Barbara Rössle, Katharina Schmid +1

    cs.CVarXiv:2603.26661v22026
  34. S4L: Self-Supervised Semi-Supervised Learning

    Xiaohua Zhai, Avital Oliver, Alexander Kolesnikov +1

    cs.CVcs.LGarXiv:1905.03670v22019
  35. A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

    Xingjun Ma, Yixu Wang, Hengyuan Xu +18

    cs.AIcs.CLcs.CVarXiv:2601.10527v22026
  36. Few-shot Object Detection via Feature Reweighting

    Bingyi Kang, Zhuang Liu, Xin Wang +3

    cs.CVarXiv:1812.01866v22018
  37. MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows

    Weixiang Shen, Chengzhi Shen, Yanzhu Hu +12

    cs.CVarXiv:2603.24649v22026
  38. CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

    Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin +5

    cs.LGcs.AIcs.CVarXiv:2603.24440v12026
  39. Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation

    Mohit Shridhar, Lucas Manuelli, Dieter Fox

    cs.ROcs.AIcs.CLarXiv:2209.05451v22022
  40. ShowUI-Aloha: Human-Taught GUI Agent

    Yichun Zhang, Xiangwu Guo, Yauhong Goh +5

    cs.CVarXiv:2601.07181v12026
  41. Siamese Box Adaptive Network for Visual Tracking

    Zedu Chen, Bineng Zhong, Guorong Li +2

    cs.CVarXiv:2003.06761v22020
  42. TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts

    Yu Xu, Hongbin Yan, Juan Cao +11

    cs.CVcs.AIarXiv:2601.08881v22026
  43. DM4CT: Benchmarking Diffusion Models for Computed Tomography Reconstruction

    Jiayang Shi, Daniel M. Pelt, K. Joost Batenburg

    eess.IVcs.AIcs.CVarXiv:2602.18589v12026
  44. SAPIEN: A SimulAted Part-based Interactive ENvironment

    Fanbo Xiang, Yuzhe Qin, Kaichun Mo +11

    cs.CVcs.ROarXiv:2003.08515v12020
  45. MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios

    Zhang Li, Zhibo Lin, Qiang Liu +7

    cs.CVcs.AIarXiv:2603.28130v12026
  46. How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers

    Andreas Steiner, Alexander Kolesnikov, Xiaohua Zhai +3

    cs.CVcs.AIcs.LGarXiv:2106.10270v22021
  47. MolmoPoint: Better Pointing for VLMs with Grounding Tokens

    Christopher Clark, Yue Yang, Jae Sung Park +8

    cs.CVcs.AIarXiv:2603.28069v12026
  48. The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision

    Jiayuan Mao, Chuang Gan, Pushmeet Kohli +2

    cs.CVcs.AIcs.CLarXiv:1904.12584v12019
  49. AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

    Zhaohe Liao, Kaixun Jiang, Zhihang Liu +11

    cs.CVarXiv:2603.28068v22026
  50. LLVIP: A Visible-infrared Paired Dataset for Low-light Vision

    Xinyu Jia, Chuang Zhu, Minzhen Li +3

    cs.CVcs.AIarXiv:2108.10831v42021
  51. Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators

    Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan +4

    cs.CVarXiv:2303.13439v12023
  52. EchoWM: Open and Enterable Omnimodal World Models

    Songchun Zhang, Yaowei Li, Junhao Zhuang +19

    cs.CVarXiv:2608.23189v12026
  53. Deep Image Prior

    Dmitry Ulyanov, Andrea Vedaldi, Victor Lempitsky

    cs.CVstat.MLarXiv:1711.10925v42017
  54. Semantic Understanding of Scenes through the ADE20K Dataset

    Bolei Zhou, Hang Zhao, Xavier Puig +4

    cs.CVarXiv:1608.05442v22016
  55. DiffusionBench: On Holistic Evaluation of Diffusion Transformers

    Xingjian Leng, Jaskirat Singh, Zhanhao Liang +5

    cs.CVarXiv:2606.24888v12026
  56. Deeply learned face representations are sparse, selective, and robust

    Yi Sun, Xiaogang Wang, Xiaoou Tang

    cs.CVarXiv:1412.1265v12014
  57. Enriching ImageNet with Human Similarity Judgments and Psychological Embeddings

    Brett D. Roads, Bradley C. Love

    cs.CVcs.LGarXiv:2011.11015v12020
    Summaries:한국어
  58. Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges

    Michael M. Bronstein, Joan Bruna, Taco Cohen +1

    cs.LGcs.AIcs.CGarXiv:2104.13478v22021
  59. Neural Motifs: Scene Graph Parsing with Global Context

    Rowan Zellers, Mark Yatskar, Sam Thomson +1

    cs.CVarXiv:1711.06640v22017
  60. EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration

    Wuyang Li, Yang Gao, Mariam Hassan +4

    cs.CVcs.AIarXiv:2605.15042v12026