Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,021 to 16,080 of 18,839

  1. ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

    Jovana Kondic, Pengyuan Li, Dhiraj Joshi +24

    cs.CVcs.AIcs.CLarXiv:2603.27064v22026
  2. A Survey of Modern Deep Learning based Object Detection Models

    Syed Sahil Abbas Zaidi, Mohammad Samar Ansari, Asra Aslam +3

    cs.CVcs.LGeess.IVarXiv:2104.11892v22021
  3. Co-occurrence Feature Learning for Skeleton based Action Recognition using Regularized Deep LSTM Networks

    Wentao Zhu, Cuiling Lan, Junliang Xing +4

    cs.CVcs.LGarXiv:1603.07772v12016
  4. Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset

    Scott Ettinger, Shuyang Cheng, Benjamin Caine +15

    cs.CVcs.LGcs.ROarXiv:2104.10133v12021
  5. Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

    Yunheng Li, Hangyi Kuang, Hengrui Zhang +4

    cs.CVarXiv:2603.22847v12026
  6. Deep Convolutional Neural Fields for Depth Estimation from a Single Image

    Fayao Liu, Chunhua Shen, Guosheng Lin

    cs.CVarXiv:1411.6387v22014
  7. Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

    Zichen Wen, Boxue Yang, Shuang Chen +31

    cs.CVcs.AIarXiv:2601.19325v12026
    Summaries:한국어
  8. Rethinking Network Design and Local Geometry in Point Cloud: A Simple Residual MLP Framework

    Xu Ma, Can Qin, Haoxuan You +2

    cs.CVcs.AIarXiv:2202.07123v22022
  9. VisDA: The Visual Domain Adaptation Challenge

    Xingchao Peng, Ben Usman, Neela Kaushik +3

    cs.CVarXiv:1710.06924v22017
  10. VLS: Steering Pretrained Robot Policies via Vision-Language Models

    Shuo Liu, Ishneet Sukhvinder Singh, Yiqing Xu +2

    cs.ROcs.CVarXiv:2602.03973v12026
  11. Computer Vision for Autonomous Vehicles: Problems, Datasets and State of the Art

    Joel Janai, Fatma Güney, Aseem Behl +1

    cs.CVcs.ROarXiv:1704.05519v32017
  12. D2-Net: A Trainable CNN for Joint Detection and Description of Local Features

    Mihai Dusmanu, Ignacio Rocco, Tomas Pajdla +4

    cs.CVarXiv:1905.03561v12019
  13. Deep Continuous Fusion for Multi-Sensor 3D Object Detection

    Ming Liang, Bin Yang, Shenlong Wang +1

    cs.CVarXiv:2012.10992v12020
  14. PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation

    Xin-Sheng Chen, Jiayu Zhu, Pei-lin Li +3

    cs.CVarXiv:2603.07244v12026
  15. Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models

    Zengbin Wang, Xuecai Hu, Yong Wang +3

    cs.CVarXiv:2601.20354v22026
  16. RIVER: A Real-Time Interaction Benchmark for Video LLMs

    Yansong Shi, Qingsong Zhao, Tianxiang Jiang +3

    cs.CVarXiv:2603.03985v12026
  17. Dense Nested Attention Network for Infrared Small Target Detection

    Boyang Li, Chao Xiao, Longguang Wang +5

    cs.CVarXiv:2106.00487v32021
  18. Lip Reading Sentences in the Wild

    Joon Son Chung, Andrew Senior, Oriol Vinyals +1

    cs.CVarXiv:1611.05358v22016
    Summaries:한국어
  19. Segmentation-Based Deep-Learning Approach for Surface-Defect Detection

    Domen Tabernik, Samo Šela, Jure Skvarč +1

    cs.CVarXiv:1903.08536v32019
  20. Exploring Self-attention for Image Recognition

    Hengshuang Zhao, Jiaya Jia, Vladlen Koltun

    cs.CVarXiv:2004.13621v12020
  21. Underwater Image Enhancement via Medium Transmission-Guided Multi-Color Space Embedding

    Chongyi Li, Saeed Anwar, Junhui Hou +3

    cs.CVarXiv:2104.13015v12021
  22. ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

    Huanxuan Liao, Zhongtao Jiang, Yupu Hao +6

    cs.CVcs.AIcs.CLarXiv:2603.28610v22026
  23. A Benchmark for Endoluminal Scene Segmentation of Colonoscopy Images

    David Vázquez, Jorge Bernal, F. Javier Sánchez +5

    cs.CVarXiv:1612.00799v12016
  24. Efficient piecewise training of deep structured models for semantic segmentation

    Guosheng Lin, Chunhua Shen, Anton van dan Hengel +1

    cs.CVarXiv:1504.01013v42015
  25. AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories

    Zun Wang, Han Lin, Jaehong Yoon +3

    cs.CVcs.AIarXiv:2602.14941v12026
  26. RegionCLIP: Region-based Language-Image Pretraining

    Yiwu Zhong, Jianwei Yang, Pengchuan Zhang +8

    cs.CVcs.AIcs.LGarXiv:2112.09106v12021
  27. End-to-end Training for Whole Image Breast Cancer Diagnosis using An All Convolutional Design

    Li Shen

    cs.CVarXiv:1711.05775v12017
  28. Deep Convolutional Inverse Graphics Network

    Tejas D. Kulkarni, Will Whitney, Pushmeet Kohli +1

    cs.CVcs.GRcs.LGarXiv:1503.03167v42015
  29. Compression of Deep Convolutional Neural Networks for Fast and Low Power Mobile Applications

    Yong-Deok Kim, Eunhyeok Park, Sungjoo Yoo +3

    cs.CVcs.LGarXiv:1511.06530v22015
  30. Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

    Qihua Dong, Kuo Yang, Lin Ju +6

    cs.CVcs.AIcs.CLarXiv:2602.23898v12026
  31. When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning

    Shoubin Yu, Yue Zhang, Zun Wang +4

    cs.CVcs.AIcs.CLarXiv:2602.08236v22026
  32. Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

    Yuhao Dong, Shulin Tian, Shuai Liu +6

    cs.CVarXiv:2602.08439v12026
  33. Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs

    Shengbang Tong, Ellis Brown, Penghao Wu +11

    cs.CVarXiv:2406.16860v22024
  34. MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

    Arushi Goel, Sreyan Ghosh, Vatsal Agarwal +16

    cs.CLcs.CVarXiv:2603.14145v22026
  35. Language-driven Semantic Segmentation

    Boyi Li, Kilian Q. Weinberger, Serge Belongie +2

    cs.CVcs.CLcs.LGarXiv:2201.03546v22022
  36. RobustBench: a standardized adversarial robustness benchmark

    Francesco Croce, Maksym Andriushchenko, Vikash Sehwag +5

    cs.LGcs.CRcs.CVarXiv:2010.09670v32020
  37. RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

    Tzu-Heng Huang, Sirajul Salekin, Javier Movellan +2

    cs.CVcs.AIcs.LGarXiv:2603.09160v12026
  38. PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

    Junsong Chen, Jincheng Yu, Chongjian Ge +8

    cs.CVarXiv:2310.00426v32023
  39. PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

    Yibo Lyu, Gongwei Chen, Rui Shao +2

    cs.AIcs.CVcs.HCarXiv:2601.09636v22026
  40. Integral Human Pose Regression

    Xiao Sun, Bin Xiao, Fangyin Wei +2

    cs.CVarXiv:1711.08229v42017
  41. VGGSound: A Large-scale Audio-Visual Dataset

    Honglie Chen, Weidi Xie, Andrea Vedaldi +1

    cs.CVcs.SDeess.ASarXiv:2004.14368v22020
  42. MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

    Kangsan Kim, Yanlai Yang, Suji Kim +4

    cs.CVcs.AIarXiv:2603.09827v22026
  43. FrankenMotion: Part-level Human Motion Generation and Composition

    Chuqiao Li, Xianghui Xie, Yong Cao +2

    cs.CVarXiv:2601.10909v12026
  44. Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

    Baifeng Shi, Stephanie Fu, Long Lian +10

    cs.CVarXiv:2603.12254v12026
  45. CARAFE: Content-Aware ReAssembly of FEatures

    Jiaqi Wang, Kai Chen, Rui Xu +3

    cs.CVarXiv:1905.02188v32019
  46. Long-term Temporal Convolutions for Action Recognition

    Gül Varol, Ivan Laptev, Cordelia Schmid

    cs.CVarXiv:1604.04494v22016
  47. Speeding-up Convolutional Neural Networks Using Fine-tuned CP-Decomposition

    Vadim Lebedev, Yaroslav Ganin, Maksim Rakhuba +2

    cs.CVcs.LGarXiv:1412.6553v32014
  48. Time-Contrastive Networks: Self-Supervised Learning from Video

    Pierre Sermanet, Corey Lynch, Yevgen Chebotar +4

    cs.CVcs.ROarXiv:1704.06888v32017
  49. Grounding World Simulation Models in a Real-World Metropolis

    Junyoung Seo, Hyunwook Choi, Minkyung Kwon +10

    cs.CVarXiv:2603.15583v12026
  50. Acquisition of Localization Confidence for Accurate Object Detection

    Borui Jiang, Ruixuan Luo, Jiayuan Mao +2

    cs.CVarXiv:1807.11590v12018
  51. ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model

    Haichao Zhang, Yijiang Li, Shwai He +5

    cs.CVcs.AIcs.CLarXiv:2603.22281v22026
  52. C-RADIOv4 (Tech Report)

    Mike Ranzinger, Greg Heinrich, Collin McCarthy +4

    cs.CVarXiv:2601.17237v12026
  53. Two at Once: Enhancing Learning and Generalization Capacities via IBN-Net

    Xingang Pan, Ping Luo, Jianping Shi +1

    cs.CVarXiv:1807.09441v32018
  54. Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels

    Ilya Kostrikov, Denis Yarats, Rob Fergus

    cs.LGcs.CVeess.IVarXiv:2004.13649v42020
  55. SinGAN: Learning a Generative Model from a Single Natural Image

    Tamar Rott Shaham, Tali Dekel, Tomer Michaeli

    cs.CVarXiv:1905.01164v22019
  56. Deeper and Wider Siamese Networks for Real-Time Visual Tracking

    Zhipeng Zhang, Houwen Peng

    cs.CVarXiv:1901.01660v32019
  57. PROGRESSLM: Towards Progress Reasoning in Vision-Language Models

    Jianshu Zhang, Chengxuan Qian, Haosen Sun +4

    cs.CVcs.CLarXiv:2601.15224v22026
  58. FireRed-OCR Technical Report

    Hao Wu, Haoran Lou, Xinyue Li +19

    cs.CVeess.IVarXiv:2603.01840v12026
  59. WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

    Jisu Nam, Yicong Hong, Chun-Hao Paul Huang +9

    cs.CVarXiv:2603.16871v12026
  60. LRM: Large Reconstruction Model for Single Image to 3D

    Yicong Hong, Kai Zhang, Jiuxiang Gu +7

    cs.CVcs.AIcs.GRarXiv:2311.04400v22023