Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,021 to 16,080 of 18,839
ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
Jovana Kondic, Pengyuan Li, Dhiraj Joshi +24
cs.CVcs.AIcs.CLarXiv:2603.27064v22026A Survey of Modern Deep Learning based Object Detection Models
Syed Sahil Abbas Zaidi, Mohammad Samar Ansari, Asra Aslam +3
cs.CVcs.LGeess.IVarXiv:2104.11892v22021Co-occurrence Feature Learning for Skeleton based Action Recognition using Regularized Deep LSTM Networks
Wentao Zhu, Cuiling Lan, Junliang Xing +4
cs.CVcs.LGarXiv:1603.07772v12016Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset
Scott Ettinger, Shuyang Cheng, Benjamin Caine +15
cs.CVcs.LGcs.ROarXiv:2104.10133v12021Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
Yunheng Li, Hangyi Kuang, Hengrui Zhang +4
cs.CVarXiv:2603.22847v12026Deep Convolutional Neural Fields for Depth Estimation from a Single Image
Fayao Liu, Chunhua Shen, Guosheng Lin
cs.CVarXiv:1411.6387v22014Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
Zichen Wen, Boxue Yang, Shuang Chen +31
cs.CVcs.AIarXiv:2601.19325v12026Summaries:한국어Rethinking Network Design and Local Geometry in Point Cloud: A Simple Residual MLP Framework
Xu Ma, Can Qin, Haoxuan You +2
cs.CVcs.AIarXiv:2202.07123v22022VisDA: The Visual Domain Adaptation Challenge
Xingchao Peng, Ben Usman, Neela Kaushik +3
cs.CVarXiv:1710.06924v22017VLS: Steering Pretrained Robot Policies via Vision-Language Models
Shuo Liu, Ishneet Sukhvinder Singh, Yiqing Xu +2
cs.ROcs.CVarXiv:2602.03973v12026Computer Vision for Autonomous Vehicles: Problems, Datasets and State of the Art
Joel Janai, Fatma Güney, Aseem Behl +1
cs.CVcs.ROarXiv:1704.05519v32017D2-Net: A Trainable CNN for Joint Detection and Description of Local Features
Mihai Dusmanu, Ignacio Rocco, Tomas Pajdla +4
cs.CVarXiv:1905.03561v12019Deep Continuous Fusion for Multi-Sensor 3D Object Detection
Ming Liang, Bin Yang, Shenlong Wang +1
cs.CVarXiv:2012.10992v12020PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation
Xin-Sheng Chen, Jiayu Zhu, Pei-lin Li +3
cs.CVarXiv:2603.07244v12026Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models
Zengbin Wang, Xuecai Hu, Yong Wang +3
cs.CVarXiv:2601.20354v22026RIVER: A Real-Time Interaction Benchmark for Video LLMs
Yansong Shi, Qingsong Zhao, Tianxiang Jiang +3
cs.CVarXiv:2603.03985v12026Dense Nested Attention Network for Infrared Small Target Detection
Boyang Li, Chao Xiao, Longguang Wang +5
cs.CVarXiv:2106.00487v32021Lip Reading Sentences in the Wild
Joon Son Chung, Andrew Senior, Oriol Vinyals +1
cs.CVarXiv:1611.05358v22016Summaries:한국어Segmentation-Based Deep-Learning Approach for Surface-Defect Detection
Domen Tabernik, Samo Šela, Jure Skvarč +1
cs.CVarXiv:1903.08536v32019Exploring Self-attention for Image Recognition
Hengshuang Zhao, Jiaya Jia, Vladlen Koltun
cs.CVarXiv:2004.13621v12020Underwater Image Enhancement via Medium Transmission-Guided Multi-Color Space Embedding
Chongyi Li, Saeed Anwar, Junhui Hou +3
cs.CVarXiv:2104.13015v12021ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
Huanxuan Liao, Zhongtao Jiang, Yupu Hao +6
cs.CVcs.AIcs.CLarXiv:2603.28610v22026A Benchmark for Endoluminal Scene Segmentation of Colonoscopy Images
David Vázquez, Jorge Bernal, F. Javier Sánchez +5
cs.CVarXiv:1612.00799v12016Efficient piecewise training of deep structured models for semantic segmentation
Guosheng Lin, Chunhua Shen, Anton van dan Hengel +1
cs.CVarXiv:1504.01013v42015AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
Zun Wang, Han Lin, Jaehong Yoon +3
cs.CVcs.AIarXiv:2602.14941v12026RegionCLIP: Region-based Language-Image Pretraining
Yiwu Zhong, Jianwei Yang, Pengchuan Zhang +8
cs.CVcs.AIcs.LGarXiv:2112.09106v12021End-to-end Training for Whole Image Breast Cancer Diagnosis using An All Convolutional Design
Li Shen
cs.CVarXiv:1711.05775v12017Deep Convolutional Inverse Graphics Network
Tejas D. Kulkarni, Will Whitney, Pushmeet Kohli +1
cs.CVcs.GRcs.LGarXiv:1503.03167v42015Compression of Deep Convolutional Neural Networks for Fast and Low Power Mobile Applications
Yong-Deok Kim, Eunhyeok Park, Sungjoo Yoo +3
cs.CVcs.LGarXiv:1511.06530v22015Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
Qihua Dong, Kuo Yang, Lin Ju +6
cs.CVcs.AIcs.CLarXiv:2602.23898v12026When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
Shoubin Yu, Yue Zhang, Zun Wang +4
cs.CVcs.AIcs.CLarXiv:2602.08236v22026Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
Yuhao Dong, Shulin Tian, Shuai Liu +6
cs.CVarXiv:2602.08439v12026Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
Shengbang Tong, Ellis Brown, Penghao Wu +11
cs.CVarXiv:2406.16860v22024MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
Arushi Goel, Sreyan Ghosh, Vatsal Agarwal +16
cs.CLcs.CVarXiv:2603.14145v22026Language-driven Semantic Segmentation
Boyi Li, Kilian Q. Weinberger, Serge Belongie +2
cs.CVcs.CLcs.LGarXiv:2201.03546v22022RobustBench: a standardized adversarial robustness benchmark
Francesco Croce, Maksym Andriushchenko, Vikash Sehwag +5
cs.LGcs.CRcs.CVarXiv:2010.09670v32020RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning
Tzu-Heng Huang, Sirajul Salekin, Javier Movellan +2
cs.CVcs.AIcs.LGarXiv:2603.09160v12026PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
Junsong Chen, Jincheng Yu, Chongjian Ge +8
cs.CVarXiv:2310.00426v32023PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
Yibo Lyu, Gongwei Chen, Rui Shao +2
cs.AIcs.CVcs.HCarXiv:2601.09636v22026Integral Human Pose Regression
Xiao Sun, Bin Xiao, Fangyin Wei +2
cs.CVarXiv:1711.08229v42017VGGSound: A Large-scale Audio-Visual Dataset
Honglie Chen, Weidi Xie, Andrea Vedaldi +1
cs.CVcs.SDeess.ASarXiv:2004.14368v22020MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
Kangsan Kim, Yanlai Yang, Suji Kim +4
cs.CVcs.AIarXiv:2603.09827v22026FrankenMotion: Part-level Human Motion Generation and Composition
Chuqiao Li, Xianghui Xie, Yong Cao +2
cs.CVarXiv:2601.10909v12026Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
Baifeng Shi, Stephanie Fu, Long Lian +10
cs.CVarXiv:2603.12254v12026CARAFE: Content-Aware ReAssembly of FEatures
Jiaqi Wang, Kai Chen, Rui Xu +3
cs.CVarXiv:1905.02188v32019Long-term Temporal Convolutions for Action Recognition
Gül Varol, Ivan Laptev, Cordelia Schmid
cs.CVarXiv:1604.04494v22016Speeding-up Convolutional Neural Networks Using Fine-tuned CP-Decomposition
Vadim Lebedev, Yaroslav Ganin, Maksim Rakhuba +2
cs.CVcs.LGarXiv:1412.6553v32014Time-Contrastive Networks: Self-Supervised Learning from Video
Pierre Sermanet, Corey Lynch, Yevgen Chebotar +4
cs.CVcs.ROarXiv:1704.06888v32017Grounding World Simulation Models in a Real-World Metropolis
Junyoung Seo, Hyunwook Choi, Minkyung Kwon +10
cs.CVarXiv:2603.15583v12026Acquisition of Localization Confidence for Accurate Object Detection
Borui Jiang, Ruixuan Luo, Jiayuan Mao +2
cs.CVarXiv:1807.11590v12018ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model
Haichao Zhang, Yijiang Li, Shwai He +5
cs.CVcs.AIcs.CLarXiv:2603.22281v22026C-RADIOv4 (Tech Report)
Mike Ranzinger, Greg Heinrich, Collin McCarthy +4
cs.CVarXiv:2601.17237v12026Two at Once: Enhancing Learning and Generalization Capacities via IBN-Net
Xingang Pan, Ping Luo, Jianping Shi +1
cs.CVarXiv:1807.09441v32018Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels
Ilya Kostrikov, Denis Yarats, Rob Fergus
cs.LGcs.CVeess.IVarXiv:2004.13649v42020SinGAN: Learning a Generative Model from a Single Natural Image
Tamar Rott Shaham, Tali Dekel, Tomer Michaeli
cs.CVarXiv:1905.01164v22019Deeper and Wider Siamese Networks for Real-Time Visual Tracking
Zhipeng Zhang, Houwen Peng
cs.CVarXiv:1901.01660v32019PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
Jianshu Zhang, Chengxuan Qian, Haosen Sun +4
cs.CVcs.CLarXiv:2601.15224v22026FireRed-OCR Technical Report
Hao Wu, Haoran Lou, Xinyue Li +19
cs.CVeess.IVarXiv:2603.01840v12026WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation
Jisu Nam, Yicong Hong, Chun-Hao Paul Huang +9
cs.CVarXiv:2603.16871v12026LRM: Large Reconstruction Model for Single Image to 3D
Yicong Hong, Kai Zhang, Jiuxiang Gu +7
cs.CVcs.AIcs.GRarXiv:2311.04400v22023