Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
4,201 to 4,260 of 18,781
ApolloCar3D: A Large 3D Car Instance Understanding Benchmark for Autonomous Driving
Xibin Song, Peng Wang, Dingfu Zhou +6
cs.CVarXiv:1811.12222v22018From Affect to Complex Behavior: Advancing Multimodal Human-Centered AI at the 10th ABAW Workshop & Competition
Dimitrios Kollias, Panagiotis Tzirakis, Alan Cowen +10
cs.CVarXiv:2605.27451v12026ImageBART: Bidirectional Context with Multinomial Diffusion for Autoregressive Image Synthesis
Patrick Esser, Robin Rombach, Andreas Blattmann +1
cs.CVarXiv:2108.08827v12021Video Polyp Segmentation: A Deep Learning Perspective
Ge-Peng Ji, Guobao Xiao, Yu-Cheng Chou +4
eess.IVcs.CVarXiv:2203.14291v32022Improved Baselines with Representation Autoencoders
Jaskirat Singh, Boyang Zheng, Zongze Wu +3
cs.CVcs.AIcs.GRarXiv:2605.18324v22026CornerNet-Lite: Efficient Keypoint Based Object Detection
Hei Law, Yun Teng, Olga Russakovsky +1
cs.CVarXiv:1904.08900v22019Infinite Photorealistic Worlds using Procedural Generation
Alexander Raistrick, Lahav Lipson, Zeyu Ma +12
cs.CVarXiv:2306.09310v22023GeoStore: Finding Small Storefronts in Large Scenes -- A Fine-Grained POI Localization Benchmark with Global-to-Local Asymmetric Matching
Lu Han, Xiting Sun, Hao Wang +4
cs.CVcs.IRarXiv:2609.02012v12026DeepBox: Learning Objectness with Convolutional Networks
Weicheng Kuo, Bharath Hariharan, Jitendra Malik
cs.CVarXiv:1505.02146v22015WebLINX: Real-World Website Navigation with Multi-Turn Dialogue
Xing Han Lù, Zdeněk Kasner, Siva Reddy
cs.CLcs.CVcs.LGarXiv:2402.05930v22024Pixel to Gaussian: Ultra-Fast Continuous Super-Resolution with 2D Gaussian Modeling
Long Peng, Anran Wu, Wenbo Li +9
cs.CVarXiv:2503.06617v12025SGS-SLAM: Semantic Gaussian Splatting For Neural Dense SLAM
Mingrui Li, Shuhong Liu, Heng Zhou +4
cs.CVcs.AIcs.ROarXiv:2402.03246v62024Rethinking Feature Distribution for Loss Functions in Image Classification
Weitao Wan, Yuanyi Zhong, Tianpeng Li +1
cs.CVarXiv:1803.02988v12018TVT: Transferable Vision Transformer for Unsupervised Domain Adaptation
Jinyu Yang, Jingjing Liu, Ning Xu +1
cs.CVarXiv:2108.05988v22021Dual Contrastive Network for Few-Shot Remote Sensing Image Scene Classification
Zhong Ji, Liyuan Hou, Xuan Wang +2
cs.CVarXiv:2603.23161v12026Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang +6
cs.CVcs.AIcs.GRarXiv:2601.11109v32026Linked Dynamic Graph CNN: Learning on Point Cloud via Linking Hierarchical Features
Kuangen Zhang, Ming Hao, Jing Wang +2
cs.CVarXiv:1904.10014v22019MixFormerV2: Efficient Fully Transformer Tracking
Yutao Cui, Tianhui Song, Gangshan Wu +1
cs.CVarXiv:2305.15896v22023Cross-Modal Retrieval in the Cooking Context: Learning Semantic Text-Image Embeddings
Micael Carvalho, Rémi Cadène, David Picard +3
cs.CLcs.CVcs.IRarXiv:1804.11146v12018CTAP: Complementary Temporal Action Proposal Generation
Jiyang Gao, Kan Chen, Ram Nevatia
cs.CVarXiv:1807.04821v22018Learning Spatio-Temporal Representation with Local and Global Diffusion
Zhaofan Qiu, Ting Yao, Chong-Wah Ngo +2
cs.CVarXiv:1906.05571v12019TokenVerse: Versatile Multi-concept Personalization in Token Modulation Space
Daniel Garibi, Shahar Yadin, Roni Paiss +6
cs.CVarXiv:2501.12224v12025Linking Image and Text with 2-Way Nets
Aviv Eisenschtat, Lior Wolf
cs.CVarXiv:1608.07973v32016STEP: A Modular Silent Trial Engine for Operational Evaluation of Digital Pathology AI in Routine Workflow
Gabriele Campanella, Matthew Croken, Olga Lukatskaya +4
cs.SEcs.CVarXiv:2608.28708v12026Vision-Language Models for Edge Networks: A Comprehensive Survey
Ahmed Sharshar, Latif U. Khan, Waseem Ullah +1
cs.CVcs.AIcs.CLarXiv:2502.07855v22025Synergies Between Affordance and Geometry: 6-DoF Grasp Detection via Implicit Representations
Zhenyu Jiang, Yifeng Zhu, Maxwell Svetlik +2
cs.ROcs.AIcs.CVarXiv:2104.01542v22021NTIRE 2026 Low-light Enhancement: Twilight Cowboy Challenge
Aleksei Khalin, Egor Ershov, Artyom Panshin +46
cs.CVarXiv:2608.09782v12026SelfDoc: Self-Supervised Document Representation Learning
Peizhao Li, Jiuxiang Gu, Jason Kuen +5
cs.CVcs.CLarXiv:2106.03331v12021AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition
Shunpeng Chen, Jingyi Zhang, Changwei Wang +6
cs.CVarXiv:2609.04369v12026Adversarial Robustness vs Model Compression, or Both?
Shaokai Ye, Kaidi Xu, Sijia Liu +6
cs.CVcs.CRcs.LGarXiv:1903.12561v52019Polis: 3D Self-Supervision at City Scale
Alexander Rusnak, Sophia Kovalenko, Jingru Wang +3
cs.CVcs.AIcs.LGarXiv:2608.29426v12026Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
Yimeng Zhang, Xin Chen, Jinghan Jia +6
cs.CVcs.CRarXiv:2405.15234v32024Taming Diffusion Models for Audio-Driven Co-Speech Gesture Generation
Lingting Zhu, Xian Liu, Xuanyu Liu +3
cs.CVcs.SDeess.ASarXiv:2303.09119v22023HEST-1k: A Dataset for Spatial Transcriptomics and Histology Image Analysis
Guillaume Jaume, Paul Doucet, Andrew H. Song +8
cs.CVarXiv:2406.16192v22024UBnormal: New Benchmark for Supervised Open-Set Video Anomaly Detection
Andra Acsintoae, Andrei Florescu, Mariana-Iuliana Georgescu +5
cs.CVcs.LGarXiv:2111.08644v32021MM-Fi: Multi-Modal Non-Intrusive 4D Human Dataset for Versatile Wireless Sensing
Jianfei Yang, He Huang, Yunjiao Zhou +6
eess.SPcs.AIcs.CVarXiv:2305.10345v22023Learning to Paint With Model-based Deep Reinforcement Learning
Zhewei Huang, Wen Heng, Shuchang Zhou
cs.CVcs.AIarXiv:1903.04411v32019Skeleton-Contrastive 3D Action Representation Learning
Fida Mohammad Thoker, Hazel Doughty, Cees G. M. Snoek
cs.CVarXiv:2108.03656v12021Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang +2
cs.CLcs.CVarXiv:2309.06135v32023Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation
Nicklas Hansen, Hao Su, Xiaolong Wang
cs.LGcs.CVcs.ROarXiv:2107.00644v22021A Review of YOLOv12: Attention-Based Enhancements vs. Previous Versions
Rahima Khanam, Muhammad Hussain
cs.CVarXiv:2504.11995v12025NFAD: Nuisance-Filtered Anomaly Detection Under Distribution Shift
Dat Cao, Son Nghiem, Phan Nguyen +2
cs.CVarXiv:2608.29112v12026RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos
Wenting Wang, Jiaxin Guo, Wenzhen Dong +3
cs.CVcs.AIarXiv:2608.29003v12026LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
Boyu Chen, Zhengrong Yue, Siran Chen +4
cs.CVarXiv:2503.10200v52025Crop mapping from image time series: deep learning with multi-scale label hierarchies
Mehmet Ozgur Turkoglu, Stefano D'Aronco, Gregor Perich +4
cs.CVarXiv:2102.08820v22021DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
Feiyang jia, Lin Liu, Ziying Song +4
cs.CVcs.ROarXiv:2602.06521v12026Incremental Learning In Online Scenario
Jiangpeng He, Runyu Mao, Zeman Shao +1
cs.CVarXiv:2003.13191v22020Domain Adaptation for Underwater Image Enhancement
Zhengyong Wang, Liquan Shen, Mei Yu +3
cs.CVarXiv:2108.09650v12021CKD-TransBTS: Clinical Knowledge-Driven Hybrid Transformer with Modality-Correlated Cross-Attention for Brain Tumor Segmentation
Jianwei Lin, Jiatai Lin, Cheng Lu +12
eess.IVcs.CVarXiv:2207.07370v12022SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images
Zixuan Huang, Mark Boss, Aaryaman Vasishta +2
cs.CVcs.GRarXiv:2501.04689v12025Deep Learning Representation using Autoencoder for 3D Shape Retrieval
Zhuotun Zhu, Xinggang Wang, Song Bai +2
cs.CVarXiv:1409.7164v12014TransDeepLab: Convolution-Free Transformer-based DeepLab v3+ for Medical Image Segmentation
Reza Azad, Moein Heidari, Moein Shariatnia +4
eess.IVcs.CVcs.LGarXiv:2208.00713v12022MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens
Youngrae Kim, Qixin Hu, C. -C. Jay Kuo +1
cs.CVarXiv:2603.12513v12026RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control
Teng Li, Guangcong Zheng, Rui Jiang +9
cs.CVarXiv:2502.10059v22025BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household Activities
Yunfan Jiang, Ruohan Zhang, Josiah Wong +7
cs.ROcs.AIcs.CVarXiv:2503.05652v22025Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning
Bozhou Zhang, Nan Song, Xin Jin +1
cs.ROcs.CVarXiv:2503.14182v12025MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
Kuicai Dong, Yujing Chang, Xin Deik Goh +3
cs.IRcs.AIcs.CLarXiv:2501.08828v32025Super-resolution Ultrasound Localization Microscopy through Deep Learning
Ruud J. G. van Sloun, Oren Solomon, Matthew Bruce +4
eess.SPcs.CVeess.IVarXiv:1804.07661v22018ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement
Runhui Huang, Chunwei Wang, Junwei Yang +8
cs.CVarXiv:2504.01934v22025CARD: Calibration via Agreement in Reverse Diffusion for Out-of-Domain MRI Segmentation
Jiaheng Dai, Weidong Guo, Qingbiao Li +4
cs.CVarXiv:2608.28681v12026