Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

4,201 to 4,260 of 18,781

  1. ApolloCar3D: A Large 3D Car Instance Understanding Benchmark for Autonomous Driving

    Xibin Song, Peng Wang, Dingfu Zhou +6

    cs.CVarXiv:1811.12222v22018
  2. From Affect to Complex Behavior: Advancing Multimodal Human-Centered AI at the 10th ABAW Workshop & Competition

    Dimitrios Kollias, Panagiotis Tzirakis, Alan Cowen +10

    cs.CVarXiv:2605.27451v12026
  3. ImageBART: Bidirectional Context with Multinomial Diffusion for Autoregressive Image Synthesis

    Patrick Esser, Robin Rombach, Andreas Blattmann +1

    cs.CVarXiv:2108.08827v12021
  4. Video Polyp Segmentation: A Deep Learning Perspective

    Ge-Peng Ji, Guobao Xiao, Yu-Cheng Chou +4

    eess.IVcs.CVarXiv:2203.14291v32022
  5. Improved Baselines with Representation Autoencoders

    Jaskirat Singh, Boyang Zheng, Zongze Wu +3

    cs.CVcs.AIcs.GRarXiv:2605.18324v22026
  6. CornerNet-Lite: Efficient Keypoint Based Object Detection

    Hei Law, Yun Teng, Olga Russakovsky +1

    cs.CVarXiv:1904.08900v22019
  7. Infinite Photorealistic Worlds using Procedural Generation

    Alexander Raistrick, Lahav Lipson, Zeyu Ma +12

    cs.CVarXiv:2306.09310v22023
  8. GeoStore: Finding Small Storefronts in Large Scenes -- A Fine-Grained POI Localization Benchmark with Global-to-Local Asymmetric Matching

    Lu Han, Xiting Sun, Hao Wang +4

    cs.CVcs.IRarXiv:2609.02012v12026
  9. DeepBox: Learning Objectness with Convolutional Networks

    Weicheng Kuo, Bharath Hariharan, Jitendra Malik

    cs.CVarXiv:1505.02146v22015
  10. WebLINX: Real-World Website Navigation with Multi-Turn Dialogue

    Xing Han Lù, Zdeněk Kasner, Siva Reddy

    cs.CLcs.CVcs.LGarXiv:2402.05930v22024
  11. Pixel to Gaussian: Ultra-Fast Continuous Super-Resolution with 2D Gaussian Modeling

    Long Peng, Anran Wu, Wenbo Li +9

    cs.CVarXiv:2503.06617v12025
  12. SGS-SLAM: Semantic Gaussian Splatting For Neural Dense SLAM

    Mingrui Li, Shuhong Liu, Heng Zhou +4

    cs.CVcs.AIcs.ROarXiv:2402.03246v62024
  13. Rethinking Feature Distribution for Loss Functions in Image Classification

    Weitao Wan, Yuanyi Zhong, Tianpeng Li +1

    cs.CVarXiv:1803.02988v12018
  14. TVT: Transferable Vision Transformer for Unsupervised Domain Adaptation

    Jinyu Yang, Jingjing Liu, Ning Xu +1

    cs.CVarXiv:2108.05988v22021
  15. Dual Contrastive Network for Few-Shot Remote Sensing Image Scene Classification

    Zhong Ji, Liyuan Hou, Xuan Wang +2

    cs.CVarXiv:2603.23161v12026
  16. Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

    Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang +6

    cs.CVcs.AIcs.GRarXiv:2601.11109v32026
  17. Linked Dynamic Graph CNN: Learning on Point Cloud via Linking Hierarchical Features

    Kuangen Zhang, Ming Hao, Jing Wang +2

    cs.CVarXiv:1904.10014v22019
  18. MixFormerV2: Efficient Fully Transformer Tracking

    Yutao Cui, Tianhui Song, Gangshan Wu +1

    cs.CVarXiv:2305.15896v22023
  19. Cross-Modal Retrieval in the Cooking Context: Learning Semantic Text-Image Embeddings

    Micael Carvalho, Rémi Cadène, David Picard +3

    cs.CLcs.CVcs.IRarXiv:1804.11146v12018
  20. CTAP: Complementary Temporal Action Proposal Generation

    Jiyang Gao, Kan Chen, Ram Nevatia

    cs.CVarXiv:1807.04821v22018
  21. Learning Spatio-Temporal Representation with Local and Global Diffusion

    Zhaofan Qiu, Ting Yao, Chong-Wah Ngo +2

    cs.CVarXiv:1906.05571v12019
  22. TokenVerse: Versatile Multi-concept Personalization in Token Modulation Space

    Daniel Garibi, Shahar Yadin, Roni Paiss +6

    cs.CVarXiv:2501.12224v12025
  23. Linking Image and Text with 2-Way Nets

    Aviv Eisenschtat, Lior Wolf

    cs.CVarXiv:1608.07973v32016
  24. STEP: A Modular Silent Trial Engine for Operational Evaluation of Digital Pathology AI in Routine Workflow

    Gabriele Campanella, Matthew Croken, Olga Lukatskaya +4

    cs.SEcs.CVarXiv:2608.28708v12026
  25. Vision-Language Models for Edge Networks: A Comprehensive Survey

    Ahmed Sharshar, Latif U. Khan, Waseem Ullah +1

    cs.CVcs.AIcs.CLarXiv:2502.07855v22025
  26. Synergies Between Affordance and Geometry: 6-DoF Grasp Detection via Implicit Representations

    Zhenyu Jiang, Yifeng Zhu, Maxwell Svetlik +2

    cs.ROcs.AIcs.CVarXiv:2104.01542v22021
  27. NTIRE 2026 Low-light Enhancement: Twilight Cowboy Challenge

    Aleksei Khalin, Egor Ershov, Artyom Panshin +46

    cs.CVarXiv:2608.09782v12026
  28. SelfDoc: Self-Supervised Document Representation Learning

    Peizhao Li, Jiuxiang Gu, Jason Kuen +5

    cs.CVcs.CLarXiv:2106.03331v12021
  29. AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition

    Shunpeng Chen, Jingyi Zhang, Changwei Wang +6

    cs.CVarXiv:2609.04369v12026
  30. Adversarial Robustness vs Model Compression, or Both?

    Shaokai Ye, Kaidi Xu, Sijia Liu +6

    cs.CVcs.CRcs.LGarXiv:1903.12561v52019
  31. Polis: 3D Self-Supervision at City Scale

    Alexander Rusnak, Sophia Kovalenko, Jingru Wang +3

    cs.CVcs.AIcs.LGarXiv:2608.29426v12026
  32. Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models

    Yimeng Zhang, Xin Chen, Jinghan Jia +6

    cs.CVcs.CRarXiv:2405.15234v32024
  33. Taming Diffusion Models for Audio-Driven Co-Speech Gesture Generation

    Lingting Zhu, Xian Liu, Xuanyu Liu +3

    cs.CVcs.SDeess.ASarXiv:2303.09119v22023
  34. HEST-1k: A Dataset for Spatial Transcriptomics and Histology Image Analysis

    Guillaume Jaume, Paul Doucet, Andrew H. Song +8

    cs.CVarXiv:2406.16192v22024
  35. UBnormal: New Benchmark for Supervised Open-Set Video Anomaly Detection

    Andra Acsintoae, Andrei Florescu, Mariana-Iuliana Georgescu +5

    cs.CVcs.LGarXiv:2111.08644v32021
  36. MM-Fi: Multi-Modal Non-Intrusive 4D Human Dataset for Versatile Wireless Sensing

    Jianfei Yang, He Huang, Yunjiao Zhou +6

    eess.SPcs.AIcs.CVarXiv:2305.10345v22023
  37. Learning to Paint With Model-based Deep Reinforcement Learning

    Zhewei Huang, Wen Heng, Shuchang Zhou

    cs.CVcs.AIarXiv:1903.04411v32019
  38. Skeleton-Contrastive 3D Action Representation Learning

    Fida Mohammad Thoker, Hazel Doughty, Cees G. M. Snoek

    cs.CVarXiv:2108.03656v12021
  39. Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

    Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang +2

    cs.CLcs.CVarXiv:2309.06135v32023
  40. Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation

    Nicklas Hansen, Hao Su, Xiaolong Wang

    cs.LGcs.CVcs.ROarXiv:2107.00644v22021
  41. A Review of YOLOv12: Attention-Based Enhancements vs. Previous Versions

    Rahima Khanam, Muhammad Hussain

    cs.CVarXiv:2504.11995v12025
  42. NFAD: Nuisance-Filtered Anomaly Detection Under Distribution Shift

    Dat Cao, Son Nghiem, Phan Nguyen +2

    cs.CVarXiv:2608.29112v12026
  43. RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos

    Wenting Wang, Jiaxin Guo, Wenzhen Dong +3

    cs.CVcs.AIarXiv:2608.29003v12026
  44. LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents

    Boyu Chen, Zhengrong Yue, Siran Chen +4

    cs.CVarXiv:2503.10200v52025
  45. Crop mapping from image time series: deep learning with multi-scale label hierarchies

    Mehmet Ozgur Turkoglu, Stefano D'Aronco, Gregor Perich +4

    cs.CVarXiv:2102.08820v22021
  46. DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving

    Feiyang jia, Lin Liu, Ziying Song +4

    cs.CVcs.ROarXiv:2602.06521v12026
  47. Incremental Learning In Online Scenario

    Jiangpeng He, Runyu Mao, Zeman Shao +1

    cs.CVarXiv:2003.13191v22020
  48. Domain Adaptation for Underwater Image Enhancement

    Zhengyong Wang, Liquan Shen, Mei Yu +3

    cs.CVarXiv:2108.09650v12021
  49. CKD-TransBTS: Clinical Knowledge-Driven Hybrid Transformer with Modality-Correlated Cross-Attention for Brain Tumor Segmentation

    Jianwei Lin, Jiatai Lin, Cheng Lu +12

    eess.IVcs.CVarXiv:2207.07370v12022
  50. SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images

    Zixuan Huang, Mark Boss, Aaryaman Vasishta +2

    cs.CVcs.GRarXiv:2501.04689v12025
  51. Deep Learning Representation using Autoencoder for 3D Shape Retrieval

    Zhuotun Zhu, Xinggang Wang, Song Bai +2

    cs.CVarXiv:1409.7164v12014
  52. TransDeepLab: Convolution-Free Transformer-based DeepLab v3+ for Medical Image Segmentation

    Reza Azad, Moein Heidari, Moein Shariatnia +4

    eess.IVcs.CVcs.LGarXiv:2208.00713v12022
  53. MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

    Youngrae Kim, Qixin Hu, C. -C. Jay Kuo +1

    cs.CVarXiv:2603.12513v12026
  54. RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control

    Teng Li, Guangcong Zheng, Rui Jiang +9

    cs.CVarXiv:2502.10059v22025
  55. BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household Activities

    Yunfan Jiang, Ruohan Zhang, Josiah Wong +7

    cs.ROcs.AIcs.CVarXiv:2503.05652v22025
  56. Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning

    Bozhou Zhang, Nan Song, Xin Jin +1

    cs.ROcs.CVarXiv:2503.14182v12025
  57. MMDocIR: Benchmarking Multimodal Retrieval for Long Documents

    Kuicai Dong, Yujing Chang, Xin Deik Goh +3

    cs.IRcs.AIcs.CLarXiv:2501.08828v32025
  58. Super-resolution Ultrasound Localization Microscopy through Deep Learning

    Ruud J. G. van Sloun, Oren Solomon, Matthew Bruce +4

    eess.SPcs.CVeess.IVarXiv:1804.07661v22018
  59. ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement

    Runhui Huang, Chunwei Wang, Junwei Yang +8

    cs.CVarXiv:2504.01934v22025
  60. CARD: Calibration via Agreement in Reverse Diffusion for Out-of-Domain MRI Segmentation

    Jiaheng Dai, Weidong Guo, Qingbiao Li +4

    cs.CVarXiv:2608.28681v12026