Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,181 to 15,240 of 18,867

  1. AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent Forecasting

    Ye Yuan, Xinshuo Weng, Yanglan Ou +1

    cs.AIcs.CVcs.LGarXiv:2103.14023v32021
  2. From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering

    Xinyi Shang, Yi Tang, Jiacheng Cui +9

    cs.CVcs.AIcs.LGarXiv:2603.20193v12026
  3. What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

    Marek Hradil, Danae Sánchez Villegas

    cs.CLcs.AIcs.CVarXiv:2608.23474v22026
  4. 2Xplat: Decoupling Geometry and Appearance Modeling for Feed-Forward 3D Gaussian Splatting

    Hwasik Jeong, Seungryong Lee, Gyeongjin Kang +4

    cs.CVarXiv:2603.21064v32026
  5. Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

    Jianrui Zhang, Yue Yang, Rohun Tripathi +5

    cs.CVcs.AIcs.LGarXiv:2603.18004v12026
  6. Synthesized Classifiers for Zero-Shot Learning

    Soravit Changpinyo, Wei-Lun Chao, Boqing Gong +1

    cs.CVarXiv:1603.00550v32016
  7. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1

    cs.CVcs.AIarXiv:2603.18558v22026
  8. Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

    Yuqing Wang, Chuofan Ma, Zhijie Lin +7

    cs.CVarXiv:2603.19232v12026
  9. Conditional Convolutions for Instance Segmentation

    Zhi Tian, Chunhua Shen, Hao Chen

    cs.CVarXiv:2003.05664v42020
  10. Common Objects in 3D: Large-Scale Learning and Evaluation of Real-life 3D Category Reconstruction

    Jeremy Reizenstein, Roman Shapovalov, Philipp Henzler +3

    cs.CVarXiv:2109.00512v12021
  11. Matryoshka Gaussian Splatting

    Zhilin Guo, Boqiao Zhang, Hakan Aktas +11

    cs.CVcs.GRarXiv:2603.19234v22026
  12. Autonomous Vehicles that Interact with Pedestrians: A Survey of Theory and Practice

    Amir Rasouli, John K. Tsotsos

    cs.ROcs.CVcs.HCarXiv:1805.11773v12018
  13. Cost-Effective Active Learning for Deep Image Classification

    Keze Wang, Dongyu Zhang, Ya Li +2

    cs.CVarXiv:1701.03551v12017
  14. Gated-SCNN: Gated Shape CNNs for Semantic Segmentation

    Towaki Takikawa, David Acuna, Varun Jampani +1

    cs.CVcs.LGarXiv:1907.05740v12019
  15. Compositional Visual Generation with Composable Diffusion Models

    Nan Liu, Shuang Li, Yilun Du +2

    cs.CVcs.AIcs.LGarXiv:2206.01714v62022
  16. Semantic Audio-Visual Navigation in Continuous Environments

    Yichen Zeng, Hebaixu Wang, Meng Liu +4

    cs.CVcs.SDarXiv:2603.19660v12026
  17. WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

    Ziya Erkoç, Angela Dai, Matthias Nießner

    cs.CVarXiv:2603.19708v12026
  18. Learning-Based View Synthesis for Light Field Cameras

    Nima Khademi Kalantari, Ting-Chun Wang, Ravi Ramamoorthi

    cs.CVcs.GRarXiv:1609.02974v12016
  19. Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

    Sangoh Lee, Sangwoo Mo, Wook-Shin Han

    cs.ROcs.AIcs.CVarXiv:2608.23478v12026
  20. ReLi3D: Relightable Multi-view 3D Reconstruction with Disentangled Illumination

    Jan-Niklas Dihlmann, Mark Boss, Simon Donne +3

    cs.CVcs.GRarXiv:2603.19753v12026
  21. On instabilities of deep learning in image reconstruction - Does AI come at a cost?

    Vegard Antun, Francesco Renna, Clarice Poon +2

    cs.CVarXiv:1902.05300v12019
  22. RetinaFace: Single-stage Dense Face Localisation in the Wild

    Jiankang Deng, Jia Guo, Yuxiang Zhou +3

    cs.CVarXiv:1905.00641v22019
  23. ViZDoom: A Doom-based AI Research Platform for Visual Reinforcement Learning

    Michał Kempka, Marek Wydmuch, Grzegorz Runc +2

    cs.LGcs.AIcs.CVarXiv:1605.02097v22016
  24. From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

    Jiangning Zhang, Haojun Chen, Yong Liu

    cs.CVarXiv:2608.24877v12026
  25. DECO: Depth-Guided Co-Visibility Reasoning for Low-Altitude UAV Visual Localization

    Yibin Ye, Xichao Teng, Shuo Chen +4

    cs.CVarXiv:2608.22289v12026
  26. VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

    Ruoliu Yang, Chu Wu, Caifeng Shan +2

    cs.CVarXiv:2603.22285v22026
  27. WorldCache: Content-Aware Caching for Accelerated Video World Models

    Umair Nawaz, Ahmed Heakl, Ufaq Khan +3

    cs.CVcs.AIcs.CLarXiv:2603.22286v12026
  28. Asymmetric Contextual Modulation for Infrared Small Target Detection

    Yimian Dai, Yiquan Wu, Fei Zhou +1

    cs.CVarXiv:2009.14530v12020
  29. SyncDreamer: Generating Multiview-consistent Images from a Single-view Image

    Yuan Liu, Cheng Lin, Zijiao Zeng +4

    cs.CVcs.AIcs.GRarXiv:2309.03453v22023
  30. SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

    Haoyu Huang, Jinfa Huang, Zhongwei Wan +3

    cs.CVcs.CLarXiv:2603.23483v22026
  31. Transformer Meets Tracker: Exploiting Temporal Context for Robust Visual Tracking

    Ning Wang, Wengang Zhou, Jie Wang +1

    cs.CVarXiv:2103.11681v22021
  32. STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

    Junho Kim, Hosu Lee, James M. Rehg +2

    cs.CVcs.AIarXiv:2603.27593v12026
  33. ScaleNet: An Unsupervised Representation Learning Method for Limited Information

    Huili Huang, M. Mahdi Roozbahani

    cs.CVarXiv:2310.02386v12023
  34. LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

    Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti +9

    cs.CVcs.AIcs.LGarXiv:2608.24845v12026
  35. Mish: A Self Regularized Non-Monotonic Activation Function

    Diganta Misra

    cs.LGcs.CVcs.NEarXiv:1908.08681v32019
  36. Semantic Segmentation using Adversarial Networks

    Pauline Luc, Camille Couprie, Soumith Chintala +1

    cs.CVarXiv:1611.08408v12016
  37. Genie: Generative Interactive Environments

    Jake Bruce, Michael Dennis, Ashley Edwards +22

    cs.LGcs.AIcs.CVarXiv:2402.15391v12024
  38. Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning

    WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

    cs.CVcs.LGarXiv:2603.22758v12026
  39. Frustratingly Simple Few-Shot Object Detection

    Xin Wang, Thomas E. Huang, Trevor Darrell +2

    cs.CVarXiv:2003.06957v12020
  40. Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

    Wenyue Chen, Wenjue Chen, Peng Li +6

    cs.CVarXiv:2603.22782v22026
  41. SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

    Chuanrui Zhang, Minghan Qin, Yuang Wang +3

    cs.CVcs.GRcs.ROarXiv:2603.23386v12026
  42. UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

    Jiaying Lin, Dan Xu

    cs.CVarXiv:2603.23478v12026
  43. PMT: Plain Mask Transformer for Image and Video Segmentation with Frozen Vision Encoders

    Niccolò Cavagnero, Narges Norouzi, Gijs Dubbelman +1

    cs.CVarXiv:2603.25398v12026
  44. Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

    Abdullah Hamdi, Changchun Yang, Xin Gao

    eess.IVcs.CVcs.HCarXiv:2603.25645v32026
  45. ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

    Haonan Han, Jiancheng Huang, Xiaopeng Sun +7

    cs.CVcs.AIarXiv:2603.25823v12026
  46. Unsupervised Label Noise Modeling and Loss Correction

    Eric Arazo, Diego Ortego, Paul Albert +2

    cs.CVarXiv:1904.11238v22019
  47. PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning

    Shaoxuan Li, Zhixuan Zhao, Hanze Deng +9

    cs.CVcs.AIcs.CLarXiv:2603.26653v12026
  48. TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets

    Zhixuan Liu, Peter Schaldenbrand, Yijun Li +5

    cs.CVarXiv:2603.27520v12026
  49. Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal

    Kazuma Ikeda, Ryosei Hara, Rokuto Nagata +6

    cs.CVarXiv:2603.28224v12026
  50. WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

    Junjie Zhou, Ke Mei, Lei Li +3

    cs.CVcs.CLcs.IRarXiv:2608.24053v12026
    Summaries:한국어
  51. Implicit Neural Representation Facilitates Unified Universal Vision Encoding

    Matthew Gwilliam, Xiao Wang, Xuefeng Hu +1

    cs.CVarXiv:2601.14256v12026
  52. Multi-digit Number Recognition from Street View Imagery using Deep Convolutional Neural Networks

    Ian J. Goodfellow, Yaroslav Bulatov, Julian Ibarz +2

    cs.CVarXiv:1312.6082v42013
    Summaries:한국어
  53. Visual Memory Injection Attacks for Multi-Turn Conversations

    Christian Schlarmann, Matthias Hein

    cs.CVcs.LGarXiv:2602.15927v12026
  54. PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

    Tianyi Xu, Rong Shan, Junjie Wu +11

    cs.IRcs.AIcs.CVarXiv:2603.01493v22026
  55. Global Filter Networks for Image Classification

    Yongming Rao, Wenliang Zhao, Zheng Zhu +2

    cs.CVcs.AIcs.LGarXiv:2107.00645v22021
  56. Salient Object Detection in the Deep Learning Era: An In-Depth Survey

    Wenguan Wang, Qiuxia Lai, Huazhu Fu +3

    cs.CVarXiv:1904.09146v52019
  57. Multiple Instance Learning: A Survey of Problem Characteristics and Applications

    Marc-André Carbonneau, Veronika Cheplygina, Eric Granger +1

    cs.CVcs.AIcs.IRarXiv:1612.03365v12016
  58. AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

    Haozhe Qi, Kevin Qu, Mahdi Rad +3

    cs.CVcs.AIarXiv:2603.28696v12026
  59. TransHands: Repurposing Human Pose Encoders as Hand Pose Encoders

    Milo Piccioli, Gianluca Amprimo, Claudia Ferraris +1

    cs.CVcs.AIarXiv:2608.22341v12026
  60. Deep Photo Style Transfer

    Fujun Luan, Sylvain Paris, Eli Shechtman +1

    cs.CVarXiv:1703.07511v32017