Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,181 to 15,240 of 18,867
AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent Forecasting
Ye Yuan, Xinshuo Weng, Yanglan Ou +1
cs.AIcs.CVcs.LGarXiv:2103.14023v32021From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering
Xinyi Shang, Yi Tang, Jiacheng Cui +9
cs.CVcs.AIcs.LGarXiv:2603.20193v12026What's the Catch? Evaluating Temporal Consistency in Vision-Language Models
Marek Hradil, Danae Sánchez Villegas
cs.CLcs.AIcs.CVarXiv:2608.23474v220262Xplat: Decoupling Geometry and Appearance Modeling for Feed-Forward 3D Gaussian Splatting
Hwasik Jeong, Seungryong Lee, Gyeongjin Kang +4
cs.CVarXiv:2603.21064v32026Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
Jianrui Zhang, Yue Yang, Rohun Tripathi +5
cs.CVcs.AIcs.LGarXiv:2603.18004v12026Synthesized Classifiers for Zero-Shot Learning
Soravit Changpinyo, Wei-Lun Chao, Boqing Gong +1
cs.CVarXiv:1603.00550v32016HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1
cs.CVcs.AIarXiv:2603.18558v22026Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
Yuqing Wang, Chuofan Ma, Zhijie Lin +7
cs.CVarXiv:2603.19232v12026Conditional Convolutions for Instance Segmentation
Zhi Tian, Chunhua Shen, Hao Chen
cs.CVarXiv:2003.05664v42020Common Objects in 3D: Large-Scale Learning and Evaluation of Real-life 3D Category Reconstruction
Jeremy Reizenstein, Roman Shapovalov, Philipp Henzler +3
cs.CVarXiv:2109.00512v12021Matryoshka Gaussian Splatting
Zhilin Guo, Boqiao Zhang, Hakan Aktas +11
cs.CVcs.GRarXiv:2603.19234v22026Autonomous Vehicles that Interact with Pedestrians: A Survey of Theory and Practice
Amir Rasouli, John K. Tsotsos
cs.ROcs.CVcs.HCarXiv:1805.11773v12018Cost-Effective Active Learning for Deep Image Classification
Keze Wang, Dongyu Zhang, Ya Li +2
cs.CVarXiv:1701.03551v12017Gated-SCNN: Gated Shape CNNs for Semantic Segmentation
Towaki Takikawa, David Acuna, Varun Jampani +1
cs.CVcs.LGarXiv:1907.05740v12019Compositional Visual Generation with Composable Diffusion Models
Nan Liu, Shuang Li, Yilun Du +2
cs.CVcs.AIcs.LGarXiv:2206.01714v62022Semantic Audio-Visual Navigation in Continuous Environments
Yichen Zeng, Hebaixu Wang, Meng Liu +4
cs.CVcs.SDarXiv:2603.19660v12026WorldAgents: Can Foundation Image Models be Agents for 3D World Models?
Ziya Erkoç, Angela Dai, Matthias Nießner
cs.CVarXiv:2603.19708v12026Learning-Based View Synthesis for Light Field Cameras
Nima Khademi Kalantari, Ting-Chun Wang, Ravi Ramamoorthi
cs.CVcs.GRarXiv:1609.02974v12016Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
Sangoh Lee, Sangwoo Mo, Wook-Shin Han
cs.ROcs.AIcs.CVarXiv:2608.23478v12026ReLi3D: Relightable Multi-view 3D Reconstruction with Disentangled Illumination
Jan-Niklas Dihlmann, Mark Boss, Simon Donne +3
cs.CVcs.GRarXiv:2603.19753v12026On instabilities of deep learning in image reconstruction - Does AI come at a cost?
Vegard Antun, Francesco Renna, Clarice Poon +2
cs.CVarXiv:1902.05300v12019RetinaFace: Single-stage Dense Face Localisation in the Wild
Jiankang Deng, Jia Guo, Yuxiang Zhou +3
cs.CVarXiv:1905.00641v22019ViZDoom: A Doom-based AI Research Platform for Visual Reinforcement Learning
Michał Kempka, Marek Wydmuch, Grzegorz Runc +2
cs.LGcs.AIcs.CVarXiv:1605.02097v22016From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms
Jiangning Zhang, Haojun Chen, Yong Liu
cs.CVarXiv:2608.24877v12026DECO: Depth-Guided Co-Visibility Reasoning for Low-Altitude UAV Visual Localization
Yibin Ye, Xichao Teng, Shuo Chen +4
cs.CVarXiv:2608.22289v12026VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
Ruoliu Yang, Chu Wu, Caifeng Shan +2
cs.CVarXiv:2603.22285v22026WorldCache: Content-Aware Caching for Accelerated Video World Models
Umair Nawaz, Ahmed Heakl, Ufaq Khan +3
cs.CVcs.AIcs.CLarXiv:2603.22286v12026Asymmetric Contextual Modulation for Infrared Small Target Detection
Yimian Dai, Yiquan Wu, Fei Zhou +1
cs.CVarXiv:2009.14530v12020SyncDreamer: Generating Multiview-consistent Images from a Single-view Image
Yuan Liu, Cheng Lin, Zijiao Zeng +4
cs.CVcs.AIcs.GRarXiv:2309.03453v22023SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
Haoyu Huang, Jinfa Huang, Zhongwei Wan +3
cs.CVcs.CLarXiv:2603.23483v22026Transformer Meets Tracker: Exploiting Temporal Context for Robust Visual Tracking
Ning Wang, Wengang Zhou, Jie Wang +1
cs.CVarXiv:2103.11681v22021STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
Junho Kim, Hosu Lee, James M. Rehg +2
cs.CVcs.AIarXiv:2603.27593v12026ScaleNet: An Unsupervised Representation Learning Method for Limited Information
Huili Huang, M. Mahdi Roozbahani
cs.CVarXiv:2310.02386v12023LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti +9
cs.CVcs.AIcs.LGarXiv:2608.24845v12026Mish: A Self Regularized Non-Monotonic Activation Function
Diganta Misra
cs.LGcs.CVcs.NEarXiv:1908.08681v32019Semantic Segmentation using Adversarial Networks
Pauline Luc, Camille Couprie, Soumith Chintala +1
cs.CVarXiv:1611.08408v12016Genie: Generative Interactive Environments
Jake Bruce, Michael Dennis, Ashley Edwards +22
cs.LGcs.AIcs.CVarXiv:2402.15391v12024Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning
WonJun Moon, Hyun Seok Seong, Jae-Pil Heo
cs.CVcs.LGarXiv:2603.22758v12026Frustratingly Simple Few-Shot Object Detection
Xin Wang, Thomas E. Huang, Trevor Darrell +2
cs.CVarXiv:2003.06957v12020Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models
Wenyue Chen, Wenjue Chen, Peng Li +6
cs.CVarXiv:2603.22782v22026SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM
Chuanrui Zhang, Minghan Qin, Yuang Wang +3
cs.CVcs.GRcs.ROarXiv:2603.23386v12026UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation
Jiaying Lin, Dan Xu
cs.CVarXiv:2603.23478v12026PMT: Plain Mask Transformer for Image and Video Segmentation with Frozen Vision Encoders
Niccolò Cavagnero, Narges Norouzi, Gijs Dubbelman +1
cs.CVarXiv:2603.25398v12026Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos
Abdullah Hamdi, Changchun Yang, Xin Gao
eess.IVcs.CVcs.HCarXiv:2603.25645v32026ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
Haonan Han, Jiancheng Huang, Xiaopeng Sun +7
cs.CVcs.AIarXiv:2603.25823v12026Unsupervised Label Noise Modeling and Loss Correction
Eric Arazo, Diego Ortego, Paul Albert +2
cs.CVarXiv:1904.11238v22019PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning
Shaoxuan Li, Zhixuan Zhao, Hanze Deng +9
cs.CVcs.AIcs.CLarXiv:2603.26653v12026TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets
Zhixuan Liu, Peter Schaldenbrand, Yijun Li +5
cs.CVarXiv:2603.27520v12026Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal
Kazuma Ikeda, Ryosei Hara, Rokuto Nagata +6
cs.CVarXiv:2603.28224v12026WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
Junjie Zhou, Ke Mei, Lei Li +3
cs.CVcs.CLcs.IRarXiv:2608.24053v12026Summaries:한국어Implicit Neural Representation Facilitates Unified Universal Vision Encoding
Matthew Gwilliam, Xiao Wang, Xuefeng Hu +1
cs.CVarXiv:2601.14256v12026Multi-digit Number Recognition from Street View Imagery using Deep Convolutional Neural Networks
Ian J. Goodfellow, Yaroslav Bulatov, Julian Ibarz +2
cs.CVarXiv:1312.6082v42013Summaries:한국어Visual Memory Injection Attacks for Multi-Turn Conversations
Christian Schlarmann, Matthias Hein
cs.CVcs.LGarXiv:2602.15927v12026PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval
Tianyi Xu, Rong Shan, Junjie Wu +11
cs.IRcs.AIcs.CVarXiv:2603.01493v22026Global Filter Networks for Image Classification
Yongming Rao, Wenliang Zhao, Zheng Zhu +2
cs.CVcs.AIcs.LGarXiv:2107.00645v22021Salient Object Detection in the Deep Learning Era: An In-Depth Survey
Wenguan Wang, Qiuxia Lai, Huazhu Fu +3
cs.CVarXiv:1904.09146v52019Multiple Instance Learning: A Survey of Problem Characteristics and Applications
Marc-André Carbonneau, Veronika Cheplygina, Eric Granger +1
cs.CVcs.AIcs.IRarXiv:1612.03365v12016AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
Haozhe Qi, Kevin Qu, Mahdi Rad +3
cs.CVcs.AIarXiv:2603.28696v12026TransHands: Repurposing Human Pose Encoders as Hand Pose Encoders
Milo Piccioli, Gianluca Amprimo, Claudia Ferraris +1
cs.CVcs.AIarXiv:2608.22341v12026Deep Photo Style Transfer
Fujun Luan, Sylvain Paris, Eli Shechtman +1
cs.CVarXiv:1703.07511v32017