Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,301 to 15,360 of 18,839
UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models
Lars Osterberg, Maggie Wang, Mac Schwager
cs.ROcs.CVarXiv:2608.22869v12026SemanticMoments: Training-Free Motion Similarity via Third Moment Features
Saar Huberman, Kfir Goldberg, Or Patashnik +2
cs.CVarXiv:2602.09146v12026Multimodal Fact-Level Attribution for Verifiable Reasoning
David Wan, Han Wang, Ziyang Wang +3
cs.CLcs.AIcs.CVarXiv:2602.11509v22026Exploring Models and Data for Image Question Answering
Mengye Ren, Ryan Kiros, Richard Zemel
cs.LGcs.AIcs.CLarXiv:1505.02074v42015LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models
Chan Hee Song, Jiaman Wu, Clayton Washington +3
cs.AIcs.CLcs.CVarXiv:2212.04088v32022SAW-Bench: Learning Situated Awareness in the Real World
Chuhan Li, Rilyn Han, Joy Hsu +5
cs.CVarXiv:2602.16682v22026MMA: Multimodal Memory Agent
Yihao Lu, Wanru Cheng, Zeyu Zhang +1
cs.CVarXiv:2602.16493v12026Three dimensional Deep Learning approach for remote sensing image classification
Amina Ben Hamida, A Benoit, Patrick Lambert +1
cs.CVcs.LGstat.MLarXiv:1806.05824v12018Expert Gate: Lifelong Learning with a Network of Experts
Rahaf Aljundi, Punarjay Chakravarty, Tinne Tuytelaars
cs.CVcs.AIstat.MLarXiv:1611.06194v22016MultiNet: Real-time Joint Semantic Reasoning for Autonomous Driving
Marvin Teichmann, Michael Weber, Marius Zoellner +2
cs.CVcs.ROarXiv:1612.07695v22016GEBench: Benchmarking Image Generation Models as GUI Environments
Haodong Li, Jingwei Wu, Quan Sun +14
cs.AIcs.CVarXiv:2602.09007v22026VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts
Hangbo Bao, Wenhui Wang, Li Dong +5
cs.CVcs.CLcs.LGarXiv:2111.02358v22021Uncertainty-Aware Vision-Language Segmentation for Medical Imaging
Aryan Das, Tanishq Rachamalla, Koushik Biswas +2
cs.CVcs.LGarXiv:2602.14498v22026Efficient Text-Guided Convolutional Adapter for the Diffusion Model
Aryan Das, Koushik Biswas, Swalpa Kumar Roy +2
cs.CVarXiv:2602.14514v22026Monocular Mesh Recovery and Body Measurement of Female Saanen Goats
Bo Jin, Shichao Zhao, Jin Lyu +5
cs.CVarXiv:2602.19896v12026A Downsampled Variant of ImageNet as an Alternative to the CIFAR datasets
Patryk Chrabaszcz, Ilya Loshchilov, Frank Hutter
cs.CVcs.LGarXiv:1707.08819v32017OmniOCR: Generalist OCR for Ethnic Minority Languages
Bonan Liu, Zeyu Zhang, Bingbing Meng +5
cs.CVarXiv:2602.21042v12026Deep Video Portraits
Hyeongwoo Kim, Pablo Garrido, Ayush Tewari +7
cs.CVcs.AIcs.GRarXiv:1805.11714v12018Finding Tiny Faces
Peiyun Hu, Deva Ramanan
cs.CVarXiv:1612.04402v22016Video Action Transformer Network
Rohit Girdhar, João Carreira, Carl Doersch +1
cs.CVarXiv:1812.02707v22018Picking Winning Tickets Before Training by Preserving Gradient Flow
Chaoqi Wang, Guodong Zhang, Roger Grosse
cs.LGcs.CVstat.MLarXiv:2002.07376v22020When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
Ahmadreza Jeddi, Kimia Shaban, Negin Baghbanzadeh +4
cs.CVarXiv:2603.01301v12026Open-Sora: Democratizing Efficient Video Production for All
Zangwei Zheng, Xiangyu Peng, Tianji Yang +6
cs.CVarXiv:2412.20404v12024Boundary loss for highly unbalanced segmentation
Hoel Kervadec, Jihene Bouchtiba, Christian Desrosiers +3
eess.IVcs.CVarXiv:1812.07032v42018Large-Scale Study of Curiosity-Driven Learning
Yuri Burda, Harri Edwards, Deepak Pathak +3
cs.LGcs.AIcs.CVarXiv:1808.04355v12018Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models
Christian Simon, Masato Ishii, Wei-Yao Wang +8
cs.CVcs.AIarXiv:2602.20981v32026DiffusionDet: Diffusion Model for Object Detection
Shoufa Chen, Peize Sun, Yibing Song +1
cs.CVarXiv:2211.09788v22022Attentional Local Contrast Networks for Infrared Small Target Detection
Yimian Dai, Yiquan Wu, Fei Zhou +1
cs.CVarXiv:2012.08573v12020EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents
Wenjia Wang, Liang Pan, Huaijin Pi +8
cs.CVarXiv:2602.23205v22026BenthicDINO: Physics-Informed Self-Distillation for View-Invariant Side-Scan Sonar Representations
Taqi Hamoda, Hayat Rajani, Nuno Gracias
cs.CVcs.AIcs.LGarXiv:2608.23215v12026Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving
Jiangxin Sun, Feng Xue, Teng Long +4
cs.CVcs.AIcs.ROarXiv:2602.23259v12026CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
Yuyang Hong, Jiaqi Gu, Yujin Lou +7
cs.CVarXiv:2602.23952v12026SkipNet: Learning Dynamic Routing in Convolutional Networks
Xin Wang, Fisher Yu, Zi-Yi Dou +2
cs.CVarXiv:1711.09485v22017NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing
Tianlin Pan, Jiayi Dai, Chenpu Yuan +7
cs.CVarXiv:2603.02802v12026ParallelWorld: Test-Time Scaling for Embodied Reasoning
Min Chen, Shengjun Zhang, Yuxin Li +4
cs.AIcs.CVarXiv:2608.22971v12026Embedding Watermarks into Deep Neural Networks
Yusuke Uchida, Yuki Nagai, Shigeyuki Sakazawa +1
cs.CVarXiv:1701.04082v22017Zero-Shot Image Restoration Using Denoising Diffusion Null-Space Model
Yinhuai Wang, Jiwen Yu, Jian Zhang
cs.CVarXiv:2212.00490v22022Can Vision-Language Models Solve the Shell Game?
Tiedong Liu, Wee Sun Lee
cs.CVcs.CLarXiv:2603.08436v12026Residual Non-local Attention Networks for Image Restoration
Yulun Zhang, Kunpeng Li, Kai Li +2
cs.CVarXiv:1903.10082v12019Hidden Trigger Backdoor Attacks
Aniruddha Saha, Akshayvarun Subramanya, Hamed Pirsiavash
cs.CVarXiv:1910.00033v22019Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports
Yuchen Yang, Yuqing Shao, Duxiu Huang +11
cs.CVarXiv:2603.09896v12026Hard Negative Mixing for Contrastive Learning
Yannis Kalantidis, Mert Bulent Sariyildiz, Noe Pion +2
cs.CVcs.LGarXiv:2010.01028v22020OSMDA: OpenStreetMap-based Domain Adaptation for Remote Sensing VLMs
Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi +3
cs.CVcs.LGarXiv:2603.11804v32026EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation
Shiyuan Yang, Ruihuang Li, Jiale Tao +3
cs.CVarXiv:2603.06014v12026Hyperspectral pansharpening: a review
Laetitia Loncan, Luis B. Almeida, José M. Bioucas-Dias +12
cs.CVphysics.data-anstat.AParXiv:1504.04531v12015Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner
Jieke Wang, Tiancheng Shen, Yibo Yang +1
cs.CVarXiv:2608.23268v12026Variational Flow Maps: Make Some Noise for One-Step Conditional Generation
Abbas Mammadov, So Takao, Bohan Chen +4
cs.CVcs.LGstat.MLarXiv:2603.07276v12026HybridStitch: Pixel and Timestep Level Model Stitching for Diffusion Acceleration
Desen Sun, Jason Hon, Jintao Zhang +1
cs.CVcs.AIarXiv:2603.07815v12026CNN-SLAM: Real-time dense monocular SLAM with learned depth prediction
Keisuke Tateno, Federico Tombari, Iro Laina +1
cs.CVarXiv:1704.03489v12017Are Video Reasoning Models Ready to Go Outside?
Yangfan He, Changgyu Boo, Jaehong Yoon
cs.CVcs.AIarXiv:2603.10652v32026Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
Lu Wang, Zhuoran Jin, Yupu Hao +4
cs.CVcs.AIcs.CLarXiv:2603.11896v12026VideoGPT: Video Generation using VQ-VAE and Transformers
Wilson Yan, Yunzhi Zhang, Pieter Abbeel +1
cs.CVcs.LGarXiv:2104.10157v22021LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition
Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu
cs.CVarXiv:2603.17965v12026Octree Generating Networks: Efficient Convolutional Architectures for High-resolution 3D Outputs
Maxim Tatarchenko, Alexey Dosovitskiy, Thomas Brox
cs.CVarXiv:1703.09438v32017FINER: MLLMs Hallucinate under Fine-grained Negative Queries
Rui Xiao, Sanghwan Kim, Yongqin Xian +2
cs.CVcs.AIarXiv:2603.17662v12026Self-supervised Equivariant Attention Mechanism for Weakly Supervised Semantic Segmentation
Yude Wang, Jie Zhang, Meina Kan +2
cs.CVarXiv:2004.04581v12020Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering
Huijuan Xu, Kate Saenko
cs.CVcs.AIcs.CLarXiv:1511.05234v22015Video Summarization with Long Short-term Memory
Ke Zhang, Wei-Lun Chao, Fei Sha +1
cs.CVcs.LGarXiv:1605.08110v22016VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
Daeun Lee, Shoubin Yu, Yue Zhang +1
cs.CVcs.AIarXiv:2603.14659v22026GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
Xincheng Shuai, Ziye Li, Henghui Ding +1
cs.CVarXiv:2603.15616v12026