Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,301 to 15,360 of 18,839

  1. UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models

    Lars Osterberg, Maggie Wang, Mac Schwager

    cs.ROcs.CVarXiv:2608.22869v12026
  2. SemanticMoments: Training-Free Motion Similarity via Third Moment Features

    Saar Huberman, Kfir Goldberg, Or Patashnik +2

    cs.CVarXiv:2602.09146v12026
  3. Multimodal Fact-Level Attribution for Verifiable Reasoning

    David Wan, Han Wang, Ziyang Wang +3

    cs.CLcs.AIcs.CVarXiv:2602.11509v22026
  4. Exploring Models and Data for Image Question Answering

    Mengye Ren, Ryan Kiros, Richard Zemel

    cs.LGcs.AIcs.CLarXiv:1505.02074v42015
  5. LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models

    Chan Hee Song, Jiaman Wu, Clayton Washington +3

    cs.AIcs.CLcs.CVarXiv:2212.04088v32022
  6. SAW-Bench: Learning Situated Awareness in the Real World

    Chuhan Li, Rilyn Han, Joy Hsu +5

    cs.CVarXiv:2602.16682v22026
  7. MMA: Multimodal Memory Agent

    Yihao Lu, Wanru Cheng, Zeyu Zhang +1

    cs.CVarXiv:2602.16493v12026
  8. Three dimensional Deep Learning approach for remote sensing image classification

    Amina Ben Hamida, A Benoit, Patrick Lambert +1

    cs.CVcs.LGstat.MLarXiv:1806.05824v12018
  9. Expert Gate: Lifelong Learning with a Network of Experts

    Rahaf Aljundi, Punarjay Chakravarty, Tinne Tuytelaars

    cs.CVcs.AIstat.MLarXiv:1611.06194v22016
  10. MultiNet: Real-time Joint Semantic Reasoning for Autonomous Driving

    Marvin Teichmann, Michael Weber, Marius Zoellner +2

    cs.CVcs.ROarXiv:1612.07695v22016
  11. GEBench: Benchmarking Image Generation Models as GUI Environments

    Haodong Li, Jingwei Wu, Quan Sun +14

    cs.AIcs.CVarXiv:2602.09007v22026
  12. VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts

    Hangbo Bao, Wenhui Wang, Li Dong +5

    cs.CVcs.CLcs.LGarXiv:2111.02358v22021
  13. Uncertainty-Aware Vision-Language Segmentation for Medical Imaging

    Aryan Das, Tanishq Rachamalla, Koushik Biswas +2

    cs.CVcs.LGarXiv:2602.14498v22026
  14. Efficient Text-Guided Convolutional Adapter for the Diffusion Model

    Aryan Das, Koushik Biswas, Swalpa Kumar Roy +2

    cs.CVarXiv:2602.14514v22026
  15. Monocular Mesh Recovery and Body Measurement of Female Saanen Goats

    Bo Jin, Shichao Zhao, Jin Lyu +5

    cs.CVarXiv:2602.19896v12026
  16. A Downsampled Variant of ImageNet as an Alternative to the CIFAR datasets

    Patryk Chrabaszcz, Ilya Loshchilov, Frank Hutter

    cs.CVcs.LGarXiv:1707.08819v32017
  17. OmniOCR: Generalist OCR for Ethnic Minority Languages

    Bonan Liu, Zeyu Zhang, Bingbing Meng +5

    cs.CVarXiv:2602.21042v12026
  18. Deep Video Portraits

    Hyeongwoo Kim, Pablo Garrido, Ayush Tewari +7

    cs.CVcs.AIcs.GRarXiv:1805.11714v12018
  19. Finding Tiny Faces

    Peiyun Hu, Deva Ramanan

    cs.CVarXiv:1612.04402v22016
  20. Video Action Transformer Network

    Rohit Girdhar, João Carreira, Carl Doersch +1

    cs.CVarXiv:1812.02707v22018
  21. Picking Winning Tickets Before Training by Preserving Gradient Flow

    Chaoqi Wang, Guodong Zhang, Roger Grosse

    cs.LGcs.CVstat.MLarXiv:2002.07376v22020
  22. When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains

    Ahmadreza Jeddi, Kimia Shaban, Negin Baghbanzadeh +4

    cs.CVarXiv:2603.01301v12026
  23. Open-Sora: Democratizing Efficient Video Production for All

    Zangwei Zheng, Xiangyu Peng, Tianji Yang +6

    cs.CVarXiv:2412.20404v12024
  24. Boundary loss for highly unbalanced segmentation

    Hoel Kervadec, Jihene Bouchtiba, Christian Desrosiers +3

    eess.IVcs.CVarXiv:1812.07032v42018
  25. Large-Scale Study of Curiosity-Driven Learning

    Yuri Burda, Harri Edwards, Deepak Pathak +3

    cs.LGcs.AIcs.CVarXiv:1808.04355v12018
  26. Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

    Christian Simon, Masato Ishii, Wei-Yao Wang +8

    cs.CVcs.AIarXiv:2602.20981v32026
  27. DiffusionDet: Diffusion Model for Object Detection

    Shoufa Chen, Peize Sun, Yibing Song +1

    cs.CVarXiv:2211.09788v22022
  28. Attentional Local Contrast Networks for Infrared Small Target Detection

    Yimian Dai, Yiquan Wu, Fei Zhou +1

    cs.CVarXiv:2012.08573v12020
  29. EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents

    Wenjia Wang, Liang Pan, Huaijin Pi +8

    cs.CVarXiv:2602.23205v22026
  30. BenthicDINO: Physics-Informed Self-Distillation for View-Invariant Side-Scan Sonar Representations

    Taqi Hamoda, Hayat Rajani, Nuno Gracias

    cs.CVcs.AIcs.LGarXiv:2608.23215v12026
  31. Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving

    Jiangxin Sun, Feng Xue, Teng Long +4

    cs.CVcs.AIcs.ROarXiv:2602.23259v12026
  32. CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering

    Yuyang Hong, Jiaqi Gu, Yujin Lou +7

    cs.CVarXiv:2602.23952v12026
  33. SkipNet: Learning Dynamic Routing in Convolutional Networks

    Xin Wang, Fisher Yu, Zi-Yi Dou +2

    cs.CVarXiv:1711.09485v22017
  34. NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

    Tianlin Pan, Jiayi Dai, Chenpu Yuan +7

    cs.CVarXiv:2603.02802v12026
  35. ParallelWorld: Test-Time Scaling for Embodied Reasoning

    Min Chen, Shengjun Zhang, Yuxin Li +4

    cs.AIcs.CVarXiv:2608.22971v12026
  36. Embedding Watermarks into Deep Neural Networks

    Yusuke Uchida, Yuki Nagai, Shigeyuki Sakazawa +1

    cs.CVarXiv:1701.04082v22017
  37. Zero-Shot Image Restoration Using Denoising Diffusion Null-Space Model

    Yinhuai Wang, Jiwen Yu, Jian Zhang

    cs.CVarXiv:2212.00490v22022
  38. Can Vision-Language Models Solve the Shell Game?

    Tiedong Liu, Wee Sun Lee

    cs.CVcs.CLarXiv:2603.08436v12026
  39. Residual Non-local Attention Networks for Image Restoration

    Yulun Zhang, Kunpeng Li, Kai Li +2

    cs.CVarXiv:1903.10082v12019
  40. Hidden Trigger Backdoor Attacks

    Aniruddha Saha, Akshayvarun Subramanya, Hamed Pirsiavash

    cs.CVarXiv:1910.00033v22019
  41. Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports

    Yuchen Yang, Yuqing Shao, Duxiu Huang +11

    cs.CVarXiv:2603.09896v12026
  42. Hard Negative Mixing for Contrastive Learning

    Yannis Kalantidis, Mert Bulent Sariyildiz, Noe Pion +2

    cs.CVcs.LGarXiv:2010.01028v22020
  43. OSMDA: OpenStreetMap-based Domain Adaptation for Remote Sensing VLMs

    Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi +3

    cs.CVcs.LGarXiv:2603.11804v32026
  44. EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

    Shiyuan Yang, Ruihuang Li, Jiale Tao +3

    cs.CVarXiv:2603.06014v12026
  45. Hyperspectral pansharpening: a review

    Laetitia Loncan, Luis B. Almeida, José M. Bioucas-Dias +12

    cs.CVphysics.data-anstat.AParXiv:1504.04531v12015
  46. Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner

    Jieke Wang, Tiancheng Shen, Yibo Yang +1

    cs.CVarXiv:2608.23268v12026
  47. Variational Flow Maps: Make Some Noise for One-Step Conditional Generation

    Abbas Mammadov, So Takao, Bohan Chen +4

    cs.CVcs.LGstat.MLarXiv:2603.07276v12026
  48. HybridStitch: Pixel and Timestep Level Model Stitching for Diffusion Acceleration

    Desen Sun, Jason Hon, Jintao Zhang +1

    cs.CVcs.AIarXiv:2603.07815v12026
  49. CNN-SLAM: Real-time dense monocular SLAM with learned depth prediction

    Keisuke Tateno, Federico Tombari, Iro Laina +1

    cs.CVarXiv:1704.03489v12017
  50. Are Video Reasoning Models Ready to Go Outside?

    Yangfan He, Changgyu Boo, Jaehong Yoon

    cs.CVcs.AIarXiv:2603.10652v32026
  51. Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

    Lu Wang, Zhuoran Jin, Yupu Hao +4

    cs.CVcs.AIcs.CLarXiv:2603.11896v12026
  52. VideoGPT: Video Generation using VQ-VAE and Transformers

    Wilson Yan, Yunzhi Zhang, Pieter Abbeel +1

    cs.CVcs.LGarXiv:2104.10157v22021
  53. LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition

    Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu

    cs.CVarXiv:2603.17965v12026
  54. Octree Generating Networks: Efficient Convolutional Architectures for High-resolution 3D Outputs

    Maxim Tatarchenko, Alexey Dosovitskiy, Thomas Brox

    cs.CVarXiv:1703.09438v32017
  55. FINER: MLLMs Hallucinate under Fine-grained Negative Queries

    Rui Xiao, Sanghwan Kim, Yongqin Xian +2

    cs.CVcs.AIarXiv:2603.17662v12026
  56. Self-supervised Equivariant Attention Mechanism for Weakly Supervised Semantic Segmentation

    Yude Wang, Jie Zhang, Meina Kan +2

    cs.CVarXiv:2004.04581v12020
  57. Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering

    Huijuan Xu, Kate Saenko

    cs.CVcs.AIcs.CLarXiv:1511.05234v22015
  58. Video Summarization with Long Short-term Memory

    Ke Zhang, Wei-Lun Chao, Fei Sha +1

    cs.CVcs.LGarXiv:1605.08110v22016
  59. VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

    Daeun Lee, Shoubin Yu, Yue Zhang +1

    cs.CVcs.AIarXiv:2603.14659v22026
  60. GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering

    Xincheng Shuai, Ziye Li, Henghui Ding +1

    cs.CVarXiv:2603.15616v12026