Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,841 to 18,900 of 18,959

  1. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20

    cs.CVcs.CLarXiv:2607.24904v12026
  2. Trajectory-aware Cross-view Geo-localization with Sequential Observations

    Tianyi Gao, Jiayu Lin, Danielle Beaulieu +1

    cs.CVarXiv:2607.15491v12026
  3. VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

    Haodong Li, Tianfei Ren, Xiaoxiao Ma +25

    cs.CVcs.AIarXiv:2607.27380v22026
  4. FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

    Hao Liu, Chenghuan Huang, Ye Huang +7

    cs.CVarXiv:2607.16190v12026
  5. An Exam for Active Observers

    Jiarui Zhang, Muzi Tao, Shangshang Wang +3

    cs.CVcs.AIcs.CLarXiv:2607.16165v12026
  6. Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

    Zishuo Li, Bowen Yang, Changtao Miao +29

    cs.ROcs.CVarXiv:2607.14183v22026
  7. TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

    Hengyi Xie, Chenfei Yao, Xianjin Wu +7

    cs.CVcs.ROarXiv:2607.27205v12026
  8. Can Multimodal Large Language Models Understand OCT?

    Baochen Fu, Wenzhi Deng, Baihao Jin +5

    cs.CVcs.CLarXiv:2607.16609v12026
  9. Dataset Distillation by Influence Matching

    Haoru Tan, Wang Wang, Sitong Wu +5

    cs.CVarXiv:2607.16859v12026
  10. MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

    Yingying Fan, Penghui Du, Leyan Zhu +10

    cs.CVcs.AIarXiv:2608.14015v12026
  11. Secret-Stego Dissimilarity as a Design Axis: Invertible Coverless Image Steganography with Diffusion Models

    Hongxin Xu, Jianping Mei, Can Wang +1

    eess.IVcs.AIcs.CRarXiv:2608.13597v12026
  12. Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

    Jiaang Li, Chengzu Li, Zhaochong An +4

    cs.CVarXiv:2607.26326v12026
  13. Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels

    Vadym Vilhurin, Volodymyr Sydorskyi, Andrii Shevtsov

    cs.SDcs.AIcs.CVarXiv:2608.14287v12026
  14. DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack

    Hoseong Tae, Jong-Seok Lee

    cs.CVcs.LGarXiv:2608.03207v12026
  15. Articulated Object Reconstruction from Rest-State Observation

    Daeun Lee, Jaeah Lee, Woosung Kim +2

    cs.CVcs.ROarXiv:2607.27749v12026
  16. FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds

    Kapil Wanaskar, Gaytri Jena, Aman Chadha +3

    cs.AIcs.CVcs.LGarXiv:2608.01049v12026
  17. GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

    Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo +2

    cs.CVarXiv:2608.02315v12026
  18. DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

    Tongsheng Ding, Zhen Luo, Yixuan Yang +4

    cs.CVarXiv:2608.00486v12026
  19. SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

    Sirun Li, Minghao Liu, Ling Dai +4

    cs.CVcs.CLarXiv:2608.04244v12026
  20. Towards Interpretable Foundation Models for Retinal Fundus Images

    Samuel Ofosu Mensah, Camila Roa, Kerol Djoumessi +1

    cs.CVcs.LGstat.COarXiv:2603.18846v42026
  21. Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

    Zhongbin Guo, Jiahao Xie, Dongling Xiao +5

    cs.CVarXiv:2608.12209v12026
  22. Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis

    Zhishan Zou

    cs.CVarXiv:2608.00440v12026
  23. JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

    Shawn Li, Wei Yang, Jike Zhong +11

    cs.CVcs.AIarXiv:2607.27670v22026
  24. Multi-Task Multi-Frame Visual Piano Transcription

    Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1

    cs.SDcs.AIcs.CVarXiv:2608.03419v12026
  25. StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

    Lingwei Dang, Shishuo Shang, Pan Liu +9

    cs.CVarXiv:2608.01954v12026
  26. Voxel-based 3D Facies Segmentation from Seismic Data: A Comparative Study

    Duc-Thanh Pham, Minh-Tan Pham, Anh Nguyen +1

    cs.CVcs.AIarXiv:2608.14058v12026
  27. Content Based Video Narration of Gameplay with Vision Language Models

    Mathew Varghese

    cs.CVcs.AIcs.GRarXiv:2608.14016v12026
  28. ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

    Mingxin Wang, Bin Hu, Bin Qian +12

    cs.ROcs.CVarXiv:2607.28993v12026
  29. A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples

    Zixuan Fu, Chong Wang, Lanqing Guo +3

    cs.CVarXiv:2607.29122v12026
  30. Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle

    Jiaming Zhang, Boyang Chen, Zherui Li +14

    cs.CRcs.CVarXiv:2608.04314v12026
  31. Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis

    Lingwei Dang, Ziyan Qiu, Jiajia Cheng +9

    cs.ROcs.CVarXiv:2608.01973v12026
  32. AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

    Guiyu Zhao, Longteng Guo, Yanghong Mei +7

    cs.ROcs.CVarXiv:2608.06729v12026
  33. Decoding Children's Gait Behavior

    Yifan Shen, Boyi Li, Meihuan Huang +12

    cs.CVarXiv:2608.00371v12026
  34. SAGE: Surrogate-gradient Adaptation via Attention-Guided Entropy for Spiking Transformers

    Kiran Nair, Rodrigue Rizk, KC Santosh

    cs.LGcs.AIcs.CVarXiv:2608.13702v12026
  35. MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

    Wenjie Zhu, Yabin Zhang, Wenjun Zeng +1

    cs.CVarXiv:2607.27637v22026
  36. What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

    Zhijing Zhang, Jinpeng Yu, Xin Song +6

    cs.CVcs.AIarXiv:2608.07565v12026
  37. The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

    Weiwei Li, Junzhuo Liu, Tong Chu +2

    cs.CVarXiv:2608.06065v12026
  38. TRUE-Colon: Exposing a Consistent Transfer Asymmetry in Real-Time Polyp Detection

    Sebastian Doerrich, Andreas Franz Schwab, Francesco Di Salvo +3

    eess.IVcs.CVcs.LGarXiv:2608.13711v12026
  39. 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

    Changwoo Baek, Kyeongbo Kong

    cs.CVcs.LGarXiv:2608.01185v12026
  40. DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

    Huanyao Zhang, Jiepeng Zhou, Runhao Zhao +12

    cs.CVcs.AIarXiv:2608.01827v12026
  41. MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation

    Rafi Ibn Sultan, Hui Zhu, Chengyin Li +1

    cs.CVcs.AIarXiv:2608.13690v12026
  42. Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

    Siming Fu, Zheming Fu, Ruizhe He +7

    cs.LGcs.CVarXiv:2608.03316v12026
  43. Uncertainty-Aware World Model for Aerial Image-Goal Navigation

    Deyi Zhu, Haoyu Fan, Yinan Zhu +4

    cs.CVarXiv:2608.05597v12026
  44. Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

    Jiazhen Liu, Mingkuan Feng, Long Chen

    cs.CVarXiv:2608.02791v12026
  45. Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

    Zhen Fang, Yu Zeng, Wenxuan Huang +17

    cs.CVcs.AIarXiv:2608.03979v12026
  46. WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

    Senyu Fei, Xiaopeng Yu, Siyin Wang +3

    cs.ROcs.CLcs.CVarXiv:2607.29613v12026
  47. Conditional Neural Optimal Transport for Predicting Cellular Phenotypes from Molecular Structure

    Gauthier Avité, Maxime Sanchez-Renauld, Nicolas Bourriez +1

    cs.CVcs.LGarXiv:2608.14293v12026
  48. Seeing Red, Thinking Bad: Color Bias in Vision Language Models

    Kohsuke Ide, Ryousuke Yamada, Yoshihiro Fukuhara +2

    cs.CVcs.AIcs.CLarXiv:2608.14286v12026
  49. ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing

    Xu Guo, Zhengxuan Wei, Xinghui Li +11

    cs.CVarXiv:2608.04956v12026
  50. What to Preserve, Where to Adapt: A Depth-Wise Analysis of Forgetting in Continual Gynecological Image Segmentation

    Amal Saqib, Tausifa Jan Saleem, Numan Saeed +1

    cs.CVcs.LGarXiv:2608.13660v12026
  51. UniWorld-Design: From Pixel Generation to Layer-Native Design

    Zongjian Li, Zhiyuan Yan, Chenxu Bai +9

    cs.CVarXiv:2608.03971v12026
  52. Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

    Siming Fu, Haojun Xu, Ruizhe He +9

    cs.CVarXiv:2608.04349v12026
  53. Invisible Shortcuts: Why Vision Encoders Know Your Camera

    Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos +2

    cs.CVcs.LGarXiv:2608.05424v12026
  54. VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

    Kangning Zhang, Yixing Li, Shuai Shao +9

    cs.CVcs.CLarXiv:2607.28590v12026
  55. Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations

    Zhixue Fang, Zhimin Zhang, Bi'an Du +6

    cs.CVarXiv:2608.01628v22026
  56. Intelligent Detection of Mechanical, Electrical, and Plumbing (MEP) Metrics Based on 2D Floor Plans

    Tarandeep Singh Mandhiratta, ANK Zaman, Abdul-Rahman Mawlood-Yunis

    cs.CVcs.AIcs.HCarXiv:2608.14317v12026
  57. CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

    Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang

    cs.CVarXiv:2608.02589v12026
  58. iFAN: Inference-Aware Learning for Plain Mask Transformers

    Fang Li, Yu He, Haoyang Tong +7

    cs.CVarXiv:2608.03216v22026
  59. EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

    Feier Wu, Wanke Xia, Xu He +8

    cs.CVarXiv:2608.05565v12026
  60. CADENA: Stepwise CAD Reverse Engineering

    Soslan Kabisov, Gennadiy Savrasov, Maksim Elistratov +9

    cs.CVarXiv:2608.00799v12026