Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,841 to 18,900 of 18,959
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20
cs.CVcs.CLarXiv:2607.24904v12026Trajectory-aware Cross-view Geo-localization with Sequential Observations
Tianyi Gao, Jiayu Lin, Danielle Beaulieu +1
cs.CVarXiv:2607.15491v12026VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
Haodong Li, Tianfei Ren, Xiaoxiao Ma +25
cs.CVcs.AIarXiv:2607.27380v22026FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation
Hao Liu, Chenghuan Huang, Ye Huang +7
cs.CVarXiv:2607.16190v12026An Exam for Active Observers
Jiarui Zhang, Muzi Tao, Shangshang Wang +3
cs.CVcs.AIcs.CLarXiv:2607.16165v12026Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Zishuo Li, Bowen Yang, Changtao Miao +29
cs.ROcs.CVarXiv:2607.14183v22026TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Hengyi Xie, Chenfei Yao, Xianjin Wu +7
cs.CVcs.ROarXiv:2607.27205v12026Can Multimodal Large Language Models Understand OCT?
Baochen Fu, Wenzhi Deng, Baihao Jin +5
cs.CVcs.CLarXiv:2607.16609v12026Dataset Distillation by Influence Matching
Haoru Tan, Wang Wang, Sitong Wu +5
cs.CVarXiv:2607.16859v12026MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
Yingying Fan, Penghui Du, Leyan Zhu +10
cs.CVcs.AIarXiv:2608.14015v12026Secret-Stego Dissimilarity as a Design Axis: Invertible Coverless Image Steganography with Diffusion Models
Hongxin Xu, Jianping Mei, Can Wang +1
eess.IVcs.AIcs.CRarXiv:2608.13597v12026Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models
Jiaang Li, Chengzu Li, Zhaochong An +4
cs.CVarXiv:2607.26326v12026Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels
Vadym Vilhurin, Volodymyr Sydorskyi, Andrii Shevtsov
cs.SDcs.AIcs.CVarXiv:2608.14287v12026DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack
Hoseong Tae, Jong-Seok Lee
cs.CVcs.LGarXiv:2608.03207v12026Articulated Object Reconstruction from Rest-State Observation
Daeun Lee, Jaeah Lee, Woosung Kim +2
cs.CVcs.ROarXiv:2607.27749v12026FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
Kapil Wanaskar, Gaytri Jena, Aman Chadha +3
cs.AIcs.CVcs.LGarXiv:2608.01049v12026GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation
Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo +2
cs.CVarXiv:2608.02315v12026DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents
Tongsheng Ding, Zhen Luo, Yixuan Yang +4
cs.CVarXiv:2608.00486v12026SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
Sirun Li, Minghao Liu, Ling Dai +4
cs.CVcs.CLarXiv:2608.04244v12026Towards Interpretable Foundation Models for Retinal Fundus Images
Samuel Ofosu Mensah, Camila Roa, Kerol Djoumessi +1
cs.CVcs.LGstat.COarXiv:2603.18846v42026Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction
Zhongbin Guo, Jiahao Xie, Dongling Xiao +5
cs.CVarXiv:2608.12209v12026Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis
Zhishan Zou
cs.CVarXiv:2608.00440v12026JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
Shawn Li, Wei Yang, Jike Zhong +11
cs.CVcs.AIarXiv:2607.27670v22026Multi-Task Multi-Frame Visual Piano Transcription
Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1
cs.SDcs.AIcs.CVarXiv:2608.03419v12026StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field
Lingwei Dang, Shishuo Shang, Pan Liu +9
cs.CVarXiv:2608.01954v12026Voxel-based 3D Facies Segmentation from Seismic Data: A Comparative Study
Duc-Thanh Pham, Minh-Tan Pham, Anh Nguyen +1
cs.CVcs.AIarXiv:2608.14058v12026Content Based Video Narration of Gameplay with Vision Language Models
Mathew Varghese
cs.CVcs.AIcs.GRarXiv:2608.14016v12026ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
Mingxin Wang, Bin Hu, Bin Qian +12
cs.ROcs.CVarXiv:2607.28993v12026A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples
Zixuan Fu, Chong Wang, Lanqing Guo +3
cs.CVarXiv:2607.29122v12026Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle
Jiaming Zhang, Boyang Chen, Zherui Li +14
cs.CRcs.CVarXiv:2608.04314v12026Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis
Lingwei Dang, Ziyan Qiu, Jiajia Cheng +9
cs.ROcs.CVarXiv:2608.01973v12026AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
Guiyu Zhao, Longteng Guo, Yanghong Mei +7
cs.ROcs.CVarXiv:2608.06729v12026Decoding Children's Gait Behavior
Yifan Shen, Boyi Li, Meihuan Huang +12
cs.CVarXiv:2608.00371v12026SAGE: Surrogate-gradient Adaptation via Attention-Guided Entropy for Spiking Transformers
Kiran Nair, Rodrigue Rizk, KC Santosh
cs.LGcs.AIcs.CVarXiv:2608.13702v12026MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models
Wenjie Zhu, Yabin Zhang, Wenjun Zeng +1
cs.CVarXiv:2607.27637v22026What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems
Zhijing Zhang, Jinpeng Yu, Xin Song +6
cs.CVcs.AIarXiv:2608.07565v12026The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents
Weiwei Li, Junzhuo Liu, Tong Chu +2
cs.CVarXiv:2608.06065v12026TRUE-Colon: Exposing a Consistent Transfer Asymmetry in Real-Time Polyp Detection
Sebastian Doerrich, Andreas Franz Schwab, Francesco Di Salvo +3
eess.IVcs.CVcs.LGarXiv:2608.13711v120263DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
Changwoo Baek, Kyeongbo Kong
cs.CVcs.LGarXiv:2608.01185v12026DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
Huanyao Zhang, Jiepeng Zhou, Runhao Zhao +12
cs.CVcs.AIarXiv:2608.01827v12026MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation
Rafi Ibn Sultan, Hui Zhu, Chengyin Li +1
cs.CVcs.AIarXiv:2608.13690v12026Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
Siming Fu, Zheming Fu, Ruizhe He +7
cs.LGcs.CVarXiv:2608.03316v12026Uncertainty-Aware World Model for Aerial Image-Goal Navigation
Deyi Zhu, Haoyu Fan, Yinan Zhu +4
cs.CVarXiv:2608.05597v12026Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
Jiazhen Liu, Mingkuan Feng, Long Chen
cs.CVarXiv:2608.02791v12026Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Zhen Fang, Yu Zeng, Wenxuan Huang +17
cs.CVcs.AIarXiv:2608.03979v12026WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
Senyu Fei, Xiaopeng Yu, Siyin Wang +3
cs.ROcs.CLcs.CVarXiv:2607.29613v12026Conditional Neural Optimal Transport for Predicting Cellular Phenotypes from Molecular Structure
Gauthier Avité, Maxime Sanchez-Renauld, Nicolas Bourriez +1
cs.CVcs.LGarXiv:2608.14293v12026Seeing Red, Thinking Bad: Color Bias in Vision Language Models
Kohsuke Ide, Ryousuke Yamada, Yoshihiro Fukuhara +2
cs.CVcs.AIcs.CLarXiv:2608.14286v12026ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing
Xu Guo, Zhengxuan Wei, Xinghui Li +11
cs.CVarXiv:2608.04956v12026What to Preserve, Where to Adapt: A Depth-Wise Analysis of Forgetting in Continual Gynecological Image Segmentation
Amal Saqib, Tausifa Jan Saleem, Numan Saeed +1
cs.CVcs.LGarXiv:2608.13660v12026UniWorld-Design: From Pixel Generation to Layer-Native Design
Zongjian Li, Zhiyuan Yan, Chenxu Bai +9
cs.CVarXiv:2608.03971v12026Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models
Siming Fu, Haojun Xu, Ruizhe He +9
cs.CVarXiv:2608.04349v12026Invisible Shortcuts: Why Vision Encoders Know Your Camera
Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos +2
cs.CVcs.LGarXiv:2608.05424v12026VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
Kangning Zhang, Yixing Li, Shuai Shao +9
cs.CVcs.CLarXiv:2607.28590v12026Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations
Zhixue Fang, Zhimin Zhang, Bi'an Du +6
cs.CVarXiv:2608.01628v22026Intelligent Detection of Mechanical, Electrical, and Plumbing (MEP) Metrics Based on 2D Floor Plans
Tarandeep Singh Mandhiratta, ANK Zaman, Abdul-Rahman Mawlood-Yunis
cs.CVcs.AIcs.HCarXiv:2608.14317v12026CAPEval: A Decoupled Caption Evaluation across Understanding and Generation
Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang
cs.CVarXiv:2608.02589v12026iFAN: Inference-Aware Learning for Plain Mask Transformers
Fang Li, Yu He, Haoyang Tong +7
cs.CVarXiv:2608.03216v22026EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal
Feier Wu, Wanke Xia, Xu He +8
cs.CVarXiv:2608.05565v12026CADENA: Stepwise CAD Reverse Engineering
Soslan Kabisov, Gennadiy Savrasov, Maksim Elistratov +9
cs.CVarXiv:2608.00799v12026