Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,421 to 18,480 of 18,817

  1. MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter

    Vignesh Nagarajan, Sriram Venkatapathy

    cs.CVcs.AIcs.LGarXiv:2608.16709v12026
  2. A cross-modal generative model for incomplete and degraded prostate MRI with multicentre clinical validation

    Siyuan Ma, Liang He, Mengying Zhu +14

    eess.IVcs.AIcs.CVarXiv:2608.16233v12026
  3. Picking the Right Image to Classify: Reliable-Input Selection in Teledermatology

    Fabian Gröger, Marco Weishaupt, Philippe Gottfrois +6

    cs.CVcs.AIarXiv:2608.16198v12026
  4. DriveCache: Action-Aware Caching for Driving World Model Inference

    Jianchun Yang, Jian Liang, Xianda Guo +5

    cs.AIcs.CVarXiv:2608.16354v12026
  5. X$^2$Localizer: Cross-grained Alignment for Progressive Cross-view Video Geo-localization

    Zichao Zeng, Weijia Fan, Yufan Chen +7

    cs.CVcs.AIcs.ROarXiv:2608.16658v12026
  6. Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

    Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar +4

    cs.CVcs.AIcs.CLarXiv:2608.15869v12026
  7. Turning spectra into images improves plant trait retrieval with 2D-CNNs

    Javier Lopatin, Teja Kattenborn, Eya Cherif +1

    cs.CVcs.LGarXiv:2608.16661v12026
  8. OceanDepths: A Global Dataset of Paired Subsurface and Surface Ocean Observations

    Simon Donike, Ruben Cartuyvels, Antonino Ian Ferola +3

    cs.LGcs.AIcs.CVarXiv:2608.16373v22026
  9. FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

    Yu Lu, Junjie Yang, Piotr Koniusz +2

    cs.CVarXiv:2606.10671v22026
  10. AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security

    Dongrui Liu, Yu Li, Zhonghao Yang +47

    cs.AIcs.CLcs.CRarXiv:2605.29801v12026
  11. JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

    Dingyu Yao, Junhao Zhou, Chenxu Yang +12

    cs.CVcs.AIarXiv:2606.14777v12026
  12. MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

    Cong Chen, Guo Gan, Kaixiang Ji +7

    cs.CVcs.AIcs.CLarXiv:2606.07512v22026
  13. CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

    Yihao Meng, Zichen Liu, Hao Ouyang +11

    cs.CVarXiv:2605.12496v12026
  14. PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

    Changpeng Wang, Xin Lin, Junhan Liu +5

    cs.CVcs.AIarXiv:2605.13169v22026
  15. IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

    Shijie Lian, Bin Yu, Xiaopeng Lin +8

    cs.ROcs.AIcs.CLarXiv:2605.14712v22026
  16. VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

    Haolin Yang, Yuxing Long, Zihan Yang +1

    cs.ROcs.AIcs.CLarXiv:2608.15284v12026
  17. PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

    Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati +3

    cs.CVcs.AIarXiv:2608.14924v12026
  18. FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making

    Pramit Dutta, Jenita Manokaran, Richa Mittal +2

    cs.CVcs.AIarXiv:2608.15004v12026
  19. PanoWorld: A Generative Spatial World Model for Consistent Whole-House Panorama Synthesis

    Jinrang Jia, Zhenjia Li, Yijiang Hu +1

    cs.CVarXiv:2605.17916v22026
  20. ActWorld: From Explorable to Interactive World Model via Action-Aware Memory

    Zhexiao Xiong, Yizhi Song, Hao Kang +11

    cs.CVarXiv:2606.17730v12026
  21. You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences

    Ninad Daithankar, Alexi Gladstone, Yann LeCun +1

    cs.CVcs.AIcs.LGarXiv:2606.15956v12026
  22. Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

    Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan +1

    cs.CVarXiv:2604.24479v12026
  23. AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

    Pan Wang, Yihao Hu, Xiujin Liu +3

    cs.CVarXiv:2605.17933v12026
  24. SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

    Zizhao Tong, Yeying Jin, Hongfeng Lai +11

    cs.CVarXiv:2605.23345v22026
  25. OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents

    Rui Yang, Qianhui Wu, Yuxi Chen +7

    cs.LGcs.AIcs.CLarXiv:2606.02031v22026
  26. EarlyTom: Early Token Compression Completes Fast Video Understanding

    Hesong Wang, Xin Jin, Lu Lu +4

    cs.CVarXiv:2605.30010v12026
  27. ActiveMimic: Egocentric Video Pretraining with Active Perception

    Xingyao Lin, Guojin Zhong, Tianyi Lu +4

    cs.ROcs.CVarXiv:2606.06194v12026
  28. RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

    Junke Wang, Qihang Zhang, Shuai Yang +5

    cs.CVarXiv:2606.13674v22026
  29. Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments

    Xiaoyu Yang, En Yu, Wei Duan +1

    cs.CVcs.AIcs.LGarXiv:2510.04142v32025
  30. SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

    Tianfei Ren, Zhipeng Yan, Yiming Zhao +13

    cs.CVcs.AIarXiv:2605.08043v12026
  31. Current World Models Lack a Persistent State Core

    Jinpeng Lu, Dexu Zhu, Haoyuan Shi +8

    cs.CVarXiv:2606.20545v12026
  32. Aurora: Unified Video Editing with a Tool-Using Agent

    Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao +4

    cs.CVarXiv:2605.18748v12026
  33. Leveraging Verifier-Based Reinforcement Learning in Image Editing

    Hanzhong Guo, Jie Wu, Jie Liu +6

    cs.CVarXiv:2604.27505v22026
  34. SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection

    Tiancheng Zhang, Mengmeng Wang, Yan Gao +3

    cs.CVcs.AIarXiv:2608.16338v12026
  35. Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

    Wenyao Zhang, Bozhou Zhang, Zekun Qi +3

    cs.ROcs.CVarXiv:2604.16391v12026
  36. FlowLet: Conditional 3D Brain MRI Synthesis using Wavelet Flow Matching

    Danilo Danese, Angela Lombardi, Matteo Attimonelli +2

    cs.CVarXiv:2601.05212v22026
  37. MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

    Kaixing Yang, Jiashu Zhu, Xulong Tang +7

    cs.CVarXiv:2512.18181v32025
  38. Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

    Fangfu Liu, Kai He, Tianchang Shen +7

    cs.CVarXiv:2605.28816v12026
  39. Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video

    Yifan Wang, Tong He

    cs.CVarXiv:2605.15182v12026
  40. MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

    Ziyun Zeng, Hang Hua, Bocheng Zou +3

    cs.CVarXiv:2605.18652v12026
  41. One-Forcing: Towards Stable One-Step Autoregressive Video Generation

    Jiaqi Feng, Justin Cui, Yuanhao Ban +1

    cs.CVcs.AIarXiv:2605.23458v12026
  42. GenClaw: Code-Driven Agentic Image Generation

    Junyan Ye, Jun He, Zilong Huang +4

    cs.CVarXiv:2605.30248v22026
  43. Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

    Jie Zhang, Xiaoyue Chen, Anzhe Chen +36

    cs.CVarXiv:2606.17030v32026
  44. OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

    Jiwen Liu, Shujuan Li, Zhixue Fang +8

    cs.CVcs.AIarXiv:2606.13432v12026
  45. From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

    Ruijie Yang, Yan Zhu, Peiyao Fu +7

    cs.AIcs.CVarXiv:2608.15580v12026
  46. Audio-Visual Segmentation via Depth-Guided Collaborative Modeling

    Zhaojin Fu, Yuyang Hong, Qi Yang +4

    cs.CVcs.AIarXiv:2608.16285v12026
  47. RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

    Swarnim Jain, Shangzhe Wu

    cs.CVcs.LGarXiv:2608.15555v12026
  48. Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts

    Ziang Wu, Peng Jin, Qishen Yin +4

    cs.CVcs.AIarXiv:2608.00574v12026
  49. Representation Forcing for Bottleneck-Free Unified Multimodal Models

    Yuqing Wang, Zhijie Lin, Ceyuan Yang +10

    cs.CVarXiv:2605.31604v42026
  50. Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

    Ziang Li, Dongzhou Cheng, Yibin Wang +5

    cs.CVarXiv:2606.08242v12026
  51. AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

    Yuyuan Liu, Yuanhong Chen, Chong Wang +6

    cs.CVarXiv:2506.01015v22025
  52. PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World

    Yunhan Yang, Chunshi Wang, Junliang Ye +7

    cs.CVarXiv:2605.05163v12026
  53. Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

    NVIDIA, :, Amala Sanjay Deshmukh +216

    cs.LGcs.AIcs.CVarXiv:2604.24954v22026
  54. HumanNet: Scaling Human-centric Video Learning to One Million Hours

    Yufan Deng, Daquan Zhou

    cs.CVcs.ROarXiv:2605.06747v12026
  55. L2P: Unlocking Latent Potential for Pixel Generation

    Zhennan Chen, Junwei Zhu, Xu Chen +7

    cs.CVcs.AIarXiv:2605.12013v12026
  56. World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

    Weijie Wang, Xiaoxuan He, Youping Gu +9

    cs.CVarXiv:2604.24764v42026
  57. WALL-WM: Carving World Action Modeling at the Event Joints

    Shalfun Li, Victor Yao, Charles Yang +28

    cs.ROcs.CVarXiv:2606.01955v12026
  58. ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

    Yiming Zhang, Jiacheng Chen, Jiaqi Tan +3

    cs.CVarXiv:2604.24300v22026
  59. Qwen-Image-2.0 Technical Report

    Bing Zhao, Chenfei Wu, Deqing Li +72

    cs.CVarXiv:2605.10730v12026
  60. MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction

    Jianing Zhang, Chenhao Zheng, Yajun Yang +10

    cs.CVarXiv:2606.18558v12026