Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,421 to 18,480 of 18,817
MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter
Vignesh Nagarajan, Sriram Venkatapathy
cs.CVcs.AIcs.LGarXiv:2608.16709v12026A cross-modal generative model for incomplete and degraded prostate MRI with multicentre clinical validation
Siyuan Ma, Liang He, Mengying Zhu +14
eess.IVcs.AIcs.CVarXiv:2608.16233v12026Picking the Right Image to Classify: Reliable-Input Selection in Teledermatology
Fabian Gröger, Marco Weishaupt, Philippe Gottfrois +6
cs.CVcs.AIarXiv:2608.16198v12026DriveCache: Action-Aware Caching for Driving World Model Inference
Jianchun Yang, Jian Liang, Xianda Guo +5
cs.AIcs.CVarXiv:2608.16354v12026X$^2$Localizer: Cross-grained Alignment for Progressive Cross-view Video Geo-localization
Zichao Zeng, Weijia Fan, Yufan Chen +7
cs.CVcs.AIcs.ROarXiv:2608.16658v12026Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar +4
cs.CVcs.AIcs.CLarXiv:2608.15869v12026Turning spectra into images improves plant trait retrieval with 2D-CNNs
Javier Lopatin, Teja Kattenborn, Eya Cherif +1
cs.CVcs.LGarXiv:2608.16661v12026OceanDepths: A Global Dataset of Paired Subsurface and Surface Ocean Observations
Simon Donike, Ruben Cartuyvels, Antonino Ian Ferola +3
cs.LGcs.AIcs.CVarXiv:2608.16373v22026FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion
Yu Lu, Junjie Yang, Piotr Koniusz +2
cs.CVarXiv:2606.10671v22026AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security
Dongrui Liu, Yu Li, Zhonghao Yang +47
cs.AIcs.CLcs.CRarXiv:2605.29801v12026JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence
Dingyu Yao, Junhao Zhou, Chenxu Yang +12
cs.CVcs.AIarXiv:2606.14777v12026MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism
Cong Chen, Guo Gan, Kaixiang Ji +7
cs.CVcs.AIcs.CLarXiv:2606.07512v22026CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives
Yihao Meng, Zichen Liu, Hao Ouyang +11
cs.CVarXiv:2605.12496v12026PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
Changpeng Wang, Xin Lin, Junhan Liu +5
cs.CVcs.AIarXiv:2605.13169v22026IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation
Shijie Lian, Bin Yu, Xiaopeng Lin +8
cs.ROcs.AIcs.CLarXiv:2605.14712v22026VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments
Haolin Yang, Yuxing Long, Zihan Yang +1
cs.ROcs.AIcs.CLarXiv:2608.15284v12026PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining
Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati +3
cs.CVcs.AIarXiv:2608.14924v12026FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making
Pramit Dutta, Jenita Manokaran, Richa Mittal +2
cs.CVcs.AIarXiv:2608.15004v12026PanoWorld: A Generative Spatial World Model for Consistent Whole-House Panorama Synthesis
Jinrang Jia, Zhenjia Li, Yijiang Hu +1
cs.CVarXiv:2605.17916v22026ActWorld: From Explorable to Interactive World Model via Action-Aware Memory
Zhexiao Xiong, Yizhi Song, Hao Kang +11
cs.CVarXiv:2606.17730v12026You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences
Ninad Daithankar, Alexi Gladstone, Yann LeCun +1
cs.CVcs.AIcs.LGarXiv:2606.15956v12026Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data
Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan +1
cs.CVarXiv:2604.24479v12026AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents
Pan Wang, Yihao Hu, Xiujin Liu +3
cs.CVarXiv:2605.17933v12026SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models
Zizhao Tong, Yeying Jin, Hongfeng Lai +11
cs.CVarXiv:2605.23345v22026OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
Rui Yang, Qianhui Wu, Yuxi Chen +7
cs.LGcs.AIcs.CLarXiv:2606.02031v22026EarlyTom: Early Token Compression Completes Fast Video Understanding
Hesong Wang, Xin Jin, Lu Lu +4
cs.CVarXiv:2605.30010v12026ActiveMimic: Egocentric Video Pretraining with Active Perception
Xingyao Lin, Guojin Zhong, Tianyi Lu +4
cs.ROcs.CVarXiv:2606.06194v12026RepWAM: World Action Modeling with Representation Visual-Action Tokenizers
Junke Wang, Qihang Zhang, Shuai Yang +5
cs.CVarXiv:2606.13674v22026Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments
Xiaoyu Yang, En Yu, Wei Duan +1
cs.CVcs.AIcs.LGarXiv:2510.04142v32025SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation
Tianfei Ren, Zhipeng Yan, Yiming Zhao +13
cs.CVcs.AIarXiv:2605.08043v12026Current World Models Lack a Persistent State Core
Jinpeng Lu, Dexu Zhu, Haoyuan Shi +8
cs.CVarXiv:2606.20545v12026Aurora: Unified Video Editing with a Tool-Using Agent
Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao +4
cs.CVarXiv:2605.18748v12026Leveraging Verifier-Based Reinforcement Learning in Image Editing
Hanzhong Guo, Jie Wu, Jie Liu +6
cs.CVarXiv:2604.27505v22026SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection
Tiancheng Zhang, Mengmeng Wang, Yan Gao +3
cs.CVcs.AIarXiv:2608.16338v12026Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
Wenyao Zhang, Bozhou Zhang, Zekun Qi +3
cs.ROcs.CVarXiv:2604.16391v12026FlowLet: Conditional 3D Brain MRI Synthesis using Wavelet Flow Matching
Danilo Danese, Angela Lombardi, Matteo Attimonelli +2
cs.CVarXiv:2601.05212v22026MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation
Kaixing Yang, Jiashu Zhu, Xulong Tang +7
cs.CVarXiv:2512.18181v32025Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
Fangfu Liu, Kai He, Tianchang Shen +7
cs.CVarXiv:2605.28816v12026Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video
Yifan Wang, Tong He
cs.CVarXiv:2605.15182v12026MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
Ziyun Zeng, Hang Hua, Bocheng Zou +3
cs.CVarXiv:2605.18652v12026One-Forcing: Towards Stable One-Step Autoregressive Video Generation
Jiaqi Feng, Justin Cui, Yuanhao Ban +1
cs.CVcs.AIarXiv:2605.23458v12026GenClaw: Code-Driven Agentic Image Generation
Junyan Ye, Jun He, Zilong Huang +4
cs.CVarXiv:2605.30248v22026Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
Jie Zhang, Xiaoyue Chen, Anzhe Chen +36
cs.CVarXiv:2606.17030v32026OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data
Jiwen Liu, Shujuan Li, Zhixue Fang +8
cs.CVcs.AIarXiv:2606.13432v12026From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM
Ruijie Yang, Yan Zhu, Peiyao Fu +7
cs.AIcs.CVarXiv:2608.15580v12026Audio-Visual Segmentation via Depth-Guided Collaborative Modeling
Zhaojin Fu, Yuyang Hong, Qi Yang +4
cs.CVcs.AIarXiv:2608.16285v12026RigidBench: Evaluating Rigid-Body Physics in Video Generation Models
Swarnim Jain, Shangzhe Wu
cs.CVcs.LGarXiv:2608.15555v12026Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts
Ziang Wu, Peng Jin, Qishen Yin +4
cs.CVcs.AIarXiv:2608.00574v12026Representation Forcing for Bottleneck-Free Unified Multimodal Models
Yuqing Wang, Zhijie Lin, Ceyuan Yang +10
cs.CVarXiv:2605.31604v42026Light-WAM: Efficient World Action Models with State-Fusion Action Decoding
Ziang Li, Dongzhou Cheng, Yibin Wang +5
cs.CVarXiv:2606.08242v12026AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting
Yuyuan Liu, Yuanhong Chen, Chong Wang +6
cs.CVarXiv:2506.01015v22025PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World
Yunhan Yang, Chunshi Wang, Junliang Ye +7
cs.CVarXiv:2605.05163v12026Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence
NVIDIA, :, Amala Sanjay Deshmukh +216
cs.LGcs.AIcs.CVarXiv:2604.24954v22026HumanNet: Scaling Human-centric Video Learning to One Million Hours
Yufan Deng, Daquan Zhou
cs.CVcs.ROarXiv:2605.06747v12026L2P: Unlocking Latent Potential for Pixel Generation
Zhennan Chen, Junwei Zhu, Xu Chen +7
cs.CVcs.AIarXiv:2605.12013v12026World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
Weijie Wang, Xiaoxuan He, Youping Gu +9
cs.CVarXiv:2604.24764v42026WALL-WM: Carving World Action Modeling at the Event Joints
Shalfun Li, Victor Yao, Charles Yang +28
cs.ROcs.CVarXiv:2606.01955v12026ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
Yiming Zhang, Jiacheng Chen, Jiaqi Tan +3
cs.CVarXiv:2604.24300v22026Qwen-Image-2.0 Technical Report
Bing Zhao, Chenfei Wu, Deqing Li +72
cs.CVarXiv:2605.10730v12026MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction
Jianing Zhang, Chenhao Zheng, Yajun Yang +10
cs.CVarXiv:2606.18558v12026