Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,301 to 18,360 of 18,822
VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding
Lin Fu, Zheyuan Yang, Yang Wang +3
cs.CVarXiv:2606.05259v12026WaveDiT: Distribution-Aware Wavelet Flow Matching for Efficient 3D Brain MRI Synthesis
Danilo Danese, Angela Lombardi, Giuseppe Fasano +2
cs.CVarXiv:2606.08670v22026Echo-Memory: A Controlled Study of Memory in Action World Models
Wayne King, Zeyue Xue, Yuxuan Bian +13
cs.CVcs.GRcs.LGarXiv:2606.09803v12026A Cookbook of 3D Vision: Data, Learning Paradigms, and Application
Hongyang Du, Zongxia Li, Dawei Liu +8
cs.CVarXiv:2606.04291v12026LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation
Qixin Hu, Shuai Yang, Wei Huang +2
cs.CVarXiv:2606.02553v12026WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark
Yida Yin, Harish Krishnakumar, Chung Peng Lee +9
cs.CVarXiv:2606.06538v12026Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback
Huaisong Zhang, Hao Yu, Yuxuan Zhang +7
cs.CVarXiv:2606.06113v22026IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder
Yitong Chen, Zijie Diao, Junke Wang +5
cs.CVarXiv:2606.11096v12026Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning
Chaofan Ma, Zhenjie Mao, Yuhuan Yang +5
cs.CVcs.AIarXiv:2606.11683v12026Native Active Perception as Reasoning for Omni-Modal Understanding
Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8
cs.CVcs.CLcs.SDarXiv:2606.19341v22026InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning
Ziang Yan, Sheng Xia, Jiashuo Yu +10
cs.CVarXiv:2606.12195v12026HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers
Guozhen Zhang, Xuerui Qiu, Yutao Cui +11
cs.CVcs.AIarXiv:2606.13289v12026ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
Sicheng Yang, Hangjie Yuan, Wenjun Zhang +5
cs.CVcs.AIcs.CLarXiv:2606.14697v12026IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products
Haonan Qi, Jin Cao, Yongqi Zhang +9
cs.CVarXiv:2606.14383v22026Human Universal Grasping
Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu +5
cs.ROcs.AIcs.CVarXiv:2606.17054v12026Looped World Models
Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang +28
cs.LGcs.AIcs.CLarXiv:2606.18208v12026BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation
Max Van Puyvelde, Ibrahim Gulluk, Wim Van Criekinge +1
cs.AIcs.CVcs.LGarXiv:2606.19651v22026CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
Fuchen Long, Cong Wang, Zitao Gao +8
cs.CVarXiv:2608.17566v12026Physics-IQ Verified
Tim Rädsch, Yuki M Asano, Hilde Kuehne +4
cs.CVarXiv:2606.18943v12026Continuous-Time Distribution Matching for Few-Step Diffusion Distillation
Tao Liu, Hao Yan, Mengting Chen +8
cs.CVcs.AIarXiv:2605.06376v12026CPCANet: Deep Unfolding Common Principal Component Analysis for Domain Generalization
Yu-Hsi Chen, Abd-Krim Seghouane
cs.CVarXiv:2605.05136v32026RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting
Ji Shi, Xianghua Ying, Bowei Xing +2
cs.CVarXiv:2605.18263v12026Swift Sampling: Selecting Temporal Surprises via Taylor Series
Dahye Kim, Bhuvan Sachdeva, Karan Uppal +3
cs.CVcs.AIarXiv:2605.22678v12026NeuROK: Generative 4D Neural Object Kinematics
Chen Geng, Guangzhao He, Yue Gao +3
cs.CVcs.GRarXiv:2605.30347v12026VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9
cs.CVcs.AIarXiv:2605.30011v12026ABot-Earth 0.5: Generative 3D Earth Model
Ming Qian, Tianjian Ouyang, Mingchao Sun +25
cs.CVarXiv:2606.09967v12026Memento: Reconstruct to Remember for Consistent Long Video Generation
Xuan Wei, Longbin Ji, Guan Wang +5
cs.CVarXiv:2606.14667v12026Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion
Zhongjie Duan, Hong Zhang, Yingda Chen
cs.LGcs.AIcs.CVarXiv:2604.24351v12026Improving Vision-language Models with Perception-centric Process Reward Models
Yingqian Min, Kun Zhou, Yifan Li +6
cs.CVarXiv:2604.24583v12026EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory
Yuyang Li, Yime He, Zeyu Zhang +1
cs.CVcs.CLarXiv:2604.27695v12026Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
Bin Wu, Mengqi Huang, Shaojin Wu +4
cs.CVarXiv:2605.03849v12026Stream-T1: Test-Time Scaling for Streaming Video Generation
Yijing Tu, Shaojin Wu, Mengqi Huang +4
cs.CVarXiv:2605.04461v12026MARBLE: Multi-Aspect Reward Balance for Diffusion RL
Canyu Zhao, Hao Chen, Yunze Tong +3
cs.CVcs.LGarXiv:2605.06507v12026Anisotropic Modality Align
Xiaomin Yu, Yijiang Li, Yuhui Zhang +8
cs.MMcs.CVarXiv:2605.07825v12026RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO
Yanzuo Lu, Ronglai Zuo, Jiankang Deng
cs.CVarXiv:2605.15190v12026Qwen-Image-VAE-2.0 Technical Report
Zekai Zhang, Deqing Li, Kuan Cao +27
cs.CVarXiv:2605.13565v12026SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
Javad Rajabi, Kimia Shaban, Koorosh Roohi +2
cs.CVarXiv:2605.22668v12026StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
Yiyang Fu, Chubin Zhang, Shukai Gong +7
cs.CVcs.ROarXiv:2605.18287v12026Learning Visual Feature-Based World Models via Residual Latent Action
Xinyu Zhang, Zhengtong Xu, Yutian Tao +3
cs.CVcs.AIcs.LGarXiv:2605.07079v12026Normalizing Trajectory Models
Jiatao Gu, Tianrong Chen, Ying Shen +3
cs.CVcs.LGarXiv:2605.08078v22026From Web to Pixels: Bringing Agentic Search into Visual Perception
Bokang Yang, Xinyi Sun, Kaituo Feng +3
cs.CVarXiv:2605.12497v12026ViMU: Benchmarking Video Metaphorical Understanding
Qi Li, Xinchao Wang
cs.CVcs.CYarXiv:2605.14607v12026EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers
Zongyuan Yang, Mingjing Yi, Wanli Ma +8
cs.CVarXiv:2605.16745v12026Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
Weimin Xiong, Shuhao Gu, Bowen Ye +5
cs.CLcs.AIcs.CVarXiv:2605.14747v12026PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset
Haojun Chen, Haoyang He, Chengming Xu +11
cs.CVarXiv:2605.20147v12026One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems
Yufei Shi, Weilong Yan, Naixuan Huang +5
cs.CVarXiv:2605.22144v12026PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects
Ziang Cao, Yinghao Liu, Haitian Li +5
cs.CVcs.ROarXiv:2605.21572v12026Rethinking Cross-Layer Information Routing in Diffusion Transformers
Chao Xu, Maohua Li, Qirui Li +9
cs.CVcs.AIarXiv:2605.20708v22026PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
Yifan Lu, Qi Wu, Jay Zhangjie Wu +4
cs.CVarXiv:2605.23902v12026EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
Songlin Yang, Haobin Zhong, Ruilin Zhang +23
cs.CVcs.AIarXiv:2605.23271v12026HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction
Chong Cheng, Peilin Tao, Nanjie Yao +9
cs.CVarXiv:2605.23889v12026Decoupling Parcellation from Classification: Systematic Benchmark of Fast Brain Segmentation Methods for Alzheimer's Disease Detection
Jiadao Zou, Hongyu Guo, Wei Xi
eess.IVcs.AIcs.CVarXiv:2608.16039v12026Reinforcing Few-step Generators via Reward-Tilted Distribution Matching
Yushi Huang, Xiangxin Zhou, Ruoyu Wang +3
cs.CVarXiv:2605.26108v32026Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning
Ao Shen, Yongheng Zhang, Yinghui Li +3
cs.CVcs.AIcs.CLarXiv:2608.16316v12026EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input
Matteo Stoiber, Niels Buus Lassen
cs.CVcs.AIarXiv:2608.15614v12026Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation
Suraj Yadav
cs.CVcs.LGarXiv:2608.16384v12026Hierarchical Adaptive Feature Refinement Network for VHR Remote Sensing Image Segmentation
Shuaishuai Cao, Meng Tang, Shuwei Peng +7
cs.CVcs.AIarXiv:2608.15647v12026Energy-Guided Flow Matching
Haoyang Tong, Yu He, Fang Li +6
cs.CVarXiv:2608.05811v32026SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory
Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx +4
cs.CVcs.ETcs.HCarXiv:2606.00825v12026SEER: Long-Context Reasoning via Selective Visual-Text Compression
Jiawei Xu, Zhilin Zhai, Jinrui Fang +6
cs.CLcs.CVarXiv:2608.15962v12026