Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,301 to 18,360 of 18,822

  1. VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding

    Lin Fu, Zheyuan Yang, Yang Wang +3

    cs.CVarXiv:2606.05259v12026
  2. WaveDiT: Distribution-Aware Wavelet Flow Matching for Efficient 3D Brain MRI Synthesis

    Danilo Danese, Angela Lombardi, Giuseppe Fasano +2

    cs.CVarXiv:2606.08670v22026
  3. Echo-Memory: A Controlled Study of Memory in Action World Models

    Wayne King, Zeyue Xue, Yuxuan Bian +13

    cs.CVcs.GRcs.LGarXiv:2606.09803v12026
  4. A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

    Hongyang Du, Zongxia Li, Dawei Liu +8

    cs.CVarXiv:2606.04291v12026
  5. LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

    Qixin Hu, Shuai Yang, Wei Huang +2

    cs.CVarXiv:2606.02553v12026
  6. WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

    Yida Yin, Harish Krishnakumar, Chung Peng Lee +9

    cs.CVarXiv:2606.06538v12026
  7. Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback

    Huaisong Zhang, Hao Yu, Yuxuan Zhang +7

    cs.CVarXiv:2606.06113v22026
  8. IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

    Yitong Chen, Zijie Diao, Junke Wang +5

    cs.CVarXiv:2606.11096v12026
  9. Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

    Chaofan Ma, Zhenjie Mao, Yuhuan Yang +5

    cs.CVcs.AIarXiv:2606.11683v12026
  10. Native Active Perception as Reasoning for Omni-Modal Understanding

    Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8

    cs.CVcs.CLcs.SDarXiv:2606.19341v22026
  11. InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

    Ziang Yan, Sheng Xia, Jiashuo Yu +10

    cs.CVarXiv:2606.12195v12026
  12. HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

    Guozhen Zhang, Xuerui Qiu, Yutao Cui +11

    cs.CVcs.AIarXiv:2606.13289v12026
  13. ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

    Sicheng Yang, Hangjie Yuan, Wenjun Zhang +5

    cs.CVcs.AIcs.CLarXiv:2606.14697v12026
  14. IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

    Haonan Qi, Jin Cao, Yongqi Zhang +9

    cs.CVarXiv:2606.14383v22026
  15. Human Universal Grasping

    Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu +5

    cs.ROcs.AIcs.CVarXiv:2606.17054v12026
  16. Looped World Models

    Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang +28

    cs.LGcs.AIcs.CLarXiv:2606.18208v12026
  17. BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation

    Max Van Puyvelde, Ibrahim Gulluk, Wim Van Criekinge +1

    cs.AIcs.CVcs.LGarXiv:2606.19651v22026
  18. CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

    Fuchen Long, Cong Wang, Zitao Gao +8

    cs.CVarXiv:2608.17566v12026
  19. Physics-IQ Verified

    Tim Rädsch, Yuki M Asano, Hilde Kuehne +4

    cs.CVarXiv:2606.18943v12026
  20. Continuous-Time Distribution Matching for Few-Step Diffusion Distillation

    Tao Liu, Hao Yan, Mengting Chen +8

    cs.CVcs.AIarXiv:2605.06376v12026
  21. CPCANet: Deep Unfolding Common Principal Component Analysis for Domain Generalization

    Yu-Hsi Chen, Abd-Krim Seghouane

    cs.CVarXiv:2605.05136v32026
  22. RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting

    Ji Shi, Xianghua Ying, Bowei Xing +2

    cs.CVarXiv:2605.18263v12026
  23. Swift Sampling: Selecting Temporal Surprises via Taylor Series

    Dahye Kim, Bhuvan Sachdeva, Karan Uppal +3

    cs.CVcs.AIarXiv:2605.22678v12026
  24. NeuROK: Generative 4D Neural Object Kinematics

    Chen Geng, Guangzhao He, Yue Gao +3

    cs.CVcs.GRarXiv:2605.30347v12026
  25. VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

    Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9

    cs.CVcs.AIarXiv:2605.30011v12026
  26. ABot-Earth 0.5: Generative 3D Earth Model

    Ming Qian, Tianjian Ouyang, Mingchao Sun +25

    cs.CVarXiv:2606.09967v12026
  27. Memento: Reconstruct to Remember for Consistent Long Video Generation

    Xuan Wei, Longbin Ji, Guan Wang +5

    cs.CVarXiv:2606.14667v12026
  28. Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion

    Zhongjie Duan, Hong Zhang, Yingda Chen

    cs.LGcs.AIcs.CVarXiv:2604.24351v12026
  29. Improving Vision-language Models with Perception-centric Process Reward Models

    Yingqian Min, Kun Zhou, Yifan Li +6

    cs.CVarXiv:2604.24583v12026
  30. EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory

    Yuyang Li, Yime He, Zeyu Zhang +1

    cs.CVcs.CLarXiv:2604.27695v12026
  31. Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation

    Bin Wu, Mengqi Huang, Shaojin Wu +4

    cs.CVarXiv:2605.03849v12026
  32. Stream-T1: Test-Time Scaling for Streaming Video Generation

    Yijing Tu, Shaojin Wu, Mengqi Huang +4

    cs.CVarXiv:2605.04461v12026
  33. MARBLE: Multi-Aspect Reward Balance for Diffusion RL

    Canyu Zhao, Hao Chen, Yunze Tong +3

    cs.CVcs.LGarXiv:2605.06507v12026
  34. Anisotropic Modality Align

    Xiaomin Yu, Yijiang Li, Yuhui Zhang +8

    cs.MMcs.CVarXiv:2605.07825v12026
  35. RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO

    Yanzuo Lu, Ronglai Zuo, Jiankang Deng

    cs.CVarXiv:2605.15190v12026
  36. Qwen-Image-VAE-2.0 Technical Report

    Zekai Zhang, Deqing Li, Kuan Cao +27

    cs.CVarXiv:2605.13565v12026
  37. SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers

    Javad Rajabi, Kimia Shaban, Koorosh Roohi +2

    cs.CVarXiv:2605.22668v12026
  38. StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

    Yiyang Fu, Chubin Zhang, Shukai Gong +7

    cs.CVcs.ROarXiv:2605.18287v12026
  39. Learning Visual Feature-Based World Models via Residual Latent Action

    Xinyu Zhang, Zhengtong Xu, Yutian Tao +3

    cs.CVcs.AIcs.LGarXiv:2605.07079v12026
  40. Normalizing Trajectory Models

    Jiatao Gu, Tianrong Chen, Ying Shen +3

    cs.CVcs.LGarXiv:2605.08078v22026
  41. From Web to Pixels: Bringing Agentic Search into Visual Perception

    Bokang Yang, Xinyi Sun, Kaituo Feng +3

    cs.CVarXiv:2605.12497v12026
  42. ViMU: Benchmarking Video Metaphorical Understanding

    Qi Li, Xinchao Wang

    cs.CVcs.CYarXiv:2605.14607v12026
  43. EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

    Zongyuan Yang, Mingjing Yi, Wanli Ma +8

    cs.CVarXiv:2605.16745v12026
  44. Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

    Weimin Xiong, Shuhao Gu, Bowen Ye +5

    cs.CLcs.AIcs.CVarXiv:2605.14747v12026
  45. PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

    Haojun Chen, Haoyang He, Chengming Xu +11

    cs.CVarXiv:2605.20147v12026
  46. One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems

    Yufei Shi, Weilong Yan, Naixuan Huang +5

    cs.CVarXiv:2605.22144v12026
  47. PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects

    Ziang Cao, Yinghao Liu, Haitian Li +5

    cs.CVcs.ROarXiv:2605.21572v12026
  48. Rethinking Cross-Layer Information Routing in Diffusion Transformers

    Chao Xu, Maohua Li, Qirui Li +9

    cs.CVcs.AIarXiv:2605.20708v22026
  49. PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

    Yifan Lu, Qi Wu, Jay Zhangjie Wu +4

    cs.CVarXiv:2605.23902v12026
  50. EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

    Songlin Yang, Haobin Zhong, Ruilin Zhang +23

    cs.CVcs.AIarXiv:2605.23271v12026
  51. HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction

    Chong Cheng, Peilin Tao, Nanjie Yao +9

    cs.CVarXiv:2605.23889v12026
  52. Decoupling Parcellation from Classification: Systematic Benchmark of Fast Brain Segmentation Methods for Alzheimer's Disease Detection

    Jiadao Zou, Hongyu Guo, Wei Xi

    eess.IVcs.AIcs.CVarXiv:2608.16039v12026
  53. Reinforcing Few-step Generators via Reward-Tilted Distribution Matching

    Yushi Huang, Xiangxin Zhou, Ruoyu Wang +3

    cs.CVarXiv:2605.26108v32026
  54. Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

    Ao Shen, Yongheng Zhang, Yinghui Li +3

    cs.CVcs.AIcs.CLarXiv:2608.16316v12026
  55. EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

    Matteo Stoiber, Niels Buus Lassen

    cs.CVcs.AIarXiv:2608.15614v12026
  56. Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation

    Suraj Yadav

    cs.CVcs.LGarXiv:2608.16384v12026
  57. Hierarchical Adaptive Feature Refinement Network for VHR Remote Sensing Image Segmentation

    Shuaishuai Cao, Meng Tang, Shuwei Peng +7

    cs.CVcs.AIarXiv:2608.15647v12026
  58. Energy-Guided Flow Matching

    Haoyang Tong, Yu He, Fang Li +6

    cs.CVarXiv:2608.05811v32026
  59. SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

    Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx +4

    cs.CVcs.ETcs.HCarXiv:2606.00825v12026
  60. SEER: Long-Context Reasoning via Selective Visual-Text Compression

    Jiawei Xu, Zhilin Zhai, Jinrui Fang +6

    cs.CLcs.CVarXiv:2608.15962v12026