Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,481 to 18,540 of 18,817

  1. MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

    Minghao Guo, Qingyue Jiao, Zeru Shi +14

    cs.CVcs.CLcs.IRarXiv:2605.15128v12026
  2. MBench: A Comprehensive Benchmark on Memory Capability for Video World Models

    Shengjun Zhang, Zhang Zhang, Simin Huang +11

    cs.CVarXiv:2606.00793v22026
  3. No One Knows the State of the Art in Geospatial Foundation Models

    Isaac Corley, Nils Lehmann, Caleb Robinson +6

    cs.CVcs.CYarXiv:2605.12678v22026
  4. Next Forcing: Causal World Modeling with Multi-Chunk Prediction

    Gangwei Xu, Qihang Zhang, Jiaming Zhou +4

    cs.CVarXiv:2606.11187v12026
  5. SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning

    Wenhao Yan, Fengjia Guo, Zhuoyi Yang +1

    cs.CVarXiv:2606.10804v32026
  6. Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

    Zhiheng Liu, Weiming Ren, Xiaoke Huang +12

    cs.CVarXiv:2604.24763v22026
  7. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    Xiang An, Yin Xie, Feilong Tang +27

    cs.CVarXiv:2605.25979v12026
  8. ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

    Yining Hong, Jiageng Liu, Han Yin +5

    cs.CVcs.AIcs.CLarXiv:2605.18746v22026
  9. iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework

    Jianjie Fang, Yingshan Lei, Qin Wan +8

    cs.CVcs.AIarXiv:2605.03941v22026
  10. AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

    Jisong Cai, Long Ling, Shiwei Chu +10

    cs.ROcs.AIcs.CVarXiv:2606.09811v12026
  11. NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

    Peng Cai, Zhaofan Zou, Shifa Liu +6

    cs.CVcs.AIarXiv:2608.12898v12026
  12. WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

    Xiaojie Xu, Zhengyuan Lin, Runyi Li +3

    cs.CVcs.GRarXiv:2608.15659v12026
  13. A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models

    Kaname Yokoyama, Norimichi Ukita

    cs.CVarXiv:2608.15984v12026
  14. NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving

    Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li +5

    cs.CVcs.AIcs.CLarXiv:2608.14767v12026
  15. CG-GLORE: A Conjugate Gradient-Based Global-Local Regularization Network for Sparse-View CT Reconstruction

    Tran Xuan Hieu Le, Doanh C. Bui, Vu Trung Duong Le +5

    cs.CVcs.AIarXiv:2608.15246v12026
  16. DualMiT-Net: Local-Global Transformer-Convolutional Fusion for Breast Mass Segmentation in Mammographic Regions of Interest

    Alibek Kamiluly, Milana Muratova, Yash Patel +1

    cs.CVcs.AIcs.LGarXiv:2608.15019v12026
  17. MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems

    Penghao Yin, Haomin Wang, Qihong Tang +3

    cs.CVcs.AIcs.MMarXiv:2608.15006v12026
  18. ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

    Peng Chunyi, Xu Zhipeng, Yan Yukun +9

    cs.CVcs.IRarXiv:2608.15698v12026
  19. A Unified Backbone--Expert Framework with Relation-Token and Residual--Classifier Interfaces for Automatic Modulation Recognition

    Zhixiang Deng, Houbiao Li, Zongyong Cui

    cs.CVcs.AIarXiv:2608.15160v12026
  20. MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

    Manwen Liao, Xinyu Lian, Jian Mao +11

    cs.CVcs.GRarXiv:2608.14783v12026
  21. MOSS-VL Technical Report

    Pengyu Wang, Chenkun Tan, Shaojun Zhou +29

    cs.CVarXiv:2608.15045v12026
  22. HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    Weiliang Chen, Haowen Sun, Jun Gao +40

    cs.CVarXiv:2608.16859v12026
  23. A Metric Learning Reality Check

    Kevin Musgrave, Serge Belongie, Ser-Nam Lim

    cs.CVarXiv:2003.08505v32020
    Summaries:한국어
  24. GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization

    Baihan Yang, Tiexin Li, Yuheng Liu +4

    cs.CVarXiv:2608.01492v12026
  25. ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow

    Jin Cao, Zian Meng, Kaipeng Zhang

    cs.CVcs.AIcs.LGarXiv:2607.28362v12026
  26. HumanCLAW: Can Vision-Language Models Act Through a Body?

    Li Siyao, Jiawei Gu, Shuai Liu +15

    cs.CVcs.ROarXiv:2607.27180v22026
  27. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19

    eess.AScs.CVarXiv:2607.16107v12026
  28. GraphVid: Interactive Graph-Controllable Video Generation

    Vedant Shah, Onkar Susladkar, Tushar Prakash +5

    cs.CVcs.AIarXiv:2607.21580v12026
  29. FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

    Shengyi Wang, Niantong Li, Guangzheng Hu +27

    cs.CVcs.AIarXiv:2607.24241v22026
  30. GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience

    Sitong Gong, Caixin Kang, Tianyu Yan +7

    cs.CVcs.AIarXiv:2608.02392v22026
  31. PhiZero: A World Model Built Around Physical Language

    Shuyao Shang, Yuqi Wang, Ruopeng Gao +4

    cs.CVarXiv:2607.28624v12026
  32. Latent-Identity Tuning in Text-to-Image Personalization Models

    Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor +2

    cs.CVcs.GRarXiv:2607.11885v12026
  33. Hierarchical Denoising For Multi-Step Visual Reasoning

    Zezhong Qian, Xiaowei Chi, Chak-Wing Mak +9

    cs.CVarXiv:2607.15278v12026
  34. A Theory of Contrastive Learning with Natural Images

    Antonio Torralba, Yair Weiss

    cs.CVarXiv:2607.07470v12026
  35. SiamJEPA: On the Role of Siamese Student Encoders in JEPA

    Makoto Yamada

    cs.CVstat.MLarXiv:2607.04044v22026
  36. Representation Fréchet Loss for Visual Generation

    Jiawei Yang, Zhengyang Geng, Xuan Ju +2

    cs.CVarXiv:2604.28190v12026
    Summaries:한국어
  37. EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

    Heqing Yang, Yang Yi, Liyao Wang +8

    cs.ROcs.CVarXiv:2607.02646v12026
  38. MirrorPPR: Exemplar-Based Portrait Photo Retouching

    Zhihong Liu, Zheng Li, Jiachun Jin +4

    cs.CVarXiv:2606.29308v12026
  39. SAM2Matting: Generalized Image and Video Matting

    Ruiqi Shen, Guangquan Jie, Chang Liu +1

    cs.CVarXiv:2606.27339v12026
  40. DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models

    Quanhao Li, Junqiu Yu, Kaixun Jiang +7

    cs.LGcs.CVarXiv:2605.15055v12026
  41. World Action Models: The Next Frontier in Embodied AI

    Siyin Wang, Junhao Shi, Zhaoyang Fu +11

    cs.ROcs.CLcs.CVarXiv:2605.12090v12026
  42. WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

    Kaining Ying, Hengrui Hu, Siyu Ren +6

    cs.CVarXiv:2605.25874v12026
  43. D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

    Dengyang Jiang, Xin Jin, Dongyang Liu +9

    cs.CVarXiv:2605.05204v32026
  44. UniPET: a universal network for high-quality PET image denoising across varied dose reduction factors

    Zhiwen Yang, Yang Zhou, Haowei Chen +4

    cs.CVarXiv:2606.11131v12026
  45. minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

    Min Zhao, Hongzhou Zhu, Bokai Yan +9

    cs.CVarXiv:2605.30263v12026
  46. Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

    Jun Guo, Qiwei Li, Peiyan Li +7

    cs.ROcs.AIcs.CVarXiv:2604.26694v22026
  47. World Model for Robot Learning: A Comprehensive Survey

    Bohan Hou, Gen Li, Jindou Jia +15

    cs.ROcs.CVarXiv:2605.00080v12026
  48. PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training

    Zelun Zhang, Hongen Liu, Suyin Liang +12

    cs.CVarXiv:2606.03264v12026
  49. DreamX-World 1.0: A General-Purpose Interactive World Model

    DreamX Team, Yancheng Bai, Rui Chen +20

    cs.CVarXiv:2606.16993v12026
  50. SVGS: Enhancing Gaussian Splatting Using Primitives with Spatially Varying Colors

    Rui Xu, Wenyue Chen, Jiepeng Wang +7

    cs.CVcs.GRcs.MMarXiv:2411.18966v22024
  51. AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation

    Yuchao Gu, Guian Fang, Yuxin Jiang +4

    cs.CVcs.AIarXiv:2605.13724v12026
  52. GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

    GLM-V Team, :, Wenyi Hong +95

    cs.CVarXiv:2604.26752v32026
    Summaries:简体中文
  53. SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

    Haiwen Diao, Penghao Wu, Hanming Deng +55

    cs.CVarXiv:2605.12500v12026
  54. ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

    Yuyang Zhang, Wenyao Zhang, Zekun Qi +7

    cs.CVcs.ROarXiv:2606.19531v12026
  55. LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

    Yukang Chen, Luozhou Wang, Wei Huang +13

    cs.CVcs.DCarXiv:2605.18739v22026
  56. Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

    Min Zhao, Hongzhou Zhu, Kaiwen Zheng +6

    cs.CVarXiv:2605.15141v32026
  57. Cosmos 3: Omnimodal World Models for Physical AI

    NVIDIA, :, Aditi +293

    cs.CVcs.AIcs.LGarXiv:2606.02800v42026
  58. Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

    Glenn Jocher, Jing Qiu, Mengyu Liu +3

    cs.CVcs.AIarXiv:2606.03748v12026
  59. SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

    SingGuard Team

    cs.CVcs.CLarXiv:2606.22873v32026
  60. Mind the Heads: Topological Representation Alignment for Multimodal LLMs

    Davide Caffagni, Alberto Compagnoni, Federico Melis +5

    cs.CVcs.AIcs.CLarXiv:2606.23885v12026
    Summaries:한국어