Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,481 to 18,540 of 18,817
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
Minghao Guo, Qingyue Jiao, Zeru Shi +14
cs.CVcs.CLcs.IRarXiv:2605.15128v12026MBench: A Comprehensive Benchmark on Memory Capability for Video World Models
Shengjun Zhang, Zhang Zhang, Simin Huang +11
cs.CVarXiv:2606.00793v22026No One Knows the State of the Art in Geospatial Foundation Models
Isaac Corley, Nils Lehmann, Caleb Robinson +6
cs.CVcs.CYarXiv:2605.12678v22026Next Forcing: Causal World Modeling with Multi-Chunk Prediction
Gangwei Xu, Qihang Zhang, Jiaming Zhou +4
cs.CVarXiv:2606.11187v12026SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning
Wenhao Yan, Fengjia Guo, Zhuoyi Yang +1
cs.CVarXiv:2606.10804v32026Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
Zhiheng Liu, Weiming Ren, Xiaoke Huang +12
cs.CVarXiv:2604.24763v22026LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
Xiang An, Yin Xie, Feilong Tang +27
cs.CVarXiv:2605.25979v12026ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop
Yining Hong, Jiageng Liu, Han Yin +5
cs.CVcs.AIcs.CLarXiv:2605.18746v22026iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
Jianjie Fang, Yingshan Lei, Qin Wan +8
cs.CVcs.AIarXiv:2605.03941v22026AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
Jisong Cai, Long Ling, Shiwei Chu +10
cs.ROcs.AIcs.CVarXiv:2606.09811v12026NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
Peng Cai, Zhaofan Zou, Shifa Liu +6
cs.CVcs.AIarXiv:2608.12898v12026WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations
Xiaojie Xu, Zhengyuan Lin, Runyi Li +3
cs.CVcs.GRarXiv:2608.15659v12026A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models
Kaname Yokoyama, Norimichi Ukita
cs.CVarXiv:2608.15984v12026NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving
Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li +5
cs.CVcs.AIcs.CLarXiv:2608.14767v12026CG-GLORE: A Conjugate Gradient-Based Global-Local Regularization Network for Sparse-View CT Reconstruction
Tran Xuan Hieu Le, Doanh C. Bui, Vu Trung Duong Le +5
cs.CVcs.AIarXiv:2608.15246v12026DualMiT-Net: Local-Global Transformer-Convolutional Fusion for Breast Mass Segmentation in Mammographic Regions of Interest
Alibek Kamiluly, Milana Muratova, Yash Patel +1
cs.CVcs.AIcs.LGarXiv:2608.15019v12026MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems
Penghao Yin, Haomin Wang, Qihong Tang +3
cs.CVcs.AIcs.MMarXiv:2608.15006v12026ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval
Peng Chunyi, Xu Zhipeng, Yan Yukun +9
cs.CVcs.IRarXiv:2608.15698v12026A Unified Backbone--Expert Framework with Relation-Token and Residual--Classifier Interfaces for Automatic Modulation Recognition
Zhixiang Deng, Houbiao Li, Zongyong Cui
cs.CVcs.AIarXiv:2608.15160v12026MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling
Manwen Liao, Xinyu Lian, Jian Mao +11
cs.CVcs.GRarXiv:2608.14783v12026MOSS-VL Technical Report
Pengyu Wang, Chenkun Tan, Shaojun Zhou +29
cs.CVarXiv:2608.15045v12026HarnessEval-W: Agentifying the Evaluation of Visual Worlds
Weiliang Chen, Haowen Sun, Jun Gao +40
cs.CVarXiv:2608.16859v12026A Metric Learning Reality Check
Kevin Musgrave, Serge Belongie, Ser-Nam Lim
cs.CVarXiv:2003.08505v32020Summaries:한국어GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization
Baihan Yang, Tiexin Li, Yuheng Liu +4
cs.CVarXiv:2608.01492v12026ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
Jin Cao, Zian Meng, Kaipeng Zhang
cs.CVcs.AIcs.LGarXiv:2607.28362v12026HumanCLAW: Can Vision-Language Models Act Through a Body?
Li Siyao, Jiawei Gu, Shuai Liu +15
cs.CVcs.ROarXiv:2607.27180v22026Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19
eess.AScs.CVarXiv:2607.16107v12026GraphVid: Interactive Graph-Controllable Video Generation
Vedant Shah, Onkar Susladkar, Tushar Prakash +5
cs.CVcs.AIarXiv:2607.21580v12026FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
Shengyi Wang, Niantong Li, Guangzheng Hu +27
cs.CVcs.AIarXiv:2607.24241v22026GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
Sitong Gong, Caixin Kang, Tianyu Yan +7
cs.CVcs.AIarXiv:2608.02392v22026PhiZero: A World Model Built Around Physical Language
Shuyao Shang, Yuqi Wang, Ruopeng Gao +4
cs.CVarXiv:2607.28624v12026Latent-Identity Tuning in Text-to-Image Personalization Models
Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor +2
cs.CVcs.GRarXiv:2607.11885v12026Hierarchical Denoising For Multi-Step Visual Reasoning
Zezhong Qian, Xiaowei Chi, Chak-Wing Mak +9
cs.CVarXiv:2607.15278v12026A Theory of Contrastive Learning with Natural Images
Antonio Torralba, Yair Weiss
cs.CVarXiv:2607.07470v12026SiamJEPA: On the Role of Siamese Student Encoders in JEPA
Makoto Yamada
cs.CVstat.MLarXiv:2607.04044v22026Representation Fréchet Loss for Visual Generation
Jiawei Yang, Zhengyang Geng, Xuan Ju +2
cs.CVarXiv:2604.28190v12026Summaries:한국어EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots
Heqing Yang, Yang Yi, Liyao Wang +8
cs.ROcs.CVarXiv:2607.02646v12026MirrorPPR: Exemplar-Based Portrait Photo Retouching
Zhihong Liu, Zheng Li, Jiachun Jin +4
cs.CVarXiv:2606.29308v12026SAM2Matting: Generalized Image and Video Matting
Ruiqi Shen, Guangquan Jie, Chang Liu +1
cs.CVarXiv:2606.27339v12026DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
Quanhao Li, Junqiu Yu, Kaixun Jiang +7
cs.LGcs.CVarXiv:2605.15055v12026World Action Models: The Next Frontier in Embodied AI
Siyin Wang, Junhao Shi, Zhaoyang Fu +11
cs.ROcs.CLcs.CVarXiv:2605.12090v12026WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation
Kaining Ying, Hengrui Hu, Siyu Ren +6
cs.CVarXiv:2605.25874v12026D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
Dengyang Jiang, Xin Jin, Dongyang Liu +9
cs.CVarXiv:2605.05204v32026UniPET: a universal network for high-quality PET image denoising across varied dose reduction factors
Zhiwen Yang, Yang Zhou, Haowei Chen +4
cs.CVarXiv:2606.11131v12026minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
Min Zhao, Hongzhou Zhu, Bokai Yan +9
cs.CVarXiv:2605.30263v12026Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
Jun Guo, Qiwei Li, Peiyan Li +7
cs.ROcs.AIcs.CVarXiv:2604.26694v22026World Model for Robot Learning: A Comprehensive Survey
Bohan Hou, Gen Li, Jindou Jia +15
cs.ROcs.CVarXiv:2605.00080v12026PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training
Zelun Zhang, Hongen Liu, Suyin Liang +12
cs.CVarXiv:2606.03264v12026DreamX-World 1.0: A General-Purpose Interactive World Model
DreamX Team, Yancheng Bai, Rui Chen +20
cs.CVarXiv:2606.16993v12026SVGS: Enhancing Gaussian Splatting Using Primitives with Spatially Varying Colors
Rui Xu, Wenyue Chen, Jiepeng Wang +7
cs.CVcs.GRcs.MMarXiv:2411.18966v22024AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
Yuchao Gu, Guian Fang, Yuxin Jiang +4
cs.CVcs.AIarXiv:2605.13724v12026GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
GLM-V Team, :, Wenyi Hong +95
cs.CVarXiv:2604.26752v32026Summaries:简体中文SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
Haiwen Diao, Penghao Wu, Hanming Deng +55
cs.CVarXiv:2605.12500v12026ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?
Yuyang Zhang, Wenyao Zhang, Zekun Qi +7
cs.CVcs.ROarXiv:2606.19531v12026LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
Yukang Chen, Luozhou Wang, Wei Huang +13
cs.CVcs.DCarXiv:2605.18739v22026Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
Min Zhao, Hongzhou Zhu, Kaiwen Zheng +6
cs.CVarXiv:2605.15141v32026Cosmos 3: Omnimodal World Models for Physical AI
NVIDIA, :, Aditi +293
cs.CVcs.AIcs.LGarXiv:2606.02800v42026Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
Glenn Jocher, Jing Qiu, Mengyu Liu +3
cs.CVcs.AIarXiv:2606.03748v12026SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning
SingGuard Team
cs.CVcs.CLarXiv:2606.22873v32026Mind the Heads: Topological Representation Alignment for Multimodal LLMs
Davide Caffagni, Alberto Compagnoni, Federico Melis +5
cs.CVcs.AIcs.CLarXiv:2606.23885v12026Summaries:한국어