Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
6,541 to 6,600 of 18,839
Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
Junlin Han, Shengbang Tong, David Fan +4
cs.CVcs.LGcs.MMarXiv:2608.05000v22026Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
Kejian Zhu, Zhuoran Jin, Dongqi Huang +4
cs.CVarXiv:2608.03571v22026Quo Vadis, World Modeling?
Yu Yang, Xuemeng Yang, Licheng Wen +17
cs.CVcs.AIcs.ROarXiv:2608.02713v12026Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement
Yuqi Liu, Bohao Peng, Zhisheng Zhong +4
cs.CVcs.MMarXiv:2503.06520v32025SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift
Sagar Lekhak, Prasanna Reddy Pulakurthi, Lalit Joshi +2
cs.CVarXiv:2607.28996v12026MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
Jiajia Lin, Mingxuan Du, Tuowen Zhou +2
cs.CVarXiv:2607.27616v12026Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Xiaomi Robotics Team, Jun Guo, Piaopiao Jin +31
cs.ROcs.CVarXiv:2607.15330v22026Summaries:한국어OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
Jinsen Su, Yongdong Luo, Yuexiao Ma +3
cs.CVarXiv:2607.23193v32026VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
Xinhao Li, Yuhan Zhu, Xiangyu Zeng +24
cs.CVarXiv:2607.14935v12026Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
Zhishan Zou, Guoyan Sun, Zhiwei Wei +4
cs.CVarXiv:2607.12477v22026RoarNet: A Robust 3D Object Detection based on RegiOn Approximation Refinement
Kiwoo Shin, Youngwook Paul Kwon, Masayoshi Tomizuka
cs.CVarXiv:1811.03818v12018Self-Forcing++: Towards Minute-Scale High-Quality Video Generation
Justin Cui, Jie Wu, Ming Li +6
cs.CVcs.AIarXiv:2510.02283v12025advertorch v0.1: An Adversarial Robustness Toolbox based on PyTorch
Gavin Weiguang Ding, Luyu Wang, Xiaomeng Jin
cs.LGcs.CRcs.CVarXiv:1902.07623v12019HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
Gengluo Li, Xingyu Wan, Shangpin Peng +20
cs.CVarXiv:2607.04884v22026Representation Distribution Matching for One-Step Visual Generation
Lan Feng, Wuyang Li, Eloi Zablocki +2
cs.CVarXiv:2607.02375v12026WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory
Hanlin Wang, Hao Ouyang, Qiuyu Wang +10
cs.CVarXiv:2607.02517v12026AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
Rintaro Otsubo, Ryo Fujii, Reina Ishikawa +6
cs.CVcs.AIarXiv:2607.02269v12026Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
Xingyu Zheng, Xianglong Liu, Yifu Ding +4
cs.CVarXiv:2607.01642v12026Summaries:한국어MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering
Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi +7
cs.CLcs.AIcs.CVarXiv:2607.01420v32026Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
Hongxing Li, Xiufeng Huang, Dingming Li +11
cs.CVarXiv:2607.01191v12026SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
Or Hirschorn, Aaron Olender, Eli Alshan +3
cs.CVarXiv:2606.32033v12026Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning
Shijie Li, Yilin Gao, Siyuan Yang +7
cs.CVarXiv:2607.00461v12026MuSViT: A Foundation Vision Model for Sheet Music Representation
Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez +4
cs.CVarXiv:2606.31811v12026DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
Siyu Yan, Yizhen Gao, Yilin Wang +2
cs.CVcs.MAarXiv:2606.31537v12026Physics-Informed Machine Learning: A Survey on Problems, Methods and Applications
Zhongkai Hao, Songming Liu, Yichi Zhang +4
cs.LGcs.AIcs.CVarXiv:2211.08064v22022Comprehensive Review of Deep Learning-Based 3D Point Cloud Completion Processing and Analysis
Ben Fei, Weidong Yang, Wenming Chen +5
cs.CVarXiv:2203.03311v32022The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction
Yuxi Wang, Chengkai Jin, Yufei Liu +6
cs.CVarXiv:2606.30308v22026Summaries:한국어PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising
Koorosh Roohi, Javad Rajabi, Andrew Fleet +1
cs.CVarXiv:2606.30968v12026LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
Xinyu Wang, Chongbo Zhao, Fangneng Zhan +1
cs.CVarXiv:2606.26740v22026Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Lianghua Huang, Zhi-Fan Wu, Wei Wang +22
cs.CVcs.AIcs.GRarXiv:2606.25041v32026SkyReels-V2: Infinite-length Film Generative Model
Guibin Chen, Dixuan Lin, Jiangping Yang +22
cs.CVarXiv:2504.13074v32025FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows
Daniel Gilo, Sven Elflein, Ido Sobol +1
cs.CVarXiv:2606.20404v12026EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies
Ganlin Yang, Zhangzheng Tu, Yuqiang Yang +10
cs.CVarXiv:2606.20092v22026BadWorld: Adversarial Attacks on World Models
Linghui Shen, Mingyue Cui, Xingyi Yang
cs.CVarXiv:2606.16519v12026SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
Zhengyi Luo, Ye Yuan, Tingwu Wang +25
cs.ROcs.AIcs.CVarXiv:2511.07820v42025GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods
Sujay Belsare, Sudarshan Nikhil, Sushant Kumar +2
cs.CVarXiv:2606.14740v12026Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion
Weichen Fan, Haiwen Diao, Penghao Wu +1
cs.CVarXiv:2606.15236v22026Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions
Xin Jin, Huanqia Cai, Zhen Li +9
cs.CVarXiv:2606.09076v32026AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding
Qize Yu, Jiadi You, Yuran Wang +10
cs.ROcs.CVcs.MMarXiv:2606.06155v12026MAOAM: Unified Object and Material Selection with Vision-Language Models
Jaden Park, Valentin Deschaintre, Jason Kuen +5
cs.CVarXiv:2606.04880v12026SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3
cs.CVarXiv:2605.31597v32026VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral +4
cs.CVcs.AIarXiv:2605.30351v12026AdaState: Self-Evolving Anchors for Streaming Video Generation
Yusuf Dalva, Pinar Yanardag
cs.CVarXiv:2605.30349v12026Geo-Align: Video Generation Alignment via Metric Geometry Reward
Zizun Li, Haoyu Guo, Runzhe Teng +2
cs.CVarXiv:2605.23903v12026Registers Matter for Pixel-Space Diffusion Transformers
Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy +2
cs.CVarXiv:2605.16147v22026DrawMotion: Generating 3D Human Motions by Freehand Drawing
Tao Wang, Lei Jin, Zhihua Wu +7
cs.CVarXiv:2605.20955v12026UniT: Unified Geometry Learning with Group Autoregressive Transformer
Haotian Wang, Yusong Huang, Zhaonian Kuang +4
cs.CVarXiv:2605.21131v12026SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training
Komal Kumar, Ankan Deria, Abhishek Basu +3
cs.CVarXiv:2605.18719v12026Generative Modeling via Drifting
Mingyang Deng, He Li, Tianhong Li +2
cs.LGcs.CVarXiv:2602.04770v22026Aligning Latent Geometry for Spherical Flow Matching in Image Generation
Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe +2
cs.CVarXiv:2605.15193v12026ReactiveGWM: Steering NPC in Reactive Game World Models
Zeqing Wang, Danze Chen, Zhaohu Xing +4
cs.CVarXiv:2605.15256v12026Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image
Ming Qian, Zimin Xia, Changkun Liu +6
cs.CVcs.AIarXiv:2605.14984v12026Roto-Translation Covariant Convolutional Networks for Medical Image Analysis
Erik J Bekkers, Maxime W Lafarge, Mitko Veta +3
cs.CVcs.LGmath.GRarXiv:1804.03393v32018End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer
Wenda Chu, Bingliang Zhang, Jiaqi Han +4
cs.CVcs.LGarXiv:2605.00503v22026Linear-Time Global Visual Modeling without Explicit Attention
Ruize He, Dongchen Han, Gao Huang
cs.CVarXiv:2605.01711v22026ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
Fanqing Meng, Lingxiao Du, Zijian Wu +46
cs.CVcs.SEarXiv:2604.23781v22026On the Global Photometric Alignment for Low-Level Vision
Mingjia Li, Tianle Du, Hainuo Wang +2
cs.CVarXiv:2604.08172v12026DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
Tianjiao Yu, Xinzhuo Li, Muntasir Wahed +4
cs.CVcs.AIcs.LGarXiv:2603.19216v22026Video-CoE: Reinforcing Video Event Prediction via Chain of Events
Qile Su, Jing Tang, Rui Chen +2
cs.CVarXiv:2603.14935v12026AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
Changwoo Baek, Jouwon Song, Sohyeon Kim +1
cs.CVcs.LGarXiv:2603.01236v12026