Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,541 to 18,600 of 18,815
MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
JoungBin Lee, Jaewoo Jung, Jongmin Lee +8
cs.CVarXiv:2606.26087v12026Trimming the Long-Tail of Visual World Modeling Evaluation
Bingxuan Li, Yining Hong, Cheng Qian +6
cs.CVarXiv:2606.24256v12026Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
Atin Pothiraj, Jaemin Cho, Yue Zhang +2
cs.CVcs.AIarXiv:2606.25306v12026Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports
Halil Ibrahim Gulluk, Max Van Puyvelde, Wim Van Criekinge +1
cs.CVarXiv:2606.28393v12026MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
Yang Chen, Xiaowei Xu, Shuai Wang +4
cs.CVarXiv:2606.26016v32026PhysiFormer: Learning to Simulate Mechanics in World Space
Yiming Chen, Yushi Lan, Andrea Vedaldi
cs.CVarXiv:2606.27364v12026In-Context World Modeling for Robotic Control
Siyin Wang, Junhao Shi, Senyu Fei +4
cs.ROcs.CVarXiv:2606.26025v32026Qwen-Image-2.0-RL Technical Report
Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25
cs.CVcs.LGarXiv:2606.27608v12026NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
Tianlin Pan, Lianyu Pang, Cheng Da +4
cs.LGcs.CVarXiv:2606.27771v52026Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation
Jiayi Xu, Di He, Guolin Ke
cs.CVcs.AIarXiv:2606.27978v12026Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE
Haoyou Deng, Keyu Yan, Chaojie Mao +4
cs.CVarXiv:2606.26938v12026ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval
Siqiao Xue, Chunxue Xu
cs.CVarXiv:2606.27708v12026One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
Xiaohao Xu, Feng Xue, Xiang Li +5
cs.CVcs.AIarXiv:2606.29600v12026Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
Chonghuinan Wang, Zhikai Chen, Chunwei Wang +9
cs.CVarXiv:2606.30054v12026One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding
Chen Liu, Ling Chen, Hanzhang Zhou +5
cs.CVarXiv:2606.30084v12026DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model
Daniyel Ayupov, Artur Markov-Tsoy
cs.LGcs.CVarXiv:2606.30292v12026Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis
Shufan Li, Greg Heinrich, Hanrong Ye +4
cs.CVarXiv:2606.29814v22026BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language
Haitao Wu, Qirui Zhang, Zhouheng Yao +8
cs.CVcs.LGarXiv:2606.30319v12026CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion
Pan Wang, Yihao Hu, Xiujin Liu
cs.CVarXiv:2606.30030v12026LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents
Yogeswar Reddy Thota
cs.OScs.AIcs.CVarXiv:2606.30697v12026Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim +1
cs.CVcond-mat.mtrl-scics.AIarXiv:2606.29667v12026SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
Zhiyuan Ma, Zhengfeng Shi, Yuning An +6
cs.CVarXiv:2606.30124v12026Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
Sen Liang, Cong Wang, Zhentao Yu +8
cs.CVarXiv:2606.30599v22026MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs
Yuxuan Fan, Gyusik Seo, Jing Hao +3
cs.CVcs.AIarXiv:2606.30026v12026Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
Yoonhyung Park, Minji Kim, Sungwon Moon +1
cs.CVcs.MMcs.ROarXiv:2607.00302v12026Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
Xinyin Ma, Julius Berner, Chao Liu +3
cs.CVarXiv:2607.03509v12026Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
Ruchit Rawal, Reza Shirkavand, Sayak Paul +5
cs.CVarXiv:2607.04461v12026CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
Xuyao Huang, Zelai Deng, Xu Wang +2
cs.CVcs.AIarXiv:2607.03803v12026MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
cs.CVcs.GRarXiv:2607.05376v12026Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
Suhyeong Park, Junha Jung, Jungwoo Park +1
cs.IRcs.AIcs.CLarXiv:2607.04605v22026Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
Chang Nie, Jiaju Wei, Junlan Feng +2
cs.CVarXiv:2607.05511v12026CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training
Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1
cs.CVcs.AIcs.LGarXiv:2607.02998v22026CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
Hairui Zhu, Yiying Yang, Tengjin Weng +5
cs.CVcs.AIarXiv:2607.05465v12026Vision as Unified Multimodal Generation
Xiaoyang Han, Jianhua Li, Kewang Deng +14
cs.CVarXiv:2607.06560v12026Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.CVcs.AIarXiv:2607.06309v12026VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
Jiazi Wang, Nonghai Zhang, Qiushi Xie +5
cs.CVarXiv:2607.06374v12026PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution
Lihua Wei, Huatong Gao, Jia Gong +4
cs.CVarXiv:2607.06238v12026MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
Hyunjae Kim, Dain Kim, Pan Xiao +25
cs.CVcs.LGarXiv:2607.07673v12026Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
Haoran Feng, Ruiyang Zhang, Longyi Zhang +2
cs.CVarXiv:2607.08765v22026SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
Ruiqi Shen, Chang Liu, Henghui Ding
cs.CVarXiv:2607.08688v12026OpenCoF: Learning to Reason Through Video Generation
Xinyan Chen, Ziyu Guo, Renrui Zhang +2
cs.CVcs.AIarXiv:2607.08763v12026From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models
Zanyi Wang, Xin Lin, Haodong Li +2
cs.CVarXiv:2607.06553v22026CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation
Seungyong Lee, Hyun Jun Jang, Sangoh Kim +1
cs.CVcs.AIarXiv:2607.09362v12026On Locality and Length Generalization in Visual Reasoning
Pulkit Madan, Sanjay Haresh, Reza Ebrahimi +3
cs.CVcs.AIcs.LGarXiv:2607.09061v12026Evidence-Backed Video Question Answering
Shijie Wang, Honglu Zhou, Ziyang Wang +5
cs.CVcs.AIarXiv:2607.11862v12026Towards Autonomous and Auditable Medical Imaging Model Development
Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng +8
cs.CVcs.AIarXiv:2607.10522v12026MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
Yufei Cai, Xuesong Niu, Hao Lu +3
cs.CVarXiv:2607.12000v22026LightMem-Ego: Your AI Memory for Everyday Life
Yijun Chen, Boyi Xiao, Yixian Zhao +10
cs.CLcs.AIcs.CVarXiv:2607.11487v12026Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
Runhui Huang, Qihui Zhang, Zhe Liu +3
cs.CVarXiv:2607.11886v12026AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou +4
cs.CVarXiv:2607.10995v12026ABot-N1: Toward a General Visual Language Navigation Foundation Model
Ruiyan Gong, Yingnan Guo, Junjun Hu +43
cs.CVcs.AIcs.ROarXiv:2607.10383v32026Let RGB Be the Language of Vision
Timing Yang, Jinrui Yang, Xinlong Li +11
cs.CVarXiv:2607.12450v12026AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow
Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika +1
cs.CVarXiv:2607.13250v12026Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
Hongbo Wang, Huaibo Huang, Jie Cao +3
cs.CVcs.AIarXiv:2607.12752v22026VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
Zhihao Xie, Junfeng Wu, Xinting Hu +2
cs.CVarXiv:2607.14088v12026VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
Yunfeng Liu, Yuandong Yang, Jiarui Han +5
cs.CVarXiv:2607.14660v12026SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera +2
cs.CVcs.ROarXiv:2607.15058v12026WanSong v1.0 Technical Report
Binghui Chen, Pandeng Li, Yu Liu +1
eess.AScs.CVarXiv:2607.14749v42026TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy
Hao Sun, Hao Yan, Mengting Chen +7
cs.CVarXiv:2606.26092v22026Generated Contents Enrichment
Mahdi Naseri, Jiayan Qiu, Zhou Wang
cs.CVcs.LGarXiv:2405.03650v42024