Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,541 to 18,600 of 18,815

  1. MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

    JoungBin Lee, Jaewoo Jung, Jongmin Lee +8

    cs.CVarXiv:2606.26087v12026
  2. Trimming the Long-Tail of Visual World Modeling Evaluation

    Bingxuan Li, Yining Hong, Cheng Qian +6

    cs.CVarXiv:2606.24256v12026
  3. Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

    Atin Pothiraj, Jaemin Cho, Yue Zhang +2

    cs.CVcs.AIarXiv:2606.25306v12026
  4. Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports

    Halil Ibrahim Gulluk, Max Van Puyvelde, Wim Van Criekinge +1

    cs.CVarXiv:2606.28393v12026
  5. MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

    Yang Chen, Xiaowei Xu, Shuai Wang +4

    cs.CVarXiv:2606.26016v32026
  6. PhysiFormer: Learning to Simulate Mechanics in World Space

    Yiming Chen, Yushi Lan, Andrea Vedaldi

    cs.CVarXiv:2606.27364v12026
  7. In-Context World Modeling for Robotic Control

    Siyin Wang, Junhao Shi, Senyu Fei +4

    cs.ROcs.CVarXiv:2606.26025v32026
  8. Qwen-Image-2.0-RL Technical Report

    Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25

    cs.CVcs.LGarXiv:2606.27608v12026
  9. NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

    Tianlin Pan, Lianyu Pang, Cheng Da +4

    cs.LGcs.CVarXiv:2606.27771v52026
  10. Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

    Jiayi Xu, Di He, Guolin Ke

    cs.CVcs.AIarXiv:2606.27978v12026
  11. Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

    Haoyou Deng, Keyu Yan, Chaojie Mao +4

    cs.CVarXiv:2606.26938v12026
  12. ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval

    Siqiao Xue, Chunxue Xu

    cs.CVarXiv:2606.27708v12026
  13. One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

    Xiaohao Xu, Feng Xue, Xiang Li +5

    cs.CVcs.AIarXiv:2606.29600v12026
  14. Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

    Chonghuinan Wang, Zhikai Chen, Chunwei Wang +9

    cs.CVarXiv:2606.30054v12026
  15. One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

    Chen Liu, Ling Chen, Hanzhang Zhou +5

    cs.CVarXiv:2606.30084v12026
  16. DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model

    Daniyel Ayupov, Artur Markov-Tsoy

    cs.LGcs.CVarXiv:2606.30292v12026
  17. Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

    Shufan Li, Greg Heinrich, Hanrong Ye +4

    cs.CVarXiv:2606.29814v22026
  18. BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language

    Haitao Wu, Qirui Zhang, Zhouheng Yao +8

    cs.CVcs.LGarXiv:2606.30319v12026
  19. CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion

    Pan Wang, Yihao Hu, Xiujin Liu

    cs.CVarXiv:2606.30030v12026
  20. LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents

    Yogeswar Reddy Thota

    cs.OScs.AIcs.CVarXiv:2606.30697v12026
  21. Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature

    Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim +1

    cs.CVcond-mat.mtrl-scics.AIarXiv:2606.29667v12026
  22. SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

    Zhiyuan Ma, Zhengfeng Shi, Yuning An +6

    cs.CVarXiv:2606.30124v12026
  23. Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

    Sen Liang, Cong Wang, Zhentao Yu +8

    cs.CVarXiv:2606.30599v22026
  24. MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

    Yuxuan Fan, Gyusik Seo, Jing Hao +3

    cs.CVcs.AIarXiv:2606.30026v12026
  25. Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

    Yoonhyung Park, Minji Kim, Sungwon Moon +1

    cs.CVcs.MMcs.ROarXiv:2607.00302v12026
  26. Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

    Xinyin Ma, Julius Berner, Chao Liu +3

    cs.CVarXiv:2607.03509v12026
  27. Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

    Ruchit Rawal, Reza Shirkavand, Sayak Paul +5

    cs.CVarXiv:2607.04461v12026
  28. CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

    Xuyao Huang, Zelai Deng, Xu Wang +2

    cs.CVcs.AIarXiv:2607.03803v12026
  29. MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

    Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

    cs.CVcs.GRarXiv:2607.05376v12026
  30. Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

    Suhyeong Park, Junha Jung, Jungwoo Park +1

    cs.IRcs.AIcs.CLarXiv:2607.04605v22026
  31. Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

    Chang Nie, Jiaju Wei, Junlan Feng +2

    cs.CVarXiv:2607.05511v12026
  32. CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

    Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1

    cs.CVcs.AIcs.LGarXiv:2607.02998v22026
  33. CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

    Hairui Zhu, Yiying Yang, Tengjin Weng +5

    cs.CVcs.AIarXiv:2607.05465v12026
  34. Vision as Unified Multimodal Generation

    Xiaoyang Han, Jianhua Li, Kewang Deng +14

    cs.CVarXiv:2607.06560v12026
  35. Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification

    Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi

    cs.CVcs.AIarXiv:2607.06309v12026
  36. VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

    Jiazi Wang, Nonghai Zhang, Qiushi Xie +5

    cs.CVarXiv:2607.06374v12026
  37. PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

    Lihua Wei, Huatong Gao, Jia Gong +4

    cs.CVarXiv:2607.06238v12026
  38. MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

    Hyunjae Kim, Dain Kim, Pan Xiao +25

    cs.CVcs.LGarXiv:2607.07673v12026
  39. Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

    Haoran Feng, Ruiyang Zhang, Longyi Zhang +2

    cs.CVarXiv:2607.08765v22026
  40. SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

    Ruiqi Shen, Chang Liu, Henghui Ding

    cs.CVarXiv:2607.08688v12026
  41. OpenCoF: Learning to Reason Through Video Generation

    Xinyan Chen, Ziyu Guo, Renrui Zhang +2

    cs.CVcs.AIarXiv:2607.08763v12026
  42. From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

    Zanyi Wang, Xin Lin, Haodong Li +2

    cs.CVarXiv:2607.06553v22026
  43. CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

    Seungyong Lee, Hyun Jun Jang, Sangoh Kim +1

    cs.CVcs.AIarXiv:2607.09362v12026
  44. On Locality and Length Generalization in Visual Reasoning

    Pulkit Madan, Sanjay Haresh, Reza Ebrahimi +3

    cs.CVcs.AIcs.LGarXiv:2607.09061v12026
  45. Evidence-Backed Video Question Answering

    Shijie Wang, Honglu Zhou, Ziyang Wang +5

    cs.CVcs.AIarXiv:2607.11862v12026
  46. Towards Autonomous and Auditable Medical Imaging Model Development

    Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng +8

    cs.CVcs.AIarXiv:2607.10522v12026
  47. MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

    Yufei Cai, Xuesong Niu, Hao Lu +3

    cs.CVarXiv:2607.12000v22026
  48. LightMem-Ego: Your AI Memory for Everyday Life

    Yijun Chen, Boyi Xiao, Yixian Zhao +10

    cs.CLcs.AIcs.CVarXiv:2607.11487v12026
  49. Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

    Runhui Huang, Qihui Zhang, Zhe Liu +3

    cs.CVarXiv:2607.11886v12026
  50. AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling

    Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou +4

    cs.CVarXiv:2607.10995v12026
  51. ABot-N1: Toward a General Visual Language Navigation Foundation Model

    Ruiyan Gong, Yingnan Guo, Junjun Hu +43

    cs.CVcs.AIcs.ROarXiv:2607.10383v32026
  52. Let RGB Be the Language of Vision

    Timing Yang, Jinrui Yang, Xinlong Li +11

    cs.CVarXiv:2607.12450v12026
  53. AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow

    Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika +1

    cs.CVarXiv:2607.13250v12026
  54. Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

    Hongbo Wang, Huaibo Huang, Jie Cao +3

    cs.CVcs.AIarXiv:2607.12752v22026
  55. VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

    Zhihao Xie, Junfeng Wu, Xinting Hu +2

    cs.CVarXiv:2607.14088v12026
  56. VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

    Yunfeng Liu, Yuandong Yang, Jiarui Han +5

    cs.CVarXiv:2607.14660v12026
  57. SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

    Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera +2

    cs.CVcs.ROarXiv:2607.15058v12026
  58. WanSong v1.0 Technical Report

    Binghui Chen, Pandeng Li, Yu Liu +1

    eess.AScs.CVarXiv:2607.14749v42026
  59. TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy

    Hao Sun, Hao Yan, Mengting Chen +7

    cs.CVarXiv:2606.26092v22026
  60. Generated Contents Enrichment

    Mahdi Naseri, Jiayan Qiu, Zhou Wang

    cs.CVcs.LGarXiv:2405.03650v42024