Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,621 to 16,680 of 18,817

  1. Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

    Gordon Chen, Ziqi Huang, Ziwei Liu

    cs.CVarXiv:2604.10030v12026
  2. EditCrafter: Tuning-free High-Resolution Image Editing via Pretrained Diffusion Model

    Kunho Kim, Sumin Seo, Yongjun Cho +1

    cs.CVarXiv:2604.10268v12026
  3. DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain

    Song Jin, Juntian Zhang, Xun Zhang +6

    cs.CVarXiv:2604.10425v12026
  4. Rethinking the Diffusion Model from a Langevin Perspective

    Candi Zheng, Yuan Lan

    cs.LGcs.AIcs.CVarXiv:2604.10465v12026
  5. Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

    Songlin Yang, Xianghao Kong, Anyi Rao

    cs.CVcs.AIarXiv:2604.10949v12026
  6. OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

    Donghao Zhou, Guisheng Liu, Hao Yang +9

    cs.CVarXiv:2604.11804v22026
  7. Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

    Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani +1

    cs.CVarXiv:2604.11177v12026
  8. You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass

    Yinuo Yang, Zixian Ma, Manasi Ganti +2

    cs.CVcs.AIarXiv:2604.10966v22026
  9. ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents

    Fei Tang, Zhiqiong Lu, Boxuan Zhang +4

    cs.LGcs.AIcs.CLarXiv:2604.11784v12026
  10. Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

    Yunkai Zhang, Linda Li, Yingxin Cui +5

    cs.CVcs.AIarXiv:2604.09687v22026
  11. Motif-Video 2B: Technical Report

    Junghwan Lim, Wai Ting Cheung, Minsu Ha +25

    cs.CVcs.AIarXiv:2604.16503v22026
  12. OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

    Junfu Pu, Yuxin Chen, Teng Wang +1

    cs.CVcs.MMarXiv:2604.11102v12026
  13. Self-Adversarial One Step Generation via Condition Shifting

    Deyuan Liu, Peng Sun, Yansen Han +3

    cs.CVarXiv:2604.12322v12026
  14. GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

    Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner +2

    cs.CLcs.CVarXiv:2604.12978v12026
  15. Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting

    Ziyuan Xia, Jingyi Xu, Chong Cui +9

    cs.ROcs.CVarXiv:2604.12626v12026
  16. Generative Refinement Networks for Visual Synthesis

    Jian Han, Jinlai Liu, Jiahuan Wang +2

    cs.CVarXiv:2604.13030v22026
  17. Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

    Weijie Wang, Qihang Cao, Sensen Gao +10

    cs.CVcs.AIcs.GRarXiv:2604.14025v12026
  18. Lyra 2.0: Explorable Generative 3D Worlds

    Tianchang Shen, Sherwin Bahmani, Kai He +12

    cs.CVarXiv:2604.13036v12026
  19. SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments

    Dinging Li, Yingxiu Zhao, Xinrui Cheng +16

    cs.CVcs.CLarXiv:2604.14144v12026
  20. Free Geometry: Refining 3D Reconstruction from Longer Versions of Itself

    Yuhang Dai, Xingyi Yang

    cs.CVarXiv:2604.14048v12026
  21. ROSE: Retrieval-Oriented Segmentation Enhancement

    Song Tang, Guangquan Jie, Henghui Ding +1

    cs.CVarXiv:2604.14147v12026
  22. MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

    Han Wang, David Wan, Hyunji Lee +6

    cs.CLcs.AIcs.CVarXiv:2604.13418v12026
  23. Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction

    Efstathios Karypidis, Spyros Gidaris, Nikos Komodakis

    cs.CVarXiv:2604.11707v12026
  24. Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution

    Sebastian Cajas, Ashaba Judith, Rahul Gorijavolu +8

    cs.CVcs.AIarXiv:2604.12152v12026
  25. VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

    Andrei Atanov, Jesse Allardice, Roman Bachmann +6

    cs.CVcs.LGarXiv:2604.12887v12026
  26. Towards Long-horizon Agentic Multimodal Search

    Yifan Du, Zikang Liu, Jinbiao Peng +5

    cs.CVcs.AIarXiv:2604.12890v22026
  27. Boosting Visual Instruction Tuning with Self-Supervised Guidance

    Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc +2

    cs.CVarXiv:2604.12966v12026
  28. UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding

    Fei Tang, Bofan Chen, Zhengxi Lu +8

    cs.CVcs.AIcs.CLarXiv:2604.14113v12026
  29. Geometric Context Transformer for Streaming 3D Reconstruction

    Lin-Zhuo Chen, Jian Gao, Yihang Chen +8

    cs.CVarXiv:2604.14141v22026
  30. (1D) Ordered Tokens Enable Efficient Test-Time Search

    Zhitong Gao, Parham Rezaei, Ali Cy +7

    cs.CVcs.AIcs.LGarXiv:2604.15453v12026
  31. HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds

    Team HY-World, Chenjie Cao, Xuhui Zuo +42

    cs.CVarXiv:2604.14268v12026
  32. HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System

    Tianshuo Yang, Guanyu Chen, Yutian Chen +8

    cs.CVcs.AIcs.ROarXiv:2604.14125v22026
  33. OneHOI: Unifying Human-Object Interaction Generation and Editing

    Jiun Tian Hoe, Weipeng Hu, Xudong Jiang +2

    cs.CVcs.MMarXiv:2604.14062v12026
  34. MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

    Yan Li, Zezi Zeng, Yifan Yang +12

    cs.CVcs.AIcs.CLarXiv:2604.15309v12026
  35. GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens

    Roni Itkin, Noam Issachar, Yehonatan Keypur +3

    cs.CVarXiv:2604.15284v22026
  36. OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

    Kanzhi Cheng, Zehao Li, Zheng Ma +11

    cs.AIcs.CLcs.CVarXiv:2604.15093v12026
  37. Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

    Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1

    cs.CVcs.AIarXiv:2604.16060v12026
  38. Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes

    Victoria Yue Chen, Emery Pierson, Léopold Maillard +1

    cs.CVarXiv:2604.14914v22026
  39. An Optimal Transport-driven Approach for Cultivating Latent Space in Online Incremental Learning

    Quyen Tran, Hai Nguyen, Hoang Phan +6

    cs.LGcs.CVarXiv:2211.16780v42022
  40. LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

    Zhanhao Liang, Tao Yang, Jie Wu +2

    cs.CVarXiv:2604.15311v22026
  41. Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

    Haoyi Sun, Xiaoxiao Wang, Ning Mao +5

    cs.CVarXiv:2604.14629v12026
  42. Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

    Yixu Huang, Tinghui Zhu, Muhao Chen

    cs.CVcs.CLarXiv:2604.14568v12026
  43. Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips

    Ido Galil, Moshe Kimhi, Ran El-Yaniv

    cs.LGcs.AIcs.CVarXiv:2502.07408v22025
  44. Hierarchical Codec Diffusion for Video-to-Speech Generation

    Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4

    cs.SDcs.CVarXiv:2604.15923v12026
  45. VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects

    Xiangbo Gao, Sicong Jiang, Bangya Liu +12

    cs.CVcs.AIcs.CLarXiv:2604.16272v22026
  46. Repurposing 3D Generative Model for Autoregressive Layout Generation

    Haoran Feng, Yifan Niu, Zehuan Huang +3

    cs.CVarXiv:2604.16299v22026
  47. Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

    Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2

    cs.CVcs.AIarXiv:2604.16054v12026
  48. EasyVideoR1: Easier RL for Video Understanding

    Chuanyu Qin, Chenxu Yang, Qingyi Si +6

    cs.CVcs.LGarXiv:2604.16893v12026
  49. Coevolving Representations in Joint Image-Feature Diffusion

    Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis

    cs.CVarXiv:2604.17492v12026
  50. Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

    Jinghui Lu, Jiayi Guan, Zhijian Huang +47

    cs.CVcs.CLcs.ROarXiv:2604.18486v32026
  51. MultiWorld: Scalable Multi-Agent Multi-View Video World Models

    Haoyu Wu, Jiwen Yu, Yingtian Zou +1

    cs.CVarXiv:2604.18564v22026
  52. MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

    Sua Lee, Sanghee Park, Jinbae Im

    cs.CLcs.AIcs.CVarXiv:2604.18164v32026
  53. HSG: Hyperbolic Scene Graph

    Liyang Wang, Zeyu Zhang, Hao Tang

    cs.CVarXiv:2604.17454v12026
  54. When Background Matters: Breaking Medical Vision Language Models by Transferable Attack

    Akash Ghosh, Subhadip Baidya, Sriparna Saha +1

    cs.CVarXiv:2604.17318v12026
  55. UniMesh: Unifying 3D Mesh Understanding and Generation

    Peng Huang, Yifeng Chen, Zeyu Zhang +1

    cs.CVarXiv:2604.17472v12026
  56. On the Transferability of Agricultural Weed Detection Under Cross-Field Distribution Shift

    Nikhilesh Prabhakar, Pranuthi Tenali, Wilfredo Abudeye Fernandez +5

    cs.CVcs.LGarXiv:2608.21254v12026
  57. Speculative Decoding for Autoregressive Video Generation

    Yuezhou Hu, Jintao Zhang

    cs.CVcs.AIarXiv:2604.17397v12026
  58. Mitigating Multimodal Hallucination via Phase-wise Self-reward

    Yu Zhang, Chuyang Sun, Kehai Chen +3

    cs.CVcs.CLarXiv:2604.17982v12026
  59. UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

    Jiaqi Wang, Haoge Deng, Ting Pan +5

    cs.CVcs.LGarXiv:2604.18518v42026
  60. CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation

    Chenglong Liu, Xin Zhang, Yimeng Zhu +5

    cs.GRcs.CVcs.LGarXiv:2608.20803v12026