Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,621 to 16,680 of 18,817
Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation
Gordon Chen, Ziqi Huang, Ziwei Liu
cs.CVarXiv:2604.10030v12026EditCrafter: Tuning-free High-Resolution Image Editing via Pretrained Diffusion Model
Kunho Kim, Sumin Seo, Yongjun Cho +1
cs.CVarXiv:2604.10268v12026DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
Song Jin, Juntian Zhang, Xun Zhang +6
cs.CVarXiv:2604.10425v12026Rethinking the Diffusion Model from a Langevin Perspective
Candi Zheng, Yuan Lan
cs.LGcs.AIcs.CVarXiv:2604.10465v12026Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
Songlin Yang, Xianghao Kong, Anyi Rao
cs.CVcs.AIarXiv:2604.10949v12026OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
Donghao Zhou, Guisheng Liu, Hao Yang +9
cs.CVarXiv:2604.11804v22026Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani +1
cs.CVarXiv:2604.11177v12026You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
Yinuo Yang, Zixian Ma, Manasi Ganti +2
cs.CVcs.AIarXiv:2604.10966v22026ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
Fei Tang, Zhiqiong Lu, Boxuan Zhang +4
cs.LGcs.AIcs.CLarXiv:2604.11784v12026Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models
Yunkai Zhang, Linda Li, Yingxin Cui +5
cs.CVcs.AIarXiv:2604.09687v22026Motif-Video 2B: Technical Report
Junghwan Lim, Wai Ting Cheung, Minsu Ha +25
cs.CVcs.AIarXiv:2604.16503v22026OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
Junfu Pu, Yuxin Chen, Teng Wang +1
cs.CVcs.MMarXiv:2604.11102v12026Self-Adversarial One Step Generation via Condition Shifting
Deyuan Liu, Peng Sun, Yansen Han +3
cs.CVarXiv:2604.12322v12026GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner +2
cs.CLcs.CVarXiv:2604.12978v12026Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting
Ziyuan Xia, Jingyi Xu, Chong Cui +9
cs.ROcs.CVarXiv:2604.12626v12026Generative Refinement Networks for Visual Synthesis
Jian Han, Jinlai Liu, Jiahuan Wang +2
cs.CVarXiv:2604.13030v22026Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective
Weijie Wang, Qihang Cao, Sensen Gao +10
cs.CVcs.AIcs.GRarXiv:2604.14025v12026Lyra 2.0: Explorable Generative 3D Worlds
Tianchang Shen, Sherwin Bahmani, Kai He +12
cs.CVarXiv:2604.13036v12026SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments
Dinging Li, Yingxiu Zhao, Xinrui Cheng +16
cs.CVcs.CLarXiv:2604.14144v12026Free Geometry: Refining 3D Reconstruction from Longer Versions of Itself
Yuhang Dai, Xingyi Yang
cs.CVarXiv:2604.14048v12026ROSE: Retrieval-Oriented Segmentation Enhancement
Song Tang, Guangquan Jie, Henghui Ding +1
cs.CVarXiv:2604.14147v12026MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
Han Wang, David Wan, Hyunji Lee +6
cs.CLcs.AIcs.CVarXiv:2604.13418v12026Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction
Efstathios Karypidis, Spyros Gidaris, Nikos Komodakis
cs.CVarXiv:2604.11707v12026Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution
Sebastian Cajas, Ashaba Judith, Rahul Gorijavolu +8
cs.CVcs.AIarXiv:2604.12152v12026VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
Andrei Atanov, Jesse Allardice, Roman Bachmann +6
cs.CVcs.LGarXiv:2604.12887v12026Towards Long-horizon Agentic Multimodal Search
Yifan Du, Zikang Liu, Jinbiao Peng +5
cs.CVcs.AIarXiv:2604.12890v22026Boosting Visual Instruction Tuning with Self-Supervised Guidance
Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc +2
cs.CVarXiv:2604.12966v12026UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
Fei Tang, Bofan Chen, Zhengxi Lu +8
cs.CVcs.AIcs.CLarXiv:2604.14113v12026Geometric Context Transformer for Streaming 3D Reconstruction
Lin-Zhuo Chen, Jian Gao, Yihang Chen +8
cs.CVarXiv:2604.14141v22026(1D) Ordered Tokens Enable Efficient Test-Time Search
Zhitong Gao, Parham Rezaei, Ali Cy +7
cs.CVcs.AIcs.LGarXiv:2604.15453v12026HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
Team HY-World, Chenjie Cao, Xuhui Zuo +42
cs.CVarXiv:2604.14268v12026HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System
Tianshuo Yang, Guanyu Chen, Yutian Chen +8
cs.CVcs.AIcs.ROarXiv:2604.14125v22026OneHOI: Unifying Human-Object Interaction Generation and Editing
Jiun Tian Hoe, Weipeng Hu, Xudong Jiang +2
cs.CVcs.MMarXiv:2604.14062v12026MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
Yan Li, Zezi Zeng, Yifan Yang +12
cs.CVcs.AIcs.CLarXiv:2604.15309v12026GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens
Roni Itkin, Noam Issachar, Yehonatan Keypur +3
cs.CVarXiv:2604.15284v22026OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
Kanzhi Cheng, Zehao Li, Zheng Ma +11
cs.AIcs.CLcs.CVarXiv:2604.15093v12026Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1
cs.CVcs.AIarXiv:2604.16060v12026Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
Victoria Yue Chen, Emery Pierson, Léopold Maillard +1
cs.CVarXiv:2604.14914v22026An Optimal Transport-driven Approach for Cultivating Latent Space in Online Incremental Learning
Quyen Tran, Hai Nguyen, Hoang Phan +6
cs.LGcs.CVarXiv:2211.16780v42022LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories
Zhanhao Liang, Tao Yang, Jie Wu +2
cs.CVarXiv:2604.15311v22026Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models
Haoyi Sun, Xiaoxiao Wang, Ning Mao +5
cs.CVarXiv:2604.14629v12026Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
Yixu Huang, Tinghui Zhu, Muhao Chen
cs.CVcs.CLarXiv:2604.14568v12026Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips
Ido Galil, Moshe Kimhi, Ran El-Yaniv
cs.LGcs.AIcs.CVarXiv:2502.07408v22025Hierarchical Codec Diffusion for Video-to-Speech Generation
Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4
cs.SDcs.CVarXiv:2604.15923v12026VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
Xiangbo Gao, Sicong Jiang, Bangya Liu +12
cs.CVcs.AIcs.CLarXiv:2604.16272v22026Repurposing 3D Generative Model for Autoregressive Layout Generation
Haoran Feng, Yifan Niu, Zehuan Huang +3
cs.CVarXiv:2604.16299v22026Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2
cs.CVcs.AIarXiv:2604.16054v12026EasyVideoR1: Easier RL for Video Understanding
Chuanyu Qin, Chenxu Yang, Qingyi Si +6
cs.CVcs.LGarXiv:2604.16893v12026Coevolving Representations in Joint Image-Feature Diffusion
Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis
cs.CVarXiv:2604.17492v12026Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
Jinghui Lu, Jiayi Guan, Zhijian Huang +47
cs.CVcs.CLcs.ROarXiv:2604.18486v32026MultiWorld: Scalable Multi-Agent Multi-View Video World Models
Haoyu Wu, Jiwen Yu, Yingtian Zou +1
cs.CVarXiv:2604.18564v22026MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
Sua Lee, Sanghee Park, Jinbae Im
cs.CLcs.AIcs.CVarXiv:2604.18164v32026HSG: Hyperbolic Scene Graph
Liyang Wang, Zeyu Zhang, Hao Tang
cs.CVarXiv:2604.17454v12026When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
Akash Ghosh, Subhadip Baidya, Sriparna Saha +1
cs.CVarXiv:2604.17318v12026UniMesh: Unifying 3D Mesh Understanding and Generation
Peng Huang, Yifeng Chen, Zeyu Zhang +1
cs.CVarXiv:2604.17472v12026On the Transferability of Agricultural Weed Detection Under Cross-Field Distribution Shift
Nikhilesh Prabhakar, Pranuthi Tenali, Wilfredo Abudeye Fernandez +5
cs.CVcs.LGarXiv:2608.21254v12026Speculative Decoding for Autoregressive Video Generation
Yuezhou Hu, Jintao Zhang
cs.CVcs.AIarXiv:2604.17397v12026Mitigating Multimodal Hallucination via Phase-wise Self-reward
Yu Zhang, Chuyang Sun, Kehai Chen +3
cs.CVcs.CLarXiv:2604.17982v12026UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
Jiaqi Wang, Haoge Deng, Ting Pan +5
cs.CVcs.LGarXiv:2604.18518v42026CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation
Chenglong Liu, Xin Zhang, Yimeng Zhu +5
cs.GRcs.CVcs.LGarXiv:2608.20803v12026