Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,681 to 16,740 of 18,841
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1
cs.CVcs.AIarXiv:2604.16060v12026Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
Victoria Yue Chen, Emery Pierson, Léopold Maillard +1
cs.CVarXiv:2604.14914v22026An Optimal Transport-driven Approach for Cultivating Latent Space in Online Incremental Learning
Quyen Tran, Hai Nguyen, Hoang Phan +6
cs.LGcs.CVarXiv:2211.16780v42022LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories
Zhanhao Liang, Tao Yang, Jie Wu +2
cs.CVarXiv:2604.15311v22026Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models
Haoyi Sun, Xiaoxiao Wang, Ning Mao +5
cs.CVarXiv:2604.14629v12026Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
Yixu Huang, Tinghui Zhu, Muhao Chen
cs.CVcs.CLarXiv:2604.14568v12026Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips
Ido Galil, Moshe Kimhi, Ran El-Yaniv
cs.LGcs.AIcs.CVarXiv:2502.07408v22025Hierarchical Codec Diffusion for Video-to-Speech Generation
Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4
cs.SDcs.CVarXiv:2604.15923v12026VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
Xiangbo Gao, Sicong Jiang, Bangya Liu +12
cs.CVcs.AIcs.CLarXiv:2604.16272v22026Repurposing 3D Generative Model for Autoregressive Layout Generation
Haoran Feng, Yifan Niu, Zehuan Huang +3
cs.CVarXiv:2604.16299v22026Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2
cs.CVcs.AIarXiv:2604.16054v12026EasyVideoR1: Easier RL for Video Understanding
Chuanyu Qin, Chenxu Yang, Qingyi Si +6
cs.CVcs.LGarXiv:2604.16893v12026Coevolving Representations in Joint Image-Feature Diffusion
Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis
cs.CVarXiv:2604.17492v12026Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
Jinghui Lu, Jiayi Guan, Zhijian Huang +47
cs.CVcs.CLcs.ROarXiv:2604.18486v32026MultiWorld: Scalable Multi-Agent Multi-View Video World Models
Haoyu Wu, Jiwen Yu, Yingtian Zou +1
cs.CVarXiv:2604.18564v22026MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
Sua Lee, Sanghee Park, Jinbae Im
cs.CLcs.AIcs.CVarXiv:2604.18164v32026HSG: Hyperbolic Scene Graph
Liyang Wang, Zeyu Zhang, Hao Tang
cs.CVarXiv:2604.17454v12026When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
Akash Ghosh, Subhadip Baidya, Sriparna Saha +1
cs.CVarXiv:2604.17318v12026UniMesh: Unifying 3D Mesh Understanding and Generation
Peng Huang, Yifeng Chen, Zeyu Zhang +1
cs.CVarXiv:2604.17472v12026On the Transferability of Agricultural Weed Detection Under Cross-Field Distribution Shift
Nikhilesh Prabhakar, Pranuthi Tenali, Wilfredo Abudeye Fernandez +5
cs.CVcs.LGarXiv:2608.21254v12026Speculative Decoding for Autoregressive Video Generation
Yuezhou Hu, Jintao Zhang
cs.CVcs.AIarXiv:2604.17397v12026Mitigating Multimodal Hallucination via Phase-wise Self-reward
Yu Zhang, Chuyang Sun, Kehai Chen +3
cs.CVcs.CLarXiv:2604.17982v12026UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
Jiaqi Wang, Haoge Deng, Ting Pan +5
cs.CVcs.LGarXiv:2604.18518v42026CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation
Chenglong Liu, Xin Zhang, Yimeng Zhu +5
cs.GRcs.CVcs.LGarXiv:2608.20803v12026HP-Edit: A Human-Preference Post-Training Framework for Image Editing
Fan Li, Chonghuinan Wang, Lina Lei +9
cs.CVcs.AIarXiv:2604.19406v12026Chat2Workflow: A Benchmark for Generating Executable Visual Workflows with Natural Language
Yi Zhong, Buqiang Xu, Yijun Wang +4
cs.CLcs.AIcs.CVarXiv:2604.19667v22026CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation
Xiangyang Luo, Xiaozhe Xin, Tao Feng +3
cs.CVarXiv:2604.19636v12026SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing
Ying Zeng, Miaosen Luo, Guangyuan Li +10
cs.CVarXiv:2604.19587v12026Learning Prostate Anatomy at Test Time for Cancer Detection in Micro-Ultrasound
Obed Korshie Dzikunu, Mohammad Mahdi Abootorabi, Mohamed Harmanani +7
cs.CVcs.LGarXiv:2608.20557v12026ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis
Zhengwentai Sun, Keru Zheng, Chenghong Li +7
cs.CVarXiv:2604.19720v12026Keep Your Friends Close, and the Right Neighbours Closer: Disaster-Conditioned Kernel-Regularized Graph Attention for Building Damage Classification
Fuad Hasan, Chul Min Yeum
cs.CVcs.LGarXiv:2608.20548v12026EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
Yiyang Du, Zhanqiu Guo, Xin Ye +2
cs.CVcs.AIcs.CLarXiv:2604.20012v12026Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates
Hui Wei, Licai Sun, Guoying Zhao
cs.CVcs.LGarXiv:2608.21160v12026RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models
Yusuf Çelebi, Yağız Asker, Özay Ezerceli +4
cs.LGcs.AIcs.CLarXiv:2604.19321v12026AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model
Yutian Chen, Shi Guo, Renbiao Jin +7
cs.CVarXiv:2604.19747v12026Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items
Mengting Chen, Zhengrui Chen, Yongchao Du +16
cs.CVarXiv:2604.19748v32026MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings
Zijie Li, Yichun Shi, Jingxiang Sun +8
cs.CVcs.AIcs.LGarXiv:2604.19902v12026Visual Reasoning through Tool-supervised Reinforcement Learning
Qihua Dong, Gozde Sahin, Pei Wang +4
cs.CVarXiv:2604.19945v12026Exploring Spatial Intelligence from a Generative Perspective
Muzhi Zhu, Shunyao Jiang, Huanyi Zheng +9
cs.CVarXiv:2604.20570v12026DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation
Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho +1
cs.CVarXiv:2604.20841v12026Image Generators are Generalist Vision Learners
Valentin Gabeur, Shangbang Long, Songyou Peng +22
cs.CVcs.AIarXiv:2604.20329v32026Encoder-Free Human Motion Understanding via Structured Motion Descriptions
Yao Zhang, Zhuchenyang Liu, Thomas Ploetz +1
cs.CVarXiv:2604.21668v22026Vista4D: Video Reshooting with 4D Point Clouds
Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca +9
cs.CVarXiv:2604.21915v12026UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection
Yanran Zhang, Wenzhao Zheng, Yifei Li +5
cs.CVarXiv:2604.21904v12026WorldMark: A Unified Benchmark Suite for Interactive Video World Models
Xiaojie Xu, Zhengyuan Lin, Kang He +5
cs.CVarXiv:2604.21686v22026Seeing Fast and Slow: Learning the Flow of Time in Videos
Yen-Siang Wu, Rundong Luo, Jingsen Zhu +6
cs.CVcs.AIcs.GRarXiv:2604.21931v12026StyleID: A Perception-Aware Dataset and Metric for Stylization-Agnostic Facial Identity Recognition
Kwan Yun, Changmin Lee, Ayeong Jeong +3
cs.GRcs.CVcs.HCarXiv:2604.21689v12026LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
Inclusion AI, Tiwei Bie, Haoxing Chen +15
cs.CVarXiv:2604.20796v12026Building a Precise Video Language with Human-AI Oversight
Zhiqiu Lin, Chancharik Mitra, Siyuan Cen +13
cs.CVcs.AIcs.CLarXiv:2604.21718v22026Context Unrolling in Omni Models
Ceyuan Yang, Zhijie Lin, Yang Zhao +16
cs.CVarXiv:2604.21921v12026FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing
Ze Chen, Lan Chen, Yuanhang Li +1
cs.CVarXiv:2604.22586v12026Video Analysis and Generation via a Semantic Progress Function
Gal Metzer, Sagi Polaczek, Ali Mahdavi-Amiri +2
cs.CVarXiv:2604.22554v12026Decoupled Vision-Language System for Multimodal Understanding and Generation
Yifan Xu, Baochen Xiong, Xiaoshan Yang +3
cs.CLcs.CVarXiv:2608.20382v12026COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models
Chenghua Zhu, Zhaolu Kang, Qifan Shi +8
cs.CVcs.CLcs.LGarXiv:2608.21030v12026MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos
Fatima Haouari, Carolina Scarton, Kalina Bontcheva
cs.CVcs.CLcs.CYarXiv:2608.20984v12026Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images
A. Said Gurbuz, Ahmed Nassar, Christoph Auer +8
cs.CVcs.CLarXiv:2608.20868v12026CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents
Jiancheng Wang, Mingli Zhu, Tong Zhang +4
cs.CVcs.AIarXiv:2608.21114v12026A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans
Simon Vincent Abel, Heiko Hillenhagen, Michael Götz +3
cs.CVcs.AIarXiv:2608.21140v12026Recognition in Terra Incognita
Sara Beery, Grant van Horn, Pietro Perona
cs.CVq-bio.PEarXiv:1807.04975v22018TRACE: Training-time Report-guided and Clinically Ordered Concept Editing
Wentao Yue, Tianyou Lai, Jiayu Luo +4
cs.CVcs.AIarXiv:2608.20809v12026