Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,681 to 16,740 of 18,841

  1. Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

    Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1

    cs.CVcs.AIarXiv:2604.16060v12026
  2. Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes

    Victoria Yue Chen, Emery Pierson, Léopold Maillard +1

    cs.CVarXiv:2604.14914v22026
  3. An Optimal Transport-driven Approach for Cultivating Latent Space in Online Incremental Learning

    Quyen Tran, Hai Nguyen, Hoang Phan +6

    cs.LGcs.CVarXiv:2211.16780v42022
  4. LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

    Zhanhao Liang, Tao Yang, Jie Wu +2

    cs.CVarXiv:2604.15311v22026
  5. Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

    Haoyi Sun, Xiaoxiao Wang, Ning Mao +5

    cs.CVarXiv:2604.14629v12026
  6. Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

    Yixu Huang, Tinghui Zhu, Muhao Chen

    cs.CVcs.CLarXiv:2604.14568v12026
  7. Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips

    Ido Galil, Moshe Kimhi, Ran El-Yaniv

    cs.LGcs.AIcs.CVarXiv:2502.07408v22025
  8. Hierarchical Codec Diffusion for Video-to-Speech Generation

    Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4

    cs.SDcs.CVarXiv:2604.15923v12026
  9. VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects

    Xiangbo Gao, Sicong Jiang, Bangya Liu +12

    cs.CVcs.AIcs.CLarXiv:2604.16272v22026
  10. Repurposing 3D Generative Model for Autoregressive Layout Generation

    Haoran Feng, Yifan Niu, Zehuan Huang +3

    cs.CVarXiv:2604.16299v22026
  11. Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

    Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2

    cs.CVcs.AIarXiv:2604.16054v12026
  12. EasyVideoR1: Easier RL for Video Understanding

    Chuanyu Qin, Chenxu Yang, Qingyi Si +6

    cs.CVcs.LGarXiv:2604.16893v12026
  13. Coevolving Representations in Joint Image-Feature Diffusion

    Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis

    cs.CVarXiv:2604.17492v12026
  14. Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

    Jinghui Lu, Jiayi Guan, Zhijian Huang +47

    cs.CVcs.CLcs.ROarXiv:2604.18486v32026
  15. MultiWorld: Scalable Multi-Agent Multi-View Video World Models

    Haoyu Wu, Jiwen Yu, Yingtian Zou +1

    cs.CVarXiv:2604.18564v22026
  16. MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

    Sua Lee, Sanghee Park, Jinbae Im

    cs.CLcs.AIcs.CVarXiv:2604.18164v32026
  17. HSG: Hyperbolic Scene Graph

    Liyang Wang, Zeyu Zhang, Hao Tang

    cs.CVarXiv:2604.17454v12026
  18. When Background Matters: Breaking Medical Vision Language Models by Transferable Attack

    Akash Ghosh, Subhadip Baidya, Sriparna Saha +1

    cs.CVarXiv:2604.17318v12026
  19. UniMesh: Unifying 3D Mesh Understanding and Generation

    Peng Huang, Yifeng Chen, Zeyu Zhang +1

    cs.CVarXiv:2604.17472v12026
  20. On the Transferability of Agricultural Weed Detection Under Cross-Field Distribution Shift

    Nikhilesh Prabhakar, Pranuthi Tenali, Wilfredo Abudeye Fernandez +5

    cs.CVcs.LGarXiv:2608.21254v12026
  21. Speculative Decoding for Autoregressive Video Generation

    Yuezhou Hu, Jintao Zhang

    cs.CVcs.AIarXiv:2604.17397v12026
  22. Mitigating Multimodal Hallucination via Phase-wise Self-reward

    Yu Zhang, Chuyang Sun, Kehai Chen +3

    cs.CVcs.CLarXiv:2604.17982v12026
  23. UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

    Jiaqi Wang, Haoge Deng, Ting Pan +5

    cs.CVcs.LGarXiv:2604.18518v42026
  24. CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation

    Chenglong Liu, Xin Zhang, Yimeng Zhu +5

    cs.GRcs.CVcs.LGarXiv:2608.20803v12026
  25. HP-Edit: A Human-Preference Post-Training Framework for Image Editing

    Fan Li, Chonghuinan Wang, Lina Lei +9

    cs.CVcs.AIarXiv:2604.19406v12026
  26. Chat2Workflow: A Benchmark for Generating Executable Visual Workflows with Natural Language

    Yi Zhong, Buqiang Xu, Yijun Wang +4

    cs.CLcs.AIcs.CVarXiv:2604.19667v22026
  27. CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

    Xiangyang Luo, Xiaozhe Xin, Tao Feng +3

    cs.CVarXiv:2604.19636v12026
  28. SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing

    Ying Zeng, Miaosen Luo, Guangyuan Li +10

    cs.CVarXiv:2604.19587v12026
  29. Learning Prostate Anatomy at Test Time for Cancer Detection in Micro-Ultrasound

    Obed Korshie Dzikunu, Mohammad Mahdi Abootorabi, Mohamed Harmanani +7

    cs.CVcs.LGarXiv:2608.20557v12026
  30. ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis

    Zhengwentai Sun, Keru Zheng, Chenghong Li +7

    cs.CVarXiv:2604.19720v12026
  31. Keep Your Friends Close, and the Right Neighbours Closer: Disaster-Conditioned Kernel-Regularized Graph Attention for Building Damage Classification

    Fuad Hasan, Chul Min Yeum

    cs.CVcs.LGarXiv:2608.20548v12026
  32. EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

    Yiyang Du, Zhanqiu Guo, Xin Ye +2

    cs.CVcs.AIcs.CLarXiv:2604.20012v12026
  33. Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates

    Hui Wei, Licai Sun, Guoying Zhao

    cs.CVcs.LGarXiv:2608.21160v12026
  34. RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models

    Yusuf Çelebi, Yağız Asker, Özay Ezerceli +4

    cs.LGcs.AIcs.CLarXiv:2604.19321v12026
  35. AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model

    Yutian Chen, Shi Guo, Renbiao Jin +7

    cs.CVarXiv:2604.19747v12026
  36. Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items

    Mengting Chen, Zhengrui Chen, Yongchao Du +16

    cs.CVarXiv:2604.19748v32026
  37. MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

    Zijie Li, Yichun Shi, Jingxiang Sun +8

    cs.CVcs.AIcs.LGarXiv:2604.19902v12026
  38. Visual Reasoning through Tool-supervised Reinforcement Learning

    Qihua Dong, Gozde Sahin, Pei Wang +4

    cs.CVarXiv:2604.19945v12026
  39. Exploring Spatial Intelligence from a Generative Perspective

    Muzhi Zhu, Shunyao Jiang, Huanyi Zheng +9

    cs.CVarXiv:2604.20570v12026
  40. DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation

    Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho +1

    cs.CVarXiv:2604.20841v12026
  41. Image Generators are Generalist Vision Learners

    Valentin Gabeur, Shangbang Long, Songyou Peng +22

    cs.CVcs.AIarXiv:2604.20329v32026
  42. Encoder-Free Human Motion Understanding via Structured Motion Descriptions

    Yao Zhang, Zhuchenyang Liu, Thomas Ploetz +1

    cs.CVarXiv:2604.21668v22026
  43. Vista4D: Video Reshooting with 4D Point Clouds

    Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca +9

    cs.CVarXiv:2604.21915v12026
  44. UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection

    Yanran Zhang, Wenzhao Zheng, Yifei Li +5

    cs.CVarXiv:2604.21904v12026
  45. WorldMark: A Unified Benchmark Suite for Interactive Video World Models

    Xiaojie Xu, Zhengyuan Lin, Kang He +5

    cs.CVarXiv:2604.21686v22026
  46. Seeing Fast and Slow: Learning the Flow of Time in Videos

    Yen-Siang Wu, Rundong Luo, Jingsen Zhu +6

    cs.CVcs.AIcs.GRarXiv:2604.21931v12026
  47. StyleID: A Perception-Aware Dataset and Metric for Stylization-Agnostic Facial Identity Recognition

    Kwan Yun, Changmin Lee, Ayeong Jeong +3

    cs.GRcs.CVcs.HCarXiv:2604.21689v12026
  48. LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

    Inclusion AI, Tiwei Bie, Haoxing Chen +15

    cs.CVarXiv:2604.20796v12026
  49. Building a Precise Video Language with Human-AI Oversight

    Zhiqiu Lin, Chancharik Mitra, Siyuan Cen +13

    cs.CVcs.AIcs.CLarXiv:2604.21718v22026
  50. Context Unrolling in Omni Models

    Ceyuan Yang, Zhijie Lin, Yang Zhao +16

    cs.CVarXiv:2604.21921v12026
  51. FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing

    Ze Chen, Lan Chen, Yuanhang Li +1

    cs.CVarXiv:2604.22586v12026
  52. Video Analysis and Generation via a Semantic Progress Function

    Gal Metzer, Sagi Polaczek, Ali Mahdavi-Amiri +2

    cs.CVarXiv:2604.22554v12026
  53. Decoupled Vision-Language System for Multimodal Understanding and Generation

    Yifan Xu, Baochen Xiong, Xiaoshan Yang +3

    cs.CLcs.CVarXiv:2608.20382v12026
  54. COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

    Chenghua Zhu, Zhaolu Kang, Qifan Shi +8

    cs.CVcs.CLcs.LGarXiv:2608.21030v12026
  55. MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

    Fatima Haouari, Carolina Scarton, Kalina Bontcheva

    cs.CVcs.CLcs.CYarXiv:2608.20984v12026
  56. Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images

    A. Said Gurbuz, Ahmed Nassar, Christoph Auer +8

    cs.CVcs.CLarXiv:2608.20868v12026
  57. CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents

    Jiancheng Wang, Mingli Zhu, Tong Zhang +4

    cs.CVcs.AIarXiv:2608.21114v12026
  58. A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

    Simon Vincent Abel, Heiko Hillenhagen, Michael Götz +3

    cs.CVcs.AIarXiv:2608.21140v12026
  59. Recognition in Terra Incognita

    Sara Beery, Grant van Horn, Pietro Perona

    cs.CVq-bio.PEarXiv:1807.04975v22018
  60. TRACE: Training-time Report-guided and Clinically Ordered Concept Editing

    Wentao Yue, Tianyou Lai, Jiayu Luo +4

    cs.CVcs.AIarXiv:2608.20809v12026