Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,601 to 18,660 of 18,815

  1. PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation

    Ebenezer Tarubinga

    cs.CVcs.AIcs.LGarXiv:2607.03068v12026
  2. FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

    Orest Kupyn, Goutam Bhat, Philipp Henzler +3

    cs.CVarXiv:2606.24876v12026
  3. PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

    Xianghui Wang, Feng Chen, Wenbo Zhang +4

    cs.CVarXiv:2606.22540v32026
  4. DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation

    Nan Chen, Yiyang Cai, Rongchang Xie +7

    cs.CVarXiv:2606.26058v12026
  5. Fast LeWorldModel

    Yuntian Gao, Xiangyu Xu

    cs.LGcs.CVcs.ROarXiv:2606.26217v12026
  6. PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

    Chunshi Wang, Haohan Weng, Junliang Ye +9

    cs.GRcs.CVarXiv:2606.30673v12026
  7. Hallucination in World Models is Predictable and Preventable

    Nicklas Hansen, Xiaolong Wang

    cs.LGcs.CVcs.ROarXiv:2606.27326v12026
  8. ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

    Xumin Yu, Zuyan Liu, Zhenyu Yang +5

    cs.CVarXiv:2606.27313v22026
  9. Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

    Zekai Zhang, Jiahao Li, Jie Zhang +18

    cs.CVarXiv:2606.26907v22026
  10. Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

    Sijin Chen, Kaixuan Jiang, Haixin Shi +6

    cs.ROcs.CVarXiv:2606.28133v12026
  11. ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

    ZhengXian Wu, Hangrui Xu, Kai Shi +8

    cs.CVcs.AIarXiv:2606.27974v12026
  12. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Kien T. Pham, I Chieh Chen, Qifeng Chen +1

    cs.CVcs.MMcs.SDarXiv:2606.30811v12026
  13. Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

    Mijin Yoo, In Cho, Subin Jeon +3

    cs.CVcs.GRarXiv:2606.29513v12026
  14. ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

    Lingao Xiao, Yalun Dai, Yangyu Huang +17

    cs.CVcs.AIcs.HCarXiv:2607.04438v22026
  15. Perceptual Flow Matching for Few-Step Generative Modeling

    Chuyang Zhao, Yifei Song, Hongfa Wang +7

    cs.CVarXiv:2607.03524v12026
  16. PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

    Sensen Gao, Zhaoqing Wang, Qihang Cao +3

    cs.CVarXiv:2607.05373v12026
  17. Vision Pretraining for Dense Spatial Perception

    Zelin Fu, Bin Tan, Changjiang Sun +6

    cs.CVarXiv:2607.05247v12026
  18. AlayaWorld: Long-Horizon and Playable Video World Generation

    AlayaWorld Team, Kaipeng Zhang, Chuanhao Li +14

    cs.CVcs.HCarXiv:2607.06291v12026
  19. Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

    Hongyu Qu, Jianzhe Gao, Xiaobin Hu +6

    cs.ROcs.CVarXiv:2607.07608v12026
  20. ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

    Kaifeng Zhao, Mathis Petrovich, Haotian Zhang +3

    cs.GRcs.CVcs.LGarXiv:2607.08741v12026
  21. PanoWorld: Real-World Panoramic Generation

    Haoyuan Li, Dizhe Zhang, Yuemei Zhou +7

    cs.CVarXiv:2607.09661v12026
  22. MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

    Yuliang Liu, Zhang Li, Ziyang Zhang +11

    cs.CVarXiv:2607.11562v12026
  23. KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

    Yuqi Tang, Tengfei Liu, Yizheng Lai +18

    cs.CVarXiv:2607.14202v12026
  24. OvisOCR2 Technical Report

    Shiyin Lu, Yinglun Li, Yu Xia +10

    cs.CVcs.AIarXiv:2607.13639v12026
  25. MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

    Xiaohan Zhang, Yuqing Wen, Junlin Chen +9

    cs.CVcs.SDarXiv:2607.14189v12026
  26. Video = World + Event Stream

    Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +24

    cs.CVarXiv:2607.15038v22026
  27. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

    Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5

    cs.CLcs.AIcs.CVarXiv:2606.22565v12026
  28. IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

    Zixuan Li, Haokun Lin, Yicheng Xiao +10

    cs.CVcs.AIarXiv:2606.24849v12026
  29. LISA: Likelihood Score Alignment for Visual-condition Controllable Generation

    Yanghao Wang, Hongxu Chen, Jiazhen Liu +4

    cs.CVarXiv:2606.27192v12026
  30. MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

    Haoyu Chen, Kaichen Zhou, Hang Hua +11

    cs.CVarXiv:2606.27537v62026
  31. SPEAR: A Simulator for Photorealistic Embodied AI Research

    Mike Roberts, Renhan Wang, Rushikesh Zawar +10

    cs.CVcs.AIcs.GRarXiv:2607.06701v12026
  32. PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

    Yana Wei, Hongbo Peng, Yanlin Lai +14

    cs.CVarXiv:2606.28322v22026
  33. Wan-Streamer v0.2: Higher Resolution, Same Latency

    Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23

    cs.CVcs.AIcs.GRarXiv:2607.04443v32026
  34. From Pixels to States: Rethinking Interactive World Models as Game Engines

    Zhen Li, Zian Meng, Shuwei Shi +4

    cs.CVarXiv:2607.14076v12026
  35. ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

    Karan Goyal, Afreen Hossain, Debojyoti Das +1

    cs.CVcs.AIcs.CLarXiv:2607.20092v12026
  36. SciForma: Structure-Faithful Generation of Scientific Diagrams

    Yuxuan Luo, Peng Zhang, Xinjie Zhang +3

    cs.CVcs.GRcs.LGarXiv:2607.18091v12026
  37. Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

    Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin

    cs.CVarXiv:2607.21485v12026
  38. ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

    In Cho, Jeonghwan Cho, Mijin Yoo +2

    cs.CVarXiv:2607.20417v22026
  39. SLAM in Low-Light Environments: Project Report

    Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan +1

    cs.ROcs.CVarXiv:2607.17699v12026
  40. Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

    Zhuchenyang Liu, Yao Zhang, Yu Xiao

    cs.CVcs.CLcs.IRarXiv:2607.24651v12026
  41. Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

    Wenchao Ma, Changran Liu, Sharon X. Huang +1

    cs.CVarXiv:2607.21848v22026
  42. Delineate Anything v2: A Global Foundation Model for Field Delineation

    Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov +4

    cs.CVarXiv:2607.19069v22026
  43. Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

    Md Tanvirul Alam

    cs.CVarXiv:2607.19790v12026
  44. HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

    Lingwei Dang, Juntong Li, Zonghan Li +5

    cs.CVarXiv:2607.17097v12026
  45. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

    Junsong Chen, Jincheng Yu, Yitong Li +11

    cs.CVarXiv:2607.21553v12026
  46. O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

    Mei Yuan, Qi Long, Qifeng Wu +5

    cs.CVcs.AIcs.CLarXiv:2607.18142v12026
  47. GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels

    Xingyu Xiang, Shuang Hao, Fan Wang +2

    cs.CVarXiv:2607.22135v22026
  48. OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

    Zihan Li, Feiyang Liu, Dandan Shan +2

    cs.CVcs.AIcs.LGarXiv:2607.25108v12026
  49. UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

    Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4

    cs.CVarXiv:2607.23373v12026
  50. Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

    Sicheng Mo, Yuheng Li, Ziyang Leng +2

    cs.CVarXiv:2607.21594v12026
  51. Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

    Yong Liu, Xiaolong Fu, Zihang Xu +10

    cs.CVarXiv:2607.21694v12026
  52. ShotPlan: Cinematic Video Generation with Learnable Planning Token

    Su Guo, Guangce Liu, Haosen Yang +7

    cs.CVarXiv:2607.17675v12026
  53. SceneActBench: Can Agents Act on the 3D Scenes They See?

    Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11

    cs.AIcs.CVarXiv:2607.22393v12026
  54. dRAE: Representation Autoencoder with Hyper-Spherical Codes

    Tianren Ma, Lin Long, Chuyan Chen +4

    cs.CVcs.AIarXiv:2607.22148v12026
  55. Scaling Native Multimodal Pre-Training From Scratch

    Haoyuan Wu, Aoqi Wu, Hai Wang +3

    cs.CLcs.CVarXiv:2607.22043v12026
  56. Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

    Xinjie Zhang, Peng Zhang, Shicheng Zheng +21

    cs.CVcs.AIcs.LGarXiv:2607.19064v22026
  57. StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

    Yan Yang, Xiangru Jian, Ziyang Luo +7

    cs.SEcs.CVarXiv:2607.22798v12026
  58. Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

    Maohua Li, Qirui Li, Yanke Zhou +10

    cs.CVarXiv:2607.19139v22026
  59. Wonder: Video World Model Done Better

    Jiacong Xu, Hanwen Jiang, Zhixin Shu +3

    cs.CVcs.GRarXiv:2607.26037v12026
  60. Self-Supervised Learning of Structured Dynamics from Videos

    Lukas Knobel, Andrew Zisserman, Yuki M. Asano

    cs.CVarXiv:2607.21576v12026