Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,601 to 18,660 of 18,815
PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation
Ebenezer Tarubinga
cs.CVcs.AIcs.LGarXiv:2607.03068v12026FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation
Orest Kupyn, Goutam Bhat, Philipp Henzler +3
cs.CVarXiv:2606.24876v12026PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models
Xianghui Wang, Feng Chen, Wenbo Zhang +4
cs.CVarXiv:2606.22540v32026DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
Nan Chen, Yiyang Cai, Rongchang Xie +7
cs.CVarXiv:2606.26058v12026Fast LeWorldModel
Yuntian Gao, Xiangyu Xu
cs.LGcs.CVcs.ROarXiv:2606.26217v12026PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation
Chunshi Wang, Haohan Weng, Junliang Ye +9
cs.GRcs.CVarXiv:2606.30673v12026Hallucination in World Models is Predictable and Preventable
Nicklas Hansen, Xiaolong Wang
cs.LGcs.CVcs.ROarXiv:2606.27326v12026ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
Xumin Yu, Zuyan Liu, Zhenyu Yang +5
cs.CVarXiv:2606.27313v22026Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
Zekai Zhang, Jiahao Li, Jie Zhang +18
cs.CVarXiv:2606.26907v22026Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
Sijin Chen, Kaixuan Jiang, Haixin Shi +6
cs.ROcs.CVarXiv:2606.28133v12026ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
ZhengXian Wu, Hangrui Xu, Kai Shi +8
cs.CVcs.AIarXiv:2606.27974v12026AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
Kien T. Pham, I Chieh Chen, Qifeng Chen +1
cs.CVcs.MMcs.SDarXiv:2606.30811v12026Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views
Mijin Yoo, In Cho, Subin Jeon +3
cs.CVcs.GRarXiv:2606.29513v12026ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
Lingao Xiao, Yalun Dai, Yangyu Huang +17
cs.CVcs.AIcs.HCarXiv:2607.04438v22026Perceptual Flow Matching for Few-Step Generative Modeling
Chuyang Zhao, Yifei Song, Hongfa Wang +7
cs.CVarXiv:2607.03524v12026PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
Sensen Gao, Zhaoqing Wang, Qihang Cao +3
cs.CVarXiv:2607.05373v12026Vision Pretraining for Dense Spatial Perception
Zelin Fu, Bin Tan, Changjiang Sun +6
cs.CVarXiv:2607.05247v12026AlayaWorld: Long-Horizon and Playable Video World Generation
AlayaWorld Team, Kaipeng Zhang, Chuanhao Li +14
cs.CVcs.HCarXiv:2607.06291v12026Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
Hongyu Qu, Jianzhe Gao, Xiaobin Hu +6
cs.ROcs.CVarXiv:2607.07608v12026ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
Kaifeng Zhao, Mathis Petrovich, Haotian Zhang +3
cs.GRcs.CVcs.LGarXiv:2607.08741v12026PanoWorld: Real-World Panoramic Generation
Haoyuan Li, Dizhe Zhang, Yuemei Zhou +7
cs.CVarXiv:2607.09661v12026MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
Yuliang Liu, Zhang Li, Ziyang Zhang +11
cs.CVarXiv:2607.11562v12026KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
Yuqi Tang, Tengfei Liu, Yizheng Lai +18
cs.CVarXiv:2607.14202v12026OvisOCR2 Technical Report
Shiyin Lu, Yinglun Li, Yu Xia +10
cs.CVcs.AIarXiv:2607.13639v12026MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
Xiaohan Zhang, Yuqing Wen, Junlin Chen +9
cs.CVcs.SDarXiv:2607.14189v12026Video = World + Event Stream
Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +24
cs.CVarXiv:2607.15038v22026Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5
cs.CLcs.AIcs.CVarXiv:2606.22565v12026IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
Zixuan Li, Haokun Lin, Yicheng Xiao +10
cs.CVcs.AIarXiv:2606.24849v12026LISA: Likelihood Score Alignment for Visual-condition Controllable Generation
Yanghao Wang, Hongxu Chen, Jiazhen Liu +4
cs.CVarXiv:2606.27192v12026MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
Haoyu Chen, Kaichen Zhou, Hang Hua +11
cs.CVarXiv:2606.27537v62026SPEAR: A Simulator for Photorealistic Embodied AI Research
Mike Roberts, Renhan Wang, Rushikesh Zawar +10
cs.CVcs.AIcs.GRarXiv:2607.06701v12026PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
Yana Wei, Hongbo Peng, Yanlin Lai +14
cs.CVarXiv:2606.28322v22026Wan-Streamer v0.2: Higher Resolution, Same Latency
Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23
cs.CVcs.AIcs.GRarXiv:2607.04443v32026From Pixels to States: Rethinking Interactive World Models as Game Engines
Zhen Li, Zian Meng, Shuwei Shi +4
cs.CVarXiv:2607.14076v12026ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
Karan Goyal, Afreen Hossain, Debojyoti Das +1
cs.CVcs.AIcs.CLarXiv:2607.20092v12026SciForma: Structure-Faithful Generation of Scientific Diagrams
Yuxuan Luo, Peng Zhang, Xinjie Zhang +3
cs.CVcs.GRcs.LGarXiv:2607.18091v12026Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin
cs.CVarXiv:2607.21485v12026ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion
In Cho, Jeonghwan Cho, Mijin Yoo +2
cs.CVarXiv:2607.20417v22026SLAM in Low-Light Environments: Project Report
Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan +1
cs.ROcs.CVarXiv:2607.17699v12026Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels
Zhuchenyang Liu, Yao Zhang, Yu Xiao
cs.CVcs.CLcs.IRarXiv:2607.24651v12026Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering
Wenchao Ma, Changran Liu, Sharon X. Huang +1
cs.CVarXiv:2607.21848v22026Delineate Anything v2: A Global Foundation Model for Field Delineation
Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov +4
cs.CVarXiv:2607.19069v22026Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
Md Tanvirul Alam
cs.CVarXiv:2607.19790v12026HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis
Lingwei Dang, Juntong Li, Zonghan Li +5
cs.CVarXiv:2607.17097v12026SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
Junsong Chen, Jincheng Yu, Yitong Li +11
cs.CVarXiv:2607.21553v12026O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
Mei Yuan, Qi Long, Qifeng Wu +5
cs.CVcs.AIcs.CLarXiv:2607.18142v12026GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels
Xingyu Xiang, Shuang Hao, Fan Wang +2
cs.CVarXiv:2607.22135v22026OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis
Zihan Li, Feiyang Liu, Dandan Shan +2
cs.CVcs.AIcs.LGarXiv:2607.25108v12026UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4
cs.CVarXiv:2607.23373v12026Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
Sicheng Mo, Yuheng Li, Ziyang Leng +2
cs.CVarXiv:2607.21594v12026Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Yong Liu, Xiaolong Fu, Zihang Xu +10
cs.CVarXiv:2607.21694v12026ShotPlan: Cinematic Video Generation with Learnable Planning Token
Su Guo, Guangce Liu, Haosen Yang +7
cs.CVarXiv:2607.17675v12026SceneActBench: Can Agents Act on the 3D Scenes They See?
Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11
cs.AIcs.CVarXiv:2607.22393v12026dRAE: Representation Autoencoder with Hyper-Spherical Codes
Tianren Ma, Lin Long, Chuyan Chen +4
cs.CVcs.AIarXiv:2607.22148v12026Scaling Native Multimodal Pre-Training From Scratch
Haoyuan Wu, Aoqi Wu, Hai Wang +3
cs.CLcs.CVarXiv:2607.22043v12026Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Xinjie Zhang, Peng Zhang, Shicheng Zheng +21
cs.CVcs.AIcs.LGarXiv:2607.19064v22026StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Yan Yang, Xiangru Jian, Ziyang Luo +7
cs.SEcs.CVarXiv:2607.22798v12026Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
Maohua Li, Qirui Li, Yanke Zhou +10
cs.CVarXiv:2607.19139v22026Wonder: Video World Model Done Better
Jiacong Xu, Hanwen Jiang, Zhixin Shu +3
cs.CVcs.GRarXiv:2607.26037v12026Self-Supervised Learning of Structured Dynamics from Videos
Lukas Knobel, Andrew Zisserman, Yuki M. Asano
cs.CVarXiv:2607.21576v12026