Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,501 to 16,560 of 18,817
Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation
Hongzhou Zhu, Min Zhao, Guande He +3
cs.CVarXiv:2602.02214v52026GigaWorld-Policy: An Efficient Action-Centered World--Action Model
Angen Ye, Boyuan Wang, Chaojun Ni +21
cs.CVarXiv:2603.17240v22026Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
Christopher Clark, Jieyu Zhang, Zixian Ma +18
cs.CVcs.AIarXiv:2601.10611v42026Causal World Modeling for Robot Control
Lin Li, Qihang Zhang, Yiming Luo +9
cs.CVcs.ROarXiv:2601.21998v22026SkillNet: Create, Evaluate, and Connect AI Skills
Yuan Liang, Ruobin Zhong, Haoming Xu +47
cs.AIcs.CLcs.CVarXiv:2603.04448v22026One-step Latent-free Image Generation with Pixel Mean Flows
Yiyang Lu, Susie Lu, Qiao Sun +6
cs.CVarXiv:2601.22158v32026Helios: Real Real-Time Long Video Generation Model
Shenghai Yuan, Yuanyang Yin, Zongjian Li +3
cs.CVarXiv:2603.04379v12026VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
Jingwen Sun, Wenyao Zhang, Zekun Qi +6
cs.ROcs.CVarXiv:2602.10098v22026OpenClaw-RL: Train Any Agent Simply by Talking
Yinjie Wang, Xuyang Chen, Xiaolong Jin +2
cs.CLcs.AIcs.CVarXiv:2603.10165v22026ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning
Yandan Yang, Shuang Zeng, Tong Lin +11
cs.CVcs.CLcs.ROarXiv:2602.11236v22026A Pragmatic VLA Foundation Model
Wei Wu, Fan Lu, Yunnan Wang +22
cs.ROcs.CVarXiv:2601.18692v42026SAM 3D Body: Robust Full-Body Human Mesh Recovery
Xitong Yang, Devansh Kukreja, Don Pinkus +11
cs.CVarXiv:2602.15989v12026V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar +6
cs.CVarXiv:2603.14482v32026Advancing Open-source World Models
Robbyant Team, Zelin Gao, Qiuyu Wang +21
cs.CVarXiv:2601.20540v12026DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
Shenyuan Gao, William Liang, Kaiyuan Zheng +27
cs.ROcs.AIcs.CVarXiv:2602.06949v12026World Action Models are Zero-shot Policies
Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng +33
cs.ROcs.CVcs.LGarXiv:2602.15922v12026Human-Centric Intelligence in the Era of Foundation Models: A Survey
Yang Chen, Tianqi Wang, Xiaorui Jiang +13
cs.CVarXiv:2608.18184v12026Summaries:한국어EgoSim: Egocentric World Simulator for Embodied Interaction Generation
Jinkun Hao, Mingda Jia, Ruiyan Wang +7
cs.CVcs.AIarXiv:2604.01001v22026RecGen3D: Reconstruction-Guided 3D Generation in a Shared Canonical Space
Zhisheng Huang, Jiahao Chen, Cheng Lin +10
cs.CVarXiv:2604.01479v32026PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
Nan Wang, Zhiwei Jin, Chen Chen +1
cs.CVcs.AIcs.CLarXiv:2604.00886v12026Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment
Zhuchenyang Liu, Yao Zhang, Yu Xiao
cs.CVcs.CLarXiv:2604.00913v22026FlowSlider: Training-Free Continuous Image Editing via Fidelity-Steering Decomposition
Taichi Endo, Guoqing Hao, Kazuhiko Sumi
cs.CVarXiv:2604.02088v12026DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data
Wonjoon Jin, Jiyun Won, Janghyeok Han +4
cs.CVarXiv:2604.01666v12026VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
Jiahao Meng, Tan Yue, Qi Xu +7
cs.CVcs.MMarXiv:2604.01569v12026VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
Haz Sameen Shahgir, Xiaofu Chen, Yu Fu +4
cs.CVcs.CLarXiv:2604.02486v32026Generative World Renderer
Zheng-Hui Huang, Zhixiang Wang, Jiaming Tan +6
cs.CVarXiv:2604.02329v12026LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar +2
cs.CVcs.CLarXiv:2604.00829v32026All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
Xinyu Tian, Shu Zou, Zhaoyuan Yang +3
cs.CVarXiv:2604.00479v12026AutoMIA: Improved Baselines for Membership Inference Attack via Agentic Self-Exploration
Ruhao Liu, Weiqi Huang, Qi Li +1
cs.CRcs.CVarXiv:2604.01014v12026HippoCamp: Benchmarking Contextual Agents on Personal Computers
Zhe Yang, Shulin Tian, Kairui Hu +9
cs.AIcs.CVarXiv:2604.01221v12026Summaries:한국어ActionParty: Multi-Subject Action Binding in Generative Video Games
Alexander Pondaven, Ziyi Wu, Igor Gilitschenski +4
cs.CVcs.AIcs.LGarXiv:2604.02330v22026Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models
Jiawei Chen, Simin Huang, Jiawei Du +5
cs.CVcs.AIarXiv:2604.01618v12026Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation
Chongjie Ye, Cheng Cao, Chuanyu Pan +4
cs.CVcs.AIarXiv:2604.02289v12026UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
Yongkang Li, Lijun Zhou, Sixu Yan +11
cs.CVcs.ROarXiv:2604.02190v12026GPA: Learning GUI Process Automation from Demonstrations
Zirui Zhao, Jun Hao Liew, Yan Yang +5
cs.CVcs.AIcs.SEarXiv:2604.01676v22026LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model
Jiachun Jin, Zetong Zhou, Xiao Yang +4
cs.CVcs.LGarXiv:2604.02097v12026Steerable Visual Representations
Jona Ruthardt, Manu Gaur, Deva Ramanan +2
cs.CVcs.AIarXiv:2604.02327v22026DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
Yang Zhou, Xiaofeng Wang, Hao Shao +8
cs.CVcs.AIcs.ROarXiv:2604.01765v12026A Simple Baseline for Streaming Video Understanding
Yujiao Shen, Shulin Tian, Jingkang Yang +1
cs.CVarXiv:2604.02317v12026Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation
Xingtong Ge, Yi Zhang, Yushi Huang +6
cs.CVeess.IVarXiv:2604.03118v22026Token Warping Helps MLLMs Look from Nearby Viewpoints
Phillip Y. Lee, Chanho Park, Mingue Park +3
cs.CVarXiv:2604.02870v12026Significance and Stability Analysis of Genotype-Environment Interaction using GxEStat
Meng'en Qin, Zhe Li, Hui Huang +1
cs.CVstat.AParXiv:2604.03337v32026Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization
Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee +7
cs.CVarXiv:2606.11180v12026Addressable Memory for Video World Models
Xindi Wu, Sven Elflein, James Lucas +5
cs.CVcs.LGarXiv:2608.07408v12026PLUME: Latent Reasoning Based Universal Multimodal Embedding
Chenwei He, Xiangzhao Hao, Tianyu Yang +6
cs.CVarXiv:2604.02073v32026Summaries:한국어Watch Before You Answer: Learning from Visually Grounded Post-Training
Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang +8
cs.CVcs.AIcs.CLarXiv:2604.05117v12026SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
Yicheng Xiao, Wenhu Zhang, Lin Song +10
cs.CVarXiv:2604.04911v22026SciLT: Long-tailed Image Classification under Scientific Image Domains
Jiahao Chen, Bing Su
cs.CVarXiv:2604.03687v32026TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
Weian Mao, Xi Lin, Wei Huang +5
cs.CLcs.CVarXiv:2604.04921v12026Training a Student Expert via Semi-Supervised Foundation Model Distillation
Pardis Taghavi, Tian Liu, Renjie Li +2
cs.CVarXiv:2604.03841v12026Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling?
Peter Yongho Kim, Juhyeon Park, Jungwoo Park +4
cs.CVarXiv:2604.03619v12026AURA: Always-On Understanding and Real-Time Assistance via Video Streams
Xudong Lu, Yang Bo, Jinpeng Chen +9
cs.CVarXiv:2604.04184v12026A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
Tianle Chen, Deepti Ghadiyaram
cs.CVcs.SDarXiv:2604.03995v12026CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
Xiangzhao Hao, Zefeng Zhang, Zhenyu Zhang +6
cs.CVarXiv:2604.04780v12026AvatarPointillist: AutoRegressive 4D Gaussian Avatarization
Hongyu Liu, Xuan Wang, Zijian Wu +7
cs.CVarXiv:2604.04787v22026Vero: An Open RL Recipe for General Visual Reasoning
Gabriel Sarch, Linrong Cai, Qunzhong Wang +3
cs.CVcs.AIcs.CLarXiv:2604.04917v32026Less Detail, Better Answers: Degradation-Driven Prompting for VQA
Haoxuan Han, Weijie Wang, Zeyu Zhang +2
cs.CVarXiv:2604.04838v22026FileGram: Grounding Agent Personalization in File-System Behavioral Traces
Shuai Liu, Shulin Tian, Kairui Hu +6
cs.CVcs.AIarXiv:2604.04901v12026OpenWorldLib: A Unified Codebase and Definition of Advanced World Models
DataFlow Team, Bohan Zeng, Daili Hua +39
cs.CVarXiv:2604.04707v22026MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
Bin Wang, Tianyao He, Linke Ouyang +40
cs.CVcs.CLarXiv:2604.04771v22026