Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,661 to 18,720 of 18,811
Shieldstral
Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273
cs.CLcs.CVarXiv:2607.25857v22026Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
Haopeng Li, Yitong Li, Junsong Chen +8
cs.CVarXiv:2607.24027v12026Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark
Muyao Niu, Mingze Ma, Yifan Zhan +5
cs.CVarXiv:2607.29684v12026Generative World Renderer at the Speed of Play
Guixu Lin, Zheng-Hui Huang, Siqi Yang +3
cs.CVarXiv:2607.18703v12026QQWorld: Quantile-Quantile Matching for World Model Regularization
Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu
cs.LGcs.AIcs.CVarXiv:2607.28415v12026Style or Signature? Artist-Disjoint Evaluation of Style Classification in Frozen Vision Embeddings
Rory Ashton
cs.CVcs.LGarXiv:2608.14435v12026OpenLongTail: Generative Scaling of Long-Tail Driving Data
Lulin Liu, Nuo Chen, Yan Wang +15
cs.CVarXiv:2607.09655v12026HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement
Yiyang Cai, Nan Chen, Rongchang Xie +8
cs.CVarXiv:2607.18217v22026Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
Xu Wang, Kaixiang Yao, Miao Pan +4
cs.CVarXiv:2607.21072v12026TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
Yuhan Zhu, Changlian Ma, Xiangyu Zeng +12
cs.CVarXiv:2607.17423v12026UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
Grace Man Chen, Litao Guo, Yifan Wu +5
cs.SEcs.AIcs.CVarXiv:2607.06306v12026Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
Chongjian Ge, Hanwen Jiang, Tianyu Wang +9
cs.CVarXiv:2607.28611v12026Visual Contrastive Self-Distillation
Yijun Liang, Yunjie Tian, Yijiang Li +4
cs.CVcs.AIarXiv:2607.21556v12026Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
Yingmao Miao, Pengfei Zhang, Xiaochen Lv +5
cs.CVarXiv:2607.29025v22026ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
Yukang Cao, Haozhe Xie, Beichen Wen +13
cs.CVarXiv:2607.28625v12026See2Think: Do Multimodal Models Really Use Intermediate Visual States?
Siyu Yan, Zhuoran Yan, Haiying Xu +10
cs.CVcs.AIarXiv:2607.26769v12026OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation
Kaiyu Li, Zepeng Xin, Zixuan Jiang +4
cs.CVarXiv:2607.27278v22026CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
Lai Wei, Chengqi Li, Jiapeng Li +3
cs.CVcs.AIcs.CLarXiv:2607.25294v12026ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
Yao Xiao, Reuben Tan, Zhen Zhu +3
cs.CVcs.AIcs.LGarXiv:2607.28627v12026OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
Jun Zhan, Chen Yang, Yitian Gong +23
cs.SDcs.CVarXiv:2607.23855v22026HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
Simple AI, :, Yuteng Wei +16
cs.ROcs.CVcs.LGarXiv:2607.25895v12026StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
Zijun Lin, Zeqing Wang, Cheston Tan +2
cs.CVarXiv:2607.26754v12026GNM Head: A Generative aNthropometric Model of the human head
Stylianos Ploumpis, Jan Bednarik, Gaspard Zoss +26
cs.CVcs.GRarXiv:2607.23687v12026Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
Alexi Gladstone, Heng Ji, Yilun Du
cs.LGcs.AIcs.CLarXiv:2607.27372v12026Meshy T2: Fast Native Mesh Generation with Flow Matching
Jiale Xu, Rendong Liang, Yuhao Long +5
cs.GRcs.CVarXiv:2607.28675v32026JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
Yunlong Lin, Zixu Lin, Zhaohu Xing +23
cs.CVarXiv:2607.23588v12026DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
Jiaxing Li, Kai Zou, Cindy Zhou +7
cs.CVarXiv:2607.26811v12026UEmbed: Unified Sparse and Dense Multimodal Embeddings
Tingyu Song, Mingxin Li, Yanzhao Zhang +5
cs.CVcs.AIcs.CLarXiv:2608.02583v12026Data Pyramid for Embodied Manipulation: A Survey
Yifan Ye, Yankai Fu, Yaoxu Lv +26
cs.ROcs.CVarXiv:2607.24744v22026ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow
Dongxiu Liu, Haoyi Niu, Peng Cheng +5
cs.LGcs.CVcs.ROarXiv:2607.27924v22026VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
Yupeng Zheng, Kai Zou, Bin Liu +1
cs.CVarXiv:2607.12756v22026ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition
Jooyeol Yun, Jintae Park, Hyesu Lim +3
cs.CVarXiv:2607.25565v12026Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20
cs.CVcs.CLarXiv:2607.24904v12026Trajectory-aware Cross-view Geo-localization with Sequential Observations
Tianyi Gao, Jiayu Lin, Danielle Beaulieu +1
cs.CVarXiv:2607.15491v12026VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
Haodong Li, Tianfei Ren, Xiaoxiao Ma +25
cs.CVcs.AIarXiv:2607.27380v22026FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation
Hao Liu, Chenghuan Huang, Ye Huang +7
cs.CVarXiv:2607.16190v12026An Exam for Active Observers
Jiarui Zhang, Muzi Tao, Shangshang Wang +3
cs.CVcs.AIcs.CLarXiv:2607.16165v12026Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Zishuo Li, Bowen Yang, Changtao Miao +29
cs.ROcs.CVarXiv:2607.14183v22026TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Hengyi Xie, Chenfei Yao, Xianjin Wu +7
cs.CVcs.ROarXiv:2607.27205v12026Can Multimodal Large Language Models Understand OCT?
Baochen Fu, Wenzhi Deng, Baihao Jin +5
cs.CVcs.CLarXiv:2607.16609v12026Dataset Distillation by Influence Matching
Haoru Tan, Wang Wang, Sitong Wu +5
cs.CVarXiv:2607.16859v12026MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
Yingying Fan, Penghui Du, Leyan Zhu +10
cs.CVcs.AIarXiv:2608.14015v12026Secret-Stego Dissimilarity as a Design Axis: Invertible Coverless Image Steganography with Diffusion Models
Hongxin Xu, Jianping Mei, Can Wang +1
eess.IVcs.AIcs.CRarXiv:2608.13597v12026Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models
Jiaang Li, Chengzu Li, Zhaochong An +4
cs.CVarXiv:2607.26326v12026Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels
Vadym Vilhurin, Volodymyr Sydorskyi, Andrii Shevtsov
cs.SDcs.AIcs.CVarXiv:2608.14287v12026DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack
Hoseong Tae, Jong-Seok Lee
cs.CVcs.LGarXiv:2608.03207v12026Articulated Object Reconstruction from Rest-State Observation
Daeun Lee, Jaeah Lee, Woosung Kim +2
cs.CVcs.ROarXiv:2607.27749v12026FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
Kapil Wanaskar, Gaytri Jena, Aman Chadha +3
cs.AIcs.CVcs.LGarXiv:2608.01049v12026GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation
Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo +2
cs.CVarXiv:2608.02315v12026DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents
Tongsheng Ding, Zhen Luo, Yixuan Yang +4
cs.CVarXiv:2608.00486v12026SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
Sirun Li, Minghao Liu, Ling Dai +4
cs.CVcs.CLarXiv:2608.04244v12026Towards Interpretable Foundation Models for Retinal Fundus Images
Samuel Ofosu Mensah, Camila Roa, Kerol Djoumessi +1
cs.CVcs.LGstat.COarXiv:2603.18846v42026Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction
Zhongbin Guo, Jiahao Xie, Dongling Xiao +5
cs.CVarXiv:2608.12209v12026Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis
Zhishan Zou
cs.CVarXiv:2608.00440v12026JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
Shawn Li, Wei Yang, Jike Zhong +11
cs.CVcs.AIarXiv:2607.27670v22026Multi-Task Multi-Frame Visual Piano Transcription
Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1
cs.SDcs.AIcs.CVarXiv:2608.03419v12026StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field
Lingwei Dang, Shishuo Shang, Pan Liu +9
cs.CVarXiv:2608.01954v12026Voxel-based 3D Facies Segmentation from Seismic Data: A Comparative Study
Duc-Thanh Pham, Minh-Tan Pham, Anh Nguyen +1
cs.CVcs.AIarXiv:2608.14058v12026Content Based Video Narration of Gameplay with Vision Language Models
Mathew Varghese
cs.CVcs.AIcs.GRarXiv:2608.14016v12026ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
Mingxin Wang, Bin Hu, Bin Qian +12
cs.ROcs.CVarXiv:2607.28993v12026