Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,661 to 18,720 of 18,811

  1. Shieldstral

    Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273

    cs.CLcs.CVarXiv:2607.25857v22026
  2. Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

    Haopeng Li, Yitong Li, Junsong Chen +8

    cs.CVarXiv:2607.24027v12026
  3. Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

    Muyao Niu, Mingze Ma, Yifan Zhan +5

    cs.CVarXiv:2607.29684v12026
  4. Generative World Renderer at the Speed of Play

    Guixu Lin, Zheng-Hui Huang, Siqi Yang +3

    cs.CVarXiv:2607.18703v12026
  5. QQWorld: Quantile-Quantile Matching for World Model Regularization

    Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

    cs.LGcs.AIcs.CVarXiv:2607.28415v12026
  6. Style or Signature? Artist-Disjoint Evaluation of Style Classification in Frozen Vision Embeddings

    Rory Ashton

    cs.CVcs.LGarXiv:2608.14435v12026
  7. OpenLongTail: Generative Scaling of Long-Tail Driving Data

    Lulin Liu, Nuo Chen, Yan Wang +15

    cs.CVarXiv:2607.09655v12026
  8. HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

    Yiyang Cai, Nan Chen, Rongchang Xie +8

    cs.CVarXiv:2607.18217v22026
  9. Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

    Xu Wang, Kaixiang Yao, Miao Pan +4

    cs.CVarXiv:2607.21072v12026
  10. TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

    Yuhan Zhu, Changlian Ma, Xiangyu Zeng +12

    cs.CVarXiv:2607.17423v12026
  11. UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

    Grace Man Chen, Litao Guo, Yifan Wu +5

    cs.SEcs.AIcs.CVarXiv:2607.06306v12026
  12. Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

    Chongjian Ge, Hanwen Jiang, Tianyu Wang +9

    cs.CVarXiv:2607.28611v12026
  13. Visual Contrastive Self-Distillation

    Yijun Liang, Yunjie Tian, Yijiang Li +4

    cs.CVcs.AIarXiv:2607.21556v12026
  14. Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

    Yingmao Miao, Pengfei Zhang, Xiaochen Lv +5

    cs.CVarXiv:2607.29025v22026
  15. ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

    Yukang Cao, Haozhe Xie, Beichen Wen +13

    cs.CVarXiv:2607.28625v12026
  16. See2Think: Do Multimodal Models Really Use Intermediate Visual States?

    Siyu Yan, Zhuoran Yan, Haiying Xu +10

    cs.CVcs.AIarXiv:2607.26769v12026
  17. OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

    Kaiyu Li, Zepeng Xin, Zixuan Jiang +4

    cs.CVarXiv:2607.27278v22026
  18. CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

    Lai Wei, Chengqi Li, Jiapeng Li +3

    cs.CVcs.AIcs.CLarXiv:2607.25294v12026
  19. ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

    Yao Xiao, Reuben Tan, Zhen Zhu +3

    cs.CVcs.AIcs.LGarXiv:2607.28627v12026
  20. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jun Zhan, Chen Yang, Yitian Gong +23

    cs.SDcs.CVarXiv:2607.23855v22026
  21. HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

    Simple AI, :, Yuteng Wei +16

    cs.ROcs.CVcs.LGarXiv:2607.25895v12026
  22. StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

    Zijun Lin, Zeqing Wang, Cheston Tan +2

    cs.CVarXiv:2607.26754v12026
  23. GNM Head: A Generative aNthropometric Model of the human head

    Stylianos Ploumpis, Jan Bednarik, Gaspard Zoss +26

    cs.CVcs.GRarXiv:2607.23687v12026
  24. Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

    Alexi Gladstone, Heng Ji, Yilun Du

    cs.LGcs.AIcs.CLarXiv:2607.27372v12026
  25. Meshy T2: Fast Native Mesh Generation with Flow Matching

    Jiale Xu, Rendong Liang, Yuhao Long +5

    cs.GRcs.CVarXiv:2607.28675v32026
  26. JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

    Yunlong Lin, Zixu Lin, Zhaohu Xing +23

    cs.CVarXiv:2607.23588v12026
  27. DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

    Jiaxing Li, Kai Zou, Cindy Zhou +7

    cs.CVarXiv:2607.26811v12026
  28. UEmbed: Unified Sparse and Dense Multimodal Embeddings

    Tingyu Song, Mingxin Li, Yanzhao Zhang +5

    cs.CVcs.AIcs.CLarXiv:2608.02583v12026
  29. Data Pyramid for Embodied Manipulation: A Survey

    Yifan Ye, Yankai Fu, Yaoxu Lv +26

    cs.ROcs.CVarXiv:2607.24744v22026
  30. ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

    Dongxiu Liu, Haoyi Niu, Peng Cheng +5

    cs.LGcs.CVcs.ROarXiv:2607.27924v22026
  31. VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

    Yupeng Zheng, Kai Zou, Bin Liu +1

    cs.CVarXiv:2607.12756v22026
  32. ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

    Jooyeol Yun, Jintae Park, Hyesu Lim +3

    cs.CVarXiv:2607.25565v12026
  33. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20

    cs.CVcs.CLarXiv:2607.24904v12026
  34. Trajectory-aware Cross-view Geo-localization with Sequential Observations

    Tianyi Gao, Jiayu Lin, Danielle Beaulieu +1

    cs.CVarXiv:2607.15491v12026
  35. VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

    Haodong Li, Tianfei Ren, Xiaoxiao Ma +25

    cs.CVcs.AIarXiv:2607.27380v22026
  36. FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

    Hao Liu, Chenghuan Huang, Ye Huang +7

    cs.CVarXiv:2607.16190v12026
  37. An Exam for Active Observers

    Jiarui Zhang, Muzi Tao, Shangshang Wang +3

    cs.CVcs.AIcs.CLarXiv:2607.16165v12026
  38. Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

    Zishuo Li, Bowen Yang, Changtao Miao +29

    cs.ROcs.CVarXiv:2607.14183v22026
  39. TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

    Hengyi Xie, Chenfei Yao, Xianjin Wu +7

    cs.CVcs.ROarXiv:2607.27205v12026
  40. Can Multimodal Large Language Models Understand OCT?

    Baochen Fu, Wenzhi Deng, Baihao Jin +5

    cs.CVcs.CLarXiv:2607.16609v12026
  41. Dataset Distillation by Influence Matching

    Haoru Tan, Wang Wang, Sitong Wu +5

    cs.CVarXiv:2607.16859v12026
  42. MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

    Yingying Fan, Penghui Du, Leyan Zhu +10

    cs.CVcs.AIarXiv:2608.14015v12026
  43. Secret-Stego Dissimilarity as a Design Axis: Invertible Coverless Image Steganography with Diffusion Models

    Hongxin Xu, Jianping Mei, Can Wang +1

    eess.IVcs.AIcs.CRarXiv:2608.13597v12026
  44. Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

    Jiaang Li, Chengzu Li, Zhaochong An +4

    cs.CVarXiv:2607.26326v12026
  45. Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels

    Vadym Vilhurin, Volodymyr Sydorskyi, Andrii Shevtsov

    cs.SDcs.AIcs.CVarXiv:2608.14287v12026
  46. DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack

    Hoseong Tae, Jong-Seok Lee

    cs.CVcs.LGarXiv:2608.03207v12026
  47. Articulated Object Reconstruction from Rest-State Observation

    Daeun Lee, Jaeah Lee, Woosung Kim +2

    cs.CVcs.ROarXiv:2607.27749v12026
  48. FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds

    Kapil Wanaskar, Gaytri Jena, Aman Chadha +3

    cs.AIcs.CVcs.LGarXiv:2608.01049v12026
  49. GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

    Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo +2

    cs.CVarXiv:2608.02315v12026
  50. DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

    Tongsheng Ding, Zhen Luo, Yixuan Yang +4

    cs.CVarXiv:2608.00486v12026
  51. SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

    Sirun Li, Minghao Liu, Ling Dai +4

    cs.CVcs.CLarXiv:2608.04244v12026
  52. Towards Interpretable Foundation Models for Retinal Fundus Images

    Samuel Ofosu Mensah, Camila Roa, Kerol Djoumessi +1

    cs.CVcs.LGstat.COarXiv:2603.18846v42026
  53. Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

    Zhongbin Guo, Jiahao Xie, Dongling Xiao +5

    cs.CVarXiv:2608.12209v12026
  54. Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis

    Zhishan Zou

    cs.CVarXiv:2608.00440v12026
  55. JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

    Shawn Li, Wei Yang, Jike Zhong +11

    cs.CVcs.AIarXiv:2607.27670v22026
  56. Multi-Task Multi-Frame Visual Piano Transcription

    Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1

    cs.SDcs.AIcs.CVarXiv:2608.03419v12026
  57. StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

    Lingwei Dang, Shishuo Shang, Pan Liu +9

    cs.CVarXiv:2608.01954v12026
  58. Voxel-based 3D Facies Segmentation from Seismic Data: A Comparative Study

    Duc-Thanh Pham, Minh-Tan Pham, Anh Nguyen +1

    cs.CVcs.AIarXiv:2608.14058v12026
  59. Content Based Video Narration of Gameplay with Vision Language Models

    Mathew Varghese

    cs.CVcs.AIcs.GRarXiv:2608.14016v12026
  60. ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

    Mingxin Wang, Bin Hu, Bin Qian +12

    cs.ROcs.CVarXiv:2607.28993v12026