Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

17,821 to 17,880 of 18,867

  1. NoPA: Non-Parametric Online 3D Scene Graph Generation

    Qi Xun Yeo, Seungjun Lee, Yan Li +1

    cs.CVarXiv:2607.00529v12026
  2. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11

    cs.CVarXiv:2607.00115v12026
  3. MemLearner: Learning to Query Context memory for Video World Models

    Jiwen Yu, Jianxiong Gao, Jianhong Bai +7

    cs.CVarXiv:2606.31734v12026
  4. Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

    Xiaobiao Du, YuAn Wang, Hao Li +3

    cs.CVarXiv:2606.30017v12026
  5. GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

    Sunqi Fan, Lingshan Chen, Runqi Yin +4

    cs.AIcs.CLcs.CVarXiv:2606.29705v12026
  6. PoseShield: Neural Collision Fields for Human Self-Collision Resolution

    Zhengyuan Li, Zeyun Deng, Yifan Shen +7

    cs.CVarXiv:2606.29686v22026
  7. Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

    Sunqi Fan, Qingle Liu, Runqi Yin +2

    cs.CVcs.AIarXiv:2606.29445v12026
    Summaries:한국어
  8. EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

    Junwei Luo, Shuai Yuan, Zhenya Yang +3

    cs.AIcs.CVarXiv:2606.27277v12026
  9. ShutterMuse: Capture-Time Photography Guidance with MLLMs

    Jiayu Li, Yixiao Fang, Tianyu Hu +5

    cs.CVarXiv:2606.25763v12026
    Summaries:한국어
  10. V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

    Haoxiang Sun, Zhihang Yi, Langxuan Deng +6

    cs.CVarXiv:2606.25319v12026
  11. Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild

    Yehonathan Litman, Xiaoxuan Ma, Manan Shah +4

    cs.CVarXiv:2606.23688v12026
  12. Semantic Browsing: Controllable Diversity for Image Generation

    Sara Dorfman, Maya Vishnevsky, Omer Dahary +2

    cs.CVcs.AIcs.GRarXiv:2606.23679v12026
    Summaries:한국어
  13. Safe Few-Step Generation via Velocity Editing

    Yujin Choi, Jaehong Yoon

    cs.CVcs.CYarXiv:2606.23267v12026
  14. FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

    Wenlong Cheng, Yuan Gan, Yunqiu Xu +1

    cs.CVarXiv:2606.22875v12026
  15. RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

    Yuchuan Ding, Linfei Li, Lin Zhang +1

    cs.CVarXiv:2606.22749v12026
    Summaries:한국어
  16. Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation

    Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon +1

    cs.CVarXiv:2606.20196v22026
  17. Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

    Jiazhao Zhang, Gengze Zhou, Hale Yin +32

    cs.ROcs.CVarXiv:2606.18112v32026
  18. Context-Aware RL for Agentic and Multimodal LLMs

    Peiyang Xu, Bangzheng Li, Sijia Liu +4

    cs.CLcs.CVarXiv:2606.17053v12026
  19. MotionVLA: Vision-Language-Action Model for Humanoid Motion

    Nonghai Zhang, Siyu Zhai, Yanjun Li +5

    cs.CVcs.ROarXiv:2606.15142v12026
  20. High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation

    Dongyang Liu, Ruoyi Du, David Liu +7

    cs.CVarXiv:2606.12575v12026
  21. Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

    Kevin Qinghong Lin, Batu EI, Yuhong Shi +3

    cs.CVcs.CLcs.CYarXiv:2606.11176v12026
  22. Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

    Jingbo Gong, Yikai Wang, Yushi Lan +6

    cs.CVcs.AIcs.LGarXiv:2606.06601v12026
  23. AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation

    Haobo Li, Yanhong Zeng, Yunhong Lu +6

    cs.CVarXiv:2606.03972v22026
  24. NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

    NVIDIA, :, Aarti Basant +32

    cs.CVcs.AIcs.ROarXiv:2606.03159v22026
  25. Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

    Seojeong Park, Jiho Choi, Junyong Kang +3

    cs.CVcs.AIarXiv:2606.02578v12026
  26. RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes

    Leyi Wu, Yifan Zhao, Jinjie Zhang +11

    cs.CVarXiv:2606.00828v12026
  27. GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

    Xiangtao Kong, Jixin Zhao, Lingchen Sun +2

    cs.CVarXiv:2605.31039v22026
  28. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    Xinchen Zhang, Bowei Liu, Jiale Liu +7

    cs.CLcs.AIcs.CVarXiv:2605.28805v12026
  29. GEM: Generative Supervision Helps Embodied Intelligence

    Ruowen Zhao, Bangguo Li, Zuyan Liu +9

    cs.CVarXiv:2605.28548v12026
  30. LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

    Shihao Wang, Shilong Liu, Yuanguo Kuang +10

    cs.CVcs.AIcs.LGarXiv:2605.27365v22026
  31. Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

    Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang +86

    cs.CVarXiv:2605.27295v12026
    Summaries:한국어
  32. Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution

    Hongbo Wang, Huaibo Huang, Pin Wang +3

    cs.CVcs.AIarXiv:2605.23264v22026
  33. AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

    Baiyu Chen, Zechen Li, Wilson Wongso +5

    cs.CVcs.AIcs.CLarXiv:2605.22715v22026
  34. Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking

    Deyi Zhu, Yuji Wang, Yong Liu +4

    cs.CVarXiv:2605.22538v12026
  35. ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison

    Tianle Li, Xuyang Shen, Yan Ma +7

    cs.LGcs.AIcs.CVarXiv:2605.20278v22026
  36. Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

    Yuqi Tang, Yang Shi, Zhuoran Zhang +21

    cs.CVarXiv:2605.18984v12026
  37. When Vision Speaks for Sound

    Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6

    cs.CVcs.SDarXiv:2605.16403v12026
  38. SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

    Haoyi Zhu, Haozhe Liu, Yuyang Zhao +6

    cs.CVarXiv:2605.15178v12026
    Summaries:한국어
  39. WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

    Keming Wu, Yijing Cui, Wenhan Xue +11

    cs.CVarXiv:2605.10434v12026
  40. Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models

    Yicheng Ji, Zhizhou Zhong, Jun Zhang +7

    cs.CVarXiv:2605.09681v12026
  41. CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

    Joowon Kim, Seungho Shin, Joonhyung Park +1

    cs.CVarXiv:2605.08735v12026
  42. RewardHarness: Self-Evolving Agentic Post-Training

    Yuxuan Zhang, Penghui Du, Bo Li +11

    cs.AIcs.CLcs.CVarXiv:2605.08703v12026
  43. Flow-OPD: On-Policy Distillation for Flow Matching Models

    Zhen Fang, Wenxuan Huang, Yu Zeng +8

    cs.CVcs.AIarXiv:2605.08063v52026
    Summaries:한국어
  44. STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

    Ying Shen, Tianrong Chen, Yuan Gao +6

    cs.CVcs.LGarXiv:2605.08029v12026
  45. InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

    Bohan Hou, Jiuning Gu, Jiayan Guo +5

    cs.CVcs.CLcs.IRarXiv:2605.07510v12026
    Summaries:한국어
  46. SplatWeaver: Learning to Allocate Gaussian Primitives for Generalizable Novel View Synthesis

    Yecong Wan, Fan Li, Mingwen Shao +1

    cs.CVarXiv:2605.07287v22026
  47. OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents

    Shuang Chen, Kaituo Feng, Hangting Chen +7

    cs.CVarXiv:2605.05185v12026
    Summaries:한국어
  48. Assessing Pancreatic Ductal Adenocarcinoma Vascular Invasion: the PDACVI Benchmark

    M. Riera-Marín, O. K. Sikha, J. Rodríguez-Comas +23

    cs.CVarXiv:2604.27582v12026
  49. Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

    Yupeng Zhou, Lianghua Huang, Zhifan Wu +7

    cs.CVcs.SDarXiv:2604.25819v12026
  50. Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts

    Meng Lou, Yunxiang Fu, Yizhou Yu

    cs.LGcs.CVarXiv:2602.03473v22026
  51. FCOS: Fully Convolutional One-Stage Object Detection

    Zhi Tian, Chunhua Shen, Hao Chen +1

    cs.CVarXiv:1904.01355v52019
  52. nuScenes: A multimodal dataset for autonomous driving

    Holger Caesar, Varun Bankiti, Alex H. Lang +7

    cs.LGcs.CVcs.ROarXiv:1903.11027v52019
  53. Random Erasing Data Augmentation

    Zhun Zhong, Liang Zheng, Guoliang Kang +2

    cs.CVarXiv:1708.04896v22017
  54. Striving for Simplicity: The All Convolutional Net

    Jost Tobias Springenberg, Alexey Dosovitskiy, Thomas Brox +1

    cs.LGcs.CVcs.NEarXiv:1412.6806v32014
  55. MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

    Haojie Zhang, Di Wu, Bingyan Liu +5

    cs.CVarXiv:2604.23789v32026
    Summaries:한국어
  56. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

    Anthony Brohan, Noah Brown, Justice Carbajal +51

    cs.ROcs.CLcs.CVarXiv:2307.15818v12023
  57. DETRs Beat YOLOs on Real-time Object Detection

    Yian Zhao, Wenyu Lv, Shangliang Xu +5

    cs.CVarXiv:2304.08069v32023
  58. Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

    Shilong Liu, Zhaoyang Zeng, Tianhe Ren +9

    cs.CVarXiv:2303.05499v52023
  59. Swin-Unet: Unet-like Pure Transformer for Medical Image Segmentation

    Hu Cao, Yueyue Wang, Joy Chen +4

    eess.IVcs.CVarXiv:2105.05537v12021
  60. Barlow Twins: Self-Supervised Learning via Redundancy Reduction

    Jure Zbontar, Li Jing, Ishan Misra +2

    cs.CVcs.AIcs.LGarXiv:2103.03230v32021