Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
17,821 to 17,880 of 18,867
NoPA: Non-Parametric Online 3D Scene Graph Generation
Qi Xun Yeo, Seungjun Lee, Yan Li +1
cs.CVarXiv:2607.00529v12026PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11
cs.CVarXiv:2607.00115v12026MemLearner: Learning to Query Context memory for Video World Models
Jiwen Yu, Jianxiong Gao, Jianhong Bai +7
cs.CVarXiv:2606.31734v12026Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting
Xiaobiao Du, YuAn Wang, Hao Li +3
cs.CVarXiv:2606.30017v12026GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
Sunqi Fan, Lingshan Chen, Runqi Yin +4
cs.AIcs.CLcs.CVarXiv:2606.29705v12026PoseShield: Neural Collision Fields for Human Self-Collision Resolution
Zhengyuan Li, Zeyun Deng, Yifan Shen +7
cs.CVarXiv:2606.29686v22026Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
Sunqi Fan, Qingle Liu, Runqi Yin +2
cs.CVcs.AIarXiv:2606.29445v12026Summaries:한국어EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting
Junwei Luo, Shuai Yuan, Zhenya Yang +3
cs.AIcs.CVarXiv:2606.27277v12026ShutterMuse: Capture-Time Photography Guidance with MLLMs
Jiayu Li, Yixiao Fang, Tianyu Hu +5
cs.CVarXiv:2606.25763v12026Summaries:한국어V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
Haoxiang Sun, Zhihang Yi, Langxuan Deng +6
cs.CVarXiv:2606.25319v12026Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild
Yehonathan Litman, Xiaoxuan Ma, Manan Shah +4
cs.CVarXiv:2606.23688v12026Semantic Browsing: Controllable Diversity for Image Generation
Sara Dorfman, Maya Vishnevsky, Omer Dahary +2
cs.CVcs.AIcs.GRarXiv:2606.23679v12026Summaries:한국어Safe Few-Step Generation via Velocity Editing
Yujin Choi, Jaehong Yoon
cs.CVcs.CYarXiv:2606.23267v12026FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs
Wenlong Cheng, Yuan Gan, Yunqiu Xu +1
cs.CVarXiv:2606.22875v12026RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation
Yuchuan Ding, Linfei Li, Lin Zhang +1
cs.CVarXiv:2606.22749v12026Summaries:한국어Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation
Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon +1
cs.CVarXiv:2606.20196v22026Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System
Jiazhao Zhang, Gengze Zhou, Hale Yin +32
cs.ROcs.CVarXiv:2606.18112v32026Context-Aware RL for Agentic and Multimodal LLMs
Peiyang Xu, Bangzheng Li, Sijia Liu +4
cs.CLcs.CVarXiv:2606.17053v12026MotionVLA: Vision-Language-Action Model for Humanoid Motion
Nonghai Zhang, Siyu Zhai, Yanjun Li +5
cs.CVcs.ROarXiv:2606.15142v12026High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation
Dongyang Liu, Ruoyi Du, David Liu +7
cs.CVarXiv:2606.12575v12026Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories
Kevin Qinghong Lin, Batu EI, Yuhong Shi +3
cs.CVcs.CLcs.CYarXiv:2606.11176v12026Direct 3D-Aware Object Insertion via Decomposed Visual Proxies
Jingbo Gong, Yikai Wang, Yushi Lan +6
cs.CVcs.AIcs.LGarXiv:2606.06601v12026AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation
Haobo Li, Yanhong Zeng, Yunhong Lu +6
cs.CVarXiv:2606.03972v22026NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation
NVIDIA, :, Aarti Basant +32
cs.CVcs.AIcs.ROarXiv:2606.03159v22026Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling
Seojeong Park, Jiho Choi, Junyong Kang +3
cs.CVcs.AIarXiv:2606.02578v12026RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes
Leyi Wu, Yifan Zhao, Jinjie Zhang +11
cs.CVarXiv:2606.00828v12026GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration
Xiangtao Kong, Jixin Zhao, Lingchen Sun +2
cs.CVarXiv:2605.31039v22026OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration
Xinchen Zhang, Bowei Liu, Jiale Liu +7
cs.CLcs.AIcs.CVarXiv:2605.28805v12026GEM: Generative Supervision Helps Embodied Intelligence
Ruowen Zhao, Bangguo Li, Zuyan Liu +9
cs.CVarXiv:2605.28548v12026LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
Shihao Wang, Shilong Liu, Yuanguo Kuang +10
cs.CVcs.AIcs.LGarXiv:2605.27365v22026Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang +86
cs.CVarXiv:2605.27295v12026Summaries:한국어Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution
Hongbo Wang, Huaibo Huang, Pin Wang +3
cs.CVcs.AIarXiv:2605.23264v22026AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild
Baiyu Chen, Zechen Li, Wilson Wongso +5
cs.CVcs.AIcs.CLarXiv:2605.22715v22026Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
Deyi Zhu, Yuji Wang, Yong Liu +4
cs.CVarXiv:2605.22538v12026ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison
Tianle Li, Xuyang Shen, Yan Ma +7
cs.LGcs.AIcs.CVarXiv:2605.20278v22026Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
Yuqi Tang, Yang Shi, Zhuoran Zhang +21
cs.CVarXiv:2605.18984v12026When Vision Speaks for Sound
Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6
cs.CVcs.SDarXiv:2605.16403v12026SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
Haoyi Zhu, Haozhe Liu, Yuyang Zhao +6
cs.CVarXiv:2605.15178v12026Summaries:한국어WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors
Keming Wu, Yijing Cui, Wenhan Xue +11
cs.CVarXiv:2605.10434v12026Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
Yicheng Ji, Zhizhou Zhong, Jun Zhang +7
cs.CVarXiv:2605.09681v12026CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
Joowon Kim, Seungho Shin, Joonhyung Park +1
cs.CVarXiv:2605.08735v12026RewardHarness: Self-Evolving Agentic Post-Training
Yuxuan Zhang, Penghui Du, Bo Li +11
cs.AIcs.CLcs.CVarXiv:2605.08703v12026Flow-OPD: On-Policy Distillation for Flow Matching Models
Zhen Fang, Wenxuan Huang, Yu Zeng +8
cs.CVcs.AIarXiv:2605.08063v52026Summaries:한국어STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
Ying Shen, Tianrong Chen, Yuan Gao +6
cs.CVcs.LGarXiv:2605.08029v12026InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
Bohan Hou, Jiuning Gu, Jiayan Guo +5
cs.CVcs.CLcs.IRarXiv:2605.07510v12026Summaries:한국어SplatWeaver: Learning to Allocate Gaussian Primitives for Generalizable Novel View Synthesis
Yecong Wan, Fan Li, Mingwen Shao +1
cs.CVarXiv:2605.07287v22026OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
Shuang Chen, Kaituo Feng, Hangting Chen +7
cs.CVarXiv:2605.05185v12026Summaries:한국어Assessing Pancreatic Ductal Adenocarcinoma Vascular Invasion: the PDACVI Benchmark
M. Riera-Marín, O. K. Sikha, J. Rodríguez-Comas +23
cs.CVarXiv:2604.27582v12026Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
Yupeng Zhou, Lianghua Huang, Zhifan Wu +7
cs.CVcs.SDarXiv:2604.25819v12026Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts
Meng Lou, Yunxiang Fu, Yizhou Yu
cs.LGcs.CVarXiv:2602.03473v22026FCOS: Fully Convolutional One-Stage Object Detection
Zhi Tian, Chunhua Shen, Hao Chen +1
cs.CVarXiv:1904.01355v52019nuScenes: A multimodal dataset for autonomous driving
Holger Caesar, Varun Bankiti, Alex H. Lang +7
cs.LGcs.CVcs.ROarXiv:1903.11027v52019Random Erasing Data Augmentation
Zhun Zhong, Liang Zheng, Guoliang Kang +2
cs.CVarXiv:1708.04896v22017Striving for Simplicity: The All Convolutional Net
Jost Tobias Springenberg, Alexey Dosovitskiy, Thomas Brox +1
cs.LGcs.CVcs.NEarXiv:1412.6806v32014MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
Haojie Zhang, Di Wu, Bingyan Liu +5
cs.CVarXiv:2604.23789v32026Summaries:한국어RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
Anthony Brohan, Noah Brown, Justice Carbajal +51
cs.ROcs.CLcs.CVarXiv:2307.15818v12023DETRs Beat YOLOs on Real-time Object Detection
Yian Zhao, Wenyu Lv, Shangliang Xu +5
cs.CVarXiv:2304.08069v32023Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
Shilong Liu, Zhaoyang Zeng, Tianhe Ren +9
cs.CVarXiv:2303.05499v52023Swin-Unet: Unet-like Pure Transformer for Medical Image Segmentation
Hu Cao, Yueyue Wang, Joy Chen +4
eess.IVcs.CVarXiv:2105.05537v12021Barlow Twins: Self-Supervised Learning via Redundancy Reduction
Jure Zbontar, Li Jing, Ishan Misra +2
cs.CVcs.AIcs.LGarXiv:2103.03230v32021