Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
17,761 to 17,820 of 18,839
Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization
Xinxin Liu, Ming Li, Zonglin Lyu +2
cs.CVcs.AIarXiv:2604.24952v12026MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment
Yuan li, Youyuan Lin, Chenhui Chu +1
cs.CVcs.AIarXiv:2608.18579v12026Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models
Zongyang Qiu, Yihan Wu, Kaixuan Fan +2
cs.CVcs.AIarXiv:2608.17564v12026An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models
Dengyang Jiang, Ruoyi Du, Zhennan Chen +10
cs.CVarXiv:2608.16887v12026HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation
Junhao Hou, Chenqi Luo, Pufan Wang +5
cs.CVarXiv:2608.16485v12026RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning
Yanbo Jiang, Haotian Zheng, Jiahao Wang +10
cs.CVcs.AIarXiv:2608.16480v12026UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations
Zihan Ding, Longxu Dou, Qi Gao +26
cs.AIcs.CVarXiv:2608.15930v12026CardiacMamba: Fair and Robust RGB-RF Fusion for Remote Heart Rate Estimation via State Space Modeling
Bo Zhao, Zheng Wu, Yiping Xie +1
cs.CVcs.AIarXiv:2608.15831v12026MotionGS-SLAM: Event-Modulated Gaussian Splatting for Motion-Blur Robust SLAM
Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa
cs.ROcs.AIcs.CVarXiv:2608.15024v12026A Vision Transformer for ECG-Based Detection of Left Ventricular Systolic Dysfunction Across Multiple Clinical Sites
Burcu Ozek, Aruna Mohan, David Vorchheimer +5
cs.CVcs.LGarXiv:2608.14723v12026360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents
Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa +2
cs.CVcs.AIcs.LGarXiv:2608.08814v12026Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation
Kuan Xing, Ye Wang, Changyi Gan +4
cs.CVcs.AIarXiv:2608.06751v12026Summaries:한국어World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation
Yuhao Pan, Haosong Peng, Zhengshen Zhang +8
cs.ROcs.CVarXiv:2608.05369v12026Douyin Multimodal Embedding Model Technical Report
Haonan Chen, Chu Li, Zhicheng Wang +4
cs.IRcs.CLcs.CVarXiv:2608.02148v12026SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
Ruiteng Zhao, Zhengshen Zhang, Yue Su +6
cs.ROcs.CVarXiv:2608.01397v12026LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation
Rongxiang Zhang, Songhua Liu
cs.CVcs.SDarXiv:2608.00079v12026ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures
Fahad Ahmed, Sören Auer, Jennifer D'Souza
cs.CVarXiv:2607.26848v12026Summaries:한국어Self Gradient Forcing: Native Long Video Extrapolation
Junhao Zhuang, Shiyi Zhang, Yuxuan Bian +11
cs.CVarXiv:2607.20368v22026Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation
Amber Yijia Zheng, Lu Liu, Raymond A. Yeh +1
cs.CVarXiv:2607.18789v12026DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation
Eungjune Shim, Hansol Lee, Eunjung Ju
cs.CVarXiv:2607.13365v12026UniVR: Thinking in Visual Space for Unified Visual Reasoning
Zhongwei Ren, Yunchao Wei, Yao Zhao +5
cs.CVarXiv:2607.12800v12026Color Pass-Through via Camera-Display Coupling
Ruikang Li, Molin Li, Jiarui Wu +3
cs.CVarXiv:2607.12746v12026Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
Gong Sitong, Tianyu Yan, Caixin Kang +6
cs.CVcs.AIarXiv:2607.11523v12026ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams
Xiaokang Ma, Yifan Sun, Zhihong Jin +6
cs.CVcs.AIarXiv:2607.09759v22026Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
Shuailei Ma, Jiaqi Liao, Xinyang Wang +24
cs.CVarXiv:2607.07675v12026WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence
Xiangyu Han, Mengyu Yang, Jiaqi Li +9
cs.CVarXiv:2607.06838v12026Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
Hongyu Li, Wanjia Fu, Xiaoyan Cong +11
cs.ROcs.CVarXiv:2607.05390v12026Summaries:한국어Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
Haozhe Wang, Weijia Feng, Jinpeng Yu +8
cs.CVcs.AIarXiv:2607.05382v42026PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
Haofei Xu, Rundi Wu, Philipp Henzler +7
cs.CVarXiv:2607.02515v12026Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment
Ziyao Wang, Maonan Wang, Yucheng He +5
cs.CVarXiv:2607.02471v12026ACID: Action Consistency via Inverse Dynamics for Planning with World Models
Gawon Seo, Dongwon Kim, Suha Kwak
cs.ROcs.AIcs.CVarXiv:2607.02403v12026Optimizing Visual Generative Models via Distribution-wise Rewards
Ruihang Li, Mengde Xu, Shuyang Gu +4
cs.LGcs.CVarXiv:2607.02291v12026NoPA: Non-Parametric Online 3D Scene Graph Generation
Qi Xun Yeo, Seungjun Lee, Yan Li +1
cs.CVarXiv:2607.00529v12026PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11
cs.CVarXiv:2607.00115v12026MemLearner: Learning to Query Context memory for Video World Models
Jiwen Yu, Jianxiong Gao, Jianhong Bai +7
cs.CVarXiv:2606.31734v12026Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting
Xiaobiao Du, YuAn Wang, Hao Li +3
cs.CVarXiv:2606.30017v12026GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
Sunqi Fan, Lingshan Chen, Runqi Yin +4
cs.AIcs.CLcs.CVarXiv:2606.29705v12026PoseShield: Neural Collision Fields for Human Self-Collision Resolution
Zhengyuan Li, Zeyun Deng, Yifan Shen +7
cs.CVarXiv:2606.29686v22026Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
Sunqi Fan, Qingle Liu, Runqi Yin +2
cs.CVcs.AIarXiv:2606.29445v12026Summaries:한국어EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting
Junwei Luo, Shuai Yuan, Zhenya Yang +3
cs.AIcs.CVarXiv:2606.27277v12026ShutterMuse: Capture-Time Photography Guidance with MLLMs
Jiayu Li, Yixiao Fang, Tianyu Hu +5
cs.CVarXiv:2606.25763v12026Summaries:한국어V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
Haoxiang Sun, Zhihang Yi, Langxuan Deng +6
cs.CVarXiv:2606.25319v12026Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild
Yehonathan Litman, Xiaoxuan Ma, Manan Shah +4
cs.CVarXiv:2606.23688v12026Semantic Browsing: Controllable Diversity for Image Generation
Sara Dorfman, Maya Vishnevsky, Omer Dahary +2
cs.CVcs.AIcs.GRarXiv:2606.23679v12026Summaries:한국어Safe Few-Step Generation via Velocity Editing
Yujin Choi, Jaehong Yoon
cs.CVcs.CYarXiv:2606.23267v12026FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs
Wenlong Cheng, Yuan Gan, Yunqiu Xu +1
cs.CVarXiv:2606.22875v12026RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation
Yuchuan Ding, Linfei Li, Lin Zhang +1
cs.CVarXiv:2606.22749v12026Summaries:한국어Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation
Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon +1
cs.CVarXiv:2606.20196v22026Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System
Jiazhao Zhang, Gengze Zhou, Hale Yin +32
cs.ROcs.CVarXiv:2606.18112v32026Context-Aware RL for Agentic and Multimodal LLMs
Peiyang Xu, Bangzheng Li, Sijia Liu +4
cs.CLcs.CVarXiv:2606.17053v12026MotionVLA: Vision-Language-Action Model for Humanoid Motion
Nonghai Zhang, Siyu Zhai, Yanjun Li +5
cs.CVcs.ROarXiv:2606.15142v12026High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation
Dongyang Liu, Ruoyi Du, David Liu +7
cs.CVarXiv:2606.12575v12026Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories
Kevin Qinghong Lin, Batu EI, Yuhong Shi +3
cs.CVcs.CLcs.CYarXiv:2606.11176v12026Direct 3D-Aware Object Insertion via Decomposed Visual Proxies
Jingbo Gong, Yikai Wang, Yushi Lan +6
cs.CVcs.AIcs.LGarXiv:2606.06601v12026AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation
Haobo Li, Yanhong Zeng, Yunhong Lu +6
cs.CVarXiv:2606.03972v22026NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation
NVIDIA, :, Aarti Basant +32
cs.CVcs.AIcs.ROarXiv:2606.03159v22026Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling
Seojeong Park, Jiho Choi, Junyong Kang +3
cs.CVcs.AIarXiv:2606.02578v12026RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes
Leyi Wu, Yifan Zhao, Jinjie Zhang +11
cs.CVarXiv:2606.00828v12026GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration
Xiangtao Kong, Jixin Zhao, Lingchen Sun +2
cs.CVarXiv:2605.31039v22026OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration
Xinchen Zhang, Bowei Liu, Jiale Liu +7
cs.CLcs.AIcs.CVarXiv:2605.28805v12026