Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

17,761 to 17,820 of 18,839

  1. Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization

    Xinxin Liu, Ming Li, Zonglin Lyu +2

    cs.CVcs.AIarXiv:2604.24952v12026
  2. MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

    Yuan li, Youyuan Lin, Chenhui Chu +1

    cs.CVcs.AIarXiv:2608.18579v12026
  3. Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models

    Zongyang Qiu, Yihan Wu, Kaixuan Fan +2

    cs.CVcs.AIarXiv:2608.17564v12026
  4. An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

    Dengyang Jiang, Ruoyi Du, Zhennan Chen +10

    cs.CVarXiv:2608.16887v12026
  5. HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation

    Junhao Hou, Chenqi Luo, Pufan Wang +5

    cs.CVarXiv:2608.16485v12026
  6. RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning

    Yanbo Jiang, Haotian Zheng, Jiahao Wang +10

    cs.CVcs.AIarXiv:2608.16480v12026
  7. UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

    Zihan Ding, Longxu Dou, Qi Gao +26

    cs.AIcs.CVarXiv:2608.15930v12026
  8. CardiacMamba: Fair and Robust RGB-RF Fusion for Remote Heart Rate Estimation via State Space Modeling

    Bo Zhao, Zheng Wu, Yiping Xie +1

    cs.CVcs.AIarXiv:2608.15831v12026
  9. MotionGS-SLAM: Event-Modulated Gaussian Splatting for Motion-Blur Robust SLAM

    Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa

    cs.ROcs.AIcs.CVarXiv:2608.15024v12026
  10. A Vision Transformer for ECG-Based Detection of Left Ventricular Systolic Dysfunction Across Multiple Clinical Sites

    Burcu Ozek, Aruna Mohan, David Vorchheimer +5

    cs.CVcs.LGarXiv:2608.14723v12026
  11. 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

    Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa +2

    cs.CVcs.AIcs.LGarXiv:2608.08814v12026
  12. Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation

    Kuan Xing, Ye Wang, Changyi Gan +4

    cs.CVcs.AIarXiv:2608.06751v12026
    Summaries:한국어
  13. World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

    Yuhao Pan, Haosong Peng, Zhengshen Zhang +8

    cs.ROcs.CVarXiv:2608.05369v12026
  14. Douyin Multimodal Embedding Model Technical Report

    Haonan Chen, Chu Li, Zhicheng Wang +4

    cs.IRcs.CLcs.CVarXiv:2608.02148v12026
  15. SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

    Ruiteng Zhao, Zhengshen Zhang, Yue Su +6

    cs.ROcs.CVarXiv:2608.01397v12026
  16. LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

    Rongxiang Zhang, Songhua Liu

    cs.CVcs.SDarXiv:2608.00079v12026
  17. ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures

    Fahad Ahmed, Sören Auer, Jennifer D'Souza

    cs.CVarXiv:2607.26848v12026
    Summaries:한국어
  18. Self Gradient Forcing: Native Long Video Extrapolation

    Junhao Zhuang, Shiyi Zhang, Yuxuan Bian +11

    cs.CVarXiv:2607.20368v22026
  19. Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

    Amber Yijia Zheng, Lu Liu, Raymond A. Yeh +1

    cs.CVarXiv:2607.18789v12026
  20. DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

    Eungjune Shim, Hansol Lee, Eunjung Ju

    cs.CVarXiv:2607.13365v12026
  21. UniVR: Thinking in Visual Space for Unified Visual Reasoning

    Zhongwei Ren, Yunchao Wei, Yao Zhao +5

    cs.CVarXiv:2607.12800v12026
  22. Color Pass-Through via Camera-Display Coupling

    Ruikang Li, Molin Li, Jiarui Wu +3

    cs.CVarXiv:2607.12746v12026
  23. Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

    Gong Sitong, Tianyu Yan, Caixin Kang +6

    cs.CVcs.AIarXiv:2607.11523v12026
  24. ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams

    Xiaokang Ma, Yifan Sun, Zhihong Jin +6

    cs.CVcs.AIarXiv:2607.09759v22026
  25. Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

    Shuailei Ma, Jiaqi Liao, Xinyang Wang +24

    cs.CVarXiv:2607.07675v12026
  26. WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence

    Xiangyu Han, Mengyu Yang, Jiaqi Li +9

    cs.CVarXiv:2607.06838v12026
  27. Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

    Hongyu Li, Wanjia Fu, Xiaoyan Cong +11

    cs.ROcs.CVarXiv:2607.05390v12026
    Summaries:한국어
  28. Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

    Haozhe Wang, Weijia Feng, Jinpeng Yu +8

    cs.CVcs.AIarXiv:2607.05382v42026
  29. PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

    Haofei Xu, Rundi Wu, Philipp Henzler +7

    cs.CVarXiv:2607.02515v12026
  30. Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment

    Ziyao Wang, Maonan Wang, Yucheng He +5

    cs.CVarXiv:2607.02471v12026
  31. ACID: Action Consistency via Inverse Dynamics for Planning with World Models

    Gawon Seo, Dongwon Kim, Suha Kwak

    cs.ROcs.AIcs.CVarXiv:2607.02403v12026
  32. Optimizing Visual Generative Models via Distribution-wise Rewards

    Ruihang Li, Mengde Xu, Shuyang Gu +4

    cs.LGcs.CVarXiv:2607.02291v12026
  33. NoPA: Non-Parametric Online 3D Scene Graph Generation

    Qi Xun Yeo, Seungjun Lee, Yan Li +1

    cs.CVarXiv:2607.00529v12026
  34. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11

    cs.CVarXiv:2607.00115v12026
  35. MemLearner: Learning to Query Context memory for Video World Models

    Jiwen Yu, Jianxiong Gao, Jianhong Bai +7

    cs.CVarXiv:2606.31734v12026
  36. Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

    Xiaobiao Du, YuAn Wang, Hao Li +3

    cs.CVarXiv:2606.30017v12026
  37. GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

    Sunqi Fan, Lingshan Chen, Runqi Yin +4

    cs.AIcs.CLcs.CVarXiv:2606.29705v12026
  38. PoseShield: Neural Collision Fields for Human Self-Collision Resolution

    Zhengyuan Li, Zeyun Deng, Yifan Shen +7

    cs.CVarXiv:2606.29686v22026
  39. Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

    Sunqi Fan, Qingle Liu, Runqi Yin +2

    cs.CVcs.AIarXiv:2606.29445v12026
    Summaries:한국어
  40. EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

    Junwei Luo, Shuai Yuan, Zhenya Yang +3

    cs.AIcs.CVarXiv:2606.27277v12026
  41. ShutterMuse: Capture-Time Photography Guidance with MLLMs

    Jiayu Li, Yixiao Fang, Tianyu Hu +5

    cs.CVarXiv:2606.25763v12026
    Summaries:한국어
  42. V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

    Haoxiang Sun, Zhihang Yi, Langxuan Deng +6

    cs.CVarXiv:2606.25319v12026
  43. Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild

    Yehonathan Litman, Xiaoxuan Ma, Manan Shah +4

    cs.CVarXiv:2606.23688v12026
  44. Semantic Browsing: Controllable Diversity for Image Generation

    Sara Dorfman, Maya Vishnevsky, Omer Dahary +2

    cs.CVcs.AIcs.GRarXiv:2606.23679v12026
    Summaries:한국어
  45. Safe Few-Step Generation via Velocity Editing

    Yujin Choi, Jaehong Yoon

    cs.CVcs.CYarXiv:2606.23267v12026
  46. FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

    Wenlong Cheng, Yuan Gan, Yunqiu Xu +1

    cs.CVarXiv:2606.22875v12026
  47. RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

    Yuchuan Ding, Linfei Li, Lin Zhang +1

    cs.CVarXiv:2606.22749v12026
    Summaries:한국어
  48. Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation

    Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon +1

    cs.CVarXiv:2606.20196v22026
  49. Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

    Jiazhao Zhang, Gengze Zhou, Hale Yin +32

    cs.ROcs.CVarXiv:2606.18112v32026
  50. Context-Aware RL for Agentic and Multimodal LLMs

    Peiyang Xu, Bangzheng Li, Sijia Liu +4

    cs.CLcs.CVarXiv:2606.17053v12026
  51. MotionVLA: Vision-Language-Action Model for Humanoid Motion

    Nonghai Zhang, Siyu Zhai, Yanjun Li +5

    cs.CVcs.ROarXiv:2606.15142v12026
  52. High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation

    Dongyang Liu, Ruoyi Du, David Liu +7

    cs.CVarXiv:2606.12575v12026
  53. Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

    Kevin Qinghong Lin, Batu EI, Yuhong Shi +3

    cs.CVcs.CLcs.CYarXiv:2606.11176v12026
  54. Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

    Jingbo Gong, Yikai Wang, Yushi Lan +6

    cs.CVcs.AIcs.LGarXiv:2606.06601v12026
  55. AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation

    Haobo Li, Yanhong Zeng, Yunhong Lu +6

    cs.CVarXiv:2606.03972v22026
  56. NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

    NVIDIA, :, Aarti Basant +32

    cs.CVcs.AIcs.ROarXiv:2606.03159v22026
  57. Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

    Seojeong Park, Jiho Choi, Junyong Kang +3

    cs.CVcs.AIarXiv:2606.02578v12026
  58. RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes

    Leyi Wu, Yifan Zhao, Jinjie Zhang +11

    cs.CVarXiv:2606.00828v12026
  59. GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

    Xiangtao Kong, Jixin Zhao, Lingchen Sun +2

    cs.CVarXiv:2605.31039v22026
  60. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    Xinchen Zhang, Bowei Liu, Jiale Liu +7

    cs.CLcs.AIcs.CVarXiv:2605.28805v12026