Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,181 to 18,240 of 18,839

  1. Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

    Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja

    cs.CVcs.AIcs.LGarXiv:2606.15134v12026
  2. Selective Synergistic Learning for Video Object-Centric Learning

    WonJun Moon, Jae-Pil Heo

    cs.CVcs.AIarXiv:2606.15527v12026
  3. SpatialAvatar-0: High-Quality 4D Head Avatar with Multi-Stage Reconstruction

    Yiran Wang, Zeyu Zhang, Yuanming Li +2

    cs.CVarXiv:2606.15659v12026
  4. When Do Diffusion Models learn to Generate Multiple Objects?

    Yujin Jeong, Arnas Uselis, Iro Laina +2

    cs.CVcs.AIarXiv:2605.00273v22026
  5. PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory

    Shuai Yang, Bingjie Gao, Ziwei Liu +3

    cs.CVarXiv:2606.16449v22026
  6. BRDFusion: Physics Meets Generation for Urban Scene Inverse Rendering

    Yi-Ruei Liu, Jie-Ying Lee, Zheng-Hui Huang +2

    cs.CVarXiv:2606.17049v12026
  7. Text-Vision Co-Instructed Image Editing

    Chenxi Xie, Yuhui Wu, Qiaosi Yi +1

    cs.CVarXiv:2606.16767v12026
  8. ProCUA-SFT Technical Report

    Jaehun Jung, Ximing Lu, Brandon Cui +11

    cs.LGcs.CVarXiv:2606.17321v12026
  9. Hardware-in-the-Loop Phase-Aware CNN for Real-Time 5G Channel Estimation

    Javad Zolfaghari-Bengar, Rakibul Rony, Elisa Gomez-de-Lope +3

    eess.SPcs.CVcs.ITarXiv:2608.14709v12026
  10. Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling

    Yang Zhao, Peisong Niu, Tian Zhou +5

    cs.LGcs.AIcs.CVarXiv:2608.14652v12026
  11. ARGUS: Attention-Guided Transformers for Scalable Person Identification Using Wi-Fi Telemetry

    Nayan Sanjay Bhatia, Pranay Kocheta, Yuhan Li +1

    cs.LGcs.AIcs.CVarXiv:2608.14670v12026
  12. SpIn-ViT: Designing a Sparsity-Induced Vision Transformer That Is Mechanistically Interpretable

    Philip H. Lee, Parth Padalkar

    cs.CVcs.AIarXiv:2608.14922v12026
  13. Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

    Bruno Chicelli, Henrique Alves, Rodrigo Anselmo +3

    cs.CLcs.AIcs.CVarXiv:2608.15032v12026
  14. On Cross-Validation for Hyperparameter Optimization of Deep Learning Image Classifiers

    Ljubomir Buturovic

    cs.CVcs.LGarXiv:2608.14705v12026
  15. Beyond Boundary Noise: Aggregated Aleatoric Uncertainty Fails to Capture Presence Ambiguity in 3D Lung Nodule Segmentation

    Simon Baur, Arne Schernich, Ekin Böke +2

    cs.CVcs.LGarXiv:2608.14766v12026
  16. PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection

    Chengyao Jia, Ruixuan Wang

    cs.CVcs.LGarXiv:2608.15802v12026
  17. Geometry of Forgetting: Representation Flux in Continual Learning

    Maksim A. Kazanskii

    cs.LGcs.CVarXiv:2608.15854v12026
  18. Identifying Confusion Trends in Concept-based XAI for Multi-Label Classification

    Haadia Amjad, Ronald Tetzlaff

    cs.CVcs.AIarXiv:2608.15731v12026
  19. RRFC: Recursive Refinement via Feedback Conditioning for Iterative Image-to-Image Generation

    Kareem Hassani, Chaymaa Abbas, Hadi Al Mubasher +1

    cs.CVcs.AIarXiv:2608.15694v12026
  20. EMASAM: a Computationally Efficient Sharpness-Aware Minimization via EMA-Guided Perturbations

    Tanapat Ratchatorn, Masayuki Tanaka

    cs.LGcs.CVarXiv:2608.15105v12026
  21. Adaptive Volumetric Mechanical Property Fields Invariant to Resolution

    Rishit Dagli, Donglai Xiang, Vismay Modi +4

    cs.CVcs.LGcs.ROarXiv:2606.18231v12026
  22. Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

    Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma +3

    cs.CVcs.AIcs.ROarXiv:2606.20980v12026
  23. LooseControlVideo: Directorial Video Control using Spatial Blocking

    Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli

    cs.CVarXiv:2606.19495v12026
  24. StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

    Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal +2

    cs.CLcs.CVarXiv:2606.20527v12026
  25. JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

    Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang +1

    cs.CVarXiv:2606.20563v12026
  26. CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

    Yifan Shen, Pei Tian, Xinzhuo Li +8

    cs.CVarXiv:2606.20970v12026
  27. Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

    Yatai Ji, An-Chieh Cheng, Yang Fu +13

    cs.CVcs.AIarXiv:2606.17539v12026
  28. GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

    Haoyu Wang, Guoqing Ma, Zeyu Zhang +3

    cs.CVcs.ROarXiv:2606.17480v12026
  29. Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

    Shengyuan Ding, Xilin Wei, Xinyu Fang +4

    cs.CVarXiv:2606.19338v12026
  30. PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

    Yueyi Sun, Yuhao Wang, Jason Li +8

    cs.CVcs.AIcs.CLarXiv:2606.19534v12026
  31. Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

    Kangsheng Duan, Ziyang Xu, Wenyu Liu +3

    cs.CVarXiv:2606.19195v12026
  32. HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining

    Juncheng Ma, Jianxin Bi, Yufan Deng +19

    cs.CVarXiv:2606.20521v12026
  33. DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

    Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi +6

    cs.CVcs.AIarXiv:2604.13416v32026
  34. Toward Parking Spot Occupancy Recognition: A Self-Supervised Approach

    Luan Marko Kujavski, Rayson Laroca, Paulo Lisboa de Almeida

    cs.CVarXiv:2606.20886v12026
  35. QG-MIL: A Gated Transformer Aggregator for Domain-Agnostic Multiple Instance Learning in Medical Imaging

    Luca Zedda, Davide Antonio Mura, Cecilia Di Ruberto +4

    cs.CVarXiv:2606.20027v12026
  36. Arbor: Explicit Geometric Conditioning for Controllable 3D Asset Generation

    Jan-Niklas Dihlmann, Andreas Engelhardt, Simon Donne +2

    cs.CVcs.GRarXiv:2606.23514v12026
  37. Vera: A Layered Diffusion Model for Content-Preserving Video Editing

    Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein +2

    cs.CVarXiv:2606.23610v12026
  38. VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

    Haoling Li, Kai Zheng, Jie Wu +4

    cs.AIcs.CLcs.CVarXiv:2606.23543v12026
  39. Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation

    Rui Wang, Quentin Lohmeyer, Siyu Tang +1

    cs.CVarXiv:2606.22197v12026
  40. Sapiens2

    Rawal Khirodkar, He Wen, Julieta Martinez +3

    cs.CVarXiv:2604.21681v12026
  41. MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

    Dongxia Liu, Jie Ma, Xiaochen Yang +7

    cs.GRcs.CVcs.LGarXiv:2605.13857v12026
  42. Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning

    Ido Sobol, Kihyuk Sohn, Yoav Blum +4

    cs.GRcs.CVcs.LGarXiv:2605.13852v12026
  43. IAM: Identity-Aware Human Motion and Shape Joint Generation

    Wenqi Jia, Zekun Li, Abhay Mittal +6

    cs.CVarXiv:2604.25164v12026
  44. V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think

    Bingda Tang, Yuhui Zhang, Xiaohan Wang +3

    cs.LGcs.CVarXiv:2604.23380v12026
  45. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Zhen Ye, Xu Tan, Aoxiong Yin +8

    cs.CVcs.CLcs.MMarXiv:2604.23586v22026
  46. aDSL: Agentic 3D Creation via Joint Agent-Program Design

    Rui-Huan Wang, Si-Tong Wei, Jia-Qi He +3

    cs.GRcs.CVarXiv:2608.17975v12026
  47. iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance

    Jun Zheng, Zhengze Xu, Mengting Chen +6

    cs.CVarXiv:2605.21431v22026
  48. StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding

    Keming Wu, Baoyi Wang, Kaichen Zhang +7

    cs.CVarXiv:2608.16320v12026
    Summaries:한국어
  49. Dual Co-Train: Cross-Dataset Ultrasound Tongue Segmentation Under Extreme Data Scarcity

    Alisher Myrgyyassov, Zhen Song, Bruce Xiao Wang +4

    cs.CVcs.AIarXiv:2608.17983v12026
  50. Comparative Study of Out-of-the-Box Technology for Automatic Target Detection and Recognition

    Alma M. Liezenga, Lotte Nijskens, Henrik R. Baumann +12

    cs.CVcs.AIarXiv:2608.17917v12026
  51. Relit-LiVE: Relight Video by Jointly Learning Environment Video

    Weiqing Xiao, Hong Li, Xiuyu Yang +7

    cs.CVarXiv:2605.06658v12026
  52. X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

    Xiaoming Ren, Ru Zhen, Chao Li +11

    cs.CVarXiv:2605.05765v22026
  53. Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models

    Daniel Sungho Jung, Kyoung Mu Lee

    cs.CVarXiv:2605.05886v12026
  54. ViPO: Visual Preference Optimization at Scale

    Ming Li, Jie Wu, Justin Cui +3

    cs.CVcs.AIarXiv:2604.24953v22026
  55. MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware

    Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathore +3

    cs.CVcs.CLarXiv:2605.05945v72026
  56. Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

    Peiyang Liu, Ziqiang Cui, Xi Wang +2

    cs.CVcs.AIcs.CLarXiv:2605.01284v22026
  57. SAM 3D Animal: Promptable Animal 3D Reconstruction from Images in the Wild

    Xuyi Hu, Jin Lyu, Jiuming Liu +4

    cs.CVcs.AIarXiv:2605.07604v12026
  58. Memory-Bounded Continuation of Greedy Sampling for Continual Anomaly Detection

    Yoon Gyo Jung, Jaewoo Park, Kuan-Chuan Peng +2

    cs.CVcs.LGarXiv:2608.15277v12026
  59. Geometric Action Model for Robot Policy Learning

    Jisang Han, Seonghu Jeon, Jaewoo Jung +7

    cs.ROcs.CVcs.LGarXiv:2606.17046v22026
  60. Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

    Zhuohan Liu, Wujian Peng, Yitong Chen +1

    cs.CVarXiv:2605.28615v12026