Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
18,181 to 18,240 of 18,839
Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings
Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja
cs.CVcs.AIcs.LGarXiv:2606.15134v12026Selective Synergistic Learning for Video Object-Centric Learning
WonJun Moon, Jae-Pil Heo
cs.CVcs.AIarXiv:2606.15527v12026SpatialAvatar-0: High-Quality 4D Head Avatar with Multi-Stage Reconstruction
Yiran Wang, Zeyu Zhang, Yuanming Li +2
cs.CVarXiv:2606.15659v12026When Do Diffusion Models learn to Generate Multiple Objects?
Yujin Jeong, Arnas Uselis, Iro Laina +2
cs.CVcs.AIarXiv:2605.00273v22026PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory
Shuai Yang, Bingjie Gao, Ziwei Liu +3
cs.CVarXiv:2606.16449v22026BRDFusion: Physics Meets Generation for Urban Scene Inverse Rendering
Yi-Ruei Liu, Jie-Ying Lee, Zheng-Hui Huang +2
cs.CVarXiv:2606.17049v12026Text-Vision Co-Instructed Image Editing
Chenxi Xie, Yuhui Wu, Qiaosi Yi +1
cs.CVarXiv:2606.16767v12026ProCUA-SFT Technical Report
Jaehun Jung, Ximing Lu, Brandon Cui +11
cs.LGcs.CVarXiv:2606.17321v12026Hardware-in-the-Loop Phase-Aware CNN for Real-Time 5G Channel Estimation
Javad Zolfaghari-Bengar, Rakibul Rony, Elisa Gomez-de-Lope +3
eess.SPcs.CVcs.ITarXiv:2608.14709v12026Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling
Yang Zhao, Peisong Niu, Tian Zhou +5
cs.LGcs.AIcs.CVarXiv:2608.14652v12026ARGUS: Attention-Guided Transformers for Scalable Person Identification Using Wi-Fi Telemetry
Nayan Sanjay Bhatia, Pranay Kocheta, Yuhan Li +1
cs.LGcs.AIcs.CVarXiv:2608.14670v12026SpIn-ViT: Designing a Sparsity-Induced Vision Transformer That Is Mechanistically Interpretable
Philip H. Lee, Parth Padalkar
cs.CVcs.AIarXiv:2608.14922v12026Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints
Bruno Chicelli, Henrique Alves, Rodrigo Anselmo +3
cs.CLcs.AIcs.CVarXiv:2608.15032v12026On Cross-Validation for Hyperparameter Optimization of Deep Learning Image Classifiers
Ljubomir Buturovic
cs.CVcs.LGarXiv:2608.14705v12026Beyond Boundary Noise: Aggregated Aleatoric Uncertainty Fails to Capture Presence Ambiguity in 3D Lung Nodule Segmentation
Simon Baur, Arne Schernich, Ekin Böke +2
cs.CVcs.LGarXiv:2608.14766v12026PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection
Chengyao Jia, Ruixuan Wang
cs.CVcs.LGarXiv:2608.15802v12026Geometry of Forgetting: Representation Flux in Continual Learning
Maksim A. Kazanskii
cs.LGcs.CVarXiv:2608.15854v12026Identifying Confusion Trends in Concept-based XAI for Multi-Label Classification
Haadia Amjad, Ronald Tetzlaff
cs.CVcs.AIarXiv:2608.15731v12026RRFC: Recursive Refinement via Feedback Conditioning for Iterative Image-to-Image Generation
Kareem Hassani, Chaymaa Abbas, Hadi Al Mubasher +1
cs.CVcs.AIarXiv:2608.15694v12026EMASAM: a Computationally Efficient Sharpness-Aware Minimization via EMA-Guided Perturbations
Tanapat Ratchatorn, Masayuki Tanaka
cs.LGcs.CVarXiv:2608.15105v12026Adaptive Volumetric Mechanical Property Fields Invariant to Resolution
Rishit Dagli, Donglai Xiang, Vismay Modi +4
cs.CVcs.LGcs.ROarXiv:2606.18231v12026Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City
Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma +3
cs.CVcs.AIcs.ROarXiv:2606.20980v12026LooseControlVideo: Directorial Video Control using Spatial Blocking
Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli
cs.CVarXiv:2606.19495v12026StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs
Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal +2
cs.CLcs.CVarXiv:2606.20527v12026JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising
Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang +1
cs.CVarXiv:2606.20563v12026CogniRoute: Learning to Route Social Evidence in Omni-Modal Models
Yifan Shen, Pei Tian, Xinzhuo Li +8
cs.CVarXiv:2606.20970v12026Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
Yatai Ji, An-Chieh Cheng, Yang Fu +13
cs.CVcs.AIarXiv:2606.17539v12026GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning
Haoyu Wang, Guoqing Ma, Zeyu Zhang +3
cs.CVcs.ROarXiv:2606.17480v12026Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games
Shengyuan Ding, Xilin Wei, Xinyu Fang +4
cs.CVarXiv:2606.19338v12026PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models
Yueyi Sun, Yuhao Wang, Jason Li +8
cs.CVcs.AIcs.CLarXiv:2606.19534v12026Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
Kangsheng Duan, Ziyang Xu, Wenyu Liu +3
cs.CVarXiv:2606.19195v12026HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
Juncheng Ma, Jianxin Bi, Yufan Deng +19
cs.CVarXiv:2606.20521v12026DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis
Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi +6
cs.CVcs.AIarXiv:2604.13416v32026Toward Parking Spot Occupancy Recognition: A Self-Supervised Approach
Luan Marko Kujavski, Rayson Laroca, Paulo Lisboa de Almeida
cs.CVarXiv:2606.20886v12026QG-MIL: A Gated Transformer Aggregator for Domain-Agnostic Multiple Instance Learning in Medical Imaging
Luca Zedda, Davide Antonio Mura, Cecilia Di Ruberto +4
cs.CVarXiv:2606.20027v12026Arbor: Explicit Geometric Conditioning for Controllable 3D Asset Generation
Jan-Niklas Dihlmann, Andreas Engelhardt, Simon Donne +2
cs.CVcs.GRarXiv:2606.23514v12026Vera: A Layered Diffusion Model for Content-Preserving Video Editing
Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein +2
cs.CVarXiv:2606.23610v12026VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct
Haoling Li, Kai Zheng, Jie Wu +4
cs.AIcs.CLcs.CVarXiv:2606.23543v12026Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation
Rui Wang, Quentin Lohmeyer, Siyu Tang +1
cs.CVarXiv:2606.22197v12026Sapiens2
Rawal Khirodkar, He Wen, Julieta Martinez +3
cs.CVarXiv:2604.21681v12026MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation
Dongxia Liu, Jie Ma, Xiaochen Yang +7
cs.GRcs.CVcs.LGarXiv:2605.13857v12026Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning
Ido Sobol, Kihyuk Sohn, Yoav Blum +4
cs.GRcs.CVcs.LGarXiv:2605.13852v12026IAM: Identity-Aware Human Motion and Shape Joint Generation
Wenqi Jia, Zekun Li, Abhay Mittal +6
cs.CVarXiv:2604.25164v12026V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think
Bingda Tang, Yuhui Zhang, Xiaohan Wang +3
cs.LGcs.CVarXiv:2604.23380v12026Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
Zhen Ye, Xu Tan, Aoxiong Yin +8
cs.CVcs.CLcs.MMarXiv:2604.23586v22026aDSL: Agentic 3D Creation via Joint Agent-Program Design
Rui-Huan Wang, Si-Tong Wei, Jia-Qi He +3
cs.GRcs.CVarXiv:2608.17975v12026iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance
Jun Zheng, Zhengze Xu, Mengting Chen +6
cs.CVarXiv:2605.21431v22026StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding
Keming Wu, Baoyi Wang, Kaichen Zhang +7
cs.CVarXiv:2608.16320v12026Summaries:한국어Dual Co-Train: Cross-Dataset Ultrasound Tongue Segmentation Under Extreme Data Scarcity
Alisher Myrgyyassov, Zhen Song, Bruce Xiao Wang +4
cs.CVcs.AIarXiv:2608.17983v12026Comparative Study of Out-of-the-Box Technology for Automatic Target Detection and Recognition
Alma M. Liezenga, Lotte Nijskens, Henrik R. Baumann +12
cs.CVcs.AIarXiv:2608.17917v12026Relit-LiVE: Relight Video by Jointly Learning Environment Video
Weiqing Xiao, Hong Li, Xiuyu Yang +7
cs.CVarXiv:2605.06658v12026X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
Xiaoming Ren, Ru Zhen, Chao Li +11
cs.CVarXiv:2605.05765v22026Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
Daniel Sungho Jung, Kyoung Mu Lee
cs.CVarXiv:2605.05886v12026ViPO: Visual Preference Optimization at Scale
Ming Li, Jie Wu, Justin Cui +3
cs.CVcs.AIarXiv:2604.24953v22026MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware
Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathore +3
cs.CVcs.CLarXiv:2605.05945v72026Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
Peiyang Liu, Ziqiang Cui, Xi Wang +2
cs.CVcs.AIcs.CLarXiv:2605.01284v22026SAM 3D Animal: Promptable Animal 3D Reconstruction from Images in the Wild
Xuyi Hu, Jin Lyu, Jiuming Liu +4
cs.CVcs.AIarXiv:2605.07604v12026Memory-Bounded Continuation of Greedy Sampling for Continual Anomaly Detection
Yoon Gyo Jung, Jaewoo Park, Kuan-Chuan Peng +2
cs.CVcs.LGarXiv:2608.15277v12026Geometric Action Model for Robot Policy Learning
Jisang Han, Seonghu Jeon, Jaewoo Jung +7
cs.ROcs.CVcs.LGarXiv:2606.17046v22026Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
Zhuohan Liu, Wujian Peng, Yitong Chen +1
cs.CVarXiv:2605.28615v12026