Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
6,841 to 6,900 of 18,867
Model-based Deep Hand Pose Estimation
Xingyi Zhou, Qingfu Wan, Wei Zhang +2
cs.CVarXiv:1606.06854v12016DiffusionNFT: Online Diffusion Reinforcement with Forward Process
Kaiwen Zheng, Huayu Chen, Haotian Ye +7
cs.LGcs.AIcs.CVarXiv:2509.16117v22025RGB$\leftrightarrow$X: Image decomposition and synthesis using material- and lighting-aware diffusion models
Zheng Zeng, Valentin Deschaintre, Iliyan Georgiev +5
cs.CVcs.GRarXiv:2405.00666v12024Weakly Supervised Adversarial Domain Adaptation for Semantic Segmentation in Urban Scenes
Qi Wang, Junyu Gao, Xuelong Li
cs.CVarXiv:1904.09092v12019Diverse Data Augmentation with Diffusions for Effective Test-time Prompt Tuning
Chun-Mei Feng, Kai Yu, Yong Liu +2
cs.CVarXiv:2308.06038v22023AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation
Yuning Cui, Syed Waqas Zamir, Salman Khan +3
cs.CVarXiv:2403.14614v12024DENSE: Data-Free One-Shot Federated Learning
Jie Zhang, Chen Chen, Bo Li +5
cs.LGcs.CVarXiv:2112.12371v22021Kimi-VL Technical Report
Kimi Team, Angang Du, Bohong Yin +92
cs.CVarXiv:2504.07491v32025OmniGen2: Towards Instruction-Aligned Multimodal Generation
Chenyuan Wu, Pengfei Zheng, Ruiran Yan +19
cs.CVcs.AIcs.CLarXiv:2506.18871v42025Space-Time-Separable Graph Convolutional Network for Pose Forecasting
Theodoros Sofianos, Alessio Sampieri, Luca Franco +1
cs.CVarXiv:2110.04573v12021MMaDA: Multimodal Large Diffusion Language Models
Ling Yang, Ye Tian, Bowen Li +4
cs.CVarXiv:2505.15809v22025Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
Kunhao Liu, Wenbo Hu, Jiale Xu +2
cs.CVarXiv:2509.25161v12025Towards the Automatic Anime Characters Creation with Generative Adversarial Networks
Yanghua Jin, Jiakai Zhang, Minjun Li +3
cs.CVarXiv:1708.05509v12017AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
Zewei Zhou, Tianhui Cai, Seth Z. Zhao +4
cs.CVarXiv:2506.13757v32025LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
Xiang An, Yin Xie, Kaicheng Yang +20
cs.CVarXiv:2509.23661v32025Cascaded V-Net using ROI masks for brain tumor segmentation
Adrià Casamitjana, Marcel Catà, Irina Sánchez +2
cs.CVcs.AIcs.CYarXiv:1812.11588v12018When Vision Meets Graphs: A Survey on Graph Reasoning and Learning
Xinjian Zhao, Wei Pang, Zhixuan Yu +8
cs.SIcs.CVcs.LGarXiv:2609.03816v12026Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass
Jianing Yang, Alexander Sax, Kevin J. Liang +6
cs.CVcs.AIcs.GRarXiv:2501.13928v22025SignMatch: Matching Dictionary Signs to Continuous Sign Language Video
Ryan Wong, Youngjoon Jang, Liliane Momeni +2
cs.CVarXiv:2609.01886v12026Summaries:한국어RENOIR - A Dataset for Real Low-Light Image Noise Reduction
Josue Anaya, Adrian Barbu
cs.CVarXiv:1409.8230v92014Designing and Training of A Dual CNN for Image Denoising
Chunwei Tian, Yong Xu, Wangmeng Zuo +3
eess.IVcs.CVarXiv:2007.03951v12020YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection
Ranjan Sapkota, Rahul Harsha Cheppally, Ajay Sharda +1
cs.CVarXiv:2509.25164v52025Motus: A Unified Latent Action World Model
Hongzhe Bi, Hengkai Tan, Shenghao Xie +13
cs.CVcs.LGcs.ROarXiv:2512.13030v22025ColonFormer: An Efficient Transformer based Method for Colon Polyp Segmentation
Nguyen Thanh Duc, Nguyen Thi Oanh, Nguyen Thi Thuy +2
cs.CVarXiv:2205.08473v32022Combining Noise-to-Image and Image-to-Image GANs: Brain MR Image Augmentation for Tumor Detection
Changhee Han, Leonardo Rundo, Ryosuke Araki +5
eess.IVcs.AIcs.CVarXiv:1905.13456v32019Seedance 1.0: Exploring the Boundaries of Video Generation Models
Yu Gao, Haoyuan Guo, Tuyen Hoang +41
cs.CVarXiv:2506.09113v22025Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
Haozhe Wang, Alex Su, Weiming Ren +2
cs.CVcs.AIcs.CLarXiv:2505.15966v32025Learning a Recurrent Visual Representation for Image Caption Generation
Xinlei Chen, C. Lawrence Zitnick
cs.CVcs.AIcs.CLarXiv:1411.5654v12014From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers
Siyi Liu, Hanjun Yang, Chenchen Zhang +7
cs.IRcs.CVarXiv:2609.00667v12026ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
Kaixin Li, Ziyang Meng, Hongzhan Lin +5
cs.CVcs.HCcs.MMarXiv:2504.07981v12025YOLO-Z: Improving small object detection in YOLOv5 for autonomous vehicles
Aduen Benjumea, Izzeddin Teeti, Fabio Cuzzolin +1
cs.CVarXiv:2112.11798v42021R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization
Yi Yang, Xiaoxuan He, Hongkun Pan +9
cs.CVarXiv:2503.10615v22025ReCamMaster: Camera-Controlled Generative Rendering from A Single Video
Jianhong Bai, Menghan Xia, Xiao Fu +8
cs.CVarXiv:2503.11647v22025Federated Learning for Breast Density Classification: A Real-World Implementation
Holger R. Roth, Ken Chang, Praveer Singh +40
eess.IVcs.CVarXiv:2009.01871v32020LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
Randall Balestriero, Yann LeCun
cs.LGcs.AIcs.CVarXiv:2511.08544v32025DenseRaC: Joint 3D Pose and Shape Estimation by Dense Render-and-Compare
Yuanlu Xu, Song-Chun Zhu, Tony Tung
cs.CVcs.LGeess.IVarXiv:1910.00116v22019ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVT
Yipeng Sun, Zihan Ni, Chee-Kheng Chng +9
cs.CVcs.LGcs.MMarXiv:1909.07741v12019DreamEditor: Text-Driven 3D Scene Editing with Neural Fields
Jingyu Zhuang, Chen Wang, Lingjie Liu +2
cs.CVarXiv:2306.13455v32023Swin Meets EfficientNet: Lightweight Architectures for GAN-Based Face Forensics
Sejuti Basu, Ashima Sood, Vijay Kumar +1
cs.CVcs.AIarXiv:2609.01749v12026DPANet: Depth Potentiality-Aware Gated Attention Network for RGB-D Salient Object Detection
Zuyao Chen, Runmin Cong, Qianqian Xu +1
cs.CVarXiv:2003.08608v42020LongLive: Real-time Interactive Long Video Generation
Shuai Yang, Wei Huang, Ruihang Chu +9
cs.CVarXiv:2509.22622v22025$π^3$: Permutation-Equivariant Visual Geometry Learning
Yifan Wang, Jianjun Zhou, Haoyi Zhu +7
cs.CVarXiv:2507.13347v32025Patch-wise Attack for Fooling Deep Neural Network
Lianli Gao, Qilong Zhang, Jingkuan Song +2
cs.CVarXiv:2007.06765v32020Learning Cross-Modal Deep Representations for Robust Pedestrian Detection
Dan Xu, Wanli Ouyang, Elisa Ricci +2
cs.CVarXiv:1704.02431v22017DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
Ziwei Zheng, Michael Yang, Jack Hong +5
cs.CVarXiv:2505.14362v32025AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views
Lihan Jiang, Yucheng Mao, Linning Xu +9
cs.CVarXiv:2505.23716v22025"Help Me Help the AI": Understanding How Explainability Can Support Human-AI Interaction
Sunnie S. Y. Kim, Elizabeth Anne Watkins, Olga Russakovsky +2
cs.HCcs.AIcs.CVarXiv:2210.03735v22022YodaNN: An Architecture for Ultra-Low Power Binary-Weight CNN Acceleration
Renzo Andri, Lukas Cavigelli, Davide Rossi +1
cs.ARcs.CVcs.NEarXiv:1606.05487v42016Deep Fully-Connected Networks for Video Compressive Sensing
Michael Iliadis, Leonidas Spinoulas, Aggelos K. Katsaggelos
cs.CVcs.LGcs.MMarXiv:1603.04930v22016Generative Compression
Shibani Santurkar, David Budden, Nir Shavit
cs.CVarXiv:1703.01467v22017MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details
Ruicheng Wang, Sicheng Xu, Yue Dong +6
cs.CVarXiv:2507.02546v12025Beyond Human Parts: Dual Part-Aligned Representations for Person Re-Identification
Jianyuan Guo, Yuhui Yuan, Lang Huang +3
cs.CVarXiv:1910.10111v12019Knowledge Transfer for Melanoma Screening with Deep Learning
Afonso Menegola, Michel Fornaciali, Ramon Pires +3
cs.CVarXiv:1703.07479v12017X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
Jinliang Zheng, Jianxiong Li, Zhihao Wang +12
cs.ROcs.AIcs.CVarXiv:2510.10274v12025Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
Z-Image Team, Huanqia Cai, Sihan Cao +21
cs.CVarXiv:2511.22699v52025Learning to Adapt Invariance in Memory for Person Re-identification
Zhun Zhong, Liang Zheng, Zhiming Luo +2
cs.CVarXiv:1908.00485v12019GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control
Xuanchi Ren, Tianchang Shen, Jiahui Huang +7
cs.CVcs.GRarXiv:2503.03751v12025DN-Splatter: Depth and Normal Priors for Gaussian Splatting and Meshing
Matias Turkulainen, Xuqian Ren, Iaroslav Melekhov +3
cs.CVarXiv:2403.17822v32024Early Detection of Combustion Instabilities using Deep Convolutional Selective Autoencoders on Hi-speed Flame Video
Adedotun Akintayo, Kin Gwn Lore, Soumalya Sarkar +1
cs.CVcs.LGcs.NEarXiv:1603.07839v12016GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
GLM-V Team, :, Wenyi Hong +91
cs.CVcs.AIcs.LGarXiv:2507.01006v62025