Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

6,841 to 6,900 of 18,867

  1. Model-based Deep Hand Pose Estimation

    Xingyi Zhou, Qingfu Wan, Wei Zhang +2

    cs.CVarXiv:1606.06854v12016
  2. DiffusionNFT: Online Diffusion Reinforcement with Forward Process

    Kaiwen Zheng, Huayu Chen, Haotian Ye +7

    cs.LGcs.AIcs.CVarXiv:2509.16117v22025
  3. RGB$\leftrightarrow$X: Image decomposition and synthesis using material- and lighting-aware diffusion models

    Zheng Zeng, Valentin Deschaintre, Iliyan Georgiev +5

    cs.CVcs.GRarXiv:2405.00666v12024
  4. Weakly Supervised Adversarial Domain Adaptation for Semantic Segmentation in Urban Scenes

    Qi Wang, Junyu Gao, Xuelong Li

    cs.CVarXiv:1904.09092v12019
  5. Diverse Data Augmentation with Diffusions for Effective Test-time Prompt Tuning

    Chun-Mei Feng, Kai Yu, Yong Liu +2

    cs.CVarXiv:2308.06038v22023
  6. AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation

    Yuning Cui, Syed Waqas Zamir, Salman Khan +3

    cs.CVarXiv:2403.14614v12024
  7. DENSE: Data-Free One-Shot Federated Learning

    Jie Zhang, Chen Chen, Bo Li +5

    cs.LGcs.CVarXiv:2112.12371v22021
  8. Kimi-VL Technical Report

    Kimi Team, Angang Du, Bohong Yin +92

    cs.CVarXiv:2504.07491v32025
  9. OmniGen2: Towards Instruction-Aligned Multimodal Generation

    Chenyuan Wu, Pengfei Zheng, Ruiran Yan +19

    cs.CVcs.AIcs.CLarXiv:2506.18871v42025
  10. Space-Time-Separable Graph Convolutional Network for Pose Forecasting

    Theodoros Sofianos, Alessio Sampieri, Luca Franco +1

    cs.CVarXiv:2110.04573v12021
  11. MMaDA: Multimodal Large Diffusion Language Models

    Ling Yang, Ye Tian, Bowen Li +4

    cs.CVarXiv:2505.15809v22025
  12. Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

    Kunhao Liu, Wenbo Hu, Jiale Xu +2

    cs.CVarXiv:2509.25161v12025
  13. Towards the Automatic Anime Characters Creation with Generative Adversarial Networks

    Yanghua Jin, Jiakai Zhang, Minjun Li +3

    cs.CVarXiv:1708.05509v12017
  14. AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

    Zewei Zhou, Tianhui Cai, Seth Z. Zhao +4

    cs.CVarXiv:2506.13757v32025
  15. LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

    Xiang An, Yin Xie, Kaicheng Yang +20

    cs.CVarXiv:2509.23661v32025
  16. Cascaded V-Net using ROI masks for brain tumor segmentation

    Adrià Casamitjana, Marcel Catà, Irina Sánchez +2

    cs.CVcs.AIcs.CYarXiv:1812.11588v12018
  17. When Vision Meets Graphs: A Survey on Graph Reasoning and Learning

    Xinjian Zhao, Wei Pang, Zhixuan Yu +8

    cs.SIcs.CVcs.LGarXiv:2609.03816v12026
  18. Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass

    Jianing Yang, Alexander Sax, Kevin J. Liang +6

    cs.CVcs.AIcs.GRarXiv:2501.13928v22025
  19. SignMatch: Matching Dictionary Signs to Continuous Sign Language Video

    Ryan Wong, Youngjoon Jang, Liliane Momeni +2

    cs.CVarXiv:2609.01886v12026
    Summaries:한국어
  20. RENOIR - A Dataset for Real Low-Light Image Noise Reduction

    Josue Anaya, Adrian Barbu

    cs.CVarXiv:1409.8230v92014
  21. Designing and Training of A Dual CNN for Image Denoising

    Chunwei Tian, Yong Xu, Wangmeng Zuo +3

    eess.IVcs.CVarXiv:2007.03951v12020
  22. YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection

    Ranjan Sapkota, Rahul Harsha Cheppally, Ajay Sharda +1

    cs.CVarXiv:2509.25164v52025
  23. Motus: A Unified Latent Action World Model

    Hongzhe Bi, Hengkai Tan, Shenghao Xie +13

    cs.CVcs.LGcs.ROarXiv:2512.13030v22025
  24. ColonFormer: An Efficient Transformer based Method for Colon Polyp Segmentation

    Nguyen Thanh Duc, Nguyen Thi Oanh, Nguyen Thi Thuy +2

    cs.CVarXiv:2205.08473v32022
  25. Combining Noise-to-Image and Image-to-Image GANs: Brain MR Image Augmentation for Tumor Detection

    Changhee Han, Leonardo Rundo, Ryosuke Araki +5

    eess.IVcs.AIcs.CVarXiv:1905.13456v32019
  26. Seedance 1.0: Exploring the Boundaries of Video Generation Models

    Yu Gao, Haoyuan Guo, Tuyen Hoang +41

    cs.CVarXiv:2506.09113v22025
  27. Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

    Haozhe Wang, Alex Su, Weiming Ren +2

    cs.CVcs.AIcs.CLarXiv:2505.15966v32025
  28. Learning a Recurrent Visual Representation for Image Caption Generation

    Xinlei Chen, C. Lawrence Zitnick

    cs.CVcs.AIcs.CLarXiv:1411.5654v12014
  29. From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers

    Siyi Liu, Hanjun Yang, Chenchen Zhang +7

    cs.IRcs.CVarXiv:2609.00667v12026
  30. ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use

    Kaixin Li, Ziyang Meng, Hongzhan Lin +5

    cs.CVcs.HCcs.MMarXiv:2504.07981v12025
  31. YOLO-Z: Improving small object detection in YOLOv5 for autonomous vehicles

    Aduen Benjumea, Izzeddin Teeti, Fabio Cuzzolin +1

    cs.CVarXiv:2112.11798v42021
  32. R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

    Yi Yang, Xiaoxuan He, Hongkun Pan +9

    cs.CVarXiv:2503.10615v22025
  33. ReCamMaster: Camera-Controlled Generative Rendering from A Single Video

    Jianhong Bai, Menghan Xia, Xiao Fu +8

    cs.CVarXiv:2503.11647v22025
  34. Federated Learning for Breast Density Classification: A Real-World Implementation

    Holger R. Roth, Ken Chang, Praveer Singh +40

    eess.IVcs.CVarXiv:2009.01871v32020
  35. LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics

    Randall Balestriero, Yann LeCun

    cs.LGcs.AIcs.CVarXiv:2511.08544v32025
  36. DenseRaC: Joint 3D Pose and Shape Estimation by Dense Render-and-Compare

    Yuanlu Xu, Song-Chun Zhu, Tony Tung

    cs.CVcs.LGeess.IVarXiv:1910.00116v22019
  37. ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVT

    Yipeng Sun, Zihan Ni, Chee-Kheng Chng +9

    cs.CVcs.LGcs.MMarXiv:1909.07741v12019
  38. DreamEditor: Text-Driven 3D Scene Editing with Neural Fields

    Jingyu Zhuang, Chen Wang, Lingjie Liu +2

    cs.CVarXiv:2306.13455v32023
  39. Swin Meets EfficientNet: Lightweight Architectures for GAN-Based Face Forensics

    Sejuti Basu, Ashima Sood, Vijay Kumar +1

    cs.CVcs.AIarXiv:2609.01749v12026
  40. DPANet: Depth Potentiality-Aware Gated Attention Network for RGB-D Salient Object Detection

    Zuyao Chen, Runmin Cong, Qianqian Xu +1

    cs.CVarXiv:2003.08608v42020
  41. LongLive: Real-time Interactive Long Video Generation

    Shuai Yang, Wei Huang, Ruihang Chu +9

    cs.CVarXiv:2509.22622v22025
  42. $π^3$: Permutation-Equivariant Visual Geometry Learning

    Yifan Wang, Jianjun Zhou, Haoyi Zhu +7

    cs.CVarXiv:2507.13347v32025
  43. Patch-wise Attack for Fooling Deep Neural Network

    Lianli Gao, Qilong Zhang, Jingkuan Song +2

    cs.CVarXiv:2007.06765v32020
  44. Learning Cross-Modal Deep Representations for Robust Pedestrian Detection

    Dan Xu, Wanli Ouyang, Elisa Ricci +2

    cs.CVarXiv:1704.02431v22017
  45. DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

    Ziwei Zheng, Michael Yang, Jack Hong +5

    cs.CVarXiv:2505.14362v32025
  46. AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views

    Lihan Jiang, Yucheng Mao, Linning Xu +9

    cs.CVarXiv:2505.23716v22025
  47. "Help Me Help the AI": Understanding How Explainability Can Support Human-AI Interaction

    Sunnie S. Y. Kim, Elizabeth Anne Watkins, Olga Russakovsky +2

    cs.HCcs.AIcs.CVarXiv:2210.03735v22022
  48. YodaNN: An Architecture for Ultra-Low Power Binary-Weight CNN Acceleration

    Renzo Andri, Lukas Cavigelli, Davide Rossi +1

    cs.ARcs.CVcs.NEarXiv:1606.05487v42016
  49. Deep Fully-Connected Networks for Video Compressive Sensing

    Michael Iliadis, Leonidas Spinoulas, Aggelos K. Katsaggelos

    cs.CVcs.LGcs.MMarXiv:1603.04930v22016
  50. Generative Compression

    Shibani Santurkar, David Budden, Nir Shavit

    cs.CVarXiv:1703.01467v22017
  51. MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details

    Ruicheng Wang, Sicheng Xu, Yue Dong +6

    cs.CVarXiv:2507.02546v12025
  52. Beyond Human Parts: Dual Part-Aligned Representations for Person Re-Identification

    Jianyuan Guo, Yuhui Yuan, Lang Huang +3

    cs.CVarXiv:1910.10111v12019
  53. Knowledge Transfer for Melanoma Screening with Deep Learning

    Afonso Menegola, Michel Fornaciali, Ramon Pires +3

    cs.CVarXiv:1703.07479v12017
  54. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

    Jinliang Zheng, Jianxiong Li, Zhihao Wang +12

    cs.ROcs.AIcs.CVarXiv:2510.10274v12025
  55. Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

    Z-Image Team, Huanqia Cai, Sihan Cao +21

    cs.CVarXiv:2511.22699v52025
  56. Learning to Adapt Invariance in Memory for Person Re-identification

    Zhun Zhong, Liang Zheng, Zhiming Luo +2

    cs.CVarXiv:1908.00485v12019
  57. GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control

    Xuanchi Ren, Tianchang Shen, Jiahui Huang +7

    cs.CVcs.GRarXiv:2503.03751v12025
  58. DN-Splatter: Depth and Normal Priors for Gaussian Splatting and Meshing

    Matias Turkulainen, Xuqian Ren, Iaroslav Melekhov +3

    cs.CVarXiv:2403.17822v32024
  59. Early Detection of Combustion Instabilities using Deep Convolutional Selective Autoencoders on Hi-speed Flame Video

    Adedotun Akintayo, Kin Gwn Lore, Soumalya Sarkar +1

    cs.CVcs.LGcs.NEarXiv:1603.07839v12016
  60. GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

    GLM-V Team, :, Wenyi Hong +91

    cs.CVcs.AIcs.LGarXiv:2507.01006v62025