Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

6,781 to 6,840 of 18,821

  1. A Dual-Source Approach for 3D Pose Estimation from a Single Image

    Hashim Yasin, Umar Iqbal, Björn Krüger +2

    cs.CVarXiv:1509.06720v22015
  2. ContourNet: Taking a Further Step toward Accurate Arbitrary-shaped Scene Text Detection

    Yuxin Wang, Hongtao Xie, Zhengjun Zha +3

    cs.CVarXiv:2004.04940v12020
  3. Improving Video Generation with Human Feedback

    Jie Liu, Gongye Liu, Jiajun Liang +14

    cs.CVcs.AIcs.GRarXiv:2501.13918v22025
  4. FoundationStereo: Zero-Shot Stereo Matching

    Bowen Wen, Matthew Trepte, Joseph Aribido +3

    cs.CVcs.LGcs.ROarXiv:2501.09898v42025
  5. Video Object Detection with an Aligned Spatial-Temporal Memory

    Fanyi Xiao, Yong Jae Lee

    cs.CVarXiv:1712.06317v32017
  6. Neuro-Symbolic Geometric Abstraction (NeuSOGA): From Observations to Symbolic Mathematical Representations

    Qingde Li, Qingqi Hong, Zihan Li +1

    cs.AIcs.CVcs.GRarXiv:2609.01408v22026
  7. Event-based Asynchronous Sparse Convolutional Networks

    Nico Messikommer, Daniel Gehrig, Antonio Loquercio +1

    cs.CVcs.LGeess.SParXiv:2003.09148v22020
  8. Native and Compact Structured Latents for 3D Generation

    Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu +8

    cs.CVcs.AIarXiv:2512.14692v12025
  9. On Feature Learning in the Presence of Spurious Correlations

    Pavel Izmailov, Polina Kirichenko, Nate Gruver +1

    cs.LGcs.CVstat.MLarXiv:2210.11369v12022
  10. SmolVLM: Redefining small and efficient multimodal models

    Andrés Marafioti, Orr Zohar, Miquel Farré +14

    cs.AIcs.CVarXiv:2504.05299v12025
  11. AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data

    Christopher F. Brown, Michal R. Kazmierski, Valerie J. Pasquarella +16

    cs.CVcs.LGarXiv:2507.22291v22025
  12. Deep Comprehensive Correlation Mining for Image Clustering

    Jianlong Wu, Keyu Long, Fei Wang +4

    cs.CVarXiv:1904.06925v32019
  13. Automatic Understanding of Image and Video Advertisements

    Zaeem Hussain, Mingda Zhang, Xiaozhong Zhang +5

    cs.CVarXiv:1707.03067v12017
  14. ImgEdit: A Unified Image Editing Dataset and Benchmark

    Yang Ye, Xianyi He, Zongjian Li +5

    cs.CVarXiv:2505.20275v12025
  15. Model-based Deep Hand Pose Estimation

    Xingyi Zhou, Qingfu Wan, Wei Zhang +2

    cs.CVarXiv:1606.06854v12016
  16. DiffusionNFT: Online Diffusion Reinforcement with Forward Process

    Kaiwen Zheng, Huayu Chen, Haotian Ye +7

    cs.LGcs.AIcs.CVarXiv:2509.16117v22025
  17. RGB$\leftrightarrow$X: Image decomposition and synthesis using material- and lighting-aware diffusion models

    Zheng Zeng, Valentin Deschaintre, Iliyan Georgiev +5

    cs.CVcs.GRarXiv:2405.00666v12024
  18. Weakly Supervised Adversarial Domain Adaptation for Semantic Segmentation in Urban Scenes

    Qi Wang, Junyu Gao, Xuelong Li

    cs.CVarXiv:1904.09092v12019
  19. Diverse Data Augmentation with Diffusions for Effective Test-time Prompt Tuning

    Chun-Mei Feng, Kai Yu, Yong Liu +2

    cs.CVarXiv:2308.06038v22023
  20. AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation

    Yuning Cui, Syed Waqas Zamir, Salman Khan +3

    cs.CVarXiv:2403.14614v12024
  21. DENSE: Data-Free One-Shot Federated Learning

    Jie Zhang, Chen Chen, Bo Li +5

    cs.LGcs.CVarXiv:2112.12371v22021
  22. Kimi-VL Technical Report

    Kimi Team, Angang Du, Bohong Yin +92

    cs.CVarXiv:2504.07491v32025
  23. OmniGen2: Towards Instruction-Aligned Multimodal Generation

    Chenyuan Wu, Pengfei Zheng, Ruiran Yan +19

    cs.CVcs.AIcs.CLarXiv:2506.18871v42025
  24. Space-Time-Separable Graph Convolutional Network for Pose Forecasting

    Theodoros Sofianos, Alessio Sampieri, Luca Franco +1

    cs.CVarXiv:2110.04573v12021
  25. MMaDA: Multimodal Large Diffusion Language Models

    Ling Yang, Ye Tian, Bowen Li +4

    cs.CVarXiv:2505.15809v22025
  26. Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

    Kunhao Liu, Wenbo Hu, Jiale Xu +2

    cs.CVarXiv:2509.25161v12025
  27. Towards the Automatic Anime Characters Creation with Generative Adversarial Networks

    Yanghua Jin, Jiakai Zhang, Minjun Li +3

    cs.CVarXiv:1708.05509v12017
  28. AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

    Zewei Zhou, Tianhui Cai, Seth Z. Zhao +4

    cs.CVarXiv:2506.13757v32025
  29. LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

    Xiang An, Yin Xie, Kaicheng Yang +20

    cs.CVarXiv:2509.23661v32025
  30. Cascaded V-Net using ROI masks for brain tumor segmentation

    Adrià Casamitjana, Marcel Catà, Irina Sánchez +2

    cs.CVcs.AIcs.CYarXiv:1812.11588v12018
  31. When Vision Meets Graphs: A Survey on Graph Reasoning and Learning

    Xinjian Zhao, Wei Pang, Zhixuan Yu +8

    cs.SIcs.CVcs.LGarXiv:2609.03816v12026
  32. Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass

    Jianing Yang, Alexander Sax, Kevin J. Liang +6

    cs.CVcs.AIcs.GRarXiv:2501.13928v22025
  33. SignMatch: Matching Dictionary Signs to Continuous Sign Language Video

    Ryan Wong, Youngjoon Jang, Liliane Momeni +2

    cs.CVarXiv:2609.01886v12026
    Summaries:한국어
  34. RENOIR - A Dataset for Real Low-Light Image Noise Reduction

    Josue Anaya, Adrian Barbu

    cs.CVarXiv:1409.8230v92014
  35. Designing and Training of A Dual CNN for Image Denoising

    Chunwei Tian, Yong Xu, Wangmeng Zuo +3

    eess.IVcs.CVarXiv:2007.03951v12020
  36. YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection

    Ranjan Sapkota, Rahul Harsha Cheppally, Ajay Sharda +1

    cs.CVarXiv:2509.25164v52025
  37. Motus: A Unified Latent Action World Model

    Hongzhe Bi, Hengkai Tan, Shenghao Xie +13

    cs.CVcs.LGcs.ROarXiv:2512.13030v22025
  38. ColonFormer: An Efficient Transformer based Method for Colon Polyp Segmentation

    Nguyen Thanh Duc, Nguyen Thi Oanh, Nguyen Thi Thuy +2

    cs.CVarXiv:2205.08473v32022
  39. Combining Noise-to-Image and Image-to-Image GANs: Brain MR Image Augmentation for Tumor Detection

    Changhee Han, Leonardo Rundo, Ryosuke Araki +5

    eess.IVcs.AIcs.CVarXiv:1905.13456v32019
  40. Seedance 1.0: Exploring the Boundaries of Video Generation Models

    Yu Gao, Haoyuan Guo, Tuyen Hoang +41

    cs.CVarXiv:2506.09113v22025
  41. Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

    Haozhe Wang, Alex Su, Weiming Ren +2

    cs.CVcs.AIcs.CLarXiv:2505.15966v32025
  42. Learning a Recurrent Visual Representation for Image Caption Generation

    Xinlei Chen, C. Lawrence Zitnick

    cs.CVcs.AIcs.CLarXiv:1411.5654v12014
  43. From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers

    Siyi Liu, Hanjun Yang, Chenchen Zhang +7

    cs.IRcs.CVarXiv:2609.00667v12026
  44. ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use

    Kaixin Li, Ziyang Meng, Hongzhan Lin +5

    cs.CVcs.HCcs.MMarXiv:2504.07981v12025
  45. YOLO-Z: Improving small object detection in YOLOv5 for autonomous vehicles

    Aduen Benjumea, Izzeddin Teeti, Fabio Cuzzolin +1

    cs.CVarXiv:2112.11798v42021
  46. R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

    Yi Yang, Xiaoxuan He, Hongkun Pan +9

    cs.CVarXiv:2503.10615v22025
  47. ReCamMaster: Camera-Controlled Generative Rendering from A Single Video

    Jianhong Bai, Menghan Xia, Xiao Fu +8

    cs.CVarXiv:2503.11647v22025
  48. Federated Learning for Breast Density Classification: A Real-World Implementation

    Holger R. Roth, Ken Chang, Praveer Singh +40

    eess.IVcs.CVarXiv:2009.01871v32020
  49. LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics

    Randall Balestriero, Yann LeCun

    cs.LGcs.AIcs.CVarXiv:2511.08544v32025
  50. DenseRaC: Joint 3D Pose and Shape Estimation by Dense Render-and-Compare

    Yuanlu Xu, Song-Chun Zhu, Tony Tung

    cs.CVcs.LGeess.IVarXiv:1910.00116v22019
  51. ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVT

    Yipeng Sun, Zihan Ni, Chee-Kheng Chng +9

    cs.CVcs.LGcs.MMarXiv:1909.07741v12019
  52. DreamEditor: Text-Driven 3D Scene Editing with Neural Fields

    Jingyu Zhuang, Chen Wang, Lingjie Liu +2

    cs.CVarXiv:2306.13455v32023
  53. Swin Meets EfficientNet: Lightweight Architectures for GAN-Based Face Forensics

    Sejuti Basu, Ashima Sood, Vijay Kumar +1

    cs.CVcs.AIarXiv:2609.01749v12026
  54. DPANet: Depth Potentiality-Aware Gated Attention Network for RGB-D Salient Object Detection

    Zuyao Chen, Runmin Cong, Qianqian Xu +1

    cs.CVarXiv:2003.08608v42020
  55. LongLive: Real-time Interactive Long Video Generation

    Shuai Yang, Wei Huang, Ruihang Chu +9

    cs.CVarXiv:2509.22622v22025
  56. $π^3$: Permutation-Equivariant Visual Geometry Learning

    Yifan Wang, Jianjun Zhou, Haoyi Zhu +7

    cs.CVarXiv:2507.13347v32025
  57. Patch-wise Attack for Fooling Deep Neural Network

    Lianli Gao, Qilong Zhang, Jingkuan Song +2

    cs.CVarXiv:2007.06765v32020
  58. Learning Cross-Modal Deep Representations for Robust Pedestrian Detection

    Dan Xu, Wanli Ouyang, Elisa Ricci +2

    cs.CVarXiv:1704.02431v22017
  59. DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

    Ziwei Zheng, Michael Yang, Jack Hong +5

    cs.CVarXiv:2505.14362v32025
  60. AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views

    Lihan Jiang, Yucheng Mao, Linning Xu +9

    cs.CVarXiv:2505.23716v22025