Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
6,781 to 6,840 of 18,821
A Dual-Source Approach for 3D Pose Estimation from a Single Image
Hashim Yasin, Umar Iqbal, Björn Krüger +2
cs.CVarXiv:1509.06720v22015ContourNet: Taking a Further Step toward Accurate Arbitrary-shaped Scene Text Detection
Yuxin Wang, Hongtao Xie, Zhengjun Zha +3
cs.CVarXiv:2004.04940v12020Improving Video Generation with Human Feedback
Jie Liu, Gongye Liu, Jiajun Liang +14
cs.CVcs.AIcs.GRarXiv:2501.13918v22025FoundationStereo: Zero-Shot Stereo Matching
Bowen Wen, Matthew Trepte, Joseph Aribido +3
cs.CVcs.LGcs.ROarXiv:2501.09898v42025Video Object Detection with an Aligned Spatial-Temporal Memory
Fanyi Xiao, Yong Jae Lee
cs.CVarXiv:1712.06317v32017Neuro-Symbolic Geometric Abstraction (NeuSOGA): From Observations to Symbolic Mathematical Representations
Qingde Li, Qingqi Hong, Zihan Li +1
cs.AIcs.CVcs.GRarXiv:2609.01408v22026Event-based Asynchronous Sparse Convolutional Networks
Nico Messikommer, Daniel Gehrig, Antonio Loquercio +1
cs.CVcs.LGeess.SParXiv:2003.09148v22020Native and Compact Structured Latents for 3D Generation
Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu +8
cs.CVcs.AIarXiv:2512.14692v12025On Feature Learning in the Presence of Spurious Correlations
Pavel Izmailov, Polina Kirichenko, Nate Gruver +1
cs.LGcs.CVstat.MLarXiv:2210.11369v12022SmolVLM: Redefining small and efficient multimodal models
Andrés Marafioti, Orr Zohar, Miquel Farré +14
cs.AIcs.CVarXiv:2504.05299v12025AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data
Christopher F. Brown, Michal R. Kazmierski, Valerie J. Pasquarella +16
cs.CVcs.LGarXiv:2507.22291v22025Deep Comprehensive Correlation Mining for Image Clustering
Jianlong Wu, Keyu Long, Fei Wang +4
cs.CVarXiv:1904.06925v32019Automatic Understanding of Image and Video Advertisements
Zaeem Hussain, Mingda Zhang, Xiaozhong Zhang +5
cs.CVarXiv:1707.03067v12017ImgEdit: A Unified Image Editing Dataset and Benchmark
Yang Ye, Xianyi He, Zongjian Li +5
cs.CVarXiv:2505.20275v12025Model-based Deep Hand Pose Estimation
Xingyi Zhou, Qingfu Wan, Wei Zhang +2
cs.CVarXiv:1606.06854v12016DiffusionNFT: Online Diffusion Reinforcement with Forward Process
Kaiwen Zheng, Huayu Chen, Haotian Ye +7
cs.LGcs.AIcs.CVarXiv:2509.16117v22025RGB$\leftrightarrow$X: Image decomposition and synthesis using material- and lighting-aware diffusion models
Zheng Zeng, Valentin Deschaintre, Iliyan Georgiev +5
cs.CVcs.GRarXiv:2405.00666v12024Weakly Supervised Adversarial Domain Adaptation for Semantic Segmentation in Urban Scenes
Qi Wang, Junyu Gao, Xuelong Li
cs.CVarXiv:1904.09092v12019Diverse Data Augmentation with Diffusions for Effective Test-time Prompt Tuning
Chun-Mei Feng, Kai Yu, Yong Liu +2
cs.CVarXiv:2308.06038v22023AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation
Yuning Cui, Syed Waqas Zamir, Salman Khan +3
cs.CVarXiv:2403.14614v12024DENSE: Data-Free One-Shot Federated Learning
Jie Zhang, Chen Chen, Bo Li +5
cs.LGcs.CVarXiv:2112.12371v22021Kimi-VL Technical Report
Kimi Team, Angang Du, Bohong Yin +92
cs.CVarXiv:2504.07491v32025OmniGen2: Towards Instruction-Aligned Multimodal Generation
Chenyuan Wu, Pengfei Zheng, Ruiran Yan +19
cs.CVcs.AIcs.CLarXiv:2506.18871v42025Space-Time-Separable Graph Convolutional Network for Pose Forecasting
Theodoros Sofianos, Alessio Sampieri, Luca Franco +1
cs.CVarXiv:2110.04573v12021MMaDA: Multimodal Large Diffusion Language Models
Ling Yang, Ye Tian, Bowen Li +4
cs.CVarXiv:2505.15809v22025Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
Kunhao Liu, Wenbo Hu, Jiale Xu +2
cs.CVarXiv:2509.25161v12025Towards the Automatic Anime Characters Creation with Generative Adversarial Networks
Yanghua Jin, Jiakai Zhang, Minjun Li +3
cs.CVarXiv:1708.05509v12017AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
Zewei Zhou, Tianhui Cai, Seth Z. Zhao +4
cs.CVarXiv:2506.13757v32025LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
Xiang An, Yin Xie, Kaicheng Yang +20
cs.CVarXiv:2509.23661v32025Cascaded V-Net using ROI masks for brain tumor segmentation
Adrià Casamitjana, Marcel Catà, Irina Sánchez +2
cs.CVcs.AIcs.CYarXiv:1812.11588v12018When Vision Meets Graphs: A Survey on Graph Reasoning and Learning
Xinjian Zhao, Wei Pang, Zhixuan Yu +8
cs.SIcs.CVcs.LGarXiv:2609.03816v12026Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass
Jianing Yang, Alexander Sax, Kevin J. Liang +6
cs.CVcs.AIcs.GRarXiv:2501.13928v22025SignMatch: Matching Dictionary Signs to Continuous Sign Language Video
Ryan Wong, Youngjoon Jang, Liliane Momeni +2
cs.CVarXiv:2609.01886v12026Summaries:한국어RENOIR - A Dataset for Real Low-Light Image Noise Reduction
Josue Anaya, Adrian Barbu
cs.CVarXiv:1409.8230v92014Designing and Training of A Dual CNN for Image Denoising
Chunwei Tian, Yong Xu, Wangmeng Zuo +3
eess.IVcs.CVarXiv:2007.03951v12020YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection
Ranjan Sapkota, Rahul Harsha Cheppally, Ajay Sharda +1
cs.CVarXiv:2509.25164v52025Motus: A Unified Latent Action World Model
Hongzhe Bi, Hengkai Tan, Shenghao Xie +13
cs.CVcs.LGcs.ROarXiv:2512.13030v22025ColonFormer: An Efficient Transformer based Method for Colon Polyp Segmentation
Nguyen Thanh Duc, Nguyen Thi Oanh, Nguyen Thi Thuy +2
cs.CVarXiv:2205.08473v32022Combining Noise-to-Image and Image-to-Image GANs: Brain MR Image Augmentation for Tumor Detection
Changhee Han, Leonardo Rundo, Ryosuke Araki +5
eess.IVcs.AIcs.CVarXiv:1905.13456v32019Seedance 1.0: Exploring the Boundaries of Video Generation Models
Yu Gao, Haoyuan Guo, Tuyen Hoang +41
cs.CVarXiv:2506.09113v22025Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
Haozhe Wang, Alex Su, Weiming Ren +2
cs.CVcs.AIcs.CLarXiv:2505.15966v32025Learning a Recurrent Visual Representation for Image Caption Generation
Xinlei Chen, C. Lawrence Zitnick
cs.CVcs.AIcs.CLarXiv:1411.5654v12014From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers
Siyi Liu, Hanjun Yang, Chenchen Zhang +7
cs.IRcs.CVarXiv:2609.00667v12026ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
Kaixin Li, Ziyang Meng, Hongzhan Lin +5
cs.CVcs.HCcs.MMarXiv:2504.07981v12025YOLO-Z: Improving small object detection in YOLOv5 for autonomous vehicles
Aduen Benjumea, Izzeddin Teeti, Fabio Cuzzolin +1
cs.CVarXiv:2112.11798v42021R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization
Yi Yang, Xiaoxuan He, Hongkun Pan +9
cs.CVarXiv:2503.10615v22025ReCamMaster: Camera-Controlled Generative Rendering from A Single Video
Jianhong Bai, Menghan Xia, Xiao Fu +8
cs.CVarXiv:2503.11647v22025Federated Learning for Breast Density Classification: A Real-World Implementation
Holger R. Roth, Ken Chang, Praveer Singh +40
eess.IVcs.CVarXiv:2009.01871v32020LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
Randall Balestriero, Yann LeCun
cs.LGcs.AIcs.CVarXiv:2511.08544v32025DenseRaC: Joint 3D Pose and Shape Estimation by Dense Render-and-Compare
Yuanlu Xu, Song-Chun Zhu, Tony Tung
cs.CVcs.LGeess.IVarXiv:1910.00116v22019ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVT
Yipeng Sun, Zihan Ni, Chee-Kheng Chng +9
cs.CVcs.LGcs.MMarXiv:1909.07741v12019DreamEditor: Text-Driven 3D Scene Editing with Neural Fields
Jingyu Zhuang, Chen Wang, Lingjie Liu +2
cs.CVarXiv:2306.13455v32023Swin Meets EfficientNet: Lightweight Architectures for GAN-Based Face Forensics
Sejuti Basu, Ashima Sood, Vijay Kumar +1
cs.CVcs.AIarXiv:2609.01749v12026DPANet: Depth Potentiality-Aware Gated Attention Network for RGB-D Salient Object Detection
Zuyao Chen, Runmin Cong, Qianqian Xu +1
cs.CVarXiv:2003.08608v42020LongLive: Real-time Interactive Long Video Generation
Shuai Yang, Wei Huang, Ruihang Chu +9
cs.CVarXiv:2509.22622v22025$π^3$: Permutation-Equivariant Visual Geometry Learning
Yifan Wang, Jianjun Zhou, Haoyi Zhu +7
cs.CVarXiv:2507.13347v32025Patch-wise Attack for Fooling Deep Neural Network
Lianli Gao, Qilong Zhang, Jingkuan Song +2
cs.CVarXiv:2007.06765v32020Learning Cross-Modal Deep Representations for Robust Pedestrian Detection
Dan Xu, Wanli Ouyang, Elisa Ricci +2
cs.CVarXiv:1704.02431v22017DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
Ziwei Zheng, Michael Yang, Jack Hong +5
cs.CVarXiv:2505.14362v32025AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views
Lihan Jiang, Yucheng Mao, Linning Xu +9
cs.CVarXiv:2505.23716v22025