Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

8,581 to 8,640 of 18,867

  1. Multi-interactive Dual-decoder for RGB-thermal Salient Object Detection

    Zhengzheng Tu, Zhun Li, Chenglong Li +2

    cs.CVarXiv:2005.02315v32020
  2. Fine-Grained Multi Image Object Hallucination Benchmark

    Joonki Min, Chaeyun Kim, Hyungwook Choi +4

    cs.CVcs.AIcs.LGarXiv:2608.30653v12026
  3. GO-SLAM: Global Optimization for Consistent 3D Instant Reconstruction

    Youmin Zhang, Fabio Tosi, Stefano Mattoccia +1

    cs.CVcs.ROarXiv:2309.02436v12023
  4. TMR: Text-to-Motion Retrieval Using Contrastive 3D Human Motion Synthesis

    Mathis Petrovich, Michael J. Black, Gül Varol

    cs.CVcs.CLarXiv:2305.00976v22023
  5. E-RAFT: Dense Optical Flow from Event Cameras

    Mathias Gehrig, Mario Millhäusler, Daniel Gehrig +1

    cs.CVarXiv:2108.10552v32021
  6. FLOT: Scene Flow on Point Clouds Guided by Optimal Transport

    Gilles Puy, Alexandre Boulch, Renaud Marlet

    cs.CVarXiv:2007.11142v12020
  7. Regularizing Deep Neural Networks by Noise: Its Interpretation and Optimization

    Hyeonwoo Noh, Tackgeun You, Jonghwan Mun +1

    cs.LGcs.CVarXiv:1710.05179v22017
  8. Minerals in the Wild: A Hyperspectral-XRF Dataset for Elemental Composition Estimation

    Eleftheria Tetoula-Tsonga, George Arvanitakis, Theodoros Giannakas

    cs.CVcs.LGarXiv:2608.30537v12026
  9. A Review on Deep Learning Techniques for the Diagnosis of Novel Coronavirus (COVID-19)

    Md. Milon Islam, Fakhri Karray, Reda Alhajj +1

    eess.IVcs.CVcs.LGarXiv:2008.04815v12020
  10. LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark

    Zhenfei Yin, Jiong Wang, Jianjian Cao +9

    cs.CVarXiv:2306.06687v32023
  11. Hierarchical LSTMs with Adaptive Attention for Visual Captioning

    Jingkuan Song, Xiangpeng Li, Lianli Gao +1

    cs.CVarXiv:1812.11004v12018
  12. Multi-Modal 3D Object Detection in Autonomous Driving: a Survey

    Yingjie Wang, Qiuyu Mao, Hanqi Zhu +5

    cs.CVarXiv:2106.12735v32021
  13. ObjectSplat: Improving Mesh Fidelity and Interactivity for 3D Scenes via Object-Level Mesh Splatting

    Minhas Kamal, Hiranya Garbha Kumar, Mahedi Kamal +1

    cs.CVcs.AIcs.LGarXiv:2608.30423v12026
  14. CT-GAN: Malicious Tampering of 3D Medical Imagery using Deep Learning

    Yisroel Mirsky, Tom Mahler, Ilan Shelef +1

    cs.CRcs.CVcs.LGarXiv:1901.03597v32019
  15. Compositional Chain-of-Thought Prompting for Large Multimodal Models

    Chancharik Mitra, Brandon Huang, Trevor Darrell +1

    cs.CVcs.AIcs.CLarXiv:2311.17076v32023
  16. Point in, Box out: Beyond Counting Persons in Crowds

    Yuting Liu, Miaojing Shi, Qijun Zhao +1

    cs.CVarXiv:1904.01333v22019
  17. Rethinking Architecture Design for Tackling Data Heterogeneity in Federated Learning

    Liangqiong Qu, Yuyin Zhou, Paul Pu Liang +5

    cs.LGcs.CVarXiv:2106.06047v22021
  18. ViTGAN: Training GANs with Vision Transformers

    Kwonjoon Lee, Huiwen Chang, Lu Jiang +3

    cs.CVcs.LGeess.IVarXiv:2107.04589v22021
  19. Fast and Accurate Image Super Resolution by Deep CNN with Skip Connection and Network in Network

    Jin Yamanaka, Shigesumi Kuwashima, Takio Kurita

    cs.CVarXiv:1707.05425v72017
  20. VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

    Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1

    cs.CVcs.LGarXiv:2608.30480v12026
  21. Learning a Probabilistic Model for Diffeomorphic Registration

    Julian Krebs, Hervé Delingette, Boris Mailhé +2

    cs.CVarXiv:1812.07460v22018
  22. DeepCache: Principled Cache for Mobile Deep Vision

    Mengwei Xu, Mengze Zhu, Yunxin Liu +2

    cs.CVarXiv:1712.01670v52017
  23. BBAM: Bounding Box Attribution Map for Weakly Supervised Semantic and Instance Segmentation

    Jungbeom Lee, Jihun Yi, Chaehun Shin +1

    cs.CVarXiv:2103.08907v12021
  24. LaneNet: Real-Time Lane Detection Networks for Autonomous Driving

    Ze Wang, Weiqiang Ren, Qiang Qiu

    cs.CVarXiv:1807.01726v12018
  25. Scene Memory Transformer for Embodied Agents in Long-Horizon Tasks

    Kuan Fang, Alexander Toshev, Li Fei-Fei +1

    cs.LGcs.CVcs.ROarXiv:1903.03878v12019
  26. Faster gaze prediction with dense networks and Fisher pruning

    Lucas Theis, Iryna Korshunova, Alykhan Tejani +1

    cs.CVstat.MLarXiv:1801.05787v22018
  27. Transformer Tracking with Cyclic Shifting Window Attention

    Zikai Song, Junqing Yu, Yi-Ping Phoebe Chen +1

    cs.CVarXiv:2205.03806v12022
  28. Cycle Self-Training for Domain Adaptation

    Hong Liu, Jianmin Wang, Mingsheng Long

    cs.LGcs.CVarXiv:2103.03571v32021
  29. The MYOSAIQ Challenge: Myocardial Segmentation with Automated Infarct Quantification

    Olivier Bernard, William A. Romero R., Cyprien Bouton +24

    eess.IVcs.CVarXiv:2608.29246v12026
  30. ZipLoRA: Any Subject in Any Style by Effectively Merging LoRAs

    Viraj Shah, Nataniel Ruiz, Forrester Cole +4

    cs.CVcs.GRcs.LGarXiv:2311.13600v22023
  31. SegViT: Semantic Segmentation with Plain Vision Transformers

    Bowen Zhang, Zhi Tian, Quan Tang +4

    cs.CVarXiv:2210.05844v22022
  32. PLA: Language-Driven Open-Vocabulary 3D Scene Understanding

    Runyu Ding, Jihan Yang, Chuhui Xue +3

    cs.CVarXiv:2211.16312v22022
  33. Revisiting the "Video" in Video-Language Understanding

    Shyamal Buch, Cristóbal Eyzaguirre, Adrien Gaidon +3

    cs.CVcs.AIcs.CLarXiv:2206.01720v12022
  34. Rethinking Pseudo-LiDAR Representation

    Xinzhu Ma, Shinan Liu, Zhiyi Xia +3

    cs.CVarXiv:2008.04582v12020
  35. Point Density-Aware Voxels for LiDAR 3D Object Detection

    Jordan S. K. Hu, Tianshu Kuai, Steven L. Waslander

    cs.CVarXiv:2203.05662v22022
  36. Multi-Fiber Networks for Video Recognition

    Yunpeng Chen, Yannis Kalantidis, Jianshu Li +2

    cs.CVarXiv:1807.11195v32018
  37. Lipreading with Long Short-Term Memory

    Michael Wand, Jan Koutník, Jürgen Schmidhuber

    cs.CVcs.CLarXiv:1601.08188v12016
  38. Monocular Real-time Hand Shape and Motion Capture using Multi-modal Data

    Yuxiao Zhou, Marc Habermann, Weipeng Xu +3

    cs.CVarXiv:2003.09572v32020
  39. Motus2: A Self-Evolving General World Model for Dexterous Manipulation

    Hongzhe Bi, Zihao Zhou, Yihang Tang +16

    cs.ROcs.AIcs.CVarXiv:2608.30237v12026
  40. DeepSVG: A Hierarchical Generative Network for Vector Graphics Animation

    Alexandre Carlier, Martin Danelljan, Alexandre Alahi +1

    cs.CVarXiv:2007.11301v32020
  41. Neural-Pull: Learning Signed Distance Functions from Point Clouds by Learning to Pull Space onto Surfaces

    Baorui Ma, Zhizhong Han, Yu-Shen Liu +1

    cs.CVarXiv:2011.13495v22020
  42. TF-ICON: Diffusion-Based Training-Free Cross-Domain Image Composition

    Shilin Lu, Yanzhu Liu, Adams Wai-Kin Kong

    cs.CVcs.AIarXiv:2307.12493v42023
  43. Solving Inverse Problems with Latent Diffusion Models via Hard Data Consistency

    Bowen Song, Soo Min Kwon, Zecheng Zhang +3

    cs.CVarXiv:2307.08123v32023
  44. Collaborative Representation based Classification for Face Recognition

    Lei Zhang, Meng Yang, Xiangchu Feng +2

    cs.CVarXiv:1204.2358v22012
  45. LaDI-VTON: Latent Diffusion Textual-Inversion Enhanced Virtual Try-On

    Davide Morelli, Alberto Baldrati, Giuseppe Cartella +3

    cs.CVcs.AIcs.MMarXiv:2305.13501v32023
  46. Recent Advances and New Guidelines on Hyperspectral and Multispectral Image Fusion

    Renwei Dian, Shutao Li, Bin Sun +1

    eess.IVcs.CVarXiv:2008.03426v12020
  47. Attentive Contexts for Object Detection

    Jianan Li, Yunchao Wei, Xiaodan Liang +4

    cs.CVarXiv:1603.07415v12016
  48. SCAttNet: Semantic Segmentation Network with Spatial and Channel Attention Mechanism for High-Resolution Remote Sensing Images

    Haifeng Li, Kaijian Qiu, Li Chen +3

    cs.CVarXiv:1912.09121v22019
  49. TSPFN: A Temporal Tabular Foundation Model for Physiological Time Series Classification

    Jérémie Stym-Popper, Clément Rambour, Federica Granese +2

    cs.LGcs.CVarXiv:2608.31013v12026
  50. Seeing through the Human Reporting Bias: Visual Classifiers from Noisy Human-Centric Labels

    Ishan Misra, C. Lawrence Zitnick, Margaret Mitchell +1

    cs.CVarXiv:1512.06974v22015
  51. Dreamix: Video Diffusion Models are General Video Editors

    Eyal Molad, Eliahu Horwitz, Dani Valevski +5

    cs.CVarXiv:2302.01329v12023
  52. Raising the Bar of AI-generated Image Detection with CLIP

    Davide Cozzolino, Giovanni Poggi, Riccardo Corvi +2

    cs.CVarXiv:2312.00195v22023
  53. Skip RNN: Learning to Skip State Updates in Recurrent Neural Networks

    Victor Campos, Brendan Jou, Xavier Giro-i-Nieto +2

    cs.AIcs.CVarXiv:1708.06834v32017
  54. Cross-Modal Interaction Networks for Query-Based Moment Retrieval in Videos

    Zhu Zhang, Zhijie Lin, Zhou Zhao +1

    cs.IRcs.CVcs.MMarXiv:1906.02497v22019
  55. 70 years of machine learning in geoscience in review

    Jesper Sören Dramsch

    physics.geo-phcs.CVcs.LGarXiv:2006.13311v32020
  56. Self-Supervised Discriminative Feature Learning for Deep Multi-View Clustering

    Jie Xu, Yazhou Ren, Huayi Tang +6

    cs.LGcs.CVarXiv:2103.15069v32021
  57. CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory

    Nur Muhammad Mahi Shafiullah, Chris Paxton, Lerrel Pinto +2

    cs.ROcs.CVarXiv:2210.05663v32022
  58. Maximum-Margin Structured Learning with Deep Networks for 3D Human Pose Estimation

    Sijin Li, Weichen Zhang, Antoni B. Chan

    cs.CVarXiv:1508.06708v12015
  59. Semantic-aware Knowledge Distillation for Few-Shot Class-Incremental Learning

    Ali Cheraghian, Shafin Rahman, Pengfei Fang +3

    cs.CVarXiv:2103.04059v22021
  60. NASA: Neural Articulated Shape Approximation

    Boyang Deng, JP Lewis, Timothy Jeruzalski +4

    cs.CVcs.GRcs.LGarXiv:1912.03207v52019