Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

12,241 to 12,300 of 18,866

  1. Efficient parametrization of multi-domain deep neural networks

    Sylvestre-Alvise Rebuffi, Hakan Bilen, Andrea Vedaldi

    cs.CVstat.MLarXiv:1803.10082v12018
  2. MIC: Masked Image Consistency for Context-Enhanced Domain Adaptation

    Lukas Hoyer, Dengxin Dai, Haoran Wang +1

    cs.CVarXiv:2212.01322v22022
  3. Anatomy-Guided Foundation Model Adaptation with Within-Case Prototype Supervision for Standard Plane Detection in Fetal Ultrasound Blind Sweeps

    Yuzhe Zhao

    cs.CVeess.IVarXiv:2608.27051v12026
  4. CheXclusion: Fairness gaps in deep chest X-ray classifiers

    Laleh Seyyed-Kalantari, Guanxiong Liu, Matthew McDermott +2

    cs.CVcs.AIcs.LGarXiv:2003.00827v22020
  5. How good is my GAN?

    Konstantin Shmelkov, Cordelia Schmid, Karteek Alahari

    cs.CVcs.LGarXiv:1807.09499v12018
  6. Sparse Single Sweep LiDAR Point Cloud Segmentation via Learning Contextual Shape Priors from Scene Completion

    Xu Yan, Jiantao Gao, Jie Li +4

    cs.CVarXiv:2012.03762v12020
  7. Cross-Layer Distillation with Semantic Calibration

    Defang Chen, Jian-Ping Mei, Yuan Zhang +3

    cs.CVcs.AIcs.LGarXiv:2012.03236v22020
  8. LaserNet: An Efficient Probabilistic 3D Object Detector for Autonomous Driving

    Gregory P. Meyer, Ankit Laddha, Eric Kee +2

    cs.CVcs.LGcs.ROarXiv:1903.08701v12019
  9. Multi-modal Cycle-consistent Generalized Zero-Shot Learning

    Rafael Felix, B. G. Vijay Kumar, Ian Reid +1

    cs.CVarXiv:1808.00136v22018
  10. TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

    Qi Lu, Zehui Guo, David Yuanda Gan +4

    cs.CVcs.MMarXiv:2608.26971v12026
  11. Filtered Channel Features for Pedestrian Detection

    Shanshan Zhang, Rodrigo Benenson, Bernt Schiele

    cs.CVarXiv:1501.05759v12015
  12. Image Retrieval on Real-life Images with Pre-trained Vision-and-Language Models

    Zheyuan Liu, Cristian Rodriguez-Opazo, Damien Teney +1

    cs.CVcs.CLcs.IRarXiv:2108.04024v12021
  13. Learning Spatial Regularization with Image-level Supervisions for Multi-label Image Classification

    Feng Zhu, Hongsheng Li, Wanli Ouyang +2

    cs.CVarXiv:1702.05891v22017
  14. Object Detection from Video Tubelets with Convolutional Neural Networks

    Kai Kang, Wanli Ouyang, Hongsheng Li +1

    cs.CVarXiv:1604.04053v12016
  15. On Evaluating Adversarial Robustness of Large Vision-Language Models

    Yunqing Zhao, Tianyu Pang, Chao Du +4

    cs.CVcs.CLcs.CRarXiv:2305.16934v22023
  16. Large-scale Classification of Fine-Art Paintings: Learning The Right Metric on The Right Feature

    Babak Saleh, Ahmed Elgammal

    cs.CVcs.IRcs.LGarXiv:1505.00855v12015
  17. TEXTure: Text-Guided Texturing of 3D Shapes

    Elad Richardson, Gal Metzer, Yuval Alaluf +2

    cs.CVcs.GRarXiv:2302.01721v12023
  18. Free Lunch for Few-shot Learning: Distribution Calibration

    Shuo Yang, Lu Liu, Min Xu

    cs.LGcs.CVarXiv:2101.06395v32021
  19. Fine-grained Video-Text Retrieval with Hierarchical Graph Reasoning

    Shizhe Chen, Yida Zhao, Qin Jin +1

    cs.CVcs.AIarXiv:2003.00392v12020
  20. PENet: Towards Precise and Efficient Image Guided Depth Completion

    Mu Hu, Shuling Wang, Bin Li +3

    cs.CVarXiv:2103.00783v32021
  21. Review of Visual Saliency Detection with Comprehensive Information

    Runmin Cong, Jianjun Lei, Huazhu Fu +3

    cs.CVarXiv:1803.03391v22018
  22. Charting the Right Manifold: Manifold Mixup for Few-shot Learning

    Puneet Mangla, Mayank Singh, Abhishek Sinha +3

    cs.LGcs.CVstat.MLarXiv:1907.12087v42019
  23. Generating 3D Adversarial Point Clouds

    Chong Xiang, Charles R. Qi, Bo Li

    cs.CRcs.CVcs.LGarXiv:1809.07016v42018
  24. One-Shot Imitation from Observing Humans via Domain-Adaptive Meta-Learning

    Tianhe Yu, Chelsea Finn, Annie Xie +4

    cs.LGcs.AIcs.CVarXiv:1802.01557v12018
  25. TransPose: Keypoint Localization via Transformer

    Sen Yang, Zhibin Quan, Mu Nie +1

    cs.CVarXiv:2012.14214v52020
  26. Image Splicing Localization Using A Multi-Task Fully Convolutional Network (MFCN)

    Ronald Salloum, Yuzhuo Ren, C. -C. Jay Kuo

    cs.CVarXiv:1709.02016v12017
  27. Pix2Vox: Context-aware 3D Reconstruction from Single and Multi-view Images

    Haozhe Xie, Hongxun Yao, Xiaoshuai Sun +2

    cs.CVarXiv:1901.11153v22019
  28. VideoAgent: Long-form Video Understanding with Large Language Model as Agent

    Xiaohan Wang, Yuhui Zhang, Orr Zohar +1

    cs.CVcs.AIcs.CLarXiv:2403.10517v12024
  29. Walk in the Cloud: Learning Curves for Point Clouds Shape Analysis

    Tiange Xiang, Chaoyi Zhang, Yang Song +2

    cs.CVarXiv:2105.01288v22021
  30. Analysis of classifiers' robustness to adversarial perturbations

    Alhussein Fawzi, Omar Fawzi, Pascal Frossard

    cs.LGcs.CVstat.MLarXiv:1502.02590v42015
  31. Learning Object Bounding Boxes for 3D Instance Segmentation on Point Clouds

    Bo Yang, Jianan Wang, Ronald Clark +4

    cs.CVcs.AIcs.LGarXiv:1906.01140v22019
  32. V2X-Sim: Multi-Agent Collaborative Perception Dataset and Benchmark for Autonomous Driving

    Yiming Li, Dekun Ma, Ziyan An +4

    cs.CVarXiv:2202.08449v22022
  33. InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

    Xiaoyi Dong, Pan Zhang, Yuhang Zang +20

    cs.CVcs.CLarXiv:2401.16420v12024
  34. Vision-Language Transformer and Query Generation for Referring Segmentation

    Henghui Ding, Chang Liu, Suchen Wang +1

    cs.CVarXiv:2108.05565v12021
  35. SimpleShot: Revisiting Nearest-Neighbor Classification for Few-Shot Learning

    Yan Wang, Wei-Lun Chao, Kilian Q. Weinberger +1

    cs.CVarXiv:1911.04623v22019
  36. A Unified Framework for the Mechanics of Information in Convolutional Neural Network Image Space

    Aryan Shukla, Matthew Toews

    cs.CVarXiv:2608.26363v12026
  37. Towards automatic pulmonary nodule management in lung cancer screening with deep learning

    Francesco Ciompi, Kaman Chung, Sarah J. van Riel +10

    cs.CVarXiv:1610.09157v22016
  38. Associating Objects with Transformers for Video Object Segmentation

    Zongxin Yang, Yunchao Wei, Yi Yang

    cs.CVarXiv:2106.02638v32021
  39. Text-to-3D using Gaussian Splatting

    Zilong Chen, Feng Wang, Yikai Wang +1

    cs.CVarXiv:2309.16585v42023
  40. Transfer Learning for Domain Adaptation in MRI: Application in Brain Lesion Segmentation

    Mohsen Ghafoorian, Alireza Mehrtash, Tina Kapur +11

    cs.CVarXiv:1702.07841v12017
  41. Rethinking Space-Time Networks with Improved Memory Coverage for Efficient Video Object Segmentation

    Ho Kei Cheng, Yu-Wing Tai, Chi-Keung Tang

    cs.CVarXiv:2106.05210v22021
  42. PhaseStain: Digital staining of label-free quantitative phase microscopy images using deep learning

    Yair Rivenson, Tairan Liu, Zhensong Wei +2

    eess.IVcs.CVphysics.med-pharXiv:1807.07701v12018
  43. 3D Convolutional Encoder-Decoder Network for Low-Dose CT via Transfer Learning from a 2D Trained Network

    Hongming Shan, Yi Zhang, Qingsong Yang +5

    cs.CVarXiv:1802.05656v22018
  44. Neural Codes for Image Retrieval

    Artem Babenko, Anton Slesarev, Alexandr Chigorin +1

    cs.CVarXiv:1404.1777v22014
  45. Structure-Preserving Super Resolution with Gradient Guidance

    Cheng Ma, Yongming Rao, Yean Cheng +3

    eess.IVcs.CVarXiv:2003.13081v12020
  46. InternVideo2: Scaling Foundation Models for Multimodal Video Understanding

    Yi Wang, Kunchang Li, Xinhao Li +17

    cs.CVarXiv:2403.15377v42024
  47. Ask Me Anything: Free-form Visual Question Answering Based on Knowledge from External Sources

    Qi Wu, Peng Wang, Chunhua Shen +2

    cs.CVarXiv:1511.06973v22015
  48. Deblurring via Stochastic Refinement

    Jay Whang, Mauricio Delbracio, Hossein Talebi +3

    cs.CVeess.IVarXiv:2112.02475v22021
  49. NeRF-SLAM: Real-Time Dense Monocular SLAM with Neural Radiance Fields

    Antoni Rosinol, John J. Leonard, Luca Carlone

    cs.CVarXiv:2210.13641v12022
  50. Annotating Object Instances with a Polygon-RNN

    Lluis Castrejon, Kaustav Kundu, Raquel Urtasun +1

    cs.CVarXiv:1704.05548v12017
  51. MotionBERT: A Unified Perspective on Learning Human Motion Representations

    Wentao Zhu, Xiaoxuan Ma, Zhaoyang Liu +3

    cs.CVarXiv:2210.06551v52022
  52. Searching in one billion vectors: re-rank with source coding

    Hervé Jégou, Romain Tavenard, Matthijs Douze +1

    cs.IRcs.CVarXiv:1102.3828v12011
  53. Perceptual Adversarial Networks for Image-to-Image Transformation

    Chaoyue Wang, Chang Xu, Chaohui Wang +1

    cs.CVarXiv:1706.09138v22017
  54. Towards Reading Hidden Emotions: A comparative Study of Spontaneous Micro-expression Spotting and Recognition Methods

    Xiaobai Li, Xiaopeng Hong, Antti Moilanen +4

    cs.CVarXiv:1511.00423v22015
  55. ThreeDWorld: A Platform for Interactive Multi-Modal Physical Simulation

    Chuang Gan, Jeremy Schwartz, Seth Alter +21

    cs.CVcs.GRcs.LGarXiv:2007.04954v22020
  56. Exploring Randomly Wired Neural Networks for Image Recognition

    Saining Xie, Alexander Kirillov, Ross Girshick +1

    cs.CVcs.LGarXiv:1904.01569v22019
  57. SOSNet: Second Order Similarity Regularization for Local Descriptor Learning

    Yurun Tian, Xin Yu, Bin Fan +3

    cs.CVarXiv:1904.05019v22019
  58. RSMamba: Remote Sensing Image Classification with State Space Model

    Keyan Chen, Bowen Chen, Chenyang Liu +3

    cs.CVarXiv:2403.19654v12024
  59. The Relative Performance of Ensemble Methods with Deep Convolutional Neural Networks for Image Classification

    Cheng Ju, Aurélien Bibaut, Mark J. van der Laan

    stat.MLcs.CVcs.LGarXiv:1704.01664v12017
  60. UniFLM: United Segmentation and Measurement on Fetal Limb Ultrasonic Image

    Zeen Zhou, Qiuhua Chen, Xiaojun Cao +3

    cs.CVarXiv:2608.27240v12026