Source-linked AI summary

Learning Transferable Visual Models From Natural Language Supervision

Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever

arXiv:2103.00020v1cs.CVcs.LG

TL;DR

기존 vision model은 고정된 labeled category에 의존하므로 더 폭넓은 concept을 인식하는 능력이 제한된다. CLIP은 400 million 이미지-텍스트 쌍으로 학습하고 language를 통해 transfer하여, 전반적인 state of the art에는 미치지 못하지만 다양한 task에서 경쟁력 있는 성능을 달성한다.

  • 문제

    Natural-language supervision은 computer-vision benchmark에서 제한적인 성능만 보여, web-scale text가 경쟁력 있고 범용적인 visual representation learning을 뒷받침할 수 있는지는 불분명했다.

  • 방법

    CLIP은 400 million 이미지-텍스트 쌍으로 matching pair를 예측하도록 사전 학습한 뒤, 후보 class의 language description과 이미지 embedding을 비교해 zero-shot classification을 수행한다.

  • 결과

    30개가 넘는 vision dataset에서 CLIP은 대부분의 task로 비자명하게 전이되며 task-specific supervised model과 경쟁력 있는 성능을 보일 수 있다.

  • 시사점 및 한계

    Web-scale natural-language pre-training은 학습된 task 지식으로 기존 computer-vision dataset 다수에 zero-shot transfer를 지원하는 visual model을 만들 수 있다.

  • 시사점 및 한계

    CLIP은 여전히 전반적인 state-of-the-art 성능에 미치지 못하며, 현재 hardware로 이를 달성하려면 실현 불가능할 정도로 약 1000배의 compute 증가가 필요할 수 있다.

Abstract

from arXiv · show

State-of-the-art computer vision systems are trained to predict a fixed set of predetermined object categories. This restricted form of supervision limits their generality and usability since additional labeled data is needed to specify any other visual concept. Learning directly from raw text about images is a promising alternative which leverages a much broader source of supervision. We demonstrate that the simple pre-training task of predicting which caption goes with which image is an efficient and scalable way to learn SOTA image representations from scratch on a dataset of 400 million (image, text) pairs collected from the internet. After pre-training, natural language is used to reference learned visual concepts (or describe new ones) enabling zero-shot transfer of the model to downstream tasks. We study the performance of this approach by benchmarking on over 30 different existing computer vision datasets, spanning tasks such as OCR, action recognition in videos, geo-localization, and many types of fine-grained object classification. The model transfers non-trivially to most tasks and is often competitive with a fully supervised baseline without the need for any dataset specific training. For instance, we match the accuracy of the original ResNet-50 on ImageNet zero-shot without needing to use any of the 1.28 million training examples it was trained on. We release our code and pre-trained model weights at https://github.com/OpenAI/CLIP.

1. 서론 및 동기 부여 연구

CLIP은 image–text pairing을 학습하고 language를 사용해 zero-shot classifier를 구성함으로써 web-scale, task-agnostic pre-training을 vision으로 확장한다. 기존 natural-language supervision 접근법의 제한적인 scale, vocabulary, flexibility, benchmark performance 문제를 해결하며, 경쟁력 있는 transfer와 향상된 efficiency 및 robustness를 달성한다.

  • CLIP 접근법: CLIP은 matching image–text pair를 예측하도록 image encoder와 text encoder를 joint training한 뒤, class name이나 description을 사용해 zero-shot linear classifier를 합성한다.이는 고정된 classifier를 target dataset을 위한 language-based output으로 대체한다.
  • 기존 연구의 한계: 기존 weakly supervised vision model은 supervision을 1,000 또는 18,291개 class로 제한하고 static softmax classifier를 사용해 visual vocabulary, dynamic output, zero-shot flexibility를 제약했다.Natural language는 이러한 고정 class inventory보다 훨씬 더 폭넓은 visual concept를 표현할 수 있다.
  • 기여: CLIP은 one to two hundred thousand image로 학습된 기존 language-supervised vision 연구와 millions to billions의 image로 학습된 weakly supervised model 사이의 scale gap을 해소해 경쟁력 있는 task-specific transfer를 가능하게 한다.인용된 비교는 VirTex, ICMLM, ConVIRT의 accelerator-days training과 Mahajan et al. (2018), Kolesnikov et al. (2019)의 accelerator-years training을 대조한다.
  • 효율성: Contrastive training은 bag-of-words baseline을 넘어 zero-shot ImageNet transfer efficiency를 4x 향상시키는 반면, transformer language modeling은 해당 baseline보다 3x 느리게 학습된다.이 efficiency 비교는 image-caption baseline 대비 CLIP에 대해 보고된 것이다.
  • 결과: CLIP은 linear-probe representation learning에서 공개적으로 이용 가능한 최상의 ImageNet model을 능가하며, 동일한 정확도를 가진 supervised ImageNet model보다 더 robust한 zero-shot model을 생성한다.논문은 기존 task-specific supervised model과의 경쟁력도 보고한다.

2. 접근법

CLIP은 400 million개의 공개 수집 image–text pair로 학습해 natural-language supervision에서 visual representation을 학습한다. Scalable한 image encoder와 text encoder를 사용해 contrastive objective로 image와 대응하는 text를 매칭하고, 불일치하는 pair는 분리한다.

  • Data: CLIP은 visual concept coverage를 넓히기 위해 공개 인터넷 소스에서 수집한 400 million개의 image–text pair 데이터셋인 WIT로 학습한다.기존 caption 데이터셋은 규모가 작아 internet-scale natural-language supervision의 잠재력을 과소평가할 수 있었기 때문에 이 데이터셋을 구축했다.
  • Contrastive objective: Contrastive approach는 exact-text prediction을 대체한다. Image는 다양한 description, comment, 관련 text와 함께 나타나므로 exact-text prediction은 어렵다.초기 transformer language-model approach는 더 단순한 bag-of-words baseline보다 ImageNet class 인식이 세 배 느렸으며, ResNet-50 encoder의 두 배 compute를 사용했다.
  • Contrastive objective: N개의 image–text pair가 주어지면 CLIP은 N × N개의 후보 중 관측된 N개의 pairing을 식별한다. 이를 위해 매칭된 embedding similarity는 최대화하고, 불일치하는 similarity는 최소화한다.Similarity score에 대해 symmetric cross-entropy loss를 적용해 image encoder와 text encoder를 multimodal embedding space에서 함께 학습한다.
  • 학습: CLIP은 ImageNet initialization이나 pretrained text weight 없이 trained from scratch 방식으로 학습되며, 대규모 pre-training dataset을 활용해 training detail을 단순화한다.이 approach는 encoder representation과 contrastive embedding space 사이의 nonlinear projection을 사용하지 않는다.
  • Architecture: Image encoder는 수정된 ResNet-50 또는 Vision Transformer를 사용하고, text encoder는 소문자로 변환한 byte-pair-encoded text를 처리하는 Transformer다.ResNet에는 ResNet-D 개선, antialiased blur pooling, attention pooling이 적용된다. 기본 text model은 63M parameter, 12개 layer, 512-wide representation, 8개 attention head로 구성된다.

3. 실험

실험에서는 보지 못한 데이터셋을 대상으로 CLIP을 zero-shot classifier로 평가했으며, supervised 및 few-shot baseline과 자주 대등하거나 더 나은 성능을 보이는 한편 복잡한 task에서의 약점도 드러났다. Natural-language prompt와 ensembling은 transfer 성능을 높이지만, 데이터셋 명명 방식과 단어 의미의 모호성이 성능을 제약한다.

  • Zero-shot transfer: CLIP은 각 이미지와 후보 class text를 embedding한 뒤, 가장 가능성이 높은 image–text pairing을 선택해 zero-shot classification을 수행한다.후보 text는 각 데이터셋의 모든 class 이름이며, pre-training에서 학습한 image–text pairing 능력을 재사용한다.
  • Zero-shot transfer: ImageNet에서 CLIP은 76.2% accuracy에 도달해, 1.28 million개의 labeled training example을 사용하지 않고도 original ResNet-50과 대등한 성능을 보이며, 95% top-5 accuracy를 달성해 Inception-V4와 대등하다.최고 성능의 CLIP model은 ImageNet accuracy를 proof of concept의 11.5%에서 76.2%로 높인다.
  • Prompting과 ensembling: “A photo of a {label}.” prompt는 ImageNet accuracy를 1.3% 높이고, 80개 context prompt를 ensembling하면 3.5%가 추가로 향상된다.Prompting은 single-word class label과 CLIP pre-training data에 흔한 full-sentence description 사이의 간극을 메운다. Embedding-space ensembling은 다수의 prediction에 걸쳐 계산 비용을 amortize하면 하나의 classifier를 계산하는 비용으로 cache할 수 있다.
  • Zero-shot transfer: Zero-shot CLIP은 27개 데이터셋 중 16개에서 승리하며, supervised baseline을 근소하게 능가하는 경우가 그렇지 않은 경우보다 많다.성능 편차는 크다. Stanford Cars와 Food101에서는 ResNet-50-feature logistic regression을 20% 넘게 앞서지만, Flowers102와 FGVCAircraft에서는 10% 넘게 뒤처진다.
  • 한계: Zero-shot CLIP은 satellite imagery, tumor detection, synthetic counting, traffic signs, car-distance recognition을 포함한 specialized, complex, 또는 abstract task에서 약하다.데이터셋에 class-name mapping이 없거나 label이 polysemous한 경우에도 transfer가 저해된다. 이름만으로는 의도한 visual concept을 특정하지 못할 수 있기 때문이다.
  • Few-shot 비교: Zero-shot CLIP은 동일한 feature space에서 four-shot logistic regression과 대등하며, BiT-M ResNet-152x2 feature를 사용해 평가한 최상의 16-shot classifier와도 대략 대등하다.이 비교는 zero-shot이 few-shot learning의 한계라는 점에 근거한다. Natural language는 labeled example에서 추론해야 하는 것이 아니라 visual concept을 직접 전달한다.

4. 인간 성능과의 비교

Oxford IIT Pets에서 인간의 zero-shot 정확도는 54%에서 클래스당 예시 하나를 사용했을 때 76%로 향상되었지만, 예시를 추가해도 향상 폭은 미미했다. 인간과 CLIP의 난이도 패턴은 상관되었으며, 이는 dataset noise와 distribution 밖 이미지가 양쪽 모두에 어려움을 주기 때문일 가능성이 있다.

  • 평가 설정: 인간은 zero-shot, one-shot, two-shot 설정에서 37개 고양이·개 품종에 걸친 Oxford IIT Pets 테스트 이미지 3,669장을 평가했다.참가자 5명은 가장 잘 맞는 품종 또는 “모르겠다”를 선택했다. zero-shot 참가자에게는 품종 예시나 인터넷 검색이 허용되지 않았고, one-shot 참가자는 품종별 샘플 하나를 보았다.
  • 인간 성능: 인간 정확도는 54%에서 클래스당 training example 하나를 사용했을 때 76%로 상승했지만, 두 번째 예시는 marginal gain을 거의 만들어내지 못했다.zero-shot에서 one-shot으로의 향상은 인간이 처음에 불확실하다고 판단한 이미지에서 거의 모두 발생했으며, 이는 예시 하나를 본 뒤 인간이 prior를 선택적으로 업데이트함을 시사한다.
  • 시사점: 인간의 few-shot 우위는 sample efficiency의 격차를 드러낸다. 인간은 prior knowledge를 사용하고 CLIP의 few-shot 평가보다 example image를 더 효과적으로 통합할 수 있기 때문이다.저자들은 이 격차를 줄이기 위한 중요한 방향으로 few-shot learning에 prior knowledge를 통합하는 방안을 제안한다.
  • 인간–모델 비교: CLIP이 가장 어려워한 문제는 인간에게도 어려웠으며, 이는 dataset noise, 잘못 라벨링된 이미지, distribution 밖 예시가 양쪽에 공통적인 영향을 미친다는 해석과 일치한다.저자들은 인간 정확도와 CLIP의 zero-shot 정확도 사이에서 관찰된 정렬을 설명하는 가설로 이러한 요인들을 제시한다.

5. 데이터 중복 분석

CLIP의 pre-training 데이터는 downstream evaluation dataset과의 overlap이 제한적이며, 이러한 contamination은 측정된 zero-shot accuracy를 크게 바꾸는 경우가 드물다. 이 분석은 detector와 distribution shift의 한계를 인정하면서 contamination 효과를 추정한다.

  • 방법: 각 evaluation dataset에서 nearest-neighbor duplicate를 수동으로 검사해 high-precision threshold를 설정하고, Overlap, Clean, 그리고 수정하지 않은 All subset을 구성했다.Contamination은 Overlap을 All로 나눈 값으로 측정했으며, 주요 효과 metric은 CLIP RN50x64의 All과 Clean zero-shot accuracy 차이였다.
  • 결과: 분석 결과 35개 dataset 중 9개에서는 detected overlap이 없었으며, 이는 duplicate detector의 false-positive rate가 낮음을 뒷받침한다.이 dataset들은 대체로 synthetic하거나 특수 목적이었으며, 일반적인 인터넷 이미지로 등장할 가능성이 낮았다.
  • 결과: Median overlap은 2.2%, average overlap은 3.2%였으며, accuracy가 0.1%를 초과해 변한 dataset은 35개 중 7개뿐이었다. Bonferroni correction 후 유의한 dataset은 단 2개였다.Detected improvement의 최대치는 Birdsnap에서의 0.6%였고, Country211은 21.5%로 가장 큰 overlap을 보였다.
  • 한계: 400 million examples 전체에서 detector recall을 확인할 수 없고 Overlap이 distribution 또는 difficulty 측면에서 Clean과 다를 수 있으므로 contamination 추정치는 완벽하지 않다.이러한 차이는 Kinetics-700의 20% 하락처럼 겉보기 accuracy 변화를 유발하거나 contamination 효과를 가릴 수 있다.
  • 관련 연구: 이 결과는 유사한 overlap rate와 전반적인 성능 변화가 미미하다고 보고한 Mahajan et al. (2018) 및 Kolesnikov et al. (2019)의 결과와 일치한다.Kolesnikov et al. (2019)은 full deduplication과 채택된 overlap-analysis 접근법 사이에도 차이가 거의 없음을 확인했다.

6. 한계

CLIP은 많은 데이터셋에서 단순한 supervised baseline과 경쟁력 있는 성능을 보이지만, task coverage, out-of-distribution generalization, data efficiency, evaluation methodology, bias 측면에서 상당한 한계를 지닌다. zero-shot interface는 유연하지만, 지정된 classifier 밖의 개념을 생성할 수 없고 few-shot performance를 직접 최적화하지도 않는다.

  • Performance limitations: Zero-shot CLIP은 ResNet-50 features를 사용하는 linear classifier와 경쟁력 있는 성능을 보이지만, 대부분의 데이터셋에서 전반적인 state-of-the-art performance에는 여전히 미치지 못하며, state-of-the-art zero-shot accuracy를 얻으려면 대략 1000x more compute가 필요한 것으로 추정된다.Scaling에 따라 performance는 꾸준히 향상되었지만, 상당한 추가 computation이 필요할 수 있다.
  • Task limitations: CLIP은 fine-grained classification, counting, 그리고 pre-training data에 나타날 가능성이 낮은 novel tasks에서 성능이 낮다.약점은 car models, flower species, aircraft variants를 구분하는 능력과 object counting을 포함한다.
  • Out-of-distribution generalization: CLIP은 진정한 out-of-distribution data에 poorly generalizes한다. handwritten MNIST digits에서 88% accuracy에 도달하지만, raw pixels에 대한 logistic regression이 더 우수한 성능을 보인다.CLIP의 semantic OCR representation은 digitally rendered text에서는 잘 작동하지만 handwritten digits에서는 그렇지 않다. handwritten digits는 training data에 유사한 images가 거의 없기 때문이다.
  • Interface limitations: CLIP은 미리 정의된 candidate concepts 집합을 필요로 하므로 image captioning에 비해 novel outputs를 생성하는 능력이 제한된다. 다만 실험한 captioning baseline은 computational efficiency가 훨씬 낮았다.Natural-language classifiers는 task 전반에서 유연하지만, 각 classifier에 지정된 concepts로 여전히 제한된다.
  • Data efficiency: CLIP은 deep learning의 낮은 data efficiency 문제를 해결하지 못한다. 초당 한 image를 처리하는 속도로 12.8 billion images를 32 epochs 동안 학습하려면 405 years가 걸린다.이 접근법은 internet supervision을 수억 개의 training examples로 scaling하여 data inefficiency를 보완한다.
  • Methodological limitations: evaluation methodology는 진정한 zero-shot 사용을 완전히 대표하지 못한다. development 과정에서 full validation sets를 반복적으로 조회했으며, text-only specification은 어려울 수 있고 model은 few-shot performance를 직접 최적화하지 않는다.논문은 evaluation-dataset selection에 대한 우려도 인정하며, few-shot settings에서는 CLIP features에 대한 linear classifiers로 대체한다.
  • Bias: CLIP은 필터링되지 않은 internet image-text pairs로 학습하므로 social biases를 습득할 수 있다.논문은 상세한 analysis, quantification, mitigation strategies를 위해 Section 7을 참조한다.

7. 광범위한 영향

CLIP의 유연한 zero-shot classification은 유망한 retrieval 및 search 응용을 가능하게 하지만, surveillance나 민감한 인간 분류에 배포될 경우 상당한 위험도 초래한다. 편향은 인구통계적 특성, label, threshold, design choice에 따라 달라지므로 benchmark accuracy만으로는 실제 환경에서의 공정성이나 안전성을 확립할 수 없다.

  • 역량과 위험: CLIP은 폭넓게 적용 가능한 zero-shot image retrieval 및 search를 지원하지만, bespoke application으로 쉽게 조정할 수 있다는 특성은 사회적 함의가 큰 용도도 가능하게 한다.논문은 shoplifter 분류나 surveillance system 배포와 같은 응용에는 맥락별 평가와 broader-impact analysis가 필요하다고 강조한다.
  • FairFace 평가: LR CLIP은 대부분의 FairFace classification test에서 Linear Probe Instagram과 FairFace’s model보다 높은 성능을 보였지만, benchmark accuracy는 여전히 algorithmic fairness의 근사치일 뿐이다.Gender-classification 성능은 모든 race category에서 95%를 초과했지만, 더 높은 accuracy나 더 작은 subgroup disparity가 실제 환경에서의 공정성을 보장하지는 않는다.
  • 인구통계적 편향: 이미지의 4.9%가 non-human class로 오분류되었으며, Black image와 0–20세 사람에서는 approximately 14%까지 증가했다.그 외 모든 race의 오분류율은 8% 미만이었고, 전체 비율의 보고된 confidence interval은 4.6%–5.4%였다.
  • 인구통계적 편향: 남성 이미지의 16.5%와 여성 이미지의 9.8%가 crime-related label을 받았으며, 0–20세 사람은 approximately 18%가 이를 받은 반면 70세 초과에서는 0%였다.저자들은 crime-related classification에서 race 간에도 유의한 disparity를 발견했다.
  • 편향의 메커니즘과 한계: Threshold와 design choice에 따라 biased label이 달라졌다. 0.5% threshold는 label quality를 낮추고, 4%에서는 없거나 드물었던 gendered appearance 또는 occupation term을 생성했다.저자들은 training data, architecture, class design, thresholding이 harm을 심화하거나 줄일 수 있으므로, 더 폭넓고 맥락적인 bias testing이 필요하다고 주장한다.
  • Surveillance 평가: 초기 CCTV 평가에서 91.8%였던 top-1 accuracy는 caption이 fine-grained detail에서만 달라졌을 때 51.1%로 하락했으며, 40.7%가 부정확한 “close” choice였다.Fine-grained detection experiment는 무작위에 가까운 성능을 보였고, image sequence에서 작은 물체의 존재 또는 부재만을 대상으로 했다.

8. 관련 연구

CLIP은 자연어를 supervision으로 활용하려는 폭넓은 연구 흐름을 기반으로 하며, multimodal retrieval, webly supervised learning, joint vision-language modeling의 선행 연구를 포함한다. 가장 직접적인 선행 연구는 이미지 외 영역의 natural-language supervision, 대규모 image-text dataset, text-image retrieval objective에 걸쳐 있다.

  • Natural Language Supervision: Natural-language supervision은 distributional semantics, dialog feedback, semantic explanations, language-conditioned feature learning을 비롯해 폭넓은 방법론을 포괄한다.예로는 topic models, word 및 sentence vectors, language models, dialog-based learning, semantic parsing, ExpBERT가 있다.
  • Natural Language Supervision: CLIP은 비언어 영역을 위한 기존 natural-language supervision을 확장하며, 다른 supervision과 함께 descriptions를 사용해 video event understanding을 수행하는 연구를 포함한다 [Ramanathan et al. (2013)].관련 연구는 videos 및 기타 modalities에도 natural-language supervision을 적용하며, perceptual systems에 대한 더 넓은 잠재력을 시사한다.
  • Text-Image Retrieval: CLIP의 text-image retrieval objective는 초기 image retrieval부터 correlation 및 ranking objectives로 학습한 joint multimodal embeddings에 이르는 연구를 따른다.대표적인 선행 연구로 Mori et al. (1999), Weston et al. (2010), Socher & Fei-Fei (2010), Hodosh et al. (2013)이 있다.
  • Image-Text Datasets: CLIP의 image-text dataset은 Pascal1K, Flickr8K, Flickr30K와 같은 crowd-sourced caption benchmarks의 작은 규모 문제를 다루며, 자동으로 구축된 더 큰 datasets도 함께 고려한다.관련 연구는 dataset scale을 달성 가능한 image-text retrieval performance를 제한하는 요인으로 본다.
  • Webly Supervised Learning: CLIP은 image-search queries를 noisy labels로 사용하고, 대규모로 자동 수집된 datasets가 더 작지만 신중하게 라벨링된 datasets와 경쟁할 수 있게 하는 webly supervised learning과 관련된다.Image-query pairs는 standard datasets를 위한 추가 training data로도 사용된다.
  • Vision-Language Models: CLIP은 visual question answering, visual commonsense reasoning, multimodal entailment를 위한 풍부하게 통합된 vision-language models와도 관련되며, 이러한 모델은 대체로 multiple pretrained subsystems를 결합한다.이러한 systems는 일반적으로 image features, region proposals 또는 object detection, masked language modeling components를 결합한다.

9. 결론 · A. Linear-probe 평가

이 논문은 task-agnostic, web-scale NLP pre-training을 computer vision으로 전이하는 방식을 연구하고, 유사한 동작이 나타나며 natural-language prompting을 통해 다양한 task 학습이 가능해짐을 밝힌다. 부록은 논문의 linear-probe 실험에 사용된 dataset과 model의 세부 사항을 제공한다.

  • 9. 결론: CLIP은 task-agnostic, web-scale pre-training이 NLP에서 computer vision으로 전이될 수 있는지 연구한다.
  • 9. 결론: 이 연구는 이러한 pre-training 방식을 적용하면 computer vision에서도 유사한 동작이 나타남을 밝힌다.
  • 9. 결론: 결론에서는 이 연구 방향의 사회적 함의를 논의한다.
  • 9. 결론: pretraining 동안 CLIP model은 training objective를 최적화하기 위해 매우 다양한 task를 수행하는 방법을 학습한다.
  • 9. 결론: Natural-language prompting은 CLIP pretraining에서 습득한 task 학습을 활용할 수 있다.
  • A. Linear-probe 평가: linear-probe 부록은 논문에서 제시한 실험에 관한 추가 세부 사항을 제공한다.
  • A. Linear-probe 평가: 이 세부 사항에는 linear-probe 평가에 사용된 dataset과 model이 포함된다.

A.1. 데이터셋 · A.2. 모델 · A.3. 평가

평가는 총 27개 데이터셋에 걸쳐 수행되며, geolocation과 OCR을 위해 별도로 구축된 benchmark를 포함한다. 또한 표준화된 linear-probe 평가를 사용해 CLIP을 다양한 vision 및 multimodal model family와 비교한다. 모델은 penultimate-layer feature를 사용해 평가하며, validation 기반으로 hyperparameter를 선택하고 held-out data에서 최종 테스트를 수행한다.

  • A.1. 데이터셋: benchmark는 Kornblith et al. (2019)의 12개 데이터셋과 더 넓은 분포 및 task를 포괄하는 15개의 추가 데이터셋을 결합한다.이 suite에는 MNIST, facial expression recognition, STL-10, EuroSAT, NWPU-RESISC45, GTSRB가 포함된다.
  • A.1. 데이터셋: Country211은 YFCC100m에서 필터링한 사진으로 구성된, 국가별 200개 training photo와 100개 testing photo를 포함하는 211개의 균형 잡힌 국가 category를 사용해 geolocation을 측정한다.국가는 ISO-3166 code와 최소 300개의 GPS-tagged photo를 갖춰야 한다.
  • A.1. 데이터셋: Rendered SST2는 Stanford Sentiment Treebank 문장을 흰색 배경 위의 검은색 텍스트로 된 448×448 이미지로 rendering해 optical character recognition을 측정한다.두 개의 예시 이미지는 Figure 19에 제시되어 있다.
  • A.2. 모델: 비교 대상에는 다섯 개의 ResNet 기반 contrastive CLIP model, 네 개의 CLIP-ViT model, 그리고 CLIP과 동일한 data와 epoch으로 학습한 autoregressive LM RN50이 포함된다.CLIP-RN은 ResNet model을 대략 64× computation까지 확장하며, CLIP-ViT에는 ViT-B/32, ViT-B/16, ViT-L/14, 336×336으로 fine-tuning한 ViT-L/14가 포함된다.
  • A.2. 모델: Baseline은 EfficientNet, Instagram-pretrained ResNeXt, BiT, ImageNet-21k ViT, SimCLRv2, BYOL, MoCo, VirTex, original ResNet checkpoint를 포괄한다.이 collection은 supervised, self-supervised, multimodal, standard convolutional 또는 transformer architecture를 포함하며, 공개적으로 이용할 수 없는 variant는 제외한다.
  • A.2. 모델: VirTex는 관련된 caption-trained 비교 모델로, CLIP-AR과 유사한 design을 사용하되 1000× 더 작은 MSCOCO caption dataset으로 학습한다.비교에는 MoCo-v1, MoCo-v2, ResNet-50, ResNet-101, ResNet152 checkpoint도 포함된다.
  • A.3. 평가: 평가는 penultimate-layer image feature와 scikit-learn L-BFGS logistic regression을 사용하며, validation label을 사용할 수 없을 때는 validation data 또는 training split에서 hyperparameter를 선택한다.최종 결과를 위해 사용 가능한 validation data를 training data와 다시 결합한 뒤, 사용하지 않은 split에서 성능을 측정한다.

A.4. 결과 · B. Zero-Shot Prediction

CLIP의 최선의 linear-probe 모델은 27개 데이터셋 중 21개에서 state-of-the-art 성능을 달성했으며, 논문은 36개 classifier에 대한 데이터셋 수준의 zero-shot 점수와 정성적 예측도 보고한다.

  • A.4. 결과: 27개 데이터셋 중 21개가 336-by-336 해상도에서 CLIP ViT-L/14를 사용해 얻은 최고 점수의 99.5% Clopper-Pearson confidence interval 안에 들어왔다.많은 데이터셋에서 CLIP은 다른 모델보다 유의하게 뛰어난 성능을 보여, 전통적인 pre-training보다 natural-language supervision이 우수하다는 점을 뒷받침한다.
  • A.4. 결과: linear-probe 평가는 Table 9에 나열된 데이터셋을 대상으로 수행되었으며, 논문 작성 당시 이용 가능했던 Birdsnap 및 Kinetics700의 온라인 리소스를 사용했다.따라서 데이터셋 리소스는 연구 당시 온라인에서 이용 가능했던 상태를 반영한다.
  • A.4. 결과: Table 10은 평가된 27개 데이터셋에서 다양한 pre-trained 모델의 linear-probe performance를 보고한다.각 데이터셋에서 최고 점수의 99.5% Clopper-Pearson confidence interval 안에 있는 점수는 굵게 표시했다.
  • A.4. 결과: STL10 점수는 논문의 이전 버전에서 CUDA-related bug를 수정한 뒤 업데이트되었다.이 주의사항은 보고된 STL10 비교가 이전 버전에서 수정된 결과임을 명시한다.
  • A.4. 결과: Figure 20은 Table 10의 점수를 사용해 27개 데이터셋 전체의 개별 linear-probe 결과를 도시한다.이 비교 도표는 linear-probe 평가를 데이터셋별로 보여준다.
  • B. Zero-Shot Prediction: Zero-shot performance는 Figure 21의 36개 classifier에 대한 random prediction과 Table 11 및 Figure 22의 데이터셋 수준 점수로 요약된다.Figure 21은 상위 5개 class probability, class-representation text, 각 prediction이 ground-truth label과 일치하는지를 보여주며, Figure 22는 zero-shot CLIP과 linear-probe ResNet performance를 비교한다.

C. 중복 검출기

저자들은 의미적 유사성이 많은 중복 오검출을 낳았기 때문에 embedding space의 최근접 이웃 사용을 포기했다. 대신 수정된 ResNet-50을 사용해 synthetic augmentation 기반 검출기를 구축했다.

  • 한계: Embedding space의 최근접 이웃은 의미적으로 유사하지만 서로 다른 객체, 예를 들어 축구공과 꽃이 거의 완벽한 유사도를 보일 수 있어 거짓 양성을 생성했다.모델의 feature space는 의미적 유사성에 크게 가중되어 중복 검출에 대한 유용성이 제한됐다.
  • 방법: 사용자 정의 검출기는 random crop, zoom, aspect-ratio distortion, rescaling, rotation, JPEG compression, HSV jitter, 다양한 interpolation으로 변환한 이미지로 학습됐다.이러한 조작은 embedding space 검출기의 실패를 해결하기 위해 설계된 synthetic data augmentation pipeline을 구성했다.
  • 구현: 검출기는 anti-aliasing, weight normalization, GELU activation을 적용해 수정한 ResNet-50을 사용했다.Weight normalization은 batch statistics를 통한 중복 관련 정보 누출을 방지하기 위해 batch normalization을 대체했다.
  • 데이터셋 비교: YFCC100M으로 학습한 CLIP은 데이터셋별 차이에도 불구하고 동일한 크기의 WIT subset과 유사한 평균 성능과 승리 횟수를 보였다.비교에는 zero-shot 및 linear-classifier 평가가 포함됐다. 서로 다른 데이터셋에서 YFCC100M은 WIT 대비 가장 우수하거나 가장 낮은 성능을 보였다.

D. YFCC100M 데이터셋 ablation · E. 선택 과제 및 데이터셋 결과 · E.1. 이미지 및 텍스트 retrieval

CLIP은 YFCC100M과 WIT에서 동일한 크기로 필터링한 부분집합을 학습할 때 유사한 성능을 보여, 합리적으로 필터링된 image-text 데이터 선택에 강건함을 시사한다. 다만 데이터셋 중복에 대해서는 주의가 필요하다. 이어서 pre-training objective의 sanity check로 zero-shot image 및 text retrieval을 포함한 일부 과제 결과를 살펴본다.

  • D. YFCC100M 데이터셋 ablation: YFCC100M과 WIT는 동일한 크기로 필터링한 부분집합 모델을 32 epochs 동안 학습했을 때 evaluation suite 전반에서 평균적으로 유사한 성능을 보인다.이 비교는 overfitting으로 인해 transfer 성능이 plateau에 접어들기 시작한 이후에 수행된다.
  • D. YFCC100M 데이터셋 ablation: 이 ablation은 CLIP이 합리적으로 필터링된 paired text 및 image 데이터 컬렉션이라면 무엇이든 사용할 수 있음을 시사한다.이는 medical imaging에서 contrastive pre-training이 긍정적인 결과를 보였다는 보고와, noisy-student self-training에서 JFT300M이 YFCC100M보다 보인 향상이 미미했다는 결과와 일치한다.
  • D. YFCC100M 데이터셋 ablation: 필터링된 WIT 부분집합에 YFCC100M 데이터가 포함되어 있으므로, YFCC100M과 WIT의 비교는 성능 차이를 과소평가할 수 있다.저자들은 YFCC100M이 WIT의 3.7%에 불과하고, WIT의 기존 blend에 이를 추가해도 모델 성능이 눈에 띄게 변하지 않았기 때문에 이 중복이 크게 중요하지 않을 것으로 본다.
  • E. 선택 과제 및 데이터셋 결과: 선택 과제 섹션은 본문에서 전반적인 결과를 다룬 뒤, 특정 과제·데이터셋·evaluation 설정의 구체적인 그룹별 성능을 요약한다.이 구성은 연구에서 다룬 데이터셋과 실험의 다양성이 매우 크다는 점을 반영한다.
  • E.1. 이미지 및 텍스트 retrieval: Zero-shot image 및 text retrieval은 CLIP이 pre-training에 사용한 image-text retrieval 과제로 성공적으로 transfer되는지를 평가한다.저자들은 이 평가를 representation 및 task learning에 대한 중요한 sanity check이자 proof of concept로 설명한다.
  • E.1. 이미지 및 텍스트 retrieval: retrieval 평가는 zero-shot transfer 성능을 사용해 text retrieval과 image retrieval을 모두 다룬다.결과는 Table 13에 제시되지만, 제공된 본문에는 표의 수치 결과가 포함되어 있지 않다.

E.2. 광학 문자 인식

CLIP의 OCR 성능은 다섯 개의 직접·간접 OCR 데이터셋에서 이미지 도메인과 숫자 또는 단어 인식 여부에 따라 달라진다. 디지털로 렌더링되고 단어 중심인 과제에서 가장 강력하며, 텍스트의 고차원 의미 표현을 지원할 수 있다.

  • 동기: ImageNet 표현은 OCR에 필요한 만큼 세밀하지 않으므로, 이 기능이 필요한 시스템에서는 맞춤형 OCR 엔진의 출력과 feature를 사용하게 된다.이전 시각화에서는 ImageNet feature가 텍스트의 존재에 반응하는 것으로 나타났지만, 직접적인 optical character recognition을 수행하기에는 충분히 세밀하지 않았다 (Zeiler & Fergus, 2014).
  • 평가: 평가는 다섯 개의 OCR 관련 데이터셋을 다룬다. MNIST, SVHN, IIIT5K는 문자 또는 단어 인식을 평가하고, Hateful Memes와 SST-2는 의미 과제에서의 OCR 활용을 평가한다.Table 14는 Hateful Memes를 제외한 모든 데이터셋에서 test set의 accuracy를 보고하며, Hateful Memes는 dev set의 ROC AUC를 보고한다.
  • 결과: CLIP의 OCR 성능은 이미지 도메인과 텍스트 유형에 따라 달라지며, 텍스트가 디지털로 렌더링되고 대부분 단어로 이루어진 Hateful Memes와 SST-2에서 가장 강력하다.개별적으로 crop된 단어의 natural image로 구성된 IIIT5K에서는 zero-shot CLIP의 성능이 더 낮고 Jaderberg et al. (2015)와 유사하다.
  • 결과: 렌더링된 SST-2 문장에서의 80.5% accuracy는 840 billion token으로 pretrained된 GloVe vector를 사용한 80% continuous-bag-of-words baseline과 일치한다.CLIP의 representation에 linear classifier를 적합해, low-level OCR을 higher-level representation으로 변환할 수 있는지 검증한다.

E.3. 비디오에서의 행동 인식 · E.4. 지리 위치 추정

CLIP은 단일 프레임 평가라는 제약에도 불구하고 비디오 행동 인식으로 강하게 transfer되며, 위치 인식 능력은 Country211과 IM2GPS에서의 평가를 뒷받침한다. 비교 결과는 ImageNet의 명사만을 사용하는 label에 비해 더 폭넓은 language supervision이 잠재적 장점일 수 있음을 보여주지만, architecture와 data 차이의 영향은 여전히 분리되지 않는다.

  • E.3. 비디오에서의 행동 인식: CLIP이 더 잘 transfer될 수 있는 이유는 image-text pretraining이 일반 명사, 고유 명사, 동사, 형용사를 supervision하는 반면 ImageNet-1K label은 일반 명사만 지정하기 때문이다.이 대목은 이러한 더 폭넓은 개념적 supervision을 CLIP과 ImageNet model을 비디오 행동 인식에서 비교하는 동기로 제시한다.
  • E.3. 비디오에서의 행동 인식: 행동 인식 실험은 UCF-101과 Kinetics-700을 포함한 동사 인식 dataset을 평가하지만, CPU 기반 linear evaluation에서는 각 비디오를 one center frame으로 줄여야 한다.이러한 단일 프레임 설정으로 인해 linear CLIP과 linear NS ENet-L2 비교는 기존 video method와 달라진다.
  • E.3. 비디오에서의 행동 인식: CLIP은 linear probing에서 기존 UCF-101 최고 결과와 일치하고, 평가된 model을 능가하며, Kinetics-700에서는 fine-tuned I3D baseline을 넘어선다.제공된 대목은 이러한 비교를 보고하지만 수치 점수는 제시하지 않는다.
  • E.3. 비디오에서의 행동 인식: CLIP의 zero-shot video recognition은 모든 frame에 걸쳐 prediction을 평균내며, 기존 S3D state of the art보다 10 points 향상된다.zero-shot 평가는 별도의 training stage를 거치지 않으며, 기존 S3D model은 100 million instructional video에서 자동 추출한 caption을 사용했다.
  • E.3. 비디오에서의 행동 인식: 행동 인식 비교는 model마다 architecture, training-data distribution, dataset size, compute가 다르므로 인과적으로 분리되어 있지 않다.저자들은 높은 성능을 이끄는 design choice가 무엇인지 규명하려면 추가 연구가 필요하다고 말한다.
  • E.4. 지리 위치 추정: CLIP에서 관찰된 장소 인식 능력은 새로운 Country211 benchmark와 기존 IM2GPS test set에서의 추가 비교를 수행하는 동기를 제공한다.IM2GPS는 기존 geolocalization 연구와 비교하는 데 사용되며, Country211은 논문 전반에서 새로운 benchmark로 평가된다.
  • E.4. 지리 위치 추정: IM2GPS에서 CLIP은 benchmark가 regression으로 구성되어 있기 때문에 search procedure에서 가장 가까운 image를 선택해 GPS 좌표를 추정한다.제공된 대목은 완전한 procedure나 결과를 명시하기 전에 끝난다.

E.5. 분포 이동에 대한 강건성 · F. 모델 하이퍼파라미터

Zero-shot CLIP은 7개 분포 이동 데이터셋 중 5개에서 최신 성능을 개선하며, ImageNet-R의 향상은 CLIP의 사전 학습 분포를 반영한 결과일 가능성이 있다. 부록에는 공통 하이퍼파라미터, CLIP-ResNet 하이퍼파라미터, CLIP-ViT 하이퍼파라미터도 표로 정리되어 있다.

  • E.5. 분포 이동에 대한 강건성: Zero-shot CLIP은 7개 데이터셋 중 5개에서 최신 성능을 개선한다: ImageNet-R, ObjectNet, ImageNet-Sketch, ImageNet-Vid, Youtube-BB.결과는 Table 16에 데이터셋별로 보고되며, Taori et al. (2020)의 평가 스위트와 비교된다.
  • E.5. 분포 이동에 대한 강건성: Table 16은 Taori et al. (2020)의 평가 스위트에서 제시한 최신 성능 결과를 기준으로 데이터셋별 강건성 결과를 제공한다.
  • E.5. 분포 이동에 대한 강건성: ImageNet-R에서는 특히 큰 향상이 나타나는데, 이는 CLIP의 사전 학습 분포에 풍부한 창작 콘텐츠가 포함되었기 때문일 가능성이 높다.Taori et al. (2020)은 Instagram으로 사전 학습한 ResNeXt 모델에서도 유사한 패턴을 보고했다.
  • F. 모델 하이퍼파라미터: Table 18은 공통 CLIP 하이퍼파라미터를 나열한다.
  • F. 모델 하이퍼파라미터: Table 19는 CLIP-ResNet 하이퍼파라미터를 나열한다.
  • F. 모델 하이퍼파라미터: Table 20은 CLIP-ViT 하이퍼파라미터를 나열한다.
Loading 2103.00020v1…