Source-linked AI summary

Mind the Gap: Understanding the Modality Gap in Multi-modal Contrastive Representation Learning

Weixin Liang, Yuhui Zhang, Yongchan Kwon, Serena Yeung, James Zou

arXiv:2203.02053v2cs.CLcs.AIcs.CVcs.LGcs.MM

TL;DR

Multi-modal model은 서로 다른 modality를 공유 representation space의 분리된 영역에 배치하지만, 이러한 modality gap의 기원과 함의는 아직 완전히 이해되지 않았다. 이 논문은 이론적 분석과 실험을 결합해 gap의 원인을 initialization으로 유도된 cone effect와 contrastive optimization으로 설명하고, gap의 거리를 변경하면 downstream zero-shot 성능과 fairness에 영향을 미친다는 사실을 밝혔다.

  • 문제

    이 논문은 multi-modal model이 서로 다른 modality를 분리된 영역에 embedding하는 이유와 이러한 gap이 downstream 성능 및 fairness와 어떤 관련이 있는지를 조사한다.

  • 방법

    이 논문은 두 encoder에서 발생하는 narrow initialization cones와 separation을 유지하는 contrastive learning을 통해 gap을 설명하기 위해 이론과 실험을 결합한다.

  • 결과

    Modality gap은 다양한 multi-modal 모델과 modality에서 나타나며, gap distance를 바꾸면 downstream zero-shot performance와 fairness에 영향을 미친다.

  • 시사점 및 한계

    Modality-gap distance는 중요한 geometric property이며, 더 큰 gap은 일부 fairness 및 zero-shot learning application에 도움이 된다.

  • 시사점 및 한계

    불일치하는 data가 contrastive loss landscape와 modality gap에 미치는 영향은 future research를 위한 open direction으로 남아 있다.

Abstract

from arXiv · show

We present modality gap, an intriguing geometric phenomenon of the representation space of multi-modal models. Specifically, we show that different data modalities (e.g. images and text) are embedded at arm's length in their shared representation in multi-modal models such as CLIP. Our systematic analysis demonstrates that this gap is caused by a combination of model initialization and contrastive learning optimization. In model initialization, we show empirically and theoretically that the representation of a common deep neural network is restricted to a narrow cone. As a consequence, in a multi-modal model with two encoders, the representations of the two modalities are clearly apart when the model is initialized. During optimization, contrastive learning keeps the different modalities separate by a certain distance, which is influenced by the temperature parameter in the loss function. Our experiments further demonstrate that varying the modality gap distance has a significant impact in improving the model's downstream zero-shot classification performance and fairness. Our code and data are available at https://modalitygap.readthedocs.io/

1 서론

이 논문은 random initialization에서도 서로 다른 modality가 공유 representation space의 별도 영역을 차지하는 pervasive한 modality gap을 규명한다. 이 gap을 neural-network cone 효과, 서로 다른 encoder initialization, contrastive learning의 결합으로 설명하고, gap을 조정하면 zero-shot 성능과 fairness를 향상할 수 있음을 보인다.

  • Modality gap 현상: modality gap은 multi-modal model과 modality 전반에서 나타나며, encoder가 random weight를 사용하더라도 image와 text embedding은 서로 다른 영역을 차지한다.보고된 modality에는 text, natural image, video, medical image, amino-acid sequence가 포함된다.
  • Gap의 설명: Deep neural architecture는 embedding을 narrow cone으로 제한하며, 독립적으로 initialized된 encoder는 서로 다른 cone을 형성해 initialization 시 modality를 분리한다.이 논문은 ReLU nonlinearity를 포함한 linear layer가 유도하는 contraction mapping을 수학적으로 특성화하고, theory와 experiment가 일치함을 보고한다.
  • Gap의 설명: Contrastive learning은 optimization 중에도 modality gap을 보존하며, 분리 정도는 loss function의 temperature parameter에 영향을 받는다.이 논문은 theoretical analysis와 experiment를 통해 이 설명을 뒷받침한다.
  • Downstream 시사점: Gap distance를 조정하면 CLIP의 downstream zero-shot 성능과 fairness가 향상된다.이 논문은 gap distance 변경을 downstream 이점을 제공하는 간단한 intervention으로 제시한다.

2 Cone Effect가 Modality Gap을 유발하다

Modality gap은 encoder embedding이 random initialization 단계에서도 좁은 cone 내부에 집중되기 때문에 발생하며, modality-specific data나 contrastive training이 gap을 설명하기 전부터 representation을 분리한다. Nonlinear activation이 이러한 집중을 유도하고, encoder가 동일한 data를 처리할 때에도 gap은 지속될 수 있다.

  • Cone Effect: Encoder embedding은 극도로 좁은 cone을 차지해 분리된 representation 영역을 만들며, random initialization 단계에서 이미 modality gap을 유발한다.Cosine similarity 0.56은 512차원 unit hypersphere 표면적의 1/2^512 미만에 해당한다.
  • Random Initialization: Random initialization된 model에서도 cone effect가 유지되며, average cosine similarity는 trained model보다 높다. 따라서 이 gap에는 서로 다른 modality가 필요하지 않다.두 encoder에 동일한 실제 MSCOCO Caption data를 사용했지만, embedding은 random initialization마다 분리된 상태로 유지되었다.
  • Activation Functions: Nonlinear activation function은 핵심적이다. 더 깊은 nonlinear MLP일수록 average cosine similarity가 빠르게 증가해 2-layer Sigmoid MLP에서는 0.99에 도달하는 반면, linear MLP에서는 cone effect가 거의 나타나지 않는다.이 연구에서는 nonlinearities를 달리하거나 nonlinearities를 사용하지 않은, random initialization된 512-dimensional MLP를 사용했다.
  • Normalization and Architecture: Cone effect는 normalization layer에도 불구하고 지속되며, 분석한 architecture는 embedding extraction 전에 마지막 layer로 ReLU를 사용하지 않는다.Model에는 batch normalization 또는 layer normalization이 포함되므로, 마지막 layer output이 nonnegative라는 사실만으로는 이 관찰을 설명할 수 없다.

3 이론적 분석

이론적 분석은 layerwise computation이 cosine similarity를 높이고 intermediate-output variance가 주로 random initialization에 의해 결정됨을 보여 cone effect를 설명한다. 이러한 결과는 deep network에서 representation이 점점 더 정렬되고 initialization에 의존하게 되는 현상을 뒷받침한다.

  • 각 network layer는 cosine similarity를 높인다: 각 feedforward layer는 output layer의 폭이 충분히 넓을 때 높은 확률로 cosine similarity를 높이며, 이는 intermediate layer 전반에서 관찰된 증가와 일치한다.이 정리는 ReLU가 뒤따르는 linear transformation에 적용되며, 최소 1 − O(1/dout)의 확률로 성립한다.
  • 각 network layer는 cosine similarity를 높인다: 이 단조성 결과는 input vector들이 방향상 지나치게 가깝지 않을 것을 요구한다. 그렇지 않으면 random bias addition이 cosine similarity를 소폭 낮출 수 있기 때문이다.intermediate-layer output norm이 높은 확률로 1에 가깝기 때문에 이 조건은 타당한 것으로 여겨진다.
  • random initialization의 효과: intermediate output의 variance는 data-induced variance와 random weights and biases에 따른 variance로 분해되며, 후자는 deep network에서 지배적이 된다.Theorem 2는 initialization-variance fraction을 이전 layer output의 평균 cosine similarity인 β로 하한 bound하며, β는 depth가 증가함에 따라 one에 가까워진다.

4 대조 학습은 modality gap을 보존한다

대조 학습은 modality gap을 보존한다. CLIP의 학습된 temperature에서 기본 gap은 contrastive loss를 최소화하며, 더 높은 temperature와 불일치 데이터는 gap의 강도를 변화시킨다. 서로 다른 초기 gap에서 학습하면 initialization과 optimization이 모두 최종 분리를 형성하는 것으로 나타난다.

  • Contrastive objective: CLIP은 정렬된 N개의 image-text 쌍에 대해서는 cosine similarity를 최대화하고, image-to-text 및 text-to-image loss를 사용해 잘못된 N^2 − N개의 쌍에 대해서는 이를 최소화한다.embedding은 L2-normalized되며, τ는 logit의 크기를 조정하는 learned temperature parameter다. CLIP의 최종값은 τ = 1/100이다.
  • Loss landscape: τ = 1/100에서 기본 gap distance 0.82는 contrastive loss의 global minimum을 달성하는 반면, gap을 줄이면 loss가 증가한다.text embedding을 반대쪽의 back-to-back 위치로 이동시키면 local minimum도 나타난다.
  • Temperature: temperature가 증가할수록 gap distance는 단조롭게 감소하며, 높은 temperature에서는 gap이 크게 줄어들거나 닫히고 낮은 temperature에서는 gap이 보존된다.이 결과는 batch size 64인 MSCOCO Caption에서 CLIP을 6개의 temperature로 fine-tuning하여 얻었다.
  • Mismatched data: 불일치하는 image-text 쌍을 사용하면 simulation은 temperature에 의존하는 repulsive optimization structure를 재현하지만, 불일치를 제거하면 이 구조는 사라진다.따라서 불일치 데이터는 낮은 temperature에서 modality-gap 형성에 기여한다. 이러한 불일치는 어려운 caption이나 annotation error에서 발생할 수 있다.
  • Initialization and optimization: 최종 gap은 초기 gap 1.1891 ± 0.0017 및 0.0388 ± 0.0351에서 각각 1.2991 ± 0.0389 및 0.7457 ± 0.0633이었다.모델은 batch size 64 및 τ = 1/100 조건에서 MSCOCO Caption으로 학습했으며, 값은 3회 실행에 대한 95% confidence interval이다.

5 Modality Gap의 시사점

CLIP embedding을 이동해 modality gap을 조정하면 여러 downstream zero-shot task의 성능이 향상된다. gap을 0.82에서 0.97로 늘리면 0.0008의 top-1 accuracy 하락만으로 모든 인종에서 denigration harm이 일관되게 감소한다.

  • Downstream 성능: 이 연구는 CIFAR10, CIFAR100, EuroSAT, SVHN, HatefulMemes [28]을 사용해 CLIP zero-shot transfer에서 gap 변화를 평가한다.Task별 metric과 prompt는 Supplementary Table 3에 제시한다.
  • Downstream 성능: embedding을 이동해 modality gap을 조정하면 CLIP의 원래 이동되지 않은 gap과 비교해 서로 다른 downstream task의 성능이 향상된다.평가는 coarse-grained classification, fine-grained classification, optical character recognition task를 포괄한다.
  • 공정성 시사점: gap을 0.82에서 0.97로 늘리면 0.0008의 minor한 top-1 accuracy 하락만 발생하면서 모든 인종에서 denigration harm이 일관되게 감소한다.gap을 지나치게 작게 또는 크게 만들면 각각 범죄 관련 bias와 비인간 bias가 악화된다.

6 관련 연구

선행 연구는 vision, language, graph 전반에서 contrastive learning을 정립했으며, multi-modal model은 contrastive pretraining을 사용해 공유 공간에서 modality를 정렬했다. 기존 cone effect 연구는 주로 language model에 초점을 맞춘 반면, 본 연구는 이 현상을 일반적인 deep neural network로 확장한다.

  • Contrastive Representation Learning: Contrastive representation learning은 서로 유사한 object를 유사하지 않은 object보다 가깝게 만들며, vision [7] [6] [9], language [16], graph domain에서 성공을 거두었다.이러한 성공에도 불구하고 contrastive learning이 작동하는 이유에 대한 포괄적인 이론적·경험적 이해는 여전히 제한적이다.
  • Multi-modal Contrastive Representation Learning: Multi-modal model은 서로 다른 modality의 input을 공유 표현 공간(shared representation spaces) [24]으로 매핑하며, 일반적으로 contrastive loss 로 사전 학습된다.Contrastive learning은 generative approach 보다 12× 더 효율적인 것으로 보고되었다.
  • Cone Effect: 선행 cone effect 연구는 BERT와 GPT-2 [12] [15] 같은 학습된 language representation을 검토했으며, post-processing과 수정된 objective는 anisotropy를 완화하고 downstream performance를 향상시킨다 [15] [16].기존 연구는 cone effect를 불균형한 word-frequency distribution [15]하에서의 optimization에 기인한 것으로 설명했다.
  • Cone Effect: 본 연구는 이 현상이 기존에 연구된 language-representation 설정을 넘어 성립함을 입증함으로써 cone-effect analysis를 확장한다.이 논문은 cone effect를 deep neural network의 일반적인 현상으로 제시한다.

7 논의

논의에서는 modality gap이 모델 초기화와 최적화에서 비롯되며 downstream 성능과 공정성에 영향을 준다고 본다. 또한 temperature가 contrastive geometry에 미치는 영향과 더 큰 gap이 일부 응용에서 제공할 수 있는 이점을 강조한다.

  • 논의: 이 연구는 modality gap이 모델 초기화와 최적화의 결합 효과에서 비롯된다고 보이며, gap이 downstream 성능과 공정성에 영향을 줄 수 있음을 보인다.이 논문의 주요 목표는 이 현상을 입증하고 contraction mapping이 이에 어떻게 기여하는지 설명하는 것이다.
  • 논의: Embedding shifting, simulation, fine-tuning 실험은 temperature가 contrastive loss landscape에 큰 영향을 미친다는 것을 보여주며, unimodal representation geometry에 관한 연구 결과 를 보완한다.선행 연구는 temperature를 unimodal representation space의 uniformity 및 affinity와 연결한다.
  • 논의: modality gap을 변화시키면 downstream 성능과 공정성에 영향을 주며, 더 큰 gap은 일부 공정성 및 zero-shot learning 응용에 도움이 된다.gap이 응용에 미치는 영향을 체계적으로 분석하는 것은 향후 연구의 중요한 방향으로 제시된다.

재현성 성명

저자들은 보고된 modality gap을 재현하고, 추가적인 cross-modal 모델을 분석하며, 논문의 figure를 생성할 수 있는 오픈소스 구현을 공개한다.

  • 재현성 성명: 오픈소스 구현을 통해 modality gap을 재현하고, 추가적인 cross-modal 모델을 분석하며, 논문의 figure를 생성할 수 있다.https://github.com/Weixin-Liang/Modality-Gap에서 이용할 수 있다.

체크리스트 · Contrastive learning이 modality gap을 보존함

이 체크리스트는 논문이 주장 범위, 한계, 사회적 영향, 이론적 가정과 증명, 재현성, training 세부사항, 불확실성, compute, asset 문서화, data privacy, participant 고려사항을 다루는지 확인한다.

  • 체크리스트: 저자들은 논문의 abstract와 introduction이 주장과 범위를 정확히 반영하며, 한계가 기술되어 있다고 확인한다.또한 잠재적인 부정적 사회적 영향과 ethics-review guidelines 준수에 대한 논의도 확인한다.
  • 체크리스트: 이론적 결과에 대해 체크리스트는 모든 가정이 명시되어 있고 완전한 증명이 포함되어 있다고 밝힌다.
  • 체크리스트: 실험에 대해 저자들은 완전한 training 세부사항과 함께 code, data, reproduction instructions가 제공된다고 확인한다.
  • 체크리스트: 실험은 반복 실행에서 얻은 error bars를 보고하고 총 compute와 사용한 resources를 문서화한다.
  • 체크리스트: 논문은 기존 assets를 인용하고 해당 licenses를 언급하며, supplemental material 또는 URL을 통해 새로운 assets를 제공한다.
  • 체크리스트: 체크리스트는 consent, personally identifiable 또는 offensive content, human-subject requirements를 다루며, 관련되는 경우 해당 항목을 적용 불가로 표시한다.논문은 consent와 data risks에 대한 논의를 확인하는 한편, participant instructions, risks, approvals, compensation은 N/A로 표시한다.

A.1 불일치 데이터 시뮬레이션 · B Modality Gap의 함의 · B.1 Zero-shot 성능

시뮬레이션은 불일치 데이터가 temperature에 의존하는 반발 구조를 형성하며, 불일치를 제거하면 이 구조가 사라짐을 보여준다. 또한 논문은 coarse-grained 및 fine-grained classification과 optical-recognition task 전반에서 modality gap 증가가 zero-shot 성능에 미치는 영향을 평가한다.

  • A.1 불일치 데이터 시뮬레이션: 불일치 데이터는 simulation model이 optimization landscape에서 temperature에 의존하는 반발 구조를 재현하도록 한다.이 구조는 Figure 3 (e-g)에 나타난다.
  • A.1 불일치 데이터 시뮬레이션: 불일치를 제거하면 simulation에서 반발 구조가 사라진다.비교에는 Supplementary Figure 9가 사용된다.
  • A.1 불일치 데이터 시뮬레이션: 이론적 시뮬레이션은 embedding을 3D unit sphere에 배치하고, image vector를 적도에 고정하며, text embedding을 gap을 줄이는 방향으로 이동시킨다.고정된 image embedding에는 r = 1, Δφ = 15°, θ = 90°가 사용된다.
  • B Modality Gap의 함의: 모델링은 낮은 temperature와 hard sample 또는 annotation error가 관찰된 구조를 형성하는 중요한 요인임을 확인한다.제공된 본문은 두 요인이 모두 중요한 형성 요인이라고 서술한다.
  • B.1 Zero-shot 성능: CLIP에서 modality gap을 늘리면 여러 zero-shot learning task의 downstream 성능을 향상시킬 수 있다.gap distance에 따른 성능은 Appendix Figure 10에 보고되어 있다.
  • B.1 Zero-shot 성능: 평가된 task는 coarse-grained classification, fine-grained classification, optical character recognition을 포괄한다.여기에는 CIFAR10과 CIFAR100, EuroSAT, SVHN과 HatefulMemes [28]가 포함된다.

B.2 공정성 · C 더 큰 그림: modality gap 연구가 중요한 이유

CLIP의 modality gap을 수정하면 경미한 정확도 비용만으로 인종 간 편향이 일관되게 감소하지만, 극단적인 gap 설정은 서로 다른 유형의 편향을 증폭시킨다. 더 폭넓은 증거는 modality gap이 좁은 원뿔 형태의 표현에서 발생하고, 다양한 학습 조건에서도 지속되며, downstream 성능과 최적화에 영향을 미친다는 점을 보여준다.

  • B.2 공정성: 단순한 gap offset 방법은 인종 전반에서 CLIP의 편향을 일관되게 줄이면서 top-1 정확도를 0.0008만큼, 0.5817에서 0.5739로 감소시킨다.gap을 지나치게 작게 또는 크게 만들면 각각 범죄 관련 편향이나 비인간 편향이 오히려 악화된다.
  • C 더 큰 그림: modality gap 연구가 중요한 이유: modality gap 연구는 random label fitting과 더 평평한 minimum 또는 initialization에 가까운 해를 선호하는 optimization을 포함한 neural-network inductive bias에 관한 폭넓은 연구와 맥을 같이한다 [13] [27].이러한 맥락은 initialization과 optimization이 multimodal representation geometry를 어떻게 형성하는지 분석할 동기를 제공한다.
  • C 더 큰 그림: modality gap 연구가 중요한 이유: modality gap은 pretrained cross-modal model에서 나타나며, multimodal training 이전인 initialization 단계에 이미 존재한다.SVD 시각화는 여러 model과 initialization 과정에서 쌍을 이룬 image-text embedding이 서로 분리되어 있음을 보여준다.
  • C 더 큰 그림: modality gap 연구가 중요한 이유: 무작위로 initialization된 neural network는 입력을 좁은 원뿔로 사상하며, 서로 다른 random seed는 서로 다른 원뿔을 만들어 ImageNet training 이후에도 그 차이가 유지될 수 있다.COCO-Captions와 ImageNet에서 평균 pairwise cosine similarity가 0보다 상당히 높게 나타나, 유효 embedding space가 제한되어 있음을 보여준다.
  • C 더 큰 그림: modality gap 연구가 중요한 이유: 불일치하는 image-text pair는 반발성 loss landscape 구조를 만들지만, 불일치를 바로잡으면 그 구조가 사라진다.simulation에서 text embedding을 modality gap을 줄이는 방향으로 이동시키고, 일치하는 pairing과 불일치하는 pairing을 비교한다.
  • C 더 큰 그림: modality gap 연구가 중요한 이유: modality gap을 수정하면 zero-shot downstream 성능이 향상되며, embedding이 image embedding과 text embedding 사이의 중심으로 이동할 때 task-specific trend가 나타난다.보고된 향상은 통계적으로 유의하며, 최적 성능을 위해 gap을 증가시켜야 하는 경우와 감소시켜야 하는 경우가 모두 있을 수 있다.
  • B.2 공정성: d = 0.07인 gap은 범죄 관련 편향을 악화시키는 반면, d = 1.29인 gap은 인종 전반에서 비인간 편향을 일관되게 악화시킨다.더 큰 값은 original CLIP definition에서 더 큰 denigration bias를 의미한다.
  • C 더 큰 그림: modality gap 연구가 중요한 이유: CLIP input normalization과 normalization layer를 비활성화해도 modality gap은 지속되며, embedding dimension 64, 128, 256, and 512 전반에서 나타난다.이 결과는 해당 현상이 검증한 normalization 설정이나 특정 embedding dimensionality에 의존하지 않음을 보여준다.

D 증명

이 증명들은 symmetry, Gaussian moments, probabilistic inequalities를 사용해 randomly initialized ReLU networks의 concentration과 cosine-similarity bound를 확립한다. 또한 trace parameter β가 preceding-layer cosine similarity를 포착하고 final-layer variance를 제약하는 방식을 형식화한다.

  • Lemma 3: Lemma 3은 symmetric하고 variance-scaled weights와 biases를 사용하는 random affine layer 전후의 inner product를 비교해, 이후 ReLU similarity inequalities의 기반을 제공한다.증명은 W와 b의 independence에 의존한 뒤 각 coordinate를 positive part와 negative part로 분해한다. mixed-sign term은 nonpositive다.
  • Theorem 1: Theorem 1은 ReLU output이 almost surely positive cosine similarity를 가지므로 nonpositive input inner product를 별도로 다룬다. main proof는 positive-inner-product case를 다룬다.이는 해당 정리에 사용되는 concentration argument의 적용 범위를 확립한다.
  • Theorem 1: Theorem 1은 neuron preactivation을 i.i.d. Gaussian variable로 취급하고 rectified-Gaussian moment를 bound한 뒤 Chebyshev concentration을 적용해 high-probability cosine-similarity bound를 얻어 증명한다.이 논증은 finite fourth moment를 사용하고 두 concentration inequality를 결합해 failure probability O(1/(d_outϵ_1^2))와 O(1/(d_outϵ_2^2))를 얻는다.
  • Theorem 4: Theorem 4는 unit-norm input과 tr(Var[h^(L−1)(U) | Θ^(L−1)]) = 1 − β를 가정하고 Gaussian initialization에서 각 final-layer coordinate의 conditional variance를 bound한다.증명은 conditional Gaussian variance, symmetry-based variance bound, total variance law를 통해 진행된다.
  • Theorem 4: β는 independent (L−1)-th-layer output의 expected cosine similarity를 근사하며, cone effect가 conditional variance를 줄이므로 large depth에서 one에 가까울 가능성이 크다.이는 정리의 variance parameter와 deep-network representation의 geometric concentration을 연결한다.
Loading 2203.02053v2…