Source-linked AI summary

Multimodal Deep Learning

Cem Akkus, Luyang Chu, Vladana Djakovic, Steffen Jauch-Walser, Philipp Koch, Giacomo Loss, Christopher Marquardt, Marco Moldovan, Nadja Sauter, Maximilian Schneider, Rickmer Schulte, Karol Urbanczyk, Jann Goschenhofer, Christian Heumann, Rasmus Hvingelby, Daniel Schalk, Matthias Aßenmacher

arXiv:2301.04856v1cs.CLcs.LGstat.ML

TL;DR

Multimodal 연구는 sequence modeling과 cross-modal representation learning의 한계를 해결해야 한다. 이 책은 multimodal architecture를 조사하고 GLIDE와 unCLIP 같은 모델에서 향상된 photorealism과 diversity를 보고하는 한편, 여전히 남아 있는 과제를 지적한다.

  • 문제

    Encoder-decoder와 recurrent architecture는 sequence의 bottleneck, vanishing gradient, long-distance dependency를 처리하는 데 어려움을 겪는다.

  • 방법

    이 책은 joint text-image contrastive pretraining과 생성 이미지에 대한 automated 및 human evaluation을 포함해 multimodal architecture를 종합한다.

  • 결과

    GLIDE는 더 높은 photorealism을 달성하는 반면, unCLIP은 유사한 photorealism과 caption similarity를 유지하면서 더 큰 data diversity를 생성한다.

  • 시사점 및 한계

    검토한 text-to-image model은 photorealism, diversity, caption similarity 전반에서 진전을 보이지만, model capability에 따른 성능은 여전히 고르지 않다.

  • 시사점 및 한계

    Pure language model은 여전히 multimodal multitask model보다 우수하며, unified multimodal 및 multitask representation learning에는 개선의 여지가 있음을 보여준다.

Abstract

from arXiv · show

This book is the result of a seminar in which we reviewed multimodal approaches and attempted to create a solid overview of the field, starting with the current state-of-the-art approaches in the two subfields of Deep Learning individually. Further, modeling frameworks are discussed where one modality is transformed into the other, as well as models in which one modality is utilized to enhance representation learning for the other. To conclude the second part, architectures with a focus on handling both modalities simultaneously are introduced. Finally, we also cover other modalities as well as general-purpose multi-modal models, which are able to handle different tasks on different modalities within one unified architecture. One interesting application (Generative Art) eventually caps off this booklet.

기술 설정

이 책은 Markdown으로 작성되었으며, 시뮬레이션, 데이터 예제, 시각화는 R로 생성하고 rmarkdown을 사용해 Markdown에 통합했다.

  • 기술 설정: 각 장은 Markdown을 사용하며, R은 시뮬레이션, 데이터 예제, 시각화를 지원한다. rmarkdown은 R 코드와 Markdown을 결합한다.

0 서문

서문에서는 이 책이 Git과 GitHub를 활용한 협업으로 bookdown 패키지를 통해 제작되었다고 설명한다.

  • 0 서문: 이 책은 bookdown으로 제작되었으며, 공동 저자들은 Git과 GitHub를 통해 작업을 조율했다.자세한 내용은 이 책의 repository에서 확인할 수 있다.

1 서론

이 책은 이질적인 정보를 결합하고 비정형 cross-modal 데이터 문제를 해결하기 위한 state-of-the-art multimodal deep-learning 방법을 개관한다. NLP와 computer vision의 기초에서 text–image architecture와 general multimodal system으로 나아간다.

  • 동기: Multimodal learning은 청각, 촉각, 후각, 미각, 시각과 같은 정보 채널을 결합해 주변 세계를 지각하고 이해한다.이 책은 multimodal deep learning을 비정형 데이터와 서로 다른 modality에서 입력되는 데이터가 야기하는 문제를 해결하는 접근으로 설명한다.
  • 기초: Chapter 2는 NLP와 computer vision의 기초를 소개하며, word embedding과 dataset, pre-training task, challenging benchmark 간 비교를 중점적으로 다룬다.NLP는 text를 처리하고 computer vision은 image를 처리하며, word embedding은 거의 모든 multimodal architecture에서 필수적이다.
  • Text–Image Architecture: Chapter 3는 image captioning, image-to-text method, image-supported language model, text-supported vision model을 포함해 text와 image를 결합하는 architecture를 개관한다.예로 Microsoft COCO, M2 Transformer (Cornia et al., 2019), CLIP (Radford et al., 2021b), ALIGN (Jia et al., 2021a), Florence 가 있다.
  • General Multimodal Architecture: Chapter 4는 multimodal modeling을 video, speech, tabular data로 확장하고, modality-independent architecture, fusion과 alignment, joint 또는 coordinated representation에 초점을 맞춘다.또한 structured modality를 general multimodal system 안에서 결합하는 방법을 살펴본다.

2 모달리티 소개

NLP와 computer vision은 sequence-to-sequence models, attention, convolutional 및 contrastive methods를 비롯한 강력한 representation-learning architecture를 발전시켜 왔다. 두 분야의 융합으로 text-to-image generation과 같은 multimodal task가 가능해졌지만, 고품질 multimodal data가 부족해 pre-training과 benchmarking이 필수적이다.

  • Natural Language Processing: Sequence-to-sequence models는 입력 sequence를 서로 다른 길이의 출력으로 매핑하며, sequence structure에 대한 가정을 최소화한 채 machine translation, video captioning, question answering을 지원한다.Attention은 관련 정보에 집중하고 bottleneck을 우회하며 vanishing gradient 문제를 완화해 이러한 model을 개선한다 (Bahdanau et al. (2014)).
  • Computer Vision: Computer vision에서는 self-supervised contrastive learning의 활용이 늘고 있으며, 같은 image의 augmented view는 서로 가깝게 만들고 서로 다른 image의 view는 분리한다.SimCLR은 이전 연구를 능가하며, BYOL은 image representation을 학습하기 위한 또 다른 self-supervised approach를 제공한다 (Chen et al., 2020a; Grill et al., 2020b).
  • Multimodal Convergence: NLP와 computer vision은 multimodal task를 위해 융합되고 있으며, DALL-E 2가 text로부터 photorealistic image 또는 art를 생성하는 사례가 이를 보여준다.한 modality에서 다른 modality로의 이러한 변환에는 multimodal dataset이 필요하지만, 이러한 dataset은 여전히 상대적으로 드물다.
  • Multimodal Data: Vision-language pre-training은 고품질 image description을 확보하기 어렵다는 제약을 받으며, COCO, Visual Genome, Conceptual Captions, Flickr30k, LAION-400M, LAION-5B를 포함한 dataset에 의존한다.LAION-5B는 공개적으로 접근 가능한 가장 큰 image-text dataset으로 설명된다.
  • Benchmarking: Benchmarking은 accuracy와 같은 metric을 사용해 특정 task에서 model을 비교하며, human baseline과 비교해 성능을 맥락화할 수 있다.Benchmark dataset은 ImageNet과 ImageNetReaL 같은 computer-vision dataset을 포함해 여러 modality에 걸쳐 model을 테스트하고 비교하는 데 사용된다.

2.1 NLP의 최첨단

최첨단 NLP는 정적 word embedding과 recurrent sequence model에서 attention 기반 Transformer 및 pretrained language model로 발전해 왔다. 이러한 발전은 contextual representation, translation, transfer learning, few-shot generalization을 향상시키지만, 장거리 context, 암묵적 지식, 데이터 가용성 측면의 한계는 여전히 남아 있다.

  • Word embedding: 정적 word embedding은 사전 지식을 통합하고 transfer learning을 지원하지만, 단어의 문맥 의존적 의미를 표현할 수 없다.정적 word embedding은 정도가 있는 유사성, 통사적 규칙성, 언어 간 기하학적 매핑, 일부 사전에 없는 의미 번역 예측을 포착할 수 있지만, 언어 거리가 먼 번역에서는 한계가 드러난다.
  • Sequence modeling과 attention: Attention은 encoder-decoder 병목을 우회하고 vanishing gradient를 완화하는 지름길을 제공함으로써 NLP 성능을 상당히 향상시킨다.Attention alignment는 각 target word를 생성할 때 decoder가 어떤 source word를 사용하는지도 드러내므로, 번역 결정의 해석을 지원한다.
  • Sequence modeling과 attention: Recurrent model은 인접한 단어 간 상호작용을 인코딩하지만, 먼 의존성을 처리하려면 O(sequence length) 단계가 필요하다. 반면 deep LSTM은 층을 하나 추가할 때마다 perplexity를 거의 10% 낮춘다.4-layer LSTM의 한 예에서는 층마다 1000개의 cell과 1000차원 word embedding을 사용해, 문장을 8000개의 실수로 표현했다.
  • Transformer와 pretrained language model: BERT의 masked-language pretraining과 bidirectional context는 question answering, sentiment analysis, text summarization 전반에서 뛰어난 fine-tuned 결과를 가능하게 했다.Sequence generation에는 BERT와 같은 encoder보다 pretrained decoder가 더 적합하지만, BERT는 여전히 다양한 task를 위한 범용 도구로 남아 있다.
  • Transformer와 pretrained language model: Transformer language model은 성공적인 결과를 달성했으며, scaling은 T5의 11 billion과 비교되는 GPT-3의 175 billion parameters로 대표된다.이러한 model의 규모가 커질수록 실험과 이해는 더 어려워진다.
  • 한계와 데이터 효율성: BERT representation은 품사, 통사적 구, 역할, 의미적 선호에 관한 계층적 정보를 인코딩하지만, 명시되지 않은 시각적·지각적 지식을 처리하는 데 어려움을 겪는다.Few-shot learning은 언어, domain, task 전반에서 labelled example의 실질적 부족과 수집 비용 문제를 해결한다 (Schick and Schütze, 2020).

2.2 Computer Vision의 최신 동향

이 절에서는 residual 및 compound-scaled convolutional network부터 self-supervised contrastive learning과 Vision Transformer까지 computer vision의 주요 발전을 살펴본다. 균형 잡힌 scaling, 강력한 representation-learning 기법, patch 기반 Transformer를 핵심 최신 동향으로 강조한다.

  • Residual network: Residual network는 identity mapping으로 degradation 문제를 해결하지만, 매우 깊은 model에서는 정확도 향상이 감소하며 ResNet-1000은 ResNet-101과 유사한 성능을 보인다.실험 결과 residual projection matrix는 차원만 일치하면 되고, degradation 문제에는 identity mapping만으로 충분한 것으로 나타났다.
  • EfficientNet: EfficientNet-B0는 ResNet-50보다 우수한 성능을 보였으며, 이후 EfficientNet 변형들은 B7까지 결과를 개선했다.EfficientNet은 하나의 차원만 조정하는 대신 고정된 coefficient를 사용해 network width, depth, resolution을 compound-scale한다.
  • Self-supervised representation learning: SimCLR은 더 강한 augmentation, nonlinear projection head, memory bank 없는 contrastive cross-entropy learning을 사용해 기존 self-supervised method보다 우수한 성능을 보였다.더 강한 color augmentation은 특히 unsupervised contrastive learning에 유리하며, NT-Xent는 normalization, cosine similarity, temperature를 통해 negative sample을 상대적 난이도에 따라 가중한다.
  • Self-supervised representation learning: image augmentation을 random crop으로 제한하면 BYOL은 SimCLR보다 성능 손실이 적다.이 비교는 linear-evaluation protocol에 관한 것으로, 더 약한 augmentation에서의 robustness 차이를 보여준다.
  • Vision Transformer: 88.5% 정확도: ViT-H/14는 ImageNet에서 ResNet(BiT)과 Noisy Student보다 우수한 성능을 보였다.ViT는 최소한의 architectural change만으로 linearly embedded image patch에 표준 Transformer를 적용한다.

2.3 NLP, CV 및 멀티모달 태스크를 위한 리소스와 벤치마크

모델 성능을 향상하려면 더 강력한 아키텍처와 더 많은 데이터가 모두 필요하지만, 데이터를 추가하면 라벨링 문제가 발생한다. 더 넓은 목표는 방대한 라벨링 데이터에 의존하지 않고 다양한 태스크에서 우수한 성능을 내는 generalist 모델을 개발하는 것이다.

  • 더 나은 모델 성능은 개선된 아키텍처와 더 크거나 새로운 데이터셋에서 비롯될 수 있지만, 새로 수집한 데이터에는 신중한 라벨링이 필요하다.
  • 신중하게 라벨링된 데이터로 학습한 supervised 모델은 학습 태스크에서 매우 우수한 성능을 내지만, 다른 태스크로 효과적으로 일반화하지 못할 수 있다.
  • 지향하는 방향은 방대한 라벨링 데이터 없이 여러 태스크를 처리하는 generalist 모델이며, 제한적인 supervision만으로 효율적으로 학습하는 인간과 더 유사한 방식이다.

2.3 NLP, CV 및 멀티모달 태스크를 위한 리소스와 벤치마크

모달리티에 따라 pre-training 리소스가 다르다. NLP는 텍스트, CV는 이미지, VL-PTM은 텍스트–이미지 쌍을 사용한다. 한편 웹에서 수집한 데이터셋은 노이즈, 불균등한 규모, 제한적인 공개 가능성을 수반한다. 이 절에서는 언어, 비전, vision-language 평가의 취약점을 드러내는 벤치마크를 살펴보며, 여기에는 overfitting, 모호한 라벨, 그리고 여전히 남아 있는 reasoning의 공백이 포함된다.

  • Pre-training 리소스: NLP 모델은 텍스트로, CV 모델은 이미지로, VL-PTM은 텍스트–이미지 쌍 데이터로 pre-train하며, NLP와 CV의 특성을 결합한다.
  • Pre-training 리소스: 텍스트 데이터는 CV 데이터보다 훨씬 풍부하고, VL-PTM 데이터셋은 여전히 상대적으로 작지만 빠르게 증가하고 있으며, 일부 데이터셋은 공개되지 않는다.수집된 데이터가 proprietary하거나 민감할 수 있기 때문에 데이터셋 접근 역시 제한되지만, 그렇다고 해서 항상 이를 공개하지 않을 정당성이 생기는 것은 아니다.
  • Pre-training 리소스: 웹에서 수집한 데이터셋은 노이즈가 많을 수 있어 추출과 filtering이 필요하다. 현재의 best practice는 대규모 웹 스크랩과 선별된 고품질 데이터셋을 결합하는 것이다.Common Crawl은 원시 웹 데이터의 규모와 변동성을 보여주는 사례이며, Pile은 다양한 소스를 중심으로 설계되었고 22개 하위 데이터셋에 걸쳐 약 825 GB를 포함한다.
  • NLP 벤치마크: GLUE의 human leaderboard 벤치마크는 모델들에 의해 빠르게 추월되었고, 이에 따라 SuperGLUE가 만들어졌다.
  • Computer vision 벤치마크: ImageNet 평가에서는 새로 수집된 약간 더 어려운 이미지에서 accuracy drops가 나타났으며, ReaL은 재평가된 라벨과 여러 개의 유효한 이미지 라벨을 수용하는 metric을 도입했다.Recht et al. (2019)은 이러한 하락을 adaptivity가 아니라 제한적인 generalization에 따른 것으로 보았고, Beyer et al. (2020)은 ReaL accuracy를 제안했다.
  • 멀티모달 벤치마크: VCR은 vision-language 모델에 여전히 어렵다. 인간은 90% 이상의 accuracy를 달성하지만, 공개된 모델은 Q →A에서 85.5, QA →R에서 87.5, Q →AR에서 74.9를 달성했다.공개 당시 state-of-the-art vision 모델의 accuracy는 45%에 불과했으며, 이는 visual reasoning이 해결되지 않았음을 보여준다.

3 멀티모달 아키텍처

이 절에서는 이미지와 텍스트를 위한 멀티모달 아키텍처를 개관하며, image-to-text generation, text-to-image synthesis, language model을 위한 visual grounding, vision을 위한 language supervision, 두 modality를 모두 처리하는 unified model을 다룬다. Transformer 기반 representation learning, self-supervision, modality의 joint 또는 staged integration을 강조한다.

  • 절 개요: 이 장에서는 image–text multimodal learning을 다섯 방향으로 구성한다: Image2Text, Text2Image, Images supporting Language Models, Text supporting Image Models, Models for both modalities.이 방향들은 한 modality를 다른 modality로 변환하고, visual information을 language model에 통합하며, language를 vision의 supervision으로 사용하고, unified framework를 구축하는 내용을 포괄한다.
  • Image2Text: Transformer-based architectures는 복잡한 이미지의 captioning을 향상시키며, 풍부하게 주석이 달린 COCO는 의미 있는 Image2Text modeling을 지원한다 (Lin et al., 2014c; Cornia et al., 2020).이 절에서는 image description과 scene-context parsing이 인간보다 컴퓨터에 상당히 더 어려운 과제라는 점을 설명한다.
  • Text2Image: Text2Image model은 문맥적 textual representation을 embedding vectors로 인코딩하여 GAN, VAE, VQ-VAE, diffusion, autoregressive 접근법 전반에서 image generation을 유도한다.이 분야는 연대기적으로 제시되며, 최근 NLP의 발전이 text-conditioned visual generation을 가능하게 했다.
  • Images supporting Language Models: Visual information은 별도의 unimodal encoder를 사용한 뒤 결합하거나, shared intermediate space에서 simultaneous joint learning을 수행하는 방식으로 language model을 지원할 수 있다.Silberer and Lapata (2014)는 bimodal autoencoder를 사용한 반면, Bordes et al. (2020)는 textual objective와 grounded objective 사이에서 parameter를 공유한다.
  • Text supporting Image Models: Language supervision은 manual label을 넘어서는 signal을 추가하여 computer-vision training을 강화하며, WIT의 400 million text-image pairs로 학습된 CLIP (Radford et al., 2021a)이 이를 예시한다.CLIP은 대규모 web text-image data를 사용해 language representation과 visual representation을 연결한다.
  • Models for both modalities: Unified multimodal model은 general self-supervised learning을 추구하며, transformer는 확장 가능한 parallel processing을 제공하고 vision-language modeling의 de-facto standard가 되었다.이 절에서는 대규모 dataset에서 RNN/CNN보다 transformer가 갖는 장점을 강조하고, data2vec과 Flamingo를 포함한 model에서 cross-modality 및 few-shot capability를 논의한다.

3.1 Image2Text

Image captioning은 semantic image comprehension과 정확한 문장 생성을 모두 요구한다. 이 절에서는 풍부한 주석이 포함된 자원으로 MS COCO를 제시하고, image encoding, decoding 및 captioning 성능에서 M² Transformer의 발전을 설명한다.

  • Image captioning: Image captioning은 semantic image comprehension과 정확하고 정밀한 설명 문장 생성을 결합한다.이는 computer vision과 natural language processing을 아우르는 과제로 제시된다.
  • MS COCO: MS COCO에는 91개 object categories, 328,000 images, 2,500,000 instance labels가 포함되어 detection, relationship modeling 및 정밀한 localization을 지원한다 (Lin et al., 2014c).이 dataset은 비아이코닉한 시점, 객체 간 semantic relationships 및 정밀한 object localization에 초점을 둔다.
  • MS COCO: MS COCO는 ImageNet과 SUN보다 categories가 적지만 category당 highest average number of instances를 가지며, 정밀한 localization을 위한 model을 지원한다 (Lin et al., 2014c).구축 과정에서는 일상적인 객체 categories를 대표성 있게 선정하고 다수의 비아이코닉한 images를 포함하는 데 중점을 둔다.
  • M² Transformer: M² Transformer는 image regions 간 multi-level relationships를 학습하고, encoder layers 전반에 a priori knowledge를 통합하며, language generation을 위해 mesh-like decoder connectivity를 사용한다 (Cornia et al., 2020).이 architecture는 low- 및 high-level visual features를 활용하고 sigmoid-gated meshed connectivity를 적용한다.
  • M² Transformer: M² Transformer는 BLEU-4, METEOR 및 CIDEr에서 다른 models를 능가하며, BLEU-1에서는 SGAE와, SPICE에서는 ORT와 경쟁력 있는 성능을 유지한다 (Cornia et al., 2020).CIDEr score는 original Transformer의 121.8에서 reduced model의 129.2, meshed connectivity의 131.2로 상승한다.

3.2 Text2Image

Text-to-image 모델은 style transfer와 zero-shot generation을 활용한 GAN 기반 시스템에서 더 강한 photorealism, diversity, benchmark 성능을 보이는 대규모 diffusion 모델로 발전했다. 이러한 발전에도 불구하고 compositionality, text rendering, inference speed, misuse, bias, copyright는 여전히 중요한 과제다.

  • 3.2 Text2Image: 초기 GAN 시스템은 training-data style과 background를 전이하고, 보지 못한 클래스를 zero-shot으로 생성했으며, MS-COCO 도메인 전반에서 일반화했지만 출력이 항상 일관적이지는 않았다.언급된 두 방법을 모두 사용했을 때 GAN-INT-CLS의 성능이 가장 좋았다.
  • 3.2 Text2Image: DALL-E는 기존 same-domain 시스템보다 diversity와 zero-shot 성능을 향상했지만, 낮은 photorealism과 text 및 상대적 object 위치 처리의 어려움은 남겼다.비교 결과는 Figure 3.24에 제시되며, 정성적 출력은 Figure 3.25에 제시된다.
  • 3.2 Text2Image: GLIDE는 선행 모델보다 더 photorealistic한 zero-shot MS-COCO 결과를 달성했으며, photorealism과 caption 유사성에 대해 인간 평가자의 선호를 얻었다.FID 비교는 Figure 3.26에 제시되고, DALL-E 1과의 비교는 Figure 3.27에 제시된다.
  • 3.2 Text2Image: UnCLIP은 유사한 photorealism과 caption 유사성에서 GLIDE보다 더 큰 data diversity를 나타냈으며, 전례 없는 MS-COCO FID를 달성했다.본문은 남은 문제의 일부 원인을 CLIP embeddings에 돌리는데, 이는 diversity를 향상하지만 compositional 및 text-rendering 실패를 악화시킬 수 있다.
  • 3.2 Text2Image: 논의된 두 모델 모두 이전 연구보다 FID를 크게 향상했으며, 집필 당시 Parti 샘플은 state of the art로 제시되었다.보고된 결과에서 두 모델의 이름은 모두 식별되지 않는다.
  • 3.2 Text2Image: Text-to-image 모델은 harassment, disinformation, embedded bias, insufficient diversity의 위험과 authorship 및 copyright에 관한 미해결 문제를 제기한다.Inpainting은 실제 장면에서 object를 추가하거나 지워 misuse를 심화할 수 있으며, 모델은 training data의 개념들을 결합한다.

3.3 Language Model을 지원하는 이미지

이 절에서는 word embedding을 개선하기 위해 이미지로 language model을 강화하는 모델을 검토하며, modality fusion에서 visual supervision과 generated-image 접근법으로 이어지는 통합 과정을 추적한다. Visual grounding은 주로 구체적 개념에 도움이 되며, Transformer 기반 multimodal model은 visual supervision이 통합되지 않는 한 일반적으로 순수 language baseline을 능가하지 못한다.

  • 모델의 발전: 모델은 textual modality와 visual modality를 concatenate하는 방식에서 projected visual representation, generated-image supervision, 모든 token에 대한 image assignment로 발전한다.Voken 방법은 유한한 image set에서 pooling하여 낮은 grounding coverage 문제를 다루며, generated image는 BERT와 같은 순수 language model이나 visual supervision을 받은 model을 supervise할 수 있다.
  • 한계와 확장: one-to-one text–image assumption은 일부 단어에 이용 가능한 이미지가 없기 때문에 grounding을 제한하며, linguistic information에서 추론한 visual representation이나 더 폭넓은 token-level assignment를 촉진한다.Voken-Classification framework는 language corpus의 모든 word 또는 token에 visual representation을 할당할 수 있다.
  • 평가: Visual grounding은 “cat,” “table,” “bicycle”과 같은 concrete concepts의 representation을 개선하지만, abstract concepts에는 거의 기여하지 않는다.이러한 양상은 intrinsic evaluation과 downstream evaluation 전반에서 나타나며, abstract concepts에 대해서는 multimodal model이 여전히 순수 language model보다 뒤처질 수 있다.
  • 평가: Transformer 기반 universal multimodal model은 일반적으로 BERT나 RoBERTa와 같은 순수 language model을 능가하지 못하는 반면, Voken 기반 visual supervision은 성능을 이들보다 높일 수 있다.Voken-Classification task는 pre-training에 통합할 수 있으며, Vokenization은 가장 경쟁력 있는 visual supervision 방식으로 확인된다.
  • Few-shot learning: 학습 세트의 최대 5%만 사용해 Lu et al. (2022)은 imagination 기반 supervision이 Voken model의 단순한 visual supervision보다 우수할 수 있음을 보였으며, 이는 few-shot multimodal learning을 뒷받침한다.Few-shot evaluation은 paired image–text data 수집의 높은 비용을 다루며, Ive et al. (2019)도 textual context가 일반적이거나 모호할 때 이미지가 translation을 개선한다고 밝혔다.

3.4 Vision Model을 지원하는 Text

Text-supported vision model은 NLP architecture와 language supervision을 computer vision에 적용하고, image-text data를 확장해 성능과 robustness를 향상한다. CLIP, ALIGN, Florence가 강력한 결과를 보이며, Florence가 overall top performance를 달성하지만 web-scale data는 noise와 preprocessing 요구를 동반한다.

  • Training approach: 이 model들은 Transformer와 self-supervised learning 같은 NLP 개념을 vision으로 전이하고, image와 text를 jointly encoding한 뒤 contrastive objective로 정렬한다.Natural language supervision은 image-caption co-occurrence를 사용하며, contrastive alignment는 image-text similarity에 대한 symmetric loss를 최소화한다.
  • Data limitations: Web-scale image-text data는 비용이 큰 manual labeling을 제거하지만 여전히 extremely noisy하므로, language 및 graphic-content filtering 같은 preprocessing이 필요하다.Data의 noise는 internet-generated image-text pair를 통해 확장할 때 발생하는 핵심 trade-off다.
  • 강건성: CLIP는 동일한 정확도의 ImageNet으로 학습된 ResNet101과 비교해 분포 이동에서 강건성 격차를 좁히며, 점점 더 달라지는 분포에서 성능이 저하된다.ImageNet에서 정확도 76.2%로 학습된 ResNet101은 ObjectNet에서 32.6%만 유지하며, 이는 강건성 평가의 필요성을 뒷받침한다.
  • Model comparisons: Florence는 overall top performance를 기록해 거의 모든 zero-shot 및 fine-tuned evaluation에서 CLIP을 능가하며, ALIGN은 보고된 네 가지 비교 중 절반에서 승리한다.Florence는 original ImageNet에서 CLIP보다 7.3pp 앞선다. retrieval 순위는 Florence가 첫 번째, ALIGN이 두 번째, CLIP이 세 번째다.

3.5 두 modalities를 위한 모델

이 절에서는 통합 학습 프레임워크를 통해 텍스트, 이미지, 음성을 처리하는 아키텍처를 제시하고, 단일 modality 연산과 실제 cross-modal 상호작용을 구분한다. 또한 data2vec의 self-supervised latent prediction과 ViLBERT의 vision-language task를 위한 dual-stream co-attention을 다룬다.

  • 동기와 한계: 이 아키텍처들은 정교한 training scheme을 통해 제한적인 multimodal data와 파편화된 modality-specific model 문제를 다루지만, data2vec은 여전히 modality-specific encoder를 유지하며 cross-modality training을 사용하지 않는다.Self-supervision과 unified framework는 대규모 multimodal dataset에 라벨을 지정하는 비용과 별도 model을 통합하기 어려운 문제에 대한 대응으로 동기화된다.
  • 결과: Data2vec은 유사한 self-supervised model 중 vision 및 language task에서 state-of-the-art performance를 달성했으며, ViLBERT의 dual-stream design은 single-stream encoding보다 뛰어난 성능을 보였다.ViLBERT의 성능은 pre-training, fine-tuning, 더 큰 dataset을 통해서도 향상되었다.
  • Data2vec: Data2vec은 prediction target을 위해 여러 teacher layer의 평균을 사용하여 language, vision, speech 전반의 성능을 향상시키지만, 최적 layer 수는 domain마다 다르다.향상 폭은 NLP에서 가장 크며, computer vision은 최대 세 개의 layer까지, speech는 여섯 개의 layer에서 최고 성능을 보인다.
  • Data2vec: Data2vec은 teacher-student framework를 통해 text, speech 또는 image를 처리하며, masked input에서 contextualized latent representation을 예측하여 human label에 대한 의존도를 낮춘다.Teacher는 완전한 input view를 사용하고 student는 masked version을 본다. 이 model은 cross-modal model도 universal model도 아니다.
  • ViLBERT: ViLBERT (Lu et al., 2019b)는 vision과 language를 parallel stream으로 처리하며, co-attention을 사용해 각 modality의 attention이 다른 modality에 의해 조건화되도록 한다.각 modality의 key와 value는 다른 modality의 multi-head attention block에 입력된다.
  • ViLBERT: ViLBERT의 attention quality는 input structure에 좌우된다. 명사가 attention map에 가장 강한 영향을 미치며, 36 image region proposal은 한 질문에 대해 오답을 냈지만 72 또는 108 proposal은 정답을 냈다.일부 Wh-word를 제거하면 fine-grained final-layer attention map이 개선될 수 있다는 증거도 제시된다.

4 추가 주제 · 4.1 추가 모달리티 포함 · 4.2 구조화 데이터 + 비구조화 데이터

이 절은 멀티모달 딥러닝의 범위를 텍스트와 이미지에서 연속적이고 시간 정보가 풍부한 신호로 확장하고, 도전 과제, 표현, 변환, 아키텍처, 학습 패러다임을 통해 이러한 확장을 체계화한다. 또한 구조화–비구조화 멀티모달 응용을 검토하며, 유망한 성능, 해석 가능성, 결측 데이터에 대한 강건성, 벤치마킹과 데이터 가용성의 한계를 강조한다.

  • 4.1 추가 모달리티 포함: 멀티모달 학습은 텍스트와 정적 이미지뿐 아니라 video와 audio 같은 시간 신호, 그리고 깊이, 온도, 냄새, 촉각, 균형까지 포함하도록 확장되어야 한다.텍스트와 이미지는 인간이 지각하는 연속적이고 매우 멀티모달한 세계의 불연속적 스냅샷만을 나타낸다.
  • 4.1 추가 모달리티 포함: 이 절은 모달리티 전반에 일반화되는 central challenges를 중심으로 멀티모달 연구를 체계화하여, 공통 taxonomy를 버리지 않고도 새로운 문제에 접근할 수 있게 한다.이 taxonomy는 representation spaces, alignment, fusion, translation, sampling, retrieval을 중심으로 구성된다.
  • 4.1 추가 모달리티 포함: 실제 멀티모달 과제는 translation으로 일반화할 수 있다. 모델은 aligned spaces를 사용해 다른 모달리티에서 의미적으로 관련된 신호를 검색하거나 생성하며, 대응하는 datapoint가 없을 때는 decoders를 사용한다.Cross-modal retrieval은 현재 거의 전적으로 contrastive learning을 통해 학습된다 [Chen et al. (2020b)][@ oord2018representation][@ DBLP:conf/icml/ZbontarJMLD21].
  • 4.1 추가 모달리티 포함: 일반화된 멀티모달 시스템에는 architecture와 training paradigm이 모두 필요하며, 바람직한 특성으로 input-agnostic processing, fusion, locality와 compositionality 보존, flexible outputs가 포함된다.Perceiver-style architectures는 cross-attention을 사용해 매우 큰 멀티모달 입력을 압축하고, hierarchical variant는 손실된 locality와 compositionality를 다룬다.
  • 4.1 추가 모달리티 포함: 멀티모달 representation learning은 모달리티를 하나의 입력과 표현으로 병합하는 joint representations와, 의미적 유사성을 통해 분리된 모달리티별 공간을 정렬하는 coordinated representations를 구분한다.Joint representations는 cross-modal information flow를 활용할 수 있는 반면, coordinated representations는 분리된 공간 사이에서 의미적으로 관련된 점들을 더 가깝게 만든다.
  • 4.1 추가 모달리티 포함: 제안된 통합 멀티모달 self-supervised framework는 BYOL- 및 data2vec-inspired latent prediction을 임의의 모달리티로 일반화하여 contrastive methods 없이 joint 및 coordinated learning을 수행한다.이 framework는 Perceiver-compatible generic inputs와 하나의 masking strategy를 사용하여, 모달리티별 masking과 cross-modal learning을 위한 hard negatives를 제거한다.
  • 4.2 구조화 데이터 + 비구조화 데이터: 구조화–비구조화 멀티모달 모델은 높은 predictive performance를 달성하면서도 interpretable하게 유지될 수 있으며, end-to-end learning은 독립적으로 학습된 representations나 expert-information retrieval보다 자주 우수한 성능을 보인다.Multimodal dropout은 학습 중 전체 모달리티를 제거하여 결측 데이터에 대한 강건성을 높인다. 한 연구에서는 구조화된 임상 데이터와 mRNA 데이터를 결합했을 때 최고의 성능을 보였으며, 모달리티를 추가하자 성능이 소폭 감소했다.
  • 4.2 구조화 데이터 + 비구조화 데이터: 구조화–비구조화 멀티모달 이득에 대한 증거는 여전히 제한적이다. 연구에서 single-modality benchmarks를 생략하는 경우가 많고, small samples가 비구조화 임상 데이터를 제약하며, 강건성에 대한 우려로 신중한 해석이 필요하기 때문이다.향후 더 큰 데이터셋을 이용할 수 있게 되면 deep learning methods가 잠재력을 실현하는 데 도움이 될 수 있다.

4.3 다목적 모델 · 4.4 생성 예술

다목적 모델은 multimodal 및 multitask learning을 결합해 하나의 모델에서 여러 인식과 작업을 지원하며, 생성 예술 시스템은 text prompt로 이미지를 생성하지만 평가, 편향, 오용, 접근성을 둘러싼 우려를 낳는다. 두 영역 모두에서 검토된 접근법은 인상적인 역량과 해결되지 않은 기술적·사회적 한계를 동시에 보인다.

  • 4.3.1 사전 지식 · 4.3.1.1 Multitask Learning · 4.3.1.2 Mixture-of-Experts · 4.3.1.4 Multipurpose Models: 다목적 모델은 작업과 modality 전반에서 지식을 전이해 일반화를 향상하는 multimodal-multitask systems이며, multitask learning과 mixture-of-experts architecture를 활용한다.Multitask learning은 공유 패턴을 활용하기 위해 하나의 모델을 여러 작업으로 학습시키며, MoE architecture는 모델 규모를 효율적으로 키우기 위해 적합한 expert만 활성화한다.
  • 4.3.2.3 OFA - Sequentialization is All You Need: OFA는 image captioning, visual question answering, visual entailment, visual grounding에서 SOTA models보다 우수했으며, 기술된 unseen task로도 전이되었지만 specialist baseline은 사용하지 않았다.OFA는 모든 입력을 순차화하고 전체 transformer architecture를 통해 tokenized output을 생성한다.
  • 4.3.2.1 MultiModel · 4.3.2.2 Unified Transformer (UniT) · 4.3.2.4 Gato - A Generalist Decoder · 4.3.2.5 Comparison: OFA를 제외하면 검토된 모델 중 어느 것도 overall SOTA를 달성하지 못했다. Gato, UniT, MultiModel은 대체로 specialist와 비슷했으며, low-resource 또는 unseen task에서 transferability가 나타났다.그럼에도 Gato는 ATARI Boxing에서 경쟁 모델보다 낮은 성능을 보였고, 일부 unseen 또는 low-resource setting에 대한 비교는 불완전했다.
  • 4.3.1.3 Evolutionary Algorithms · 4.3.3.4 muNet (Multitask Network) · 4.3.5 Discussion: muNet은 fine-tuning 중 이전에 학습한 지식을 보존하기 위해 evolutionary algorithm을 사용하지만, PathNet과 muNet은 여전히 task-tailored이며 일반화를 향상하려면 routing method가 필요하다.이 장은 scaling, routing, metric, accessibility, bias, environmental impact를 다목적 모델의 지속적인 과제로 제시한다.
  • 4.3.3.3 LIMoE · 4.3.4 Conclusion Pathways: LIMoE는 language encoder와 vision encoder를 sparse MoE layer와 결합해 dense model 및 CLIP과 같은 current SOTA model보다 우수한 성능을 내면서 sparsity를 통해 연산량을 줄인다.논의에서는 LIMoE 방식의 sparsity를 OFA 및 Gato 방식의 유연한 encoding과 결합하고, muNet과 PathNet 같은 evolutionary model을 위한 intelligent routing을 개발할 것을 권고한다.
  • 4.4.2 이 모델을 어떻게 사용하는가?: Text-to-image notebook은 사전 코딩 지식 없이도 사용자가 prompt로 그림을 생성하게 하지만, 추상적인 prompt는 묘사하기 어렵고 연산 한계로 해상도가 낮아질 수 있다.출시된 smaller GLIDE model은 300 million parameter를 가지는 반면, 출시되지 않은 model은 약 3.5 billion parameter를 가진다 (Nicholas et al.).
  • 4.4.4 논의와 전망: Generative-art method는 빠르게 발전해 짧은 지시로 점점 더 사실적인 이미지를 생성하지만, 미학을 측정할 직접적인 loss function은 없으며 artist의 역할을 둘러싼 논쟁도 계속된다.OpenAI의 DALLE-2 (Ramesh et al., 2022a)는 DALLE-1보다 우수한 것으로 설명된다.
  • 4.4.4 논의와 전망: 사실적인 generated image는 plagiarism과 오해를 일으키는 fake content의 위험을 낳으며, training-data bias는 “human being”을 여성보다 남성과 더 강하게 연관시키는 사례처럼 output을 형성할 수 있다.이러한 우려로 일부 조직은 model 또는 downstream model의 출시를 보류했다.

5 결론

Multimodal architecture는 빠르게 발전해 점점 더 사실적인 text-to-image 결과를 생성하지만, 그 발전은 deepfake, 계산 비용, 환경 부담, 불평등한 접근성에 대한 우려도 제기한다. 이러한 과제는 안전장치와 모델 및 연구에 대한 더 폭넓은 접근을 요구한다.

  • DALL-E와 같은 text-to-image model은 이제 인상적이고 매우 사실적인 결과를 생성해 대중의 큰 관심과 온라인상의 흥미를 불러일으킨다.
  • 사실적으로 생성된 이미지는 진짜 사진과 구별하기 어려울 수 있어, 대중의 의견을 체계적으로 조작할 수 있는 deepfake를 가능하게 한다.Joshi et al. (2021)은 이러한 조작된 미디어를 탐지할 수 있는 자동화 도구가 필요하다고 주장한다.
  • 더 큰 architecture는 성능을 향상할 수 있지만, 그 parameter를 학습하고 저장하려면 상당한 시간, 계산 능력, 저장 공간, 재정 자원이 필요하다.GPT-2 학습에는 32개의 TPUv3 chip에서 약 168시간이 걸렸으며, 비용은 $12,902–$43,008로 추정되었다 (Strubell et al., 2019c).
  • 고급 model을 실행하는 데 필요한 hardware, 기술, 자금은 대기업에 집중되는 경우가 많아 학계와 산업계 사이에 불평등한 접근성을 초래한다.기업은 최상의 model이 제품이고 지식재산에 기여하기 때문에 이를 공개하지 않을 수도 있다.

6 맺음말

이 책자는 범위가 제한되고 분야가 빠르게 발전하고 있어 Multimodal Deep Learning을 비망라적으로 개관한다. Stable Diffusion과 text-to-video generation을 포함한 최신 연구를 맥락화하며 마무리한다.

  • 범위와 한계: 이 소책자는 프로젝트가 제한된 기간 내에 완료되었고 한 학기 ECTS 학업량의 약 삼분의 일에 해당했기 때문에 Multimodal Deep Learning을 빠짐없이 다룰 수 없다.
  • 범위와 한계: 이 분야는 빠르게 발전하고 있어 장별 주제를 선정할 당시 일부 architecture, improvement, idea는 아직 발표되지 않았지만, 진행 중인 연구를 일부 경우에 반영했다.
  • 최신 generative model: LMU의 Björn Ommer 연구 그룹 연구자들이 제안한 Stable Diffusion은 free-text prompt로부터 photorealistic image를 생성하며 앞서 논의한 generative model을 확장한다.
  • 최신 generative model: Google Research Brain Team이 개발한 Imagen extension을 포함해, 연구는 natural-language image generation을 video로 확장하고 있다.
Loading 2301.04856v1…