Source-linked AI summary
DINOv2: Learning Robust Visual Features without Supervision
Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mahmoud Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Hervé Jegou, Julien Mairal, Patrick Labatut, Armand Joulin, Piotr Bojanowski
TL;DR
컴퓨터 비전에는 finetuning 없이 여러 태스크에서 작동하는 폭넓은 전이 가능 시각 특징이 부족하다. 특히 text-guided pretraining은 이미지 정보를 놓칠 수 있고 정렬된 이미지-텍스트 데이터가 필요하다. DINOv2는 대규모 curated image data와 효율적인 학습으로 self-supervised pretraining을 확장해, 다양한 벤치마크에서 weakly supervised 모델에 필적하는 frozen feature를 생성한다.
문제
기존 시각 pretraining이 정렬된 텍스트-이미지 supervision 없이 대규모 curated data로부터 all-purpose feature를 생성할 수 있다는 근거는 제한적이다.
방법
DINOv2는 image-only curation pipeline, 더 큰 모델, 학습 개선 기법, 소형 Vision Transformer로의 distillation을 통해 discriminative self-supervised learning을 확장한다.
결과
self-supervised pretraining만으로도 상당히 다양한 image-level 및 pixel-level 태스크에서 weakly supervised 모델에 match하거나 surpass하는 전이 가능한 frozen feature를 생성한다.
시사점 및 한계
DINOv2는 curated-data self-supervision이 finetuning 없이 폭넓게 전이 가능한 시각 특징을 위한 유력한 후보임을 보여준다.
시사점 및 한계
Text-guided pretraining은 정렬된 text-image corpus를 필요로 하며 복잡한 pixel-level 정보를 보존하지 못할 수 있다.
Abstract
from arXiv · showhide
The recent breakthroughs in natural language processing for model pretraining on large quantities of data have opened the way for similar foundation models in computer vision. These models could greatly simplify the use of images in any system by producing all-purpose visual features, i.e., features that work across image distributions and tasks without finetuning. This work shows that existing pretraining methods, especially self-supervised methods, can produce such features if trained on enough curated data from diverse sources. We revisit existing approaches and combine different techniques to scale our pretraining in terms of data and model size. Most of the technical contributions aim at accelerating and stabilizing the training at scale. In terms of data, we propose an automatic pipeline to build a dedicated, diverse, and curated image dataset instead of uncurated data, as typically done in the self-supervised literature. In terms of models, we train a ViT model (Dosovitskiy et al., 2020) with 1B parameters and distill it into a series of smaller models that surpass the best available all-purpose features, OpenCLIP (Ilharco et al., 2021) on most of the benchmarks at image and pixel levels.
1 서론
DINOv2는 정렬된 text-image supervision 없이 대규모 curated image data로부터 transferable하고 task-agnostic한 visual feature를 self-supervised learning으로 생성할 수 있는지 탐구한다. 확장 가능한 data 및 training 기법을 제안하고 ViT 기반 model과 retraining code를 공개하며, self-supervised pretraining만으로도 주요 공개 weakly supervised model에 필적하는 frozen feature를 얻을 수 있음을 보인다.
- 동기: Text-guided image encoder는 정렬된 text-image corpus에 의존하므로 raw image data만으로 학습하는 방식보다 유연성이 제한된다.서론에서는 text supervision 없이 image에서 학습하는 self-supervised learning과 이러한 한계를 대비한다.
- 동기: Self-supervised learning은 image만 사용해 image 및 pixel 수준에서 작동하는 범용 visual feature를 얻는 방법으로 연구된다.이 연구는 iBOT (Zhou et al., 2021)와 같은 discriminative approach를 재검토하고, 더 큰 dataset에 맞게 설계 선택을 다시 살펴본다.
- 기여: DINOv2는 수작업 annotation이나 external metadata 없이 방대한 uncurated image collection을 필터링하고 재균형화하는 automatic pipeline을 구축한다.이 pipeline은 실제 환경의 image에 존재하는 지배적 concept와 mode가 불균형과 overfitting을 일으킬 위험에 대응한다.
- 기여: 저자들은 Vision Transformer architecture 전반에서 DINOv2 model을 학습하고 공개하며, 어떤 data에서도 이를 retraining할 수 있는 code를 함께 제공하고 image- 및 pixel-level benchmark에서 평가한다.model은 scale이 증가함에 따라 다양한 computer vision benchmark에서 검증된다.
- 결과: Self-supervised pretraining만으로도 최상의 공개 weakly supervised model에 필적하는 transferable frozen feature를 생성한다.평가는 여덟 가지 vision task 유형 전반의 성능을 요약하고 DINOv2를 self-supervised 및 weakly supervised method와 비교한다.
2 관련 연구
관련 연구는 이미지 내 pretext task, 판별적 self-supervised learning, 확장 가능한 pretraining, 자동화된 데이터 큐레이션을 아우른다. 본 연구는 대규모 데이터셋과 모델을 위한 판별적 접근법을 Zhou et al. (2021)을 특히 기반으로 재검토한다.
- Intra-image self-supervised training: Intra-image self-supervised methods는 context prediction, recolorization, transformation prediction, inpainting을 비롯해 이미지 내부에서 추출한 신호로 학습한다.
- Discriminative self-supervised learning: Discriminative self-supervised learning은 이미지 간 또는 이미지 그룹 간 신호로 feature를 학습하며, 초기 metric-learning 연구에서 instance-classification method로 발전했다.
- Discriminative self-supervised learning: 본 연구는 대규모 pretraining 데이터셋과 모델을 위한 discriminative self-supervised training을 Zhou et al. (2021)을 특히 확장성이 높은 접근법으로 삼아 재검토한다.
- Scaling self-supervised pretraining: Scaling 연구는 더 큰 데이터셋과 모델을 사용한 self-supervised learning을 검토하며, 대개 비큐레이션 데이터를 사용하고 discriminative method가 데이터에 따라 확장된다는 근거를 제시한다.
- Automatic data curation: Automatic data-curation methods는 image retrieval, retrieval-based semi-supervised augmentation, hashtag와 같은 metadata를 활용해 비큐레이션 데이터셋을 필터링한다.
3 데이터 처리
LVD-142M dataset은 image-only pipeline을 사용해 curated dataset의 이미지와 유사한 다양한 이미지를 uncurated web data에서 검색해 구축한다. 이 과정은 benchmark evaluation image를 포함한 near-duplicate를 제거하며, self-supervised embedding, clustering, GPU-accelerated indexing으로 검색 규모를 확장한다.
- 데이터 출처: 이 pipeline은 metadata나 text를 사용하지 않고, 여러 curated dataset의 이미지와 가까운 이미지를 대규모 uncurated pool에서 검색해 LVD-142M을 구축한다.Curated source에는 ImageNet-22k, ImageNet-1k training data, Google Landmarks, fine-grained dataset이 포함되며, uncurated source는 크롤링한 web image로 구성된다.
- Deduplication: Near-duplicate 제거는 redundancy를 줄이고 image diversity를 높이며, benchmark의 test 또는 validation image와 near-duplicate인 이미지를 제외한다.Deduplication 단계에서는 Pizzi et al. (2022)의 copy detection pipeline을 사용한다.
- Self-supervised image retrieval: 검색은 ImageNet-22k에서 pretrained된 self-supervised ViT-H/16 embedding 사이의 cosine similarity를 사용한 뒤, uncurated data에 k-means clustering을 적용한다.Query dataset이 충분히 크면 system은 query image마다 N개의 이미지를 검색하며, 제공된 passage는 이후 절차가 생략된 상태로 끝난다.
- 구현 세부 사항: Faiss는 product-quantization code를 사용하는 GPU-accelerated inverted-file index를 통해 효율적인 nearest-embedding search를 가능하게 한다.구현에서는 Faiss에 대해 Johnson et al. (2019)을, product quantization에 대해 Jegou et al. (2010)을 인용하며, 각각 8 V100-32GB GPU를 탑재한 20개 node에 처리를 분산한다.
4 판별적 Self-supervised Pre-training
이 방법은 DINO와 iBOT의 판별적 self-supervised loss를 SwAV centering, feature-spreading regularization, 짧은 high-resolution training과 결합한다. image-level 및 patch-level objective, 별도의 objective head, Sinkhorn-Knopp normalization, KoLeo regularization, pre-training 후반의 resolution adaptation을 사용한다.
- 4 판별적 Self-supervised Pre-training: 이 pre-training 방법은 DINO와 iBOT loss를 SwAV centering, feature-spreading regularizer, 짧은 high-resolution training phase와 결합한다.이 구성요소들은 image-level과 pixel-level 모두에서 robust feature를 지원하도록 설계되었다.
- Image-level objective: image-level objective는 서로 다른 crop에서 얻은 student와 teacher의 class-token feature 사이에 cross-entropy를 적용하며, teacher는 exponential moving average로 업데이트된다.student와 teacher는 동일한 image의 서로 다른 crop을 처리한다.
- Patch-level objective: patch-level objective는 student input patch를 mask하고 teacher patch는 mask하지 않은 채로 두며, image-level loss와 함께 대응하는 masked-patch feature에 cross-entropy를 적용한다.이는 전역 image supervision과 국소 patch supervision을 결합한다.
- Head weight 분리: image-level과 patch-level objective의 head를 분리하면 patch-level underfitting과 image-level overfitting을 방지하여 두 scale 모두에서 성능을 향상한다.가중치를 공유하면 두 objective 사이에 반대되는 불균형이 발생했다.
- Normalization, regularization, resolution: Sinkhorn-Knopp centering은 teacher에서 3 iterations 동안 수행되고 student는 softmax normalization을 사용한다. KoLeo는 ℓ2-normalized batch feature를 분산시키며, pre-training 후반에는 resolution이 518 × 518로 증가한다.high-resolution phase는 high-resolution training에 시간과 메모리가 많이 필요하기 때문에 짧게 구성되며, resolution 증가는 small object를 포함하는 pixel-level task에 도움이 된다.
5 효율적인 구현
DINOv2는 iBOT보다 학습을 크게 빠르고 메모리 효율적으로 만드는 구현 변경과, 더 크고 작은 모델을 가능하게 하는 sharding 및 distillation 전략을 결합한다. 여기에는 최적화된 attention, nested tensors, stochastic depth, FSDP, ViT-g로부터의 distillation이 포함된다.
- 효율적인 구현: 동일한 하드웨어에서 DINOv2는 iBOT보다 약 2× 빠르게 실행되며 메모리는 삼분의 일만 사용한다.구현은 PyTorch 2.0 기반의 A100 GPU를 대상으로 하며, feature extraction을 위한 코드와 pretrained model을 제공한다.
- 빠르고 메모리 효율적인 attention: Custom FlashAttention은 self-attention 속도와 메모리 사용량을 개선하며, 테스트한 모든 경우에 원래 구현과 같거나 더 나은 성능을 내면서 더 많은 사용 사례와 하드웨어를 지원한다 [Dao et al., 2022].효율은 head별 embedding dimension이 64의 배수일 때 가장 높으며, 전체 embedding dimension도 64의 배수이면 추가 성능 향상을 얻는다.
- self-attention에서의 nested tensors: Nested tensors는 global crop과 local crop을 한 번의 forward pass로 처리해, 별도의 forward 및 backward pass보다 상당한 compute efficiency 향상을 제공한다.하위 수준 구성 요소는 xFormers에서 제공된다 [Lefaudeux et al. (2022)].
- 효율적인 stochastic depth: 개선된 stochastic depth는 dropped residual computation의 출력을 masking하는 대신 해당 computation을 건너뛰어, drop rate에 대략 비례해 메모리와 연산을 절약한다 [Huang et al., 2016].여기서 사용한 40% drop rate에서는 fused kernel이 compute efficiency와 메모리 사용량을 크게 개선한다.
- Fully-Sharded Data Parallel (FSDP): FSDP는 billion-parameter ViT-g에 필요한 16 GB의 replica를 GPU들에 걸쳐 shard하여 GPU당 메모리 사용량을 줄이고 model-size bound를 제거한다.이 replica는 float32 precision의 student, teacher, 두 optimizer moment state로 구성된다.
- Model distillation: ViT-g에서 더 작은 model을 distill하면 ViT-L의 경우에도 scratch부터 학습하는 것보다 더 나은 성능을 얻으며, 동시에 student의 EMA를 평가한다 [Hinton et al., 2015; Duval et al. (2023)].이 방법은 Duval et al.의 접근법과 대체로 유사하지만 distillation loss term은 수정하지 않는다.
6 Ablation Studies
ablation은 downstream task 전반에서 pipeline의 기술적 구성 요소, curated pretraining data, model–data scaling, loss term, distillation, training resolution을 검증한다. Curated LVD-142M은 전반적으로 가장 강력한 feature를 제공하며, 개별 구성 요소는 상호 보완적인 평가 설정을 개선한다.
- 6.1 Technical Improvements: 제안된 기술적 구성 요소를 점진적으로 추가하면 대체로 ImageNet-1k k-NN accuracy, linear-probe accuracy 또는 두 지표 모두가 향상되며, LayerScale과 Stochastic 관련 예외는 평가에서 확인된다.ablation은 baseline iBOT model에서 시작해 Section 4에 설명된 구성 요소를 추가한다.
- 6.2 Pretraining Data: LVD-142M은 대부분의 benchmark에서 uncurated data를 능가하고 ImageNet-1k를 제외하면 ImageNet-22k도 앞서며, image domain 전반에서 가장 균형 잡힌 성능을 제공한다.이 결과는 ImageNet-22k가 다루지 않는 domain의 feature를 개선하는 curated하고 diverse한 data에서 이러한 우위가 나온다고 설명한다.
- 6.3 Scaling Data and Model Size: model size가 증가할수록 LVD-142M은 ImageNet-22k보다 더 유용해진다. ViT-g는 ImageNet-1k 성능과 일치하면서 다른 benchmark에서는 이를 크게 능가한다.Figure 4는 14M images를 사용한 ImageNet-22k와 142M images를 사용한 LVD-142M에서 model scaling을 비교한다.
- 6.5 Model Distillation: distilled ViT-L/14는 12개 benchmark 중 10개에서 scratch-trained ViT-L/14를 능가하며, 더 큰 ViT-g/14 model에서의 distillation을 검증한다.ViT-g/14 teacher는 topline reference로도 보고된다.
- 6.4 Loss Ablations: KoLeo loss는 nearest-neighbor retrieval을 개선하는 반면, iBOT masked-image-modeling loss는 segmentation과 같은 patch-level task를 개선한다.Table 3은 matched training iteration에서 ImageNet-1k/A, ADE-20k segmentation, Oxford-M retrieval을 평가한다.
7 결과
전역 및 국소 이미지 이해 평가 전반에서 DINOv2 feature는 self-supervised 분야의 최신 성능을 큰 폭으로 앞서며, 여러 task에서 weakly supervised feature와 대등하거나 이를 능가한다. frozen backbone을 포함해 classification, retrieval, action recognition, segmentation, depth, out-of-distribution 설정 전반에 걸쳐 일반화된다.
- 종합 평가: DINOv2 feature는 현재 self-supervised 분야의 최신 성능을 매우 큰 폭으로 앞서며, 평가된 여러 task에서 weakly supervised feature와 대등하거나 이를 능가한다.평가는 전역 및 국소 표현, category-level 및 instance-level recognition, semantic segmentation, monocular depth prediction, action recognition을 아우른다.
- 종합적 이미지 표현: ImageNet-1k linear evaluation에서 DINOv2는 EVA-CLIP보다 1.1% 더 잘 일반화하며, 이후에는 OpenCLIP-G를 weakly supervised reference로 사용한다.비교에는 frozen backbone과 단순한 linear classifier를 사용하며, Table 4에서는 여러 off-the-shelf weakly supervised architectural variant와도 비교한다.
- Downstream classification 및 action recognition: DINOv2는 transfer classification benchmark에서 state-of-the-art feature를 유의미하게 능가하면서도 대부분의 dataset에서 OpenCLIP과 경쟁력 있는 성능을 유지한다. 다만 SUN (−5.3%)과 Cars (−4.7%)에서는 특히 뒤처진다.평가는 iNaturalist, Places205, UCF101·Kinetics-400·Something-Something v2의 video action recognition, 그리고 scene·object·texture를 아우르는 12개 transfer classification task를 포함한다.
- Instance-level recognition: Instance recognition에서 DINOv2는 landmark, artwork, archival street-view benchmark에 대해 cosine-similarity retrieval로 평가되며, dataset과 setup 전반에서 강력한 성능을 보인다.평가된 dataset은 Paris, Oxford, Met, AmsterTime이다.
- Semantic segmentation 및 depth estimation: Frozen DINOv2 backbone은 강력한 dense prediction을 생성한다. +ms는 fully finetuned MAE의 53.6 mIoU에 대해 53.0을 기록하고, boosted recipe는 Pascal VOC에서 89.0 mIoU에 대해 86.2를 기록하며, adapter tuning은 ADE20k에서 62.9 mIoU에 대해 60.2를 기록한다.Adapter 실험에서는 backbone을 frozen 상태로 유지한 채 adapter와 head만 tuning하며, linear evaluation setup에서 정성적 segmentation 및 depth 결과는 OpenCLIP보다 우수하다.
- Out-of-distribution 일반화 및 창발적 구조: DINOv2는 domain을 넘어 전이되며 semantic object structure를 포착한다. 동물과 그림에서 양호한 segmentation 및 depth를 생성하고, style과 pose가 달라져도 object 간 대응하는 부분을 일치시킨다.모델은 object part를 parsing하도록 학습되지 않았지만, 그 component는 주요 object의 경계를 구분하고 plane wing과 bird wing처럼 의미적으로 대응하는 영역을 정렬한다.
8 공정성과 편향 분석
DINOv2의 가장 큰 모델을 지리적 공정성과 유해한 label 연관성 측면에서 평가한다. 이 모델은 서구 및 고소득 가구에 편향된 경향을 보이지만, 전반적으로 인구통계학적 집단에 대해 유해한 분류는 피한다.
- 지리적 공정성: 아프리카에서의 성능은 유럽 대비 25.7% 하락하고, 고소득 가구와 저소득 가구 사이에는 31.7%의 차이가 나타나 서구 및 소득 관련 편향이 지속됨을 보여준다.지리적 평가는 54개국 289개 가구에서 수집한 Dollar Street의 16,073개 이미지를 사용하며, 국가와 소득 수준에 걸쳐 94개 concept를 비교한다.
- label 연관성 공정성: 성별, 피부색, 연령 집단 전반에서 DINOv2는 대체로 이미지를 Human으로 분류하며 피부색에 따른 큰 편차를 보이지 않고, 유해한 Non-Human 또는 Crime label을 predict하지 않는다.평가는 619개 ImageNet-22k class로 학습한 linear classifier와 frozen backbone을 사용한다. 이 class들은 Human, Possibly Human, Non-Human, Crime category로 묶이며, DINOv2와 SEERv2를 비교한다.
- label 연관성 공정성: DINOv2는 Possibly-Human label을 자주 발생시키는데, 여기에는 스카프, 안경, 수염처럼 인간과 관련되는 경우가 많은 물체가 포함된다.보고된 유해 label 예외는 두 이미지에서 배경의 막대가 교도소 창살과 시각적으로 유사했던 경우다.
9 모델 학습의 환경 영향 추정
저자들은 Patterson et al.’s (2021) 방법론을 데이터센터와 전력망에 대한 가정에 맞게 조정해 학습 관련 에너지 사용량과 탄소 배출량을 추정한다. DINOv2 재학습에 따른 배출량을 보고하고 프로젝트의 총 footprint를 추정해 self-supervised pretraining이 주요 배출원임을 밝힌다.
- 탄소 추정 방법론: 추정에는 Patterson et al.’s (2021) 공식, 400W A100-80GB thermal design power, 그리고 미국 평균 강도인 0.385 kg CO2eq/KWh가 사용된다.이 방법론은 배출량을 데이터센터와 전력망의 특성에 연관시킨다.
- 재학습 footprint: 동일한 데이터센터에서 OpenCLIP ViT-L과 OpenCLIP ViT-G를 재학습하려면 각각 22.4 MWh와 118.9 MWh가 필요하다.본문은 Table 14가 DINOv2 ViT-g 재학습의 잠재적 탄소 배출량을 보고한다고 서술하지만, 여기서는 그 값을 제시하지 않는다.
- 전체 프로젝트 footprint: 전체 프로젝트는 0.5k–1k tCO2eq로 추정되며, 이는 약 200k GPU-days에 해당하고 self-supervised pretraining이 primary emissions source다.ViT-g pretraining은 22k GPU-hours 동안 3.7 tons의 CO2eq를 배출하는 반면, ImageNet-1k finetuning은 1k GPU-hours 동안 0.2 tons를 배출한다.
10 향후 연구와 논의 … B 구현 세부 사항
DINOv2는 대규모 curated data에서 폭넓게 적용 가능한 unsupervised visual features를 생성하며, 부록에서는 LVD-142M 구축을 위한 dataset selection, similarity computation, deduplication, retrieval 절차를 상세히 설명한다.
- 10 향후 연구와 논의: DINOv2는 finetuning 없이 다양한 benchmark에서 weakly supervised 대안과의 성능 격차를 좁히며, 여러 image domain에서 object part와 scene geometry를 포착한다.저자들은 이러한 특성이 범용 visual feature의 추가 발전을 뒷받침할 것으로 예상한다.
- A.1 Data selection: LVD-142M은 image-level 및 dense recognition에서 downstream vision task를 포괄하도록 설계된 dataset을 선택한다.Dataset selection은 Table 15에 자세히 설명되어 있다.
- A.2 Image similarity: Image similarity는 한 model이 두 image에 대해 생성한 feature vector 사이의 cosine similarity로 계산한다.Similarity function은 m(s, r) = cosine-similarity(f(s), f(r))이다.
- A.3 Deduplication: Self-deduplication은 k = 64개의 nearest neighbor, similarity threshold >0.6, connected component를 사용해 1.3B개의 uncurated image를 처리하고 duplicate group마다 하나의 representative를 남긴다.Connected component는 확장 가능한 disjoint-set data structure 구현으로 계산한다.
- A.3 Deduplication: Relative deduplication은 더 엄격한 similarity threshold >0.45를 적용한 duplicate-component matching으로 evaluation train 및 test split과 지나치게 유사한 image를 제거한다.Reference evaluation image가 포함된 경우 해당 duplicate component 전체를 폐기한다.
- A.4 Retrieval: Retrieval은 sample-based 또는 cluster-based approach를 통해 dataset을 확장하며, Google Landmarks v2와 ImageNet-22k에는 k = 4, LVD-142M에는 k = 32를 사용한다.Sample-based retrieval은 각 dataset image에 대해 nearest image를 수집하고, 고정된 retrieval count만큼 더 큰 dataset을 확장한다. 이는 1M image보다 큰 dataset에 적용된다.
B.1 비지도 사전학습 · B.2 고해상도 적응 · B.3 선형 프로빙 평가
부록에서는 DINOv2의 비지도 사전학습, 고해상도 적응, 선형 프로빙 평가 절차를 규정한다. 학습 일정, teacher 업데이트, 적응, classifier 선택 grid, 검증 결과 보고를 상세히 설명한다.
- B.1 비지도 사전학습: 비지도 사전학습은 DINO 및 iBOT codebase를 기반으로 하며, Tables 16 및 17에 명시된 hyperparameter와 ViT architecture를 사용한다.Architecture table은 distilled model의 MLP feed-forward network와 처음부터 학습한 model의 SwiGLU (Shazeer, 2020)를 구분한다.
- B.1 비지도 사전학습: LVD-142M dataset은 여러 dataset과 split을 결합하며, 데이터를 직접 포함하거나 sample 기반 및 cluster 기반 retrieval을 통해 포함한다.Retrieval된 데이터에 대해서는 retrieval된 image 수와 최종 포함된 image 수를 모두 보고한다.
- B.1 비지도 사전학습: DINOv2 model은 AdamW, scheduled weight decay와 teacher momentum, 100k-step learning-rate warmup, float16 precision을 사용해 625k iteration 동안 사전학습한다.Weight-decay schedule은 0.04에서 0.2까지 진행되며, teacher momentum은 0.994에서 1까지 cosine schedule을 따른다.
- B.1 비지도 사전학습: Teacher는 student와 동일한 상태에서 시작하며, 매 step 이후 [0.994, 1.0] 범위의 cosine-scheduled momentum을 사용하는 exponential moving average로 업데이트된다.또한 각 GPU 내 first-global-crop class token 사이에 weight 0.1의 KoLeo regularization을 적용하며, GPU 간 통신은 사용하지 않는다.
- B.2 고해상도 적응: 고해상도 적응은 pretrained weight에서 초기화하고, 압축된 schedule과 낮아진 base learning rate로 원래 학습 절차를 10k iteration 동안 수행한다.더 짧은 실행에 맞추기 위해 schedule을 압축하지만, 그 밖의 모든 hyperparameter와 schedule은 pretraining과 동일하게 유지한다.
- B.3 선형 프로빙 평가: 선형 프로빙은 learning rate, output-layer 수, average-pooled patch token을 class token과 concatenate할지 여부를 조정하며, SGD classifier를 12,500 iteration 동안 학습한다.Grid는 output layer를 {1, 4}, token concatenation을 {yes, no}에서 탐색하며, random-resized-crop augmentation을 사용한다.
- B.3 선형 프로빙 평가: 평가는 linear-probing grid search에서 가장 높은 validation accuracy를 보고하며, 각 iteration에서 backbone inference를 한 번 수행한 뒤 classifier matrix multiplication을 수행하므로 비용이 제한된다.이 절차는 각 iteration에서 동일한 backbone output을 사용해 모든 linear classifier를 평가한다.
C 평가에 사용된 벤치마크 목록
이 절에서는 모델 평가에 사용된 벤치마크와 데이터셋을 식별하며, 전체 목록은 Table 18에 제시된다.
- C 평가에 사용된 벤치마크 목록: Table 18에는 평가에 사용된 벤치마크와 데이터셋이 나열된다.이 대목에서는 평가 벤치마크 목록의 출처로 해당 표를 소개한다.