Source-linked AI summary

Enriching ImageNet with Human Similarity Judgments and Psychological Embeddings

Brett D. Roads, Bradley C. Love

arXiv:2011.11015v1cs.CVcs.LG

TL;DR

기존 benchmark는 task-specific output을 강조하므로, 인간이 지각하는 similarity와 internal representation을 직접 평가하기 어렵다. 이 논문은 확장 가능한 psychological embedding을 갖춘 ImageNet-HSJ를 소개하고, 더 우수한 classification performance가 인간의 similarity judgment와의 alignment를 안정적으로 향상시키지는 않는다는 점을 보인다.

  • 문제

    classification accuracy와 같은 task-specific metric만으로는 다양한 model의 internal representation이 인간이 지각하는 similarity와 부합하는지 제한적으로만 평가할 수 있다.

  • 방법

    저자들은 인간의 similarity judgment를 수집하고, variational inference, ensemble model, active learning을 사용해 대규모 psychological embedding을 추론한다.

  • 결과

    supervised 또는 unsupervised 절차로 학습된 model을 평가할 수 있지만, DeepCluster는 최하위권의 성능을 보였고 새로운 classification 성능 향상도 인간의 similarity judgment와의 correspondence를 증가시키지 않았다.

  • 시사점 및 한계

    ImageNet-HSJ는 supervised 및 unsupervised learning 절차 전반에서 model representation을 인간의 judgment와 비교해 평가할 수 있는 task-general basis를 제공한다.

  • 시사점 및 한계

    참가자들이 서로 다른 판단을 내릴 수 있고 개인이 metric consistency를 보이지 않을 수 있으므로, 인간의 similarity judgment가 모든 triplet을 일관되게 순위화할 것으로 기대되지는 않는다.

Abstract

from arXiv · show

Advances in object recognition flourished in part because of the availability of high-quality datasets and associated benchmarks. However, these benchmarks---such as ILSVRC---are relatively task-specific, focusing predominately on predicting class labels. We introduce a publicly-available dataset that embodies the task-general capabilities of human perception and reasoning. The Human Similarity Judgments extension to ImageNet (ImageNet-HSJ) is composed of human similarity judgments that supplement the ILSVRC validation set. The new dataset supports a range of task and performance metrics, including the evaluation of unsupervised learning algorithms. We demonstrate two methods of assessment: using the similarity judgments directly and using a psychological embedding trained on the similarity judgments. This embedding space contains an order of magnitude more points (i.e., images) than previous efforts based on human judgments. Scaling to the full 50,000 image set was made possible through a selective sampling process that used variational Bayesian inference and model ensembles to sample aspects of the embedding space that were most uncertain. This methodological innovation not only enables scaling, but should also improve the quality of solutions by focusing sampling where it is needed. To demonstrate the utility of ImageNet-HSJ, we used the similarity ratings and the embedding space to evaluate how well several popular models conform to human similarity judgments. One finding is that more complex models that perform better on task-specific benchmarks do not better conform to human semantic judgments. In addition to the human similarity judgments, pre-trained psychological embeddings and code for inferring variational embeddings are made publicly available. Collectively, ImageNet-HSJ assets support the appraisal of internal representations and the development of more human-like models.

1. 서론

본 연구는 인간이 지각하는 유사성을 기준으로 임의의 모델을 평가하기 위한 데이터셋과 psychological embedding 프레임워크를 제안하며, task-specific metric을 task-general 평가로 보완한다. 인간의 유사성 판단은 맥락과 풍부한 세계 지식을 유연하게 반영하므로, 인간과 유사한 기계 표현을 개발하는 데 중요하다는 점이 동기다.

  • 동기: 인간이 지각하는 유사성은 맥락에 유연하게 적응하며, 풍부한 세계 이해를 반영한다.예를 들어 맥주는 연령 제한 상품이라는 맥락에서는 담배와, 음료라는 맥락에서는 탄산음료와 유사하다고 판단될 수 있다.
  • 동기: 모델이 task-general representation으로 전환함에 따라, task-general 평가 metric은 classification accuracy와 같은 task-specific 척도를 보완할 수 있다.내부 representation metric은 supervised, unsupervised, self-supervised training paradigm 간 비교를 지원할 수 있다.
  • 동기: 보다 인간과 유사한 기계적 사고는 인간-기계 상호작용을 개선할 수 있다.
  • 기여: 본 연구는 인간이 지각하는 유사성을 구현하는 데이터셋을 구축하고, 이를 임의의 모델 평가에 활용하는 방법을 보이는 것을 목표로 한다.유사성 판단에 포함된 정보를 간결하게 모델링하기 위해 psychological embedding을 사용함으로써 선행 연구 [50]를 확장한다.
  • 기여: Psychological embedding은 자극의 embedding과 해당 embedding을 관찰된 행동에 연결하는 함수를 포함한다.본 논문은 psychological embedding이 세 가지 서로 다른 역할을 수행한다고 규정한다.

2. 관련 연구

선행 연구는 인간 유사성 판단을 사용해 embedding을 추론했으며, 점점 더 크고 자연스러운 자극을 활용해 왔다. 한편 다른 연구들은 artificial network와 인간 행동을 비교했다. 본 연구는 유사성 판단 수집을 위한 active-learning 방법을 기반으로 하며, variational inference를 사용해 계산 비용을 줄이고 더 큰 자극 집합으로 확장한다.

  • 인간 유사성 판단의 embedding화: 인간 유사성 판단은 kernel 및 non-metric 알고리즘을 통해 embedding을 추론하는 데 오랫동안 사용되어 왔으며, 최근 연구들은 자극의 규모와 자연성을 높이고 있다.최근 THINGS 연구는 1,854개의 고유 이미지에 대한 판단을 수집했다.
  • 모델과 인간 행동의 비교: 인공 신경망과 인간 행동을 비교한 연구는 분류 성능, 이미지 수준의 혼동, 형태 편향, 그리고 인간이 지각한 전형성 평점을 검토했다.
  • 효율적인 데이터 수집: 이 접근법은 인간 유사성 판단을 위한 active-learning 패러다임을 기반으로 하며, 계산 비용을 줄이기 위해 MCMC posterior sampling을 variationally inferred approximate posterior에서 직접 sampling하는 방식으로 대체한다.명시된 이점은 더 큰 자극 집합으로 확장할 수 있다는 점이다.

3. ImageNet-HSJ 데이터셋

ImageNet-HSJ는 품질이 관리된 50,000개 전체 이미지의 서열형 인간 유사도 판단을 추가해 ILSVRC 2012 validation set을 확장한다. 데이터 수집에는 8개 기준 이미지와 rank-two 선택 과제, 1,000개 이미지 seed subset에서 시작하는 active-learning 확장, 단계적 버전 관리가 사용된다.

  • 데이터셋 범위: ImageNet-HSJ는 ILSVRC 2012 validation set을 보완하는 서열형 인간 유사도 판단의 버전 관리 데이터셋이며, 다수 참가자로부터 수집한 품질 관리 판단을 포함한다.평가가 model-selection 패러다임을 지원하므로 데이터셋은 validation set에만 집중한다.
  • 데이터 수집: 각 수집 세션은 50 trials로 구성되고 약 10분간 진행되었으며, 참가자에게 시간당 약 8.00 USD를 보상했다.판단은 Amazon Mechanical Turk를 통해 모집한 참가자로부터 웹 애플리케이션을 사용해 수집했다.
  • 인간 과제: 참가자는 주변의 8개 이미지 중 중심 query와 가장 유사한 두 reference image를 선택하고, 첫 번째와 두 번째 선택 순위를 매겼다.8개 기준 이미지와 rank-two 형식은 사용 편의성과 처리량 및 noise 간 균형을 위해 선택했다.
  • 자극 범위: 1,000개 이미지 seed subset에서 시작해 active-learning 수렴 후 확장함으로써 50,000개 ILSVRC validation image 전체에 대한 판단을 수집했다.seed에는 VGG19 prediction을 사용해 선택한 클래스별 대표 이미지 하나씩이 포함되었다.
  • 버전 관리: Release version 0.1은 seed subset을 포함하고, version 0.2는 제출 시점에 판단을 이용할 수 있는 전체 stimulus set을 포함하며, version 1.0은 수렴 후 공개할 예정이다.이 버전 관리 체계는 초기 seed 수집, 전체 데이터셋 범위 확보, 예정된 최종 공개를 구분한다.

4. 데이터 수집

ImageNet-HSJ는 무작위 샘플링이 아니라 active learning을 통해 인간 유사성 판단을 수집하며, 기대 정보 이득이 큰 trial을 선택하고 psychological embedding을 반복적으로 정 refinement한다. 품질 관리는 catch trial과 세션 평가를 사용하고, variational posterior와 embedding ensemble이 이후 trial 선택을 유도한다.

  • Active learning: Active learning은 trial을 반복적으로 선택하고 판단을 수집하며 psychological embedding을 추론하되, 무작위로 샘플링하는 대신 최대 기대 정보 이득을 갖는 trial을 대상으로 한다.기대 정보 이득은 후보 trial을 추가했을 때 예상되는 embedding entropy의 감소로 정의된다. 휴리스틱을 사용하면 방대한 trial 공간에서도 탐색이 가능하다.
  • 품질 관리: 선택된 trial은 50개 trial로 구성된 72개 세션으로 나뉘었으며, 각 세션에는 품질 평가를 위한 catch trial 4개가 전략적으로 배치되었다.처음 20개 trial 사이에 catch trial 2개가, 마지막 20개 trial 사이에 2개가 나타났다.
  • 품질 관리: 평균 평가가 .5 미만인 만족스럽지 않은 세션은 폐기했으며, .875를 초과한 우수 세션은 참가자가 추가 작업을 수행할 자격을 유지하도록 했다.이 절차는 각 세션마다 하나의 우수 평가를 확보하는 것을 목표로 했고, 우수 세션을 받지 못한 참가자는 이후 자격에서 제외했다.
  • Embedding 추론: Variational inference에서 얻은 posterior uncertainty는 embedding이 불확실한 지점을 식별하며, 동일한 가중치를 갖는 3개 embedding의 ensemble은 초기화와 local optima에 대한 민감도를 제한한다.Posterior는 epistemic uncertainty와 aleatoric uncertainty를 모두 포착하며, ensemble 구성원은 향후 trial 선택을 위한 더 강건한 지침을 제공한다.

5. 데이터셋 수렴 평가

이 연구는 coarse-grained loss, ensemble 내 일치도, iteration 간 일치도를 사용해 psychological embedding의 수렴을 평가한다. 모든 측정치는 seed subset에서는 수렴을 나타내지만, local optimum에 여전히 민감한 full dataset에서는 수렴을 나타내지 않는다.

  • 측정치: 추가 similarity data가 수집됨에 따라 coarse-grained loss, ensemble 내 일치도, iteration 간 일치도를 사용해 수렴을 평가했다.이 측정치들은 embedding의 변화, ensemble 내 모델 간 일치, 연속된 iteration 간 일치를 추적한다.
  • Coarse-grained loss: training iteration 전반에서 coarse-grained loss가 minimum에 가까워지는 것은 psychological embedding이 수렴했다는 증거를 제공한다.coarse-grained trial은 무작위로 표본 추출되며, 매우 유사한 image pair가 포함될 가능성이 낮아 fine-grained similarity를 탐색하는 관측치가 적다.
  • Embedding 일치도: ensemble 내 일치도는 모델이 함의하는 pairwise similarity matrix를 비교하는 반면, iteration 간 일치도는 연속된 ensemble에서 얻은 expected similarity matrix 사이의 Pearson correlations를 사용한다.데이터가 충분하면 ensemble 내에서 comparable한 embedding이 생성되어야 하며, 추가 데이터가 추론된 ensemble을 변화시키지 않아야 한다.
  • 결과: 모든 측정치는 seed-subset embedding이 수렴했음을 나타내는 반면, full-dataset embedding은 수렴하지 않았다 (Figure 5.4).full dataset에서 나타난 하락은 local optimum에 대한 취약성을 보여준다.

6. 데이터셋을 사용한 target model 평가

이 절에서는 direct triplet accuracy와 psychological embedding과의 correlation을 사용해 임의의 model representation을 ImageNet-HSJ에 대해 평가한다. 널리 사용되는 supervised model 중에서는 ResNet50이 가장 우수하며, stimulus-blind인 psychological embedding이 가장 높은 triplet-rating accuracy를 보인다.

  • Direct triplet evaluation: Triplet accuracy는 각 8-rank-2 judgment를 암묵적 triplet inequality로 변환하고, target model이 올바르게 순위를 매긴 비율을 측정한다.q : a > b일 때 d(Zq, Za) < d(Zq, Zb)이면 triplet이 정답이며, 평균 정답률이 triplet accuracy가 된다.
  • Evaluation methods: Triplet accuracy는 단순하지만 거칠다. 인간 judgment가 서로 다를 수 있고 개인마다 metric consistency가 다를 수 있기 때문이다.충분한 관측값이 있을 때는 psychological-embedding 비교가 더 강력한 평가를 제공한다.
  • Evaluation results: ResNet50은 seed dataset과 full dataset 모두에서 가장 높은 triplet accuracy를 보이며, 모든 model에서 cosine distance가 L1과 L2보다 우수하다.평가된 모든 model은 chance level을 상회한다.
  • Evaluation results: psychological embedding은 stimulus를 보지 못하고 triplet data로 학습되었음에도 triplet rating 예측에서 가장 우수하다.다른 model은 약 1 million개의 image를 경험으로 활용하므로 비교가 완전히 공정하지 않다. hold-one-trial-out procedure를 사용하면 유사한 accuracy를 얻을 수 있다.
  • Evaluation results: ResNet50은 psychological-embedding correlation에서도 가장 우수하며, 대부분의 target model에서 cosine similarity가 가장 높은 correlation을 산출한다.Correlation은 Spearman correlation을 사용해 upper-triangular pairwise similarity matrix를 비교하므로, similarity relationship이 선형이라는 가정을 피한다.

7. 논의

이 방법은 variational inference, ensemble models, active learning을 사용해 인간 유사성 판단으로부터 대규모 psychological embedding space를 효율적으로 추론한다. 이러한 판단은 supervised 및 unsupervised model representation을 평가하며, 더 높은 ImageNet classification 성능이 인간 유사성 판단과의 더 큰 정렬을 반드시 의미하지는 않음을 보여준다.

  • 방법론적 기여: 이 접근법은 variational inference, ensemble models, active learning을 통해 psychological embedding 추론을 기존 연구보다 한 자릿수 큰 문제로 확장한다.model representation과 인간 판단 간 일관성을 평가하면 많은 항목에 적용할 수 있는 유용한 평가 metric을 제공한다.
  • Model evaluation: unsupervised representation이 더 잘 일반화되고 인간 판단에 더 잘 부합할 것이라는 예상과 달리, DeepCluster는 성능이 가장 낮은 model 중 하나였다.이 metric은 supervised 및 unsupervised procedure를 통해 학습된 representation을 모두 평가할 수 있지만, unsupervised model은 하나만 검증되었다.
  • Model evaluation: 새로운 model의 ImageNet classification 성능이 향상되었음에도 supervised model과 인간 유사성 판단 간 대응은 증가하지 않았다.이전 classification model은 인간의 행동 및 뇌 데이터와 더 높은 대응을 보였지만, 이러한 관계는 새로운 model에서는 이어지지 않았다.
  • broader implications: 인간 유사성 판단은 인간이 세계를 유연하고 맥락에 따라 구조화하는 방식을 드러내며, model representation 평가를 넘어선 응용을 지원할 수 있다.저자들은 추론된 embedding space와 dataset 모두에 추가적인 용도가 있을 것으로 예상한다.
Loading 2011.11015v1…