Source-linked AI summary

Reframing Human-AI Collaboration for Generating Free-Text Explanations

Sarah Wiegreffe, Jack Hessel, Swabha Swayamdipta, Mark Riedl, Yejin Choi

arXiv:2112.08674v2cs.CL

TL;DR

높은 품질의 서술형 설명은 수집하기 어렵고 비용이 많이 들어, 자유 텍스트 설명 생성에 사용할 수 있는 supervision이 제한된다. 이 논문은 GPT-3의 overgeneration과 human-acceptability filtering을 사용하며, 인간이 acceptable하다고 판단하는 설명을 일관되게 선택하는 동시에 label support와 novel information을 향상한다.

  • 문제

    높은 품질의 서술형 설명을 수집하기 어려운 이유는 crowdsourced explanations가 일관되지 않거나 문법에 맞지 않을 수 있고, 데이터셋 간 비교도 어렵기 때문이다.

  • 방법

    이 논문은 GPT-3에 candidate explanations를 반복적으로 prompt하고, human acceptability ratings로 supervised filter를 학습해 후보 중에서 설명을 선택한다.

  • 결과

    다섯 번의 query 안에 GPT-3는 대개 인간 평가자 전원이 accept하는 설명을 생성하며, filtration은 acceptability, label support, novel information을 향상한다.

  • 시사점 및 한계

    Overgenerate-and-filter는 human acceptability supervision을 사용해 few-shot GPT-3 설명을 개선한다.

  • 시사점 및 한계

    GPT-3는 자신이 예측하지 않은 answer choices도 설명할 수 있어, 생성된 설명이 실제 배포에서 신뢰하기 어렵고 오해를 유발할 가능성이 있다.

Abstract

from arXiv · show

Large language models are increasingly capable of generating fluent-appearing text with relatively little task-specific supervision. But can these models accurately explain classification decisions? We consider the task of generating free-text explanations using human-written examples in a few-shot manner. We find that (1) authoring higher quality prompts results in higher quality generations; and (2) surprisingly, in a head-to-head comparison, crowdworkers often prefer explanations generated by GPT-3 to crowdsourced explanations in existing datasets. Our human studies also show, however, that while models often produce factual, grammatical, and sufficient explanations, they have room to improve along axes such as providing novel information and supporting the label. We create a pipeline that combines GPT-3 with a supervised filter that incorporates binary acceptability judgments from humans in the loop. Despite the intrinsic subjectivity of acceptability judgments, we demonstrate that acceptability is partially correlated with various fine-grained attributes of explanations. Our approach is able to consistently filter GPT-3-generated explanations deemed acceptable by humans.

1 서론

이 논문은 few-shot GPT-3 prompting이 놀랍도록 경쟁력 있는 자유 텍스트 설명을 생성할 수 있으며, human-supervised acceptability filter가 그 품질을 높인다는 것을 보인다. 이는 crowd annotator를 설명 작성자에서 machine-generated explanation의 평가자로 재구성한다.

  • 제안된 pipeline은 연구자들이 작성한 prompt를 사용해 각 instance마다 설명을 다섯 개씩 과잉 생성한 뒤, binary human acceptability judgment를 사용해 타당하지 않은 output을 필터링한다.평가는 explanation 수준과 instance 수준 모두에서 수행된다.
  • 고품질의 서면 supervision은 어렵고 비용이 많이 든다. crowdsourced dataset에는 논리적으로 일관되지 않거나 문법에 맞지 않으며 서로 이질적인 설명이 자주 포함되기 때문이다.기존 free-text explanation dataset의 70% 이상이 crowdsourced dataset이다.
  • Human study에 따르면 GPT-3 설명은 반복을 피하고 label을 뒷받침하며 전반적인 acceptability를 높이는 측면에서 여전히 개선이 필요하다.greedy decoding으로 생성된 설명 중 절반 미만만이 모든 human annotator의 일치된 판단에서 acceptable했다.
  • Filtration model은 human이 acceptable하다고 식별한 설명을 일관되게 선택하며, 강력한 baseline보다 label support, novel information, 전반적인 acceptability를 향상한다.이러한 향상은 acceptability rating이 본질적으로 주관적임에도 유지된다.
  • Few-shot GPT-3 prompting은 놀랍도록 경쟁력 있는 설명을 생성하며, crowd-authored free-text explanation corpus의 유망한 대안을 제공한다.

2 GPT-3은 크라우드소싱 설명 데이터셋과 경쟁력 있다

고품질의 저자 작성 예시를 프롬프트로 제공하면 few-shot GPT-3 설명은 크라우드소싱 설명과 경쟁력을 갖는다. 표면적 품질은 높지만 새로움과 레이블 뒷받침에서는 여전히 약하며, 이 두 속성은 전반적 수용 가능성과 관련된다.

  • 2.1 데이터셋 비교: GPT-3 설명은 CoS-E 설명보다 자주 선호되거나 비슷한 평가를 받았으며, ECQA와 e-SNLI에 대해서도 각각 47.3%와 36.4%의 사례에서 경쟁력을 보였다.ECQA와 e-SNLI 설명이 대체로 선호되었지만, GPT-3이 크라우드소싱 설명보다 일관되게 낮은 평가를 받은 것은 아니다.
  • 2.2 프롬프트 품질: 저자 작성 설명은 세 코퍼스 모두에서 프롬프트로 사용한 크라우드소싱 설명보다 더 나은 GPT-3 생성 결과를 이끌어냈다.일대일 평가는 프롬프트 품질이 생성된 설명의 품질에 실질적인 영향을 미친다는 점을 보여준다.
  • 2.2 프롬프트 품질: 저자 작성 프롬프트를 사용하면 세 데이터셋 모두에서 GPT-3 설명이 인간 작성 설명만큼 좋거나 더 나았던 경우가 절반을 넘었다.이러한 생성 결과는 데이터셋 프롬프트로 생성한 결과보다 경쟁력이 높았으며, 후속 실험에서 저자 작성 설명을 사용할 근거가 되었다.
  • 2.3 설명 속성: GPT-3 설명은 일반성, 문법성, 사실성에서 높은 점수를 받았지만, 가장 강력한 크라우드소싱 데이터셋보다 새로운 정보 제공과 레이블 뒷받침이 약했다.새로운 정보의 평균은 두 과제 모두에서 GPT-3이 0.1이었던 반면 ECQA는 0.6, SNLI는 0.2였으며, 통계적으로 유의한 차이는 p ≤0.01에서 나타났다.
  • 2.3 설명 속성: 수용 가능성은 측정된 모든 속성과 양의 상관을 보였으며, 일반성, 문법성, 레이블 뒷받침과 가장 강하게, 새로운 정보와는 가장 약하게 상관되었다.GPT-3 설명은 CoS-E와 ECQA 설명보다 수용 가능성이 높다고 평가되었지만, e-SNLI 설명보다 높지는 않았다.

3 탐욕적 설명을 넘어

추가 GPT-3 설명을 샘플링하면, 샘플링된 설명이 greedy 출력보다 개별적으로는 덜 수용 가능함에도 불구하고, 세 명의 annotator 모두에게 수용 가능한 설명이 하나 이상 포함될 가능성이 크게 높아진다.

  • 3 탐욕적 설명을 넘어: greedy CommonsenseQA 설명의 46.3%와 greedy NLI 설명의 31.5%만이 세 annotator 모두에게 수용 가능하다고 평가되었으며, 이는 greedy decoding의 대안을 모색하게 했다.여러 최종 사용자가 시스템 출력을 받을 수 있는 상황에서 가장 모호하지 않게 수용 가능한 설명을 제공하는 것이 목표다.
  • 3 탐욕적 설명을 넘어: 이 방법은 각 instance마다 GPT-3 설명을 네 개 추가로 샘플링하고, 새로 생성된 각 설명에 대해 crowdsource acceptability annotation 세 개를 수집한다.이 확률적 샘플링 전략은 다른 generation task에 관한 선행 연구(Holtzman et al., 2020; Massarelli et al., 2020; Holtzman et al., 2021)에 기반해 도입되었다.
  • 3 탐욕적 설명을 넘어: 샘플링된 generation을 추가한 뒤 CommonsenseQA instance의 79.5%와 NLI instance의 51.2%에는 3/3-acceptable 설명이 하나 이상 포함되었으며, greedy 출력에서는 각각 46.3%와 31.5%였다.각 instance의 집합은 greedy 설명 하나와 샘플링된 설명 네 개로 구성되었다.
  • 3 탐욕적 설명을 넘어: 샘플링된 설명은 개별적으로 greedy 설명보다 낮은 3/3 acceptability를 보였다. CommonsenseQA에서는 25.1%, SNLI에서는 11.3%였다.개별 수용 가능성은 더 낮았지만, 샘플링된 후보들은 다섯 개 출력으로 구성된 집합에 수용 가능한 설명이 하나 이상 포함될 가능성을 높인다.

4 Acceptability Filtering을 통한 Explanation Generation 개선

이 절에서는 annotator를 binary acceptability judge로 재정의하고, GPT-3의 stochastic candidate 중 acceptable한 explanation을 선택하는 supervised filter를 학습한다. 이 filter는 GPT-3 likelihood baseline을 능가하고, content-related explanation trait 여러 항목을 개선하며, CommonsenseQA에서 GPT-3 explanation에 대한 선호를 높인다.

  • Classifier performance: CommonsenseQA에서 T0-3B는 test set의 instance-level accuracy에서 NLL baseline보다 7–8%, explanation-level AP에서 18% 앞선다.두 task와 validation/test set 모두에서 T0-3B는 GPT-3의 negative log-likelihood acceptability score를 크게 능가한다.
  • Classifier performance: Full model은 모든 metric에서 explanation-only baseline보다 5 points 이상 높은 성능을 보여, instance–explanation feature interaction이 human acceptability 예측에 기여함을 나타낸다.그럼에도 explanation-only model은 놀라울 정도로 높은 성능을 보여, factuality와 grammaticality가 human judgment의 latent factor일 수 있음을 시사한다.
  • Human evaluation: Filtered explanation은 greedy explanation보다 new information을 도입하고 label을 뒷받침하며 sufficient information을 제공하는 경우가 더 많지만, greedy output은 일부 surface-level 이점을 유지한다.Greedy explanation은 grammaticality에서, 그리고 CommonsenseQA에서는 factuality에서도 여전히 더 강하며, 이러한 차이는 통계적으로 유의하다.
  • 인간 평가: greedy 대신 filtered GPT-3 설명을 사용하면 두 CommonsenseQA 데이터셋 모두에서 GPT-3에 대한 선호도가 15–24% 증가하지만, SNLI에서는 증가하지 않는다.SNLI에서 효과가 더 작은 것은 filtering 후 변경되는 설명이 더 적고 전반적인 acceptability가 더 낮은 것과 일치한다.
  • Summary: 이 방법은 약 5k개의 binary annotation을 사용해 만장일치로 acceptable한 GPT-3 candidate를 선택하지만, upper-bound oracle과의 격차는 특히 SNLI에서 상당한 개선 여지가 남아 있음을 보여준다.Consensus label은 때때로 성능을 높이고 대개 seed variance를 줄이지만, annotation이 세 배 더 필요하다. 성능은 별도로 annotation된 NLI test data에도 유사한 수준으로 transfer된다.

5 관련 연구

선행 연구는 supervised, unsupervised, weakly supervised, template-based free-text explanation generation을 아우르며, 동시기 연구는 prompting과 model size를 다룬다. 본 연구는 human-preference modeling을 explanation acceptability로 확장하고, 서로 다른 성공 조건과 평가 요건을 제시한다.

  • Free-text explanation generation: 초기 explanation generator는 vision과 NLI를 대상으로 주로 supervised dataset을 사용했으며, 이후 연구는 supervised 또는 unsupervised task-improvement setting을 탐구했다.이러한 방향에는 supervised 및 unsupervised 방식으로 explanation 또는 clarification을 생성하는 방법이 포함된다.
  • Free-text explanation generation: 다른 접근법은 task signal만 사용하거나, weak supervision 또는 mask-infilling을 적용한 hand-crafted template으로 free-text 또는 contrastive explanation을 생성한다.Latcinnik and Berant (2020)은 task signal을 사용하고, Brahman et al. (2021)은 weak supervision을 사용하며, Paranjape et al. (2021)은 pretrained language model과 함께 template을 사용한다.
  • Free-text explanation generation: 동시기 연구는 GPT-3 Davinci가 더 작은 pretrained model보다 성능이 우수하지만 dataset explanation보다 crowdworker에게 덜 그럴듯하게 받아들여진다는 점을 보인다. 본 연구는 더 세분화된 기준을 연구하고 prompts and filtering을 통해 성능을 향상한다.이 비교는 prompted explanation의 plausibility를 다루며, 논문의 첫 번째 실험 결과(Table 3)와 일치한다.
  • Supervising on human preferences: summarization, commonsense knowledge base, NLI dataset을 대상으로 한 기존 human-preference modeling과 달리, 본 연구는 모든 instance에 대해 prediction을 산출해야 하는 explanation에 acceptability filtering을 적용한다.반면 causal knowledge-graph generation은 나쁜 generation을 폐기할 수 있지만, 이 task는 domain, 성공 조건, evaluation metric에서 차이가 있다.

6 결론

GPT-3는 few-shot 설정에서 NLP 인스턴스에 대한 자유 텍스트 설명을 생성할 수 있으며, overgenerate-and-filter pipeline은 human acceptability supervision을 활용해 이 능력을 한층 향상한다. 또한 저자들은 신뢰와 잘못된 label에 대한 misleading explanations를 향후 연구의 중요한 방향으로 제시한다.

  • 결론: GPT-3는 few-shot 설정에서 NLP task 인스턴스에 대한 자유 텍스트 설명을 생성하며, overgenerate-and-filter는 human acceptability ratings를 활용해 이 능력을 한층 향상한다.filter는 human acceptability judgments에서 얻은 supervision으로 학습된다.
  • 결론: 향후 연구에서는 neural 또는 neurosymbolic systems를 통한 자유 텍스트 설명을 탐구하고 counterfactual explanations의 이점을 추가로 검토해야 한다.저자들은 Brahman et al. (2021), Majumder et al. (2021), Saha et al. (2021)를 관련된 향후 연구 방향으로 제시한다.
  • 결론: human acceptability를 모델링하면 사용자 신뢰를 높이는 데 도움이 될 수 있지만, 특히 설명이 incorrect label predictions와 함께 제공되어 최종 사용자를 mislead end users할 수 있는 경우 그러한 신뢰는 정당하지 않을 수 있다.의사결정을 위한 human rationales가 model rationales와 반드시 같은 것은 아니다.

7 윤리 및 광범위한 영향 · A 프롬프트 구성 · B 크라우드소싱 세부사항

이 논문은 과도한 신뢰, 신뢰할 수 없는 설명, 집단에 따라 달라지는 수용성 판단의 가능성을 기록해 윤리적 위험을 제한한다. 또한 견고한 few-shot 프롬프트 구성 전략을 자세히 설명하고, 인터페이스, 품질 관리, 보상, 주석자 통계를 중심으로 크라우드소싱 절차를 구성한다.

  • 7 윤리 및 광범위한 영향: 이 연구는 공개 데이터셋을 사용하고 수집한 설명과 주석을 공개할 계획이며, 참여자로부터 개인 정보를 수집하지 않는다.이러한 관행은 연구가 명시한 데이터 및 참여자 개인정보 보호 장치를 규정한다.
  • 7 윤리 및 광범위한 영향: gold label을 조건으로 생성된 GPT-3 설명은 인간이 AI 시스템을 부당하게 신뢰하게 만들 수 있으므로, 설명의 faithfulness에 주의를 기울여야 한다 [Hase et al., 2020; Wiegreffe et al., 2021].이 논문은 이 위험을 model-generated free-text explanation의 faithfulness를 다루는 연구와 연결한다.
  • 7 윤리 및 광범위한 영향: GPT-3는 자신이 예측하지 않은 answer choice도 그만큼 잘 설명할 수 있으며, 이는 그 설명이 신뢰할 수 없음을 보여준다.논문은 sub-optimal decoding과 대안 선택지에 관한 factual knowledge가 이러한 행동을 부분적으로 설명할 수 있다고 제안한다 [Zhao et al., 2021; Holtzman et al., 2021].
  • 7 윤리 및 광범위한 영향: 모델이 주로 서구권 영어 사용자 크라우드소싱 참여자들의 종합적 판단을 반영하기 때문에, 집단별 수용성 판단은 인구 집단에 따라 크게 달라질 수 있다.이러한 한계로 인해 인간 수용성 모델은 모집단에 의존한다.
  • A 프롬프트 구성: 프롬프트 구성은 전체 training 및 development set에 대한 tuning을 피하고 방법 개발에 최대 115개의 sampled training instance만 사용함으로써 진정한 few-shot 설정을 유지한다.초기 설계에서는 CoS-E와 e-SNLI 각각에 대해 예시 15개를 포함한 layout을 10개 이하로 사용했으며, 이후 설계에서는 해당 예시에서 prompt 6개를 샘플링했다.
  • A 프롬프트 구성: 프롬프트 용량은 GPT-3의 2049-token API limit으로 제한되며, CoS-E, e-SNLI, handwritten explanation에는 최대 24개, ECQA에는 16개의 예시만 허용된다.추가된 설명이 각 프롬프트 인스턴스를 길게 만들어 API가 수용할 수 있는 예시 수를 줄인다.
  • A 프롬프트 구성: 프롬프팅 전략은 hyperparameter를 tuning하는 대신 추가 hyperparameter를 샘플링하며, 큰 validation set을 사용할 수 없을 때 견고한 expected-performance estimate를 얻는 것을 목표로 한다.이 일반 전략은 예시의 순서, 개수, 선택에서 발생하는 분산을 다룬다 [Zhao et al., 2021; Lu et al., 2022].
  • B 크라우드소싱 세부사항: 크라우드소싱 절차는 공유된 study-design 세부사항, head-to-head·absolute·acceptability 인터페이스와 품질 관리, 보상, 주석자 통계를 통해 문서화된다.부록은 이러한 주제를 §§B.1–B.6에 배정한다.

B.1 공통 인터페이스 세부 사항 … B.4 Acceptability 인터페이스 세부 사항

연구에서는 pairwise comparison, attribute-based evaluation, acceptability filtering에 맞게 설계된 인터페이스를 사용해 참가자에게 과제 입력과 gold label을 제시한다. Absolute evaluation은 맥락과 무관한 품질과 맥락에 따른 유용성 및 충분성 판단을 분리한다.

  • B.1 공통 인터페이스 세부 사항: 모든 human-study 인터페이스는 explanation(s)과 함께 입력 인스턴스와 gold label을 보여 주며, gold label을 방법론적 통제값으로 취급한다.참가자에게 다른 오답 선택지는 제시하지 않아 주관적이거나 모호한 대안, 특히 CommonsenseQA에서 발생할 수 있는 교란을 줄인다.
  • B.2 Head-to-Head 인터페이스 세부 사항: Head-to-head 인터페이스는 gold label을 정답으로 간주하고 사소한 문법 또는 철자 오류는 무시하면서, 두 explanation 중 어느 것이 답을 더 잘 설명하는지 worker가 선택하게 한다.Figures 5 and 6에 evaluation interface가 기술되어 있다.
  • B.3 Absolute 인터페이스 세부 사항: Absolute evaluation 인터페이스는 맥락과 무관한 평가와 맥락에 따른 평가로 나뉘는 일곱 개의 질문으로 구성된다.일치율을 높이기 위해 인터페이스를 세 버전에서 네 버전에 걸쳐 반복적으로 개선했다.
  • B.3 Absolute 인터페이스 세부 사항: 맥락과 무관한 평가는 explanation이 다루는 질문이나 맥락을 공개하지 않고 factuality, generality, grammaticality를 평가한다.Factuality 판단에서는 진실성을 평가할 수 있는 진술과 더 많은 정보가 필요한 진술도 구분한다.
  • B.3 Absolute 인터페이스 세부 사항: 맥락에 따른 평가는 질문과 gold answer를 공개한 뒤, explanation이 그 내용을 넘어 새로운 사실, 정보 또는 추론을 추가하는지 검증한다.이를 통해 유용한 explanation과 올바르지만 단순히 선언적으로 다시 서술한 explanation을 구분한다.
  • B.3 Absolute 인터페이스 세부 사항: 나머지 맥락 의존적 질문은 explanation이 답을 정당화할 만큼 충분한 정보를 제공하는지와 전반적으로 acceptable한지를 평가한다.Adequacy에 관한 질문은 추가 정보나 추론이 식별된 뒤 조건부로 제시되므로, 단일 informativeness 판단보다 세분화된 오류 분석이 가능하다.
  • B.4 Acceptability 인터페이스 세부 사항: Binary acceptability 인터페이스는 overgeneration filter model의 training data와 test data를 수집한다.상관 분석을 위해 다섯 개 데이터 소스에서 250개의 test explanation에 각각 세 개의 annotation을 부여하며, 조건부 제외 전 총 3750 datapoints를 얻는다.

B.5 품질 관리 및 보상

이 연구는 표준화된 시간당 환산 보상, 지역 및 경력 기반 선별, 과업별 자격시험, 지속적인 주석 품질 모니터링을 포함하는 AMT를 사용했다. 저자들은 지역별 자격 요건이 영어 능력을 대리하는 광범위하고 최적이 아닐 가능성이 높은 지표임을 인정했다.

  • 보상: 작업자에게 목표 보상률인 $15/hour를 지급했으며, 초기 보상은 head-to-head HIT당 $0.12, absolute-evaluation HIT당 $0.25, acceptability HIT당 $0.20였다.연구자들은 목표 보상률을 유지하기 위해 주기적으로 중앙 완료 시간을 확인했지만, 주석자들은 시간이 지나면서 더 빠르게 작업하는 경향을 보였다.
  • 자격 요건: 주석자는 영어 사용 5개국으로 제한되었고, >5000개의 승인된 HIT에 대해 >98%의 승인율을 충족해야 했으며, 이전에 차단 목록에 오른 경우에는 제외되었다.지역 제한은 영어 능력의 대리 지표로 사용되었다.
  • 한계: 국가 제한은 광범위하고 최적이 아닐 가능성이 높은 가정으로 인정되었으며, 선행 경험에 따르면 이를 확대해도 주석자의 >90%가 미국 또는 캐나다 출신이었다.이 한계는 지역을 언어 능력의 대리 지표로 사용하는 데 따르는 불확실성을 반영한다.
  • 품질 관리: 주석은 자격시험, 주석자 간 일치도, 완료 시간 점검, 신뢰할 수 없는 작업의 제거 및 재주석, 다수의 서로 다른 크라우드 작업자 모집을 통해 품질 관리되었다.일치도는 Krippendorff’s α로 측정했으며, 숨겨진 JavaScript가 HIT당 소요 시간을 추적했다.

B.6 통계

이 절에서는 크라우드 주석자 수와 실험별 HIT 완료 요약을 포함한 주석 통계를 보고한다. 또한 acceptability 주석 통계와 더 자세한 주석자 간 일치도 분석을 담은 표를 제시한다.

  • B.6 통계: Table 17은 각 실험에 참여한 서로 다른 크라우드 주석자의 수와 완료한 HIT 수의 중앙값 및 평균을 보고한다.이 통계는 실험 전반에 걸친 주석자 참여를 요약한다.
  • B.6 통계: Table 13은 acceptability 주석 통계를 제시한다.
  • B.6 통계: 일부 실험의 주석자 간 일치도에 대한 더 자세한 분석은 Tables 14 및 15에 제시되어 있다.

C 레이블 정확도에 의한 절대 평가 · D 2/3 수용 가능성 통계 · E 필터 모델 세부사항

GPT-3 설명은 정답 및 오답 레이블 사이에서 속성 차이가 거의 나타나지 않아 충실성이 제한되었으며, greedy CommonsenseQA 생성에서는 수용 가능성이 높고 5개 후보 전반에서 이를 회복할 수 있는 경우가 많았다. 필터 모델은 누수 방지 인스턴스 분할과 표준 sequence-model 학습 설정을 사용했다.

  • C 레이블 정확도에 의한 절대 평가: GPT-3가 WHY? 토큰이나 정답 설명 없이 레이블 예측을 생성했을 때, CommonsenseQA 레이블 정확도 50.8%는 20% 무작위 기준선을 상회했다.
  • D 2/3 수용 가능성 통계: 5개 후보 설명 중 CommonsenseQA 인스턴스의 97.7%와 SNLI 인스턴스의 79.5%에는 수용 가능한 설명이 최소 하나씩 있었다.
  • E 필터 모델 세부사항: 필터 데이터에는 서로 다른 주석이 달린 CommonsenseQA 설명 4,955개와 SNLI 설명 5,000개가 사용되었으며, train 세트와 development 세트로 분할할 때 인스턴스별 설명 5개를 모두 함께 유지했다.인스턴스 수준 metric은 각 인스턴스의 설명 5개 전체에 대해 계산한 점수의 평균이었다.
  • E 필터 모델 세부사항: 낮은 SNLI 레이블 예측 성능은 GPT-3가 문장 비교 과제에 어려움을 겪는다는 선행 연구 결과와 일치한다(Brown et al., 2020; Zhao et al., 2021).
  • C 레이블 정확도에 의한 절대 평가: 정확하게 예측된 레이블과 잘못 예측된 레이블에서 설명의 차이가 거의 나타나지 않았으며, 이는 현재 형태의 GPT-3가 실제 사용에 충분히 충실하지 않음을 보여준다.Figure 4는 CommonsenseQA와 SNLI에 대한 이 절대 평가를 보고한다.
  • E 필터 모델 세부사항: 필터는 설명만 포함한 입력 또는 질문과 정답 레이블을 포함한 입력을 사용해 설명을 good 또는 bad로 분류했으며, T5-Large와 T0-3B의 학습 설정을 명시했다.T5-Large는 learning rate 1E −4, batch size 64, early stopping, 최대 200 epochs를 사용했고, T0-3B는 batch size 50을 사용했다.

F 추가 필터 결과

acceptability threshold를 만장일치에서 annotator 2/3의 동의로 완화해도 주요 실험과 comparable한 결과가 나온다. 이 정의에서도 T0-3B는 select-1 accuracy와 average precision (AP)에서 baseline보다 여전히 우수하다.

  • 추가 threshold 결과: 완화된 평가에서는 3명의 annotator 모두의 동의를 요구하는 대신, annotator 중 2/3 이상이 동의하면 explanation을 acceptable로 라벨링한다.주요 실험에서는 3/3 annotator threshold를 사용했다.
  • 추가 threshold 결과: 전반적으로 threshold를 완화해도 기존의 만장일치 기준으로 얻은 결과와 comparable한 결과가 나온다.비교 대상은 select-1 accuracy와 AP 모두를 포함한다.
  • 추가 threshold 결과: acceptability를 위해 annotator 2/3 이상이 동의하도록 하면 T0-3B는 select-1 accuracy와 AP 모두에서 baseline보다 우수하다.이 결과는 CommonsenseQA와 SNLI로 학습한 acceptability classifier에 대해 보고되었다.
Loading 2112.08674v2…