Source-linked AI summary
TyDi QA: A Benchmark for Information-Seeking Question Answering in Typologically Diverse Languages
Jonathan H. Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, Jennimaria Palomaki
TL;DR
다국어 모델을 평가하려면 영어뿐 아니라 전 세계 언어의 폭넓은 유형론적 다양성을 반영하는 평가 데이터가 필요하다. TyDi QA는 모델을 사용하지 않고 번역도 하지 않는 절차로 수집한 대규모 다국어 정보 탐색 질의-응답 쌍 코퍼스를 제시한다. 기준선 mBERT 성능은 여러 언어에서 인간 성능과 큰 격차를 보이며, 영어 SQuAD 학습은 TyDi QA에서 매우 낮은 F1을 산출한다.
문제
다국어 모델을 평가하려면 영어뿐 아니라 전 세계 언어의 폭넓은 유형론적 다양성을 반영하는 평가 데이터가 필요하다.
방법
TyDi QA는 모델을 사용하지 않고 번역도 하지 않는 절차로 수집한 대규모 다국어 정보 탐색 질의-응답 쌍 코퍼스를 제시한다.
결과
기준선 mBERT 성능은 여러 언어에서 인간 성능과 큰 격차를 보이며, 영어 SQuAD 학습은 TyDi QA에서 매우 낮은 F1을 산출한다.
시사점 및 한계
TyDi QA는 정보 탐색 요구와 다양한 언어 현상에 부합하는 결론을 뒷받침하도록 설계된 도전적인 다국어 평가를 제공한다.
시사점 및 한계
질문, Wikipedia 콘텐츠, 주석자 품질 및 기타 변수가 언어마다 다르므로 점수를 언어 간에 직접 비교해서는 안 된다.
Abstract
from arXiv · showhide
Confidently making progress on multilingual modeling requires challenging, trustworthy evaluations. We present TyDi QA---a question answering dataset covering 11 typologically diverse languages with 204K question-answer pairs. The languages of TyDi QA are diverse with regard to their typology---the set of linguistic features each language expresses---such that we expect models performing well on this set to generalize across a large number of the world's languages. We present a quantitative analysis of the data quality and example-level qualitative linguistic analyses of observed language phenomena that would not be found in English-only corpora. To provide a realistic information-seeking task and avoid priming effects, questions are written by people who want to know the answer, but don't know the answer yet, and the data is collected directly in each language without the use of translation.
1 서론
TyDi QA는 언어적 다양성과 현실적인 사용자 요구를 중심으로 설계한 대규모 정보 탐색 코퍼스를 도입해 신뢰할 수 있는 다국어 질의응답의 필요성에 대응한다. 언어 분석, 데이터 품질 평가, baseline modeling, 공개 벤치마킹을 통해 연구의 진전을 지원한다.
- 동기: TyDi QA는 많은 잠재적 QA 사용자가 영어를 사용하지 않으며 언어마다 유형론, 자원, 문자 체계, 띄어쓰기 관습이 크게 다르다는 문제에 대응한다.서론에서는 어순, reduplication, 형태통사론, 격, 복수성, 의문 표지, 관계화, 데이터 가용성, 표준화의 변이를 강조한다.
- 기여: TyDi QA는 model-free·translation-free 절차로 수집한 정보 탐색 질문-답변 쌍으로 구성된 최초의 공개 대규모 다국어 코퍼스를 제시한다.이 데이터셋은 영어를 넘어선 질의응답 연구를 지원하고 평가를 실제 사용자의 정보 요구에 맞추는 것을 목표로 한다.
- 동기와 목표: 이 벤치마크는 세계 상위 약 100개 언어를 대상으로 하며, 다양한 언어 현상과 데이터 시나리오에서 작동하는 모델을 장려한다.11개 언어를 포함하지만, 데이터셋은 매우 다양한 언어 현상과 데이터 시나리오를 포괄하는 것으로 설명된다.
- 기여: 이 논문은 유형론적 기술, gloss가 포함된 예시, 오픈소스 baseline, 그리고 다국어 modeling의 진전을 추적하기 위한 hidden test set 기반 공개 leaderboard를 제공한다.이러한 자원은 인위적으로 쉬운 데이터셋이 뒷받침할 수 있는 것보다 더 신뢰할 수 있는 결론과 함께 내재적·외재적 분석을 가능하게 하는 것을 목표로 한다.
2 과제 정의
TyDi QA는 passage selection과 minimal answer-span prediction을 통해 Wikipedia 문서의 내용을 사용해 질문에 답하도록 모델에 요구한다. 이 형식은 답이 어디에 나타나는지와 질문에 답할 수 있는지를 둘러싼 불확실성을 포착한다.
- TyDi QA는 Wikipedia 문서의 내용과 함께 질문을 제시하고 두 가지 예측을 요구한다.
- Passage selection은 질문에 답하는 passage의 인덱스를 반환하며, 어떤 passage도 질문에 답하지 않으면 NULL을 반환한다.
- Minimal answer span prediction은 최소 완전 답변의 byte indices를 반환하고, 답할 수 있는 yes/no 질문에는 YES 또는 NO를, 그 밖의 경우에는 NULL을 반환한다.
- 이 형식은 사용자가 답이 어디에 나타나는지 또는 자신의 질문에 답할 수 있는지를 모를 수 있다는 점을 반영한다.Figure 1은 질문-답변 쌍의 예를 보여준다.
3 데이터 수집 절차
TYDI QA는 답을 보지 못한 주석자에게 실제로 답을 알고 싶어 하는 질문을 작성하게 하고, 각 질문에 대한 Wikipedia 문서를 검색한 뒤 답변 문단, 최소 span 또는 답변 불가능성을 라벨링한다. 이 설계는 자연스러운 질문–답변 불일치를 보존하며, 많은 질문에 답이 없는 전체 문서를 대상으로 추론할 수 있게 한다.
- 질문 유도: 주석자는 답을 보지 않고 실제로 답을 알고 싶어 하는 질문을 작성하며, 영감을 얻기 위한 짧은 Wikipedia 프롬프트만 참고하고 프롬프트와 무관한 주제도 자유롭게 질문한다.이는 priming을 피하고 주석자가 관심 있는 주제에 대해 질문하도록 유도하며, 프롬프트 문서에서 다루지 않는 주제도 포함한다.
- 문서 검색: 각 질문은 해당 언어의 Wikipedia 도메인으로 제한한 Google 검색의 최상위 결과와 짝지으며, 언어별 atomic snapshot을 사용한다.다국어 텍스트에 대한 도전에 집중하기 위해 문서에서 표, 긴 목록, infobox를 제거했다.
- 답변 라벨링: 주석자는 가장 적절한 답변 문단을 선택하거나 답변 불가능성을 표시한 다음, 만족스러운 답변을 제공하는 가장 짧은 문자 span을 표시한다. 이상적으로는 1–3단어이며, boolean 질문에는 YES/NO를 사용한다.최소 답변 지침에는 추가 교육이 필요했으며, 주석자는 90%+의 정확도를 충족해야 했고, 편차를 줄이기 위해 반복 교육을 실시했다.
- 문서 검색: 질문의 46%–82%는 검색된 문서만으로 답할 수 없으며, 이는 답을 포함한 문단이 아니라 5K–30KB의 긴 문서를 사용하는 정보 탐색 환경을 반영한다.SQuAD 스타일 데이터셋과 달리 TYDI QA는 전체 문서를 제공하며 답이 존재한다고 보장하지 않는다.
- 품질 검증: Native-speaker checks를 통해 질문이 유창하고 프롬프트가 이미 답을 제시하지 않았음을 검증했으며, 수집 과정에서는 의견 질문과 대화형 질문을 배제했다.그 결과 얻은 답을 보지 않은 질문은 정보가 불충분할 수 있고, 답변과 어휘적 또는 형태통사적으로 불일치할 수 있다.
4 관련 연구
기존 multilingual QA dataset은 대체로 한두 개 언어만 다루거나 translation을 사용했으며, 다른 multilingual QA benchmark는 서로 다른 task formulation을 대상으로 했다. QA 연구는 generation, corpus retrieval, reading comprehension, expert-authored information verification을 비롯한 폭넓은 형식을 아우른다.
- Multilingual QA dataset: Multilingual QA benchmark는 question-like prompt에서 noun phrase를 retrieval하거나 속성을 설명하는 document span을 찾는 등 서로 다른 task도 다뤘다.XQA와 XCMRC는 noun-phrase retrieval을 위해 문법적으로 question-like한 prompt를 사용하며, Kenter et al.은 location과 같은 속성에 관한 정보를 제공하는 span을 찾는다.
- Multilingual QA dataset: 초기의 non-English multilingual QA dataset은 대체로 한두 개 언어만 다뤘으며, Chinese, Arabic, 그리고 translation된 French, Japanese, Korean, Italian resource가 이에 포함된다.여기에는 DuReader와 DRCD, translation된 SQuAD evaluation set, Korean SQuAD translation, semiautomatic Italian translation, ARCD가 포함된다.
- QA task formulation: Question answering은 단어 단위의 answer generation부터 전체 corpus에서 answer를 찾는 것까지 다양한 형식을 포괄한다.예로는 generative QA, TREC, DrQA가 있다.
- QA task formulation: 또 다른 QA paradigm은 신중하게 작성된 trivia 또는 reading-comprehension question과 의도된 정답을 통해 전문가의 지식을 검증한다.이러한 information-verifying framing에는 TriviaQA, Quizbowl/Jeopardy!, NewsQA, CoQA, RACE가 포함되며, 후속 연구는 어려운 example이나 특정 answer type을 강조했다.
5 유형론적 다양성
TyDi QA는 유형론적 다양성과 데이터 다양성을 중시하며, 번역 의존적 모델링에 도전이 되는 언어학적·자원 특성을 지닌 여러 어족의 언어를 선정한다. 데이터셋에는 풍부한 형태론, 유연하거나 비구성적 통사론, 다양한 문자 체계, 일관되지 않은 띄어쓰기 등의 현상이 포함되어 있어, 문자열 매칭처럼 겉보기에는 단순한 작업도 어렵게 만든다.
- 언어 선정: TyDi QA는 여러 어족에 걸친 유형론적 다양성과 제한적인 단일언어 또는 병렬 데이터 같은 데이터 특성을 기준으로 언어를 선정하여, 고품질 기계 번역에 대한 의존을 줄인다.이 선정은 서로 다른 언어적 장치를 포괄하고, 대규모 병렬 데이터 생산에 대한 경제적 유인이 제한적인 언어를 포함하는 것을 목표로 한다.
- 언어 예시: 데이터셋은 또한 아랍어의 어근-패턴 형태론과 접어, 인도네시아어의 중첩과 접사화, Kiswahili의 접두사 일치와 주어 생략을 비롯해 다양한 단어 형성과 문법적 부호화를 보여준다.이 언어들은 굴절, 파생, 수, 인칭, 의미 관계가 표현되는 방식의 다양성을 보여준다.
- 언어 예시: 11개 언어는 핀란드어의 광범위한 굴절, 일본어의 조사와 문말 동사, 한국어의 격과 경어 체계, 태국어의 분석적 구조를 비롯해 다양한 형태론적·통사론적 체계를 포괄한다.핀란드어 명사는 일반적으로 약 140개의 형태를 가지며 동사는 약 260개의 형태를 가진다. 한국어의 명사 조사는 최대 15개의 격을 표현한다.
- 언어 예시: Figure 2는 질의-응답 예시에서 핀란드어의 합성, 속격 및 복수 굴절, 자음 교체가 상호작용하는 모습을 보여준다.이 예시는 합성어 내부의 굴절형과 독립적으로 사용된 주격 응답 형태를 대조한다.
- 모델링 과제: 핀란드어, 러시아어, 아랍어의 예시는 형태음운론적 교체, 합성, 철자 변이, 발음 구별 부호 표기, 공백, 성 변이가 영어에서는 사소한 문자열 매칭을 복잡하게 만든다는 점을 보여준다.아랍어 예시에는 이름 철자의 변이, 선택적 발음 구별 부호 표기, 일관되지 않은 공백, 성 변이가 포함되며, Figure 3은 사소하지 않은 러시아어 굴절 변화를 제시한다.
6 정량적 분석
TyDi QA는 277K개의 annotation으로 뒷받침되는 204K개의 예제로 구성되며, 영어 의문사 분포가 균형적이고 질문 유도 및 annotation 절차가 신뢰할 수 있는 데이터를 산출한다는 근거를 제공한다. 오류 분석에서는 false-positive NULL 판정과 모호성으로 인한 최소 답변 오류가 중요한 잔여 문제로 확인된다.
- 데이터셋 규모: 204K개의 예제는 단방향 학습 annotation 166K개와 3-way 개발/테스트 예제 37K개로 구성되며, 총 277K개의 annotation에 해당한다.이 합계는 Table 4에 보고되어 있다.
- 질문 유형: TyDi QA의 영어 개발 데이터는 SQuAD보다 의문사 분포가 더 균형적이다.이 비교는 Table 2에 제시되어 있으며, 의문사가 문맥에 따라 다르게 기능하기 때문에 언어 간 의문사 비교는 어렵다.
- 프로토콜 준수: 100쌍의 표본에서 모든 질문은 프롬프트와 1–2개의 단어가 겹쳤고, 프롬프트만으로 답할 수 있는 질문은 없었으며, 제외된 프롬프트는 질문–답변의 어휘 중복을 줄였다.중복은 대체로 관심 대상인 개체 또는 단어와 관련되었으며, 해당 프롬프트는 최종 데이터셋에서 제외되었다.
- Annotation 품질: 핀란드어와 러시아어 개발 세트 200쌍에 대한 전문가 판정에서 높은 annotation 정확도가 확인되었으며, 이는 TyDi QA가 multilingual question-answering 모델을 평가하는 신호로 활용될 수 있음을 뒷받침한다.전문가들은 문서의 답변 가능성, 3개의 passage-answer annotation, 그리고 최소 답변의 정확성을 평가했다.
- 오류 분석: NULL 관련 오류는 문서 길이 전반에서 전적으로 false positive였지만, 최소 답변 오류는 여러 날짜가 그럴듯해 보일 때 자주 발생했다.3개의 답변 annotation을 사용하면 NULL 오류를 대부분 완화할 수 있지만, 문서 길이 외에도 matching 난이도나 미묘함이 다른 가능한 원인으로 남는다.
7 평가
TYDI QA는 주로 언어별 macro-averaged F1을 사용해 passage selection과 minimal-answer prediction을 평가하며, NULL answer와 partial span overlap은 별도로 처리한다. mBERT는 비관적인 human estimate보다 여전히 크게 낮은 성능을 보이며, 언어 간 score를 직접 비교해서는 안 된다.
- 7.1 평가: TYDI QA의 primary measure는 F1이며, 각 언어에서 precision과 recall을 계산한 뒤 English가 아닌 언어들에 대해 macro-averaged한다.English measurement는 task 자체의 목표라기보다 주로 debugging aid로 취급된다.
- 7.1 평가: NULL consensus에는 threshold를 적용해, answerable question의 불균형을 이용하여 항상 NULL을 예측하는 것을 방지한다.NULL-consensus question의 passage-selection answer는 annotator가 선택한 passage 중 하나와 일치하면 credit을 받으며, precision과 recall의 denominator는 consensus와 prediction status에 따라 달라진다.
- 7.1 평가: Minimal answer에 대해 system은 NULL, YES, NO 또는 contiguous answer span을 예측하며, 겹치는 span에는 partial credit을 받고 annotator가 뒷받침한 YES/NO answer에는 full credit을 받는다.Non-NULL prediction은 consensus가 non-NULL일 때만 credit을 받는다.
- 7.2 Human performance: Human performance는 하나의 annotation을 hold out하고 나머지 두 annotation에 대해 bootstrap resampling으로 평가해 추정하며, annotator가 불일치할 때 그 estimate는 비관적이 된다.저자들은 여러 answer가 모두 정답일 수 있으므로 이러한 불일치 기반 estimate가 human performance를 과소평가할 수 있다고 지적한다.
- 7.3 Baselines and results: mBERT는 모든 언어에서 human performance의 낮은 estimate보다 large performance gap만큼 낮은 성능을 보이며, 결과는 Table 5에서 first-passage 및 human baseline과 함께 보고된다.mBERT model은 모든 언어에 대해 jointly train되며, first-passage system은 학습되지 않은 baseline이다.
- 7.3 Baselines and results: Question set, Wikipedia coverage, annotation quality 및 기타 조건이 언어마다 다르므로 score를 언어 간에 직접 비교해서는 안 된다.저자들은 이러한 차이를 직접 다루는 것이 multilingual problem space의 중요한 측면을 드러낸다고 주장한다.
8 Gold passage: 단순화된 과제
단순화된 GOLDP 과제는 SQuAD 스타일 평가와의 호환성을 위해 gold passage를 제공하지만, TYDI QA는 영어만 사용하는 zero-shot transfer에서도 상당히 낮은 lexical overlap과 매우 낮은 F1을 유지한다.
- 과제 설계: GOLDP는 gold answer passage만 제공하고, 답변 불가능한 질문을 제외하며, SQuAD 1.1 metrics를 사용하고, 제한적인 공백이 기존 도구를 방해하므로 태국어와 일본어를 제거한다.이 과제는 선행 연구와 직접 비교하고 SQuAD, XQuAD, MLQA code와 호환되도록 설계되었다.
- Lexical overlap: TYDI QA는 모든 언어에서 MLQA와 XQuAD보다 상당히 낮은 question-answer lexical overlap을 보인다.Overlap은 100개의 최빈 tokens를 제외하고, 200-character answer window와 공유되는 tokens를 사용해 측정한다.
- 결과: mBERT를 다국어 TYDIQA-GOLDP data에 공동 fine-tuning할 때에도, 긴 article과 답변 불가능한 질문을 제거했음에도 매우 낮은 F1 scores가 지속된다.단순화된 설정에서도 여전히 개선의 여지가 상당히 남아 있다.
- 결과: 영어만 사용하는 SQuAD fine-tuning에서도 매우 낮은 TYDIQA-GOLDP zero-shot F1이 산출되며, 이는 Artetxe et al. (2019)이 보고한 XQuAD results보다 다소 낮다.영어 성능은 유의하게 더 낮으며, 이는 SQuAD question-answer style이 이 과제로 잘 transfer되지 않음을 나타낸다.
9 권고 및 향후 연구
저자들은 다국어 QA 현상, 전이와 번역, zero-shot 평가, 더 심층적인 언어학적 분석에 대한 연구를 제안한다. 또한 신뢰할 수 있는 번역을 위해 저자원이 부족한 언어에는 문어 답변과 병렬 데이터가 모두 부족할 수 있음을 지적하며 호환 가능한 데이터셋을 요청한다.
- 연구 방향: 향후 연구에서는 형태론–질문-답변 일치, transfer learning, 증강 및 런타임 QA를 위한 machine translation, 그리고 제외된 언어를 대상으로 한 zero-shot QA를 다뤄야 한다.이러한 방향은 데이터 가용성의 차이와 언어적 난제를 다룬다.
- 데이터 이해: 전 세계 언어에서 관찰되는 현상의 전체적 다양성에 적합한 modeling 기법을 식별하려면 더 심층적인 언어학적 분석이 필요하다.저자들은 데이터 자체에 대한 더 깊은 이해가 핵심이라고 주장한다.
- 데이터셋 확장: 저자들은 추가 언어를 위한 호환 가능한 데이터셋을 요청한다. 단일 연구만으로는 전 세계 언어를 포괄할 수 없기 때문이며, Universal Dependencies treebank의 폭넓은 범위를 공동체의 잠재력을 보여주는 근거로 제시한다.저자들은 Universal Dependencies treebank가 70개가 넘는 언어를 포함했다고 지적한다.
- 저자원 언어: 많은 언어에는 질문에 답하는 데 필요한 문어 자료가 부족하므로, 신뢰할 수 있는 번역 시스템을 위한 병렬 데이터가 제한적이더라도 언어 간 검색과 번역이 필요하다.이는 저자원 언어에서 특히 어려운 문제를 만든다. 이러한 언어에서는 병렬 데이터도 계속 부족할 가능성이 높다.
10 결론
결론은 유형론적으로 다양한 데이터셋에 대한 질의응답이 다국어 모델에 도전적이고 신뢰할 수 있는 평가를 제공하며, 그 진전이 세계의 언어 전반으로 일반화될 수 있다고 주장한다. 또한 기계 번역이 유망한 연구 방향일 수 있으므로 저자들이 자동 번역을 공개하지 않는다고 설명한다.
- 10 결론: 유형론적으로 다양한 언어에 대한 질의응답은 그 진전이 세계의 언어적 현상 전반으로 일반화될 가능성이 더 높은 도전적이고 신뢰할 수 있는 평가로 제시된다.저자들은 번역에 기반한 데이터 수집을 피하고 다국어 모델링을 사용하는 것이 표본 추출 위험을 완화한다고 주장하지만, 제공된 본문은 그 위험을 구체적으로 설명하기 전에 잘려 있다.
- 10 결론: 저자들은 기계 번역이 TyDi QA를 위한 유망한 연구 방향일 수 있으므로 자동 번역을 공개하지 않는다.번역이 과거에 다국어 데이터셋을 둘러싼 혁신을 가로막았다고 설명한다.
- 10 결론: 저자들은 요청이 있으면 주석 프로토콜을 공유할 예정이다.