Source-linked AI summary

Tangut Word Segmentation under Extreme Resource Scarcity: Integrating Traditional Lexicons and Unlabeled Text

Lifan Deng, Yongwei Zhang, Sen Sun, Bojun Sun, Jingsong Yu

arXiv:2608.18437v1cs.CL

TL;DR

Tangut 단어 분할은 명시적인 경계 표지가 없고 전문가 주석에 큰 비용이 들어 제약을 받는다. 본 연구는 전문가 라벨, 전통 lexicon, 말뭉치 통계, 비라벨 텍스트 사전학습을 하나의 framework로 결합하며, TangutEncoder는 평균 F1 0.911과 source 내 평가에서 OOV recall 최고 성능을 달성한다.

  • 문제

    Tangut의 표시되지 않은 단어 경계와 높은 주석 장벽 때문에, 후속 언어 분석에 중요함에도 자동 분할 연구는 충분히 이루어지지 않았다.

  • 방법

    이 framework는 BIES supervision, 신뢰도 보정 lexicon lattice, 명시적 분포 통계, 경량 character-level MLM pretraining을 BIES–CRF framework 안에서 결합한다.

  • 결과

    TangutEncoder는 source 내 line-level 평가에서 평균 F1 (0.911)과 OOV recall 최고 성능을 보이는 반면, 종교 텍스트에서는 CRF가 더 강하다.

  • 시사점 및 한계

    본 연구는 불교 및 세속 텍스트 전반의 자동 Tangut 단어 분할을 위한 초기 source 내 baseline을 확립한다.

  • 시사점 및 한계

    말뭉치가 작고 장르 불균형이 있으며 두 작품으로 제한되어 있어, 본 평가는 보지 못한 문서로의 transfer를 확립하지 않는다.

Abstract

from arXiv · show

Tangut is an extinct language whose script does not explicitly mark word boundaries. We present the first systematic study of Tangut word segmentation using 2,750 expert-annotated segments(31,893 tokens), traditional lexicons, and unlabeled text. Our framework combines a reliability-calibrated lexicon-lattice representation, explicit distributional statistics, and a lightweight character encoder pretrained with MLM. Segment-level five-fold cross-validation shows that lexical and statistical features raise CRF F1 to approximately 0.91. The full TangutEncoder reaches the highest mean F1 (0.911) and improves recall beyond the labeled training vocabulary. These results demonstrate generalization beyond the limited supervised vocabulary across thematically diverse held-out passages, while document-level transfer remains to be evaluated.

1 서론

이 논문은 Tangut 단어 분절에 관한 최초의 체계적 연구를 제시하며, 어휘 통합과 비라벨 텍스트 학습을 통해 표시되지 않은 단어 경계와 부족한 전문가 주석 문제를 다룬다. segment-level five-fold cross-validation에서 두 complete system 모두 0.90 F1을 넘었고, TangutEncoder가 가장 높은 평균 점수와 OOV recall을 달성했다.

  • 동기: 이 연구는 표시되지 않은 Tangut 단어 경계를 다룬다. 이러한 특성 때문에 어휘 검색, 빈도 분석, POS tagging, alignment, translation을 위해 분절이 필요하다.따라서 OCR과 전사는 분절되지 않은 문자열을 생성한다.
  • 데이터와 과제: 전문가 주석 말뭉치는 높은 주석 장벽에도 불구하고 불교 경전과 세속 백과사전 저작 Leilin에서 추출한 2,750개의 텍스트 segment와 31,893개의 word token으로 구성된다.경계 주석에는 문맥, 음운 재구, 번역문, 전통 사전을 함께 검토할 수 있는 전문가가 필요하다.
  • 접근법: 이 framework는 BIES supervision, 중첩된 사전 후보를 보존하는 reliability-calibrated lexicon lattice, 말뭉치 통계, static character embedding, MLM pretraining을 통합한다.이 연구는 이러한 비라벨 텍스트 신호를 체계적으로 비교하고 경량 TangutEncoder를 개발한다.
  • 결과: segment-level five-fold cross-validation에서 두 complete system 모두 0.90 F1을 넘었고, TangutEncoder가 가장 높은 평균 점수와 OOV recall을 달성했다.TangutEncoder는 사전에 단어 경계를 가정하지 않고 문맥적 문자 표현을 학습한다.
  • 기여: 이 논문은 불교 텍스트와 세속 텍스트에 대한 source 내부 평가 baseline을 수립하고, 검색, POS tagging, alignment, machine translation 및 관련 디지털 연구를 위한 word-level 기반을 제공한다.저자들이 아는 한, 자동 Tangut 단어 분절에 관한 최초의 체계적 연구를 제시한다.

2 관련 연구

기존 분절 연구는 명시적 구분자가 없는 여러 문자 체계에서 시퀀스 예측과 렉시콘 강화 방법을 활용해 왔으며, 저자원 및 역사 언어 연구는 심각한 데이터 제약을 다룬다. 탕구트 정보 처리는 주로 디지털 인프라에 집중되어 자동 단어 경계 식별과 문맥 표현은 충분히 탐구되지 않았다.

  • 명시적 구분자가 없는 단어 분절: 중국어, 티베트어, 미얀마어를 포함해 일관된 단어 구분자가 없는 문자 체계에서는 시퀀스 예측이 일반적인 정식화다.기존 연구로는 중국어의 BIES 방식 태깅과 CRFs, 티베트어의 음절 수준 CRFs, 미얀마어의 최장 일치법 이 있다.
  • 렉시콘 강화 분절: 렉시콘은 CRF 특징, 부분 주석, 수동 분절, 신경 렉시컬 표현, 후보 어텐션, 보조 BIES 예측을 통해 통합되어 왔다.이러한 접근법은 지도학습, 도메인 적응, 문서화, 비라벨 텍스트 환경 전반에 걸쳐 렉시컬 정보를 통합한다 (Peng et al., 2004; Liu et al., 2014; Okabe et al., 2022; Zhang et al., 2018; Higashiyama et al., 2019, 2020).
  • 저자원 및 역사 언어 분절: 저자원 및 역사 언어 분절 연구는 제한된 주석, 텍스트, 도구, 사전학습 모델, 지원이라는 제약에 직면하며, 사전 기반 약한 감독이 이를 부분적으로 보완한다.이러한 제약은 특히 중국티베트어족 언어에서 두드러지며 (Nigatu et al., 2024), 역사 언어 연구에서는 아카드어에 대해 규칙 기반, 렉시컬, 통계적, 학습 기반 방법을 비교한다 (Homburg and ...).
  • 탕구트 정보 처리: 탕구트 연구는 주로 디지털 인프라, 인식, 데이터베이스, 필사본 분석, 번역에 초점을 맞춰 왔으며, 자동 단어 경계 식별과 문맥 표현은 여전히 대부분 탐구되지 않았다.본 연구는 전문가 주석, 전통 렉시콘, 비라벨 텍스트를 활용해 이러한 공백을 다룬다.

3 과제 정의 및 데이터

Tangut 단어 분할은 문자 수준 BIES 라벨링과 정확한 span 기반 평가로 정식화된다. 데이터셋은 전문가가 검토한 불교 및 세속 텍스트, 구조화된 lexicon, 별도의 비라벨 자료를 결합하며, 해당 자료의 coverage는 넓지만 불확실하다.

  • 과제 정의: Tangut 분할에서는 각 문자에 BIES 라벨을 할당하고, 주석된 단어 경계와의 exact matching으로 예측을 평가한다.B, I, E는 각각 여러 문자로 이루어진 단어의 시작, 내부, 끝을 나타내며, S는 한 문자 단어를 나타낸다.
  • 데이터 구축: 전문가 주석은 Tangut 전문가들이 문맥, 재구된 독음, 번역, 전통 lexicon을 활용해 불교 및 세속 텍스트 전반에 대해 독립적으로 작성한 뒤 공동 검토했다.말뭉치는 Mahāratnakūṭa-sūtra의 불교 경전과 백과사전식 저술인 Leilin의 세속 문헌으로 구성된다.
  • Lexicon: 처리된 lexicon은 19,290개의 다문자 후보를 산출하며, 이 중 두 문자 단어 17,082개가 후보의 88.6%를 차지한다.한 문자 항목은 제거하고 중복 형태는 통합했으며, 항목에는 단어 형태, 발음, 정의, 메타데이터가 유지된다.
  • Lexicon: 말뭉치 단어 토큰의 95.9%와 단어 유형의 83.1%가 lexicon에 기록되어 있지만, lexicon 항목 중 주석된 단어와 정확히 일치하는 것은 14.2%에 불과하다.추가로 항목의 23.3%는 말뭉치 부분 문자열로 나타나며, 76.7%는 전혀 나타나지 않아 불확실성을 고려한 lexical 처리가 필요하다.
  • 비라벨 데이터: 비라벨 데이터에는 663개 기록과 46개 제목 수준 단위에 걸쳐 약 318,000 Tangut characters가 포함되며, 세 문자 이상으로 이루어진 주석 세그먼트의 중복은 없다.주석 자료는 Mahāratnakūṭa-sūtra의 fascicle 68을 사용하며, 해당 fascicle은 비라벨 컬렉션에 포함되지 않는다.

4 계층형 프레임워크와 설정

이 프레임워크는 supervised BIES–CRF segmentation과 중첩 lexicon-lattice feature, 그리고 세 가지 unlabeled-text 지식인 distributional statistics, static character embeddings, contextual pretraining을 결합한다. 사전 증거의 reliability를 보정하고 out-of-fold 추정을 통해 leakage를 방지하며, fold-specific OOV recall을 사용해 라벨된 training vocabulary를 넘어선 generalization을 평가한다.

  • 계층형 프레임워크: Tangut segmentation은 supervised BIES tagging을 CRF decoding, lexical candidate features, unlabeled text에서 얻은 distributional knowledge와 결합한다.distributional layer는 corpus statistics, static character embeddings 또는 contextual pretraining을 사용하며, dictionary matching은 character-level BIES–CRF modeling의 주요 예외다.
  • Lexicon representation: 20-dimensional lexicon representation은 중첩된 dictionary span을 보존하고 11개의 position-and-length indicator를 reliability, unseen-entry prior, metadata feature와 결합한다.reliability는 beginning, internal, ending position별로 집계하며, metadata에는 semantic gloss, phonetic entry, book-title label을 기록하되 이를 결정론적 boundary로 취급하지 않는다.
  • Leakage control: Reliability feature는 out of fold 방식으로 생성되므로 각 training instance의 dictionary statistic에서 해당 instance 자체의 gold boundary information이 제외된다.각 outer training portion 내부에서 reliability는 추가적인 five-fold split을 사용해 추정하며, validation 및 test feature에는 전체 outer training portion에서 계산한 statistic을 사용한다.
  • Unlabeled-text knowledge: Unlabeled parallel text는 frequency, association strength, left- 및 right-neighbor entropy에 기반한 8개의 gap-level distributional feature를 제공하며, Char2Vec 및 TangutEncoder도 함께 사용한다.TangutEncoder는 각 Tangut character를 단일 token으로 취급하는 compact character-level BERT-style encoder다.
  • Evaluation setup: 라벨된 training의 OOV token 중 53.0%는 external lexicon에 포함되고, 34.8%는 unlabeled text에 나타나며, 24.8%는 어느 resource에도 나타나지 않는다.OOV는 현재 fold의 labeled training partition에 gold test word가 없다는 뜻이며, external lexicon이나 unlabeled corpus에 나타나는 경우도 포함한다.

5 결과

5-fold cross-validation에서 TangutEncoder는 전반적인 성능과 세속 텍스트 성능 모두에서 가장 우수했으며, lexical·distributional·contextual signal은 상호보완적인 향상을 보였다. 명시적 feature는 vocabulary coverage와 가장 작은 genre에서 특히 중요했고, corpus 및 neural method는 OOV generalization을 개선했다.

  • RQ1: linear CRF는 전반적으로 가장 강력한 supervised baseline이다. dictionary matching은 IV word를 인식하지만 generalization이 낮고, neural model은 전체 F1을 대가로 OOV recall을 높인다.random Transformer는 OOV recall이 가장 높지만 전체 F1은 가장 낮으며, 모든 학습 기반 baseline에서 religious text가 secular text보다 어렵다.
  • RQ2: BIE lattice feature는 가장 큰 lexical gain을 제공하며, reliability estimate는 precision과 IV recognition을 높이지만 OOV recall은 소폭 낮춘다.lattice는 coverage를 제공하고, reliability와 metadata는 dictionary entry와 corpus boundary 사이의 불일치를 조정한다.
  • RQ3: unlabeled-text statistic은 complete lexicon CRF를 개선하며, bigram frequency가 초기 향상에 가장 크게 기여하고 character association과 neighbor entropy가 상호보완적인 boundary evidence를 추가한다.향상은 IV 및 OOV recognition으로 확장되며 religious text에서 특히 뚜렷하다.
  • RQ4: MLM pretraining은 F1, OOV recall, religious-text performance를 크게 향상시키지만, Char2Vec의 소폭 하락은 cross-fold variation 범위에 머문다.이점은 static character embedding만 제공하는 것이 아니라 전체 contextual encoder를 학습하는 데서 비롯된다.
  • RQ5: complete lexicon representation을 TangutEncoder에 추가하면 IV 및 OOV recognition이 크게 향상되고, corpus statistic은 그보다 작은 추가 향상을 제공한다.MLM은 이용 가능한 local distributional information을 상당 부분 포착하지만 전부 포착하지는 못한다.
  • RQ5: TangutEncoder는 전체 및 secular-text F1과 OOV recall이 가장 높고, CRF는 전체 IV recall이 소폭 더 높으며 religious text에서 더 우수한 성능을 보인다.두 system은 상호보완적이다. contextual pretraining은 주로 labeled vocabulary를 넘어서는 generalization을 개선하고, explicit feature는 가장 작은 genre에서 안정적으로 유지된다.

6 POS Tagging으로의 예비 확장

예비 공동 segmentation-and-POS 실험에서는 BIES label을 boundary–POS label로 대체하고, 예측된 span이 정확히 일치하는 경우에만 tagging을 평가한다. 공동 CRF는 약 0.88 conditional POS accuracy를 달성했으며, lexical feature는 POS tagging보다 segmentation을 더 일관되게 개선한다. 다만 POS inventory가 수정 중이므로 결과는 여전히 예비적이다.

  • 방법: 이 실험은 boundary–POS label을 공동으로 예측하고, 예측 sequence를 word span과 POS label로 변환한 뒤, lexical feature 유무에 따라 CRF와 BiLSTM–CRF model에 이 formulation을 적용한다.공동 label에는 B-NOUN, E-NOUN과 같은 형식이 포함된다.
  • 결과: 공동 CRF는 예측된 span이 gold segmentation과 정확히 일치하는 word에서 약 0.88 conditional POS accuracy를 달성한다.이 평가는 boundary error와 POS-tagging error를 분리한다.
  • 결과: Lexical feature는 segmentation을 개선하지만 POS tagging에는 더 불안정하게 기여하며, 이는 dictionary evidence가 grammatical category보다 boundary에 더 많은 정보를 제공함을 시사한다.POS inventory가 Appendix A에서 여전히 수정 중이므로 결과는 예비적이다.

7 결론 및 향후 과제

이 연구는 전문가 주석, 전통 사전, 비라벨 텍스트를 통합된 BIES–CRF framework에서 결합해 Tangut 자동 단어 분할을 체계적으로 연구한 최초의 사례다. 저자들은 TangutEncoder의 가장 뛰어난 결과를 확인하고, 데이터·평가·자원·downstream 측면의 확장 계획을 제시한다.

  • 결론: 0.911 mean F1: 전체 TangutEncoder가 소스 내 line-level 평가에서 가장 높은 mean F1과 OOV recall을 달성한다.이 framework는 lexicon-lattice feature, corpus statistics, contextual MLM pretraining을 결합해 데이터 효율적인 경계 증거를 제공한다.
  • 향후 과제: 향후 연구에서는 문서·장르·역사적 시기에 걸쳐 전문가 주석을 확대하는 한편, 장르 균형, 문서 수준 평가, POS inventory, 주석 지침, 전문가 일관성 검사를 개선할 예정이다.이 계획은 더 넓은 범위의 포괄성과 더욱 명확하고 신뢰할 수 있는 주석 및 평가를 함께 다룬다.
  • 향후 과제: 저자들은 더 많은 주석 데이터를 통제된 방식으로 이용할 수 있도록 하고 code, model, preprocessing resource를 공개한 뒤, pretraining과 weak supervision을 위해 더 큰 corpus를 탐색할 계획이다.후속 연구에는 retrieval, lexical analysis, alignment, translation에서의 multi-seed 유의성 분석과 downstream 평가도 포함된다.

제한점

이 연구는 두 문헌에서 추출한 규모가 작고 장르 편중이 있는 corpus에 기반하며, 보지 못한 문서로의 transfer를 입증하지 못한다. 추가적인 제약으로는 공유되는 정형 표현, 제한적인 통계 검정, 제한된 corpus 공개, 잠정적인 POS inventory가 있다.

  • 제한점: corpus가 작고 장르 편중이 있으며 두 문헌으로 제한되어 평가의 폭을 제약한다.Leilin은 주제적으로 다양하지만, 평가는 보지 못한 문서로의 transfer를 입증하지 못한다.
  • 제한점: Leilin의 주제적 다양성에도 불구하고, 평가는 보지 못한 문서로의 transfer를 입증하지 못한다.Fascicle 68은 unlabeled collection에 포함되지 않으며, 긴 문자열의 overlap은 미미하다.
  • 제한점: 더 짧은 정형 표현은 불교 문헌 전반에서 공유되어 labeled 자료와 unlabeled 자료를 구분하는 힘을 제한한다.본문은 긴 문자열의 overlap은 미미하지만 더 짧은 정형 표현은 여전히 공유된다고 지적한다.
  • 제한점: 작은 model 차이는 multi-seed 또는 유의성 검정이 부족하며, data-use 제한으로 전체 corpus 공개가 불가능하고 POS inventory는 여전히 개정 중이다.OOV는 labeled training에 부재한 경우만을 가리킨다.

윤리적 고려 · A 코퍼스에 대한 추가 세부사항 · A.1 텍스트 자료와 구성

이 연구는 전문가가 주석한 Tangut 텍스트와 디지털화된 역사 자료 및 비라벨 자료를 결합하지만, 기관 및 데이터 이용 제한으로 전체 주석 코퍼스를 공개할 수 없다. 주석 자료는 종교 및 세속 문헌으로 구성되며, 레이아웃 기반 segment를 사용하므로 상당한 불균형을 고려한 장르별 평가가 필요하다.

  • 윤리적 고려: 기관 및 데이터 이용 제한으로 전체 주석 코퍼스는 공개할 수 없지만, 허용되는 공개 범위에서는 코드, 분할, 스크립트, 설정, 매니페스트, 지침, 메타데이터, 학습된 모델을 포함한 재현성 자료를 제공한다.허용되는 경우 계획된 공개에는 예시와 체크섬도 포함된다.
  • A.1 텍스트 자료와 구성: 주석 코퍼스는 두 Tangut 문헌을 바탕으로 한다. 종교 텍스트에는 Mahāratnakūṭa Sūtra의 fascicle 68을, 세속 이야기에는 중국어에서 번역된 Leilin을 사용한다.자료 위치 식별자는 주석자들이 사용한 판본과 목록 기록까지의 추적 가능성을 보존한다.
  • A.1 텍스트 자료와 구성: segment는 주로 위치 식별자가 있는 단일 세로 열에 대응하며, 열을 가로지르는 어휘적 연속성을 보존하기 위해 필요한 경우 경계를 조정했다.이는 현대 구두점으로 정의한 문장이 아니라 레이아웃 기반 텍스트 segment다.
  • A.1 텍스트 자료와 구성: segment의 약 8.5%와 token의 11.6%는 종교 텍스트에서 나오며, 나머지는 Leilin이 제공하므로 장르별 평가가 필요하다.따라서 두 주석 자료 사이에는 상당한 불균형이 존재한다.
  • A.1 텍스트 자료와 구성: 비라벨 코퍼스는 7개 문헌의 46개 제목 단위에 걸친 663개의 page-image record와 약 318,000자의 Tangut 문자로 구성된다.이는 러시아 소장 문헌에 기반한 디지털화된 4행 번역 자료에서 Tangut 행을 추출해 구축했다.
  • A.1 텍스트 자료와 구성: Mahāratnakūṭa-sūtra는 가장 큰 비라벨 자료로, 38개의 fascicle-level 제목에 걸쳐 269,149자를 제공하며 코퍼스의 84.6%를 차지한다.제공된 본문은 이 record들이 모두 동일한 자료 범주에 속하지는 않는다고 언급하지만, 마지막 절은 잘려 있다.
  • A.1 텍스트 자료와 구성: 비라벨 코퍼스에서는 원래의 Tangut 텍스트만 사용해 distributional feature를 계산하고 Char2Vec과 TangutEncoder를 학습한다.이는 modeling pipeline에서 비라벨 데이터의 역할을 명확히 한다.

A.2 중첩 및 OOV-커버리지 감사 … B.1 선형 CRF

이 감사는 주석이 달린 Tangut 텍스트와 비라벨 Tangut 텍스트 사이의 중첩 및 OOV 커버리지를 특성화하며, 부록에서는 주석 라벨과 표준화된 모델 학습 설정을 기록한다. 선형 CRF는 공유 최적화 조건에서 국소 문자 feature와 lexicon-lattice 및 말뭉치 통계 feature를 결합한다.

  • A.2 중첩 및 OOV-커버리지 감사: 정규화 후 정확히 일치하는 주석-비라벨 항목은 Five exact annotated–unlabeled matches만 남았으며, 모두 한 문자 또는 두 문자 fragment이고, 세 문자 이상으로 중복되는 주석 segment는 없었다.Token-level n-gram overlap은 주석이 달린 n-gram occurrence 중 그 character string이 비라벨 collection 어디에든 나타나는 비율로 정의된다.
  • A.2 중첩 및 OOV-커버리지 감사: labeled-training OOV token의 53.0%는 external lexicon으로 커버되고, 34.8%는 비라벨 corpus substring으로 나타나며, 12.6%는 양쪽 모두에 나타나고, 24.8%는 어느 쪽에도 나타나지 않는다.이 범주들은 OOV-R이 모든 system component에서 보이지 않는 형태가 아니라 supervised vocabulary를 넘어선 generalization을 측정한다는 점을 보여준다.
  • A.3 주석 예시: corpus format은 raw line에서 space를 제거하고, expert word boundaries를 vertical bar로 표시하며, slash 뒤에 linguistic label을 덧붙인다.종교적 예시와 세속적 예시가 이 표상을 보여준다.
  • A.4 POS 및 형태통사적 라벨: 정규화된 expert-annotation inventory에는 통상적인 품사와 더 세밀한 형태통사적 구분을 아우르는 36 labels가 포함된다.빈번한 범주로는 명사, 동사, 형용사, 부사, 후치사·전치사, 접속사, 대명사, 수사, 수량사, particle 또는 auxiliary가 있으며, 문법적 기능, 상, 방향, 인칭, 수를 나타내는 label도 포함된다.
  • A.4 POS 및 형태통사적 라벨: POS experiments are preliminary한데, 세분화된 inventory가 여전히 전문가 검토 중이며 lexical class와 형태통사적 기능을 결합하기 때문이다.실험에서는 새로 설계한 tagset으로 통합하지 않고 원래의 구분을 유지한다.
  • B 모델 및 학습 파라미터: 달리 명시하지 않는 한 모든 model은 동일한 data partition과 BIES tag set을 사용하며, base random seed는 42이고 deterministic CuDNN execution을 활성화한다.이 설정은 각 training environment 내부에 적용된다.
  • B.1 선형 CRF: linear CRF는 L-BFGS를 사용하며, 그 variant들은 optimization parameter를 공유하고 포함하는 external feature group만 다르다.local template은 현재 문자, 이웃 문자와 인접 bigram 문자, character-type indicator, single-character word indicator를 사용하며, lexicon-lattice 및 corpus-statistical feature는 실수값 추가 항목이다.

B.2 BiLSTM–CRF … C.1 문자 결합도 척도 비교

실험 설정 전반에서 BiLSTM–CRF는 보조 비교 모델로 다뤄지며, Transformer 변형들은 통제된 아키텍처를 공유하고 초기화 방식만 다르다. 문자 결합도 실험에서는 엔트로피가 없을 때 dPMI가 근소한 우위를 보이지만, 엔트로피를 추가하면 척도들의 성능이 거의 동등해지고 상호보완적인 경계 근거를 제공한다.

  • B.2 BiLSTM–CRF: 예비 탐색에서 100차원 임베딩과 총 hidden size 64를 사용하는 2층 BiLSTM이 관찰된 분할 F1 최고값을 달성했으며, batch size 512가 32보다 근소하게 우수했다.탐색에는 외부 outer cross-validation에서 고정한 80/10/10 분할이 사용되었으므로, BiLSTM은 주된 모델 선택 주장을 뒷받침하는 증거라기보다 보조 아키텍처 비교로 남는다.
  • B.2 BiLSTM–CRF: 선택된 BiLSTM–CRF는 학습 가능한 100차원 문자 임베딩, 방향당 32 units를 사용하는 2층 bidirectional LSTM, 그리고 네 개의 BIES score에 대한 CRF decoding을 사용한다.외부 feature는 BiLSTM 앞에서 연결되며, 주요 lexicon-enhanced model은 dictionary dropout 0.2를 적용한 20차원 reliability-calibrated dictionary representation을 사용한다.
  • B.3 Transformer–CRF 변형: Transformer-Random, Transformer-Char2Vec, TangutEncoder는 동일한 Transformer–CRF 아키텍처를 공유하며 parameter initialization만 다르다.TangutEncoder는 masked-language-model pretraining에서 모든 encoder parameter를 불러오는 반면, Transformer-Char2Vec은 static Skip-gram vector로 character embedding을 초기화한다.
  • B.3 Transformer–CRF 변형: Transformer encoder는 pre-normalized layer 3개, hidden size 192, attention head 4개, 768차원 feed-forward layer, 그리고 최대 128자 시퀀스를 위한 learned position을 갖는다.출력은 네 개의 BIES score로 매핑되고 CRF로 decoding된다.
  • B.3 Transformer–CRF 변형: TangutEncoder는 약 15%의 마스킹 위치, 단일 문자와 두-네 문자 span masking의 균형, lexicon-and-corpus vocabulary를 활용한 문자 수준 masked-language-model 사전학습을 수행한다.모든 Transformer 변형은 공동 fine-tuning에 앞서 세 epoch 동안 encoder를 고정한다. random 및 Char2Vec 모델은 독립적으로 최적화한 scratch 상한이 아니라 초기화 대조군이다.
  • C.1 문자 결합도 척도 비교: 이 연구는 인접 문자 쌍에 대해 discounted PMI, Dice, t-score를 비교하며, 각각 빈도 할인을 적용한 positive association, 정규화된 overlap, standardized observed-versus-expected cooccurrence를 포착한다.Dice는 0과 1 사이로 제한되는 반면, t-score는 negative evidence를 보존할 수 있고 더 높은 absolute frequency가 뒷받침하는 association을 선호한다.
  • C.1 문자 결합도 척도 비교: neighbor entropy를 추가하면 dPMI, Dice, t-score의 성능이 거의 동일하게 수렴하므로, 실험에서는 통계적으로 의미 있는 우승자를 확립하지 못한다.entropy가 없을 때는 특히 OOV word에서 dPMI가 근소하게 더 우수하며, 그 frequency discount가 많은 low-count observation에 적합하기 때문에 주요 실험에는 dPMI를 유지한다.
  • C.1 문자 결합도 척도 비교: neighbor entropy는 잠재적 word boundary와 연결된 contextual diversity로 cohesion estimate를 보완하여 association-based segmentation을 일관되게 향상한다.Association measure는 인접 문자가 cohesive unit을 이루는지를 평가하는 반면, entropy는 문자가 서로 다른 많은 neighbor와 자유롭게 나타나는지를 반영한다.

C.2 추가 모델 변형 · C.3 사전 인식 연속 사전학습

추가 변형은 어휘 범위에 신뢰도 인식 통합이 필요함을 보이며, 사전 인식 연속 사전학습은 canonical MLM보다 downstream 이점을 추가하지 않는다. 내부 lattice와 장르 feature는 조건에 따라 더 작은 이득을 제공하는 반면, MLM 사전학습은 lexicon representation과 상호보완적이다.

  • C.2 추가 모델 변형: 학습 어휘와의 일치는 강한 IV recall을 보이지만 어휘 외 recall은 약한 반면, 외부 사전은 precision과 IV recall을 희생하여 OOV recall을 높인다.말뭉치 경계와의 불일치는 더 넓은 어휘 범위에만 의존하기보다 집계된 lattice representation과 신뢰도 보정을 사용해야 할 근거가 된다.
  • C.2 추가 모델 변형: 이전 BIE lattice에 candidate count를 추가하면 BIE만 사용한 경우의 0.897에 비해 F1 0.898이 되며, 최대 candidate 길이 feature를 사용하면 F1 0.897이 된다.이 실험은 이전 lattice 설계에서 대안적인 CRF lattice feature를 비교한다.
  • C.2 추가 모델 변형: 내부 lattice는 11차원 BIE-by-length 방식으로 말뭉치에서 도출된 다중 문자 단어를 인코딩하며, gold boundary가 노출되지 않도록 inner out-of-fold estimation을 사용한다.주석 말뭉치에서 직접 도출되므로 그 항목에는 신뢰도 점수가 없으며, 외부 및 내부 candidate vector는 각 문자 위치에서 평균을 낸다.
  • C.2 추가 모델 변형: BIE lattice는 BiLSTM–CRF의 어휘적 성능 향상을 가장 크게 만들고, 그다음은 신뢰도 추정과 미관측 항목 prior이며, 내부 lattice와 domain feature는 더 작은 상호보완적 향상을 추가한다.내부 lattice는 전통 사전에 없는 말뭉치 특화 단어를 복원하며, domain feature는 장르 선호를 모델링한다.
  • C.2 추가 모델 변형: 내부 lattice와 domain feature는 OOV recall을 포함해 종교 텍스트 성능도 향상시키지만, 학습 데이터를 지배하는 세속 텍스트에서 이득이 더 안정적이다.추론 시 문서 장르가 필요하므로 domain feature는 장르 독립 모델의 일부가 아닌 보조 변형으로 남는다.
  • C.2 추가 모델 변형: Lexicon injection은 무작위 초기화 Transformer의 성능을 향상시키지만 MLM-pretrained TangutEncoder에는 여전히 미치지 못하며, MLM과 lexicon feature를 결합하면 어느 한 소스만 사용하는 것보다 강하다.이는 사전 지식이 contextual pretraining을 대체하기보다 보완함을 보여준다.
  • C.3 사전 인식 연속 사전학습: 사전 인식 연속 사전학습은 structured lexicon과 개정 Tongyin에서 가져온 사전 구간을 positive로 사용하고, 이를 다섯 개의 표본 추출된 비사전 negative와 대조하며, ranking loss와 MLM을 결합한다.학습에는 최대 3,000 step 동안 λword = 0.3과 500-step warmup을 사용하며, segmentation transfer 전에 span head를 폐기한다.
  • C.3 사전 인식 연속 사전학습: 보조 lexicon-ranking objective는 전체 F1이나 OOV recall에서 canonical MLM보다 향상을 보이지 않으므로, 예비 appendix 실험으로만 보고한다.두 encoder는 downstream evaluation에서 동일한 사전과 distributional feature를 사용한다.
Loading 2608.18437v1…