Source-linked AI summary
HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models
Junyi Li, Xiaoxue Cheng, Wayne Xin Zhao, Jian-Yun Nie, Ji-Rong Wen
TL;DR
LLM은 검증할 수 없거나 출처와 충돌하는 hallucination을 생성할 수 있지만, 그 발생 비율과 식별 가능성은 여전히 불분명하다. HaluEval은 대규모 benchmark를 통해 이를 다루며, ChatGPT 응답의 약 19.5%에서 hallucination이 발생하고 LLM이 이러한 내용을 탐지하는 데 어려움을 겪는다는 결과를 제시한다.
문제
배포에 따른 위험에도 불구하고 LLM hallucination의 발생 비율과 유형, 그리고 LLM이 이를 식별하는 능력은 여전히 불분명하다.
방법
HaluEval은 sampling-then-filtering을 결합해 식별하기 어려운 hallucinated sample을 생성하고, ChatGPT 응답을 사람이 annotation한다.
결과
ChatGPT 응답의 약 19.5%가 조작된 검증 불가능한 정보를 포함하며, 기존 LLM은 hallucination을 식별하는 데 어려움을 겪는다.
시사점 및 한계
HaluEval은 hallucination 식별에 대한 체계적 분석을 지원하며, 명시적 지식과 중간 추론이 LLM의 탐지 성능을 향상할 수 있음을 시사한다.
시사점 및 한계
benchmark의 hallucinated sample 품질은 ChatGPT가 복잡한 생성 지시를 따르는 능력에 의해 제한되며, hallucination의 원인은 조사하지 않는다.
Abstract
from arXiv · showhide
Large language models (LLMs), such as ChatGPT, are prone to generate hallucinations, i.e., content that conflicts with the source or cannot be verified by the factual knowledge. To understand what types of content and to which extent LLMs are apt to hallucinate, we introduce the Hallucination Evaluation benchmark for Large Language Models (HaluEval), a large collection of generated and human-annotated hallucinated samples for evaluating the performance of LLMs in recognizing hallucination. To generate these samples, we propose a ChatGPT-based two-step framework, i.e., sampling-then-filtering. Besides, we also hire some human labelers to annotate the hallucinations in ChatGPT responses. The empirical results suggest that ChatGPT is likely to generate hallucinated content in specific topics by fabricating unverifiable information (i.e., about $19.5\%$ responses). Moreover, existing LLMs face great challenges in recognizing the hallucinations in texts. However, our experiments also prove that providing external knowledge or adding reasoning steps can help LLMs recognize hallucinations. Our benchmark can be accessed at https://github.com/RUCAIBox/HaluEval.
1 서론
HaluEval은 일반 사용자 질의와 세 가지 과제별 설정을 아우르는 35,000개 샘플 benchmark를 통해 LLM hallucination의 위험과 불명확한 범위를 다룬다. 연구 결과, ChatGPT는 검증할 수 없는 내용을 생성하고 LLM은 hallucination을 탐지하는 데 어려움을 겪으며, 명시적 지식이나 reasoning을 제공하면 인식 성능이 향상되지만 ground truth와 비교하면 성능이 저하될 수 있음이 나타난다.
- HaluEval은 35,000개의 hallucinated 또는 정상 샘플을 제공한다. 여기에는 ChatGPT 응답이 포함된 일반 사용자 질의 5,000개와 question answering, knowledge-grounded dialogue, text summarization을 다루는 예시 30,000개가 포함된다.
- 이 benchmark는 일반 ChatGPT 응답에 대한 human annotation과 과제별 hallucinated 샘플을 생성하고 필터링하는 two-stage automatic pipeline을 결합한다.과제별 생성에서는 one-pass 및 conversational instruction을 사용해 다양한 샘플을 만든 뒤, 그럴듯하고 판별하기 어려운 hallucination을 선택한다.
- ChatGPT는 language, climate, technology를 포함한 주제 전반에서 약 19.5%의 응답에 검증할 수 없는 정보를 조작해 삽입한다.
- 기존 LLM은 hallucination을 식별하는 데 어려움을 겪으며, ChatGPT의 question answering 정확도는 62.59%에 불과하다.
- 명시적 지식과 중간 reasoning은 hallucination 인식을 향상시키지만, hallucinated 샘플을 ground truth와 대조하면 성능이 저하된다.
2 HaluEval 벤치마크
HaluEval은 환각의 유형, 발생 빈도, 인식 능력을 연구하기 위해 자동 생성된 환각 샘플과 사람이 주석을 단 ChatGPT 응답을 결합한다. 2단계 생성 과정에서 question answering, knowledge-grounded dialogue, summarization에 걸쳐 30,000개의 샘플을 생성하며, 주석 결과 5,000개 응답 중 19.5%에서 환각이 식별된다.
- 자동 생성: 샘플링 지침은 의도 설명, 환각 패턴, 시연 예시를 지정하여 여러 환각 패턴과 task에 걸친 통제된 생성을 가능하게 한다.Few-shot 시연 예시는 seed task에 의도된 환각 패턴을 ChatGPT가 이해하도록 돕는다.
- 자동 생성: 자동 파이프라인은 다양한 환각 샘플을 얻기 위해 ChatGPT를 사용한 뒤, 그럴듯하고 판별하기 어려운 환각 샘플을 남기기 위해 고품질 필터링을 수행한다.샘플링에는 단일 단계 또는 대화형 instruction schema가 사용되며, 필터링에서는 ground-truth-enhanced instruction을 사용해 환각 후보 중 하나를 선택한다.
- 벤치마크 구성: 생성된 30,000개 샘플은 question answering, knowledge-grounded dialogue, text summarization을 포괄하며, task당 10,000개의 예시로 구성된다.벤치마크에는 일반 사용자 질의에 대한 ChatGPT 응답 5,000개를 사람이 직접 주석한 자료도 포함된다.
- 사람 주석: 주석이 부여된 ChatGPT 응답 5,000개 중 977개에 환각이 포함되며, 이는 19.5%에 해당한다.질의는 샘플링된 세 응답 간 평균 BERTScore 유사도가 낮은 경우를 기준으로 사전 선정되었으며, 세 명의 라벨러가 다수결을 통해 응답을 검증 불가, 비사실적 또는 무관으로 판정했다.
- 벤치마크 활용: 이 벤치마크는 환각이 발생하기 쉬운 content를 분석하고, 생성 샘플과 주석 샘플에서 LLM의 환각 인식 능력을 평가할 수 있도록 한다.연구자들은 제공된 instruction을 자체 dataset에 적용해 환각 평가와 분석을 수행할 수도 있다.
3 실험
실험 결과, LLM은 암묵적 hallucination을 인식하는 데 어려움을 겪는 반면, 검색된 지식은 ChatGPT의 인식 정확도를 크게 향상시키는 것으로 나타났다. 실패는 hallucination 패턴과 주제에 따라 고르지 않게 분포하며, 생성된 hallucination이 사실적 출력과 유사하기 때문에 sample contrast의 성능이 가장 낮다.
- 실험 설정: 평가는 fine-tuning이나 hyper-parameter tuning 없이 5개의 closed-source LLM과 5개의 open-source LLM을 대상으로 하며, temperature-zero의 결정론적 평가를 사용한다.평가 대상 모델에는 GPT-3, InstructGPT, ChatGPT, Claude, Claude 2, Alpaca, Vicuna, ChatGLM, Falcon, Llama 2-Chat이 포함된다.
- Hallucination 인식: ChatGPT는 text summarization의 hallucination 인식에서 58.53% accuracy만 달성해 우연 수준을 간신히 웃돌며, 암묵적인 사실 오류를 식별하기 어렵다는 점을 보여준다.Table 5는 평가된 LLM의 classification accuracy를 보고하며, 생성된 hallucination sample은 주로 핵심 factual span에서 factual output과 다르다.
- 실패 분석: ChatGPT의 인식 실패는 고르지 않게 분포한다. QA, dialogue, summarization에서 절반 이상이 첫 번째 hallucination 패턴에서 발생한다.이러한 패턴은 각각 QA에서는 comprehension, dialogue에서는 extrinsic-soft, summarization에서는 factual이다.
- 실패 분석: Hallucination 인식은 주제에 민감하며, ChatGPT는 여러 task 설정에서 film, company, band, technology, climate, language 주제에 대해 자주 실패한다.자주 등장하는 QA 주제는 film, school, company이며, user query와 response는 story, health, language, technology, computer를 가장 많이 다룬다.
- 인식 개선: Wikipedia 지식을 검색하면 ChatGPT의 QA 인식 accuracy가 62.59에서 76.83으로 상승하지만, CoT reasoning은 전체적으로 약간 도움이 되는 반면 QA와 dialogue에는 해를 끼친다.Summarization에는 source document가 이미 필요한 정보를 제공하므로 external knowledge를 사용하지 않는다.
- 인식 개선: sample contrast에 ground-truth example을 제공하면 최악의 결과가 나오며, 매우 유사한 factual sample과 hallucination sample이 LLM을 혼란스럽게 한다는 점을 나타낸다.이 결과는 HaluEval이 hallucination evaluation에 도전적인 benchmark라는 점도 보여준다.
4 관련 연구
기존 연구는 verification, external evidence, fact critics, 그리고 원인 분석을 통해 LLM hallucination에 대응해 왔지만, hallucination benchmark와 metric은 task 또는 model별로 한정된 경우가 많다. HaluEval은 general user queries와 ChatGPT responses를 중심으로 한 benchmark를 제공해 LLM의 blind spots를 드러낸다.
- LLM의 Hallucination: 기존 연구는 verification systems, structured-data evidence, token-level fact critics를 활용해 hallucination을 완화하는 한편, task 전반에서 원인을 분석하는 일은 여전히 활발한 research direction으로 남아 있다.이러한 접근에는 summarization에서 non-factual entities를 검증하는 방법(Zhao et al., 2020), knowledge graphs와 databases 같은 structured interfaces(Lan et al., 2022), 그리고 cross-task analyses(Das et al., 2023; Cao et al., 2022)가 포함된다.
- Hallucination 평가: HaluEval은 general user queries와 ChatGPT responses를 활용하는 benchmark를 구축해 LLM의 blind spots를 드러내는 public platform으로 활용할 수 있다는 점에서 차별화된다.이 연구는 자신의 dataset을 또 다른 task-specific evaluation resource가 아니라 benchmark로 제시한다.
- Hallucination 평가: 기존 hallucination evaluation은 다양한 NLP tasks를 포괄하지만, BEGIN과 같은 사례는 dialogue outputs를 세 가지 categories로만 분류하며 single tasks와 small models에 제한될 수 있다.인용된 evaluation 계열에는 Dziri et al. (2022b), Gupta et al. (2022), Dziri et al. (2022a), Rashkin et al. (2021), Li et al. (2023b)의 연구가 포함된다.
- Hallucination 평가: 기존 metrics는 특수한 settings에서 hallucination을 정량화하며, 여기에는 table-to-text n-gram lexical entailment를 위한 PARENT와 example-level area under the ROC curve를 위한 TRUE가 포함된다.PARENT는 Dhingra et al. (2019), TRUE는 Honovich et al. (2022)의 연구로 제시된다.
5 결론
HaluEval은 LLM의 환각 인식 능력을 평가하기 위한 생성 및 인간 주석 환각 샘플의 대규모 benchmark다. sampling-then-filtering을 사용해 다양하고 어려운 샘플을 생성하며, LLM이 환각을 인식하거나 회피하지 못하는 경우가 많음을 보여 인식 능력 향상 전략의 필요성을 제기한다.
- HaluEval은 LLM의 환각 인식 능력을 평가하기 위해 생성 및 인간 주석 환각 샘플을 제공한다.
- Sampling-then-filtering은 필터링하고 어려운 사례를 선별하기 전에 두 가지 sampling 방법을 통해 다양한 샘플을 생성한다.
- 기존 LLM은 대부분 환각을 인식하지 못하고 환각 콘텐츠를 생성하는 경향이 있어, 인식 능력 향상 전략의 필요성을 제기한다.
6 한계
benchmark에서 생성된 hallucination의 품질은 filtering을 거치더라도 ChatGPT의 instruction-following 능력에 좌우되며, sample이 ground-truth sample과 유사해 오용될 수 있다.
- 한계: ChatGPT가 생성한 hallucination sample은 복잡한 sampling instruction을 따르는 능력에 의해 여전히 제한되므로, filtering을 거치더라도 품질 관리가 필요하다.이 접근법은 자동 sample 생성을 위해 ChatGPT를 사용하므로, 생성 품질이 model의 능력에 좌우된다.
- 한계: hallucination sample이 ground-truth sample과 매우 유사하므로 benchmark가 오용될 수 있으며, 그 확산과 사용에 대한 모니터링 및 규제가 필요하다.
부록
부록에서는 환각 샘플링, 필터링, 평가 및 benchmark 세부 사항을 다루는 보충 benchmark 정보를 제공한다.
- 부록 A: 부록 A에서는 환각 샘플링 지침을 제시한다.
- 부록 B: 부록 B에서는 환각 필터링 지침을 제시한다.
- 부록 C: 부록 C에서는 평가 지침을 제시한다.
- 부록 D: 부록 D에서는 benchmark 세부 사항을 제시한다.
환각 샘플링
대화와 요약을 위한 hallucination sampling 지침은 각각 Table 9와 Table 10에 제시된다.
- Hallucination Sampling: sampling 지침은 대화의 경우 Table 9에, 요약의 경우 Table 10에 별도로 제시된다.
B 환각 필터링
이 절에서는 대화와 요약에 대한 환각 샘플링 지침을 별도의 표로 제시한다.
- 대화 환각 샘플링 지침은 Table 11에 제시한다.
- 요약 환각 샘플링 지침은 Table 12에 제시한다.
- 샘플링 지침은 대화와 요약에 대해 별도로 구성한다.
C 환각 인식
환각 인식 지침은 질의응답, 대화, 요약에 대해 각각 별도로 정의된다. 이 지침은 각각 Tables 13, 14, 15에 제시된다.
- Table 13은 질의응답을 위한 환각 인식 지침을 제시한다.
- Table 14는 대화를 위한 환각 인식 지침을 제시한다.
- Table 15는 요약을 위한 환각 인식 지침을 제시한다.
D HaluEval 세부 사항
이 절에서는 지식 기반 대화, 텍스트 요약, 질의응답 전반에서 hallucination을 샘플링하고 필터링하며 인식하는 데 사용한 지침을 설명하고, hallucination 패턴별 생성 샘플 수를 보고한다.
- Table 16은 P-I부터 P-IV까지 각 hallucination 패턴의 생성 샘플 수를 보고한다.대화와 요약의 경우, 이 표는 세 가지 패턴을 고려하며 “Summa.”는 summarization의 약어다.
- Tables 9–12는 지식 기반 대화와 텍스트 요약을 위한 hallucination 샘플링 및 필터링 지침을 명시한다.
- Tables 13–15는 질의응답, 지식 기반 대화, 텍스트 요약을 위한 hallucination 인식 지침을 명시한다.