Source-linked AI summary

Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025

Maria Kunilovskaya, Gagan Bhatia, Lisa Sophie Albertelli, Yanran Chen, Christian Greisinger, Lotta Kiefer, Christoph Leiter, Subhadeep Roy, Tewodros Achamaleh, Muhammad Arslan Manzoor, Sebastian Pohl, Yufang Hou, Steffen Eger

arXiv:2606.02255v1cs.CLcs.AI

TL;DR

NLP 연구는 인간의 판단에 의존하지만, 누가 주석을 수행하고 주석 품질을 어떻게 관리했는지에 대한 보고는 일관되지 않다. 이 논문은 taxonomy와 LLM-assisted extraction pipeline을 사용해 task 수준에서 보고 관행을 감사하고, 특히 model-evaluation 연구에서 지속되는 누락과 함께 개선도 이루어졌음을 보인다.

  • 문제

    NLP 연구는 인간의 판단에 의존하지만, 논문은 annotator, 주석 절차, training, disagreement 처리 방식을 충분히 문서화하지 않는 경우가 많다.

  • 방법

    이 논문은 unified taxonomy, human-adjudicated gold standard, LLM-assisted extraction pipeline을 사용해 task 수준에서 주석 보고를 감사한다.

  • 결과

    주석 보고는 개선되었지만, compensation, socio-demographics, training, adjudication, agreement values는 여전히 상당히 적게 보고되며, 특히 model-evaluation 연구에서 두드러진다.

  • 시사점 및 한계

    독자가 인간 주석이 reliable, interpretable, reproducible한지 평가하려면 주석 task의 세부 사항을 bare minimum으로 제시해야 한다.

  • 시사점 및 한계

    taxonomy는 불완전하거나 일관되지 않은 기술에 대한 세밀한 해석을 요구하므로, perfect agreement를 달성하기 어렵다.

Abstract

from arXiv · show

Human annotation is the empirical foundation of much NLP research, from dataset construction to model evaluation, but papers often leave unclear who produced the annotations and how the annotation process was controlled. We provide the first large-scale, task-level audit of human annotation reporting across major NLP venues, asking which annotation details are documented, which are missing, and how reporting varies across time, topic, venue, and intended use of human judgment. We introduce a unified taxonomy of annotation-reporting practices and validate an LLM-assisted extraction pipeline against Annotated-gold, a human-adjudicated gold standard of 41 papers and 72 annotation tasks, where the best model reaches human-comparable agreement with adjudicated labels, with Krippendorff's alpha of 0.606 versus 0.585 for human-human agreement. Using this pipeline, we construct Annotated-llm, a dataset covering ACL-venue papers from 2018-2025, with 2,667 extracted annotation tasks from 1,603 papers, and find that papers frequently report operational details such as recruitment strategies, annotator expertise, and annotation volume, but often omit details needed to assess annotation validity, including training, language proficiency, compensation, socio-demographics, adjudication, and agreement values, especially in model-evaluation studies. Our results show that annotation reporting in NLP has improved over time but remains uneven, and they establish a scalable framework and bare-minimum reporting recommendations for making human annotation more reliable, reproducible, and interpretable.

1 서론

이 논문은 human annotation을 경험적 NLP의 토대로 규정하면서 annotator와 reporting practice에 관한 제한적인 근거를 지적한다. task-level audit를 도입하고, adjudicated label을 기준으로 확장 가능한 extraction을 검증하며, reporting recommendation을 제안한다.

  • 동기: NLP의 주장은 annotator가 누구인지, 무엇을 하는지, 어떻게 훈련받는지, 의견 불일치를 어떻게 처리하는지에 의존하지만, 이러한 관행에 관한 경험적 근거는 여전히 부족하다.서론은 크라우드 작업자와 전문가의 차이, task의 적절성, 보상, reporting initiative가 측정 가능한 효과를 내는지에 관한 미해결 질문을 강조한다.
  • 기여: ANNOTATED는 각 annotation task를 별도의 단위로 다루어 annotator, 지침, 목적, quality-control procedure의 논문 내 차이를 보존한다.task-level 관점은 paper-level 분석으로는 놓칠 수 있는 변이를 가리지 않는다.
  • 기여: Gemini-3.1-Pro는 Krippendorff’s α = 0.606에서 adjudicated label과 인간에 준하는 일치도를 달성하여 annotation practice의 확장 가능한 meta-analysis를 가능하게 한다.검증에는 41편의 논문과 72개의 human-annotation task를 포괄하는 인간 adjudication 기반 gold standard인 ANNOTATEDGOLD가 사용된다.
  • 기여: 대규모 audit는 2018년부터 2025년 사이에 출판된 ACL-venue 논문 1,603편에서 annotation task 2,667개를 추출한다.분석은 시간, venue, NLP topic, human judgment의 용도에 따른 reporting을 검토한다.
  • 기여: 이 논문은 human annotation을 더 신뢰할 수 있고, 재현 가능하며, 해석 가능하게 만들기 위한 확장 가능한 framework와 bare-minimum reporting recommendation을 제안한다.이 recommendation은 annotation-reporting practice에 대한 대규모 audit에 근거한다.

2 관련 연구

기존 NLP 연구는 인간 주석, 주석자 특성, 일치도 측정, 평가 설계, 재현성이 주석 품질을 좌우한다고 강조한다. 관련 AI4Science 연구는 LLM 기반 동료평가, 글쓰기, 그래픽 생성, 경험적 주석 또는 평가를 포함해 과학적 워크플로를 지원하는 AI를 다룬다.

  • 주석자 효과, 주석 품질, 보고: 인간 주석은 NLP 평가와 데이터셋 구축의 핵심이며, 이에 따라 일치도 측정, 평가 설계, 재현성에 주목하게 된다.기존 연구는 주석자가 서로 대체 가능한 존재가 아니라고도 강조하며, 주석자의 인구학적 배경, 언어 능력, 문화적 맥락이 중요함을 보여준다.
  • AI4Science와 메타과학적 분석: AI4Science 연구는 문헌 분석, 발견, 실험, 글쓰기, 그림 생성, 평가를 포함해 AI 시스템이 과학적 작업을 지원하거나 변화시키는 방식을 다룬다.
  • AI4Science와 메타과학적 분석: 최근 연구는 동료평가, 초록 생성, 과학 그래픽을 위한 LLM 기반 지원을 탐구하는 한편, NLP에서는 과학적·경험적 분석을 위해 LLM을 주석자, 평가자 또는 보조자로 활용하는 사례가 늘고 있다.

3 인간 주석 설정

이 연구는 논문이 아니라 개별 인간 주석 작업을 분석 단위로 삼아, 통합 taxonomy와 보정된 consensus 기반 절차로 보고 관행을 평가한다. 작업은 지침과 데이터를 공유하며, taxonomy는 7개 보고 측면에 걸쳐 25개 범주를 포괄한다.

  • 3 인간 주석 설정: 논문이 아니라 개별 인간 주석 작업이 분석 단위이며, 주석자들이 동일한 지침을 따르고 동일한 데이터에 주석을 다는 공유된 설정으로 정의된다.작업은 데이터셋 구축, 인간 성능 추정 또는 모델 출력 평가를 지원할 수 있다.
  • 3 인간 주석 설정: 주석자들은 통합 지침, 파일럿 주석, 그룹 토론, 보정을 포함한 구조화된 인터페이스를 사용했으며, 일관된 코딩과 집계를 위해 폐쇄형 목록 선택을 우선했다.일부 범주는 논문에 명시적으로 서술된 내용만으로 코딩했지만, 다른 범주는 관련 정보를 바탕으로 한 판단이 필요했다.
  • 3 인간 주석 설정: taxonomy는 25개 보고 범주를 7개 측면으로 구성한다: 작업 설명, 일치도, 작업량, 모집 및 자격, 보상, 사회인구학적 특성, 품질 관리.이는 ACL 논문의 이질적인 인간 주석 작업을 매핑하기 위한 통합 프레임워크를 제공한다.
  • 3 인간 주석 설정: 각 논문은 최소 2명의 독립적인 주석자가 주석했으며, 불일치는 논의하고 해결되지 않은 사례는 세 번째 주석자가 판정했으며, consensus 라벨이 ANNOTATEDGOLD 표준을 구성했다.이 consensus 부분집합은 LLM 추출 품질을 평가하는 데 사용되었다.

4 ANNOTATED 데이터셋

ANNOTATED 데이터셋은 ACL venues에서 2018년부터 2025년 사이에 발표된 human-annotation task를 대상으로, 수작업으로 adjudication한 gold-standard benchmark와 대규모 LLM-extracted corpus를 결합한다. Keyword-based retrieval과 filtering을 통해 1,603편의 논문과 2,667개의 annotation task를 확보했으며, sampling strategy는 stratified random sample과 비교해 평가했고 전반적으로 분포 차이가 크지 않았다.

  • Dataset construction: 이 corpus는 2018–2025년 ACL, EMNLP, NAACL, TACL, EACL, AACL publication을 포괄하며, annotation과 관련된 title 및 abstract keyword 34개를 반복적으로 정교화한 matching으로 검색했다.이 기간은 ACL checklist 도입 전후 각각 3년을 포함한다.
  • Dataset construction: ANNOTATEDGOLD는 처음 sampling한 61편 중 reliably annotatable한 41편의 논문을 남겨 수작업으로 annotation하고 adjudication한 benchmark를 구성했다.세 번째 annotation 이후에도 annotation task가 해결되지 않았거나, 최소 2명의 annotator가 annotatable하기 어려운 task를 3개 초과로 식별한 논문은 제외했다.
  • Dataset construction: Keyword로 검색된 1,995개 후보에서 annotatable한 human-annotation content를 filtering한 뒤, 1,603편의 논문과 2,667개의 extracted annotation task로 ANNOTATEDLLM을 구성했다.ANNOTATEDGOLD에 sampling된 61편의 논문은 ANNOTATEDLLM에서 엄격히 제외했다.
  • Sampling validation: 동일한 venue-year 범위에서 추출한 stratified random sample과 비교했을 때, keyword-based sampling은 일부 category-value frequency에서 통계적으로 유의한 차이를 보였지만, 67개 observation 전반의 평균 차이는 대체로 크지 않았다.이 비교는 모든 ACL-venue 논문에 비해 발생할 수 있는 sampling bias를 평가한다.

5 실험 설정

이 실험은 통합된 schema 제약 추출 프로토콜하에서 6개 proprietary 및 open-weight LLM을 평가하고, task에 맞춘 출력을 정규화된 gold label과 비교한다. universal 및 조건부 적용 attribute를 대상으로 task-sensitive REPORTAGE SCORE를 사용해 annotation reporting을 정량화한다.

  • 추출: 6개 LLM—proprietary 3개와 open-weight 3개—를 통합 추출 프로토콜하에서 평가한다.proprietary model은 Gemini-3.1-Pro, Gemini-3.1-Flash-Lite, GPT-4.1이고, open-weight model은 Qwen3.6-27B, gemma-4-31B-it, gpt-oss-120b이다.
  • 추출: 추출 framework는 taxonomy rule을 인코딩하고 출력을 JSON-defined schema로 제한하며, 여러 실험을 포함한 논문에서 under-extraction을 줄이기 위해 지속적인 scanning을 유도한다.프로토콜에는 정확한 허용값, field-level decision rule, 상호의존성 제약, self-audit checklist가 포함된다.
  • 평가: LLM 출력은 대응하는 annotation task를 정렬하고 비교 전에 값을 canonical form으로 정규화한 뒤 gold label과 비교해 평가한다.task 정렬에는 annotation 중 기록된 짧은 task description을 사용하며, tweet sentiment labeling과 tweet sentiment annotation 같은 일치 항목이 포함된다.
  • REPORTAGE SCORE: REPORTAGE SCORE는 각 task에 대해 적용 가능한 annotation attribute 중 명시적으로 보고된 항목의 비율을 측정하며, 10개의 universal attribute와 관련성이 있을 때 조건부 attribute를 함께 사용한다.universal attribute에는 guideline, recruitment, training, expertise, language proficiency, education, annotator 수와 item 수, compensation, post-annotation filtering이 포함되며, 단일 annotator task에서는 agreement와 adjudication을 제외할 수 있다.

6 결과

모델 지원 annotation은 adjudicated gold standard와의 human–human agreement를 소폭 웃돌았으며, 대규모 결과는 NLP 논문이 타당성에 핵심적인 방법론 정보보다 annotation의 운영 세부사항을 더 일관되게 보고함을 보여준다. Reporting은 시간에 따라 개선되었지만 topic과 intended use에 따라 여전히 불균등하며, model-evaluation 연구는 resource-creation 연구보다 적은 세부사항을 기록한다.

  • 6.1 Agreement: Human–human exact-match agreement는 79.2%였고, macro-averaged Krippendorff’s α는 0.585였다. 명확하게 정의되고 명시적으로 보고된 field에서는 reliability가 α > 0.8을 넘었다.guideline availability, annotator expertise, recruitment, quality-control procedures처럼 추론이 필요하거나 모호한 field에서는 agreement가 더 낮았다.
  • 6.1 Agreement: 79.9% vs. 79.2%의 macro-level agreement와 0.606 vs. 0.585의 Krippendorff’s α는 Gemini-3.1-Pro가 gold standard에 대한 human–human annotation을 소폭 상회했음을 보여준다.6개 모델을 평가한 뒤 대규모 extraction에는 Gemini-3.1-Pro를 선정했으며, consensus dataset을 만들기 위해 모든 annotation을 논의를 통해 adjudication했다.
  • 6.2 Reporting trends: task의 90.4%는 recruitment를, 86.5%는 annotator expertise를, 86.0%는 annotation volume을 보고했지만, validity와 관련된 attribute는 훨씬 덜 일관되게 보고되었다.사회적 주제를 다루는 NLP 논문은 annotator sourcing과 language background에 조금 더 주의를 기울였지만, validity를 평가하는 데 필요한 더 광범위한 방법론적 세부사항은 여전히 누락했다.
  • 6.2 Reporting trends: Reporting quality는 시간에 따라 improved over time했지만, 2022년 이전의 상승 추세는 ACL Responsible NLP Checklist가 도입되기 전부터 이미 나타나던 관행을 공식화했을 가능성을 시사한다.analysis는 2022년 이후의 즉각적인 level shift와 2022년 이후 trend의 변화를 모두 추정한다.
  • 6.2 Reporting trends: Resource-creation 연구는 model-evaluation 연구보다 일관되게 substantially more methodological detail을 보고했으며, 후자에서는 recruitment, compensation, training, quality-control procedures가 누락되었다.전반적인 reportage quality의 개선에도 불구하고 이 격차는 관찰 기간 내내 지속되었다.

7 결론 및 권고

이 연구는 NLP 논문에서 human annotation을 문서화하는 방식이 개선되고 있지만 여전히 격차가 크며, 특히 신뢰성, 해석 가능성, 재현 가능성을 평가하는 데 필요한 세부 정보가 부족하다는 점을 보여준다. 확장 가능한 taxonomy와 LLM-assisted pipeline을 기반으로, 최소한의 task-sensitive reporting standards와 model-evaluation studies에서의 투명성 강화를 권고한다.

  • 발견: NLP 논문은 training, qualification, compensation, demographic information보다 annotator 모집 출처, annotator 전문성, annotation 규모를 더 일관되게 보고한다.이 분야는 분명히 발전했지만 문서화는 여전히 불균일하고 불완전하다.
  • 권고: 논문은 annotator 출처, annotator 수와 item 수, item당 annotator 수, training, language proficiency, 전문성, compensation, quality control, annotation-guideline access를 보고해야 한다.이러한 세부 정보가 있어야 독자는 annotation이 신뢰할 수 있고 해석 가능하며 재현 가능한지 평가할 수 있다.
  • 권고: 보고는 task-sensitive해야 한다. 사회적 맥락에 기반하거나 주관적인 task에서는 demographics가 중요하지만, benchmark-label 및 evaluation task에서는 agreement, adjudication, quality control이 중요하다.서로 다른 annotation 용도에는 validity와 quality에 관한 서로 다른 근거가 필요하다.
  • 발견 및 기여: Model-evaluation studies는 핵심적인 경험적 주장을 위해 annotation에 의존함에도 resource-creation studies보다 annotation을 덜 자주 문서화한다.제안된 taxonomy와 LLM-assisted pipeline은 reliability와 reproducibility를 뒷받침하는 reporting practices를 모니터링할 수 있는 확장 가능한 기반을 제공한다.

한계

annotation taxonomy는 불완전하거나 일관되지 않게 작성된 논문 설명을 세밀하게 해석해야 하는 범주들로 인해 제약을 받으며, 완벽한 일치를 이루기 어렵다. 이러한 범주들은 annotation validity를 평가하는 데 중요한 정보를 포착하므로 유지했다.

  • 불완전하거나 일관되지 않게 작성된 설명을 세밀하게 해석해야 하므로 일부 taxonomy 범주에서는 완벽한 일치를 이루기 어렵다.
  • 그럼에도 taxonomy는 recruitment, expertise, guideline availability, compensation, quality control을 포착하므로 이러한 어려운 범주들을 유지한다.
  • 이 한계는 annotation taxonomy의 설계와 신뢰성 모두에 해당한다.

윤리 성명

이 연구는 외부 인간 피험자를 대상으로 한 새로운 실험이 아니라 공개 논문과 저자들이 수행한 수작업 annotation을 사용한다. 그럼에도 annotation 노동, 투명성, 자동화된 extraction의 책임 있는 사용에 관한 윤리적 우려를 다룬다.

  • 분석에는 공개된 과학 논문이 사용되며, 출판된 연구 논문에 대한 수작업 annotation은 저자와 협력자들이 수행했다.
  • 보상, annotator의 인구통계학적 특성, training, quality-control 세부사항이 충분히 보고되지 않는 경우가 많아 연구 결과는 윤리적 우려를 제기한다.
  • 모호한 절차는 extraction 오류를 일으킬 수 있으므로, pipeline은 human-adjudicated gold standard와 대조해 검증하며 개별 논문을 순위화하거나 비판하는 대신 aggregate trends를 분석하는 데 사용한다.공개되는 dataset과 code는 개별 저자에게 책임을 묻는 것이 아니라 공동체 수준의 reporting 관행과 더 나은 documentation 기준을 뒷받침해야 한다.

광범위한 영향

이 연구는 annotation labor, quality control, annotator characteristics의 보고를 모니터링할 수 있는 도구를 제공해 NLP human annotation의 투명성과 재현성을 높이고자 한다. 더 명확한 보고는 annotation-based claims의 신뢰성을 평가하는 데 도움이 될 수 있다.

  • 광범위한 영향: 이 연구의 방법론적 영향은 NLP에서 annotation labor, quality control, annotator characteristics를 더 명확하고 재현성 있게 보고하도록 지원하는 데 있다.이를 위해 task-level taxonomy, reporting-completeness metric, 그리고 이러한 관행을 모니터링하는 LLM-assisted extraction pipeline을 제공한다.
  • 광범위한 영향: 더 명확한 annotation reporting은 reviewer, reader, future researcher가 annotation-based claims의 신뢰성을 평가하는 데 도움이 될 수 있다.

A 데이터셋

데이터셋은 제목과 초록에서 “human in the loop”를 포함한 34개 키워드를 일치시켜 인간 주석이 포함된 논문을 식별했다.

  • A 데이터셋: 제목과 초록의 일치를 통해 인간 주석이 포함된 논문을 식별하는 데 34개 키워드를 사용했다.
  • A 데이터셋: 따라서 논문 포함 여부는 제목과 초록에서의 키워드 일치를 기준으로 결정했다.
  • A 데이터셋: 키워드 목록에는 “human in the loop”가 포함되었다.

A.1 키워드 검색 무작위 표본 검증 … E LLM 추출 프롬프트

이 연구는 키워드 검색이 효율적이지만 구성 변화를 일으키는 전략임을 검증한 뒤, task-level score, taxonomy, annotator-demographic fields, 엄격한 LLM extraction prompt를 통해 annotation reporting을 구체화한다. 이를 통해 구축한 framework는 적용 가능한 reporting attributes를 구분하고 annotation details를 정확히 추출하되 추론하지 않도록 강제한다.

  • A.1 키워드 검색 무작위 표본 검증: 키워드 검색은 annotation content가 포함된 후보 논문 1,995편 중 82%를 유지했으며, 층화 무작위 표본의 논문 3,000편에서는 36%를 유지했다.이는 human annotation content가 포함된 논문을 식별할 때 검색 효율이 상당히 높음을 확인한다.
  • B REPORTAGE SCORE 계산: REPORTAGE SCORE는 21개 schema categories에 걸쳐 각 annotation task에서 보고된 applicable attributes의 비율을 계산하며, 적용 불가능하거나 중복되는 fields는 동적으로 제외한다.Schema에는 universal, socio-demographic, conditional attributes가 포함되며, 값 없이 IAA metric만 제시된 경우와 같은 불완전한 fields는 유효한 reportage로 계산하지 않는다.
  • C Annotator demographics: Gold annotation process에는 annotators 12명이 참여했다. 구성은 교수 2명, 박사후연구원 2명, 박사과정 학생 6명, 석사과정 학생 2명이었으며, 보고된 영어 유창도와 다양한 출신 국가를 보였다.Annotator pool에는 여성 5명과 남성 7명이 포함되었고, 출신 국가는 이탈리아, 독일, 인도, 중국, 러시아였다.
  • D Human Annotation 세부 사항: Annotation taxonomy는 topic, task type, intended use, guideline reproducibility, agreement metrics and values, workload, recruitment, training, proficiency, expertise, compensation, demographics를 기록한다.Intended-use labels는 resource creation, human performance, model output evaluation을 구분하며, agreement fields는 추론 없이 metric-value alignment를 보존한다.
  • E LLM Extraction Prompt: LLM prompt는 허용된 taxonomy values를 정확히 사용하고, task-specific experiment rows를 작성하며, annotator groups, rounds, instructions, objectives가 다르면 별도의 experiments로 분리하도록 요구한다.또한 agreement values를 추론하지 말고 prose, tables, appendices를 검색하며, 근거가 없을 때는 “Not reported”와 같은 명시적 defaults를 사용하도록 지시한다.

F 추가 분석 세부사항

추가 분석 결과, 사회 지향적 NLP 연구는 전반적인 보고 품질이나 전문가 annotator 의존도보다는 annotator 모집, 언어 배경 보고, 품질 관리, 불일치 처리에서 주로 차이를 보인다. 연구 venue와 annotation 목적 전반에서 보고 추세는 2022년 이후 수렴하지만, annotation 목적이 출판 연도보다 보고 행태를 더 강하게 예측한다.

  • RQ1: 추가 분석: 사회 지향적 논문은 모집 정보를 약간 더 많이 보고하고, crowdsourced 또는 혼합 pool을 더 많이 사용하며, 모국어 화자 여부를 더 자주 보고하지만, 전반적인 보고 품질이 실질적으로 더 높은 것은 아니다.모국어 보고는 social subset과 유의하게 연관되지만(χ2 = 20.50, p < 0.001), 그 연관성은 약하다(Cramer’s V = 0.088).
  • RQ1: 추가 분석: Crowd-annotated social-subset 논문은 데이터셋의 나머지 부분보다 품질 관리 조치를 더 자주 사용하며, 그 비율은 72% versus 62.5%다.이 차이는 사회 관련 연구에서 crowdworker를 선별하거나 필터링하는 일이 더 빈번함을 보여준다.
  • RQ1: 추가 분석: 사회 지향적 논문은 training을 약간 더 자주 보고하지만(20% versus 18%), expert annotator에 더 의존하지 않으며 expertise 정보는 더 자주 누락한다.이들의 ordinal 및 scalar task에서는 불일치를 처리할 때 expert adjudication이나 consensus discussion보다 majority voting(50.0%) 또는 label distributions(25.0%)을 더 흔히 사용한다.
  • RQ2: 추가 분석: 2022년 이후 ACL, EMNLP, NAACL 전반에서 보고 추세가 평탄해져, Responsible NLP Checklist 이후 즉각적인 품질 상승은 크지 않은 가운데 venue 간 차이가 줄어든다.ARR 도입과 venue별 시행 일정이 동기화되지 않았기 때문에 intervention year는 근사적이다.
  • RQ3: 추가 분석: Resource-creation 연구는 절차적 세부사항을 가장 강하게 보고하고, human-performance 연구는 중간 수준이며, model-evaluation 연구는 모든 측정치에서 일관되게 가장 약하다.이 패턴은 형식적인 품질 관리를 넘어 annotator 투명성과 문서화에도 나타나며, 특히 model-evaluation 연구에서 모집 출처와 보상이 취약하게 보고된다.
Loading 2606.02255v1…