Source-linked AI summary
When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
Yuqing Yang, Qi Zhu, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala
TL;DR
LLM은 표 추론에서 표 항목을 혼동하거나 필요한 정보를 누락하는 등 데이터 참조 오류를 자주 일으켜 응답 품질과 최종 정확도를 저해한다. 이 논문은 이러한 오류를 체계적으로 평가하고 critic 기반 filtering과 rejection sampling을 적용해 정확도를 최대 11.96% 향상한다.
문제
LLM은 여전히 표 항목을 혼동하거나 필요한 정보를 간과하며, 다양한 표 추론 과제에서 데이터 참조 오류를 빈번하게 일으킨다.
방법
이 논문은 잘못된 인용과 누락을 분류하고 LLM-as-a-Judge framework로 평가한 뒤, critic 기반 filtering과 rejection sampling을 적용한다.
결과
DRE는 모델, 표 형식, 과제 전반에서 빈번하게 발생하며, critic이 유도하는 rejection sampling은 정확도를 최대 11.96% 향상한다.
시사점 및 한계
더 신뢰할 수 있는 표 추론 시스템을 개발하려면 최종 답변 정확도를 넘어 데이터 참조를 핵심 평가 차원으로 고려해야 한다.
시사점 및 한계
이 연구는 표 관련 과제에 초점을 맞추며, 연구 결과가 다른 도메인이나 모달리티에도 일반화되는지는 확립하지 않는다.
Abstract
from arXiv · showhide
While large language models (LLMs) perform well on table tasks, they still make data referencing errors (DREs), i.e., incorrectly citing or omitting table values, despite understanding the table structure. Beyond final-answer accuracy, DREs directly compromise the correctness and reliability of intermediate reasoning steps. Yet prior studies have only offered limited, small-scale analyses. In this work, we present the first systematic evaluation of tabular data referencing errors across different models and tasks. Our results show that DREs occur across all tested models (1.7B to 20B parameters). Furthermore, we demonstrate that incorporating data referencing as a critic significantly improves answer accuracy up to 12.0%, through critic-based filtering and rejection sampling. Finally, we trained a lightweight 4B-parameter critic model that achieves an average F1 score of 78.2% in detecting both in-distribution and out-of-distribution DREs, and effectively assists inference for larger models.
1 서론
이 논문은 모델이 표 구조를 파싱한 뒤에도 표 정보를 잘못 인용하거나 누락할 때 발생하는 표 데이터 참조 오류(DREs)를 체계적으로 연구한다. DREs를 분류하고 발생 빈도를 측정하며, critic 기반 탐지와 경량 critic 학습이 신뢰성과 성능을 높일 수 있음을 보인다.
- 연구 동기와 범위: DREs는 1.7B에서 20B 파라미터 규모의 모든 모델과 다양한 표 관련 task에서 광범위하게 나타나며, 최종 답변 정확도를 넘어선 체계적 연구의 필요성을 제기한다.기존 분석은 범위가 좁아 대체로 하나의 모델과 소수의 사람이 주석한 사례만 검토했다.
- DRE 분류 체계: DREs는 개별 값을 잘못 인용하는 Incorrect Citation과 표에서 관련된 전체 부분을 누락하는 Omitted Information으로 구성된다.밀도가 높고 구조적으로 유사한 표에서는 신뢰할 수 있는 값의 위치 파악과 인용이 어렵다.
- DRE 완화: Critic-based filtering은 DREs가 최소인 응답을 선택해 모든 sample을 사용하는 경우보다 정확도를 크게 높이며, majority voting도 향상한다.이 접근법은 최종 답변 정확도가 포착하는 보상 범위를 넘어 중간 reasoning의 품질을 개선하는 것을 목표로 한다.
- DRE 완화: Rejection sampling은 탐지된 참조 오류가 있는 응답을 반복적으로 sampling하고 reject함으로써 전체 성능을 향상한다.이는 filtering과 함께 탐색한 두 번째 critic 기반 접근법이다.
- 경량 critic 학습: Critic-4B는 in-distribution과 out-of-distribution 모두에서 학습하지 않은 baseline을 능가하며, 2단계 학습 후 평균 8.65% F1 향상을 달성한다.학습은 supervised fine-tuning과 RLVR을 결합해 Chain-of-Thought 형식을 제한하지 않으면서 강건한 DRE 탐지를 개선한다.
2 관련 연구
기존 연구는 표 중심 LLM을 특화 사전학습 아키텍처에서 prompting, supervised fine-tuning, reinforcement learning으로 발전시켜 왔지만, 평가는 중간 추론보다 최종 정확도를 주로 강조해 왔다. 기존 연구들이 data referencing errors (DREs)를 식별하고 관련 평가 또는 reward 기반 접근법을 제안했음에도, 체계적인 특성 규명은 여전히 제한적이다.
- 표 LLM: 표 중심 language model은 특화 사전학습 아키텍처에서 prompting, supervised fine-tuning, reinforcement learning으로 발전했다.특화 아키텍처의 예로 TaPas와 TaBERT가 있으며, 이후 방법들은 prompting, supervised fine-tuning, reinforcement learning을 통해 범용 LLM을 적용한다.
- 정확도를 넘어선 평가: 평가 benchmark는 대부분 최종 정확도를 우선시하여 표 과제에서 중간 추론의 품질을 간과한다.기존 연구는 process-level reward model과 다차원 평가를 통해 중간 추론을 다루지만, 표 추론 benchmark는 여전히 거의 전적으로 최종 정답성에 초점을 둔다.
- 정확도를 넘어선 평가: 기존 평가 연구는 추론 품질을 validity, redundancy, instruction-following, truthfulness, relevance, completeness와 같은 차원으로 분해한다.이러한 차원은 각각 수학적 추론, alignment, 장문 question answering에서 연구되었다.
- DREs에 관한 기존 연구: Distill-Llama-8B의 WTQ 샘플 50개에서 발생한 오류의 More than 80%가 잘못된 위치 지정과 인용에서 비롯되었지만, DREs는 여전히 체계적으로 특성 규명되지 않았다.이 결과는 표 값의 정확하고 완전한 사용이 중요함을 보여 주며, 더 폭넓은 체계적 분석의 필요성을 제기한다.
3 DRE 특성화
이 절에서는 표 관련 data referencing errors(DREs)를 잘못된 인용이나 누락된 정보로 규정하고, 모델·형식·태스크 전반에서 그 발생 빈도, 탐지, 영향을 평가한다. 모델의 reasoning과 prompting에도 불구하고 DREs는 여전히 흔하며, 최종 답이 정확한 경우에도 발생할 수 있다.
- DRE 정의: 이 연구는 DREs를 잘못된 인용이나 누락된 정보로 정의하며, 잘못된 값, 행 또는 열 혼동, 조작된 내용, 표 정보 누락을 포함한다.분석은 표 관련 태스크에 초점을 맞춘다. 표의 조밀하고 반복적인 행과 열 때문에 잘못된 referencing이 특히 발생하기 쉽기 때문이다.
- DRE 평가: ground truth를 제공한 Sonnet-3.7은 두 DRE 유형을 92.67% accuracy와 높은 일관성으로 탐지하여 자동 response evaluation을 가능하게 한다.judge는 생성된 response가 표 정보를 정확하게 사용하는지 확인하며, reflection token을 기준으로 긴 reasoning response를 segmenting하면 verbosity로 인한 evaluation difficulty를 완화할 수 있다.
- 심각도 분석: DREs는 모델, 표 형식, 표 관련 태스크 전반에서 광범위하게 나타난다. 대규모 Qwen3 모델은 일반적으로 더 적은 오류를 생성하지만, family 간 발생률은 전반적인 capability에 따라 달라진다.Llama4-Scout의 DRE rate는 46.48%로 비교적 높으며, reasoning models에서도 5.71%에서 46.04%에 이르는 rate가 관찰된다.
- 심각도 분석: self-reflection과 명시적인 data-referencing prompt에도 불구하고 DREs는 지속되며, 모델은 원래 표로 돌아가기보다 초기 오류를 반복하는 경우가 많다.평가된 instruction은 모델이 표만 사용하고 인용된 값이 표와 정확히 일치하도록 요구했다.
- 심각도 분석: 정확한 최종 답에도 DREs가 포함될 수 있으므로, 최종 답의 accuracy만으로는 올바른 intermediate reasoning이나 전반적인 response quality를 보장할 수 없다.Correct-in-DRE Ratio는 SciTab에서 65.57%로 특히 높다. 이 경우 수치 인용에 오류가 있어도 binary True/False 답은 정확할 수 있다.
4 Critic을 활용한 DRE 감소
Critic 기반 filtering과 segment-level rejection sampling은 data referencing가 어려운 사례에서 특히 data referencing errors를 줄이고 최종 정확도를 높인다. 이러한 방법은 generation model을 변경하지 않고도 inference-time intervention을 통해 많은 DRE를 방지할 수 있음을 보여준다.
- Critic 기반 Filtering: Critic은 전체 답변의 정확성이 아니라 DRE를 탐지하므로, filtering은 단일 최적 응답 대신 일부 응답으로 구성된 subset을 선택한다.여러 응답이 DRE-free일 수 있지만 reasoning 후반부에서 오류가 발생해 서로 달라질 수 있으므로, standard Best-of-N judging이 아닌 subset selection이 필요하다.
- Critic 기반 Filtering: Critic 기반 filtering은 data referencing errors가 더 적은 응답을 선택해 최종 정확도를 높이고, 이후 더 높은 품질의 subset에 대해 majority voting을 수행할 수 있게 한다.이 방법은 질문마다 N = 8개의 응답을 sampling하고 DRE 개수에 따라 filtering한다. 일부 사례에서는 filtered subset에서 무작위로 선택하는 것만으로도 majority voting을 능가한다.
- Rejection Sampling: Critic을 사용한 rejection sampling은 reasoning model과 non-reasoning model 모두에서 정확도를 높이며, 전체 set보다 DRE subset에서 더 큰 향상을 보인다.이 절차는 critic이 수용할 때까지 표시된 reasoning segment만, 필요한 경우에는 전체 응답을 resampling하며, N = 8회의 재시도에 도달하면 종료한다.
- Rejection Sampling: Segment-level rejection sampling은 generation model을 변경하지 않고 resampling해 DRE-free 응답을 얻으며, 이는 DRE가 대체로 방지 가능한 오류임을 시사한다.저자들은 critic-guided rejection sampling을 유망한 실용적 해법으로 규정하면서도, DRE 발생 빈도를 안정적으로 줄이는 일은 여전히 미해결 과제라고 지적한다.
5 소규모 Critic 학습
저자들은 SFT 후 RLVR을 적용해 경량 DRE detector인 Critic-4B를 학습하고, 여러 model과 table-question-answering dataset에서 일반화 성능을 평가한다. Critic-4B는 overall F1 78.16%를 기록해 Qwen3-4B-Instruct의 69.51%를 웃돌며, rejection sampling을 통해 inference를 개선한다.
- Critic 학습: Critic-4B는 response segment를 오류가 있으면 positive, 그렇지 않으면 negative로 분류해 DRE를 검출하며, table value를 전혀 인용하지 않는 response도 포함한다.critic은 table, question, response segment를 입력으로 받으며, 2단계 학습은 SFT warm-up 후 RLVR을 적용한다.
- 결과: overall F1 78.16%를 달성한 Critic-4B는 모든 evaluation scenario에서 Qwen3-4B-Instruct의 69.51%를 웃돌며, WTQ를 넘어 TableBench와 FinQA에도 일반화한다.평가는 다양한 table-question-answering task에서 reasoning model과 non-reasoning model이 생성한 response를 포괄한다.
- 결과: Critic-4B-Synthetic은 in-distribution setting에서 더 큰 성능 향상을 보이지만 FinQA와 Llama4-Scout에서는 성능이 하락하며, 이는 실제 DRE를 학습하기보다 synthetic-data bias에 과적합했음을 시사한다.이러한 하락은 domain이나 model이 synthetic-data setting과 크게 다를 때 나타난다.
- Inference 지원: Critic-4B를 사용한 rejection sampling은 rejection sampling을 사용하지 않는 경우보다 일관되게 accuracy를 높이며, 더 강력한 Sonnet-3.7+gt critic을 대체할 수 있는 경량·비용 효율적 방법을 제공한다.세 가지 generation model보다 모두 작고 extended thinking을 사용하지 않지만, Sonnet-3.7+gt보다 효과는 낮다.
6 결론
Data referencing errors는 LLM의 표 추론에서 만연한 약점으로, 응답 품질과 최종 정확도를 저해한다. 체계적 분석은 추론 시 완화 전략을 뒷받침하며, 최종 답변 정확도를 넘어 data referencing을 평가 차원으로 다룰 근거를 제시한다.
- DREs는 LLM의 표 추론에 만연하며 응답 품질과 최종 정확도를 모두 저해한다.
- 체계적인 LLM-as-a-Judge 분석은 DRE의 만연성을 입증하고, 완화를 위한 inference-time 전략과 경량 critic의 필요성을 제시한다.
- 더 신뢰할 수 있는 표 추론 시스템을 개발하려면 data referencing을 최종 답변 정확도와 함께 평가해야 한다.
제한점
이 연구는 표 관련 task에서 발생하는 data referencing errors에 한정되지만, 이러한 오류는 다른 domain과 modality에서도 발생한다. 또한 attention analysis와 steering experiment를 충분히 확대하지 못해 이러한 오류의 원인에 대한 탐구가 제한적이다.
- 범위: 유사한 오류가 다른 domain과 modality에서도 발생한다는 증거가 있음에도, 평가는 표 관련 task의 DREs만 다룬다.Cobbe et al. (2021b); Mirzadeh et al. (2025)는 Qwen3-8B가 얼음 조각 범주의 순서를 잘못 해석한 비표 형식 사례를 설명한다.
- 해석 가능성: 자원 제약으로 attention analysis와 steering experiment를 확대하지 못했기 때문에, 이 연구는 interpretability 관점에서 DRE 원인을 검토하지 않는다.향후 연구에서는 이 방향을 더 광범위하게 탐구할 수 있다.
- 해석 가능성: 예비 실험은 값을 참조하기 전에 전체 표에 대한 attention을 높이면 이후 DREs를 줄일 수 있음을 시사하며, 오류가 불충분한 attention과 연결됨을 보여준다.이 관찰은 향후 attention analysis와 steering experiment를 수행할 동기를 제공한다.
A LLM-as-a-Judge · B Critic-based Filtering
이 연구는 ground truth를 인지하는 LLM judge로 표 참조 정확도를 평가하고 인간에 가까운 판단 신뢰도를 보고하며, critic-based filtering을 통해 전체 평균 정확도와 critic이 선택한 부분집합의 정확도를 비교한다.
- A LLM-as-a-Judge: 데이터 참조 오류를 판단할 때 false negative를 완화하기 위해 Sonnet-3.7+gt에 ground-truth answer를 제공했다.프롬프트 설계에는 Section 3.2에 설명된 대로 ground-truth answer가 명시적으로 포함된다.
- A LLM-as-a-Judge: judge는 표 참조 정확도를 평가할 때 model response를 오직 table data와만 비교하도록 지시받았다.이러한 명시적 초점은 표 참조 평가를 더 광범위한 answer evaluation과 분리한다.
- A LLM-as-a-Judge: judge는 모든 부정확한 최종 답을 DRE로 취급하지 않고 calculation mistake와 실제 data-referencing error를 구분한다.한 예에서는 calculation error가 있었음에도 관련된 모든 table value를 정확히 추출하고 인용했다.
- A LLM-as-a-Judge: 예시 model은 최종 답이 reference answer와 달랐음에도 관련된 모든 table value를 정확히 추출하고 인용했다.이 불일치는 table-referencing error가 아니라 calculation error에 따른 것으로 판단되었다.
- A LLM-as-a-Judge: 세 명의 PhD 수준 annotator가 독립적으로 평가한 결과, Sonnet-3.7+gt의 판단은 92.67% average accuracy를 달성했다.평가는 critic evaluation dataset에서 100개 instance를 표본 추출했으며 인간에 가까운 신뢰도를 보였다.
- B Critic-based Filtering: Critic-based filtering은 전체 set에서 모든 sample의 average accuracy와 critic-selected subset의 accuracy를 비교한다.제공된 구절은 이 비교를 식별하지만 그에 해당하는 값은 제시하지 않는다.
C Synthetic Positives Construction
Synthetic positives는 표 또는 모델 응답에 data referencing errors(DREs)를 의도적으로 삽입한 뒤, 반복 추론에서 최종 답변이 바뀌는 사례만 유지해 구성한다. 네 가지 perturbation strategy는 값 교환과 행 누락을 포괄하며, 수정된 입력과 원래 응답 사이의 불일치로 DREs를 식별한다.
- DRE identification: 수정된 표와 원래 응답, 또는 원래 표와 수정된 응답이 완전히 일치하지 않으면 유지된 사례를 DRE로 판정한다.Synthetic positives는 perturbation 전에 최종 답변이 정확한 표와 응답에서 시작한다.
- Perturbation strategies: 네 가지 perturbation이 DREs를 생성한다. 행 또는 열 사이의 값 교환, 사용된 값이 포함된 행 삭제, 열거된 응답에서 나열된 행 제거가 이에 해당한다.앞의 두 strategy는 참조된 값을 바꾸면서 열 또는 행 중 하나를 유지하고, 뒤의 두 strategy는 표 또는 응답의 내용을 변경한다.
- Filtering criteria: Qwen3-8B가 추가로 세 번 추론을 수행하며, 최종 답변이 바뀐 사례만 유지한다.이 filtering step은 수정이 모델의 답변에 영향을 미치는 예시를 선택한다.
D 학습 세부사항 · E 생성 세부사항
학습에는 명시된 supervised fine-tuning 및 reinforcement-learning 설정을 사용하며, 생성 평가는 task-dependent metric, 제한된 TableBench subset, 권장 decoding 설정을 적용한다. 학습된 critic은 추론 시 greedy decoding을 사용한다.
- D 학습 세부사항: critic은 SFT로 2 epochs 학습한 후, prompt당 8 rollouts를 사용하는 GRPO 기반 RLVR로 20 epochs 학습한다.SFT에는 Llama-Factory (Zheng et al., 2024)를 사용하고, RLVR에는 verl (Sheng et al., 2024) 및 GRPO (Shao et al., 2024)를 사용한다.
- D 학습 세부사항: SFT에는 learning rate 1e-5, batch size 8, 2,000 examples를 사용하고, RLVR에는 learning rate 1e-6, batch size 256, temperature 1.0을 사용한다.추론 시 학습된 critic은 greedy decoding을 사용한다.
- E 생성 세부사항: ToTTO를 제외한 table-related task에서는 accuracy에 string matching을 사용하며, ToTTO에는 Yang et al. (2025b)에 따라 (BLEU + ROUGE-L)/2를 사용한다.ToTTO metric은 BLEU와 ROUGE-L의 평균이다.
- E 생성 세부사항: TableBench 평가는 Fact Checking과 Numerical Reasoning만 포함하며, 총 493 examples로 구성된다. 나머지 subset은 tested model의 capability를 초과하므로 제외한다.Data Analysis와 Visualization은 평가에서 제외된다.
- E 생성 세부사항: 생성 모델에는 Table 6에 자세히 제시된 recommended decoding hyperparameters를 사용한다.Table 6은 생성 모델에 사용된 decoding hyperparameters를 명시한다.
- E 생성 세부사항: Llama4-Scout 생성에는 fp4 quantized version을 사용한다.이는 generation setup에서의 implementation choice다.
F 윤리 강령
이 연구는 공개 데이터셋과 모델만 사용하며 윤리적·안전·개인정보 보호상의 위험이 없다고 보고한다. 관련 라이선스를 명시하고, LLM은 저자가 작성한 문장을 다듬는 데만 사용했다고 밝힌다.
- 이 연구는 공개 데이터셋과 모델을 사용하며 윤리적·안전·개인정보 보호상의 위험이 없다고 보고한다.
- 사용한 데이터셋과 모델의 라이선스는 Table 7에 명시되어 있다.
- LLM은 문장을 다듬는 데 사용되었으며, 모든 원문 내용은 저자가 작성했다.