Source-linked AI summary

When Single-Dataset Conclusions Fail: A 45-Task Study of Threshold Tuning and Resampling for Imbalanced Classification

Diyorbek Musaev

arXiv:2608.16147v1cs.AIcs.LG

TL;DR

불균형 처리 비교는 단일 데이터셋에서 수행되는 경우가 많아, 그 순위가 일반화되는지에 대한 근거가 제한적이다. 이 연구는 불균형 비율 1:1.5부터 1:178까지를 아우르는 45개 이진 분류 태스크를 평가하며, 네 개 모델 계열에서 2,025회 모델 적합을 수행한다. 전체 태스크에서 Random Forest는 다른 어떤 계열보다 threshold tuning의 이득이 크며, threshold-tuning benefit은 불균형 비율 1:15–1:40에서 ΔF1 = +0.120으로 정점에 이른다.

  • 문제

    불균형 처리 비교는 단일 데이터셋에서 수행되는 경우가 많아, 그 순위가 일반화되는지에 대한 근거가 제한적이다.

  • 방법

    이 연구는 불균형 비율 1:1.5부터 1:178까지를 아우르는 45개 이진 분류 태스크를 평가하며, 네 개 모델 계열에서 2,025회 모델 적합을 수행한다.

  • 결과

    전체 태스크에서 Random Forest는 다른 어떤 계열보다 threshold tuning의 이득이 크며, threshold-tuning benefit은 불균형 비율 1:15–1:40에서 ΔF1 = +0.120으로 정점에 이른다.

  • 시사점 및 한계

    방법론적으로 흠잡을 데 없는 단일 데이터셋 결과도 관심 대상에 대해서는 여전히 정반대일 수 있으므로, 불균형 처리 방법을 평가할 때 external validity가 필수적이다.

  • 시사점 및 한계

    이 태스크 모음에는 합성 태스크 30개와 세 개의 기반 출처에서 얻은 실제 태스크 15개만 포함되어 있어, 도메인 다양성과 external validity가 제한된다.

Abstract

from arXiv · show

Class-imbalance handling is routinely evaluated on a single benchmark dataset, and the resulting conclusions are reported as if they were properties of the method. We show this practice is unsafe. On the public Kaggle credit-card fraud dataset, under a leakage-free nested cross-validation protocol in which the decision threshold is selected on a held-out inner validation fold, a plain Random Forest at the default 0.5 threshold attains F1 = 0.861 +/- 0.021, and threshold tuning yields it no benefit (delta-F1 = -0.002). Read alone, this supports an appealing conclusion: for a well-calibrated ensemble, imbalance handling is unnecessary. We then apply the identical protocol to 45 binary tasks spanning imbalance ratios from 1:1.5 to 1:178 (2,025 model fits, four model families). The conclusion reverses. Random Forest benefits most from threshold tuning across the suite (delta-F1 = +0.101 +/- 0.134), not least, while three other families replicate their fraud-dataset behaviour almost exactly. SMOTE likewise harms the fraud dataset but helps across the suite (mean delta-F1 = +0.076; 138 wins, 39 losses; Wilcoxon p = 2.7e-17). Two further results. Threshold-tuning benefit is non-monotonic in the imbalance ratio: near zero below 1:5, peaking at +0.120 in the 1:15-1:40 band, declining to +0.045 beyond 1:100 - explaining why the fraud dataset, at 1:577, is an unrepresentative place to study the question. And we reject an intuitive heuristic: validation-set calibration error does not predict tuning benefit (expected calibration error r = -0.087; Brier r = +0.137), so calibration diagnostics cannot tell a practitioner whether tuning is worthwhile. We release the protocol, the 45-task harness, and all per-run metrics.

1. 서론

이 논문은 단일 데이터셋에서 도출한 불균형 처리 결론이 신뢰성 있게 일반화되지 않음을 보인다. 45개 task에서 threshold tuning과 SMOTE는 대체로 도움이 되지만, 효과는 model family와 불균형 정도에 따라 달라지며 calibration diagnostic은 tuning benefit을 예측하지 못한다.

  • Fraud dataset 결과: F1 = 0.861 ± 0.021: fraud dataset에서 threshold 0.5를 적용한 plain Random Forest는 tuning으로 얻는 이득이 없고(ΔF1 = -0.002), SMOTE는 성능을 악화시킨다.이 데이터셋에는 284,807건의 transaction이 포함되며, 그중 492건이 fraudulent case로, 해당 분야에서 가장 널리 사용되는 benchmark 중 하나다.
  • 45-task 연구: ΔF1 = +0.101: Random Forest는 45개 task 전반에서 threshold tuning의 이득을 가장 크게 보이며 fraud dataset 결과를 뒤집는 반면, 다른 세 model family는 데이터셋이 달라도 유사하게 행동한다.동일한 protocol하에서 불균형 비율 1:1.5부터 1:178까지와 2,025회의 model fit을 다룬다.
  • 일반화되는 결과: Mean ΔF1 = +0.059는 threshold tuning에서, +0.076은 SMOTE에서 dataset–model pair 전반에 나타나지만, 이득은 model에 크게 의존한다.SMOTE는 MLP에서 F1을 +0.170 향상시키지만 logistic regression에서는 +0.005에 그친다. threshold tuning은 138회 승리와 31회 패배를 기록한 반면, SMOTE는 138회 승리와 39회 패배를 기록한다.
  • 불균형 정도: ΔF1 = +0.120: threshold-tuning benefit은 중간 수준의 불균형(1:15–1:40)에서 정점에 이르고, 1:5 미만에서는 -0.009로, 1:100 초과에서는 +0.045로 감소한다.이 역U자 패턴 때문에 credit-card fraud처럼 불균형이 극심한 데이터셋은 threshold selection을 연구하기에 적절하지 않다.
  • Calibration diagnostic: r = -0.087: expected calibration error는 tuning benefit을 예측하지 못하며, Brier score correlation도 약할 뿐이다(r = +0.137).따라서 제안된 validation-set calibration diagnostic은 practitioner가 언제 threshold를 조정해야 하는지 식별하지 못한다.

2. 관련 연구

관련 연구는 class imbalance에 대한 표준 대응으로 threshold tuning, resampling, cost-sensitive weighting을 정립해 왔으며, 여러 데이터셋을 사용한 연구는 threshold tuning이 도움이 될 수 있음을 이미 보였다. 이 논문은 대신 external validity, 즉 한 데이터셋에서 얻은 깔끔한 결과가 일반적 주장을 뒷받침하는지를 다루며, 그러한 결론이 뒤집힐 수 있음을 보인다.

  • 기존 방법: Threshold tuning, resampling, cost-sensitive weighting은 class imbalance에 대응하기 위한 확립된 대안 전략이다.Threshold selection은 cost-sensitive classification과 ROC operating-point selection에서 비롯되며, SMOTE는 training distribution을 변화시킨다.
  • 기존 근거: 여러 데이터셋을 사용한 연구는 이미 폭넓은 threshold-tuning 이점을 보고했으며, Random Forest에서 상당한 향상을 포함하므로, 그 발견은 이 논문의 기여가 아니다.GHOST는 138개 public drug-discovery datasets에서 검증되었고, M-Tune은 이에 상응하는 결과를 보고한다.
  • 기여: 이 논문의 기여는 특정 모델에 intervention이 필요한지에 관한 단일 데이터셋 기반 주장이 반드시 전이되는 것은 아니며 뒤집힐 수도 있음을 보이는 데 있다.초점은 threshold tuning이 일반적으로 도움이 되는지가 아니라, 한 데이터셋에서 도출한 결론이 일반화되는지에 있다.
  • Fraud-dataset 문헌: 기존 credit-card fraud 연구는 resampling, ensembles, deep models 전반에서 강한 결과를 보고했지만, 문헌에는 leakage 및 validation 문제도 존재한다.보고된 문제에는 train/test splitting 전에 sampling을 수행한 것, 불명확한 보고, 불충분한 temporal validation, metric manipulation이 포함된다.
  • 타당성 구분: 내적 타당성에 초점을 둔 기존 연구와 달리, 이 논문은 권장되는 leakage controls를 적용하면서 external validity를 검토하고, 깔끔한 단일 데이터셋 결과도 여전히 오해를 불러일으킬 수 있음을 보인다.두 관심사는 상호 보완적이다. internal validity는 결과가 해당 데이터셋에서 충실한지를 묻는 반면, external validity는 그 결과가 일반적 주장을 정당화하는지를 묻는다.

3. 방법

연구들은 내부 validation fold에서만 threshold를 선택하고, 손대지 않은 test fold에서 이를 평가하는 leakage-free nested cross-validation protocol을 사용한다. 설계는 하나의 fraud dataset과 광범위한 imbalance ratio를 포괄하는 45-task suite에서 네 supervised model family와 intervention strategy를 비교한다.

  • 평가 protocol: Nested stratified cross-validation으로 test performance를 분리한다. preprocessing, fitting, resampling, threshold selection은 training data와 inner validation fold만 사용한다.fraud study는 five outer fold를 사용하고, 45-task suite는 계산 예산을 고려해 three outer fold를 사용한다. threshold는 0.01–0.99 범위에서 validation F1이 최대가 되도록 선택하거나, plain strategy에서는 0.5로 고정한다.
  • Metrics와 contrast: 분석은 precision, recall, F1, ROC-AUC, AUPRC, calibration error, Brier score를 보고하며, calibration 통계량은 validation fold에서 계산한다.threshold effect는 동일한 test fold 내 paired within-fold contrast로 평가해 fold 간 및 model 간 variance를 제거한다.
  • Models와 strategies: 비교에는 Logistic Regression, Random Forest, Histogram Gradient Boosting, MLP model에서 plain, tuned-threshold, class-balanced, SMOTE strategy가 포함된다.MLP는 구현에 class-weight support가 없어 class-balanced tuning을 제외한다. fraud study에는 autoencoder anomaly detector도 추가로 포함한다.
  • 연구 설계: Study A는 284,807 rows, 492 positives, 1:577 imbalance, five outer fold, 85 fits로 구성된 전체 Kaggle fraud dataset을 사용한다.Study B는 task당 three fold, four model family, four strategy로 구성되며 총 2,025 fits를 포함한다.
  • 연구 설계: Benchmark suite는 1:1.5부터 1:178까지의 imbalance ratio를 포괄하는 45 binary task로 구성되며, imbalance, class separation, dimensionality를 통제하는 30 synthetic task를 포함한다.또한 14 real task와 one rarefied breast-cancer task를 포함한다. Three fold, four model family, four strategy로 총 2,025 fits를 생성한다.

4. 연구 A: 신용카드 사기 데이터셋

신용카드 사기 데이터셋에서는 resampling, class weighting, threshold tuning을 사용하지 않은 가장 단순한 Random Forest 설정이 가장 우수했다. 이 결과만 보면 잘 calibration된 ensemble에서는 표준적인 imbalance handling이 불필요하며 오히려 역효과라는 결론을 내리기 쉽지만, 이 주장은 Section 5에서 검증한다.

  • 연구 A: 신용카드 사기 데이터셋: 가장 우수한 설정은 resampling과 class weighting을 사용하지 않고 default threshold를 적용한 plain Random Forest였다.Table 1은 각 model family에서 가장 강력한 설정의 five-fold nested cross-validation 결과를 보고한다.
  • 연구 A: 신용카드 사기 데이터셋: Threshold tuning은 중립적이었고(ΔF1 = -0.002), class weighting은 F1을 1.7포인트 낮췄으며 SMOTE는 F1을 2.3포인트, AUPRC를 1.0포인트 낮췄다.Random Forest에 적용한 모든 intervention은 default threshold, unweighted, non-resampled 설정에 비해 성능을 떨어뜨렸다.
  • 연구 A: 신용카드 사기 데이터셋: 이 데이터셋만 보면 imbalance handling은 잘 calibration된 ensemble에서 불필요하며 오히려 역효과라는 주장을 뒷받침하고, 이는 Section 5의 검증을 유도한다.이 대목은 single-dataset 연구에서 이러한 유형의 결론이 관행적으로 제시된다는 점을 지적한다.

5. 연구 B: 결론이 뒤집히다

45개 binary task에서 Random Forest는 fraud dataset의 결론을 뒤집는다. threshold tuning의 효과가 가장 큰 모델은 Random Forest였고, 다른 세 model family는 앞서 관찰된 거동을 재현했다. SMOTE는 전체적으로 유익하지만 model에 따라 효과가 크게 달랐으며, threshold-tuning benefit은 imbalance ratio에 대해 역U자형을 보여 1:577 fraud dataset은 대표성이 낮다.

  • Model-family 비교: Random Forest는 fraud-dataset 결과를 뒤집는다. 해당 데이터셋에서는 threshold tuning이 무익했지만, 전체 task에서는 두 번째로 높은 family보다 44 F1 points만큼 더 큰 효과를 보였다.네 family 중 세 개는 fraud-dataset에서의 거동을 0.02 F1 이내로 재현했다. Figure 1은 이 대비를 보여준다.
  • Model-family 비교: Random Forest를 default-threshold로 배포하면 전체 task에서 평균 10 F1 points를 놓치게 된다.Study A의 결론은 fraud dataset의 Random Forest에 적용되는 것이지, Random Forest 일반에 적용되는 것은 아니다.
  • Resampling: SMOTE는 전체 task에서 평균적으로 유익하며, fraud-dataset에서의 결과를 뒤집는다. 해당 데이터셋에서는 Random Forest F1을 2.3 points, Logistic Regression F1을 9.2 points 낮췄다.전체 task와의 비교는 Table 3에서 dataset-model 수준으로 paired 분석을 수행했다.
  • Resampling: SMOTE의 효과는 model에 따라 다르다. MLP에서는 +0.170, Random Forest에서는 +0.092, Histogram Gradient Boosting에서는 +0.036, Logistic Regression에서는 +0.005였다.Logistic Regression의 거의 0에 가까운 효과는 무효과와 구분되지 않으므로, resampling을 일괄적으로 권고하거나 반대할 근거는 없다.
  • Imbalance-ratio 분석: Threshold-tuning benefit은 역U자형을 따른다. 경미한 imbalance에서는 약간 해롭고, 1:15–1:40에서 정점에 이르며, 1:100을 넘으면 감소한다.극심한 imbalance에서는 validation positive가 너무 적어 F1을 최대화하는 threshold가 불안정해지고 test fold에 잘 일반화되지 않을 수 있다.
  • Imbalance-ratio 분석: 1:577에서 fraud dataset은 threshold tuning의 효과가 가장 작고 추정 신뢰도도 가장 낮은 regime에 놓이므로, threshold selection 연구에 대표성이 없다.이로써 fraud dataset의 높은 인지도에도 Study A의 결론이 일반화되지 않는 이유를 설명할 수 있다.

6. Threshold Tuning의 이점을 무엇이 예측하는가?

Calibration error는 threshold-tuning benefit을 예측하는 데 쓸 수 있는 사전 신호를 제공하지 않는다. 전역 관계가 없거나 go/no-go 판단에 사용하기에는 너무 약하다. Tuning 비용이 낮으므로, 방어 가능한 권고는 validation fold에서 항상 tuning을 수행하고 threshold 선택을 맡기는 것이다.

  • Family별 관계: Histogram Gradient Boosting에서는 r = +0.259이지만, Logistic Regression, MLP, Random Forest에서는 family 내부 연관성이 나타나지 않는다.MLP의 평균 calibration error는 0.086으로 가장 크지만, 다른 family의 0.012–0.027보다 크면서도 평균 tuning benefit은 가장 작다.
  • Predictor로서의 calibration: Calibration error는 decision threshold를 tuning할지 결정하는 데 쓸 수 있는 diagnostic이 아니다.Expected calibration error는 tuning benefit과 상관이 없고, Brier score는 분산의 2% 미만만 설명하므로 go/no-go 판단에 실질적으로 쓸모가 없다.
  • 기록된 다른 predictor: Brier score의 경우 r = +0.137, log imbalance ratio의 경우 r = +0.138이며, AUPRC는 r = -0.162로 약한 음의 관계를 보인다.|r| < 0.09이므로 sample size와 dimensionality는 유의미한 정보를 제공하지 않는다.
  • 실천적 함의: 항상 threshold tuning을 수행하고 validation fold가 결정하도록 하라. fitted model에 대해 한 번 sweep하는 데는 retraining이 필요하지 않기 때문이다.Tuning이 도움이 되지 않을 때는 validation fold가 0.5에 가까운 threshold를 선택하므로 손실이 거의 없다.

7. 논의

논의는 단일 데이터셋에서 깔끔하게 나온 결과가 다양한 task에서 뒤집힐 수 있음을 보여주며, 불균형 처리에 관한 주장에는 external validity가 필수적임을 강조한다. 또한 validation fold에서의 threshold 선택을 일상적으로 수행하고, model별로 resampling을 결정하며, 더 폭넓은 다중 데이터셋 평가를 실시할 것을 권고하는 한편 중요한 설계상의 한계를 인정한다.

  • 한계: 45개 task 중 30개가 synthetic이고, 15개의 real task가 세 출처에서 왔으며, 확립된 real-world benchmark를 이용할 수 없어 이 suite에는 한계가 있다.외부 데이터 다운로드가 차단되어 확립된 imbalanced benchmark collection 여러 개를 포함할 수 없었다.
  • 한계: 최대 imbalance는 fraud dataset의 1:577에 비해 1:178이었으므로, inverted-U decline에 대한 근거가 제한되고 validation positive가 적다는 설명도 추론에 머문다.제안된 설명은 적은 validation positive로 인한 불안정한 threshold 추정이지만, 이를 직접 입증하지는 않았다.
  • 한계: 해석은 다섯 fold가 아닌 세 fold, F1-based evaluation, 그리고 temporal이 아닌 random validation으로도 제약된다.세 fold는 suite의 confidence interval을 넓히며, F1은 deployment cost와 맞지 않을 수 있고, fraud 분석은 temporal validation의 부재를 그대로 물려받는다.
  • 실무자를 위한 시사점: 실무자는 validation fold에서 threshold를 일상적으로 선택하고, calibration diagnostic을 의사결정에 사용하지 않으며, resampling을 model-specific하게 다뤄야 한다.Threshold 선택은 비용이 낮고 평균적으로 유용한 것으로 설명되며, resampling은 neural network에서는 시도할 가치가 크지만 logistic regression에서는 효과가 미미하다.
  • 논의: Fraud data에서 F1 = 0.861 ± 0.021이었지만, 45개 task 전체에서는 Random Forest가 threshold tuning의 혜택을 가장 크게 받았고 SMOTE는 유해한 처리에서 유익한 처리로 바뀌었다.Fraud 결과는 방법론적으로 깔끔했지만, suite는 그것이 해당 데이터셋에 특유한 artifact였음을 보여주었다.
  • 논의: 방법론적으로 흠잡을 데 없는 single-dataset findings도 관심 대상에 대해서는 여전히 정반대일 수 있으므로, imbalance-handling 주장에는 여러 데이터셋에 걸친 근거가 필요하다.논의는 leakage-free protocol과 정직한 threshold 선택 같은 internal validity와, 그동안 간과된 external validity를 구분한다.

재현성

두 연구 모두 공개된 코드와 run별 metric을 통해 재현할 수 있다. 고정 seed, 짧은 실행 시간, 소비자용 하드웨어, 표준 Python 의존성이 실용적인 재현을 뒷받침한다.

  • 재현성: 공개된 코드가 두 연구를 모두 구현하며, nested cross-validation 85개 행과 다중 데이터셋 run별 metric 2,025개를 제공한다.Study B는 중단 후 재개할 수 있다.
  • 재현성: 전체 과정에서 고정 random seed를 사용해 보고된 run을 결정론적으로 재현할 수 있다.
  • 재현성: Study A는 GPU 없이 소비자용 노트북에서 약 9분, Study B는 약 8분이 걸린다.
  • 재현성: 구현에는 scikit-learn, imbalanced-learn, pandas, NumPy, SciPy, Matplotlib만 필요하다.
Loading 2608.16147v1…