Source-linked AI summary
Beyond IID: How General Are Tabular Foundation Models, Really?
Lennart Purucker, Andrej Tschalzev, Nick Erickson, Gioia Blayer, David Holzmüller, Alan Arazi, Alexander Pfefferle, Mustafa Tajjar, Gaël Varoquaux, Frank Hutter
TL;DR
테이블형 foundation model의 벤치마킹은 분산되어 있으며 IID task에 집중되어 있다. 이 논문은 142개 다양한 dataset에서 11개 model을 평가하기 위해 BeyondArena와 DataFoundry를 도입하고, foundation model이 소규모에서 중간 규모의 IID data에서는 우수하지만 non-IID, 대규모, 고차원 설정에서는 성능이 뒤처진다는 사실을 보인다.
문제
테이블형 foundation model은 다양한 연구 공동체에서 평가되고 있지만, 테이블 연구 benchmark는 여전히 분산되어 있고 대체로 IID task에 한정되어 있다.
방법
BeyondArena는 task type, dataset scale, feature type 전반의 평가를 통합하고, DataFoundry는 재현 가능한 테이블 dataset curation을 지원한다.
결과
테이블형 foundation model은 소규모에서 중간 규모의 IID data에서는 우수하지만, non-IID, 대규모, 고차원 data에서는 전통적 method보다 성능이 뒤처진다.
시사점 및 한계
BeyondArena는 현재의 테이블형 foundation model이 테이블 data에 대해 아직 완전히 일반적이지 않음을 보이고, 향후 연구를 위한 더 광범위한 과제를 제시한다.
시사점 및 한계
결론은 fine-tuning 없이 in-context learning을 평가하고, 3개의 foundation model만 선택하며, compute 제약하에서 model을 tuning했다는 점에 의해 제한된다.
Abstract
from arXiv · showhide
Foundation models for predictive machine learning on tabular data have recently gained significant traction in academia and industry. Research communities across disciplines are increasingly evaluating tabular foundation models on diverse datasets and tasks. However, these task- and discipline-specific evaluations remain largely inaccessible to model researchers because benchmark software and evaluation protocols are fragmented. As a result, model researchers rely on standard benchmarks, which are mostly defined for tasks where tabular foundation models already excel. The most challenging scenarios are excluded, limiting meaningful progress in the field by focusing on marginal improvements on IID data rather than on broader, more demanding challenges. To overcome this, we introduce BeyondArena, the first unified holistic benchmark for tabular data that supports diverse task types (IID, temporal, grouped), across sample size and feature dimensionality scales, with diverse feature types (with text, with high cardinality) from a broad range of disciplines. To enable unified benchmarking beyond standard benchmarks, we introduce Data Foundry, a Python framework and metadata schema for curating tabular datasets for predictive machine learning. Our results across 11 models and 142 curated datasets show that existing tabular foundation models excel on tiny- to medium-sized IID data, while traditional tree-based and deep learning models still dominate on non-IID, large, and high-dimensional datasets. BeyondArena guides model research for the most demanding challenges in tabular data, enabling progress towards truly foundational tabular models.
1 서론
BeyondArena는 다양한 dataset을 curated하고 benchmarking을 표준화하며 3개의 open-source TFM과 8개의 traditional baseline을 평가해 tabular foundation model의 파편화되고 IID에 편중된 평가를 다룬다. 결과에 따르면 TFM은 tiny, small, IID data에서 우세하지만 non-IID, large-scale, high-dimensional, high-cardinality categorical dataset에서는 경쟁력을 보이지 못한다.
- 동기: 이 연구는 다른 커뮤니티에서 다양한 TFM 평가가 이루어지고 있음에도 tabular 연구가 대체로 IID task에 머물러 있다는 점을 지적하며 더 폭넓은 평가의 필요성을 제시한다.BeyondArena는 academic evaluation과 실무자의 real-world predictive application 사이의 격차를 줄이는 것을 목표로 한다.
- Benchmark와 평가: BeyondArena는 1128개에서 142개 dataset을 수작업으로 curated하고, 다양한 task에서 3개의 state-of-the-art open-source TFM을 8개의 강력한 traditional baseline과 비교 평가한다.이 benchmark는 standard IID evaluation을 넘어 predictive tabular classification과 regression을 대상으로 한다.
- Data curation: DataFoundry는 다양한 scale과 feature type에 걸쳐 재현 가능한 tabular dataset curation을 지원하는 Python framework와 metadata schema를 제공한다.더 넓은 ecosystem은 이러한 기여를 TabArena에 통합해 tabular-model evaluation의 파편화를 줄인다.
- 범위: BeyondArena는 100에서 1M sample 규모의 classification과 regression에 초점을 맞추며, temporal 및 grouped data와 high-cardinality categorical 및 text feature를 포함한다.100 sample 미만의 few-shot prediction, feature로서의 image, survival analysis, relational learning은 범위에서 제외된다.
- 결과: TFM은 tiny, small, IID data에서 우세하지만 non-IID, large-scale, high-dimensional, high-cardinality categorical dataset에서는 traditional tree-based 및 deep learning model과 경쟁하지 못한다.평가는 temporal 및 grouped non-IID setting과 다양한 scale 및 feature type을 포괄한다.
2 배경: IID 및 non-IID Tabular Data
BeyondArena는 데이터셋 자체가 아니라 애플리케이션에 적합한 train-test split에 따라 tabular data를 IID 또는 non-IID로 분류한다. 구조화되지 않은 test sample에는 random split이 적합하지만, 애플리케이션이 미래 관측치나 관측되지 않은 group을 대상으로 할 때는 temporal 또는 grouped split이 필요하다.
- 애플리케이션 의존적 정의: 적절한 IID 또는 non-IID 분류는 practitioner의 애플리케이션과 그에 필요한 train-test split에 따라 달라진다.동일한 transaction data라도 사후 fraud investigation에는 random IID split이, 실시간 prevention에는 temporal non-IID split이 필요할 수 있다. 잘못된 split을 사용하면 temporal leakage를 비롯해 성능을 잘못 추정할 수 있다 [15] [75].
- 애플리케이션 의존적 정의: BeyondArena는 애플리케이션 의존적 split 선택을 data curation과 academic benchmarking으로 확장한다.이 관점은 practitioner의 평가 선택과 benchmark의 다양한 애플리케이션 데이터 구성 방식을 연결한다.
- IID Tabular Data: IID data에서는 test sample이 특정 구조를 따르지 않으므로 random split이 가능하다.이 정의에서는 무작위로 sampling한 data를 hold out한다.
- Non-IID Tabular Data: Non-IID data에서는 애플리케이션 구조를 반영하기 위해 temporal 또는 grouped split이 필요하다.Temporal split은 time index를 사용해 test sample을 training data보다 엄격히 이후에 배치하고, grouped split은 group index를 사용해 각 group 전체를 training 또는 test 중 한쪽에만 배치한다.
3 관련 연구
기존 tabular benchmark는 주로 IID task를 대상으로 한 반면, non-IID benchmark는 주로 temporal data에 초점을 맞췄다. BeyondArena는 공유 metadata, 더 폭넓은 dataset과 baseline, task 및 multimodal data type 전반에 걸친 엄밀한 평가를 통해 IID와 non-IID 평가를 통합한다.
- IID Tabular Benchmark: 기존 tabular benchmark는 주로 IID predictive task에 초점을 맞췄으며, model development, tabular deep learning, AutoML, data-centric evaluation을 위한 benchmark를 포함한다 [85] [87] [89] [90] [93] [94] [95] [96] [97] [99] [103].
- Non-IID Tabular Benchmark: non-IID tabular data에 관한 더 폭넓은 연구가 수십 년간 이어졌음에도, non-IID tabular benchmark는 주로 temporal data에 초점을 맞췄다.
- Non-IID Tabular Benchmark: BeyondArena는 더 많은 temporal dataset, 더 많은 baseline, tabular foundation model을 지원하도록 TabReD를 확장한다 [15] [165] [166].
- BeyondArena는 대표적인 dataset을 하나의 공유 metadata 형식으로 큐레이션하고 task 및 multimodal data type 전반에서 state-of-the-art tabular model을 평가함으로써 IID와 non-IID benchmarking을 통합한다.
4 데이터셋 큐레이션
BeyondArena는 non-IID task, 이례적인 sample size, text 또는 date feature로 범위를 확장해 까다로운 현실 세계 tabular prediction을 위한 데이터셋을 큐레이션한다. Data Foundry는 Python framework, processing notebook, machine-readable metadata를 통해 이 큐레이션을 재현 가능하게 한다.
- 데이터셋 선택 기준: 큐레이션 기준은 IID, temporal, grouped task, 최소 100개의 training sample, 500개 미만 또는 100,000개 초과의 training sample을 가진 데이터셋을 지원한다.데이터셋과 predictive task는 benchmark 내에서 서로 겹치지 않아야 하며, 적절한 random, temporal 또는 grouped validation protocol을 사용해야 한다.
- 데이터셋 선택 기준: BeyondArena는 non-IID application 및 더 넓은 dataset-size scale과 함께 text 및 date feature를 포함하는 tabular data로 데이터셋 범위를 확장한다.이 기준은 기존 TabArena 선택 기준보다 까다로운 현실 세계 predictive machine-learning application을 더 잘 대표하도록 설계되었다.
- Data Foundry: Data Foundry는 데이터셋 검사와 train-test split을 위한 Python package를 제공하며, 각 데이터셋에 사용된 정확한 processing code를 담은 notebook도 제공한다.이 framework와 metadata schema는 광범위한 데이터셋 큐레이션을 재현 가능하게 하는 것을 목표로 한다.
- 데이터셋 출처: 데이터셋은 21개의 tabular benchmark study에서 수집되었으며, 여기에는 14개의 기존 benchmark에서 재평가한 304개 데이터셋과 추가적인 non-IID 또는 multimodal source가 포함된다.source 검색은 public data repository와 7개의 non-IID 또는 multimodal tabular benchmark도 포함했다.
- 데이터셋 처리: 선정된 각 데이터셋에는 통일된 format, feature-type annotation, task metadata, machine-readable curation note를 적용해 표준화했으며, 필요한 경우 feature engineering도 수행했다.저장된 metadata에는 train-test split, target column, group 또는 time-index column이 포함된다.
- 큐레이션 결과: 수집한 1128개 데이터셋 중 142개가 선택 기준을 충족했으며, 조사한 데이터셋의 약 12.6%가 BeyondArena에 선정되었다.필터링 과정에서는 주로 중복 데이터셋, 현실에 존재하지 않는 application, predictive task를 목적으로 처음부터 만들어지지 않은 데이터셋을 제외했다.
5 실험 설계
BeyondArena는 재현 가능한 오픈소스 구현, 과제에 맞는 validation 및 preprocessing, 그리고 IID 및 non-IID 설정 전반의 견고한 metric을 사용해 11개의 경쟁력 있는 tabular model을 평가한다. TabPFN-2.6과 TabDPT의 model 적용 범위는 sample size, pretraining, computational limit에 의해 제한된다.
- BeyondArena 모델: 이 benchmark는 linear, tree-based, neural-network, tabular foundation model을 아우르는 11개 model을 비교하며, Random Forest, CatBoost, LightGBM, XGBoost, TabDPT [193], TabPFN-2.6 [194], TabICLv2 [196]를 포함한다.model은 TabArena, TALENT [112], TabReD [15]에서의 경쟁력 있는 성능을 기준으로 선정했다.
- BeyondArena 모델: TabPFN-2.6과 TabDPT는 training sample이 최대 100k개인 dataset에서만 실행하며, TabPFN-2.6은 pretraining limit 내로 유지하고 TabDPT는 retrieval-based inference가 computationally infeasible하기 때문에 제한한다.1 million-sample dataset에서 cross-validation을 수행하면 TabDPT에는 8 million forward pass가 필요하며, 두 model의 누락된 결과는 default Random Forest 성능을 사용해 impute한다.
- 오픈소스 구현: benchmark는 unit-tested 오픈소스 AutoGluon 기반 구현 [181]을 사용하며, 이를 수정해 더 큰 dataset으로 확장하고 unseen category와 같은 non-IID task를 올바르게 처리한다.BeyondArena는 TabArena [11]를 기반으로 하며 non-IID validation support를 추가한다.
- Outer Split과 Inner Validation: validation은 dataset 크기에 의존하는 repeated outer cross-validation과 inner tuning split을 사용하며, stratified classification, random IID split, grouped task를 위한 grouped split, temporal task를 위한 time-binned interval을 적용한다.training sample이 500개 미만인 dataset에는 overtuning을 방지하기 위해 5-repeated 5-fold inner cross-validation을 사용한다.
- Multimodal 및 non-IID Preprocessing: 일반적인 model-agnostic preprocessing pipeline은 date, text, grouped data를 처리하고, model-specific extension은 scaling 및 categorical encoding과 같은 operation을 유지한다.이 pipeline은 multimodal non-IID data를 위해 설계되었으며 TabArena의 preprocessing을 확장한다.
- Metric: 평가에는 binary classification에 ROC AUC, multiclass classification에 log-loss, regression에 RMSE를 사용하며, 이는 기존 benchmark [11] [15] 및 machine-learning 문헌 [210]에 부합한다.ROC AUC는 threshold tuning 의존성을 피하고, log-loss는 proper scoring rule 이며, RMSE는 point prediction을 평가한다.
6 결과
142개 데이터셋 전반에서 tabular foundation model은 초소형에서 중간 규모의 IID 데이터에서는 뛰어나지만, non-IID, 대규모, 고차원, 고카디널리티 설정에서는 전통적 모델의 성능에 미치지 못한다. 그럼에도 데이터셋의 70%에서 최고 성능을 달성하거나 최상위 non-TFM과 동률을 이루며, ablation 결과는 benchmark 설계를 전반적으로 뒷받침한다.
- 평가 범위: BeyondArena는 task type, dataset scale, feature characteristic을 아우르는 12개 sub-benchmark를 통해 일반화 성능을 평가한다.benchmark는 IID, grouped, temporal task, 여러 dataset scale, 그리고 text와 high cardinality를 포함하는 feature 설정을 다룬다.
- 전체 benchmark 결과: TFM은 small, tiny, IID dataset에서 가장 우수한 성능을 보이지만, temporal, grouped, 대규모, 고차원, 고카디널리티 데이터에서는 전통적 모델과 경쟁하지 못한다.전통적 모델, 특히 RealMLP는 tuning과 ensembling을 통해 상당한 이점을 얻는 반면, TFM의 default training cost는 여전히 유의하게 낮다.
- 최고 성능 도달 범위: 데이터셋의 70%에서는 TFM으로 최고 성능을 달성할 수 있다. TFM은 49%에서 다른 모델을 유의하게 능가하고, 추가 21%에서는 최상위 non-TFM과 동률을 이룬다.TabICLv2는 데이터셋의 19%에서 첫 번째 순위를 차지했으며, TabPFN-2.6이 10.5%로 그 뒤를 이었다.
- Ablation study: BeyondArena의 grouped-data preprocessing은 평균 성능을 향상시키며, L-P-G 데이터에서는 순위가 대부분 안정적으로 유지되고, 긴 text는 일반적으로 TF-IDF에 유리하지만 model ranking을 실질적으로 바꾸지는 않는다.preprocessing을 비활성화하면 TabPFN-2.6의 성능이 크게 향상되며, calibration은 TabPFN-2.6과 RealMLP를 제외하면 대체로 log-loss를 개선한다.
7 결론
BeyondArena와 DataFoundry는 다양한 tabular task, dataset, feature type, model에 걸친 표준화된 평가를 확립해 현재 tabular foundation model의 한계를 드러낸다. 또한 더 폭넓은 평가를 위한 방법론적 한계와 향후 확장 방향을 제시한다.
- BeyondArena와 DataFoundry는 IID, temporal, grouped task, dataset 규모, dimensionality, feature type을 아우르는 142개 dataset과 11개 model에서 재현 가능한 평가를 지원한다.
- Tabular foundation model은 small- to medium-scale IID data에서 우수한 성능을 보이지만 traditional method보다 성능이 낮다.
- 한계와 사회적 영향: 이 연구는 25개의 random model configuration, fine-tuning이 아닌 in-context learning, 그리고 상위 3개의 TabArena TFM만 평가한다.
- 향후 연구: 향후 연구에서는 BeyondArena를 few-shot prediction, multimodal tabular data, relational learning, survival analysis로 확장할 수 있다.
- BeyondArena는 현재 tabular foundation model의 critical limitation을 드러내는 더 폭넓은 평가 기준을 확립한다.
이해상충
저자들은 평가 대상 모델, benchmark 및 software 프로젝트, 그리고 tabular foundation model을 개발하는 기업과 광범위한 연계가 있음을 공개한다.
- 이해상충: 저자에는 RealMLP, TabPFN-2.6, TabICLv2, TabArena, AutoGluon, skrub, scikit-learn과 관련된 개발자, 유지관리자, 기여자 또는 창립자가 포함되며, Prior Labs 및 probabl 소속도 포함된다.이러한 관계에는 모델 저술, 프로젝트 유지관리, software 기여, 창립자 역할 및 기업 소속이 포함된다.
부록 … B.4 큐레이션 결과 세부 사항
BeyondArena의 큐레이션 과정은 temporal tabular task와 time-series forecasting을 구분하고, 명시적인 데이터셋 선정 및 처리 안전장치를 적용하며, 애플리케이션 도메인과 데이터셋 규모 전반을 폭넓게 포괄한다. 메타데이터가 문서화되지 않은 경우가 많고 자동화된 큐레이션은 환각을 일으킬 수 있으므로, 이 benchmark는 subject-matter expertise와 문서화된 결정에 크게 의존한다.
- A 배경: temporal tabular regression에 forecasting data를 사용하면 실제 맥락을 무시하게 되며, 실무적 관련성이 의문스러운 validation setup에서 성능을 추정하게 된다.따라서 이 구분은 데이터 큐레이션과 benchmark 성능의 해석 모두에 영향을 미친다.
- B.1 자동화된 데이터 큐레이션을 향하여?: repository에 구조화된 메타데이터가 부족하고 agentic LLM이 환각되었거나 잘못된 판단을 내렸기 때문에 automated dataset selection은 신뢰하기 어려웠으며, subject-matter expertise가 필요했다.저자들은 기준에 주관적인 인간의 해석이 개입되므로 큐레이션의 통찰과 결정도 공개적으로 공유한다.
- 부록: 선정이 주관적인 인간의 해석에 의존하고 Erickson et al. [11]의 선행 연구를 따르기 때문에 큐레이션 결정과 기준을 공개적으로 문서화한다.공개 기록은 데이터셋별 큐레이션 통찰과 결정을 드러내는 것을 목적으로 한다.
- A.1 Time-series Forecasting Task와 Temporal Tabular Task의 비교: BeyondArena는 random, temporal, grouped tabular task를 포함하지만, 대표성 있는 평가를 위해서는 다른 validation protocol이 필요하므로 time-series forecasting은 제외한다.Forecasting은 미래를 예측하는 반면, temporal tabular validation은 task에 따라 미래 데이터를 사용할 수도, 사용하지 않을 수도 있다. 둘을 혼동하면 validation이 대표성을 잃을 수 있다 [81] [82] [83] [84].
- B.3 데이터셋 처리 세부 사항: Processing은 정보가 없는 식별자를 제거하고, 신뢰성 있게 추론된 proxy missing value를 NA로 변환하며, 이름과 feature type을 표준화하고, 가능한 경우 날짜를 재구성하여 데이터셋을 표준화한다.시간 인덱스와 같은 정보성 식별자는 유지하며, 편향된 numerical target에는 사례별로 logarithmic scaling을 적용할 수 있다. object 또는 string feature에는 categorical type 또는 string type을 할당한다.
- B 데이터셋 큐레이션: Temporal task 구성은 prediction horizon과 test time을 수동으로 정의하고, prediction time에 feature를 사용할 수 있는지 검증하며, future-information leakage와 grouped temporal leakage를 방지하도록 데이터를 필터링한다.또한 하나의 entity에서 발생한 여러 transaction처럼 동일한 entity의 시간에 따른 반복 관측을 분석한다.
- B.4 큐레이션 결과 세부 사항: 큐레이션된 데이터셋은 광범위한 애플리케이션 도메인과 데이터셋 규모를 포괄하며, healthcare, marketing, finance가 두드러지고 medical dataset은 대체로 더 작다.Figure B.1은 도메인별 개수를 보고하고, Figure B.2는 도메인별 행과 열의 변동을 특성화한다.
B.5 BeyondArena 데이터셋 개요 … D.2 표로 제시한 BeyondArena 리더보드
BeyondArena는 다양한 도메인, 규모, feature type, task structure를 포괄하는 142개 데이터셋으로 구성되며, 평가는 데이터셋별 preprocessing과 4시간 configuration limit을 사용한다. 또한 결과는 inference-time trade-off를 특성화하며, CatBoost가 inference-time Pareto front를 선도하고 TabICLv2와 TabPFN-2.6은 훨씬 높은 inference cost를 감수하는 대신 tuned CatBoost보다 향상된 성능을 보인다.
- B.5 BeyondArena 데이터셋 개요: BeyondArena는 다양한 도메인, sample 및 feature 규모, text feature, categorical cardinality, 그리고 IID, temporal, grouped task를 포괄하는 142개 데이터셋으로 구성된다.Table B.1은 rows, columns, classes, problem type, task type을 포함한 데이터셋별 metadata를 제공한다.
- C.1 시간 제한의 영향: 이 benchmark는 train split에서 각 configuration에 4시간 제한을 적용하므로, 1시간인 TabArena 제한보다 더 큰 데이터셋을 허용한다.모델이 제한 시간 내에 모든 inner fold를 완료하지 못하면 training을 조기에 중단한다.
- C.1 시간 제한의 영향: 전체 job 중 ∼0.003%, 즉 785,208개 중 31개만 4시간 제한을 초과했으며, 이는 runtime cap에 도달하는 경우가 드물었음을 보여준다.약 1.72%는 1시간을 초과했고 ∼0.01%는 3.5시간을 초과했다.
- C.2 추가 세부사항: 실험 설정은 minority-class sample이 부족할 때 cross-validation fold 수를 줄이고, specialized datetime, text, grouped-data preprocessing을 적용한다.Grouped preprocessing은 within-group aggregation에 기반한 transductive 50-dimensional group encoding을 사용한다.
- D. 결과: Inference-time 비교에는 default, tuned, post-hoc-ensembled model이 포함되며, transformer foundation-model의 default performance는 in-context learning performance와 동일하게 취급한다.Figure D.1은 이에 해당하는 Improvability와 inference-time 간 Pareto front를 제시한다.
- D.1 Inference Time 개요: CatBoost가 inference-time Pareto front를 지배하는 반면, TabICLv2와 TabPFN-2.6은 tuned CatBoost보다 2.5% 향상된 성능을 훨씬 긴 inference time으로 달성한다.Tuned RealMLP는 더 긴 inference time을 초래한다.
- D.2 표로 제시한 BeyondArena 리더보드: 결과 절에서는 Table D.1에 모든 BeyondArena 데이터셋에 대한 model별 performance를 보고한다.제공된 passage는 leaderboard table을 식별하지만 해당 cell value나 model ranking은 제공하지 않는다.
D.3 동일 범위의 TabArena-v0.1 데이터셋과 BeyondArena 데이터셋 · E 통계 분석 · E.1 검정 1: 방법들은 실제로 서로 다른가?
TabArena의 범위에 포함되는 BeyondArena 데이터셋은 tabular foundation model에 더 challenging하며, 통계 검정 결과 leaderboard 차이는 실제로 존재하고 대부분의 방법 쌍을 구분할 수 있다.
- D.3 동일 범위의 TabArena-v0.1 데이터셋과 BeyondArena 데이터셋: 동일 범위 비교에서 tabular foundation model은 49개 TabArena 데이터셋에서 우세하지만, 20개의 새로운 BeyondArena 데이터셋에서는 RealMLP에 의해 성능이 앞선다.비교에는 승인된 TabArena 데이터셋 49개와 TabArena의 IID 및 sample-size 기준을 충족하는 데이터셋 20개가 사용된다.
- D.3 동일 범위의 TabArena-v0.1 데이터셋과 BeyondArena 데이터셋: Table D.1은 default, tuned, tuned-plus-ensembled 성능과 Elo 값에 대한 근사적 95% bootstrap confidence interval을 보고한다.100k sample을 초과하는 데이터셋에 대해서는 TabPFN-2.6 및 TabDPT 결과를 대치한다.
- E 통계 분석: 통계 분석에서는 27개 방법을 비교하며, ROC AUC, log-loss, RMSE를 대상으로 cross-validation fold 전체에서 평균한 데이터셋별 normalized error를 사용한다.각 데이터셋에서 방법은 best (0)부터 worst (1)까지 점수를 받아 heterogeneous task 간 비교가 가능해진다.
- E.1 검정 1: 방법들은 실제로 서로 다른가?: Friedman test는 142개 데이터셋에서 27개 방법의 rank distribution이 모든 방법이 동등하다는 가설과 양립하는지 평가한다.각 데이터셋 내에서 방법의 순위를 매겨 global comparison에서 데이터셋 수준의 변동을 반영한다.
- E.1 검정 1: 방법들은 실제로 서로 다른가?: Pairwise Wilcoxon signed-rank test는 데이터셋별 paired normalized-error 차이와 Holm correction을 사용해 전체 351개 방법 쌍을 비교한다.Two-sided test는 paired difference가 0을 중심으로 대칭적으로 분포하는지 평가하며, p < 0.05일 때 H0를 기각한다.
- E.1 검정 1: 방법들은 실제로 서로 다른가?: 351개 방법 쌍 중 260개(74.6%)에서 Holm correction 후에도 성능 차이가 남아, 대부분의 방법을 신뢰성 있게 구분할 수 있음을 보여준다.이 결과는 leaderboard ranking이 무작위 변동만으로 설명될 가능성이 낮다는 global Friedman 결론을 더욱 뒷받침한다.
E.2 테스트 2: 어느 training-set size부터 TFM 사용이 합리적 선택이 아니게 되는가? … F.3 (Inner Splits, B.1) Tiny Data에 8-fold Cross-Validation 사용
BeyondArena 전반에서 TFM error는 large-data 경계에서 급격히 변하는 반면, tuning과 ensembling은 traditional models를 개선하며 regime별 우승 모델은 dataset properties에 따라 달라진다. Ablation 결과, split 수를 줄여도 aggregate rankings는 유지될 수 있지만 validation과 split 선택은 benchmark fidelity에 실질적인 영향을 미친다.
- E.2 테스트 2: 어느 training-set size부터 TFM 사용이 합리적 선택이 아니게 되는가?: TFM degradation은 약 100,000 rows에서 발생한다. tiny, small, medium datasets는 구분되지 않지만, 모든 large-scale comparison은 significant하며 effect가 크다.Kruskal-Wallis 검정에서 3 자유도에 대해 H = 30.6 (p = 1.0 × 10−6)이었으며, pairwise large-scale 비교에서는 padj < 0.001이고 r은 0.68에서 0.79 사이였다.
- E.3 테스트 3: tuning과 ensembling은 non-TFM models를 얼마나 개선하는가?: 16개의 paired tests 모두에서 hyperparameter tuning과 post-hoc ensembling이 142-dataset benchmark 전반의 모든 traditional algorithm을 유의하게 개선했다.모든 test에서 padj < 0.001이었다. RealMLP는 tuning-to-ensembling jump가 가장 컸고 (r = 0.87), LightGBM은 default-to-tuned jump가 가장 컸다 (r = 0.89).
- E.4 테스트 4: 어떤 dataset properties가 GBDTs의 TFM 능가를 예측하는가?: Dataset size와 high-cardinality categorical columns의 수는 GBDTs가 TFMs보다 우수한지를 예측하는 meta-features 중 두드러지는 두 가지다.비교에는 dataset별 advantage ∆ = eTFM − eGBDT와, 여덟 개 meta-feature tests에 대한 Holm correction을 적용한 Spearman correlations가 사용됐다.
- E.5 테스트 5: 주어진 data regime에서 실무자는 어떤 method를 선택해야 하는가?: TFMs는 IID, tiny/small, low-dimensional subsets에서 앞선다. tuned ensembled RealMLP는 temporal, grouped, medium, large, high-dimensional, text subsets에서 앞서며, tuned CatBoost는 high-cardinality categorical data에서 앞선다.RealMLP가 첫 순위를 차지했음에도 pairwise 비교 중 보정 후 살아남은 비율이 5.1%에 불과하므로 grouped 결과는 덜 결정적이다.
- F Ablations: BeyondArena의 ablations는 benchmark validity를 평가하기 위해 fewer outer splits, 올바른 non-IID grouped splits, 그리고 tiny datasets를 위한 alternative inner cross-validation을 검증한다.Ablation summary에 따르면 split 수를 줄여도 representative results를 유지할 수 있지만, IID outer splits는 grouped-data results를 왜곡하며, 5×5와 8-fold validation의 차이는 모든 models의 performance를 바꾼다.
- F.1 (Outer Splits, A.1) BeyondArena-Core에서 Fewer Splits 사용: Fewer outer splits를 사용해도 aggregate rankings는 유지된다. mean winrate delta는 1% 미만이지만, compute가 감소할수록 개별 dataset orderings는 덜 안정적이 된다.Φ = 0에서는 headline metrics가 full speedup을 회복하며, 이는 Full보다 9x 빠르면서도 의미 있는 fidelity loss가 없다.
- F.2 (Outer Splits, A.2) non-IID Grouped Data에 IID Splits 사용: Grouped-data ablation은 여섯 개 representative models를 사용해 musk와 sat11_hand_algo_runtime에서 grouped outer splits와 IID outer splits를 비교한다.제공된 passage는 Figure F.2가 split choice를 평가하며 IID splits에서는 musk가 trivial해진다고 서술하지만, 나머지 numerical results는 제공하지 않는다.
- F.3 (Inner Splits, B.1) Tiny Data에 8-fold Cross-Validation 사용: training samples가 최대 500개인 datasets에서 inner-split ablation은 selected IID tasks와 models에 대해 5×5 cross-validation과 8-fold cross-validation을 비교한다.최대 100 features, 처음 세 outer folds만 사용하고, full tuning plus ensembling을 적용하며, validation protocol이 fitting에 영향을 주지 않으므로 TFMs는 제외한다.
F.4 (Inner Splits, B.2) IID Split을 non-IID Data에 사용 … F.7 (Post-processing, D) Log-loss에 Probability Calibration 사용
Ablation 결과는 평가와 전처리 선택이 BeyondArena 결과에 실질적인 영향을 미침을 보여준다. non-IID validation은 대체로 성능을 높이고, grouped preprocessing은 평균적으로 도움이 되며, SMS calibration은 대부분의 방법에서 이득을 주지만 TabPFN-2.6과 RealMLP에는 악영향을 준다.
- F.4 (Inner Splits, B.2) IID Split을 non-IID Data에 사용: 작은 데이터셋에서는 5 × 5 cross-validation이 8-fold cross-validation을 일관되게 능가했으며, tuned RealMLP은 큰 폭의 성능 향상을 보였다.500개 미만의 sample을 포함한 데이터셋에서 Linear, ExtraTrees, LightGBM, RealMLP을 대상으로 tuning과 post-hoc ensembling을 적용해 비교했다.
- F.4 (Inner Splits, B.2) IID Split을 non-IID Data에 사용: Non-IID inner splits는 거의 모든 경우에, 대체로 유의하게, 성능을 향상시킨 반면 IID validation은 model ranking과 grouped-dataset metric을 왜곡했다.Grouped outer splits와 IID outer splits는 raw metric과 variance를 크게 변화시켰으며, musk의 Kendall’s τ는 0.60, sat11_hand_algo_runtime의 Kendall’s τ는 0.49였다.
- F.5 (Grouped Data Preprocessing, C.1a/b) Grouped Data의 Preprocessing 비활성화: Grouped-data preprocessing ablation은 preprocessing을 활성화한 경우와 비활성화한 경우의 default Linear, ExtraTrees, LightGBM, RealMLP, TabM, TabPFN-2.6, TabICLv2 성능을 비교했다.실험은 training sample이 100k 이하인 데이터셋으로 제한했으며, label-per-group 데이터와 label-per-sample 데이터를 분리했다.
- F.5 (Grouped Data Preprocessing, C.1a/b) Grouped Data의 Preprocessing 비활성화: Grouped-data preprocessing 변경의 효과는 model에 따라 달랐지만, 이를 활성화하면 label-per-group 및 label-per-sample 데이터셋 전반에서 평균 성능이 향상되었다.Ablation은 training sample이 100k 이하인 데이터셋에서 7개 model을 비교했다.
- F.6 (Text Data Preprocessing, C.2a/b) Text Encoding에 TF-IDF 사용: Text-encoding ablation은 동일한 32-dimensional output vector를 사용해 Qwen3-Embedding-8B with Matryoshka representation learning과 TF-IDF with SVD를 비교했다.Text를 포함하는 BeyondArena 데이터셋에서 첫 번째 split과 더 저렴한 CPU model을 사용해 Linear, ExtraTrees, LightGBM을 평가했다.
- F.7 (Post-processing, D) Log-loss에 Probability Calibration 사용: SMS probability calibration은 대부분의 방법에서 log-loss 성능을 향상시켰으며, tree-based models에서는 유의한 향상을 보였지만 TabPFN-2.6과 RealMLP에서는 결과가 악화되었다.Calibration은 여러 model에서 평균 순위도 유의하게 높였으며 model ranking 순서를 변화시켰다.
G 데이터셋별 결과
이 절에서는 Default, Tuned, Tuned + ensemble 구성에서 데이터셋별 예측 성능을 보고하고, metric error와 누적 학습 시간 사이의 하이퍼파라미터 최적화 절충을 함께 다룬다.
- 데이터셋별 성능: 데이터셋별 표는 Default, Tuned, Tuned + Ens. 구성의 평균 metric error와 fold 표준편차를 비교하고, 통계적 유의성에 따라 방법을 부각한다.초록색은 평균이 가장 좋은 방법을 표시하고, 굵은 글씨는 최선의 방법보다 유의하게 나쁘지 않은 방법을 표시한다.
- HPO Pareto 궤적: HPO Pareto 궤적은 trial budget이 증가할 때 각 방법의 튜닝 및 앙상블 validation-error frontier를 보여 주어 계산량-성능 trade-off를 드러낸다.더 아래쪽과 왼쪽에 있는 점은 validation error와 학습 시간 budget에서 다른 구성을 지배하는 구성을 나타낸다.
H NeurIPS 논문 체크리스트
체크리스트는 논문의 초록과 서론이 기여와 범위를 정확히 반영하고, 한계를 논의하며, 이론적 결과를 제시하지 않는다고 명시한다. 또한 실험 세부사항, 공유 코드와 산출물, 계산 자원 정보, 통계적 오차 분석을 통해 재현성을 기록한다.
- 주장과 범위: 초록과 서론은 BeyondArena, DataFoundry, 142 curated datasets, 다양한 task 및 feature 설정, 그리고 보고된 모델 성능 범위를 정확히 제시한다.이러한 주장은 sample size, feature dimensionality, feature type 전반에 걸친 IID, temporal, grouped prediction task를 포함한다.
- 한계: 논문은 Section 7에서 한계를 논의한다.체크리스트는 한계와 가정을 누락하지 말고 공개해야 한다고 강조한다.
- 이론적 가정과 증명: 논문은 이론적 결과를 제시하지 않는다.따라서 이 연구에는 이론적 가정이나 증명을 요구하지 않는다.
- 실험 재현성: 실험 결과는 dataset curation 및 실험 설명, appendix 세부사항, 공유 코드를 통해 재현 가능하게 보고된다.논문은 dataset curation code, benchmarking code, dataset artifact를 공유한다.
- 통계적 유의성과 자원: 모든 결과에는 error bar가 포함되며, Appendix E에서 추가 통계 분석을 제공한다.또한 Section 5에서 training 및 test 세부사항을, Section 5와 Appendix C.2에서 compute resource 세부사항을 보고한다.