Source-linked AI summary
Estimation and Inference of Heterogeneous Treatment Effects using Random Forests
Stefan Wager, Susan Athey
TL;DR
연구자에게는 이질적 처치 효과를 추정하고 타당한 추론을 뒷받침할 수 있는 방법이 필요하다. 이 논문은 causal forests를 개발하고, 시뮬레이션에서 k-nearest-neighbor matching을 능가하면서 점근적으로 타당한 추론을 제공함을 보인다.
문제
연구자는 이질적 처치 효과를 추론해야 하지만, 과거에는 데이터셋이 너무 작은 경우가 많아 표본 세분화를 넘어서는 이질성을 탐색하기 어려웠다.
방법
이 논문은 다루기 쉬운 점근 이론과 타당한 추론을 바탕으로 처치 효과를 추정하기 위해 honest, subsampled trees를 사용하는 causal forests를 개발한다.
결과
Causal forests는 시뮬레이션 전반에서 편향과 분산 측면에서 k-nearest-neighbor matching을 능가하며, d가 2에서 30으로 증가해도 평균제곱오차를 0.02로 유지한다.
시사점 및 한계
Causal forests는 적응적 feature selection과 점근적으로 정규적이고 불편한 점추정량, 그리고 이질적 처치 효과에 대한 타당한 confidence intervals를 결합한다.
시사점 및 한계
이론은 pointwise confidence intervals만 제공하며, 경계 편향과 소표본 또는 많은 공변량과 같은 난이도 높은 설정은 여전히 미해결 문제로 남아 있다.
Abstract
from arXiv · showhide
Many scientific and engineering challenges -- ranging from personalized medicine to customized marketing recommendations -- require an understanding of treatment effect heterogeneity. In this paper, we develop a non-parametric causal forest for estimating heterogeneous treatment effects that extends Breiman's widely used random forest algorithm. In the potential outcomes framework with unconfoundedness, we show that causal forests are pointwise consistent for the true treatment effect, and have an asymptotically Gaussian and centered sampling distribution. We also discuss a practical method for constructing asymptotic confidence intervals for the true treatment effect that are centered at the causal forest estimates. Our theoretical results rely on a generic Gaussian theory for a large family of random forest algorithms. To our knowledge, this is the first set of results that allows any type of random forest, including classification and regression forests, to be used for provably valid statistical inference. In experiments, we find causal forests to be substantially more powerful than classical methods based on nearest-neighbor matching, especially in the presence of irrelevant covariates.
1 서론
이 논문은 다루기 쉬운 점근 이론과 타당한 추론을 바탕으로 이질적 처치 효과를 추정하는 causal forests를 개발하여, 고전적 방법과 예측 중심 random forests의 한계를 다룬다. 또한 honest subsampled trees를 이론적 보장과 결합하고, 공변량 차원이 증가할수록 nearest-neighbor matching보다 우수함을 보인다.
- 동기: 극단적 하위집단을 반복적으로 탐색하면 허위 이질성이 발생할 수 있고, 인과 효과에는 관측 가능한 test-set ground truth가 없기 때문에 추론이 특히 중요하다.이러한 우려는 사전 지정된 하위집단 프로토콜의 필요성과 추정 잡음을 평가하는 데서 통계 이론이 중심적 역할을 해야 함을 뒷받침한다.
- 동기: 고전적 비모수 방법은 공변량이 적을 때 잘 작동하지만 공변량 차원이 증가하면 빠르게 성능이 무너져, machine-learning 접근법의 필요성이 제기된다.서론은 이질적 효과 추정이 의학, 마케팅, 공공정책, 무작위 기술 실험과 관련된 문제임을 제시한다.
- 기여: Causal forests는 tree leaves에서 처치 효과를 추정하며, 다루기 쉬운 점근 이론과 타당한 통계적 추론을 위해 설계된 forest 기반 방법을 제공한다.이 방법은 Athey and Imbens [2016]를 따라 causal trees로 forests를 구축한다.
- 이론: 이 논문은 honest subsampled regression forests에 대해 일관성과 점근적 정규성 결과를 제시하며, infinitesimal jackknife가 점근 분산을 일관되게 추정함을 보인다.Honest trees는 tree 구축과 leaf 예측에 서로 다른 subsample을 사용하며, 이 프레임워크는 forest 추정량에 대한 신뢰구간을 지원한다.
- 실증 결과: Causal forests는 여러 시뮬레이션에서 편향과 분산 측면에서 고전적 k-nearest-neighbor matching보다 우수하며, 공변량 수가 증가할수록 그 이점이 커진다.이 논문은 이질적 처치 효과에 대한 신뢰구간의 coverage rates도 검토한다.
- 새로움: 핵심 기술적 기여는 random-forest 예측으로부터 통계적 추론을 가능하게 하는 이론을 제시하여, 특정 변형이나 black-box 휴리스틱을 넘어 엄밀한 분석을 확장한 것이다.저자들은 이를 random-forest 예측이 그러한 추론을 뒷받침할 수 있도록 하는 조건을 제시한 최초의 결과라고 설명한다.
2 Causal Forests
Causal forest는 unconfoundedness하에서 tree 기반 leaf 내 treatment-effect 추정치를 평균내 heterogeneous treatment effect를 추정한다. 적절한 subsample 크기 조정과 honest tree를 사용하면 일치적이고, 점근적으로 Gaussian이며, 편향이 없고, 분산도 일관되게 추정할 수 있다.
- Causal-effect 설정: Unconfoundedness하에서 causal forest는 피험자마다 하나의 potential outcome만 관측하더라도, 인접 관측치를 근사적인 무작위 비교로 활용해 τ(x)를 추정 대상으로 삼는다.Unconfoundedness는 continuity 가정하에서 nearest-neighbor matching 같은 국소 방법이 τ(x)에 대해 일치적이도록 한다.
- Causal tree와 forest: Tree는 leaf를 통해 neighborhood를 적응적으로 정의하며, causal tree는 관측치가 무작위 실험과 유사하도록 설계된 leaf 내에서 treatment effect를 추정한다.Forest는 B개의 causal tree에서 얻은 추정치를 평균내며, signal이 빠르게 변하는 곳에서는 adaptive leaf가 좁아지고 다른 곳에서는 넓어진다.
- Consistency: Causal forest는 conditional mean function에 대한 조건하에서 true treatment effect τ(x)에 대해 pointwise consistent하다.이 논문은 causal tree로 구성한 causal forest의 consistency를 확립한다.
- Inference: Subsample 크기 s를 적절히 조정하면 causal-forest 예측은 asymptotically Gaussian이고 unbiased가 되어, forest 추정치를 중심으로 하는 confidence interval을 구성할 수 있다.Sampling-distribution 결과는 potential nearest neighbor와 고전적인 U-statistic 및 projection 논증을 사용한다.
- Inference: Infinitesimal jackknife variance estimate는 비복원 subsampling에 대한 finite-sample correction을 포함하면서 Var[ˆτ(x)]에 대해 consistent하다.Correction은 n(n−1)/(n−s)^2이며, estimated-to-true variance ratio는 확률수렴하여 1이 된다.
- Honest causal forest: 이론에는 split selection과 leaf 내 추정을 분리하는 honest tree가 필요하며, double-sample 및 propensity-tree 절차가 이 조건을 만족한다.Subsample 재무작위화는 여러 tree에 걸쳐 관측치가 두 역할 모두에 참여할 수 있게 하며, propensity tree는 splitting에 treatment assignment를 사용해 e(x)의 변동으로 인한 bias를 줄일 수 있다.
3 Random Forest의 점근 이론
이 절에서는 적절하게 honest한 random-forest 예측이 점근적으로 Gaussian 분포를 따르고, 분산을 일관되게 추정할 수 있으며, 타당한 confidence interval을 구성할 수 있음을 보이는 점근 이론을 전개한다. Subsampling, incrementality, bias control을 통해 이러한 결과가 성립하는 조건을 확립하고, voting tree의 한계도 밝힌다.
- Random-forest 구성: 이 framework는 모든 size-s subsample과 보조적 무작위성에 대해 tree를 평균내며, replicate 수 B가 충분히 클 때 Monte Carlo 효과를 무시할 수 있는 것으로 취급한다.유한-B 효과는 Mentch and Hooker [2016]가 연구했으며, Wager et al. [2014]는 B가 n 정도의 크기일 것을 권고한다.
- Regularity condition: 이 결과는 honest tree를 요구하며, Lipschitz 연속성, density 가정, subsample-size 증가율에 대한 제약을 포함한 regularity condition을 부과한다.이 조건하에서 이론은 honest regular tree와 double-sample tree에 대한 incrementality 및 bias bound를 도출한다.
- 점근적 정규성과 분산 추정: Random-forest 예측은 점근적으로 Gaussian 분포를 따르며, infinitesimal jackknife는 그 점근 분산을 일관되게 추정한다.따라서 이 이론은 target conditional mean에 대한 confidence interval을 뒷받침한다.
- 한계와 보정: k > 1인 classification forest의 경우, 증명은 leaf 내부의 관측치를 평균내는 tree에는 적용되지만 voting tree에는 적용되지 않으며, 후자의 확장은 여전히 미해결 상태다.유한표본 보정항 n(n −1)/(n −s)^2은 비복원 subsampling에 적절하며 실제 성능을 개선한다.
- 기여: Theorem 1은 random-forest 예측이 점근적으로 unbiased이고 normal이 되는 조건을 확립하며, 저자들에 따르면 이러한 결과 중 최초의 결과를 제시한다.이전 연구는 고전적 연관성을 통해 분산 추정량을 동기 부여했지만 이를 형식적으로 정당화하지는 못했다. 이 분석은 random-forest prediction variance의 일관성을 확립한다.
- Incrementality와 subsampling: Subsampling은 weakly incremental tree를 1-incremental ensemble로 변환하여, 고전적 점근 이론과 infinitesimal jackknife의 일관성을 가능하게 한다.이 논증은 먼저 regression tree에 대한 incrementality lower bound를 확립한 뒤 subsampling을 적용한다.
4 이질적 처치 효과 추론
이 절에서는 사전에 지정된 테스트 지점에서 조건부 평균 처치 효과를 추정하기 위해 random-forest 점근 이론을 causal forest로 확장한다. unconfoundedness, overlap 및 정칙성 조건하에서 얻어진 추정량은 일치성을 가지며, 중심화된 점근적 Gaussian 분포를 따른다.
- 4 이질적 처치 효과 추론: Causal forest는 사전에 지정된 테스트 지점 x에서 subsample로 학습한 causal tree 추정량을 평균내어 τ(x)를 추정한다.학습 데이터에는 feature, outcome 및 binary treatment assignment가 포함된다.
- 4 이질적 처치 효과 추론: Honest causal tree는 split selection에서 response를 제외하는 반면, regular tree는 각 leaf에 두 treatment group 모두의 관측치가 충분히 포함되도록 요구한다.Tree는 split을 선택할 때 treatment assignment를 사용할 수 있으며, 정칙성은 테스트 지점 x를 기준으로 정의된다.
- 4 이질적 처치 효과 추론: unconfoundedness, overlap, potential-outcome 정칙성 및 명시된 honest·regular·symmetric random-split 조건하에서 causal-forest 예측은 일치성을 가지며, 중심화된 점근적 Gaussian 분포를 따른다.이 결과는 α ≤ 0.2이고 subsample 크기가 (14)와 같이 증가하는 forest에 적용된다.
- 4 이질적 처치 효과 추론: Regular causal tree는 일반적으로 모든 테스트 지점에 대해 동시에 구성할 수 없으므로, 증명에서는 한 번에 하나의 사전에 지정된 지점 x를 고려한다.이 절에서는 X_i ≥ 0인지에 따라 treatment assignment가 결정되는 1차원 사례를 통해 이러한 한계를 설명한다.
5 시뮬레이션 실험
시뮬레이션 전반에서 causal forest는 이질적 treatment effect 추정에서 k-NN matching을 크게 능가했으며, 차원이 증가해도 낮은 평균제곱오차를 유지하는 한편 bias로 인한 coverage의 한계를 드러냈다. 또한 propensity adjustment, treatment-effect heterogeneity에 대한 적응, sampling variance, Gaussianity, 유한표본 confidence interval의 타당성을 평가했다.
- 연구 설계: 시뮬레이션은 forest 기반 방법이 점근적으로 타당한 confidence interval을 제공하면서, unconfoundedness하의 유한표본에서 비적응적 k-NN보다 향상되는지를 검증한다.성능은 τ(X)에 대한 기대 평균제곱오차와 목표 수준 0.95에서의 기대 coverage로 평가했으며, X는 균등분포를 따르고 noise는 등분산이다.
- 첫 번째 설정: propensity adjustment: causal forest는 d가 2에서 30으로 증가해도 평균제곱오차 0.02를 유지하는 반면, 10-NN과 100-NN은 한 자릿수 정도 더 나쁜 성능을 보인다.비교는 첫 번째 설정에서 이루어졌으며, 여기서는 treatment effect가 고정되고 propensity-treatment-outcome 상호작용이 bias를 유발한다. 100-NN은 d = 2에서 이미 bias가 지배적이다.
- 추론 진단: Figure 1의 진단 결과는 causal forest의 sampling variance가 n에 따라 감소하고, infinitesimal-jackknife variance 추정치가 상대적으로 정확해지며, 예측값이 Gaussianity에 가까워짐을 보여준다.진단은 무작위로 표본추출한 1,000개의 test point에 대한 결과를 집계하고, 여러 데이터셋으로 학습한 forest 전반에서 표준화된 예측값을 평가한다.
- 두 번째 설정: treatment-effect heterogeneity: treatment-effect heterogeneity 설정에서도 causal forest는 d > 2일 때 k-NN보다 유사하게 향상되며, 작은 값에서 ambient dimension이 증가할수록 예상과 달리 성능이 개선된다.이 설정은 m(x) = 0 및 e(x) = 0.5인 randomized treatment를 사용하고, treatment-effect heterogeneity는 처음 두 feature에만 존재한다. d = 2일 때 성능은 50-NN과 비슷하다.
- 세 번째 설정: 경계 및 첨두 효과: 세 번째 설정에서 causal forest는 d > 2일 때 k-NN보다 평균제곱오차가 한 자릿수 정도 개선되지만, confidence interval coverage는 악화된다.coverage 문제는 bias 증가에서 비롯되는 것으로 보인다. 차원이 커질수록 forest interval은 특히 중심을 벗어나지만, treatment-effect surface의 정성적 형태는 포착한다.
- 한계와 향후 연구: 이 연구의 주요 한계는 각 설정에 맞춰 propensity forest 또는 double-sample forest를 수동으로 선택한다는 점이며, 이는 automatic splitting rules와 s의 원칙에 입각한 선택을 필요로 한다.저자들은 가장 큰 signal을 보이는 좌표에 초점을 맞추는 splitting rules 등을 포함해, bias 감소와 coverage 개선도 당면 과제로 제시한다.
6 논의
이 논문은 데이터 기반 feature selection과 점근적으로 정규이고 불편한 추정량 및 타당한 confidence interval을 결합한 heterogeneous treatment-effect 추정을 위해 비모수적 causal forest를 제안한다. honest tree와 random-forest subsampling을 통해 원칙에 따른 추론을 수행하지만, global functional inference와 boundary-bias correction은 향후 과제로 남긴다.
- 기여: Causal forest는 데이터 기반 feature selection을 가능하게 하면서도 점근적으로 정규이고 불편한 point estimate와 타당한 confidence interval을 유지한다.이 추정량은 어떤 feature 차원이 이웃 선택에 중요한지를 데이터가 결정하는 adaptive nearest-neighbor method로 볼 수 있다.
- 추론: honest tree와 random-forest subsampling을 결합하면 통계적 추론에 사용되는 adaptive method의 selection bias를 다루는 단순하고 원칙에 따른 방법을 얻을 수 있다.논의에서는 selection bias를 adaptive inference의 핵심 과제로 규정하고, Berk et al. [2013], Chernozhukov et al. [2015], Taylor and Tibshirani [2015]의 최근 발전과 함께 이 접근법을 위치시킨다.
- 한계와 향후 연구: 현재 이론은 τ(x)에 대한 pointwise confidence interval만 제공하므로 global functional estimation은 미해결 과제로 남는다.이론을 global functional estimation으로 확장하는 것은 향후 연구의 유망한 방향으로 제시된다.
- 한계와 향후 연구: nearest-neighbor 비모수 추정량은 boundary bias를 겪을 수 있으므로, feature space 경계에서의 체계적 trimming과 가능한 bias correction이 필요하다.논의에서는 경계 처리와 bias correction을 해결되지 않은 방법론적 과제로 규정한다.
A 추가 시뮬레이션
추가 시뮬레이션은 causal forests가 k-NN보다 우수한 정도가 signal sparsity에 좌우되며, 적절한 variance 조건에서는 confidence intervals가 nominal coverage에 근접함을 보여준다. Signal density가 증가하면 forest의 이점은 줄어들고 반전될 수도 있다.
- Bias-Variance Trade-off: Causal forests에는 bias-variance trade-off가 존재한다. n에 비해 s가 작을 때는 bias가 지배적이고, n에 비해 s가 클 때는 variance가 지배적이다.Mean-squared error가 평균 variance 추정치 σ̂2(X)와 일치할 때 confidence intervals는 nominal coverage에 근접한다.
- Signal Density: Signal이 많은 feature에 분산되어 있으면 forest가 baseline methods를 개선할 여지가 줄어들며, baseline methods보다 크게 개선되지도 않는다.앞선 실험에서는 forest가 k-NN matching에 비해 활용할 수 있었던 강한 저차원 구조의 이점을 얻었다.
- Signal Density: Signal dimension이 희소할 때 forests는 mean-squared error에서 k-NN을 크게 능가하지만, dimension이 comparable하면 이러한 이점을 잃고 dense d = q = 6에서는 더 낮은 성능을 보인다.신호가 dense하면 조사한 모든 방법의 coverage가 낮으며, 10-NN만 예외인데 그 구간이 단순히 매우 넓다.
B 일관성을 위해 정직성이 필요한가?
점별 중심화 점근적 Gaussian 추론에는 honesty가 필요한 것으로 보인다. 모서리점 실험에서 honest forest는 편향되지 않은 상태를 유지하는 반면, adaptive forest는 기존의 평균 위험 일관성 결과가 있음에도 편향이 증가한다.
- 함의: 점별 중심화 점근적 Gaussianity에는 honesty가 필요한 것으로 보인다. 실용적인 random forest 대부분이 honest forest가 아니라 adaptive forest임에도 그렇다.따라서 이 framework의 honesty 가정은 주류 random-forest 구현과 구별되는 핵심 지점을 이룬다.
- 시뮬레이션 근거: Honest forest는 편향되지 않은 상태를 유지하며 표본 크기가 증가할수록 mean-squared error가 감소한다. 반면 adaptive forest는 표본 변동을 초과하는 편향을 보이며, 이 편향은 n이 증가할수록 커진다.비교에는 Figure 3의 모서리 예측점, 500개 tree, leaf-size k = 1, 40회 반복이 사용된다.
- 메커니즘: Adaptive CART forest는 split을 배치할 때 outcome 정보를 사용해 희귀한 outlier를 분리하므로 x-space의 모서리에서 점별 편향을 갖게 된다.Honest tree는 outlier가 어디에 나타나는지 알려주지 않는 별도 표본에서 split을 선택함으로써 이 문제를 피한다.
- 일관성과의 관계: 최소 leaf size를 키우면 모서리 편향 현상을 피할 수 있지만, 그에 따른 편향 bound는 random-forest sampling variance보다 느리게 감소하므로 중심화 confidence interval을 뒷받침하지 못한다.따라서 기존의 일관성 결과만으로는 여기서 요구하는 중심화 추론을 확립할 수 없다.
- 일관성과의 관계: 대부분의 large-sample test point가 모서리에서 멀리 위치하기 때문에 adaptive forest는 평균 test point에서 risk-consistent 상태를 유지할 수 있다. 다만 이 설정에서는 honest forest가 test-set error를 더 낮게 유지한다.이는 평균 예측 일관성이 추론에 중요한 점별 편향을 제거하지 못하는 이유를 설명한다.
B.1 Adaptive versus Honest Predictive Error
Honest forest와 adaptive forest는 최적 predictive error에서 비슷한 성능을 낼 수 있지만, honest forest는 minimum leaf size에 훨씬 덜 민감하며 기본값 k = 1에서도 높은 성능을 보인다.
- B.1 Adaptive versus Honest Predictive Error: 이 비교는 random test point에서 honesty가 mean-squared error를 희생하는지를 평가한다. 이는 일부 UCI datasets에서 honesty가 regression-forest 성능을 저하시킬 수 있다는 선행 결과에서 비롯된 우려다 [2014].
- B.1 Adaptive versus Honest Predictive Error: d = 8이고 일반적인 adaptive-forest 설정 k = 1일 때, adaptive forest는 50 nearest neighbors보다 성능이 낮지만 minimum leaf size를 늘리면 개선된다.
- B.1 Adaptive versus Honest Predictive Error: 최상의 경우 adaptive forest와 honest forest는 comparable root-mean-squared error를 보이지만, adaptive forest는 minimum leaf size를 신중하게 조정해야 한다.adaptive forest의 최적값은 k = 64인 반면, honest forest는 기본값 k = 1을 포함해 넓은 범위의 k 값에서 높은 성능을 보인다.
C 증명
이 부록에서는 점근적 스케일링 표기법을 정의하고, 추정량의 편향이 표준편차에 비해 무시할 수 있음을 보여 Theorem 1을 증명하며, 이를 통해 Slutsky’s lemma를 적용할 수 있게 한다.
- 표기법: 부록에서는 점근적 동치, 상한과 하한, big-O, big-Omega, little-o 비율을 나타내는 표기법을 정의한다.이 정의들은 증명 전반에서 사용되는 극한비의 의미를 명시한다.
- Theorem 1의 증명: |E[ˆµ_n(x)] − µ(x)| / σ_n(x) → 0을 증명하면 Theorem 1이 성립하며, 이후 Slutsky’s lemma가 논증을 완결한다.증명에서는 앞선 정리들의 명제를 결합하여 목표 결과에서 E[ˆµ_n(x)]을 µ(x)로 대체한다.
C.1 회귀 트리의 편향 상계
리프 직경을 제어해 회귀 트리의 편향을 상계한다. Regularity, concentration, honesty, Lipschitz continuity를 함께 적용하면 forest 평균에도 동일한 유계 편향 결론을 얻는다.
- Lemma 2: Regularity는 각 좌표를 따라 충분한 횟수의 분할이 이루어지도록 하며, Chernoff bound를 적용하면 좌표별 분할 횟수에 대한 확률적 하한을 얻을 수 있다.이 논증에서는 L(x)로 이어지는 분할 횟수와 random-split-tree property를 사용한다.
- Lemma 2: 높은 확률로, 노드 표본 비율이 Lebesgue measure를 추적하므로 O(log log n)의 terminal ancestor를 제외하면 리프 직경은 regularity rate에 따라 근사적으로 수축한다.이 concentration 결과는 L(x) 위에 있는 거의 모든 parent node에 동시에 성립하며, 실패 확률은 점근적으로 제어된다.
- Theorem 3: honesty와 Lipschitz continuity 하에서는 평균 리프 직경을 상계하는 것만으로 conditional-mean bias를 상계할 수 있다.Lipschitz continuity는 conditional-mean constant를 제공하고, honesty는 theorem proof의 첫 번째 관측을 제공한다.
- Theorem 3: 그 결과 편향의 상계는 O(1)이며, forest는 여러 트리의 평균을 취하므로 forest estimator ˆµ(x)에도 동일한 상계가 성립한다.증명에서는 직경 상계와 Lipschitz assumption을 결합한 뒤, 개별 트리에서 그 평균으로 결과를 확장한다.
C.2 회귀 트리의 증분성 상계
이 절에서는 k-PNN 확률을 제어해 회귀 트리의 증분성을 상계한 뒤, 이 상계를 regular tree와 double-sample tree의 variance rate를 확립하는 데 적용한다. 증명에서는 truncation, Lipschitz moments, honesty, coupling을 사용해 uniform 및 bounded feature density를 다루고 무시 가능한 항을 제어한다.
- Lemma 4의 증명: 도출된 k-PNN 상계는 uniform feature에서 [0, 1]^d 위에서 constant C로 bounded by a constant C인 모든 feature density로 확장된다.bounded-density 경우는 uniform-density 논증과 확률을 비교해 따른다.
- Theorem 5의 증명: regular tree의 경우, Lemma 4와 Theorem 3은 fixed k가 shrinking leaf size에 비해 negligible해질 때 필요한 upper variance control을 제공한다.증명에서는 x를 포함하는 leaf의 관측치 수를 사용해 k Var[T(x; Z)]를 상계한 다음, 목표 수렴을 결론짓는다.
- Corollary 6의 증명: double-sample tree의 경우, effective sample size ⌊s/2⌋를 사용해 Theorem 5를 적용하면 desired variance rate를 얻으며, complementary term은 negligibly small하다.증명에서는 Hoeffding의 standard results를 Lemma 2 및 Theorem 3의 논증과 함께 사용한다.
C.3 부분표본 증분 기본 학습기의 성질
이 절에서는 Efron–Stein ANOVA decomposition을 사용해 Hájek projection을 통해 부분표본 random forest를 분석한다. honesty, moment, subsample-scaling 조건하에서 점근적 정규성을 확립하고 infinitesimal jackknife가 projection variance를 일관되게 추정함을 보인다.
- ANOVA 프레임워크: Efron–Stein ANOVA decomposition은 평균이 0이고 서로 비상관인 성분을 통해 대칭적 기본 학습기와 random-forest 추정량을 분석하기 위한 추상적 틀을 제공한다.이 decomposition은 이후의 분산 및 점근 논증에서 사용되는 첫 번째 성분으로 Hájek projection도 식별한다.
- Random-forest 표현: subsampled random forest는 개별 tree의 ANOVA 성분을 사용해 다시 쓸 수 있으며, subsampling multiplicity가 대응하는 projection 항을 결정한다.이 유도는 각 training point와 각 point pair가 가능한 subsample 전반에 얼마나 자주 포함되는지에 의존한다.
- 점근적 정규성: 주어진 scaling 및 regularity 조건하에서 Hájek projection은 점근적으로 정규성을 가지며, Slutsky’s lemma를 통해 forest 추정량도 필요한 극한 거동을 물려받는다.증명에는 Lyapunov’s central limit theorem, honesty에 기반한 조건부 독립성, uniform (2+δ)-moment bound, subsample scaling이 사용되며, 가능한 double-sample tree는 2의 factor를 기여한다.
C.4 Causal Forest로의 확장
Causal forest 확장은 unconfoundedness, honesty, regularity, ε-overlap하에서 regression forest의 bias 및 incrementality 논의를 재사용한다. 그 결과의 bound는 동일한 구조를 유지하지만 ε에 의존하는 더 나쁜 상수를 수반한다.
- Causal Forest로의 확장: ε-overlap하에서 causal forest의 bias와 incrementality는 regression forest 논증의 유사한 형태를 통해 성립하며, 상수는 ε에 의존하는 인자만큼 악화된다.증명에서는 유효 표본 크기 s를 εs로 대체하고 Section 3.3.2의 subsampling 기반 논증을 재현한다.
- Bias: Lipschitz conditional means, honest trees, bounded potential-outcome means, ε-overlap, 그리고 α ≤ 0.2가 성립하면, x에서의 causal forest bias는 Theorem 3의 명시된 유사 결과로 bound된다.overlap 조건은 최소 treated-or-control 개수가 smin/s ≳ ε를 만족하도록 보장하며, 이를 통해 bias 논증에서 εs 대체가 가능해진다.
- Incrementality: honest k-regular causal trees, Lipschitz conditional variances, positive variance, ε-overlap이 성립하면, ν(s)-incrementality가 x에서 명시된 ε 의존 bound와 함께 성립한다.증명은 각 leaf 내부에서 minority-class 및 nearest-neighbor 논증을 조정한 뒤, Lemma 4와 Theorem 5의 기반이 되는 machinery를 적용한다.