Source-linked AI summary
High-dimensional networks and mean squared error for possibly misspecified models
Lourens Waldorp
TL;DR
高维网络分析使逐节点邻域选择容易过拟合并产生伪边,因为参数空间可能远大于数据规模。本文分析基于 ridge 的 MSE 及其偏差–方差效应,并证明在边关系为线性或非线性的情况下,minimum description length 都能以高概率选择正确或更小的邻域。
问题
高维逐节点选择可能过拟合,因为庞大的参数空间会产生近零训练误差和包含伪边的图。
方法
本文分析基于 ridge 的 MSE 和偏差–方差效应,随后使用 minimum description length 惩罚模型空间复杂度,并通过模拟检验理论。
结果
对于线性和非线性的边关系,MDL 都能以高概率实现正确或更小的邻域选择,而 AIC 和 Lasso 会选择过大的邻域。
要点与局限
在高维邻域选择中,考虑参数空间的规模是控制假阳性的关键。
要点与局限
在非线性错设下,残差方差可能具有异质性,且最佳 Kullback–Leibler 模型可能位于模型空间之外。
Abstract
from arXiv · showhide
To avoid missing important variables and their connections in networks, more and more variables are included in network analysis. Here we show that in a setting with many more parameters than observations (high-dimensional) it is possible to get a conservative (i.e., low false positive rate) estimate of the neighbourhood for each node (which connections are in the network). A neighbourhood is often estimated with a linear model, and this leads to two interesting cases: (i) If the true model is linear, then neighbourhood selection work reasonably well, and (ii) if the true model is nonlinear, then neighbourhood selection requires a penalty for the high dimensions. Here we show the impact of the ridge parameter on the mean squared error, and how this leads to low test variance and hence to neighbourhoods with large numbers of edges. We connect these insights with results from machine learning, where the so-called double descent (when more parameters are included than observations, the mean squared error goes down a second time) has put the traditional view on model selection upside down. Essentially, for adequate neighbourhood selection in models with a large number of parameters, the volume of the model space needs to be included in the penalty. Most neighbourhood selection methods (e.g., Lasso, AIC, BIC) lead to spurious edges (high false positive rate), but we prove that in the high-dimensional setting, minimum description length leads to correct neighbourhood selection or smaller (low false positive rates) in both cases when either the model is correctly or incorrectly assumed linear
1 引言
本文研究网络过参数化时的邻域选择,指出低的高维 MSE 可能导致过拟合和虚假边。文章提出通过 minimum description length 等惩罚项纳入模型空间几何,从而获得正确或更小的邻域。
- 研究动机: 即使只有 20 个节点,网络也已包含 190 个边参数;而经典估计通常需要约 1000 个观测才能可靠估计。这推动了适用于参数多于观测的情形的方法发展。
- 背景: Lasso 和 ridge 使高维情形下的估计成为可能;其中 lasso 还能够选择边,但缺乏 closed-form solution。本文以这些估计方法为基础,重点考察高维 ridge 的行为。
- 方法: 该框架采用 nodewise regression,将每个节点作为响应变量,并从其余所有节点中识别非零邻居。因此,邻域选择会针对每个节点分别进行。
- 高维 MSE: 在高维情形下,MSE 在插值之后仍可能保持良好性质,其行为直接取决于 ridge parameter 和受约束的参数空间。引言为后文在模型设定正确和模型 misspecification 两种情形下开展 bias–variance 分析作铺垫。
- 贡献: 高维过拟合可能产生出人意料的低 MSE,使 AIC 不再适用,因为它通常会选择过多的边;minimum description length 则能得到正确或更小的邻域。分析将高维 ridge 估计、MSE 和模型空间几何与邻域选择联系起来。
2 Gaussian graphical model 中的估计
Gaussian graphical model 通过偏相关编码条件依赖,可用逐节点回归进行估计;当预测变量多于观测时,ridge 正则化可提供唯一的系数估计。高维邻域选择还必须对庞大的模型空间施加惩罚,以实现较低的假阳性率。
- Gaussian graphical model: Gaussian graphical model 将变量表示为节点,将条件依赖表示为边;偏相关为零表示条件独立且不存在边 。
- 逐节点选择: 逐节点选择将图估计转化为回归,其中非零系数用于识别相邻节点,因为回归系数与偏协方差成正比 [Meinshausen and B¨uhlmann, 2006; B¨uhlmann et al., 2014; Maathuis et al., 2018; Waldorp and Marsman, 2021]。
- 高维估计: 当 p > n 时,XᵀX 秩亏,因此最小二乘没有唯一解;除此之外,普通最小二乘还要求 p < n、满秩且不存在共线性。
- 正则化: Ridge 估计施加平方参数约束,并使用 α > 0 获得唯一但有偏的估计;α 可通过 k-fold 交叉验证进行选择。
- 假阳性控制: 由于每个节点的少量伪边会在大图中产生大量假阳性,目标是 P(Ŝ ⊆ S) = 1 − ϵ,而不只是 P(S ⊂ Ŝ) = 1 − ϵ。
- 假阳性控制: 高维条件下的低假阳性邻域选择要求对大量可能模型构成的空间施加惩罚,这促使人们将 minimum description length 纳入选择过程 [Dwivedi et al., 2020; Cheema and Sugiyama, 2020]。
3 均方误差与偏差—方差权衡
对于逐节点网络选择,均方误差体现了过度参数化下发生变化的偏差—方差权衡:模型设定错误时,高度过度参数化的模型可能具有最佳泛化能力,但也会带来伪造边的风险。因此,要获得正确或更小的邻域,需要强 ridge 正则化,或额外的高维惩罚。
- 经典偏差—方差权衡: 当线性模型正确时,test MSE 在接近真实模型处达到最小值,即 p/n ≈0.15;此时,平方偏差与方差共同决定预测误差。回归使用训练数据进行估计,并使用留出的测试集评估 MSE。
- Double descent: 经过插值点后,偏差与方差都可能下降,使过度参数化模型即使拟合了过多非零系数,仍能实现良好泛化;这一现象称为 double descent(Belkin et al., 2019)。这种表面上的悖论源于方差下降,这表明过度参数化模型捕捉到了其他数据集中的规律,而不只是噪声。
- 模型设定错误的影响: 对于近似正确的线性模型,过度参数化会保留位于正确模型处的全局 test-MSE 最小值;而模型设定错误时,该最小值可能移至一个高度过度参数化的错误模型。这些结果假设变量服从正态分布,且预测变量独立同分布。
- 对邻域选择的影响: 因此,在逐节点选择中,模型设定错误时可能选出过多边,因为其 MSE 在高维度下最低。逐节点选择将 Gaussian graphical-model 估计转化为相互独立的回归,因此这些 MSE 效应同样适用于邻域估计。
- 对邻域选择的影响: 要获得正确或更小的邻域,需要大幅提高 ridge 参数,或使用额外的惩罚来抵消高维模型设定错误时的低 MSE。文中质疑,仅靠交叉验证是否能够可靠地选择足够强的 ridge 参数。
4 偏差与方差中的均方误差分解
本节将测试 MSE 分解为平方偏差与方差,说明 ridge 正则化如何稳定高维预测,同时在降低方差与可能增加偏差之间进行权衡。进一步指出,在模型设定错误时,增加模型维度可以减少失配,并通过 minimum description length 支持得到正确或更小的邻域。
- 偏差–方差分解: 测试超额风险可分解为平方偏差与方差,从而将模型选择表述为最小化二者之间的权衡。经典观点认为,降低偏差会增加方差,反之亦然。
- Ridge 正则化: Ridge 正则化会引入非零偏差;增加 α 可能提高测试平方偏差,同时降低方差。这展示了正则化对测试 MSE 两个组成部分的相反影响。
- Ridge 正则化: 增加 ridge 参数 α 会降低测试方差,并可在加入更多预测变量时保持预测稳定,尤其是在额外特征值贡献较小时。因此,当 ridge 正则化使方差保持稳定时,增加维度不一定会使方差膨胀。
- Ridge 正则化: 交叉验证消除了由 α = 0.0001 导致的表面上的 ridge 测试 MSE 峰值,而 lasso 的 MSE 通常仍高于 ridge。比较结果见 Figure H.1,其中使用了经过仔细选择的 ridge 参数。
- 高维控制: 高维方差既可以通过增加 α 来控制,也可以通过约束 ||β||2 来控制;二者都会限制总信号或模型复杂度。后一约束使用 ||β||2 ≤ c,将正则化与模型空间的体积联系起来。
- 模型设定错误: 在非线性模型设定错误下,增加 p/n 会减少失配,而 minimum description length 可在高维中得到正确或更小的邻域。该模型设定错误界限源于所假设的非线性模型以及 Cauchy–Schwarz 论证。
5 高维节点选择
在高维节点选择中,不断扩大的参数空间会导致训练误差趋近于零,并使模型选择更加复杂。MDL通过引入参数空间体积惩罚来抵消这种复杂性,并使假阳性概率趋近于零,即使数据生成过程可能是非线性的。
- 高维选择: 在高维情形下,由于参数空间足够大,可以解释几乎所有观测,因此会出现趋近于零的训练误差,使节点选择变得困难。参数空间体积随维度增长,并可能主导模型选择。
- 方法比较: 所提出的高维惩罚抵消了大量可能的邻域边,区别于文中考察的比较方法 AIC、BIC、Lasso 和另一种 MDL 版本。论文指出,MDL以高概率不会产生假阳性边。
- MDL惩罚: MDL通过对编码模型的参数空间体积进行惩罚来控制模型复杂度;该体积的对数随维度增加,并可通过降低方差改善测试集泛化能力。当 p > n 且 X⊤X 奇异时,该体积项通过 ridge regression 推导得到。
- 模型设定错误: MDL的体积计算假设线性模型是正确的,但该命题将其对假阳性的控制扩展到了数据生成过程可能为非线性的情形。论文指出,模型设定错误可能使模型空间变为非凸集,并且其中可能不存在最佳近似。
- 命题 5.1: 随着 p 增大,MDL使假阳性概率趋近于 0;在命题 5.1 的条件下,该概率至少为 1 − d/p exp(−(p − d))。该结果假设固定 n、p > d、S ⊂ J,以及对某个 γ > 0 有 Eσ̂²_J > γ;并证明 Ŝ ⊆ S。
- 相关形式: MDL-S省略积分项,并等价于贝叶斯信息准则(BIC)。这一近似对应于不含积分项的 MDL 复杂度形式。
6 模拟
模拟表明,在高维模型设定错误时,大型邻域可能获得更低的测试 MSE,从而削弱传统选择方法;而 MDL 在不同维度下都能保持较低或为零的假阳性率。在设定错误时,所有方法选中正确邻域的频率都会降低,但 MDL 能避免过拟合。
- 模拟设计: 模拟使用 n = 40 个观测,图规模从 p = 3 到 p = 320,每个节点有 5 个真实邻居,并采用 80/20 的训练-测试划分。数据来自边系数为 1 的 Gaussian graphical model;节点层面的系数通过 ridge regression 估计。
- MSE: 对于设定错误的模型,在较大维度下,测试 MSE 低于正确邻域的 MSE,可能因此偏向包含大量参数的邻域。正确模型的 p = 5,MSE 为 0.0877;而 p/n = 10 时,MSE 为 0.0844。对于设定正确的模型,全局最小值仍位于 p = 5。
- 邻域选择: 在 pmax = 320 时,AIC 和 Lasso 表现出加剧的过拟合,而 MDL、MDL-opt、MDL-S 和 AIC-CV 仍保持准确且过拟合较低。在这些模拟中,MDL 没有过拟合,这归因于其对使用高维模型空间施加了较大的惩罚。
- 邻域选择: 当模型设定错误时,只有 MDL 能避免选中过多边,尽管所有方法选中正确邻域的概率都会下降。设定错误的数据生成过程使用 logistic 或 sigmoid 条件均值,而估计仍采用线性模型。
- 假阳性率: 当线性模型设定正确时,与大多数其他方法不同,MDL 在不同模型维度下都保持零假阳性率。Figure 6(a) 评估 p/n 从 0.1 到 10 的维度;MDL 始终保持为 0。
7 结论与讨论 · 附录 · A Gaussian graphical model
在高维 Gaussian graphical model 中,当普通最小二乘法失效时,ridge regression 可实现逐节点邻域估计;同时,MDL 能在存在线性和非线性关系时控制假阳性。附录阐明了条件独立性、逆协方差、偏相关与逐节点回归系数之间的 GGM 对应关系。
- 7 结论与讨论: 当节点数超过观测数时,ridge regression 解决了最小二乘估计失效的问题,得到一个有偏但具有闭式形式的估计量,其 MSE 取决于 ridge 参数。当边关系为线性时,MSE 在正确邻域处最低;在模型设定错误时,额外的非线性到线性的设定错误项会对 MSE 产生贡献。
- 7 结论与讨论: ridge 参数可解释为信噪比的倒数,因此在低信噪比情形下需要更大的 ridge 惩罚。
- 7 结论与讨论: 在高维情形下,MDL 通过考虑参数空间的体积,以高概率得到正确或更小的邻域;这一结论同时适用于线性和非线性的边关系。这抵消了维度较高时可能出现的低 MSE。
- 7 结论与讨论: 当条件均值设定错误有界且残差方差与 0 保持正距离时,MDL 的低假阳性结果可从图模型推广到回归情形。
- A Gaussian graphical model: Gaussian graphical model 表示一组联合 Gaussian 变量,其边编码在给定其余所有变量后的条件依赖关系,而该分布由均值和协方差决定。
- A Gaussian graphical model: 对于多元正态分布,逆协方差矩阵中的零元素意味着条件独立性,因此当相应的偏相关非零时且仅当此时存在一条边。这种条件独立性对应关系仅适用于多元正态分布。
- A Gaussian graphical model: 逐节点回归恢复了相同的边条件,因为 βij = 0 if and only if θij = 0;随后可使用 and-rule 或 or-rule 选择边。and-rule 要求两个方向的系数都非零,而 or-rule 要求其中任一系数非零。
B 超额风险与均方误差(Section 4)
Section 4 将超额风险(等价于测试集均方误差)分解为平方偏差和方差。在具有各向同性协变量协方差的正确线性模型下,利用正则化设计矩阵的特征值,推导出两个分量关于 ridge 的表达式。
- B 超额风险与均方误差: 超额风险,即测试均方误差,可分解为平方偏差 B(J) 和方差 V(J)。期望以训练数据 X 为条件。
- B 超额风险与均方误差: 对于 ridge 估计量,在正确线性模型和各向同性协变量协方差 Σ = σ^2_ξI 下,可推导出平方偏差表达式。正则化设计矩阵的特征值为 λ_j + α,它们决定相应的逆平方项。
- B 超额风险与均方误差: 在相同假设下,ridge 方差表达式取决于正则化设计矩阵的特征值 λ_j + α 以及残差方差 σ^2_e。推导利用了残差的方差为 σ^2_eI 这一事实。
B.1 模型设定错误
本节将设定错误定义为:真实分布的均值为非线性,却使用线性模型进行建模,并刻画由此产生的高维预测风险。在设定错误下,风险分解为偏差、方差和设定错误项,其界要求近似误差受到控制。
- 定义: 当真实分布位于所考虑的线性模型类之外时,就会出现设定错误;例如,使用 x^Tβ 优化非线性条件均值。拟合得到的线性模型可视为在线性模型类中,以 Kullback–Leibler 意义衡量距离真实分布最近的成员。
- 设定错误下的风险: 对于 p > n,设定错误模型的风险分解为 R_f(J) = B_f(J) + V_f(J) + M_f(J)。该分解将预测风险中的偏差、方差和设定错误贡献区分开来。
- 设定错误下的风险: 不同于模型设定正确的情形,设定错误会使超额风险计算中保留不消失的交叉乘积项。证明保留了这些项,同时在不假设模型正确的情况下恢复偏差和方差成分。
- 设定错误界: 设定错误界假设加性均值为零噪声,其有限方差为 σ2,且近似误差以概率收敛意义被 K 所界定。估计量使用 |J| = p > n 的线性预测器来近似非线性目标函数。
C 高维空间
在高维各向同性 Gaussian 空间中,大多数观测点位于半径 √p 附近,而不是原点附近。相应地,单位球体积随维度升高而塌缩,而靠近外表面的点所占比例以指数速度趋近于 1。
- 随着 p 变大,来自 p 维各向同性 Gaussian 分布的大多数样本以高概率集中在半径 √p 附近。这源于高维各向同性分布的几何性质。
- p 维单位球的体积在 p = 20 左右时就已接近 0。
- 对于 t = 1 或 2 这类较小半径或界限,只有在低维空间中,点才可能以高概率位于原点附近。
- p 维球面附近的观测所占比例以指数速度趋近于 1,在约 p = 30 时呈现出这一特征。该图测量的是位于半径为 0.95r 的内球之外的点所占比例。
D Gaussian process 的几何与度量熵(Section 5)· E Akaike information criterion · F Minimum description length:优化版
这些部分将 ridge 正则化与信噪比几何联系起来,展示调节 α 或约束参数体积如何降低测试方差,同时定义 AIC 以及适用于高维模型的有效自由度 MDL。优化后的 MDL 变体将这一高维修正与最优选择的 α 及 Bayesian 先验项结合起来。
- D Gaussian process 的几何与度量熵(Section 5): 当 p > n 时,minimum-norm estimator 给出了 ridge regression 在小 α 下的极限,将插值解与体积比表述联系起来。minimum-norm solution 出现在使增广逆可行的最小 α 处。
- D Gaussian process 的几何与度量熵(Section 5): 高维线性模型的信噪比体积比可以通过 ridge estimator 表示,其中 α 被解释为 inverse signal-to-noise ratio。这将几何模型体积与 ridge 正则化直接联系起来。
- D Gaussian process 的几何与度量熵(Section 5): 增大 α 会降低测试方差,并可能消除插值峰值,这表明该峰值可能源于次优调参,而非不可避免的效应。所给段落将峰值消失归因于对 α 的审慎选择。
- D Gaussian process 的几何与度量熵(Section 5): 约束 ||β||2 ≤ c 会降低模型体积和 SNR,增大 α,从而降低测试方差;直接增大 α 具有相同的正则化作用。两种方法都约束总信号:一种直接通过 α,另一种间接通过 ridge 约束。
- E Akaike information criterion: AIC 通过估计样本外预期 log-likelihood 在模型之间进行选择;等价地,它在校正有偏的 plug-in likelihood 估计后,最小化 Kullback–Leibler divergence。对于 Gaussian GGM,准则使用 ridge estimate 和模型的参数数量构造。
- E Akaike information criterion: 标准 AIC 使用固定且与数据无关的 ridge parameter α,而 AIC-CV 通过 k-fold cross-validation 选择 α。两种准则都将 ridge estimate 代入 Gaussian model 表述。
- F Minimum description length:优化版: MDL-opt 通过将有效自由度与针对这些自由度优化的 α 结合,使描述长度适应 n < p。其目标保留给定模型下的数据编码长度和模型编码长度,同时为 β 加入 Bayesian 先验项。
G MDL 导致高维情形下的欠拟合 · H 模拟细节
该命题表明,在其规定条件下,随着维度 p 增加,MDL 选择的支持集包含于真实支持集中的概率趋近于一,即假阳性概率趋于零。模拟比较了设定正确的线性模型和 sigmoid 误设模型,并将 p 变动到远超固定样本量的范围。
- G MDL 导致高维情形下的欠拟合: 随着 p 增大,MDL 以趋近于 1 的概率选择 ˆS ⊆ S,因此假阳性概率趋近于零。这是该命题针对可能为非线性的数据生成过程、但使用线性模型进行检验时给出的高维欠拟合保证。
- G MDL 导致高维情形下的欠拟合: 证明结合了 MDL 的经验方差、模型复杂度和参数描述成分的界。论证使用了单调性、Jensen 不等式、Markov 不等式、Stirling 近似和欧氏球近似。
- G MDL 导致高维情形下的欠拟合: 该界中占主导地位的最后一项随 p 增大而消失,从而推动该命题关于支持集包含关系的结论。第一项始终由 K/γ 界定,而最后一项占主导地位并收敛于零。
- H 模拟细节: 模拟比较真实线性模型 f(X) = Xβ 与错误设定的 sigmoid 模型 f(X) = 1/(1 + exp(Xβ))。两种情形均固定 d = 5 个非零系数,并将 ||β||2 = 1 进行归一化。
- H 模拟细节: 模拟使用 n = 40 个观测、SNR 2 和噪声方差 0.5,其中 80% 用于训练,20% 用于测试。这得到 ntrain = 32 和 ntest = 8。
- H 模拟细节: 参数数量从 p = 3 变化到 p = 320,使训练比率 p/n 从 0.09 变为 10。真实模型维度保持为 d = 5,而参数数量扩展至超过训练样本量。
- H 模拟细节: Ridge 估计使用 α = 0.5 或 10 折交叉验证,而 Lasso 使用 glmnet 通过 10 折交叉验证选择 α。对于 Ridge 交叉验证,选择 MSE 最小的 α。
I 训练样本与测试样本中的残差
模型包含 64 个预测变量,但只有 5 个非零系数;在插值点,模型能够完全拟合训练数据。尽管如此,测试残差方差仍相对较小,因为 ridge 正则化隐藏了不重要预测变量方向上的噪声。
- 训练残差: 在 p = n 时,包含 64 个预测变量的模型能够精确拟合每个训练观测,尽管真实非零系数只有 5 个,仍产生零训练残差。这体现了训练残差面板所展示的插值行为。
- 测试残差: ridge 参数保留了不重要方向上的预测变量噪声,即使纳入全部 64 个预测变量,也能限制测试残差方差。模型对完整的 64 个预测变量模型使用 ridge 估计。
- 测试残差: 在插值点之后,测试残差仍相对较小,说明精确拟合训练数据并不一定会导致方差爆炸。测试残差面板显示存在一定方差,但没有显著增加。