正在学习
6.8 模型选择程序的性质
6.8 模型选择程序的性质
选择模型选择程序需要深入理解这些方法的运作方式及其具备理想性质的程度。关于"好的"选择程序应实现的目标,存在不同的概念,并且正如我们将看到的,这些概念并非总是相互一致的。
如果反映数据生成过程的真实模型 包含在所考虑的预测模型集合 中,那么一致模型选择的概念就变得有意义。假设模型集合是离散的,一致模型选择意味着当样本量增大时,,其中 是被选定的模型。按此标准,常用方法通常有两种结果——要么它们是一致模型选择器,要么它们意味着存在选择过大模型的正概率,因此是保守的。具有欠拟合模型渐近正概率的选择技术则较为罕见。
累积投资组合价值
图 6.6:与不同预测模型相关的累积财富。
证明模型选择一致性的标准方法将模型集合划分为三个子集,,其中 是欠拟合模型集合(排除了数据生成过程 中存在的变量), 是过拟合模型集合(除了真实模型 中出现的变量外,还包含了多余的变量)。然后证明 且 ,当样本量增大时。
序贯假设检验通常不是一致的模型选择方法,并且倾向于高估预测模型的规模。这可以通过考虑两个线性回归模型之间的选择来最好地展示:一个具有 个回归变量,另一个具有 个回归变量。如果我们拒绝关于较大模型中额外系数为 0 的假设检验(例如,似然比检验),则选择较小的模型。假设较大模型是真实模型。那么拒绝原假设的概率——即选择较大(真实)模型的概率——等于检验的势。对于任何一致性检验,势渐近地趋于 1,因此欠拟合的概率趋于 0。反之,如果较小模型是真实模型,拒绝原假设进而选择较小(真实)模型的概率等于检验的显著性水平。标准假设检验将显著性水平控制在渐近意义上不为零,因此过拟合(即当较小模型是真实模型时选择较大模型)的概率渐近地等于检验的显著性水平,该水平不为零。因此,即使在渐近情况下,也存在过拟合模型的正概率。对于更复杂的模型选择过程,计算过拟合发生的程度是困难的且依赖于具体方法,但基本洞见仍然成立。
为了启发式地理解信息准则所产生的各类结果,我们针对具有 个变量的一般多元线性预测模型建立模型一致性:
这里, 是 向量, 是 矩阵。这种设定不如信息准则构造中所使用的设定一般。但它足够一般,可以涵盖实际预测情境中遇到的大部分信息准则应用。具体而言,它涵盖了向量自回归(VAR),其中 捕捉 的滞后值,以及通过在 矩阵中插入 0 得到的一般线性方程组。设 表示模型中变量的总数,例如,在 VAR 中,包含 个变量的 期滞后,因此当包含所有滞后期时 ,当排除第 期滞后时 ,依此类推。最后,设 表示模型残差平方和的协方差矩阵。
正如我们在 (6.11) 中所见,信息准则选择模型(由 索引)以最小化 。信息准则的不同之处在于它们对 的选择,而该项在决定特定信息准则是否导致一致模型选择方面起着关键作用。为了确定信息准则何时是一致的,注意到由 (6.11),
首先考虑过拟合模型的情形,,其中 是真实模型的参数个数。在这种情况下,超出 个参数之外的额外模型参数在总体上为 0。在正态性条件下, 是用于检验这些系数为 0 的通常的似然比检验统计量。在标准条件下,它依概率收敛到一个 随机变量,因此我们有
要使其收敛到 1,我们需要 。由于 ,这意味着需要 。
接下来,考虑模型参数过少的情形,。在这种情况下,随机变量 以概率 1 为正,我们有
由于 ,我们需要 ,才能使 (6.39) 中的概率在极限下等于 1。
综合以上结果,得到一个信息准则渐近地选择正确模型的条件如下:
对具体的信息准则检验这些条件,可以验证它们是否是一致性的模型选择准则。对于 (6.14) 中的 AIC,,因此条件 (b) 不成立,AIC 不会渐近地选择正确模型。鉴于 AIC 与 Mallows 的渐近等价性,这个结论对 Mallows 也成立。AIC 的设计思想是:所有被考虑的模型都是真实模型的子集。因此,缺乏一致性不应被视为该准则的缺陷,而应看作是该方法设定方式的反映。
接下来我们说明当存在一个"真实"模型时会发生什么。作为一个示例,考虑一元情形,其中 。对于 AIC,,因此 (6.37) 简化为
这可以很容易地计算。在这种情况下,渐近地 ,正确模型有 96% 的概率被选中,而包含额外变量的错误模型有 4% 的概率被选中。这类似于我们用 统计量在 5% 的显著性水平下检验是否应包含额外变量所得到的结果,即一个临界值为 ±1.96 的双边检验。与上面讨论的序贯检验过程一样,问题在于第一类错误的概率在渐近意义上并不趋于 0。
对于贝叶斯信息准则,,因此 ,而 当 。因此该准则确实以概率 1 渐近地选择正确模型。重复比较多一个参数的模型与真实模型的计算,我们现在有
\begin{array}{rl} & P\left( (\ln|\hat{\sigma}_{k_0+1}^2| - \ln|\hat{\sigma}_{k_0}^2|) + (n_{k_0} + 1 - n_{k_0}) \right)(\ln(T)/T) > 0 \right) \\ & \quad = P(U^* < 2\ln(T)), \end{array}
这随着样本量 的增加而趋于 1,表明在大样本下真实模型会被选中。
Hannan–Quinn 准则同样导致一致的模型选择,因为 当 。然而,其收敛到真实模型的速度远慢于 BIC。Hannan 和 Quinn 所提出的调整确实旨在减缓添加额外变量的速度——从而减少过拟合——同时保持一致性。
对于固定回归变量且误差独立同分布的线性回归,Shao(1993)和 Shao(1997)证明,当 固定时,"留出 个样本"交叉验证不是一致的模型选择程序。与 AIC 类似,该方法渐近上永远不会选择过小的模型,但会以正概率选择过大的模型。因此,平均而言,该方法会对数据过拟合。Shao(1993)证明,如果验证样本相对于估计样本占主导地位,即渐近地 ,则该方法将一致地估计真实模型。Shao(1997)给出了留出 个样本交叉验证与信息准则之间的直接关系,表明在大样本下这些方法是等价的。虽然这些论文的假设对于大多数预测目的而言过于严格,但放宽这些假设不太可能改进这一结果。因此,我们预期交叉验证会产生包含过多回归变量的模型。
模型一致性也可以在真实模型中参数数量相对于 较大的情况下加以考虑,这可能发生在参数数量随 增加时。在这些情况下,信息准则和交叉验证方法除了计算上变得过于繁琐之外,并不具有一致性性质。正是针对这些情形,设计了 Lasso 及其变体方法。在独立同分布数据的设定下,若非零系数的数量及其取值是固定的,Knight 和 Fu(2000)证明,如果 收敛于一个非负常数,则 Lasso 以正概率选择正确的模型。这一结果已被推广,允许被包含项的数量随 增长。
模型一致性是否必然是一个理想的性质?一致性是一个较弱的性质,因为它既不能大幅缩减模型选择方法的数量,也不能告诉我们如何在任何特定应用中具体指定惩罚项。例如,如果我们修改 BIC 或任何其他一致程序,使其惩罚项变为 ,其中 为任意常数,则一致选择的一致性条件仍然满足。不同的 值很容易导致模型选择结果不同。Lasso 也存在同样的问题。因此,各种各样的模型选择程序都能提供一致的模型选择。正如计量经济学中的常见情况,给定一个速率条件并不能确定在特定应用中可能想要使用的具体惩罚项。
Shibata(1980,1981)反对基于上述一致性结果来选择模型选择程序。如果模型不是稀疏的,即存在许多系数接近但并不精确等于零,则用于检验一致性性质的渐近实验将不具有信息量。一致方法不会欠拟合,因为对于固定的一组较大备选,排除检验的功效趋于 1。然而,如果较大模型中的附加系数接近零,因此渐近地并不大,则一致方法很容易欠拟合。在所有模型都是较小近似的更复杂实验中,支撑一致模型选择结果的假设可能并不适用。事实上,Akaike(1974)正是针对这种情况开发了 AIC。此外,可用的样本量可能不足以使渐近性质提供合理的指导。我们也不一定关心选择正确的变量,而是关心选择能够产生良好预测的模型。
对于具有大量甚至无穷多个非零系数的线性回归模型,Shibata(1980,1981)在没有任何模型被正确设定的情况下,引入了模型选择准则的渐近有效性概念。其思想是,某些模型 为估计相关风险提供了一个下界,记为 。由于没有模型是正确的, 中的"最佳"模型取代了正确模型。如果当 时,所选模型 的(估计相关)风险满足
则该模型选择程序被认为是渐近有效的。这里假设所有模型的风险都渐近发散。这意味着所有模型都欠拟合真实模型,并排除了真实模型被包含在 中的可能性。
Shibata(1981)证明,AIC 和 Mallows 在该准则下是渐近有效的,而 BIC 则不是渐近有效的。事实上,对于具有确定性惩罚项( 是非随机的)的信息准则,Yang(2005)和 Shao(1997)证明,一致的准则不可能在 Shibata 意义下是渐近有效的,因此不存在同时具有这两种性质的信息准则。
为建立这些结果,通常假设模型数量相对于样本量较小。这一假设是为了获得渐近表示合理的统计量。在关于渐近效率的文献中,真实模型可以渐近地变大,但所检验的模型数量相对于样本量仍然较小。最近,关注点已转向当模型数量较大时——甚至可能大于样本量时——模型选择方法的性质。如上所述,在这些情况下无法检验信息准则,因为它们的计算量过大,并且需要评估所有可能的模型,这在实践中变得不可能。然而,Lasso及其变体的有用结果已在这种情况下得以建立。Leng、Lin和Wahba(2006)给出了一个类似于为信息准则建立的渐近效率性质的结果。具体而言,导致良好模型选择性质的Lasso惩罚因子的选择,与确保最佳样本内预测精度的的选择有所不同。样本内预测精度准则通常允许在真实模型之外包含额外的变量,尽管是以一种受约束的方式。所有这些结果都针对独立同分布模型,并对解释变量以及的行为施加了额外的限制。然而,这些结果所产生的直觉很可能适用于具有非独立同分布数据的预测情形。
练习题
以下哪项正确定义了一致模型选择?
在证明模型选择一致性的背景下,代表什么?
当样本量增大时,以下哪些是证明模型选择一致性标准方法的结果?(选择所有适用的选项)
以下关于模型选择中序贯假设检验的陈述哪些是正确的?(选择所有适用的选项)
在用于模型选择的序贯假设检验中,如果较小的模型是真实模型,则选择较小(真实)模型的概率等于检验的显著性水平。
对于顺序假设检验中的任何一致性检验,如果较大的模型是真实模型,那么欠拟合的概率会渐近趋于1。
在一般多元线性预测模型中,是一个向量,是一个___。
在信息准则模型选择公式中,项在确定特定信息准则是否会导致___方面起着至关重要的作用。
解释在序贯假设检验中,当较大的模型是真实模型时,检验的功效如何影响欠拟合的概率。
在一致模型选择的证明中,集合和的意义是什么?请简要解释。
登录后解锁笔记、知识点解析、AI 问答
立即登录