正在学习

6.9 模型选择方法的风险:蒙特卡罗模拟

6.9 模型选择方法的风险:蒙特卡洛模拟

模型选择方法应被视为估计过程的一部分。这使我们关注预测方法的风险,它是选择规则、考虑的模型集合、数据以及真实模型参数的函数。例如,对于两个模型和统计量 (其中 0 表示选择第一个模型,1 表示选择第二个模型),由模型选择方法生成的预测可以写为

与模型选择过程相关联的预测只是数据的一个比任一单独模型更复杂的函数。然而,它仍然是数据的函数,因此具有一个依赖于真实模型参数 的风险函数。一个良好的模型选择程序在那些并非明显误设的合理模型上提供可接受的风险。一致性准则以如下方式考察风险:它关注当真实模型位于候选模型集合中时,逐点渐近风险的最小化。渐近效率关注当真实模型大于任一候选模型时,相对风险的极限。这些性质中的每一个都是渐近的。风险的小样本评估表明,一致性模型选择方法通常不会以概率 1 选择正确模型。在渐近意义上与最优模型一样好的方法,在小样本中也不会总是与最优模型一样好。因此,在蒙特卡洛设定下考察一些常用方法的风险函数是具有建设性的。

考虑蒙特卡洛实验的另一个原因是,与本章所涵盖的基于模型选择方法的预测相关的风险函数通常很难进行解析刻画。原因在于,所选择的预测并不是底层数据的光滑函数,从式 (6.43) 可以清楚地看出这一点,并且风险在很大程度上依赖于预测模型的参数。

第一个蒙特卡洛模拟考察独立同分布数据的均值估计,数据生成方式为

在 MSE 损失下,最优但不可行的估计量是已知均值 ,这导致风险为 1,即不可预测成分 的方差。基于样本均值的均值估计的风险等于 ,其中 为样本量。除了直接使用样本均值外,我们还可以采用上述模型选择方法,在固定均值 (因此不涉及估计误差)的模型与使用样本均值 作为预测的模型之间进行选择。我们所采用的方法包括:(i) AIC;(ii) BIC;(iii) 基于双侧备择假设、检验水准为 5% 的 t 检验的预检验方法;(iv) 对第 (iii) 项中损失最小化方法的 Bagging,使用从去均值数据中有放回抽样的 i.i.d. 自助法。


图 6.7:常均值模型()且无时变预测变量情况下,不同模型选择方法的估计相关风险。横轴表示均值 的大小,纵轴表示估计相关风险。

图 6.7 显示了使用样本量 时,这四种方法中四种的近似估计相关风险。估计相关风险通过去除不可预测成分来消除一阶不确定性。在这里,这相当于从风险中减去 1。当真实均值接近 时,在本例中,每种模型选择方法的风险都低于直接估计均值时的风险。这是因为模型选择方法具有非零概率选择强制均值为零的预测。然而,它们并非总是以概率 1 选择 的正确模型,这正是没有任何方法实现零估计相关风险的原因。 处风险的差异反映了无均值模型被选中的概率。

然而,在真实模型 时应用模型选择方法所带来的这种收益是有代价的,因为当 "较小"(即接近但不完全等于 0)时,所有模型选择方法的风险都远高于直接使用样本均值预测 时的风险。在该参数空间邻域内,风险上升至高于直接使用样本均值的风险,因为选择强制 的(错误)模型的概率不可忽略,这会对 MSE 产生不利影响。该参数空间区域恰恰是检验难以区分两个模型的地方。然而,最终随着真实均值变大,每种模型选择方法以概率 1 选择具有非零均值的模型,风险再次下降至直接估计样本均值的水平。

风险函数中的这种"驼峰"被前面讨论的逐点证明所忽略——在渐近意义上,对于任意 的点,风险函数逐点收敛于 0。然而,驼峰永远不会消失,并且在 附近总是存在一个区域,在该区域内模型选择方法不会以概率 1 选择任一模型,因此模型选择所引发的风险总是有可能高于使用较大模型时的风险。因此,一致收敛结果不仅具有理论意义,而且具有实际价值。

当搜索中纳入更多模型且系数局部于 附近时,可以得到类似的结果。考虑用 个可能的回归变量来预测一个被解释变量。假设这些回归变量彼此独立,并通过系数向量为 的线性模型与被解释变量相联系。设 个系数等于 ,其中 为估计样本长度,我们仍将其设定为 100。其余系数设为 0,因此数据生成过程为:

全模型使用全部八个回归变量。当 时,正确设定的回归仅包含与 个非零系数相对应的那些变量。我们考虑序贯假设检验——剔除所有 t 统计量在 5% 水平下未能通过双侧显著性检验的变量——以及 BIC 和 AIC。图 6.8 给出了 时的结果,因此大多数变量应被剔除;而图 6.9 则在 的情况下重复同样的练习,因此仅需剔除一个变量。

图 6.8 表明,0 附近的"凸峰"现象在更复杂的情形中依然存在。实际上,唯一的问题在于凸峰有多大。模型选择方法此时可能比全纳入法(即同时包含有用和无用的回归变量)表现更差。尽管如此,对于大多数参数空间,模型选择方法仍然优于全纳入法,这也解释了为什么模型选择在实践中很受欢迎。此外,当 充分接近 0 时,模型选择方法甚至比正确设定表现得更好。这是因为模型选择方法本质上是收缩估计量,所以当 接近 0 时,收缩是一种有用的方法。

在上述例子中,AIC 与 BIC 以及序贯检验方法的性质有显著差异。当其他方法表现良好时,AIC 表现并不太好;而当其他方法表现较差时,AIC 也并未同样地变差。这正是前述过拟合所导致的结果。当纳入过多变量时,系数估计的收缩程度不够,我们更接近于包含所有回归变量且风险函数为平坦的解。随着 变大,没有一种方法能比仅纳入正确回归变量的方法表现更好。尽管 BIC 具有正确渐近模型选择的性质,但在小样本中该方法仍表现出一定的过拟合倾向。这种过拟合不像 AIC 那么严重,因为 AIC 在渐近意义上也会过拟合。在本实验中,序贯假设检验方法接近 BIC,但在更大样本中,BIC 的损失函数将更接近正确设定下的损失函数。

图 6.8:八个时变预测变量中三个具有非零系数的模型下,不同模型选择方法的估计相关风险。横轴表示三个预测变量非零系数的幅度,纵轴表示估计相关风险。

当几乎所有变量都应被纳入时,真实模型与包含所有变量的模型之间的差异显然很小,如图 6.9 所示。无需剔除许多变量的影响是三方面的:第一,当系数非常接近 0 时,模型选择的收益更大;第二,对于远离 0 的系数,期望损失中凸峰的规模更大;第三,当系数充分远离 0 时,所有方法的表现相似,因为可能的选择范围很小。不过,凸峰的相对大小以及随 增大各方法最终趋于稳定的方式在所有方法间是一致的。

尽管有上述结果,相较于单纯使用基础模型,预检验方法确实具有一些有价值的性质。对于非零参数的足够大的值,预检验估计量在渐近意义上具有与搜索所涉及模型集合中最大模型相同的风险。这直接源于预检验具有一致性的性质,因而序贯搜索所偏好的模型将是最大模型,两者具有相同的风险函数。这使得风险函数不会因错误剔除远离 0 的变量而无界地增大。收缩方法则不具备这种性质。然而,这也许并不像看起来那么令人欣慰,因为它仅保证在明显某些参数非零的情况下——即向 0 收缩不太可能是一种合理方法的情形——预检验方法表现良好。

图 6.9:八个时变预测变量中七个具有非零系数的模型下,不同模型选择方法的估计相关风险。横轴表示七个预测变量非零系数的幅度,纵轴表示估计相关风险。

这些结果与Ng(2013)的研究发现相一致,即在评估相关预测的有限样本风险时,BIC或AIC准则之间并不存在系统性的优劣之分。Ng(2013)通过蒙特卡洛模拟发现,小模型(参数较少的模型)并不一定优于大模型,即使数据是由一个具有有限参数个数的模型生成的。我们无法回避这样一个问题:最优的预测方法将取决于真实的数据生成过程,而在实际中该过程是未知的。

练习题

以下哪项最能描述统计量在模型选择中的作用?

A. 它衡量预测的准确性。
B. 它通过返回0或1来确定选择哪个模型。
C. 它计算每个模型的风险函数。
D. 它估计真实模型参数。

一致性准则在模型选择中关注什么?

A. 最小化小样本中的风险。
B. 最大化在小样本中选择正确模型的概率。
C. 当真实模型在候选集合中时,最小化逐点渐近风险。
D. 确保模型选择方法具有计算效率。

以下哪些是使用蒙特卡洛模拟来评估风险函数的原因?(选择所有适用的选项)

A. 风险函数通常难以用解析法描述。
B. 蒙特卡洛模拟可提供精确的解析解。
C. 所选预测不是基础数据的平滑函数。
D. 蒙特卡洛模拟的计算速度比解析法快。

在小样本情况下,一致性模型选择方法总是会以概率1选择正确的模型。

基于样本平均值估计均值的风险等于___

解释为什么在模型选择方法中,风险函数在附近可能有一个“凸起”。

以下哪种模型选择方法在文本中未被提及用于估计均值?

A. 赤池信息准则(AIC)
B. 贝叶斯信息准则(BIC)
C. 岭回归
D. 基于t检验的预检验方法

以下关于渐近有效性的陈述哪些是正确的?(选择所有适用的选项)

A. 它关注的是当真实模型比任何候选模型都大时相对风险的极限。
B. 它保证模型选择方法在小样本中会选择正确的模型。
C. 它是一种渐近性质。
D. 它最小化逐点渐近风险。

在均方误差(MSE)损失下,均值的最佳可能估计量是不可行的,因为它需要知道真实均值。

使用蒙特卡罗模拟来评估模型选择方法的风险的主要优势是什么?

哪种模型选择方法涉及使用双侧备择假设且显著性水平为5%的t检验?

A.赤池信息准则
B.贝叶斯信息准则
C.预检验方法
D.装袋法

在均方误差(MSE)损失下,均值的最佳(但不可行)估计量的风险函数等于___

在使用独立同分布数据进行均值估计的蒙特卡罗模拟中,当真实均值接近零时,哪种模型选择方法有非零概率选择施加零均值的预测?

A. 只有赤池信息准则(AIC)
B. 只有贝叶斯信息准则(BIC)
C. 赤池信息准则(AIC)和贝叶斯信息准则(BIC)两者
D. 赤池信息准则(AIC)、贝叶斯信息准则(BIC)、预检验方法和装袋法

关于蒙特卡罗模拟中模型选择方法的风险函数,以下哪些陈述是正确的?

A. 一致的模型选择方法在小样本中总是会以概率1选择正确的模型。
B. 渐近有效方法在小样本中总是会像最佳模型一样好。
C. 在附近总存在一个区域,模型选择方法不会以概率1选择任一模型。
D. 风险函数中的凸起在的任何点上都会渐近消失。
E. 一致收敛结果具有实际价值,因为风险函数中的凸起永远不会消失。

当真实模型的时,模型选择方法的风险总是低于单纯使用样本均值来预测的风险。

登录后解锁笔记、知识点解析、AI 问答

立即登录