正在学习

6.6 硬阈值与软阈值:装袋法

6.6 硬阈值与软阈值:装袋法

按设计,模型选择为构建模型提供了硬阈值,因为变量要么被包含("in"),要么被排除("out")。如果能完全确定 的值要么为 0 要么远离 0,从而每个变量都应被纳入或排除模型,那么这种方法就是合理的。如果允许那些纳入与否尚不确定的变量产生一定影响,可能会得到更好的预测模型。具有这种性质的一种方法是收缩估计,这将在第 4 章讨论。第二种方法是组合预测模型,而不是选择单一设定。在这种情况下,可以以这样的方式组合模型:对包含已知有价值变量的模型赋予较大权重,而对使用纳入与否更不确定的变量的模型赋予较低权重。从这个意义上说,所有变量都可以被包含,其权重反映我们认为它们的有用程度。模型组合将在第 14 章讨论。第三种方法是装袋法(Bagging),可视为本章所讨论的许多方法的扩展。

装袋法是 bootstrap aggregating(自助聚合)的简称,是一种估计预测变量的一般方法。该方法由 Breiman(1996)提出,此处将其纳入讨论是因为在预测文献中装袋法的主要应用是对预测模型中的变量选择。该方法将传统模型选择中使用的硬阈值——对应于 0–1 变量选择指标——修改为软阈值,允许变量选择指标取连续值。该方法包含以下三个步骤,用于从数据 中获得估计量

  1. 对数据 抽取重抽样样本,以获得与原始样本长度相同的自助样本

  2. 基于数据的第 个重抽样样本计算 的估计量

  3. 将最终估计量 计算为重抽样估计量 的均值或某个其他函数。

步骤 (1) 和 (3) 可以根据假定的数据生成过程以及最终估计量的目标性质进行调整。例如,在 Breiman 的原始公式中,数据是独立同分布的,因此选择独立同分布的(经验)自助法。如果数据是相关的,则需要保持相关性的自助法。例如,Inoue 和 Kilian(2008)使用允许相关数据的块自助法。也可以采用其他方法,从而得到不同的估计量和不同的风险函数。

例 6.6.1(模型选择中的装袋法)。 装袋法可用于确定变量的纳入,以获得预测变量:

其中第 个自助法的指示变量 ,当回归模型中第 统计量 的绝对值超过阈值 时等于 1。

基于硬阈值的模型选择是一个装袋法有望产生更好结果的领域;例如,在独立同分布数据情境下可参见 Bühlmann 和 Yu(2003)。尽管在任意给定的重抽样中使用硬阈值来选择模型,但由于在第二步中跨不同重抽样选择不同模型,然后在第三步中对这些选择进行平均,装袋法将其转化为软阈值。

6.6.1 广义收缩方法

Stock 和 Watson(2012)表明,在具有 个预测变量的线性回归模型情境下,上述许多方法可以视为广义收缩方法:

其中回归变量 已被正交化,即标准化为零均值和单位方差且互不相关,使得 。Stock 和 Watson 表明,在渐近情况下且在不要求预测变量严格外生的假设下,

基于预检验、装袋法和正态贝叶斯方法的预测可以写成广义收缩形式

其中 的最小二乘估计量,,且 。标量 取决于预测方法。对于预检验方法,收缩函数取形式 ,其中 是阈值。例如,渐近地,AIC 设定

练习题

传统上,模型选择为构建模型提供了什么?

A. 软阈值
B. 硬阈值
C. 无阈值
D. 随机阈值

在预测文献中,Bagging的主要应用是什么?

A. 估计预测变量
B. 收缩估计
C. 模型组合
D. 预测模型中的变量选择

以下哪些步骤涉及使用自助聚合法(Bagging)来获取估计量

A. 抽取数据重样本以获得自助样本
B. 基于重样本数据计算的估计量
C. 将最终估计量计算为重样本估计量的中位数
D. 将最终估计量计算为重样本估计量的均值或某种其他函数

在布雷曼(Breiman)最初提出的装袋法(Bagging)中,假定数据是相关的。

Bagging将模型选择中传统使用的硬阈值修改为___,使得变量选择指示器可以取一系列连续的值。

解释在套袋模型选择示例公式中指示变量的作用。

在线性回归模型的背景下,以下哪一项是一种广义收缩方法?

A. AIC
B. BIC
C. Bagging方法
D. 以上所有

以下关于Bagging和软阈值的陈述中哪些是正确的?

A. 硬阈值用于在任何给定的重采样中选择一个模型。
B. Bagging通过对在不同重采样中选择的不同模型取平均值,将硬阈值转换为软阈值。
C. 软阈值用于在任何给定的重采样中选择一个模型。
D. Bagging在所有重采样中使用相同的模型。

预检验方法的收缩函数形式为,其中是一个阈值。

在Lasso方法中,增加调整参数会产生什么效果?

登录后解锁笔记、知识点解析、AI 问答

立即登录