正在学习
6.1 模型选择中的权衡
6.1 模型选择中的权衡
模型选择涉及一些非平凡的问题,因为模型拟合的改进可能反映的是模型具备产生更好预测的真正能力,也可能源于模型"过拟合"的倾向,即在样本内提供更好的拟合,但并未真正提升预测精度。这在下一示例所示的线性回归情形中可以清楚地看到。
例 6.1.1(多元回归模型的风险)。对于例 3.2.3 中的模型,全样本估计量 产生如下风险估计:
第一项的均值为 ;对于第二项(与估计相关的风险),有
\begin{array} { r l } & { E [ ( \widehat { \beta } _ { T} - \beta ) ^ { \prime} \Bigg ( T ^ { - 1} \underset { t = 0 } { \overset { T - 1 } { \sum } } x _ { t} x _ { t} ^ { \prime} \Bigg ) ( \widehat { \beta } _ {T} - \beta ) ] } \\ & { \quad = T ^ { - 1} E [ ( \underset { t = 0 } { \overset { T ^ { - 1} } { \sum ^ { n} } } x _ { t} \varepsilon _ {t + 1} ) ^ { \prime} ( \underset { t = 0 } { \overset { T ^ { - 1} } { \sum } } x _ {t} x _ {t} ^ { \prime} ) ^ { - 1} ( \underset { t = 1 } { \overset { T ^ { - 1} } { \sum } } x _ {t} \varepsilon _ {t + 1} ) ] } \\ & { \quad = T ^ { - 1} E [ ( \underset { t = 0 } { \overset { T ^ { - 1} } { \sum ^ { n} } } x _ { t} x _ {t} ^ { \prime} ) ^ { - 1} E [ ( \underset { t = 1 } { \overset { T ^ { - 1} } { \sum ^ { n} } } x _ {t} \varepsilon _{t + 1} ) ( \underset { t = 1 } { \overset { T ^ { - 1} } { \sum ^ { n} } } x _ {t} \varepsilon _{t + 1} ) ^ { \prime} \bigg| x _ {1}, \ldots , x _ {T} ] ] } \\ & { \quad = T ^ { - 1} E [ ( \underset { t = 0 } { \overset { T ^ { - 1} } { \sum ^ { n} } } x _ { t} x _ {t} ^ { \prime} ) ^ { - 1} \sigma ^ { 2} ( \underset { t = 0 } { \overset { T ^ { - 1} } { \sum ^ { n} } } x _ {t} x _ {t} ^ { \prime} ) ] } \\ & \quad = \pi ^ { 2} T ^ { - 1} \delta [ ( \underset { t = 0 } { \overset {T ^ { - 1} } { \sum ^ { n} } } x _ {t} x _ {t} ^ { \prime} ) ^ { - 1} \sigma ^ { 2} ( \underset { t = 0 } \overset \end{array}
因此此处风险为 。与(3.19)中此项增加期望损失不同,样本内损失估计从 中减去此项。因此,在小样本中期望损失估计的向下偏倚可能很大,并且对于包含更多回归变量( 较大)的更复杂模型,这种偏倚倾向于更大。尽管如此,估计效应会随着样本量的增大而消失。
在此示例中,引入额外变量可能降低 ,在这种情况下,额外变量有助于改善模型。或者,这些变量可能只降低第二个(方差)分量——由于加入额外变量后,样本内风险在更多维度上得到最小化,因此效应为负。样本内拟合的改善并不能告诉我们是哪一种效应在起作用。
接下来,考虑两个模型的情形: 和 ,其中第二个模型嵌套第一个。³ 对每个模型,系数估计量的选取满足:对样本
由于 嵌套 ,由最小化性质可知,对给定的数据样本,
因此,较大的模型 总是至少提供与较小模型 同样好的拟合,并且在大多数情况下会提供严格更好的样本内拟合。这里的关键在于,(6.2) 比较的是两个模型的样本内表现,即使用相同的样本 进行参数估计和模型评估。回归 在现有回归变量集合中每加入新的变量时(弱)递增这一众所周知的结果,就是上述结论的一个特例。事实上,只要预测变量之间不存在完全共线性,具有 个预测变量的线性回归模型在 个观测的样本中即使预测变量与结果变量相互独立,也能实现完美拟合。因此,即使在总体参数概率极限 处第一个(小)模型的期望损失实际上小于第二个(大)模型的期望损失,(6.2) 所表示的样本内排序关系依然成立。于是,(6.2) 可能与以下情形同时成立:
更优的样本内拟合本身并不能得出某个特定预测模型必然产生更好预测的结论。嵌套模型的这一特殊结果为一般情形提供了直觉:参数更多(或更复杂)的模型在样本内拟合的比较中往往表现良好,即使与较小型模型相比,它们产生的预测较差,而较小型模型在应用于新数据时可能产生更小的预期损失。
预测模型的选择涉及较大模型所伴随的额外估计误差与使用排除相关预测变量的更简约模型所带来的更大模型设定误差之间的权衡。这种权衡在线性回归模型中采用均方误差损失时尤为清晰。我们在例 3.2.6 中看到,估计误差效应可以分解为两个部分:一个以速率 消失的方差项,以及一个偏差项——如果被遗漏变量的系数接近于 0,该偏差项可能具有相同的阶数。或者,如果模型严重设定不当,偏差项可能是更高阶的。使用第 3.2.1 节的记号和定义,我们可以将此估计误差项写为
其中 是第 个模型估计的参数个数。
设模型为 ,其中 的某些元素为 0, 满秩,且 。不同的子模型 通过将 的某些元素设为 0(即从预测模型中省略相应的协变量)而产生。对于这些子模型中的任何一个,通过省略共同的一阶风险成分 得到的与估计相关的风险项 为
(6.4) 式中的第一项反映了估计误差,容易估计。它随着模型维数(以 度量)的增大而增大。第二项由模型设定误差引起,难以获得,因为它依赖于通过 体现的真实模型,而 在实践中永远未知——如果已知,就不存在模型选择问题了。随着更多变量被纳入模型,这一项通常会减小。
(6.4) 式所揭示的权衡既依赖于真实模型,也依赖于最大模型 中包含的预测变量个数。当 的维数较小时,估计误差项不会太大。许多传统的模型选择方法正是针对这种情况开发的。对于高维模型( 较大),估计误差可能变得非常大。例如,所谓的"厨房水槽"回归(即包含所有可能预测变量的回归)通常产生很差的预测,因为尽管它们防止了 (6.4) 式第二项所反映的设定误差,但 很大。
稀疏模型是指 中真正非零元素的个数相对于 的维数较小的模型。对于这类模型,设定误差项相对于与大型模型相关的估计误差可能较小,因此在这种情况下,去除许多协变量的方法更为可取。相反,在协变量众多且预期 的许多元素非零的情况下,即 但随 增长时,对于所有简约模型而言设定误差项都可能很大。在这种情况下,考虑众多协变量的替代方法可能更为有用,尽管针对这种情况也有模型选择方法可用。第 10 章关于因子模型的内容与这种情况特别相关。
模型选择的方法受到待考虑模型集合规模的影响。潜在模型的数量可能很快变得非常大,大到即使借助现代计算能力也是一个难题。例如,考虑对应于从列表 中选择变量子集所构成的不同线性回归的不同预测模型。要对 个潜在预测变量 的所有可能线性模型进行全面搜索,意味着需要考虑 种可能的模型设定。例如,对于两个可能的预测变量 ,存在四种可能的组合:{0, 0}、{1, 0}、{0, 1} 和 {1, 1},其中 0 表示该变量被排除在模型之外,而 1 表示该变量被纳入模型。由于必须估计每个模型的参数,这可能将全面设定搜索限制在相对较小的预测变量集合上。例如,当 时,可能的模型数量超过一百万。因此,跨模型设定的全局搜索仅在低维模型集合中采用。
练习题
通过过拟合来提高模型拟合度的主要风险是什么?
在多元回归模型中,风险估计方程代表什么?
以下哪些是多元回归模型中风险的组成部分?
在小样本中,预期损失估计的下偏程度更大,对于包含更多回归变量的更复杂模型,这种下偏程度往往更显著。
在模型中纳入更多变量并不总是能提高模型的预测准确性。
多元回归模型中的风险由给出,其中表示___的数量。
解释为什么较大的模型()在样本内总是至少能提供与较小模型()一样好的拟合效果。
关于回归和额外变量,以下哪些陈述是正确的?
具有个预测变量的线性回归模型在具有个观测值的样本中会产生完美拟合,即使预测变量与结果无关,只要预测变量不是___即可。
当较小模型下的总体期望损失小于较大模型下的总体期望损失时,样本内排序的含义是什么?
以下哪项陈述正确描述了多元回归模型中模型复杂度与样本内拟合之间的关系?
在评估模型选择的权衡时,哪些因素会导致复杂模型预期损失估计的向下偏差?(选择所有适用项)
多元回归模型的风险估计可分解为和第二项,第二项涉及。第二项代表__________风险。
登录后解锁笔记、知识点解析、AI 问答
立即登录