正在学习
3.2.2 风险与信息集
3.2.2 风险与信息集
公式(3.15)中风险的定义方式意味着其精确形式取决于信息集的设定。信息集的设定方式对风险很重要,正如它在预测的评估和比较中也很重要一样,这一点我们将在本书的第三部分看到。
信息集的设定对于理解许多预测问题至关重要的偏差-方差权衡概念尤为重要。接下来我们使用线性预测模型和均方误差损失的特殊情形来说明这一点。我们假设并非所有可能的预测变量都已纳入模型。
假设有 个潜在预测变量,并令 为一个随机变量,用于捕捉所有 个潜在预测变量的当前和过去值,包括结果变量 的过去和当前值。类似地,令 为由 个预测变量的子集生成的随机变量。最后,定义 为由被省略变量子集生成的随机变量,因此 。注意,根据我们对 整体求积分还是仅对其子集求积分,公式(3.15)会得到不同的表达式。
例 3.2.6(子集回归的风险)。考虑与例 3.2.3 相同的问题。然而,假设预测模型仅包含 个回归元,除非所有变量(包括 )的均值均为 0,否则模型中包含一个常数项。
的最小二乘估计量可写为 ,其中 的维度与 相同,在省略变量的位置用 0 代替,而在其余位置(即 对应的位置)则用 对所包含回归元进行回归得到的最小二乘估计量。考虑估计因素,预测误差由下式给出:
其中 是在给定被省略回归元条件下 的条件期望。这就是标准的被省略变量偏差公式,其中普通最小二乘(OLS)估计量的均值是省略变量的函数。
仅对 求平方预测误差的积分(以 为条件),期望损失变为
第二项是与估计误差相关的方差项。使用与例 3.2.3 相同的数学方法,这第二项近似等于 。第三项是偏差项。
我们将(3.21)中的第二项和第三项(即大方括号内的项)统称为"估计效应项"。注意,除了收集更多数据从而进一步扩大 之外,第一项是无法通过其他方式改进的,尽管这条改进预测的途径永远不应被忽视。
这种问题的表述方式产生了均方误差计算中常见的偏差-方差权衡。当预测由线性回归构建且包含常数项时,我们只能在以潜在省略预测变量为条件的意义下考虑有偏预测的概念。预测模型构建中出现的几乎所有选择,无论损失函数为何,都围绕着添加预测变量的成本与收益展开。在均方误差损失下,我们可以看到在方差项(即(3.21)中的第二项)与偏差平方项(第三项)之间存在权衡。
增加变量会通过方差项增加损失,方差项会增加 。然而,潜在的好处是,由于多估计了 的一个参数,偏差项 可能会因此变小。
方差项以速率 消失,因此作为样本量的函数,其阶数小于(3.21)中的第一项。对于严重错误设定的回归,偏差项可能与第一项具有相同的阶数,因此对于足够大的偏差,该项可以以一个数量级压倒方差项。但请注意,合理应用的统计检验通常可以用来排除这种情况。回想一下,在标准假设下(当然对于我们的独立同分布例子也是如此),回归系数显著性假设检验的功效以速率 增长。这意味着在偏差项阶数大于方差项的情况下,模型错误设定的统计检验具有良好的功效。当统计检验发现难以区分模型时,偏差-方差权衡就变得更加复杂。
注意(3.21)中的风险是 的函数。或者,我们可以考虑对所有 进行积分,以获得风险的不同表达式,我们将在下一个例子中展示。
例 3.2.7(子集回归的风险,续)。考虑与例 3.2.6 相同的问题。我们可以将完整回归写成
其中 ,且 最小化 ,其中期望是对所有随机变量计算的。 的方差是 ,其中 。现在要运行的回归被视为具有较大方差的"短"回归。由例 3.2.3 的结果直接可得风险为
因此缩放变量 大于例 3.2.6 中表达式的值。
(3.23)中的表达式是(3.21)在被省略变量 上的平均值。在我们将被省略变量积分掉的这个版本中,"估计效应项"与不可预测的分量卷积在一起。第一种方法通常在比较模型时更为有用。对于方差项随样本量增大而渐近消失的方法,其结果通常归结为 与 之间的比较。例如,对于本书第三部分涵盖的许多样本外预测评估方法,这一点成立。
练习题
在风险的背景下,信息集的设定会影响什么?
如果表示捕获所有潜在预测变量的随机变量,那么表示什么?
在预测误差公式中,项代表什么?
以下哪些是期望损失公式的组成部分?
预期损失公式中的第二项与预测的偏差有关。
向预测模型中添加更多预测变量并不总是会降低预期损失。
项近似于预期损失公式中的__________项。
偏差与方差之间的权衡是计算__________时常见的考虑因素。
解释预测中信息集与风险之间的关系。
在预测模型中,增加额外的预测变量会如何影响预期损失?
关于预测中的偏差-方差权衡,以下哪些陈述是正确的?(选择所有适用的选项)
在风险和信息集的背景下,将结果扩展到条件预测时的主要挑战是什么?
在考虑子集回归的风险时,以下哪项陈述正确描述了方差项与纳入的预测变量数量和样本量之间的关系?
关于在均方误差(MSE)损失下向预测模型中添加变量会产生什么影响,以下哪些陈述是正确的?选择所有适用的选项。
在子集回归的风险背景下,仅当考虑无条件预测误差时,普通最小二乘法(OLS)估计值的均值才是遗漏变量的函数。
预期损失公式(3.21)中的第二项是与估计误差相关的___项,使用与线性预测模型示例中相同的数学方法,它近似等于。
登录后解锁笔记、知识点解析、AI 问答
立即登录