正在学习

比较多项预测

17.5 比较多个预测

在需要比较两个以上预测的情况下,我们需要考察一个预测向量。上述讨论的某些方法可以推广到包含 m 个预测的一般情形(例如,包容检验),而其他方法则不能(例如,Granger–Newbold 比较)。本节讨论预测数量为任意值时对检验的影响。

在有两个预测的情况下,自然的检验是预测精度相等的原假设。相比之下,在存在多个备选预测的情况下,自然要问是否存在某个预测优于基准预测。这导致一个复合假设,通常比简单的成对预测精度相等检验更难检验。

17.5.1 预测包容

在 MSE 损失下,预测包容可以直接推广到检验第一个预测对一般 维预测向量中其余预测的包容。式 (17.5)、(17.6) 和 (17.7) 的向量形式分别变为

其中, 分别是 维的预测向量和预测误差向量, 维的全 1 向量, 维的回归系数向量。原假设 给出检验第一个预测包容其余 个预测的检验统计量。

17.5.2 优越预测能力检验

White (2000) 研究了预测误差向量或更一般地与这些误差相关的损失向量的情形。然而,他考察的是一个非常不同的问题,即给定最佳预测是从一组潜在的较大模型集合中选取的,我们对最佳预测是否真正优于预先指定的基准预测有多大把握。从一个潜在的较大模型池中选取最佳模型这一事实在评估其表现时可能非常重要:在任意给定的样本中,一个预测模型可能产生较小的平均损失,尽管在期望意义上(即在我们可能看到的所有样本中)该模型的表现并不会那么好。在多个预测模型中进行搜索既可能找到一个真正优秀的模型,也可能发现一个只是在给定样本中恰好表现良好的糟糕模型。更广泛地说,这就是能力与运气的问题,即拥有真正优越的模型还是仅拥有在给定样本中恰好表现良好的劣势模型的问题。

White (2000) 考虑的现实检验(Reality Check)设置与许多经济学家进行模型构建的过程非常相似。在给定的数据集上通常会考察许多不同的设定。模型比较中使用的检验通常忽略了在选择预测模型之前可能进行过的设定搜索,尽管这些模型可能是先前检验的"幸存者"。

White 使用递归设置来构建预测,并考虑各个预测模型表现的联合分布。对于 m 个模型,有 m 个样本外(平均)损失的样本估计量。设 为第 期相对于模型 k 衡量的基准模型(编号为模型 0)的损失差,因此当模型 k 的平均损失等于基准模型的平均损失时,我们得到零值。负值表明模型 k 相对于基准模型具有更高的损失,而正值表明模型 k 优于基准模型。此外,设 上的样本均值,并设 维的样本均值向量,在包含 个观测值的某个(样本外)评估期上计算得到。最后,设 为给定估计方法下 的伪真实值。现实检验所检验的原假设是基准模型不劣于 m 个备选模型中的任何一个:

而备择假设是至少有一个模型产生比基准模型更低的期望损失:

如果所有模型的表现与基准模型一样好,那么 向量的均值为零,因此该向量的最大值均值也为零。通过考察损失向量的最大值,该假设反映了研究人员在实践中可能会在大量竞争设定中搜索最佳模型这一事实。备择假设是最佳模型优于基准模型,即存在一个优越的模型。

(当 时)的假设下,其中 表示依分布收敛,且 ,其中 (当 时),White (2000) 建立了在以下条件下成立的结论

其中 是一个 向量,其分量 服从 分布。White 的高层假设与 West (1996) 中的假设类似,因此排除了一些有趣的案例,包括嵌套模型的比较。¹¹

即使我们能够刻画样本均值向量的极限分布,由于模型之间相关性所导致的未知协方差矩阵 的存在,我们也难以确定该向量最大值的分布。从检验的角度来看, 是一个我们不关心的冗余参数,除非它影响关于预测性能的推断。White (2000) 通过设定高层假设(即损失向量渐近服从正态分布)并开发一种从 (17.38) 式中分布中抽取最大值并计算原假设为真时的 值()的自助法来解决这个问题。

为了理解自助法如何运作,设 为第 次自助计算的平均差分损失,,并考虑以下统计量:

然后我们可以将 (17.39) 式中从实际数据得到的任意模型的最佳表现与 (17.40) 式中自助法的分位数进行比较,以获得 White 自助现实检验对 (17.36) 式中原假设的 值。通过考虑跨 个模型计算的相对损失最大值的抽样分布,我们解释了跨模型的数据挖掘效应。

White 建议使用 Politis 和 Romano (1994) 的平稳自助法来构造自助样本。平稳自助法从原始数据中重采样随机长度的块,使块长度从几何分布中抽取,该几何分布的平均块长度为 。对于(时间序列)相关性较弱的数据,较大的 值是合适的;而对于相关性较强的数据,则可以适当使用较小的 值。

平稳自助法的抽样过程如下。定义一组随机时间索引集合 ,这些是介于 之间的数。然后每次自助 生成一个样本估计量 ,过程如下:

  1. 。从 中独立且均匀地随机抽取

  2. 增加 1。若 ,则停止。否则,独立于所有其他随机变量,抽取一个标准均匀随机变量 。 a) 若 ,则从 中独立且均匀地随机抽取 。 b) 若 ,通过设置 来扩展块;若 ,则重置

  3. 重复步骤 (2)。

由于该自助法只需要从预测误差(或更广泛地,从损失)中重采样,而不是从原始数据 中重采样、重新估计预测模型以及生成预测和预测误差序列,因此易于实现。所以不涉及参数估计。

Hansen (2005) 指出,White (2000) 中的自助程序实际上意味着,在原假设下的假设是 。他证明,如果 的最大值为负,那么 。因此,当基准模型优于所有其他模型时,我们以概率 1 获得一个退化分布。Hansen 的优越预测能力(SPA)检验通过标准化和重新定心检验统计量来修正现实检验。首先,他提出使用学生化检验统计量,

其中 的一致估计量。其次,Hansen 的 SPA 检验将原分布建立在

其中 1(·) 是指示函数。通过对表现较差模型的零分布进行重新中心化处理,分布在校零假设下变为依赖于样本的。该检验并未舍弃表现较差的模型(即指示函数等于 1 的模型),而是通过重新中心化来削弱其影响,同时保持 的模型的影响。

Hansen 给出的蒙特卡洛模拟表明,将这些修正应用于 Reality Check 检验统计量可以带来潜在的大幅功效提升。这些修正的重要性取决于具体的应用场景以及所考虑的"较差"预测模型的数量。即使在不存在明显劣质模型的情况下,对许多金融和经济时间序列使用如 (17.41) 式所示的学生化检验通常也是一个不错的选择。

练习题

在比较多个预测时,使用两个预测进行检验与使用个预测进行检验的主要区别是什么?

A. 对于两个预测,我们检验其预测能力是否更优;对于个预测,我们检验其预测准确性是否相等。
B. 对于两个预测,我们检验其预测准确性是否相等;对于个预测,我们检验其相对于基准的预测能力是否更优。
C. 对于两个预测,我们使用格兰杰-纽博尔德比较法;对于个预测,我们使用预测包含法。
D. 对于两个预测,我们使用预测包含法;对于个预测,我们使用格兰杰-纽博尔德比较法。

在均方误差(MSE)损失下的预测涵盖背景下,原假设意味着什么?

A. 第一个预测未被其余预测涵盖。
B. 第一个预测涵盖其余预测。
C. 其余预测涵盖第一个预测。
D. 其余预测未被第一个预测涵盖。

关于怀特(White,2000)所设定的现实检验(Reality Check),以下哪些说法是正确的?

A. 它检验基准模型是否不劣于个备选模型中的任何一个。
B. 它检验是否至少有一个模型产生的预期损失低于基准模型。
C. 它假定最佳模型是从一小组模型中选出的。
D. 它检验单个预测模型性能的联合分布。

在存在多种替代预测的情况下,存在任何优于基准的预测这一假设通常比两个预测之间预测准确性相等的假设更容易检验。

在均方误差(MSE)损失下预测涵盖的向量模拟中,方程用于通过检验原假设___ 来测试第一个预测是否涵盖了其余预测。

结合对多个预测进行优越预测能力测试的情境,解释技能与运气的概念。

在比较多组预测时,格兰杰-纽博尔德比较法和预测涵盖法之间的一个关键区别是什么?

A. 格兰杰-纽博尔德比较法可推广到组预测,而预测涵盖法不能。
B. 预测涵盖法可推广到组预测,而格兰杰-纽博尔德比较法不能。
C. 两种方法都可推广到组预测,但预测涵盖法更难实施。
D. 两种方法都可推广到组预测,但格兰杰-纽博尔德比较法更难实施。

以下哪些是怀特(White,2000)所设立的现实检验(Reality Check)的组成部分?

A. 针对每个模型相对于基准定义损失差异
B. 计算每个模型的损失差异样本均值
C. 在评估期内构建样本均值向量
D. 检验向量的最大值具有正均值的假设。

White(2000)提出的现实检验设定假设最佳预测模型是从一个可能很大的模型集合中选出的,这可能会影响对其性能的评估。

在均方误差(MSE)损失下的预测涵盖方程中,向量的作用是什么?

在均方误差(MSE)损失下对个预测进行预测涵盖性检验时,哪个原假设正确表示了第一个预测涵盖其余个预测的检验?

A.
B.
C.
D.

关于怀特(White,2000)提出的现实检验设定,以下哪些陈述是正确的?选择所有适用的选项。

A. 它检验基准模型是否不劣于个备选模型中的任何一个。
B. 原假设为
C. 它假设最优模型来自一个小规模的模型集合。
D. 备择假设为

在多个预测的背景下,怀特(White,2000)提出的现实检验设定考虑了单个预测模型表现的联合分布,以解决技能与运气的问题。

个预测的预测涵盖方程相对应的向量形式为,其中是一个___预测向量。

登录后解锁笔记、知识点解析、AI 问答

立即登录