正在学习

17.2.2 Diebold–Mariano 检验

17.2.2 Diebold–Mariano 检验

Diebold 和 Mariano(1995)的方法明确考虑了潜在损失函数以及平均损失中的抽样变异。假设有两个可用的预测,从而我们有两组损失,。考虑两个损失之间的差值:

对两个损失以及相关损失差 的时间序列观测样本构成了检验的基础。具体而言,我们可以检验原假设:

针对单侧备择假设——如果我们想考察某一特定方法是否优于另一种方法——或者针对双侧备择假设,如果我们想考察两者的平均表现是否存在差异。

Diebold(2015)讨论了可以进行一组简单等预测能力检验的条件。关键假设是,对于所有 ,有:

在这些假设下,有多种方法可用于进行假设检验。最直接的想法是使用 统计量,这需要估计个体损失的方差以进行缩放。当 (17.2) 中定义的、经适当缩放的样本外损失向量 满足中心极限定理时,,那么

其中 ,协方差矩阵 按第一行和第一列进行分块。Diebold 和 Mariano(1995)建议直接根据数据序列 来估计尺度干扰参数,使用 Newey 和 West(1987)的方法,尽管他们指出任何长期方差的一致估计量都适用。对于具有重叠数据的 步向前预测,如果潜在预测是理性的,则 中会诱发一个 结构,因此应使用至少 个观测值的窗口来构建 (17.18) 中的标准误。

Diebold 和 Mariano(1995)将预测视为原语(primitives)。这意味着其预测受参数估计误差强烈影响的模型,相对于受估计误差影响较小的模型,往往被认为较差,即使后一个模型在大样本中能够提供对数据的最佳拟合。因此,我们不能从 Diebold–Mariano 检验的结果中得出哪个模型是"最佳"的结论——我们只能就哪种方法在特定样本中产生最佳预测作出判断。Diebold 和 Mariano(1995)将通常的方差估计量作为 (17.18) 中差值 尺度的一致估计量使用。

(17.15)–(17.17) 中的假设在什么情况下可能成立?假设一个小模型和一个大模型的参数是用一个非常短的初始样本(例如 20 个观测值)估计的,而我们感兴趣的是研究由这两个模型生成的后续预测序列。在这种情况下,大模型的初始预测很可能特别强烈地受到估计误差的影响。如果使用扩展的估计窗口,那么随着估计样本长度的增加,这种影响将减小。在这种情况下,损失差序列将不是平稳的,(17.15)–(17.17) 不太可能为损失差的行为提供良好的刻画。具体而言,差分损失的方差将随时间下降,从而违反 (17.17) 中的第二个假设。

在其他不那么极端的情况下——要么初始估计窗口很大,要么保持固定,从而使损失差序列的分布不随时间变化(这是 Giacomini 和 White(2006)所涵盖的情况,我们将在下面看到)——假设 (17.17) 更有可能成为数据的良好近似。调查预测准确性的比较是 DM 检验可以派上用场的另一个例子。在评估预测表现时考虑估计误差的方法要求预测是根据一组严格的条件生成的,而对于此类数据,这些条件可能很难验证。

如果重点在于找出哪种方法提供对数据的最佳拟合,并且预测误差是使用估计的模型参数构建的,那么标准误可能必须按照 West(1996)或 West 和 McCracken(1998)所建议的方法进行调整。在某些情况下,可以使用 West(1996)中 的修正版本,用 West(1996)中建议的估计量替换 的通常估计量。再次强调,嵌套模型无法进行比较;如果模型是嵌套的, 将不是满秩的,并且 的长期方差收敛到 0。West 和 McCracken(1998)的结果适用于 Morgan–Granger–Newbold 回归检验,而 West(1996)的结果适用于 Diebold–Mariano 检验。

Harvey、 Leybourne 和 Newbold(1997)以两种方式修正了 Diebold 和 Mariano 的 t 检验:首先,改变方差项的分母;其次,建议使用自由度为 的 t 分布来构造临界值。这一修正源于注意到 Diebold–Mariano 检验并未使用经自由度调整的方差。建议使用 t 分布并非基于理论上的考量,而是为了在蒙特卡洛实验中提高那些表现出过度拒绝倾向的检验的临界值。对于一般的 h 期预测期,其修正后的 t 统计量,记为 ,为

其中 是原始的 Diebold–Mariano t 统计量。请注意,这一修正项增加了二阶和三阶项,除了在非常小的样本容量或较长的预测期下,这些项的影响很小。由于 对所有 h 成立,一阶效应是降低检验统计量的大小。7

Harvey、 Leybourne 和 Newbold(1998)中的蒙特卡洛证据表明,其修正对检验的实际拒绝率具有预期的方向性效应——通过提高临界值并降低检验统计量的值,修正降低了零假设下的拒绝率。尽管对于所有 h 值和样本容量而言,检验的实际拒绝率并未得到完全控制,但扭曲程度小于未修正的 t 统计量。

大多数模拟证据是在均方误差(MSE)损失下进行的,因此 是两个平方项之差。平方误差往往具有较大的偏度,因为其下界为 0,因此基于渐近正态分布的小样本检验出现过度拒绝现象也就不足为奇。当潜在的预测误差具有肥尾分布时,这种效应会进一步加剧。Diebold 和 Mariano(1995)展示了当预测误差从稳定分布中抽取时的模拟证据,因此该蒙特卡洛设计不允许在构造预测时存在估计误差。Busetti 和 Marcucci(2013)对一系列在平方误差损失下、针对嵌套回归模型的等预测能力检验的实际拒绝率和功效进行了蒙特卡洛研究。他们发现,不同检验在模型误设定和不同预测期的各种情境下的排序相当稳健。他们还发现,高持续性的回归变量会导致功效的下降,但不会影响检验的实际拒绝率。

练习题

在迪博尔德-马里亚诺检验中,原假设代表什么?

A. 两种预测具有相同的预期损失
B. 一种预测优于另一种预测
C. 两种预测的方差相等
D. 预测是无偏的

根据给定文本,进行迪博尔德-马里亚诺检验(Diebold–Mariano test)的关键假设是哪一个?

A. 是关于的非恒定函数
B. 对于所有
C.
D. 预测总是完全准确的

当使用迪博尔德-马里亚诺检验对具有重叠数据的h步超前预测进行检验时,应使用什么来构建(17.18)中的标准误差?

A. 1个观测值的窗口
B. 至少个观测值的窗口
C. 个观测值的窗口
D. 不需要窗口

以下关于迪博尔德-马里亚诺检验(Diebold–Mariano test)的陈述中,哪些是正确的?

A. 它考虑了潜在的损失函数
B. 它只考虑单侧备择假设
C. 它可用于检验两种预测的预测性能是否相等
D. 它假定参数估计误差较小的模型总是更好

在迪博尔德-马里亚诺检验中,原假设有哪些可能的备择假设?

A. 查看某种特定方法是否更好的单侧备择假设
B. 查看平均而言性能是否不同的双侧备择假设
C. 两种预测的方差相等
D. 预测不相关

迪博尔德-马里亚诺检验可以得出哪个模型总体上是“最佳”的结论。

迪博尔德-马里亚诺检验假定预测是原始的,并忽略了参数估计误差对预测的影响。

在迪博尔德-马里亚诺检验中,两个损失之间的差异定义为。原假设为___。

对于迪博尔德-马里亚诺检验中具有重叠数据的h步预测,如果基础预测是理性的,则会在中产生一个结构,并且应使用至少___个观测值构成的窗口来构造标准误差。

解释在迪博尔德 - 马里亚诺检验中假设的意义。

迪博尔德-马里亚诺检验与均方误差(MSE)损失下的预测涵盖概念有何关联(kp_17_1_006)?

A. 两者均用于确定大样本中的最佳拟合模型
B. 迪博尔德-马里亚诺检验比较预期损失,而均方误差损失下的预测涵盖则确定一种预测能否表示为其他预测的函数以最小化损失
C. 它们是完全不相关的概念
D. 迪博尔德-马里亚诺检验仅适用于单步预测,而预测涵盖适用于多步预测

迪博尔德 - 马里亚诺检验(Diebold - Mariano test)和基于回归的损失等价性检验(kp_17_2_005)都使用了比较预测误差某种形式差异的概念。

在基于回归的损失等价性检验(kp_17_2_005)中,回归方程为。原假设为___。

解释迪博尔德-马里亚诺检验(Diebold - Mariano test)与克拉克和麦克雷肯(Clark and McCracken)的ENC - T检验(kp_17_1_1_5)在关注重点和应用方面的差异。

登录后解锁笔记、知识点解析、AI 问答

立即登录