正在学习

17.8 样本划分的选择

17.8 样本分割的选择

White的现实检验自助法可用于解决在多种不同模型设定中搜索更优模型对推断所产生的影响。预测者可能寻求更优表现所涉及的另一个维度是样本分割,即如何将包含 个观测值的样本进行划分的决策:使用前 个观测值作为初始估计和模型选择期,使用剩余的 个观测值作为预测评估期。我们不必研究预测评估期的具体起始日期 ,而是可以等价地考虑 ,它表示用于初始估计的样本比例。为了获得表现良好的检验统计量,通常假设样本分割 的选择被限制在区间 内,典型做法是在每一侧留出 10%–15% 的样本。这确保了有足够的数据用于初始模型估计和后续的预测评估。

Hansen 和 Timmermann(2012)研究了如 (17.28) 式所示的检验的规模,其中 值取与所有可能分割点相对应的最小值,即

其中 由 (17.25) 式定义, 是预测误差方差的一致估计, 是检验统计量 的累积分布函数的逆函数。这是一个分位数函数,因此给出了给定 值下检验的 值。单个随机选取的 值将服从均匀分布,但当我们考虑从可能大量的检验统计量中选取的最小 值时,情况就不再如此。检验所使用的估计和评估窗口 之间的重叠引入了进一步的复杂性,因为各个 值之间将存在强相关性。因此,如果所报告的 值是从许多可能的样本分割中选出的最小值,那么传统的推断将不再有效。

Hansen 和 Timmermann 表明,考虑了非标准极限分布但忽略了样本分割挖掘效应的嵌套模型预测精度的传统检验,可能存在严重的过度拒绝问题。例如,在大模型中加入一个额外的预测变量时,名义显著性水平为 5% 的检验实际上可能因这种样本分割挖掘而拒绝原假设接近 15% 的次数。当大预测模型中的额外预测变量数量增加时,检验规模的膨胀会变得更大。

作为解决样本分割挖掘对推断影响的建设性方法,Hansen 和 Timmermann(2012)建议对 (17.46) 式中的统计量进行对应于调整后最小 值的检验。该检验基于 统计量,其临界值可以通过蒙特卡洛模拟其渐近分布推导得出。Hansen 和 Timmermann 从大量样本路径模拟所得 值的排序分布的分位数中计算出调整后的 值。

例如,对于一个显著性水平为 5% 且包含一个额外预测变量的检验,在区间 内经样本分割挖掘调整后的 值必须低于 1.3%,才能有显著证据表明大模型优于小模型。这一结果直观明了:如果只检查单个 值,则不会对推断造成扭曲,我们可以直接使用 McCracken(2007)报告的临界值。另一方面,如果所报告的 值是从大量候选 值中预先选取的,那么我们就需要更强的证据——更大的检验统计量和更小的 值——才能对证据的强度抱有信心。

类似的信息来自 Rossi 和 Inoue(2012),他们以与 Hansen 和 Timmermann(2012)类似的方式考虑了通过对不同样本分割的检验统计量的平均值或最大值计算得出的检验统计量。Rossi 和 Inoue 还提供了对样本分割挖掘具有稳健性的检验统计量,并通过蒙特卡洛模拟表明,忽略这种挖掘的传统检验可能导致严重的规模扭曲。

练习题

怀特的现实检验自举法的目的是什么?

A. 提高预测模型的准确性
B. 解决在众多不同模型设定中搜索优越模型对推断产生的影响
C. 将样本分为估计期和评估期
D. 计算用于初始估计的样本比例

在样本拆分的背景下,代表什么?

A. 样本中的观测值总数
B. 用于预测评估的样本比例
C. 用于初始估计的样本比例
D. 模型中的预测变量数量

以下哪些是将样本分割点的选择限制在区间内的原因?

A. 确保有足够的数据用于初始模型估计
B. 提高预测模型的准确性
C. 确保有足够的数据用于后续预测评估
D. 降低模型的计算复杂度

如果报告的值是从许多可能的样本分割中选择的最小值,则传统推断仍然有效。

汉森(Hansen)和蒂默曼(Timmermann)表明,忽略样本分割挖掘影响的常规检验可能会严重高估显著性。

汉森(Hansen)和蒂默曼(Timmermann)为考虑样本分割挖掘效应所使用的检验统计量基于统计量,其临界值可通过使用__________模拟得出。

对于临界水平为5%且有一个额外预测变量的检验,在区间内针对样本分割挖掘调整后的值必须低于__________%,才能有显著证据表明较大模型优于较小模型。

根据汉森(Hansen)和蒂默曼(Timmermann)的观点,解释样本分割挖掘对检验规模的影响。

罗西(Rossi)和井上(Inoue)的研究结果与汉森(Hansen)和蒂默曼(Timmermann)关于检验统计量的研究有何关联?

关于Hansen和Timmermann提出的调整最小值检验,以下哪些陈述是正确的?

A. 它考虑了样本分割挖掘对推断的影响。
B. 它使用统计量,其临界值通过蒙特卡洛模拟得出。
C. 它确保无论样本分割如何选择,传统推断均保持有效。
D. 它从值排序分布的分位数计算调整后的值。

在进行用于预测评估的样本划分时,将的选择限制在区间(通常在每侧排除10-15%的样本)的主要原因是什么?

A. 确保预测评估期始终大于估计期
B. 通过拥有足够的数据用于初始模型估计和预测评估,以获得表现良好的检验统计量
C. 简化调整后的最小值检验统计量的计算
D. 与怀特现实检验自助法的要求保持一致

关于样本分割挖掘对测试规模和推断的影响,以下哪些陈述是正确的?

A. 忽略样本分割挖掘的传统测试可能导致较大的规模失真。
B. 调整后的最小值检验考虑了样本分割挖掘对推断的影响。
C. 样本分割挖掘对嵌套模型预测准确性测试的规模没有影响。
D. 估计和评估窗口的重叠会引入复杂性,因为单个值之间会存在强相关性。
E. Bonferroni界是一种通过将最小值乘以所考虑的模型数量来调整样本分割挖掘的方法。

调整后的最小值检验统计量的临界值可以通过渐近分布的蒙特卡罗模拟得出,并且该检验对样本分割挖掘对推断的影响具有稳健性。

汉森(Hansen)和蒂默曼(Timmermann)表明,那些考虑了非标准极限分布但忽略了___影响的嵌套模型预测准确性的常规检验,可能会严重高估。

登录后解锁笔记、知识点解析、AI 问答

立即登录