正在学习
17.10 样本内与样本外预测比较
17.10 样本内与样本外预测比较
当我们关注于评估预期损失或涉及由上述任何估计方案生成的数据的其他统计量时,所产生的检验统计量的抽样行为必须考虑到预测模型所使用的是哪种估计方案。目前尚不太清楚的是,基于任何递归方案的"伪"样本外方法是否优于简单地基于全数据样本估计的模型进行的预测评估。
在检验一个模型是否提供比另一个模型更好的预测时,模仿预测者的问题似乎是自然而然的。然而,一组被充分理解的最优性结果确立了在相当一般的条件下,最优的模型比较检验应当使用整个数据集进行模型估计。通常,确立这一结果所需的条件与建立样本外检验统计量抽样性质所做的假设是一致的。因此,如果目的是考察哪个预测模型更优,那么样本内检验在检验模型表现差异方面的功效高于样本外检验的检验。Inoue和Kilian(2005)以及最近的Hansen和Timmermann(2015)在预测文献中提出了这一观点。Hansen和Timmermann(2015)证明,常见的用于相对均方误差表现的样本外检验统计量等价于两个沃尔德统计量之差——一个基于全样本,另一个仅基于部分样本。这一结论的一个含义是,与不以这种方式分割样本的全样本检验相比,样本外预测评估检验可能会导致功效的大量损失。
当预测评估检验被用于在构建预测模型的不同方法之间进行选择时,该问题本质上成为模型选择问题的一种变体。正如我们在第六章中所看到的,模型选择没有最优方法,因此不同方法在不同的情形下可能具有不同的、也许是理想的性质。然而,文献中尚未对这一问题进行研究。
等精度预测的检验可能更适合通过全样本回归来考察,而不是使用上述许多方法所依赖的伪样本外实验。原假设和备择假设以模型参数的形式呈现,附带着对数据和模型的大量正则性条件,这些条件通常在使用全样本时能得到更有功效的检验。
那么,为什么样本外检验在预测文献中如此流行?一个原因在于经济学家对那些提供可疑出色样本内拟合的预测模型所抱有的(合理的)怀疑态度。正如我们在前一章中所看到的,样本内结果倾向于夸大模型未来可能的预测表现。即使仅考虑单个预测模型,情况也是如此。
事实上,如果考虑多个模型而仅展示最佳模型的表现,那么这种数据挖掘会极大地夸大该模型真实的预期预测表现。在某些情况下,样本外预测可以用来解决这一数据挖掘方面的顾虑。具体来说,如果可以证明预测者完全没有以任何方式使用样本外数据来选择和估计模型,那么该评估样本就没有受到污染,因而可以作为评估模型的相对"干净"的样本使用。然而,评估样本可能受到污染的途径有很多。例如,假设我们基于截至2000年的数据估计了美国短期国债利率的预测模型,但我们纳入了那些我们(基于后续信息)知道在2008–2009年金融危机期间与货币政策相关的变量。这种事后诸葛的优势反过来可能以不太可能反映其未来预测表现的方式偏向于所选模型。此外,如果研究者将数据分割为单独的估计样本和评估样本,但在评估样本上研究不同模型的表现,这也意味着最佳模型的预测表现不再是来自全新数据样本的单一独立抽取。
这种做法是任何伪样本外检验所担忧的问题,并模糊了样本内和样本外预测评估检验之间的界限。然而,它并没有消除一个实际要点,即数据挖掘的影响对样本内检验而言可能远强于对样本外检验——因为模型参数是为评估样本量身定制的。
继续采用样本外方法的第二个原因在于,人们认为样本内检验最优的条件是不成立的。例如,生成结果的过程可能不是平稳的,因而正确的预测模型可能随时间并非恒定不变。考察模型的样本外表现可能有助于识别一个表现更优的模型,而样本内检验——由于用于构建零分布的假设的失败——可能无法控制检验的规模从而表现较差。尽管这一论据有其道理,但不幸的是,样本外检验零分布的构建同样需要相当强的假设,因此在这种情况下这些检验也可能无法恰当地控制规模。
使用样本外检验的第三个原因是,这些检验使我们能够探讨在考虑递归估计误差后,预测模型是否仍然具有实际用途。假设问题不在于一个大型预测模型的参数在极限意义上是否异于零,而在于其相关预测是否优于由另一个(可能是嵌套的)模型生成的预测。这是在许多预测情境中具有相关性的问题,也是可以通过使用Giacomini和White(2006)的样本外预测评价框架来回答的问题。
练习题
根据最优性结果,在一般条件下,在最优模型比较检验中,应使用哪个数据集进行模型估计?
对于模型比较,样本内检验和样本外检验的功效之间有什么关系?
用于相对均方误差(MSE)表现的常用样本外检验统计量等价于什么?
与全样本检验相比,样本外预测评估检验意味着检验功效有显著提升。
当预测评估测试被用于模型选择时,它就变成了模型选择的一种变体。
对于同等精确度的预测检验,使用伪样本外实验进行检验更为合适。
样本内结果往往会夸大模型可能的___预测表现。
如果考虑了多个模型,但只展示最佳模型的性能,那么这种数据挖掘会极大地夸大该模型真正的预期预测性能,这被称为___效应。
解释为什么样本外预测能解决数据挖掘问题。
尽管样本外检验可能存在效力损失,但为什么它在预测文献中仍然很受欢迎?
以下哪些是数据挖掘对样本内测试的影响?(选择所有适用的选项)
尽管样本外方法存在缺点,但继续使用它的一些原因是什么?(选择所有适用的选项)
怀特的现实检验(White’s Reality Check)和邦费罗尼界(Bonferroni bound)如何解决多模型比较问题?请分别简要解释。
在比较预测模型时,根据最优性结果,哪种方法通常在检测模型性能差异方面更有效?
以下哪项陈述最能描述样本外预测评估检验与全样本检验在统计功效方面的关系?
对于等精度预测的检验,最好使用全样本回归而非伪样本外实验,因为后者可能无法适当控制模型搜索效应。
在选择最佳预测模型时,___方法用于校正因搜索多个模型而产生的影响,考虑到由于数据挖掘,最佳模型的性能可能被夸大。
登录后解锁笔记、知识点解析、AI 问答
立即登录