正在学习

17.6 数据挖掘处理

17.6 处理数据挖掘

White的现实检验提供了一种方法来解决在正交回归中选择哪些变量 时出现的问题。大量可能的协变量以及广泛的模型选择意味着人们可以在许多可能的设定中进行搜索。事实上,这正是文献研究中所采用的方式——不同的研究者使用不同的预测模型。假设一位研究者发现了一个更优的模型。如果在此之前已经尝试了众多其他设定,我们应如何解读这一证据?一种方法是将该模型视为更大一组竞争设定中的(潜在)最佳模型,并使用White的现实检验方法来修正跨多个模型搜索所产生的影响。换言之,我们将考察最佳设定是否真正优于基准,同时考虑到已尝试的其他模型。这正是Sullivan、Timmermann和White(2001)在研究应用于每日股票收益的技术交易规则表现时所采用的方法。

White–Hansen方法的替代方案是使用Bonferroni界。设 为对应于"第 个模型未能产生低于基准的预期损失"这一原假设的 值。对于绩效测度 之间的任意相关性,Bonferroni界意味着对应于"这 个模型中无一优于基准"这一联合原假设的 值满足以下上界:

等价地,该检验在 显著性水平下拒绝原假设,若 。注意,产生对"没有模型能击败基准"这一原假设最强反驳证据的最小 值,会被所考虑的模型数量所放大。Bonferroni方法倾向于保守,并防范"最坏情形"。例如,在预测完全相关的情况下, 值相同,因此正确的程序是当 时即拒绝,而不仅仅在 时才拒绝。

方程(17.42)和(17.43)都表明,从能否识别出真正更优模型的角度来看,在大量预测模型中进行搜索并非无害——其中许多模型本来就没有希望产生好的结果。每当考虑一个新的备选模型时,击败基准的衡量标准就会被调整,从而对盲目的数据挖掘行为施加了一种"税"。因此,那些能够借助经济理论来识别函数形式或预测变量,从而指导预测模型搜索的程序,更有望取得成功。

图17.1:基于11个预测变量所有可能组合的均方根误差表现(上图)与 值(下图),相对于主流均值基准进行衡量。所有预测均基于使用20年月度观测数据的滚动窗口估计。

17.6.1 实证应用

为说明这些思想,我们利用Welch和Goyal(2008)数据集中的11个预测变量(该数据集在前述应用中已被使用)对月度股票收益进行了一项实证应用。我们考虑所有可能的 个模型。样本外区间为1970–2013年,估计使用20年月度观测数据的滚动估计窗口进行更新。这确保了在应用White的现实检验或Hansen的SPA检验时,嵌套模型不会成为问题。我们采用Welch和Goyal(2008)的主流均值模型作为基准。该基准包含一个截距项但不包含时变预测变量。

图17.1的上图绘制了RMSE表现,主流均值模型基准的值以水平线标示。图中反映出的模型排序模式并非随机——在由不同预测变量构成的不同区块内,小模型之后是大模型。极少有模型能产生低于主流均值基准的RMSE表现。

图17.1的下图绘制了与各单个模型相关联的 值。没有模型能够产生接近常规5%临界值的 值。因此,对本应用而言,在考虑模型搜索之后,没有模型能击败主流均值基准也就不足为奇了。事实上,当我们使用White的现实检验时,得到的 值为1,这证实了最佳预测模型并不优于主流均值基准。

练习题

在模型选择中,怀特现实检验(White's Reality Check)的主要目的是什么?

A. 在不考虑其他设定的情况下确定最佳模型
B. 校正跨多个模型搜索所产生的影响
C. 直接比较不同模型的p值
D. 确定预测变量的函数形式

对于“没有一个模型优于基准”的联合原假设,邦费罗尼界(Bonferroni bound)意味着什么?

A.
B.
C.
D.

以下关于邦费罗尼(Bonferroni)方法的陈述中哪些是正确的?

A. 它往往较为保守
B. 它可防范“最坏情况”情形
C. 它用于确定预测变量的函数形式
D. 若,则拒绝原假设
E. 当预测完全相关时,它的保守性较低

每当考虑一个新的替代模型时,超越基准的衡量标准保持不变。

当预测完全相关时,Bonferroni方法更为保守。

邦费罗尼界表明,如果 ___ ,则检验在的临界水平上拒绝原假设。

怀特的现实检验法将该模型视为一组较大竞争性模型规范中潜在的最好模型,并对跨___搜索的影响进行校正。

解释在众多预测模型中进行搜索对识别真正优秀模型的影响。

使用基于经济理论指导预测模型搜索的方法的主要优势是什么?

以下哪些是文中描述的实证应用设置中的组成部分?

A. 使用Welch和Goyal(2008)数据集中的11个预测变量
B. 考虑所有可能的种模型
C. 使用包含20年月度观测值的滚动估计窗口
D. 使用Welch和Goyal(2008)的现行均值模型作为基准
E. 仅使用样本内数据评估模型

在实证应用结果中,使用怀特现实检验(White’s Reality Check)的结果是什么?

A. 检验得出的p值为0,证实最佳模型优于基准
B. 检验得出的p值为1,证实最佳模型并未优于基准
C. 检验得出的p值为0.05,表明最佳模型略胜一筹
D. 由于模型数量过多,该检验不适用

以下关于实证应用结果的陈述哪些是正确的?

A. 很少有模型能够产生比普遍均值基准更低的RMSE表现
B. 没有一个模型生成的p值接近常规的5%临界值
C. 所有模型生成的p值都接近常规的5%临界值
D. 图表中的模式反映了模型的排序,小模型后面跟着大模型
E. 最佳模型的表现显著优于基准

在比较多个模型时,邦费罗尼界(Bonferroni bound)确保了什么?

A. 它确保总能识别出最佳模型
B. 它确保根据所考虑的模型数量对p值进行调整
C. 它确保使用最小的p值而不进行调整
D. 它确保仅使用样本内数据比较模型

邦弗朗尼(Bonferroni)方法如何处理完全相关预测的情况?

在使用怀特的现实检验(White's Reality Check)比较多个预测模型时,考虑损失差异向量的最大值的主要目的是什么?

A. 确保所有模型的表现同样出色
B. 识别平均损失最低的模型
C. 检验基准模型是否劣于任何备选模型
D. 尽量减少所考虑的模型数量

关于邦费罗尼界(Bonferroni bound)及其在模型比较中的应用,以下哪些陈述是正确的?

A. 它为多个模型的联合p值提供了一个上界。
B. 当预测完全相关时,它更不保守。
C. 如果,则拒绝原假设。
D. 它将最小的p值乘以模型数量以调整多重比较。

在使用怀特现实检验(White's Reality Check)的实证应用中,如果得到的p值为1,则表明最佳预测模型优于普遍使用的均值基准。

邦费罗尼界表明,关于“个模型中没有一个优于基准”这一原假设的联合值满足。若,则联合值的上界为___。

登录后解锁笔记、知识点解析、AI 问答

立即登录