正在学习
19.3 单一断点模型
19.3 单一断点模型
对于参数具有单一断点的预测模型,我们可以尝试估计断点的日期和幅度。如果模型确实存在单一断点,那么这种方法——在断点日期估计足够准确的前提下——有潜力基于断点后的参数值提供更好的预测模型。考虑线性回归模型
我们可以使用预测 ,其中 是从回归中估计得到的,该回归将式(19.8)中的(未知)单一断点替换为估计断点 。为了估计断点,请注意,对于任意断点日期 ,式(19.8)中的残差平方和为
对于每个 值,我们可以通过最小化式(19.9)中的 SSR() 来获得 的估计量。 的最小二乘估计量为
注意,我们通过仅在下限和上限 与 之间搜索断点来"截断"数据。这需要一定量的最小数据量,部分原因是为了使断点前和断点后样本的估计可行,也是为了使渐近论证合理。 和 的典型选择是在样本两端各排除 10–15% 的样本。
实际上,断点日期的估计往往是不准确的。如果估计的断点日期超过真实值 ,则得到的参数估计是低效的,因为我们可以使用更多的断点后观测值来估计参数。反之,如果估计的断点日期早于 (即 ),则估计将使用断点前的数据,因此偏向于 。
断点日期的位置可以通过最小二乘法或最大似然法来估计。Bai(1997)建立了在何种条件下断点比例 的最小二乘估计是真实断点比例的一致估计量。该结果并不意味着 ,即收敛到真实断点日期。5
对于断点幅度为 σ d(其中 )的断点,最小二乘方法是 consistent 的,其数量级大于检验具有局部功效的断点。Yao(1987)为独立分布数据的正确设定的最大似然估计建立了相应结果。
Pesaran 和 Timmermann(2002)提出了估计断点的另一种方法。Pesaran 和 Timmermann 并非直接检验断点,而是从样本末端的预测日期 的角度出发,研究应使用多少历史数据。其思想是执行一系列断点检验,然后将估计样本限制在断点之后的数据。Pesaran 和 Timmermann 首先将数据顺序倒转,然后采用逆序 CUSUM 平方(ROC)断点检验。为了理解其工作原理,设 和 表示逆序数据,使得 和 。对于线性预测模型 ,ROC 方法涉及对一系列断点日期 仅使用断点后数据 来运行一组回归,其中 表示使用全样本。具体而言,定义 和 。则 的(向后)递归最小二乘估计量为
Pesaran 和 Timmermann 建议将第一个断点日期 限制为解释变量个数的某个倍数,以确保与最短估计窗口相关的参数估计不会过于不精确。
基于逆序数据给定估计窗口的每个回归都会产生一个标准化递归残差,
对每个 τ 重复此计算会得到一个序列 ,。对应的逆序 CUSUM 平方检验统计量序列 为:
在相当严格的假设条件下——重复样本中回归量固定且误差项独立同分布正态——Brown、Durbin 和 Evans (1975) 提供了该序列的临界值。 的值落在临界值带之外则表明存在结构性断点;Pesaran 和 Timmermann 建议将检验首次拒绝参数不变原假设所对应的 τ 值作为断点后样本的起点。该样本随后可用于估计预测模型。需要注意的是,此程序并不能给出断点日期的一致估计量。
Pesaran 和 Timmermann (2007) 指出,与其仅使用估计断点日期 之后的数据,不如通过将断点前的观测值加入到用于估计线性回归模型参数的断点后观测值中,有时能够降低期望损失。加入此类断点前观测值会给预测带来偏差,但也能降低估计量的方差。前提是断点的幅度足够小以使偏差不占主导,且断点在样本中出现得足够晚,使得增加的观测值能够大幅降低估计值的方差,那么通过纳入断点前数据点可以降低预测的 MSE。
Pesaran 和 Timmermann (2007) 针对严格外生回归变量系数发生单一断点的情况,以解析方式刻画了上述权衡的大小:
假设估计窗口的起点为 , 为断点发生的时间。假定 已知,则忽略断点后信息永远不是有效的,因此 。令 和 分别为断点前和断点后观测值的个数,因此估计窗口的总长度等于 。Pesaran 和 Timmermann 表明,起始于 的估计窗口所对应的无条件 MSE 由下式给出:
(19.15) 式中的第二项反映了在估计中使用断点前信息所产生的偏差。当 时该项等于 0,否则为正且随 单调递增。第三项代表估计误差,因此随估计窗口的总长度 单调递减。由该表达式可知,在这一最简单的情形下,使 MSE 最小化的最优断点前窗口在 越小(即 越小)、断点幅度 越小以及断点后窗口 越短时越长。这一结果非常直观:当断点后参数估计不够精确时( 较低且断点后窗口 较短),断点前观测值对预测模型参数的估计更为有用,且这种估计精度的提升不会被偏差效应所淹没( 较小)。
Pesaran 和 Timmermann (2007) 还允许残差的方差在系数断点同一点处发生断点。这同样会影响断点前观测值在最小化 MSE 方面的有用性。较大的断点后方差提供了额外的激励来纳入断点前观测值,因为断点后估计的估计误差更大。
为了实施这些想法,Pesaran 和 Timmermann (2007) 提出了如下的停止规则方法。首先,估计可能发生断点的时间 。如果未检测到断点,则使用全部数据。如果发现了断点,则仅使用断点日期 之后的数据,即 ,估计 MSE。接下来,通过纳入一个额外的观测值,即使用从 到 的样本观测值,计算 MSE。如果估计结果表明这样做能降低 MSE,则继续添加一个额外的数据点()到样本中并再次计算 MSE。重复此方法,直至数据表明再加入额外的断点前数据已无法进一步降低 MSE。值得注意的是,该方法所产生的估计窗口长度是随时间变化的:随着到断点的距离增加,会使用更多的(断点后)观测值,而在接近估计的断点日期 时纳入的观测值则较少。
当怀疑模型存在不稳定性时,也可以使用其他方法来选择估计窗口。例如,如果最后 个观测值用于交叉验证目的,那么可以选择滚动估计窗口的长度 ,以使以下伪样本外准则最小化:
其中 是使用观测值 对 进行估计的 OLS 估计量。该方法的一个局限性在于,它需要一个足够长的评估窗口 ,才能得到精确的 MSE 估计。通常情况下,这很难实现,特别是当断点时间接近样本末尾时。因此,这种交叉验证程序可能无法对最优估计窗口给出精确的估计。
一种完全不同的程序部分地解决了这个问题,即使用模型平均来处理估计窗口选择中潜在的不确定性。Pesaran 和 Timmermann(2007)提出了一种简单的程序,将与估计窗口 相关的预测进行组合:
与第14章一样,组合权重与预测的 MSE 的倒数成正比。如果断点非常显著,那么在断点之后开始估计样本的模型将比包含断点前数据的模型获得更大的权重,因为后者会受到较大的(平方)偏差项的影响。
如果断点较小且断点日期估计不精确,那么基于断点估计量的预测模型程序可能效果不佳。上面提到的 Bai(1997)的结果表明,幅度上局部的断点(即 阶的断点)不能被最小二乘法一致地估计。因此,为了证明以断点估计为条件是合理的,断点必须足够大,使得检验以概率 1 拒绝原假设。Elliott 和 Müller(2007)表明,对于足够小(局部的)以至于检验只能以一定概率检测到的断点,断点日期的置信区间可能非常宽。当然,如果断点足够小,忽略它们对预测的损害也不会太大。对于中等大小的断点,忽略断点将导致更大的 MSE,而估计断点又会得到不够精确的值,从而严重影响预测的 MSE,因此对于这种情况并不存在占主导地位的预测策略。
练习题
在单一断点预测模型中,估算断点日期和断点幅度的主要目的是什么?
在单一断点模型的线性回归中,当时,方程的形式是什么?
当使用估计的断点时,单一断点模型的预测公式是什么?
在单一断点模型中,任意断点日期的残差平方和(SSR)是多少?
断点的最小二乘估计量是如何定义的?
数据修剪涉及在整个样本范围内无限制地搜索断点。
如果估计的断点日期超过了真实的断点日期,则所得的参数估计值是低效的。
断点日期的位置可以通过最小二乘法或__________方法进行估计。
佩萨兰(Pesaran)和蒂默曼(Timmermann)建议使用逆序__________平方(ROC)断点检验来估计断点。
解释使用一个早于真实断点日期的估计断点日期所带来的后果。
以下哪些是估计单一断点模型中断点日期的方法?(选择所有适用的选项)
在佩萨兰(Pesaran)和蒂默曼(Timmermann)方法中,执行一系列断点检验的目的是什么?
在单一断点预测模型中估计断点日期时,关于断点日期估计不准确的后果,以下哪项陈述是正确的?
关于单一断点预测模型中断点日期估计方法的下列陈述中,哪些是正确的?
在单一断点预测模型中,如果我们使用全样本最小二乘估计量在时间生成预测,预测模型的参数将是无偏的。
在单一断点预测模型中,为了使断点前后样本中的参数估计可行,并使渐近论证合理,我们需要通过仅在上下限和之间搜索断点来___数据。
登录后解锁笔记、知识点解析、AI 问答
立即登录