正在学习
4.1 基于损失的估计量
4.1 基于损失的估计量
构建预测模型的一种直接方法是:将模型设定为一组未知参数 的形式,其中 是可能的参数取值集合,然后基于数据 ,利用模型期望损失的样本模拟量直接估计这些参数。这一过程通常被称为 M 估计量,其结果为
然后利用估计量 构造对下一期结果 的预测,记为 。请注意,这里并没有假设(或期望)预测模型 是正确设定的。
在较为一般的条件下,可以建立如下结果:
T ^ { - 1 } \sum _ { t = 0 } ^ { T - 1 } L ( f ( z _ { t } , \beta ^ { * * } ) , \boldsymbol { y } _ { t + 1 } ) - T ^ { - 1 } \sum _ { t = 0 } ^ { T - 1 } L ( f ( z _ { t } , \boldsymbol { \hat { \beta }}} ) , \boldsymbol { y } {}_{ t + 1 } ) = o _ {P } ( 1 ) ,\tag{4.3}
其中
这里使用符号 来表示 在样本上的(平均意义上)最优选择,以区别于上一章中定义的 ,后者表示在时刻 T 的最优选择。如下所述,二者可能不同。对于像 (4.4) 这类结果的证明通常分为两步:首先证明目标函数关于 一致收敛,然后证明 。可以采用多种假设来建立这一结果。所需假设的差异反映了数据的平稳性形式(严格平稳、二阶平稳或全局平稳)、对时间序列依赖性的假设类型(混合条件、近因依赖、可和性假设等),以及目标函数的光滑程度。由于这些差异,任何试图罗列假设并证明一般性结果的尝试都将既冗长又不完整。对于独立同分布数据,Newey 和 McFadden(1994)给出了结果的综述。对于相依数据,Wooldridge(1994)是获取结果的优秀来源。
借鉴 Wooldridge(1994,定理 4.2 和 4.3),我们仅列出一组假设,以说明结果的特征,并使其具有足够的普遍性以涵盖许多预测情境。假设如下:
,其中 是紧集。
和 是关于 的可测函数,且在 上关于 连续。
对每个 , 满足弱大数定律(LLN)。
存在函数 ,使得
(a) 对所有 ,
(b) 满足弱大数定律。
在这些假设下,
该结论给出了预测模型目标函数在可能参数集合上的均匀弱大数定律。此结果比 Wooldridge(1994)中的结果更强,因为我们假设损失函数不随时间变化,这是大多数预测问题中的典型假设,尽管该结果可以推广到允许函数本身发生变化的情形。
应用 (4.5) 中的结论仍需证明定理中的两个弱大数定律,而这又需要平稳性和相依性假设。在一般假设下,弱大数定律的成立相当直接。例如,若上述假设 (2) 成立, 是规模为 的 -混合序列,或 是规模为 的 -混合序列,其中 ,且对所有 ,(对某个 成立),则上述 (3) 成立(参见 White,2001,推论 3.48),其中附加假设 (2) 确保 对任何 都具有混合性。基于这些假设,再假设 存在唯一最大化点,则 (4.2) 中的 是 (4.4) 中 的一致估计量。
诸如 (4.5) 这样的结果表明——给定足够的数据——在预测模型 保持不变的情况下,使用 所产生的平均损失接近于 的最小可能值。我们真正想要的是一个预测模型 ,它能够接近达到最小的条件期望损失 ;在我们的符号表示中,这即为 。另一种表达方式是:我们希望 ,但 (4.5) 建立的是在 处的收敛,而 不一定等于 。
如果数据是严格平稳的,即在数据来自严格平稳过程的假设下,使得 ,那么我们所最小化的目标和希望最小化的目标是相同的。这是一个很强的假设,对于大多数预测应用而言不太可能成立。对于仅依赖于 前两阶矩的线性投影等参数估计量而言,协方差平稳的假设就足够了。在任何预测场景中,更可能的情况是数据是异质的,即数据生成过程随时间变化。在这些情况下使用过去数据来估计预测模型会得到一个"平均意义上"有效的估计量,而不是针对当前预测问题定制的估计量。我们在下面的例子中说明这一点。
例 4.1.1(MSE 损失下最佳平均模型与最佳当前模型)。假设 ,且 均值为 0, 的二阶和三阶矩是异质的,记为 。设预测模型为 。则在 MSE 损失下,,其最小值在 处取得。在该模型中,,其中 不依赖于 。假设 是有限的,则 (在时刻 处)。通常情况下,OLS 系数给出最佳的"平均"拟合,而此处它与最佳当前模型不同。
注意 (4.5) 对一大类损失函数和预测模型都成立,包括并非处处可微的损失函数。这种普遍性是有代价的——对于一些常用的损失函数,某些假设强于我们可能希望的。例如,在 MSE 损失下,损失函数可微且 有闭式解时,我们可能不需要假设参数空间是紧的。事实上,对于这个简单问题,不需要紧性假设的最小二乘估计量一致性结果是可获得的。
对于更复杂的预测模型(例如非线性模型),紧性假设与常见的"异常值过滤"预测方法很好地吻合,该方法在预测值被认为与当前结果偏离太远时忽略该预测。给定数据后,这可以被视为对人们愿意接受的参数的一个约束,实质上等价于一个紧性假设。
对于特定的损失函数和预测模型组合,已经建立了一些结果。下面的例子说明了这一点。
例 4.1.2(lin-lin 损失下的 M 估计量)。考虑分段线性(lin-lin)损失函数,其中 ,以及形如 的线性预测模型:
基于损失的预测模型估计建议使用以下类比:
这就是分位数 的 M 估计量。Komunjer (2005) 给出了 的 M 估计量在 处一致的假设条件,包括对更一般模型的结果。
当损失函数处处二次可微时,我们可以利用展开式来建立上述结果。二阶均值展开得到
其中 为介于 与 之间的某个中间值。这里我们使用了一阶最优性条件 在 处成立这一事实。在 对 一致以及 不会发散的条件下,可以得出在伪真值处和估计值 处评估的平均损失变得相似。
唯一最大化器的假设在实践中可能并不成立。例如,考虑在均方误差损失下对 ARMA–GARCH 模型(在第 7 章和第 13 章中进一步讨论)的参数估计。在此类损失下,最优预测简单地就是条件均值,因此 GARCH 波动率参数(截距除外)是不可识别的。模型缺乏可识别性是否会对预测者构成实际问题可能并不明显,因为这仅仅意味着两个预测模型在其期望(或平均)损失方面同样优秀。然而,使用一个不可识别的模型可能使解释预测变得困难,因为如果两个模型产生相同的期望结果,就难以说明为什么使用该模型。
最后,注意这里的一个关键假设是我们能够构建一个参数化预测模型。我们将在第 11 章中考察非参数方法。
练习题
方程(4.2)中的M估计量最小化的是什么?
下一期结果的预测是如何构建的?
以下哪些是基于损失的估计量的假设?(选择所有适用的选项)
方程(4.3)中的收敛结果表明,样本平均损失与期望损失之差依概率收敛于零。
的定义由给出。这表示基于___的的平均(样本上)最佳选择。
解释为什么对于M估计量发挥作用而言,预测模型无需正确设定。
以下哪项是对一致性的条件?
目标函数的均匀弱大数定律意味着样本平均损失与期望损失之间的最大差值依概率收敛于零。
假设4(a)中的函数必须满足服从___的条件。
在目标函数方面,M估计量与最大似然估计量(MLE)有何不同?
以下哪项陈述正确描述了在基于损失的预测模型估计量背景下,M估计量与平均最佳选择之间的关系?
在基于损失的预测模型估计量中,为使对具有一致性,需要以下哪些假设?选择所有适用的选项。
下一期结果的预测值是使用真实参数值构建的,而非估计参数。
基于损失的估计量的收敛结果表明,在某些假设下,当时,___ 。
登录后解锁笔记、知识点解析、AI 问答
立即登录