正在学习

13.4 密度预测方法

13.4 密度预测方法

完全参数化的密度估计方法假设条件密度 除有限维参数向量 外是已知的。经典方法使用数据 来获得参数估计 ,并基于这些插入式估计来估计预测密度

为了估计 ,我们需要对估计采用某种形式的损失函数:通过最大化或最小化某些量来获得估计 。衡量候选密度 与真实密度 之间"接近程度"的最常用损失函数是库尔贝克-莱布勒(KL)距离。真实分布 与参数化分布 之间的 KL 距离为

由于 (13.25) 中的第一项不依赖于 ,因此关于 最小化 KL 距离等同于关于 最大化 ,即期望对数似然。这被称为期望对数得分。因此,使用 MLE 或准极大似然估计(QMLE) 作为插入式估计量来构建估计的预测密度,与最小化密度之间的 KL 距离是等价的。MLE 和 QMLE 方法众所周知且被充分理解,这有助于解释该方法的流行。

对于连续分布的结果,可以采用多种模型。一个明显的首选方法是假设正态性;例如, 可以是一个条件正态模型,其均值为 、方差为 ,因此极大似然方法将给出通常的 OLS 插入式估计量 。对于许多问题而言,该分布被认为限制性过强,因此人们考虑了许多其他分布。下面我们介绍这些参数化模型中最常用的一些。

的密度未知的情况下,我们可以使用准极大似然估计来获得密度模型的参数。这通过以下方式实现:首先在假设正态密度的前提下,估计条件均值和条件方差方程的参数。只要条件均值和方差方程被正确设定,即使 的密度被错误指定,这也将产生一致估计。然后可以基于标准化残差 生成密度预测。例如,可以使用自助法从经验分布函数中抽取样本。

给定一组估计 ,我们可以构建标准化残差

并用它们来估计 的分布。

最简单的方法是将标准化残差 作为原始数据来估计参数化密度 。事实上,由于标准化残差被构造成具有零均值和单位方差,如果我们假设 服从正态分布,则 在不需要残差数据的情况下是完全已知的。更常见的是,可以选择限制性较弱的密度——例如具有估计自由度的 t 分布。

或者,可以使用任何非参数密度估计方法对原始数据 进行处理,以获得 的估计。一种典型的方法是使用核密度估计器估计密度。 处密度 的估计量由下式给出

对于某个带宽 b 和核函数 K(·)。标准核函数的选择是高斯核 或 Epanechnikov 核 ,其中 如果 a 为真,否则为 0。对于上述任一选择——或任何核函数积分为 1 的选择——估计密度的均值等于 的均值。核函数的选择通常不被认为对密度估计的性质有太大影响。带宽参数 b 的选择被认为更为关键。b 取较大值会使估计 对远离 值赋予更大的权重,从而提供更平滑的分布。然而,这是以在估计中引入偏差为代价的。最优带宽选择需要权衡这些效应。高斯核的带宽标准选择为 ,其中 的标准差,鉴于 (13.26) 中的中心化和标准化处理,该值应为 1。然而,应当记住,这样的选择"最优"并非针对获得最佳密度预测,而是针对关于 自身密度所定义的某些准则而言的。这只是密度预测的一个组成部分,因此若发现核文献中的最优带宽选择在密度预测的某些相关准则下并不会产生更好的密度预测,将不足为奇。关于密度估计的详尽阐述可参见 Pagan and Ullah (1999, 第 2 章)。

登录后解锁笔记、知识点解析、AI 问答

立即登录