正在学习
18.1.1 单个密度预测的评估
18.1.1 单个密度预测的评估
为了对密度预测进行实证评估,我们需要一组已实现的结果序列和密度预测 。一种可行的方法是先将密度预测转化为点预测,然后使用第16章中讨论的点预测评估方法。使用这种方法,我们首先根据密度预测 和损失函数 生成该密度预测所隐含的最优点预测 。例如,在MSE损失下,点预测 就是利用 计算出的 的条件均值。与该密度预测相关联的平均损失变为
其形式即为第16章中所讨论的平均损失。
这种评估密度预测的简单方法在多种情况下可能是合适的。首先,正如我们在第13章中所见,密度预测的合理性可以基于存在多个具有不同损失函数的使用者这一事实。任何一位使用者都可以针对其问题所适用的特定损失函数来考察密度预测的表现。预测绩效的相关度量就是由每位使用者的特定损失函数所计算出的平均损失。其次,即使一个密度预测在某些损失函数下表现良好,也未必在所有损失函数下都表现良好。例如,一个在MSE损失下表现良好的密度预测——即具有良好的中心位置——在基于分位数(靠近尾部分位数)的损失函数下可能表现很差。这恰恰说明了评估依赖于(18.1)中所假定的损失函数。
理解(18.1)的抽样性质是困难的,因为已实现的损失是基础密度预测和损失函数的复杂函数。此外,密度预测通常依赖于那些估计被递归更新的模型。West (1996)的假设可能不适用于密度预测的情形,因此,对正确抽样分布及其对用于构建密度预测的基础估计的依赖性进行实际评估,需要对这些方法进行推广,至少在那些由参数估计的递归更新引入非平稳性的情形下如此。一种典型的做法是忽略估计误差,仅将已实现损失 的观测值视为数据来评估抽样误差。然而,这种做法可能会低估样本均值的真实抽样变异性。
另一种方法是不将密度预测转化为点预测,而是使用与密度直接相关的损失函数,例如第2章中讨论的评分规则(有时称为技能分数)。评分规则是将结果 和密度预测 映射到实数轴的函数。如果评分规则是恰当的(proper),则当密度预测与结果的分布相同时,其期望值达到最大。
对于二元结果,分布预测等价于条件均值预测。由于点预测的许多损失函数会导出恰当的评分规则,这两种方法通常是等价的。例如,在MSE损失下,二元变量的分布预测所对应的样本平均损失为
这通常被称为二次概率分数(QPS)统计量,或以Brier (1950)的名字命名的Brier QPS。正如第12章所讨论的,二元预测问题的评分规则与点预测的基础损失函数之间存在直接联系,其中评分规则可以视为对基础点预测损失进行加权平均的结果。
对于具有连续结果变量的情形,评分规则与点预测的基础损失函数之间不存在简单的联系。因此,预测评估通常依赖于任意选定的评分规则。其中最常用的是对数评分规则,它导出样本平均值
其中 是在结果 处求值的条件密度预测。对于二元变量,(18.3)变为
这实际上是平均似然值。与大多数评分规则一样,我们使用损失的相反数,因此寻求较大的平均似然值或平均对数分数。更一般地,任何将 映射到单一数值的评分规则 都导出平均分数
与(18.1)中的平均损失一样,由于这些量依赖于估计量,理解它们的抽样性质是复杂的。
练习题
要对密度预测进行实证评估,需要以下哪一项?
在均方误差(MSE)损失下,点预测是什么?
以下哪些是将密度预测评估为点预测的原因?(选择所有适用的选项)
理解平均损失公式的抽样特性是直接的,因为实现损失是基础密度预测和损失函数的简单函数。
与密度预测相关的平均损失由公式给出。该公式是平均损失的形式,如第___章所探讨的。
解释为什么在均方误差(MSE)损失下表现良好的密度预测,对于基于尾部附近分位数的损失函数可能表现不佳。
评估密度预测的主要挑战是什么?
以下关于评分规则的陈述中,哪些是正确的?(选择所有适用的选项)
对于二元结果,分布预测并不等同于条件均值预测。
在均方误差(MSE)损失下,与二元变量的分布预测相关的样本平均损失被称为___统计量。
什么是对数评分规则,以及如何用它来评估密度预测?
以下哪些是理解平均分数 的抽样特性时面临的挑战?(选择所有适用的选项)
当使用均方误差(MSE)损失评估密度预测时,从密度预测推导出的最优点预测是什么?
以下哪些是将密度预测评估为点预测的有效理由?(选择所有适用的选项)
密度预测的平均损失公式,与第16章所探讨的平均损失形式一致。
对于二元结果,分布预测等同于___。
解释为什么平均损失公式的抽样特性难以理解。
登录后解锁笔记、知识点解析、AI 问答
立即登录