正在学习
18.2.1 校准
18.2.1 校准
校准要求,如果一个密度预测为某事件分配了某一概率,那么在多次观测中该事件应以所述概率发生。这一思想最初产生于二元结果的预测。考虑预测是下雨还是晴天,因此密度预测就是下雨的概率。如果天气预报员预测有70%的概率下雨,那么在所有做出此密度预测的日子里,我们应看到实际下雨的时间占70%。更一般地,对于一个良好校准的预测,。
通过将结果的任何事件转换为一个二元变量,这一思想可以推广。对于任何这样的事件 ,如果相关的密度预测 ,校准要求在相同信息条件下 确实等于 。例如,设 为我们预测结果值增加的事件集合,即 。那么,在所有预测 的概率为 的时期中,我们应该恰好在25%的时间里看到 的增加。对于一个良好校准的预测,这应对所有 值和任何事件 成立。显然,这只有在预测分布恰好是结果的分布时才成立。
例18.2.1(比较高斯密度预测)。遵循Gneiting和Raftery(2007)的做法,考虑 的两种可能的密度预测。第一种是真实的无条件密度,。第二种是一个正确设定的条件密度,,其中 的边际分布取自标准高斯分布,即 。设 。那么 在每个时期都意味着概率预测 。正确的校准要求 平均而言在一半的时间里成立。对于第二个模型,,这随时间变化。因此,校准要求
对于所有 的时期都成立。本例中 有充分的变化,因此可以对许多不同的 值检查这一条件。
大多数检验校准的尝试采用的是非正式方法,而非正式假设检验。出现的一个问题是, 是 的函数,但通常给定样本在任何特定 值上的观测值很少。在二元预测文献中,这通常通过考察一系列 值下的性质来克服,如(18.10)式中的Murphy分解,从而构建直方图。使用这种方法,校准可以度量如下:
其中0值表示完美校准。基于此统计量的正式检验具有非枢轴分布。为解决此问题,Seillier-Moiseiwitsch和Dawid(1993)提出了以下标准化统计量:
使用鞅差序列中心极限定理,这些作者证明了(18.12)式中的统计量近似服从 分布。然而,他们的结果没有考虑在构建分布预测中的估计误差。
对于转换为二元预测的预测,Galbraith和van Norden(2011)建议使用核方法。用于估计条件均值的标准核方法适用于此问题;关于一般问题的综述,请参见Pagan和Ullah(1999)。对于一般连续分布的结果 , 有很多选择。校准意味着结果应对任何这样的选择成立,尽管对 的每一种选择都进行尝试是不可行的。
校准的缺点是它忽略了条件变量中的信息。一个预测即使密度预测并非可获得的最佳预测,也可以是良好校准的。
例18.2.2(比较高斯密度预测,续)。对于 ,第一个密度预测 是良好校准的,因为 ,这正是每个时期的预测概率。第二个密度预测 也是良好校准的。无论何时 ,都有 ,因此 ,从而形成一个良好校准的模型。
因此,校准并不能衡量密度预测在"为很可能发生的事件赋予较高概率"这一意义上是否良好。相反,它可以用来衡量密度预测在某些情境下是否犯系统性错误。正因如此,校准通常被称为"可靠性";一个校准良好的预测在避免预测不会发生的事件这一意义上是可靠的,即便它在指示实际将会发生什么方面可能表现欠佳。从这个意义上说,校准实际上更多地是一种用于确定良好分布的工具,而非说服用户相信密度预测是最优的手段。
练习题
以下哪项最能描述预测中的校准概念?
对于一个校准良好的预测,预测概率与观测结果之间的预期关系是什么?
以下关于将校准扩展到二元变量的陈述中,哪些是正确的?(选择所有适用的选项)
对于校准良好的预测,如果预测的概率为,那么我们应该恰好在25%的时间里看到的增加。
如果预测分布与结果分布不同,则校准不成立。
在高斯密度预测的背景下,如果,真实无条件密度的概率预测为___。
墨菲分解使用公式来衡量校准度。值为___表示完美校准。
解释为什么在正式假设检验中使用标准化统计量,而不是使用原始的墨菲分解统计量。
作为预测质量的一种度量标准,校准的主要缺点是什么?
以下关于校准和评分规则之间关系的陈述哪些是正确的?(选择所有适用的选项)
一位天气预报员预测某一天有60%的降雨概率。如果预报校准良好,那么在很长一段时间内,对于有此预报的日子,观察到的降雨频率应该是多少?
以下关于密度预测校准的陈述中哪些是正确的?(选择所有适用的选项)
标准化统计量近似服从分布,用于衡量校准度。
对于校准良好的预测,如果预测的概率为,那么在所有做出该预测的时期内,恰好应在___的时间内出现增长。
登录后解锁笔记、知识点解析、AI 问答
立即登录