正在学习
15.7 结论
15.7 结论
预测评估是构建、监控和改进单个预测模型的重要组成部分。样本内预测评估方法类似于计量经济学分析中的诊断检验,包括评估预测误差是否存在序列相关性(或更一般地,是否可预测),如果存在,则可以构建更好的模型。样本外方法通过仅使用部分样本来生成一系列预测,从而模拟模型的"实时"表现,以减少数据挖掘对预测性能可能产生的影响。
预测评估方法应反映预测者的损失函数。事实上,给定一系列已观察到的预测,有时可以反向推断预测者未知的损失函数,并在比了解预测者具体损失函数更弱的假设下进行预测理性检验。在均方误差(二次)损失的情况下,大量文献提出了基于预测误差的无偏性和无序列相关性的预测最优性检验。更广泛地说,关于底层数据生成过程的假设和预测者损失函数的假设也可以进行权衡,从而建立预测理性的可检验含义。
单个预测的评估
预测准确性的衡量与预测评估密切相关。可以考虑预测性能的绝对和相对衡量标准。绝对性能衡量标准涉及单个预测相对于实际结果的准确性,使用经济(基于损失的)或统计指标。相对性能衡量标准将一个或多个预测的表现与某个基准进行比较。本章关注单个模型的绝对预测性能,而下一章将处理跨多个预测的预测准确性比较。
预测评估实质上是要理解给定预测的损失是否"足够小"。可以采用正式和非正式的方法。像第15章中描述的Theil(1961)的图形方法等非正式方法为此问题提供了"全局"答案,并有助于指出某组预测明显不足的方向。例如,实际值与预测值的散点图可能揭示出系统性高估或低估的倾向。
也可以考察使用数据估计平均损失的更正式方法。对此类平均值的考察由来已久,但直到最近几年,研究人员才开始以便于对可预测性进行严格推断的方式在损失估计中设置标准误。一个关键的复杂性在于,这些样本平均值的检验统计量的分布可能取决于预测是如何构建的,具体而言,预测基于哪种估计方法。这导致人们认识到,不仅是预测模型,预测方法也很重要。例如,使用扩展估计窗口还是固定估计窗口来生成预测,会影响随后关于预测准确性的推断。
对单个预测的正式评估涉及检验预测相对于某种损失函数和特定信息集是否具有最优性。如果预测最优性被拒绝,则意味着该预测可以加以改进。预测最优性检验历史悠久,反映在大量文献及其自身的术语中。与对平均损失计算标准误一样,构建此类检验需要了解用于生成预测和预测误差的方法(和信息集)。在实践中这一点往往被忽视,并且在许多有趣的情况下,构建检验的精确方法是未知的。一个例外是使用所谓的伪样本外预测方法,该方法模拟了在"实时"情况下可能生成预测的过程。通过构造,这种设定假定评估者知道用于模型估计和预测构建的方法。
预测评估统计量的抽样性质,例如一致性和标准误,可能不仅取决于模型,还取决于参数是如何估计的以及使用了哪些数据来构建预测。这一点很重要,因为存在几种不同的预测构建方法。一种自然的方法是仅使用历史可获得的数据来构建预测,从而模拟实时预测问题。这种回测方法与使用完整数据样本进行估计和预测评估的方法形成对比。
本章的章节安排如下:第16.1节回顾在分析平均损失的抽样分布时出现的一些问题。第16.2节转向模拟样本外预测的不同方案,第16.3节探讨更正式的方法,用于评估一系列预测的平均损失大小并对样本外损失进行推断。这些方法既反映了数据生成过程的性质,也反映了用于构建预测的方法,其中后者明确考虑了预测本身是由某个预测模型生成的这一事实,因此必须考虑参数不确定性。第16.4节讨论生成预测下样本外预测理性检验的渐近性质。第16.5节涵盖聚合和分解预测的评估,第16.6节进行总结。
练习题
在使用均方误差(MSE)损失函数评估预测时,以下哪个属性对于预测被认为是最优的是必不可少的?
在进行样本外预测评估时,以下哪些是有效的考量因素?(选择所有适用项)
在评估预测时,样本均值检验统计量的______可能取决于用于生成预测的估计方法,例如是使用了扩展窗口还是固定窗口。
登录后解锁笔记、知识点解析、AI 问答
立即登录