正在学习
3.2.1 基于损失的方法与两步法
3.2.1 基于损失的方法与两步法方法
构造预测模型的经典(或频率主义)方法大致可分为两大类:要么直接使用损失函数的样本类似量(sample analog),要么采用两步法方法——先找到最优预测的形式,然后对未知参数使用代入估计。本节考察在这些方法下出现的一些一般性问题。本书后续大部分内容将在更具体的预测问题背景下研究预测的构造。
样本类似量方法要求找到(3.15)的样本类似量并构造一个预测模型 ,其中 是未知参数,其取值依赖于 ,尽管正如我们将在第6章和第11章讨论的那样,预测模型本身通常也是未知的。如果 与最优预测相同(即 等于在MSE损失下的条件均值),那么预测模型就是正确设定的。在实践中,这应该被视为不太可能发生的事件。更可能的情况是, 是对正确设定的近似。
两步法方法近似条件分布中预测变量的相关特征——例如,在MSE损失下,这一特征是给定时的条件均值,方法是通过预测模型 。同样地,如果该模型与 的相关特征相同,则模型是正确设定的,尽管更可能的情况是 是一个近似。在第二步中,使用对的一个估计,记为 ,来生成预测 。因此,两步法方法要求能够确定 的相关特征,而样本类似量方法则总是可以使用。尽管如此,两步法方法在实践中更为普遍。这主要是因为大多数预测研究是在MSE损失下进行的,将预测分析简化为对结果条件均值的估计。
例3.2.1(Linex损失,续)。 设 ,因此数据仅包含因变量的过去值。如果我们假设 ind ,则
并且我们有 。一个代入估计量可能使用如下预测:
其中 , 是方差的一个估计量,即 。
由于我们正在估计条件分布的一个特征,例如其均值,因此点预测本质上是一个估计问题。关于风险和预测最优性的大多数结果类似于参数估计理论中的结果。在本节剩余部分,我们将介绍其中一些基本结果,并将其适配到预测问题中。
首先,考虑预测模型被正确设定的情况,因此 等于 的正确特征。类似量过程或代入法的第二步要求从数据中估计 ,因此实际的预测模型不是 ,而是 。预测方法的风险计算涉及对 取期望,因此会受到未知参数估计的影响。由于参数估计带来的额外随机性增加了风险,估计的预测模型将永远无法获得前一节中讨论的最优性。
例3.2.2(给定结果观测历史的MSE损失)。 考虑使用 在MSE损失下预测 ,其中 ind ,因此数据由从同一分布中独立抽取的过去观测组成。总体最优预测是 。这产生风险 。当 未知时,我们可能改用基于 个观测计算的样本均值 作为预测,其中 。该预测的风险为
这严格大于总体预测的风险 。
(3.15)中的风险度量通常不同于(3.2)中的条件期望损失度量,因为 随 变化。我们将在下一个例子中说明这一点。
例3.2.3(线性预测模型的MSE损失)。 考虑一个线性预测模型 ,其中 独立于 。在平方误差损失下,期望损失为
在给定数据 和预测值 的条件下,对于最小二乘估计量 ,上式变为
该式依赖于直到时刻 的所有 值。通过对所有 值进行积分得到的无条件期望损失为
其中 。
假设模型 正确设定且 (从而 )已知的风险函数,可以被视为风险的一个不可行下界,或者是大样本下风险的"极限"近似。同时,在考虑预测程序的优劣时,应当考虑参数估计误差。由此得到的一个直接推论是,即使在最简单的情况下——即使在模型正确设定的情况下——也不存在一个对所有可能的 值都能使风险最小化的单一最优程序。相反,不同程序的风险函数通常会在 的不同区域内相交。下一个例子将说明这一点。
例 3.2.4(收缩估计量的 MSE 损失)。考虑例 3.2.2 中的预测问题。我们不必使用样本均值估计量 ,而可以考虑收缩估计量 ,其中 。此时风险为
当 在范围 内时,预测值 的风险低于样本均值 ;在此范围之外, 的风险较低。
上述结果都以预测模型(除一组未知参数 外)正确设定为前提。然而,正如上一小节所讨论的,我们可以将搜索范围限制在一个可能的模型子集内,该子集不包含最优模型。例如,使用 MSE 损失的预测者可能将模型限制为线性投影,即使条件均值关于条件变量并非线性关系。在这种情况下,最优性是相对于这个有限的模型集合来确定的。
估计量的标准风险概念可以推广到预测,包括与方法最优性相关的问题。与估计方法类似,一个预测方法属于一组最优方法族,如果参数空间 中存在某个区域,使得在此区域内没有其他预测方法具有更低的风险。从上述例子中可以清楚地看出,这种最优性概念通常定义的是一组预测方法,而非单一预测方法。因此,一般来说,对于任何问题都不可能声称存在单一的最优预测方法,除非 被限制为一个点——此时 必须是已知的。
这些考虑也引出了这样的可能性:某些预测程序在 的每一个取值下都被其他预测所支配,因此是劣等的,永远不应被使用。这一概念对应于不可接受估计量的思想。
例 3.2.5(收缩估计量的 MSE 损失,续)。允许例 3.2.4 中的收缩因子 在实数 等集合中取任意值,就生成了一族估计量,我们记为 。由 (3.20) 可知,对于 ,不存在 的某个范围使得 优于样本均值 ,因为相应的风险严格更大。因此,这些估计量永远不应被使用。然而,当 时,不存在这样的排序,此时在 接近 0 的情况下,较大的收缩程度会带来更低的风险。
练习题
以下哪项最能描述预测中的样本类比方法?
在两步法中,在近似条件分布的相关特征之后,第二步是什么?
以下关于两步法的陈述哪些是正确的?
样本类比法总是可以使用,而两步法要求能够确定的相关特征。
在均方误差(MSE)损失下,最优预测是给定时的条件均值,记为___。
解释为什么点预测可以被视为一个估计问题。
在Linex损失示例中,最优预测的形式是什么?
以下关于估计预测模型风险的陈述中,哪些是正确的?
(3.15)中的风险度量通常与(3.2)中的条件预期损失度量相同。
对于线性预测模型,在平方误差损失下的期望损失是多少?
以下哪项是样本类比法与两步法在预测中的关键区别?
在具有观测历史的均方误差(MSE)损失示例中,总体最优预测为___。
在均方误差(MSE)损失下,最优预测是给定时的条件均值。如果使用两步法用预测模型来近似该特征,并且使用数据估计,以下哪个陈述是正确的?
关于预测中的样本类比方法和两步法,以下哪些陈述是正确的?
当预测模型被正确设定时,估计的预测模型的风险将等于总体最优预测的风险。
登录后解锁笔记、知识点解析、AI 问答
立即登录