正在学习

3.2.1 基于损失的方法与两步法

3.2.1 基于损失的方法与两步法方法

构造预测模型的经典(或频率主义)方法大致可分为两大类:要么直接使用损失函数的样本类似量(sample analog),要么采用两步法方法——先找到最优预测的形式,然后对未知参数使用代入估计。本节考察在这些方法下出现的一些一般性问题。本书后续大部分内容将在更具体的预测问题背景下研究预测的构造。

样本类似量方法要求找到(3.15)的样本类似量并构造一个预测模型 ,其中 是未知参数,其取值依赖于 ,尽管正如我们将在第6章和第11章讨论的那样,预测模型本身通常也是未知的。如果 与最优预测相同(即 等于在MSE损失下的条件均值),那么预测模型就是正确设定的。在实践中,这应该被视为不太可能发生的事件。更可能的情况是, 是对正确设定的近似。

两步法方法近似条件分布中预测变量的相关特征——例如,在MSE损失下,这一特征是给定的条件均值,方法是通过预测模型 。同样地,如果该模型与 的相关特征相同,则模型是正确设定的,尽管更可能的情况是 是一个近似。在第二步中,使用对的一个估计,记为 ,来生成预测 。因此,两步法方法要求能够确定 的相关特征,而样本类似量方法则总是可以使用。尽管如此,两步法方法在实践中更为普遍。这主要是因为大多数预测研究是在MSE损失下进行的,将预测分析简化为对结果条件均值的估计。

例3.2.1(Linex损失,续)。,因此数据仅包含因变量的过去值。如果我们假设 ind ,则

并且我们有 。一个代入估计量可能使用如下预测:

其中 是方差的一个估计量,即

由于我们正在估计条件分布的一个特征,例如其均值,因此点预测本质上是一个估计问题。关于风险和预测最优性的大多数结果类似于参数估计理论中的结果。在本节剩余部分,我们将介绍其中一些基本结果,并将其适配到预测问题中。

首先,考虑预测模型被正确设定的情况,因此 等于 的正确特征。类似量过程或代入法的第二步要求从数据中估计 ,因此实际的预测模型不是 ,而是 。预测方法的风险计算涉及对 取期望,因此会受到未知参数估计的影响。由于参数估计带来的额外随机性增加了风险,估计的预测模型将永远无法获得前一节中讨论的最优性。

例3.2.2(给定结果观测历史的MSE损失)。 考虑使用 在MSE损失下预测 ,其中 ind ,因此数据由从同一分布中独立抽取的过去观测组成。总体最优预测是 。这产生风险 。当 未知时,我们可能改用基于 个观测计算的样本均值 作为预测,其中 。该预测的风险为

这严格大于总体预测的风险

(3.15)中的风险度量通常不同于(3.2)中的条件期望损失度量,因为 变化。我们将在下一个例子中说明这一点。

例3.2.3(线性预测模型的MSE损失)。 考虑一个线性预测模型 ,其中 独立于 。在平方误差损失下,期望损失为

在给定数据 和预测值 的条件下,对于最小二乘估计量 ,上式变为

该式依赖于直到时刻 的所有 值。通过对所有 值进行积分得到的无条件期望损失为

其中

假设模型 正确设定且 (从而 )已知的风险函数,可以被视为风险的一个不可行下界,或者是大样本下风险的"极限"近似。同时,在考虑预测程序的优劣时,应当考虑参数估计误差。由此得到的一个直接推论是,即使在最简单的情况下——即使在模型正确设定的情况下——也不存在一个对所有可能的 值都能使风险最小化的单一最优程序。相反,不同程序的风险函数通常会在 的不同区域内相交。下一个例子将说明这一点。

例 3.2.4(收缩估计量的 MSE 损失)。考虑例 3.2.2 中的预测问题。我们不必使用样本均值估计量 ,而可以考虑收缩估计量 ,其中 。此时风险为

在范围 内时,预测值 的风险低于样本均值 ;在此范围之外, 的风险较低。

上述结果都以预测模型(除一组未知参数 外)正确设定为前提。然而,正如上一小节所讨论的,我们可以将搜索范围限制在一个可能的模型子集内,该子集不包含最优模型。例如,使用 MSE 损失的预测者可能将模型限制为线性投影,即使条件均值关于条件变量并非线性关系。在这种情况下,最优性是相对于这个有限的模型集合来确定的。

估计量的标准风险概念可以推广到预测,包括与方法最优性相关的问题。与估计方法类似,一个预测方法属于一组最优方法族,如果参数空间 中存在某个区域,使得在此区域内没有其他预测方法具有更低的风险。从上述例子中可以清楚地看出,这种最优性概念通常定义的是一组预测方法,而非单一预测方法。因此,一般来说,对于任何问题都不可能声称存在单一的最优预测方法,除非 被限制为一个点——此时 必须是已知的。

这些考虑也引出了这样的可能性:某些预测程序在 的每一个取值下都被其他预测所支配,因此是劣等的,永远不应被使用。这一概念对应于不可接受估计量的思想。

例 3.2.5(收缩估计量的 MSE 损失,续)。允许例 3.2.4 中的收缩因子 在实数 等集合中取任意值,就生成了一族估计量,我们记为 。由 (3.20) 可知,对于 ,不存在 的某个范围使得 优于样本均值 ,因为相应的风险严格更大。因此,这些估计量永远不应被使用。然而,当 时,不存在这样的排序,此时在 接近 0 的情况下,较大的收缩程度会带来更低的风险。

练习题

以下哪项最能描述预测中的样本类比方法?

A. 它使用两步过程来找到最优预测,然后估计参数。
B. 它直接使用损失函数的样本类比来构建预测模型。
C. 它需要首先确定条件分布的相关特征。
D. 与两步法相比,它在实践中不太常见。

在两步法中,在近似条件分布的相关特征之后,第二步是什么?

A. 构建损失函数的样本模拟。
B. 使用未知参数的插入估计值来生成预测。
C. 确定条件分布的相关特征。
D. 直接最小化期望损失。

以下关于两步法的陈述哪些是正确的?

A. 它要求能够确定的相关特征。
B. 与样本模拟法相比,它在实践中不那么普遍。
C. 在均方误差(MSE)损失下,它更为常用。
D. 它涉及构建一个与的相关特征完全相同的预测模型

样本类比法总是可以使用,而两步法要求能够确定的相关特征。

在均方误差(MSE)损失下,最优预测是给定的条件均值,记为___

解释为什么点预测可以被视为一个估计问题。

在Linex损失示例中,最优预测的形式是什么?

A.
B.
C.
D.

以下关于估计预测模型风险的陈述中,哪些是正确的?

A. 风险受未知参数估计的影响。
B. 估计预测模型将始终获得所讨论的最优性质。
C. 参数估计带来的额外随机性增加了风险。
D. 估计预测模型的风险严格大于总体预测的风险。

(3.15)中的风险度量通常与(3.2)中的条件预期损失度量相同。

对于线性预测模型,在平方误差损失下的期望损失是多少?

以下哪项是样本类比法与两步法在预测中的关键区别?

A. 样本类比法直接处理损失函数,而两步法首先确定最优预测形式。
B. 两步法总是可以使用,而样本类比法需要确定条件分布的相关特征。
C. 与两步法相比,样本类比法在实践中较少使用。
D. 两步法在确定最优预测形式后涉及估计参数。

在具有观测历史的均方误差(MSE)损失示例中,总体最优预测为___

在均方误差(MSE)损失下,最优预测是给定的条件均值。如果使用两步法用预测模型来近似该特征,并且使用数据估计,以下哪个陈述是正确的?

A. 预测模型总是正确指定的。
B. 预测模型的风险将低于总体最优预测的风险。
C. 预测模型是对条件均值的近似,其风险受估计的影响。
D. 两步法不能在均方误差损失下使用。

关于预测中的样本类比方法和两步法,以下哪些陈述是正确的?

A. 样本类比方法需要找到损失函数的样本类比并构建预测模型
B. 两步法首先找到最优预测的形式,然后对未知参数使用插入估计。
C. 样本类比方法仅在可以确定的相关特征时才能使用。
D. 两步法在实践中更为普遍,因为大多数预测研究都是在均方误差(MSE)损失下进行的。

当预测模型被正确设定时,估计的预测模型的风险将等于总体最优预测的风险。

登录后解锁笔记、知识点解析、AI 问答

立即登录