正在学习

非参数预测方法

非参数预测方法

前几章所考察的方法要么是全参数化的——此时预测模型由一个有限维未知参数向量 β 完全确定——要么是接近全参数化的,涉对一个固定参数模型族集合的搜索(如第6章所述)。在第4章中我们注意到,任何给定的参数预测模型 都有可能不包含真实模型。事实上,要了解真实模型,就必须了解 Z 的全部或绝大部分联合密度——这一要求在实际预测情境中通常并不成立。

对于一个具体的损失函数,它指明了我们关注 Z 联合分布的哪些特征。对于 MSE 损失,我们关注的是 Y 在给定 Z 条件下的条件均值。对于线性-线性损失,我们关注的是一个条件分位数。本章考察以最少关于潜在模型的信息来非参数或半非参数地近似这些对象的方法。这些方法利用数据来估计预测模型,使得该估计方式能够逼近尽可能多的潜在真实模型。可处理的函数集合仍然存在限制,但非参数方法的目标是找到能够适用于广泛函数类的方法。通过扩大可估计模型的集合,估计出的预测模型更有可能接近最优模型。诚然,非参数预测模型所采用的更广泛的搜索范围需要付出代价。首先,一个实际考虑因素是可用来构建预测的变量的维数。由于许多方法在面对大量预测变量时难以实施,因此它们主要用于预测变量列表相对较短的情况。与此相关的是,对函数形式更广泛的搜索意味着样本内过拟合的风险大大增加,从而导致构建的模型在实际使用时预测表现较差。

对于任何一种非参数方法,基准方法都存在大量变体和改进形式。逐一考察所有这些变体并不现实,因此我们转而介绍这些方法的最简形式,并辅以对其优缺点的讨论。我们重点关注三种方法。第一种方法在预测情境中使用较少,即核估计。核估计可以通过两种方式加以运用。第一种是先估计 Y 在给定 Z 下的条件密度,然后像在密度预测估计中那样利用该密度构建预测。另一种方式是直接利用核方法估计我们感兴趣的条件分布的特征,例如条件均值。第二种方法,即筛估计(sieve estimation),在预测研究中的应用则广泛得多。筛估计器包括神经网络以及其他使用基函数进行近似的回归方法。第三种方法是使用统计(机器)学习文献中发展的方法,如提升回归树。即使在预测变量维数较高的情况下,这些方法也能适应预测任务。

非参数预测方法需要较大的数据样本,因此可以预期在这种情况下它们能够获得更好的结果。电力需求和电价就是一个大量已发表论文采用非参数预测方法的领域。由温度变化预测的电力负荷呈现出明显的非线性特征,因为无论在严寒还是酷暑天气下,电力负荷都会很高。由于这种关系中存在很强的非线性,非参数程序提供的预测优于被认为不合理的线性模型。然而,鲜有实证证据表明哪一种方法占据主导地位。在电价预测中,非线性的证据更为有限。尽管各种非参数程序的应用极为广泛,但并没有太多证据表明某种非参数方法优于其他方法,甚至优于线性模型;参见 Aggarwal、Saini 和 Kumar(2009)的综述。

11.1 节综述核模型,11.2 节讨论筛模型的估计。提升回归树在 11.3 节中介绍,11.4 节作为总结。

练习题

以下哪一项最能描述参数预测模型和非参数预测模型之间的主要区别?

A. 参数模型使用一组固定的预测变量,而非参数模型使用一组可变的预测变量。
B. 参数模型由未知参数的有限维向量确定,而非参数模型对底层模型所做的假设极少。
C. 非参数模型总是比参数模型更准确。
D. 参数模型需要大量数据样本,而非参数模型则不需要。

在预测问题中,损失函数表明了什么?

A. 模型中要使用的预测变量集合。
B. 的联合分布中感兴趣的特征。
C. 模型的计算复杂度。
D. 模型中的参数数量。

非参数预测模型有哪些缺点?(选择所有适用的选项)

A. 它们在有大量预测变量的情况下难以实施。
B. 它们总是比参数模型提供更准确的预测。
C. 它们在样本内过拟合模型的风险更大。
D. 它们对基础模型所需的信息极少。

非参数预测方法需要大量数据样本才能得出更好的结果。

核估计可用于直接估计我们感兴趣的条件分布的特征,例如___。

解释为什么与核估计相比,筛估计在预测研究中更为常用。

以下哪项是提升回归树在非参数预测中的主要优势?

A. 它们仅限于使用小规模的预测变量集。
B. 它们即使在存在高维预测变量的情况下也能进行预测。
C. 它们总是优于核估计。
D. 它们仅适用于线性关系。

以下关于非参数方法的陈述中哪些是正确的?(选择所有适用的选项)

A. 它们旨在找到适用于广泛函数类的方法。
B. 它们能保证提供最优预测模型。
C. 它们扩大了可估计的模型集合。
D. 与参数模型相比,它们不太可能对数据过拟合。

有强有力的实证证据表明,在预测性能方面,有一种非参数方法优于所有其他方法。

非参数方法在电力负荷预测中如何比线性模型表现得更好?

在大型预测变量集合中比较非参数预测方法与因子增强型向量自回归模型(VAR)时,哪项陈述是正确的?

A. 在大型预测变量集合中,非参数方法总是优于因子增强型向量自回归模型(VAR)。
B. 在大型预测变量集合中,因子增强型向量自回归模型(VAR)通常比非参数方法更有效。
C. 无论预测变量的数量如何,两种方法的性能都相同。
D. 非参数方法仅对小型预测变量集合有效。

以下关于非参数预测模型的缺点,哪些是正确的?选择所有适用的选项。

A. 它们主要用于预测变量列表相对较大的情况。
B. 它们在样本内过度拟合模型的风险更大。
C. 它们的灵活性较低,无法逼近广泛的函数类别。
D. 当预测变量集较大时,它们难以实现。

由于电力负荷与温度变化之间的关系存在很强的非线性,因此在预测电价时,非参数预测方法通常比线性模型更受青睐。

登录后解锁笔记、知识点解析、AI 问答

立即登录