正在学习
11.2.2 样条
11.2.2 样条函数
样条函数提供了一种有效划分空间 的方法,使得不同的模型在各个划分区间上分别进行估计,同时模型在整个 的取值范围内保持连续。例如,考虑一个预测回归模型,它允许在 时使用一种线性回归,而在 时使用另一种线性回归,并使两条曲线在 处相衔接。在实践中,通常使用三次样条,使得模型为关于 的最高三次多项式。这些划分点被称为节点。
考虑使用单变量预测变量 来预测 的问题。最简单的三次样条涉及估计如下模型:
其中 个节点为预测变量取值范围内的 的值。应用三次样条方法需要选择节点的位置,从而确定 的取值。一种标准的方法是简单地将节点选取为 的等距百分位数, 的取值取决于样本量; 越大,模型的平滑程度越低,且需要估计更多的参数。对于样本量为 100 的情况,一个常见的选择是使用第 20、40、60 和 80 百分位数作为节点。在给定这些节点之后,可直接通过普通最小二乘法(OLS)对式 (11.7) 进行估计。
在使用如式 (11.7) 这样的简单形式的样条回归时,通常需要考虑两个问题。首先,在观测到的预测变量取值范围的边界附近,由于数据对这些点附近的曲线拟合影响较小,因此拟合模型可能产生非常不稳定的结果。于是三次项在这些点处可能导致较大的斜率。为了克服这一问题,标准做法是将节点设置在取值范围的两端,并在这些端点节点与最近的内部节点之间的区间内使用线性函数。不过这是否真的有用并不清楚,因为它涉及对几乎从未出现过的情形进行预测。在这种情况下,预测者可能不愿意依赖一个主要功能是捕捉非线性特征并将其用于对未观测数据进行外推的模型。
第二个出现的问题是,如果式 (11.7) 中系数 之间差异很大,那么拟合模型可能会有相当大的波动。为了应对这一问题,可以对参数估计的差异施加惩罚,例如通过最小化加权平方误差与惩罚项之和。惩罚项通常具有如下形式:,其中 是估计函数的导数或二阶导数。例如,式 (11.7) 中三次样条的二阶导数为 。将该式的平方在数据取值范围的下限到上限之间关于 积分,可得到惩罚项 。此时估计问题转化为广义岭回归的形式,其具有简单的闭式解(参见第 6 章)。
使用样条模型的最后一个困难在于,随着 的维度增加,模型会变得非常复杂。即使只有两个预测变量,我们不仅需要包含每个预测变量的多项式项,还需要包含它们的交叉乘积项。这同时也使节点位置的选取变得更加复杂,因为我们需要在更大的空间中进行划分。一种方法是沿着各个 变量分别进行划分,而不考虑其他预测变量;然而这会引入大量的项,从而需要估计更多的 系数。
练习题
在回归分析中使用样条的主要目的是什么?
在使用样条进行预测回归时,在点处会发生什么?
什么是三次样条?
样条回归中划分点的特征是什么?
以下关于最简单三次样条模型的陈述中哪些是正确的?
在三次样条方法中,节点数与样本量无关。
一旦选定节点,三次样条模型的估计即可简单地通过普通最小二乘法(OLS)进行。
样条回归中的分割点被称为___。
为了克服样条回归中的边界问题,标准做法是在支撑区间的端点处放置节点,并使用___函数来划分这些端点与最近节点之间的区域。
解释三次样条模型的二阶导数如何用于惩罚参数估计之间的差异。
当在三次样条模型中对参数估计的差异进行惩罚时,估计问题的形式是什么?
以下哪些是随着的维度增加,使用样条模型时遇到的困难?
以下关于筛估计的陈述中,哪些是正确的?
在筛估计中纳入线性先导项对模型有何益处?
以下关于样条的陈述中哪一个是正确的?
以下哪些是样条回归中可能出现的问题?选择所有适用的选项。
登录后解锁笔记、知识点解析、AI 问答
立即登录