正在学习
4.2.3 基于惩罚损失函数的估计
4.2.3 基于惩罚损失函数的估计
预测模型参数估计的需要增加了相关预测的风险。在平方误差损失下,参数估计误差通常会增加一个 阶的项。尽管这个项在渐近意义上可以忽略,但在实践中它仍然可能是风险的显著增加。这在使用月度、季度甚至年度数据的实际预测问题中尤为真实,因为这些情况下样本容量并不是很大,估计误差可能很重要。
选择 以最小化样本内损失的替代方法是使用一种对样本内平均损失施加惩罚或对预测模型维度施加约束的方法。在这种情况下,我们将 选择为如下拉格朗日函数的最小化解:
其中 。我们可以将 (4.10) 视为带有惩罚项 的惩罚损失函数。将该方法应用于平方误差损失和线性模型,我们有
其中函数 的不同选择会产生不同的方法。岭回归设定 ,而扩展岭方法则使用 ,其中 为某个矩阵。岭回归最初是为处理线性回归中的多重共线性而提出的。尽管多重共线性对预测来说并不是一个问题,但岭估计量实际上是一个收缩估计量,在预测中可能是有用的。
Tibshirani (1996) 提出的 Lasso(最小绝对收缩和选择算子)方法设定 ,同样产生一个收缩估计量。该方法常用于变量选择(见第6章),因此在可能预测变量数量较多、而其中只有少数具有足够预测能力应被纳入模型的情况下非常有用。Bai 和 Ng (2008) 考虑了用 Lasso 方法来预测美国通货膨胀,而 Elliott、Gargano 和 Timmermann (2013) 则提供了 Lasso 和岭方法在美国股票市场收益可预测性方面的应用。
另一个更近期的方法是由 Zou 和 Hastie (2005) 提出的弹性网估计量。它使用惩罚项 ,其中 ,这是 Lasso 和岭惩罚项的凸组合。通过使用这样的惩罚项组合,希望能够避免 Lasso 在组内许多预测变量具有相似预测能力时表现较差、以及 Lasso 倾向于从组中任意选择一个预测变量的倾向。Bai 和 Ng (2008) 使用该方法从 100 多个变量中构建通货膨胀预测。
Breiman (1995) 提出的这些方法的一个变体是 Garrote,它通过求解下式来选择参数:
其中 是最小二乘估计。然而,该方法在经济学预测文献中并未得到广泛使用。
约束优化方法是收缩估计量的例子,它们将无约束优化方法的系数收缩到一个特定点(通常为 0)。这一点可以在下面的例子中看到。
例 4.2.6。设 ,考虑对 的均值进行预测。我们可以使用具有最小 MSE 的样本内估计量,但要求满足约束 ,以防止 变得过大。这产生如下形式的惩罚损失函数:
其中 。(4.11) 的解为估计量
因此该估计量将样本均值向 0 方向进行了收缩。
第二个例子是广义岭估计量。
例 4.2.7。考虑观测值 ,其中 为 维, 为 维。设 ,其中 使得 为正定矩阵。则
的解为 ,这就是广义岭估计量;简单岭估计量设定 。
练习题
在平方误差损失下,参数估计误差添加到预测风险中的项的阶数是多少?
用于选择使惩罚损失函数最小化的的拉格朗日形式是什么?
以下关于岭回归(Ridge regression)的陈述哪些是正确的?
以下关于Lasso方法的陈述哪些是正确的?
弹性网络估计量结合了岭回归方法和套索方法的惩罚项。
Garrote方法不对参数施加任何约束。
在平方误差损失下,参数估计误差给预测风险增加的项渐近地___。
Lasso方法常用于___选择。
解释惩罚项在惩罚损失函数中的作用。
与Lasso方法相比,使用弹性网络估计量的主要优势是什么?
以下哪一项是岭回归(Ridge regression)和套索回归(Lasso)之间的关键区别?
以下关于预测中最大似然估计(MLE)的陈述哪些是正确的?
拟极大似然估计量(QMLE)假定似然函数被正确指定。
最大似然估计量的一致性要求模型是___(因此期望似然在真实参数处有唯一最大值)。
在预测中使用插件法的主要优势是什么?
登录后解锁笔记、知识点解析、AI 问答
立即登录