正在学习

6.5 LASSO模型选择

6.5 LASSO模型选择

Lasso——最小绝对收缩和选择算子——由Tibshirani (1996)提出,作为最小二乘回归的收缩估计量,并在第4章中简要讨论过,它还具有有用的模型选择性质。Lasso方法通过在惩罚函数约束下最小化最小二乘残差之和来估计线性回归系数,

这里 是一个调优参数,捕捉惩罚函数的(相对)权重,其作用是将参数估计向0收缩。由于所有非零参数值都受到相同数量的惩罚—— 是一个标量而非向量——因此假设所有预测变量 的方差都已缩放为1。一般来说,(6.25)式中目标函数的最小化没有封闭形式的解,因此需要使用计算方法。

使用平方目标函数并以参数的绝对值进行惩罚意味着对于参数估计 为0的情况存在许多角点解。这促使我们将Lasso视为一种模型选择工具:只需选择移除那些对应于估计值为0的 的x变量后所剩余的模型。

为了理解为什么在Lasso方法下会出现角点解,我们遵循Tibshirani (1996)的思路,考虑矩阵形式的线性回归模型 ,并假设回归变量已经被正交化,使得 。最小二乘预测为 ,因此(以矩阵形式)

其中交叉项由于 而消失,且

(6.28)式中的第一项不依赖于 的选择,第二项为

因此,对 最小化(6.28)式等价于逐变量最小化,即对每个

该问题的一阶条件给出结果 ,或者经重新排列后,。这意味着如果 ,则 必须为0。要看到这一点,假设 ,则 ,因为我们假设了 。因此 不可能为正。但如果 ,则 ,通过同样的假设,这也不可能成立。

图6.1:Lasso下的模型选择。

相反,如果 ,则 ,如果 ,则 。这些结果可以总结如下:

因此,对于 ,系数估计被设为0。 越大,惩罚越强,更多系数将被设为0。更多分析和细节请参见Tibshirani (1996)。

我们还可以通过在二维(即只有两个协变量)中考虑该问题来直观地看到这一效果。要看到这一点,考虑模型

因此我们面对一个二元问题,并可以在 空间中绘制它。假设目标函数是二次的,则其等高线 空间中为椭圆。图 6.1 可视化了这一效果。

LASSO 约束现在具有如下形式:,即

这在原点 0 周围构成了一个"菱形",其顶点坐标为 。图 6.1 以图形方式展示了这一点,其中菱形即为上述约束集合,椭圆则针对使约束恰好起作用的 值绘制。椭圆与约束在顶点处相交的概率很高——如图 6.1 所示,在该约束处有

在实际应用中必须对 进行选择。选择 将得到最小二乘估计,这意味着几乎总会选出最大的模型。 选取得越大,个体 值被设为 0 的可能性就越大,从而更有可能选择一个更为简洁的模型。毫不奇怪,——或 ,因为通常建议令其为样本量 的函数——的实际选择会影响该方法的性质。典型的结论提供的是关于 的速率条件,而非确定一个具体值,并且这些结论是在固定回归量、i.i.d. 数据的设定下推导得出的。例如,Belloni 和 Chernozhukov (2011) 建议对接近(但小于)1 的 以及 设定 ,其中 为正态累积分布函数, 为真实模型残差的方差。

估计 LASSO 系数的主要困难在于目标函数不可微,因此标准的爬山优化算法对求解 (6.25) 式中的最小化问题没有用处。然而,近年来该估计问题已成为研究热点,目前已存在许多即使在 的维数很大时也能有效工作的方法。

在通过 LASSO 选定一个模型之后,可以加入一个 LASSO 后处理步骤,即使用普通最小二乘法或类似方法估计该模型的参数。

LASSO 方法已被推广到更广泛的惩罚最小二乘估计量族,其系数通过最小化下式估计:

其中 为惩罚函数。Bridge 估计量设定 ,其中 。作为一种特殊情况,当 时得到 LASSO,而 时则得到 Ridge 估计量。对于 ,当惩罚值足够大时,该估计量保持使部分 的估计值为 0 的性质;理论结果可参见 Fan 和 Li (2001),综述可参见 Fan、Lv 和 Qi (2011)。

练习题

在回归分析中,Lasso方法的主要目的是什么?

A. 使残差平方和最大化
B. 使受惩罚函数约束的残差平方和最小化
C. 增加待估计参数的数量
D. 完全忽略惩罚函数

谁引入了Lasso方法,在哪一年引入的?

A. 赤池(Akaike)于1974年
B. 施瓦茨(Schwarz)于1978年
C. 蒂布希拉尼(Tibshirani)于1996年
D. 马洛斯(Mallows)于1973年

在Lasso方法中,调整参数有什么作用?

A. 它增加了预测变量的方差
B. 它对参数估计没有影响
C. 它将参数估计值向0收缩
D. 它增加了待估计参数的数量

为什么Lasso被用作模型选择工具?(选择所有适用的选项)

A. 它使参数数量最大化
B. 它导致许多角解,其中参数估计值为0
C. 它移除与估计值等于0的相对应的x变量
D. 它增加了模型的复杂性

在Lasso方法中,如果,则必定为0。

Lasso方法在最小化目标函数时并不总是能提供封闭形式的解。

Lasso系数估计公式为。对于,系数估计值设为___。

解释Lasso方法中调整参数的作用。

Lasso方法如何有助于回归分析中的模型选择?

以下哪项陈述正确描述了Lasso调优参数与模型选择之间的关系?

A. 较大的会增加最终模型中的预测变量数量。
B. 较小的会导致更多系数估计值被设为零。
C. Lasso调优参数对最终模型中的预测变量数量没有影响。
D. 较大的会导致更多系数估计值被设为零。

关于套索(Lasso)方法和信息准则,以下哪些说法是正确的?

A. 套索(Lasso)方法和信息准则都用于模型选择。
B. 信息准则通过惩罚参数数量来调整模型复杂度,而套索(Lasso)方法将系数收缩为零。
C. 套索(Lasso)方法只能用于线性回归模型,而信息准则可应用于任何参数模型。
D. 赤池信息准则(AIC)和贝叶斯信息准则(BIC)明确最小化残差平方和,类似于套索(Lasso)目标函数。

Lasso方法可被视为用于模型选择的交叉验证的一种特殊情况。

在Lasso方法中,假设所有预测变量的方差都已缩放至1,可确保惩罚项对所有预测变量的作用___。

解释Lasso方法中的调整参数如何影响模型拟合与模型复杂度之间的权衡。

登录后解锁笔记、知识点解析、AI 问答

立即登录