正在学习

6.3 信息准则

6.3 信息准则

信息准则(IC)通过在模型拟合度与模型复杂度的惩罚项之间进行权衡来选择模型,模型复杂度以模型需要估计的自由参数个数来衡量。文献中提出了多种信息准则,其中最常用的两种是 Schwarz(1978)提出的贝叶斯信息准则(Schwarz BIC、SBIC 或 BIC)和 Akaike(1974)提出的赤池信息准则(AIC)。较少使用的方法包括 Mallows(1973)提出的 Mallows 准则以及 Hannan 和 Quinn(1979)提出的 Hannan–Quinn 准则。此外,关于这些方法的变体以及其他形式的信息准则还有大量文献。之所以出现如此众多的准则,是因为不同的信息准则具有不同的性质,我们将在下文中加以讨论。BIC、AIC 和 Mallows 都试图针对参数估计的影响对最小化准则进行调整,因为参数估计往往会使得参数较多的模型在样本内表现得优于其实际表现。参数估计对样本内拟合度的改善程度取决于真实模型,因此不同信息准则之间的差异归根结底在于如何在实践中克服我们对"真实"预测模型的根本未知。

信息准则采用不同的策略在拟合度与简约性之间进行权衡。贝叶斯信息准则选择给定数据下后验概率最高的模型。为了从候选模型集中选择一个模型,根据各模型的后验概率对其进行排序,并选择后验概率最高的模型。赤池信息准则旨在最小化候选模型的密度与真实(未知)模型密度之间的(Kullback–Leibler)距离。

考虑一组 K 个参数化模型 ,其中每个模型 ,需要估计 个参数 。BIC 和 AIC 通过最小化如下形式的表达式来选择模型(由 k 索引)

在所有模型中取值,,其中 是在参数估计值处评估的数据似然, 是关于模型规模 的递增函数, 是关于样本量 T 的递减函数。第二项 对额外参数(较大的 )的估计施加惩罚,尤其在样本量较小时惩罚更重。

不同信息准则的区别在于其对 的选择。对于 BIC 和 AIC,惩罚项的形式分别为

因此,两个准则中 ,而 BIC 中 ,AIC 中

下面的例子说明了如何将信息准则应用于单变量线性预测模型。

例 6.3.1(线性回归的 AIC 和 BIC)。考虑一组线性预测模型,这些模型在所选择的自变量 上有所不同。

为包含 个回归变量的回归中得到的方差的最大似然估计量。使用第 k 个模型的极大似然估计,我们得到(对于

因此

其中 C 是不随模型变化的常数。因此,对于具有单变量因变量的线性回归,AIC 的形式为

BIC 的形式为

Mallows(1973)提出的 Mallows 准则是第三个常用于从一组线性回归中选择子模型的准则。考虑一个包含 个回归变量且具有相应残差平方和 的模型,并设 表示包含所有可能 () 个回归变量的"超"模型的残差方差估计值。则 Mallows 准则的形式为

最优模型为所有可能模型中 值最小的模型。 准则是在相关变量被遗漏的情形下对样本内均方误差期望值的估计量。

基于Mallows 的线性回归模型选择在渐近意义上等价于基于AIC在同一模型集合上的模型选择。为验证这一点,将(6.14)式乘以并减去公共项,可见AIC等价于基于的模型选择。在方差比等于1处对自然对数进行一阶泰勒展开,得到:

为最大似然估计量时,这就是Mallows 。在大多数情况下,泰勒展开所产生的近似误差会在大样本中消失。

为确定线性自回归模型的阶数,Hannan和Quinn(1979)提出了如下模型选择准则:

该准则基于两方面考虑:一是确保滞后阶数的一致性估计,二是尽可能避免对回归的过拟合。(6.17)式中的惩罚项通常介于AIC与BIC的惩罚项之间。

BIC也常被用于选择自回归或ARMA模型的滞后阶数;参见例如Marcellino、Stock和Watson(2006)。通常会施加滞后阶数不存在"间隔"的约束——例如排除包含滞后1、3和7的模型——这大大简化了对模型设定的搜索过程。

练习题

以下哪一项不是文中提到的常用信息准则?

A. 贝叶斯信息准则(BIC)
B. 赤池信息准则(AIC)
C. 马洛斯准则
D. 皮尔逊相关系数

BIC根据什么来选择模型?

A. 样本内拟合度最低
B. 给定数据下后验概率最高
C. Kullback-Leibler距离最小
D. 参数数量最少

根据文本,AIC的惩罚形式是什么?

A.
B.
C.
D.

以下哪些是信息准则调整的目的?(选择所有适用的选项)

A. 提高模型在样本内的拟合度
B. 针对参数估计的影响调整最小化准则
C. 使参数化程度更高的模型在样本内表现看起来更好
D. 防止参数化程度更高的模型在样本内表现看起来比实际情况更好

以下关于信息准则一般形式的陈述哪些是正确的?(选择所有适用的选项)

A. 一般形式为
B. 是在非估计参数值处评估的数据似然值
C. 是关于模型大小的增函数
D. 是关于样本大小的增函数

赤池信息量准则旨在最大化候选模型密度与真实(未知)模型密度之间的Kullback-Leibler距离。

信息准则中的惩罚项对额外参数的估计进行惩罚,尤其是在大样本量的情况下。

BIC惩罚项的形式为\frac{n_{k}\ln(__)}{__}

对于具有单变量结果变量的线性回归,赤池信息准则(AIC)的形式为\operatorname{AIC}(k)=\ln\hat{\sigma}_{k}^{2}+\frac{2n_{k}}{__}

解释在模型选择中贝叶斯信息准则(BIC)和赤池信息准则(AIC)策略之间的差异。

马洛斯准则如何帮助线性回归进行模型选择?给出公式并解释其组成部分。

根据先验知识,以下哪一项是影响模型选择方法选择的关键因素?

A. 散点图中数据点的颜色
B. 潜在预测变量的数量
C. 分析报告中文字的字体大小
D. 进行分析的时间

根据先验知识,以下哪些是样本内模型选择方法?(选择所有适用的选项)

A. 信息准则(IC)
B. 序贯假设检验
C. 交叉验证
D. 样本外测试

根据先验知识,在线性回归中,较大的模型总是比较小的模型提供更好的样本内拟合效果。

在信息准则和回归模型的背景下,以下哪项陈述正确描述了模型复杂度与样本内拟合之间的关系?

A. 更复杂的模型总是能提供更好的样本内拟合,因为它们可以解释数据中更多的方差。
B. 更复杂的模型可能看似能提供更好的样本内拟合,但这可能是由于过拟合,这就是信息准则对模型复杂度施加惩罚的原因。
C. 信息准则不会对模型复杂度施加惩罚,因为它们只专注于最大化数据的似然性。
D. 只要预测变量具有统计显著性,模型的样本内拟合就不会受所包含预测变量数量的影响。

以下关于贝叶斯信息准则(BIC)和赤池信息准则(AIC)的陈述哪些是正确的?选择所有适用的选项。

A. BIC和AIC都会对模型复杂度进行惩罚,但惩罚形式不同。
B. BIC旨在最小化候选模型与真实模型之间的Kullback-Leibler距离,而AIC选择具有最高后验概率的模型。
C. BIC的惩罚项为,而AIC的惩罚项为
D. 与AIC相比,BIC更有可能选择更简单的模型,尤其是在小样本情况下。

马洛斯准则是对样本内期望均方误差(MSE)的估计量,用于从一组线性回归模型中选择子模型。它倾向于选择值较小的模型,且中的惩罚项随回归变量数量的增加而增大。

登录后解锁笔记、知识点解析、AI 问答

立即登录