正在学习
6.11.2 赤池信息准则
6.11.2 赤池信息量准则
模型选择的另一种方法是考虑真实模型与某个近似类中模型之间距离的度量。一种这样的距离度量是 Kullback–Leibler 距离或熵。对于真实密度 和近似密度 ,其定义如下:
其中 表示在真实概率下的期望值。由于第一项在所有模型之间是常数,仅取决于真实模型,因此使 (6.53) 中真实模型与近似模型之间的距离最小化等价于使第二项尽可能大。该距离可以证明是非负的,并且仅在 时(几乎必然地)为零。不幸的是,真实密度是未知的,因此我们需要找到一种方法使这一思想可操作,同时不大幅简化问题。
一种方法是认为所有模型都是误设定的,因为相对于某个具有参数 的未知真实模型而言,它们是欠参数化的。对于每个模型, 是 的一个子集,即模型 的参数少于 的参数,。考虑 的最大似然估计,将它们堆叠成一个 向量 ,其中被省略的变量处为 0,其他地方为 1。同样,我们可以通过在 MLE 值处评估的、围绕 的二阶展开来近似对数密度:
乘以 :
忽略与 无关的项,基于 MLE 值的 的近似变为
不失一般性,假设 中的系数出现在 的前 k 行。将 (连同信息矩阵一起)按估计参数的维度进行划分,并相应地划分信息矩阵。于是我们有¹⁷
该表达式将问题分解为两部分,即引入方差项的估计部分,以及涉及被省略的真实模型参数的平方偏差项。处理方差项相对简单。该项经信息矩阵适当缩放后类似于 Wald 统计量:
该项的期望值近似为 。
平方偏差项仅是一个非随机数,取决于被省略系数 的大小。Akaike 的方法是注意到该项类似于似然比检验 ,用于检验在备择假设下被省略项是否为 0,其中 是基于完整模型的似然函数,因此在不同模型 k 之间是不变的。该检验类似于在零约束下估计 ,因此收敛于一个非中心 变量。在足够大的样本中,检验这些参数等于 0 的检验统计量服从 分布,其中 是非中心性参数 。现在 ,因此非中心性参数 。结合这些结果,我们得到
在最小化该准则时, 可以忽略,因为对于每个模型它都是相同的,因此 AIC 旨在最小化
最佳模型是使真实密度与模型隐含密度之间距离最小的模型,因此在所有候选模型中具有最小的 AIC(k) 值。
预测方法
练习题
两个概率密度和之间的Kullback-Leibler(KL)距离是什么?
以下关于Kullback-Leibler距离(KL距离)的陈述中,哪一个是正确的?
库尔贝克-莱布勒距离(Kullback-Leibler距离)具有哪些性质?(选择所有适用的选项)
当Kullback-Leibler距离定义中的第二项达到最大值时,Kullback-Leibler距离最小。
对数密度可以通过在最大似然估计(MLE)值处对进行二阶展开来近似。近似式为。项被称为什么?
解释为什么Kullback-Leibler距离在模型选择中很有用。
在模型设定错误的情况下,相对于模型,模型参数不足是什么意思?
以下关于对数密度近似的陈述中哪些是正确的?(选择所有适用的选项)
信息矩阵的分块形式使我们能够分离出估计参数和省略参数对KL距离的贡献。
表达式类似于一个___。
在KL距离近似中,平方偏差项的作用是什么,它与似然比检验有何关系?
在KL距离的情境下,以下哪些是模型误设的影响?(选择所有适用的选项)
以下哪项陈述正确描述了Kullback–Leibler距离与真实密度和近似密度之间的关系?
关于对数密度近似及其对模型选择的影响,以下哪些说法是正确的?(选择所有适用的选项)
当近似密度 几乎必然等于真实密度 时,Kullback–Leibler 距离达到最小。
在对数密度近似中,方差项的期望值(经信息矩阵适当缩放后)约为___。
登录后解锁笔记、知识点解析、AI 问答
立即登录