正在学习
5.1 贝叶斯风险
5.1 贝叶斯风险
第3章将贝叶斯风险定义为风险以参数θ所有可能取值的先验分布π(θ)为权重的加权平均:
任何使贝叶斯风险最小化的预测 都是贝叶斯决策规则。
使用第3章引入的风险符号,我们有
因此贝叶斯风险可以写为(见(3.26))
这里我们使用贝叶斯公式 构建了参数的后验分布,其中 是边际似然。这可以视为一个先验预测分布,即不依赖于观测数据z的预测分布。
在条件 下,对预测方法 最小化(5.3)等价于最小化
其中最小化是关于 进行的,并且我们使用了损失函数不依赖于θ这一事实。这里 是Y的(后验)预测密度。最优贝叶斯点预测是相对于该后验预测密度使期望损失最小化的预测。
获得参数的后验密度 涉及模型参数的常规贝叶斯后验密度估计问题。因此,贝叶斯预测可以利用一系列成熟的方法。许多文献涵盖了这个问题的一般处理方法,并解释如何构建后验密度;例如参见Geweke (2005)。下一个例子说明了在简单情况下如何推导贝叶斯预测密度。
例5.1.1(计算独立同分布高斯序列的预测密度)。设 独立 ,其中 已知,并假设 的先验分布为 。
使用观测值 构建预测, 的后验密度为
其中 是样本均值。给定 时 的预测密度则由下式得到
其结果为
其中方差 。该分布就是贝叶斯密度预测 。
与经典情形一样,对于某些问题,预测密度可能被视为比点预测更有用的预测总结。在许多实际预测情境中,这正是大多数贝叶斯主义者所认为的预测问题的目标,因为其解具有一般性。
一旦我们获得了预测密度 ,就可以使用与经典两步法第一步等价的方法构建最佳预测,但用预测密度代替未知的条件密度。例如,在MSE损失下,最佳估计量是给定z时y的条件均值。贝叶斯对应的量是预测密度 的均值。类似地,对于lin-lin损失函数,我们可以报告预测密度的相关分位数。
例5.1.2(MSE损失下独立同分布高斯序列均值的预测)。在MSE损失下,使用例5.1.1的设定,预测变为
这是一个收缩估计量,它将样本均值 向先验均值 收缩,权重依赖于先验信息 和样本信息 。在大样本中,样本均值的权重趋近于1。对于更分散的先验(即 的较大值)也会出现类似的结果。
例5.1.3(Linex损失下独立同分布高斯序列均值的预测)。在Linex损失函数下,给定条件密度的最优预测是均值加上方差乘以 。使用(5.4)中的预测分布,这一预测为
这就是贝叶斯点预测。
例 5.1.2 和例 5.1.3 都使用相同的预测密度,在不同的损失函数下构建点预测。因此,只要提供预测密度,对于这些情形中的预测者来说就足够了。
最后,在指定用于构建预测密度的似然函数时,我们需要为 和 同时建立一个模型,其选择会影响结果。当我们对数据和真实联合密度使用相同的 时,也隐含地假设了模型是已知的。将贝叶斯方法推广以允许未知模型,通常涉及对不同模型进行平均,权重反映特定模型为"真"的后验似然。我们将在第 14 章中考察这些方法。
除了提供预测密度或贝叶斯点预测外,我们还可以通过风险函数来考察期望损失。这些对象的表达式可以通过将最优预测 代入贝叶斯风险(方程 (5.1) 和 (5.3))或依赖于 的风险函数 (5.2) 中得到。首先,考虑风险函数 。记最优预测为 ,则风险变为
给定函数 ,这简化为 的函数——正如经典情形一样。对于给定的预测 ,可以考察不同 值下的风险函数,以考虑相关的风险。
例 5.1.4(续:在均方误差损失下预测独立同分布高斯序列的均值)。对于本例,,因此我们需要计算
我们知道条件密度为 。对其积分,我们得到 ,即方差加上偏差的平方。这里 是 的函数,因为它依赖于 。对 积分,我们有
其中 。这个风险函数展示了使用信息先验与使用样本均值之间的权衡。通过令 得到样本均值,此时 ,对应于平坦先验。由上式,我们有 。由于 ,先验降低了方差分量,但增加了一个平方偏差分量 。当先验均值 足够接近真值 时,这将降低风险。然而,对于更远的值,平方偏差项可能大于使用最小二乘预测所带来的估计风险。
即使在最简单的情况下,这个例子再次表明不存在对所有模型都是最优的单一方法。先验的不同选择导致不同的估计量和不同的风险函数,但没有一种方法能一致地优于其他方法。
为了将作为 函数的风险简化为一个数值,从而得到一个允许我们对不同方法进行排序的度量,我们需要对 所有可能取值进行加权。这要求关于 的一个分布。使用先验分布 ,我们有
由于 是选择用来最小化这个加权平均风险的,显然贝叶斯方法既最小化了这种加权的风险,又提供了一种推导最佳预测规则的构造性方法。事实上,在对参数的任意加权下,为与该加权相同的先验构建的贝叶斯规则提供了最优的预测方法。如果经典方法等价于某个贝叶斯规则,它们也可以是最优的。
例 5.1.5(续:在均方误差损失下预测独立同分布高斯序列的均值)。使用先验密度 ,我们有
对于 的任何取值,。等号在 时成立
练习题
风险的表达式是什么?
贝叶斯风险的替代表达式是什么?
关于使用贝叶斯规则的参数后验分布,以下哪些陈述是正确的?
在给定的条件下,以下哪些步骤是使贝叶斯风险关于预测方法最小化的步骤?
的后验预测密度由给出。
最优贝叶斯点预测使相对于先验预测密度的期望损失最小化。
在独立同分布高斯序列示例中,给定时的预测密度为,其中且。预测密度的方差为___。
在独立同分布的高斯序列示例中,样本均值由___给出。
解释损失函数在构建预测密度时所起的作用。
在独立同分布的高斯序列示例中,均方误差(MSE)损失下的最优贝叶斯点预测是什么?
以下关于贝叶斯预测中的预测密度的陈述哪些是正确的?(选择所有适用的选项)
以下哪些是在贝叶斯预测中指定联合密度时存在的困难?(选择所有适用的选项)
登录后解锁笔记、知识点解析、AI 问答
立即登录