正在学习

12.3 构建二元结果的点预测

12.3 二元结果点预测的构建

涉及点预测的估计问题通常要求预测具有与结果相同的支撑集。对于二元变量 ,这意味着预测 预测 −1 或 1,而对于 两个值为 {0, 1}。这使得建立预测问题非常简单。损失函数只需涵盖四种可能情况——两种预测正确和两种预测错误。正如我们在 12.1 节中看到的,这允许一个通用设定,其中损失函数的全体可以很容易地刻画。只有这种形式的损失函数才具有第 2 章中讨论的性质。例如,当 时,MSE 和 MAE 损失是适用的。

具有二元结果的效用函数使估计变得复杂,因为它们在预测中是不连续的。预测问题简化为找到一个函数,告诉我们对于哪些 值有 。这再次揭示了密度预测与点预测之间的直接关系,因为 的估计就是一种密度预测。这种关系激发了最常见的方法,我们将在下面描述。

12.3.1 通过 进行预测

密度预测 的估计与方程 (12.2) 的形式表明,可以通过以下指标变量选择预测模型来构建 的预测:

这是一种间接方法,因为 是基于 MSE 或对数得分等损失函数估计的,而不是基于 (12.1) 中的损失函数。因此,无法保证所估计的系数是最优选择的。

文献中有很多这种方法的例子。Dimitras、Zanakis 和 Zopounidis(1996)综述了企业破产预测模型,发现在所调查的 66 项研究中有 17 项采用了这种方法。Boyes、Hoffman 和 Low(1989)使用 logit 模型预测信用违约,而 Leung、Daouk 和 Chen(2000)同时使用 probit 和 logit 模型预测股市方向。Martin(1977)和 Ohlson(1980)使用这种方法预测企业破产。在这些研究中,超过该概率阈值即预测为 1 的选择往往是任意的。Leung、Daouk 和 Chen(2000)以及 Qi 和 Yang(2003)都选择 0.5 作为他们的阈值,而 Boyes、Hoffman 和 Low(1989)则建议采用基于损失的阈值。

12.3.2 判别分析

判别分析方法在统计学和经济学以外的应用领域中很流行,可以追溯到 Fisher(1936)的工作。这些方法将协变量 的联合分布分成两个不同的组,一组对应 ,另一组对应 ,源于在这两个协变量总体之间进行假设检验的考虑。通过对总体联合密度进行参数化建模,我们可以计算任何后续观测到的协变量集合是由与 组相关联的密度生成还是由另一组生成的可能性。两组之间的似然比检验产生了如下预测规则:如果在 处针对 组计算的似然值超过另一组的似然值,则预测 。如果 服从联合正态分布且各组具有相同的协方差矩阵,则预测规则在观测到的 变量中是线性的,因此导致基于线性"得分"的决策,而这些得分与基于潜在似然值的决策一一对应。与对两个似然值进行同等加权不同,可以将其中一个加权得更高,从而产生一种改变误报和漏报之间平衡的程序。损失函数可以通过这些权重对决策施加影响。

判别分析经常因对协变量联合正态性的参数假设而受到批评。然而,这实际上等同于选择条件概率的参数模型,通过与 logit 模型的关系可以清楚地看出这一点。Amemiya(1985,第 9.2.8 节)证明,在 给定下 服从正态分布的条件下,判别分析等价于使用一个将 协变量线性以及二次包含在内的 logit 模型。在各组方差-协方差矩阵相同的假设下,二次项将被剔除。当各组方差相同时,基于线性指数的 logit 设定与判别分析方法之间存在一一对应(总体)关系。Dimitras、Zanakis 和 Zopounidis(1996)注意到了使用这两种方法进行预测的相似性,差异源于未知参数权重估计方法的不同。

练习题

对于二元变量的预测,所需的支撑集是什么?

A.
B.
C.
D.

时,适用哪种损失函数?

A. 交叉熵损失
B. 平均绝对误差(MAE)
C. 均方误差(MSE)
D. B和C均正确

以下关于具有二元结果的效用函数的陈述中,哪些是正确的?

A. 它们在预测中是连续的。
B. 它们在预测中是不连续的。
C. 预测问题涉及寻找
D. 预测问题涉及寻找

二元结果的预测问题与密度预测直接相关,因为对的估计就是一种密度预测。

对于的预测,可以使用指示变量来构建。代表什么?

解释为什么基于均方误差(MSE)或对数得分等损失函数来估计的方法被认为是间接的。

以下哪项研究在预测中使用了0.5的临界概率?

A. Boyes、Hoffman和Low(1989年)
B. Leung、Daouk和Chen(2000年)
C. Martin(1977年)
D. Ohlson(1980年)

以下关于判别分析方法的说法哪些是正确的?

A. 它们在经济学中很流行。
B. 它们可追溯至费希尔(Fisher,1936年)的研究。
C. 它们将协变量的联合分布分为两组。
D. 它们仅用于连续结果。

判别分析得出的预测规则是:若在处对该组评估的似然性小于另一组的似然性,则

如果在各组中具有共同的协方差矩阵且服从联合正态分布,则预测规则对于观测到的___是线性的。

在判别分析中,如何改变假阳性和假阴性预测之间的平衡?

判别分析常见的批评是什么?

A. 计算量太大。
B. 它假设协变量服从联合正态分布。
C. 它不能处理二元结果。
D. 它需要大样本量。

在给定的条件下服从正态分布时,关于判别分析和逻辑斯谛模型,以下哪些陈述是正确的?

A. 判别分析等价于使用具有线性协变量的逻辑斯谛模型。
B. 判别分析等价于使用具有二次协变量的逻辑斯谛模型。
C. 如果方差-协方差矩阵相同,则二次项消失。
D. 当组间方差相同时,逻辑斯谛模型和判别分析之间存在一一对应关系。

对于二元结果的密度预测和点预测之间的关系,以下哪些说法是正确的?

A. 密度预测与点预测无关。
B. 的估计值是一个密度预测。
C. 密度预测和点预测呈负相关。
D. 预测问题涉及寻找

关于二元结果的密度预测和点预测之间的关系,以下哪些陈述是正确的?

A. 密度预测与点预测无关。
B. 的估计是一个密度预测。
C. 预测问题简化为找到一个函数,该函数告诉我们对于哪些值,我们有
D. 密度预测和点预测之间的关系是间接的。

解释逻辑模型(logit模型)的设定是如何推导出来的,以及它与条件概率的关系。

登录后解锁笔记、知识点解析、AI 问答

立即登录