正在学习

21.1 计数数据预测

21.1 计数数据的预测

我们经常对取值限定为整数的变量预测结果感兴趣。例如, 的支撑集可以为 ,其中 可以是无穷大。在这种情况下,似乎应该同时在损失函数的导出和预测模型的构建中考虑这一支撑集。似乎几乎所有的预测问题都符合这种情况;例如,预测经济中新增的就业岗位数量就符合这种情况,因为就业岗位的数量是自然数。预测 GDP 水平时也是如此,因为 GDP 通常四舍五入到百万美元,而且无论如何不可能有小数位的分。然而,对于 较大的情况,"计数数据"的性质可以适当地忽略,因为考虑这一性质会显著增加预测过程的复杂性,却无法带来预测精度上的提升或对问题的更深理解。因此,计数数据的应用实际上指的是 相当小的情况,通常不超过 5 或 10。例子包括预测家庭规模、家庭拥有汽车或电脑的数量,或私人投资者持有的个股数量。

关于计数数据问题的损失函数研究似乎非常少。几乎所有的点预测方法都围绕条件均值的估计展开,隐含地假设了平方误差损失函数。

21.1.1 计数数据的参数模型

对计数数据进行建模的参数方法选择支撑集仅包含非负整数的分布。该文献中最常用的参数模型是泊松模型。泊松(), 模型的支撑集为 ,因此 是无穷大,分配概率为 。泊松分布的均值和方差都等于 ,并且该分布的所有矩都存在。

更一般地,在回归设定中,我们可以允许泊松参数 是条件变量的函数,,同样要求 为正。建模 的标准方法是使用线性指数,

假设参数模型设定正确,可以使用最大似然程序进行估计。针对其他估计量的结果也是可用的。这些模型的估计文献既专业又冗长;Cameron 和 Trivedi (1998) 提供了一个优秀的综述。

(21.1) 形式的模型可以在 中包含计数 的滞后项。在泊松模型中,这也会使结果的方差依赖于计数的滞后项。或者,一大类动态模型旨在推广自回归模型。McKenzie (2003) 对此类模型提供了广泛的综述。

用于建模和预测计数数据的自回归设定的一个流行推广是由 Al-Osh 和 Alzaid (1987) 提出的 阶整数自回归模型,记为 。该模型最常见的版本形式为

其中 ,其中每个 项是参数为 的 Bernoulli(ai) 0-1 随机变量,且 。这种方法的思想动机来自于 始终是整数值——而不是例如包含一个具有固定系数的滞后因变量。通常, 来自一个非负的参数分布,且与 的过去值相互独立。这确保了 与模型中整数值的滞后部分相互独立,因此要求 也是整数值。再次, 最常用的设定是泊松() 分布,但也使用其他分布,如二项分布。 的分布是非负的,因此具有非零均值,这就解释了模型 (21.2) 中缺少常数项的原因。利用 的独立性,我们有 。由于 ,计数的过去值对当前计数具有阻尼效应。对于平稳模型,我们要求 。该模型有众多变体,导致不同的性质;参见 McKenzie (2003)。

INAR(1)模型的估计在有观测值的情况下相对直接。假设服从Poisson(λ)分布,参数可以通过极大似然法来估计,或者简单地通过对关于常数项和进行OLS回归来估计,其中是滞后因变量的OLS系数,然后设。使用这些代入式估计量,均值的预测值可以计算为,其中额外的项来源于的均值。另一种方法是,由于该模型是完全参数化的,我们可以直接构造预测分布(Freeland and McCabe, 2004)。这种方法通常不会得到整数值的预测,尽管可以将预测值四舍五入到最近的整数值。

通过递归代换并取期望,可以得到h步向前预测,2

其中第一项与AR(1)模型中的形式相同,第二项则是由于的均值非零而产生的。

为了直接构造预测分布,考虑具有Poisson(λ)残差的INAR(1)模型:

对每个成立。为了推导该表达式,请注意自回归成分和残差有多种组合方式可以求和得到。对于这些组合中的每一种,概率仅仅是产生该总和的二项项和Poisson项的乘积。这源于这些项的独立性。如果二项部分等于某个值,那么Poisson部分必须是,以使总总和为。代入式估计量可以用来生成估计的h步向前预测分布,并且只要这些参数是一致估计的,以此方式构造的概率也是一致的。针对这类模型的贝叶斯预测方法也已经被开发出来;参见McCabe and Martin (2005)。

参数化程度更低的方法也已被考虑。McCabe, Martin, and Harris (2011)研究了模型(21.2),但不对的分布施加限制,仅要求其支撑集为非负整数集合。相反,他们建议采用非参数极大似然方法来估计残差的分布;关于该方法的细节,请参阅他们论文的第2.3节。

练习题

以下哪项是计数数据预测的例子?

A. 预测下周的温度
B. 预测一个家庭拥有的汽车数量
C. 预测明天的汇率
D. 预测孩子明年的身高

泊松()模型的支持域是什么?

A.
B.
C.
D.

选择所有关于泊松分布的正确陈述。

A. 均值和方差都等于
B. 支撑集包含负整数。
C. 该分布的所有矩都存在。
D. 概率质量函数为

的值较大时,问题的计数数据特性可以被忽略,而不会影响预测的准确性。

在回归设定中,泊松参数可以通过建模为条件变量的函数,以确保为___。

解释为什么在几乎所有针对计数数据的点预测方法中,都隐含地假设了平方误差损失函数。

哪种模型是对计数数据自回归规范的一种流行推广?

A. 自回归综合移动平均(ARIMA)模型
B. INAR(p)模型
C. 广义自回归条件异方差(GARCH)模型
D. 移动平均(MA(q))模型

选择INAR(p)模型的所有正确属性。

A. 它确保与滞后分量独立。
B. 该模型包含一个常数项。
C. 计数变量的过去值对当前计数具有衰减效应。
D. 它要求以保证模型平稳。

INAR(p)模型总是包含一个常数项,以解释的非零均值。

描述在INAR(p)模型中使用的动机。

在预测家庭拥有汽车数量时,关于模型选择及其特性,以下哪项陈述是正确的?

A. 泊松模型不适用,因为汽车数量可能为负数。
B. INAR(p)模型适用,因为它确保结果为整数值,并能纳入计数变量的滞后项。
C. 泊松模型的回归设定无效,因为可能为负数。
D. 泊松模型仅在方差小于均值时有效。

关于泊松模型的估计及其在计数数据预测中的应用,以下哪些陈述是正确的?

A. 当正确指定时,最大似然法可用于估计泊松模型。
B. 无论数据如何,泊松模型的均值和方差总是相等的。
C. INAR(p)模型的误差项通常取自泊松分布,以确保非负性。
D. 泊松模型的回归设定用于确保为正。
E. 泊松模型仅适用于数据支撑集有限的情况。

INAR(p)模型是自回归模型的推广,它确保预测值始终为非负整数。

登录后解锁笔记、知识点解析、AI 问答

立即登录