正在学习
10.4.3 缺失观测值
10.4.3 缺失观测值
不完整数据和缺失观测值是经济预测者面临的重要实际问题。在实践中遇到的典型数据集远非一个包含 个观测值的平衡面板,而是涉及样本长度不同、甚至可能以不同频率测量的变量。为了解决这个问题,Stock 和 Watson (2002b) 提出使用一种简单的期望最大化 (EM) 算法来填补缺失观测值。考虑目标函数
其中 是 的第 行, 是一个指示函数,定义如下:
Stock 和 Watson 提出了一种迭代程序,用于获得一组初始估计 以及相应的因子 。然后用这些估计来填补缺失值,即 。使用重新平衡后的数据集,从样本协方差矩阵 的最大特征值中提取一组新的因子估计 ,其中 。这些因子估计又通过对 关于更新后的因子估计进行回归来获得 的新估计,并更新缺失观测值。该过程持续进行直至收敛。详见 Stock 和 Watson (2002b, 附录 A)。
除了缺失数据点之外,离群值在处理大型数据集时也可能是一个真正的问题,因为与仅使用少量序列时相比,无法保证每个序列都具有相同的质量。在这种情况下,可以采用用估计值替换离群值的过滤器。
10.4.4 偏最小二乘
主成分方法在构造 个预测变量 的线性组合时忽略了结果变量 的信息。偏最小二乘 (PLS) 方法在构造预测变量的线性组合时考虑了这种相关性。该方法首先将每个 变量标准化为均值为零、方差为一,即 ,其中 和 分别是 的样本均值和样本标准差。然后该方法通过以下算法进行迭代,如 Hastie、Tibshirani 和 Friedman (2009, 第 81 页) 所述。首先,通过设置 来初始化算法,其中 且 。然后,对于 ,重复以下步骤:(i) 形成 变量的线性组合 ,其中 ;(ii) 将预测更新为 ,其中 ;(iii) 通过设置 使 关于 正交化,其中 。然后重复步骤 (i)。
此处 是 变量的线性组合,通常称为方向。注意偏最小二乘方法如何根据各个 变量与结果的(单变量)相关性强度对其进行加权。如果算法持续到 ,则变得类似于对全部原始预测变量进行的 OLS 回归。
尽管偏最小二乘方法明确考虑了结果与 变量线性组合之间的相关性,但在实践中,PLS 方法通常表现得类似于岭回归和主成分方法;进一步讨论参见 Hastie、Tibshirani 和 Friedman (2009)。
练习题
在用于缺失观测值的EM算法中,指示函数代表什么?
在针对缺失观测值的EM算法中,迭代过程的目的是什么?
以下哪一项用于在EM算法中提取新的因子估计值?
EM算法中对估计值和缺失观测值的更新过程会持续进行,直到估计值收敛为止。
大型数据集中的异常值可以忽略,且不会影响数据质量。
针对缺失观测的EM算法中的目标函数由给出。其中,表示矩阵的___行。
在EM算法中,缺失值使用公式进行填充。若缺失,则项等于___。
解释样本协方差矩阵在处理缺失观测值的EM算法中所起的作用。
在缺失数据的背景下,指示函数的意义是什么?
以下关于缺失观测值的EM算法的陈述中,哪些是正确的?
根据Hastie、Tibshirani和Friedman(2009)的描述,偏最小二乘(PLS)算法中涉及的关键步骤有哪些?(选择所有适用的选项)
以下哪一项最能描述偏最小二乘(PLS)方法处理结果变量与x变量线性组合之间相关性的方法?
以下关于PLS方法的陈述哪些是正确的?(选择所有适用的选项)
关于经济预测中缺失观测值和异常值的处理,以下哪些陈述是正确的?(选择所有适用的选项)
当使用期望最大化(EM)算法处理经济预测中的缺失观测值时,目标函数是针对哪些参数进行最小化的?
以下哪些步骤是使用EM算法处理缺失观测值的迭代过程的一部分?(选择所有适用的选项)
如果算法持续到,偏最小二乘(PLS)方法将与对全部原始预测变量进行的普通最小二乘(OLS)回归相似。
在EM算法中,缺失值使用公式进行填充,其中是一个指示函数,当被观测到时等于___,当缺失时等于___。
登录后解锁笔记、知识点解析、AI 问答
立即登录