正在学习
10.3 确定公因数的个数
10.3 确定共同因子的个数
在使用共同因子进行预测时,一个关键问题是在模型中应包含多少个因子。在构建预测模型时需要考虑两个独立的问题:第一,需要多少个因子才能通过(10.7)式和(10.12)式中的动态刻画 变量的变化;第二,在如(10.13)式的预测模型中应包含多少个因子。
首先考虑第一个问题——应选择多少个因子来用一组较小的因子替代高维的 。设因子的个数为 ,考虑如下静态因子表示:
通过考察样本相关矩阵 的特征值,提供了一种初步的非正式方法来选择因子的个数 。设 为协方差矩阵按降序排列的第 个特征值,则前 个共同因子所解释的 总方差的比例为 。因此,特征值超过 1 的因子所贡献的解释力高于平均水平。接近于 0 的特征值表明其所对应的因子所能解释的变异非常小。在任何样本中,排序后的特征值通常会逐渐趋近于 0,且在那些在极限下非零的特征值与那些可能为零的特征值之间,并不存在明显的"分离"。这与通常的模型选择问题完全类似——在样本中,真正非零的系数和真正为零的系数并不会自我显现。在任何样本中,可能并不存在一个明显的阈值或临界点来确定 的最优值。与一般的模型选择问题相对应,针对这一问题已经发展出正式的方法。
要一致地估计 ,正式的方法需要对 的方差-协方差矩阵的特征值做出假设。当 变得很大时,要使 个因子能够继续解释 中大部分的变异,需要第 大的特征值发散到无穷大。这确保了第 大的特征值与其余特征值分离开来(关于 的渐近性)。因此,一致地选择正确因子个数的方法便成为可能。同样需要指出的是,这与第 6 章中所述的一般一致模型选择程序类似——在那里非零参数和零参数的估计会渐近地分离得很远,从而使 BIC 等一致模型选择程序能够选出正确的模型。
不同估计程序之间的差异反映了关于第 大特征值发散速度的假设。其余差异主要集中于特质成分 的精确相关结构上,特别是是否允许时间和截面相依性的存在。
Bai 和 Ng(2002)在近似因子模型的背景下发展了一致选择因子个数的方法。他们的分析允许 中存在时间序列和截面的异方差性以及弱相依性。Bai 和 Ng(2002)刻画了一类选择准则能够一致地识别正确因子个数 的条件。设 是通过主成分法得到的 个因子构成的矩阵,则对应模型的残差平方和为
Bai 和 Ng 提出的三个信息准则具有如下形式:
在每种情况下,第一项是对拟合优度的度量,而第二项是惩罚项,它随着 和因子个数 的增加而增加。可以尝试不同的 的值,使(10.24)式达到最小值的 即为所选择的因子个数。(10.24)式中的惩罚项同时依赖于 和 。仅依赖于 或 的传统准则通常会选取过多的因子。Bai 和 Ng 建立了这些准则一致的条件,即当 和 同时趋于无穷大时,所选出的因子个数 趋近于真实的因子个数 。对于较小的 或 ,Bai 和 Ng 报告称(10.24)式中提出的准则无法选出正确的因子个数;而对于 的情形,在一系列蒙特卡洛模拟中发现这些准则表现良好。
在关于第 r 大特征值发散速度的较弱假设下,也可以得到相应的结果。在较弱的假设下,特征值的分离并不那么明显,即使在渐近意义上也是如此;较小的特征值收敛于某一分布,因此第 r 大特征值与其余特征值之间的分离程度不够清晰。该分析旨在为特征值的经验样本分布提供更好的渐近近似,如上所述,该分布通常并不会表现出如此大的分离程度。在这个方向上采用较弱假设的同时,往往需要对 的相关结构施加更强的假设,尽管蒙特卡洛证据表明,对合理的模型而言,误设误差假设的影响较小。
Onatski(2010)提出了一种基于这些关于特征值发散速度的较弱假设的方法。在较弱假设下,可以确定小于第 r 大特征值的那些特征值的分布,并将该分布的最大值点用作截断值。该方法包括估计该截断值,然后估计因子个数,使因子个数等于高于截断值的特征值数量。在我们的记号下,Onatski(2010)方法估计该截断值的步骤如下:
步骤 1:计算 的 N 个特征值,记为 ,按降序排列。设 为所要考虑的最大因子数,并令 。
步骤 2:运行 对 的回归,并令 等于该回归系数绝对值的 2 倍。
步骤 3:计算 。若 ,则令 。
步骤 4:令 ,并重复步骤(2)和(3),直至收敛。
其中, 设定为所要考虑的最大因子数。
从技术上看, 应被选为关于 N 的一个序列,使得当 时,,尽管速度条件对具体应用没有提供特别的指导。这在依赖于像一致性这样弱的概念时是标准的做法,类似于第 6 章中讨论的基于信息准则的一致模型选择。
一如既往地,简约性与模型拟合之间存在权衡。如果在预测方程中纳入过多的因子,很可能会对参数估计的精度产生不利影响。相反,纳入过少的因子意味着可能未使用到相关信息,从而导致效率的损失。
练习题
在使用样本相关矩阵的特征值选择因子数量时,以下哪个陈述是正确的?
以下哪一项是对因子数量进行一致估计的要求?
Bai和Ng(2002年)为一致地选择因子数量做出了以下哪些假设?
以下关于一般预测方程的陈述哪些是正确的?
在Forni等人(2000年)的模型中,特质性成分可能存在横截面相关性。
Forni等人(2000年)提出的利用双侧滤波器估计因子方法非常适用于预测。
由前个公共因子所解释的的总方差的比例由\frac{\sum_{i=1}^{r} \mu_i}{___}给出。
在Bai和Ng(2002)的方法中,具有个因子的模型的残差平方和表示为。矩阵包含估计的___。
解释特征值在确定因子模型中因子数量时所起的作用。
Forni等人(2000年)的模型中关于特异性和公共成分特征值的关键假设是什么?
登录后解锁笔记、知识点解析、AI 问答
立即登录