正在学习
6.2 序贯假设检验
6.2 序贯假设检验
序贯假设检验或许是构建预测模型最自然的方法,它描述了——至少是非正式地——许多研究者构建其模型的过程。作为一种模型选择技术,该方法通过一系列设定检验来从一组较大的可用模型中选择"最佳"子模型,这些检验试图识别模型的相关部分并排除其余部分。一种策略是从模型中移除那些在与不包含这些变量的较小模型进行检验时被发现无用的变量(或项)。为此已提出了大量方法。例如,可以使用 t 检验、F 检验或 p 值来排除冗余项。也可以考虑变量检验顺序的不同安排——前向逐步和后向逐步是最常见的。最后,可以对被省略项进行不同的交叉检验,以混合前向和后向逐步方法。
序贯检验文献中的两种主要方法是"从一般到特殊"和"从特殊到一般"的方法。"从一般到特殊"方法在初始模型中包含所有潜在变量,然后通过一系列检验移除被认为无用的变量。"从特殊到一般"方法则从一个小的基线模型开始,该模型例如包括被认为预测效果良好的主要变量或仅仅一个常数,然后在变量似乎能改善预测模型时添加更多变量。最终选定的模型通常将取决于检验的顺序。
例 6.2.1(从一般到特殊的建模方法)。 作为"从一般到特殊"方法的说明,考虑一个具有 个潜在预测变量 的线性预测模型。假设最初使用最小二乘法来估计包含所有预测变量的"厨房水槽"模型:
我们可以采用一种单向的后向逐步方法,根据其系数在式 (6.5) 中的 t 统计量(或等价地,根据这些系数估计值的 p 值)来对预测变量进行排序。假设所有变量中 t 统计量的最小绝对值低于某个阈值 ,例如 :
那么 t 统计量最小(或 p 值最大)的变量将从模型中剔除。为简单起见,假设被剔除的变量是 ,则包含其余 个变量的精简模型接下来被重新估计:
再次计算该模型中所有剩余回归元的 t 统计量,检查 ,如果满足此条件,则剔除 t 统计量最小的变量。重复此过程,直到模型中所有变量的 t 统计量都超过 ,或达到某个最大迭代次数 。
对于后向逐步(从一般到特殊)方法,预测值采用如下形式(假设始终包含常数项):
其中 是 在第 轮变量选择中的 t 统计量,,。这里 决定第 个变量是否在 步中的任何一步被剔除。指示变量 等于 1 表示第 个变量被包含在最终模型中。一个变量是否被排除不仅取决于其自身的 t 统计量,还取决于所有其他当前包含的变量的 t 统计量。这意味着 取决于 t 统计量(绝对值)的整个序列,不仅包括第 个变量本身,还包括所有其他变量。例如,即使某个变量在给定轮次中的检验统计量低于阈值,但如果另一个同时包含的变量的检验统计量更低,则该变量可能在该轮次中不被排除。这种路径依赖性使得为序贯模型选择方法建立解析结果变得困难。
所谓"LSE"从一般到特定的建模方法从一个一般模型开始,并在检验序列中加入对模型"协合性"的检验。这可以包括对模型残差的正态性、自相关和条件异方差的检验,但也可能涉及(样本外)模型稳定性检验;参见 Hoover 和 Perez(1999)中的讨论。如果剔除某个不显著的预测变量会导致模型无法通过一项或多项诊断检验,则该变量将被保留在模型中。其目标是确保相对于搜索中所考虑的基础变量集合,模型残差是鞅差序列。第二个目标是获得一个不被任何竞争设定所涵盖的模型,即没有任何其他模型能在所选模型之外增加预测内容。Hendry(1995)对这些问题以及相关文献进行了详细讨论。
从特定到一般的方法通常从一个仅包含截距项的简单模型开始:
在单向逐步向前方法中,接下来分别考虑 K 个单变量模型:
假设这些 t 统计量中绝对值最大者超过某一阈值 :
则与此 t 统计量相对应的变量被纳入模型中。接下来,将剩余变量库中的回归变量逐一加入到这个单变量模型中。一旦某个新加入回归变量的 t 统计量超过 ,则将其纳入预测模型。该过程持续进行,直到所有剩余排除变量的 t 统计量都低于临界值 ,或直到超过最大迭代次数为止。
逐步向前方法的预测形式与式 (6.8) 相同,唯一的区别在于如何构造纳入指示变量 。
存在多种序贯检验的变体。在每一步中可以考虑变量组而非单个变量,使用 F 检验而非 t 检验来评估统计显著性。在回归变量强相关的情况下,这类检验可能较为适用。也可以采用向前和向后步骤相结合的双向混合方法。回归变量之间的相关性意味着在向前步骤中纳入新变量可能导致扩展模型中某些原本显著的变量变得不再显著。这些变量可以在向后步骤中被剔除。然而,这类过程的收敛性无法保证。
序贯方法的主要优点在于其直观性:方法简单且在计算上易于实现——特别是当变量被逐一考虑纳入或剔除时。然而,该方法并未对所有可能的模型进行全面搜索,其结果可能具有路径依赖性,因此该方法存在一个缺陷:无法保证找到全局最优模型,即可行模型集合中的最佳模型。
序贯变量选择方法的性质已在多项研究中得到讨论。Hoover 和 Perez(1999)对从一般到特定的方法进行了详尽的模拟研究。他们发现,该方法经常最终得到过参数化模型,其中包含在某种意义上虚假显著的变量,即这些变量并不属于真实模型。不显著的变量有时被保留下来以使模型能够通过残差设定检验。有趣的是,他们的模拟表明,通过提高变量纳入的门槛,即在纳入检验中使用更小的名义显著性水平(或更高的临界值),可以在一定程度上缓解这些问题。
练习题
在序贯假设检验中,从模型中移除变量的主要目标是什么?
以下哪项是在序列假设检验中用于排除冗余项的常用方法?
以下哪些被视为顺序假设检验中变量检验的常见顺序?(选择所有适用项)
在从一般到具体的建模方法中,初始模型包含所有潜在变量。
从特殊到一般的建模方法始于一个包含所有潜在预测变量的模型。
在向后逐步剔除法中,如果t统计量的绝对值最小的变量低于某个阈值(例如___),则剔除该变量。
解释在序贯假设检验中向后逐步剔除的过程。
在序贯假设检验中,最终选择的模型可能取决于什么?
在序贯假设检验中,哪些因素会影响模型选择的方法?(选择所有适用的选项)
在模型选择中,从一般到特殊的方法与从特殊到一般的方法有何不同?
以下哪些被视为样本内模型选择方法?(选择所有适用项)
在回归模型中纳入额外变量可能存在什么潜在风险?
登录后解锁笔记、知识点解析、AI 问答
立即登录