夜雨聆风学习资料网

ARTICLE · 1101537

【统计分析软件SPSS】188、时间序列分析——使用专家建模器构建模型(操作步骤)

【统计分析软件SPSS】188、时间序列分析——使用专家建模器构建模型(操作步骤)

本系列文章(基于SPSS 31版本)配套数据可通过百度网盘获取:

链接:https://pan.baidu.com/s/1AGizNngKrzAVapWtNcc-VA?pwd=mnsj 提取码:mnsj
由于微信公众号已发布文章的内容及排版顺序无法二次编辑,为了方便大家后续查阅、检索,同时便于我对内容进行补充更新与完善,我已将所有已发布的推文,在个人网站上以结构化文档的形式重新整理、归档。欢迎前往查看:
https://www.mizhushare.com/docs/
01
应用场景

在时间序列分析领域,传统建模往往需要经历"反复试验-参数调整-模型比较"的漫长过程。但SPSS的时间序列建模器过程,特别是其中的专家建模器(Expert Modeler) 功能,让复杂的时间序列建模变得智能化和自动化。

专家建模器是SPSS时间序列建模器过程中的核心功能模块。简单来说,它是一个自动化的模型识别与估计引擎,能够:

  • 自动识别:基于数据特征,智能判断最适合的模型类型;

  • 自动估计:无需手动设定参数,自动完成模型参数估计;

  • 自动比较:在多个候选模型中,自动选择最优模型;

该功能特别适合非专业建模人员或需要快速建模的场景。

02
操作步骤
  • 一、加载并检查数据:
加载示例数据【broadband_1.sav】(软件自带样本数据)。
该数据为美国85个地区连续4年(每月)的宽带用户数。

本次将使用「专家建模器」为全部85个市场生成未来三个月的预测,并将生成的模型保存到文件中。

尽管「专家建模器」会自动为每个序列找到最佳的模型,但在构建模型之前,通过绘制序列图了解数据的性质(如,是否表现出季节性变化)仍是一个好习惯。例如,如果在数据中未发现季节性时,将模型限制为非季节性模型,通常可以获得更快的结果。

绘制序列图的相关内容可以查看以下文章:

【统计分析软件SPSS】183、时间序列分析——绘制序列图

通过绘制序列图对全部85个序列的检查,发现均显示出非常平滑的上升趋势,没有任何季节性变化的迹象。

  • 二、构建模型:

点击顶部菜单栏的【分析→时间序列预测→创建传统模型】,在打开的对话框中进行相应设置。

  • 1)、主对话框:

该对话框主要用于设置分析变量。

选项
含义
因变量

模型的因变量(即,要预测的目标变量)。

自变量

用于指定外生变量(即,可能影响因变量的其他变量)。在本例中,仅对每个市场单独建模,因此该框为空。

方法

选择建模方法,包括:

  • 专家建模器:专家建模器会自动为每个因变量序列找到最佳拟合模型。如果指定了自变量,专家建模器会选择那些与因变量序列具有统计学显著关系的变量,并将其包含在ARIMA模型中。在适当的情况下,模型变量会使用差分/平方根/自然对数转换进行转换。默认情况下,专家建模器会同时考虑指数平滑模型和ARIMA模型。但是,可以将专家建模器限制为仅搜索ARIMA模型或仅搜索指数平滑模型。

  • 指数平滑:指定自定义的指数平滑模型。可以从多种指数平滑模型中进行选择,它们在处理趋势和季节性方面有所不同。

  • ARIMA:指定自定义的ARIMA模型。涉及显式指定自回归阶数、移动平均阶数以及差分阶数。可以包含自变量并为其中任何一个或全部定义转换函数。

条件

用于配置专家建模器(详见第二部分:条件对话框)。

估算期

估算期定义了用于确定模型的个案集。默认情况下,估算期包含活动数据集中的所有个案。可以通过「选择个案」功能中「基于时间或个案范围」选项设置自定义估算期。

预测期

预测期从估计周期后的第一个个案开始,默认情况下,一直持续到活动数据集中的最后一个个案。可以通过「选项」选项卡设置预测周期的结束时间。

本次选择「市场1的订阅用户」至「市场85的订阅用户」之间的全部变量作为因变量。在「方法」下拉列表中选择「专家建模器」。

  • 2)、条件选项卡:

点击「条件」按钮即可打开条件选项卡,主要用于配置建模方法(本次示例用于配置专家建模器)。包含以下两个子选项卡:

①、模型选项卡:

主要用于约束模型的选择范围,以及引入外部事件变量以提高模型准确性。

选项
含义

模型类型

提供以下选项:

  • 所有模型:专家建模器同时考虑ARIMA和指数平滑模型。

  • 仅限指数平滑模型:专家建模器仅考虑指数平滑模型。

  • 仅限 ARIMA 模型:专家建模器仅考虑 ARIMA 模型。

  • 专家建模器考虑季节性模型:仅当活动数据集已定义周期性时,该选项才启用。选中该选项时,专家建模器会同时考虑季节性和非季节性模型。未选中时,专家建模器仅考虑非季节性模型。

事件

选择要作为事件变量处理的自变量。事件变量规则如下:

  • 值为 1 的个案表示因变量受该事件影响的时间点;

  • 非 1 的值表示无影响。

本次示例中,在「模型类型」组中取消勾选「专家建模器考虑季节性模型」。这是因为,数据虽然是按月统计且当前周期为12,但前面通过序列图发现数据没有任何季节性特征,因此无需考虑季节性模型,这将缩小专家建模器搜索的模型范围,并显著减少计算时间。

②、离群值选项卡:

用于定义如何检测和处理数据中的离群值。在时间序列分析中,正确处理这些异常值对于提高预测准确性非常重要。

选中「自动检测离群值」选项以执行离群值自动检测,然后需要在「要检测的离群值类型」组中选择一种或多种离群值类型。

本次不执行离群值的自动检测。

  • 3)、统计选项卡:

统计选项卡提供了用于显示模型结果表格的选项。
选项
含义
按模型显示拟合测量、杨-博克斯统计和离群值数目

勾选后表示将为每个模型生成以下统计信息:

  • 拟合优度指标(如 R²、MAPE 等);

  • 杨-博克斯检验(Ljung-Box Q 统计量),用于检验残差的独立性;

  • 离群值数量,标识数据中异常点的数量。

拟合测量

衡量模型对历史数据拟合程度的指标,包括:

  • 平稳R方:表示模型对差分后时间序列的解释能力。

  • R方:表示模型对原始时间序列的解释能力。

  • 均方根误差:RMSE,表示预测值与实际值之间差异的平方平均值的平方根。单位与原始数据相同,数值越小,预测精度越高。

  • 平均绝对误差百分比:MAPE,误差占实际值的百分比平均值,常用于评估预测精度(越小越好)。

  • 平均绝对误差:MAE,预测误差的绝对值的平均,对异常值不敏感。

  • 最大绝对误差百分比:MaxAPE,单个最大预测误差的百分比,反映最坏情况下的偏差。

  • 最大绝对误差:最大的单一预测误差(绝对值),关注极端误差。

  • 正态化BIC:贝叶斯信息准则(BIC)的归一化版本,用于在不同样本大小下比较模型复杂度与拟合优度。

用于比较模型的统计

控制所有估计模型计算出的统计量表格的显示:

  • 拟合优度:汇总统计量表和百分位数表,涵盖平稳R 方、R方、均方根误差、平均绝对百分比误差、平均绝对误差、最大绝对百分比误差、最大绝对误差以及标准化贝叶斯信息准则。

  • 残差自相关函数 (ACF):显示所有估计模型残差自相关的汇总统计量和百分位数。

  • 残差偏自相关函数 (PACF):显示所有估计模型残差偏自相关的汇总统计量和百分位数。

单个模型的统计

控制每个估计模型详细信息的表格显示。每个选项都会生成一个独立的表格:

  • 参数估算值:为每个估计模型显示一个参数估计值表格。指数平滑模型和ARIMA模型将分别显示在不同的表格中。如果存在离群值,其参数估计值也会在单独的表格中显示。

  • 残差自相关函数 (ACF):为每个估计模型显示按滞后阶数排列的残差自相关表格。表格中包含自相关的置信区间。

  • 残差偏自相关函数 (PACF):为每个估计模型显示按滞后阶数排列的残差偏自相关表格。表格中包含偏自相关的置信区间。

显示预测值

为每个估计模型显示模型预测值和置信区间的表格。预测周期在「选项」选项卡中设置。

本次在「拟合测量」组中,选择「平稳R方」。在「用于比较模型的统计」组中,选择「拟合优度」。
勾选「显示预测值」,该选项将为每个因变量序列生成一个包含预测值的表格,提供了另一种获取这些值的方式(而不必作为新变量保存)。
  • 4)、图选项卡:

图表选项卡提供了用于显示模型结果图表的选项。

选项
含义

用于比较模型的图

该组选项控制着包含所有估计模型计算出的统计量的图表显示。每个选项都会生成一个独立的图表。各选项的含义详见「统计」选项卡部分。

单个模型的图

  • 序列:选中该选项可获取每个估计模型的预测值图表。可以选择以下一个或多个元素包含在图表中。

    ①实测值:因变量序列的观测值。

    ②预测值:预测期内的模型预测值。

    ③拟合值:估计期内的模型预测值。

    ④预测值的置信区间:预测期的置信区间。

    ⑤拟合值的置信区间:估计期的置信区间。

  • 残差自相关函数 (ACF):为每个估计模型显示残差自相关的图表。

  • 残差偏自相关函数 (PACF):为每个估计模型显示残差偏自相关的图表。

本次在「用于比较模型的图」组中,勾选「平均绝对误差百分比」和「最大绝对误差百分比」,绝对误差百分比衡量了因变量序列与其模型预测水平的偏离程度,通过检查所有模型的平均值和最大值,可以了解预测中的不确定性。再者,因为因变量序列代表了不同规模市场的用户数量,因此建议查看百分比误差的汇总图表,而不是绝对误差。

在「单个模型的图」组中,取消勾选「序列」,因为我们更感兴趣的是将预测结果作为新变量保存,而不是生成预测图。

  • 5)、输出过滤选项卡:

输出过滤器选项卡提供了将表格和图表输出限制为已估计模型子集的选项。默认情况下,所有估计的模型都会包含在输出中。

当需要处理大量时间序列(比如几百个产品销量)时,可以根据提供的拟合标准,选择仅输出拟合最好和(或)拟合最差的模型,避免被海量数据淹没。

选项
含义
最佳拟合模型

选中该选项可将拟合最好的模型包含在输出中。

  • 固定数量的模型:指定为拟合最好的n个模型显示结果。如果该数量超过估计的模型总数,则显示所有模型。

  • 模型总数的百分比:指定为在所有估计模型中拟合优度值位于前n%的模型显示结果。

最差拟合模型

选中该选项可将拟合最差的模型包含在输出中。

  • 固定数量的模型:指定为拟合最差的n个模型显示结果。如果该数量超过估计的模型总数,则显示所有模型。

  • 模型总数的百分比:指定为在所有估计模型中拟合优度值位于后n%的模型显示结果。

拟合优度量

选择用于过滤模型的拟合优度量。默认值为平稳R方。

本次保持默认,即在输出中包括所有模型。
  • 6)、保存选项卡:

通过保存选项卡可以将模型预测作为新变量保存到活动数据集中,并将模型保存到外部文件中。
选项
含义

保存变量

可以将模型预测、置信区间和残差作为新变量保存到活动数据集中。每个因变量序列都会生成一组新变量,每个新变量都包含估计期和预测期的值。如果预测期超出了因变量序列的长度,系统会自动添加新个案。可指定用于新变量名的前缀,或者使用默认前缀。

  • 预测值:模型的预测值。

  • 下限置信区间:预测值的下限置信区间。

  • 上限置信区间:预测值的上限置信区间。

  • 噪声残差:模型的残差。当对因变量执行了转换(例如自然对数)时,这些残差对应的是转换后序列的残差。

导出模型文件

将模型保存到指定文件中,用于后续预测。包括XML文件和PMML 文件格式。

本次在「保存变量」组中,勾选「预测值」,后续模型预测值将作为新变量保存在活动数据集中,并使用前缀「预测」命名。在「导出模型文件」组中,将模型保存到外部XML文件中,以便在有新数据可用时,重复使用这些模型来进行预测。
  • 7)、选项选项卡:

该选项卡用于定义预测的时间范围、缺失值处理方式以及置信区间的宽度等底层逻辑。

选项
含义

预测期

定义预测的时间范围:

  • 评估期结束后的第一个个案到活动数据集的最后一个个案:当估计周期结束点早于数据集末尾,且希望生成一个保留期(Holdout Period)的预测时使用。通常用于将模型预测与实际值的子集进行比较,以验证模型准确性。

  • 评估期结束后的第一个个案到指定日期之间的个案:用于生成超出当前实际序列结束点的未来预测。此时需要在「日期」网格中为所有单元格输入值。如果未为活动数据集定义日期规格,「日期」网格将只显示一列,此时,输入数据编辑器中显示的相应个案的行号即可。

    用户缺失值

    控制用户缺失值的处理方式。

    • 视为无效:将用户缺失值视为系统缺失值处理。

    • 视为有效:将用户缺失值视为有效数据处理。

    以下规则适用于建模过程中缺失值(包括系统缺失值和被视为无效的用户缺失值)的处理:

    • 因变量:如果发生在估计周期内,包含因变量缺失值的个案仍会被纳入模型。具体的处理方式取决于估计方法。

    • 自变量(评估期):如果自变量在评估周期内存在缺失值,程序会发出警告。专家建模器涉及该自变量的模型将在不包含该变量的情况下进行估计。自定义ARIMA模型涉及该自变量的模型将不会被估计。

    • 自变量(预测期):如果任何自变量在预测周期内存在缺失值,程序会发出警告,并尽可能生成预测(直到遇到缺失值为止)。

    置信区间宽度 (%)

    为模型预测和残差自相关计算置信区间。可以指定任何小于 100 的正值。默认值为95%。

    输出中模型标识符的前缀

    在「变量」选项卡中指定的每个因变量都会产生一个独立的估计模型。模型通过由可自定义前缀和整数后缀组成的唯一名称进行区分。可以输入自定义前缀或保留默认。

    ACF和PACF 输出中显示的最大延迟数

    可以设置在自相关和偏自相关表格及图表中显示的最大滞后阶数。

    本次在「预测期」组中,选择「评估期结束后的第一个个案到指定日期之间的个案」,并在「日期」网格中输入年份2004和月份3(数据集包含从 1999年1月到2003年12月的数据。根据当前设置,预测期将为2004年1 月至2004年3月)。

    设置完成,点击确定,SPSS自动运行专家建模器。

    因为勾选了保存预测结果选项,因此可以看到在原始数据中共有85个表示模型预测结果的新变量(变量名称由默认前缀、关联的因变量名称以及模型标识符组成),分别对应于85个因变量序列。每个新变量都包含了估算期(1999年1月至2003年12月)的模型预测值,我们可以直观地看到模型对已知数值的拟合程度。

    另外,在数据集中添加了三个新个案,其中包含2004年1月至3月的预测值,以及自动生成的日期标签。

    输出结果的具体解释将在后续文章中进行介绍。

    相关学习资料