乐于分享
好东西不私藏

【统计分析软件SPSS】134、进行步进线性回归分析——结果解读3

【统计分析软件SPSS】134、进行步进线性回归分析——结果解读3
本系列(基于SPSS 31版本)文章配套数据可通过百度网盘获取:
链接:https://pan.baidu.com/s/15r0rLWkJlcecUvBPKZo_MQ?pwd=mnsj 提取码:mnsj
由于微信公众号已发布文章的内容及排版顺序无法二次编辑,为了方便大家后续查阅、检索,同时便于我对内容进行补充更新与完善,我会将所有已发布的推文,在个人网站上以结构化文档的形式重新整理、归档。欢迎前往查看:
https://www.mizhushare.com/docs/
01
背景
在实证研究中,步进线性回归是一种常用的变量筛选方法。它能自动从一堆候选变量中挑出“最有用”的预测因子,但其不是一键出结果的黑箱,而是一个需要前后呼应、逻辑闭环的分析过程。
在之前两篇文章中已经拆解了「输入/除去的变量表、模型摘要表、ANOVA表(方差分析表)、系数表、排除的变量表、个案诊断表、残差统计表」七个输出表格以及标准化残差直方图的相关内容:
【统计分析软件SPSS】132、进行步进线性回归分析——结果解读1
【统计分析软件SPSS】133、进行步进线性回归分析——结果解读2

本文将在前两篇文章的基础上继续拆解SPSS的步进线性回归的输出图表。

02
结果解读
  • 输出结果九:残差–预测值散点图

该图用于评估模型的拟合优度、识别异常值和检查异方差性。

  • 图表结构说明:

含义

横轴(X轴):

标准化预测值

即模型对因变量(销量的对数变换值)的预测结果,经过标准化处理。

反映了不同车型在自变量空间中的“位置”或“预期表现”。

纵轴(Y轴):

学生化删除后残差

是一种更严格的残差形式:在删除当前个案后重新建模得到的残差,并进行标准化。

更能准确识别高影响力个案(即那些对模型参数估计有显著影响的点)。

每个点

代表一个车型(进行线性分析时设置的个案标签选项),其标签为车型名称。

  • 图表解读:

①、整体分布趋势:大多数点集中在中间区域(|残差| < 2),呈横向带状分布。说明大多数车型的预测误差较小,模型拟合效果良好。

②、离群值:该图清晰地揭示了个别离群值(见前文个案诊断表部分),即3000GT和Cutlass车型表现出极端负向残差(标准残差均超过3)。另外,Breeze和SW车型虽然其标准残差均超过2,但与多数案例分布相当接近,这表明这两款车型的表现欠佳可能源于随机波动。

③、是否满足同方差性假设:理想情况下,残差应围绕零水平线随机波动,且上下边界宽度一致(即恒定方差)。本图中,残差在预测值低时(左端)波动较大(如3000GT、Cutlass车型),在预测值高时(右端)残差相对集中,表现出轻微的异方差性(预测值越小,误差越大,但整体仍可接受。

需要注意的是,该图中更值得关注的是远离主数据集左侧的案例簇。尽管这些簇内各案例的残差值不大,但其与主数据集的距离差异可能导致这些案例在回归系数确定过程中产生了过度影响(回归线会“尽量照顾”这些边缘点,从而改变整体斜率)。该情况通常对应高杠杆值(在自变量空间中极端)库克距离(对回归系数有强影响力)的情景。

03
进一步分析

上一步通过残差–预测值散点图,发现了远离主数据集左侧的案例簇。尽管这些点残差不大,但也可能扭曲模型参数估计,导致结论失真。因此,可以结合因子层面的残差图和影响力指标图进行精细化排查。

  • 各因子得分的残差图:

过将标准化残差对每个因子得分作图,可以识别特定因子维度上的异常模式。

如果要检查因子得分1的残差,点击顶部菜单栏的【图形→图形构建器】,在打开的对话框中进行相应设置:

  • 在图库中,选择简单散点图。

  • 选择标准化残差(Standardized Residual变量作为y变量,将因子得分1REGR factor score 1 for analysis 1变量作为x变量。

  • 点击「组/点ID」选项卡,勾选点ID标签」选项,并选择车型(model变量)作为标记案例的变量。

设置完成,点击确定。

生成的残差与预测值散点图中出现的异常点簇在因子得分1处具有较大数值,即这些是高价车辆(因子得分1在价格和马力上的载荷最强,具体可见前文输出结果四:系数表部分)。由于价格分布呈右偏态,后续分析中采用对数转换后的价格数据或许更为合理。

通过重新调用图表生成器,可针对其他因子得分生成类似的散点图。

因子得分2(主要在轴距和车身长度上有高载荷)和3(主要在车型上载荷最强,Automobile/Truck)的图表未显示任何有用信息。

因子得分6(因子得分5主要在发动机排量上载荷最强,具体可见前文输出结果四:系数表部分)的残差图显示,Viper车型可能也是一个关键点,因为其发动机尺寸异常庞大,且位于数据点主簇之外。

因子得分5(因子得分5主要在燃油效率上载荷最强,具体可见前文输出结果四:系数表部分)的残差图揭示,Metro车型可能是关键影响点——其燃油效率远高于数据集中其他车辆,且数据点远离主聚类区域。

  • 中心杠杆值-库克距离散点图:

中心杠杆值-库克距离散点图可用于综合判断个案的影响力:
  • 横轴:居中杠杆值,用于衡量在自变量空间中的“极端程度”;
  • 纵轴:库克距离,用于衡量对回归系数的“综合影响大小”。

如需生成「中心杠杆值-库克距离」散点图,点击顶部菜单栏的【图形→图形构建器】,在打开的对话框中进行相应设置:

  • 在图库中,选择简单散点图。

  • 选择库克距离(Cook's Distance作为y变量,将居中杠杆值(Centered Leverage Value作为x变量。

  • 点击「组/点ID」选项卡,勾选点ID标签」选项,并选择车型(model变量)作为标记案例的变量。

设置完成,点击确定。生成的散点图显示了几个异常点:

  • 3000GT车型具有较大的库克距离,但其杠杆值不高,因此虽然它为回归估计值增加了大量变异性,但很可能并未影响回归方程的斜率。
  • Viper车型虽具有高杠杆值,但Cook距离不大,因此不太可能对模型产生过度影响。
  • Metro车型同时具备高杠杆值和较大Cook距离。因此,后续应排除该案例再进行分析,本文不再深入探讨。