链接:https://pan.baidu.com/s/15r0rLWkJlcecUvBPKZo_MQ?pwd=mnsj提取码:mnsj
https://www.mizhushare.com/docs/
在前一篇文章中,介绍了SPSS自动线性建模的相关内容。
模型整体拟合情况; 自变量筛选结果; 各变量的重要性; 预测效果与诊断信息。


输出结果一:模型概要
上方表格中呈现的是构架模型的因变量、是否启用自动数据预处理功能、模型选择方法、信息准则(AICC,修正赤池信息准则)等信息。
下方以可视化进度条的方式展现了模型的拟合效果。准确度值越高,说明模型对目标变量的解释或预测能力越强。本例为59.8%(最终模型的调整后R²为0.598),表示模型具有中等偏上的解释/预测能力,要判断是否够用,需要结合研究目的、数据复杂度等情况综合考虑。

输出结果二:自动数据准备
该表展示了模型构建前自动数据准备步骤中执行的操作(需勾选「自动准备数据」选项后),即对进入模型的哪些变量做了哪些预处理操作。

输出结果三:预测变量重要性
该图以条形图的方式直观地展示了各个自变量对因变量的相对影响程度。对于线性模型,预测变量的重要性值为——从模型中移除该变量后残差平方和的归一化值,且所有变量的重要性值之和为1。
本示例中,家乡规模变量对模型的影响程度较小,后期可以将其从模型中剔除。在后面「效应」视图(输出结果七:方差分析表)中也可以看到该变量实际上并不具有统计学意义。
需要注意的是,预测变量的重要性排序未必与其添加到模型的顺序一致;例如,转换后的索赔类型变量虽最先加入模型(可通过输出结果十:「模型构建汇总表」查看),但其重要性排名位列第二。

输出结果四:预测值-观测值散点图
该图为预测值和因变量实际值绘制的散点图,横轴为因变量实际值,纵轴为预测值,用于考察模型预测效果,如果预测效果好,数据点应该位于45度线上分布。
本例中,图中数据点未落在45度线上,且所有预测值均未超过500,但因变量实际值的上限范围超过1500。这表明模型对大额索赔的预测效果不佳。这是因为「索赔金额(单位:千美元)」(claim_amount变量)的分布呈偏态,后续分析中或许应进行对数转换,本文暂不深入探讨。

输出结果五:学生化残差的直方图 + 正态曲线对比图
残差图(模型预测值与实际观测值之间的差异)用于检验当前模型是否满足线性回归的基本假设(误差项服从正态分布)。理想状态下,直方图形状与黑色正态曲线高度吻合,多数残差集中在-2到+2区间内,尾部不明显偏斜或有极端峰值。
本示例中,从学生化残差直方图可以看出,残差分布以0为中心,整体呈近似正态分布,且标准差接近1,未发现明显偏态或极端异常值,说明自动线性建模的拟合结果较为稳定,线性模型假设在可接受范围内。另外,数据中存在少量高额索赔个案,但未对整体模型造成明显破坏。



夜雨聆风