本系列文章(基于SPSS 31版本)配套数据可通过百度网盘获取:
链接:https://pan.baidu.com/s/1AGizNngKrzAVapWtNcc-VA?pwd=mnsj提取码:mnsj
https://www.mizhushare.com/docs/

输出结果一:初始聚类中心
在 SPSS 中,初始聚类中心的来源主要有两种:
系统自动生成:系统会从数据中自动选择k个彼此距离较远的观测值,直接用这k个观测值的变量值作为初始聚类中心。
用户指定:需在K均值聚类分析主对话框中勾选「读取初始聚类中心」并指定数据来源(例如,基于业务经验或前期探索性分析的结果)。

输出结果二:迭代历史记录

输出结果三:聚类成员
该表为K均值聚类分析完成后,每个个案的聚类信息,包括:
聚类编号:表示该个案最终被分到了第几类(如 1、2、3)。
距离:该个案到其所属聚类中心的欧几里得距离。
如果在聚类分析中的「保存」对话框中勾选了保存为新变量选项,每个个案的聚类信息会以新变量保存在数据集中。


输出结果四:最终聚类中心
聚类1:多项服务使用值均较高。表示高价值、多服务使用型用户。 聚类2:通话相关服务较高,其他服务值较小。表示中等消费、传统通话为主用户。 聚类3:该类用户通常消费极低,且购买的服务种类很少。

输出结果五:最终聚类中心之间的距离
该表格显示了最终聚类中心之间的欧几里得距离。用于衡量各个聚类之间的分离程度或差异大小——聚类之间的距离越大,表明它们的差异性越显著。
在本次示例中:
聚类1和聚类3的差异最大(最不相似)。
聚类2与聚类1/聚类3的相似度大致相同。
虽然通过观察最终聚类中心也能大致推断出这些聚类间的关系,但随着聚类数量和变量数量的增加,这种判断将变得愈发困难。

输出结果六:方差分析(ANOVA)表
方差分析(ANOVA)表显示了哪些变量对聚类结果的贡献最大。
聚类均方 | 聚类间的变异程度。值越大,说明该变量在不同聚类间差异越大。 |
自由度 | 固定值,取决于聚类数K。 |
误差均方 | 聚类内的变异程度。值越小,说明同类个案越相似。 |
误差自由度 | 样本量-聚类数。反映样本规模。 |
F值 | 核心指标,表示聚类间变异/聚类内变异。F 值较大的变量能提供最佳的聚类区分度。 |
显著性 | 统计检验p值。 |
需要注意的是,K-均值聚类本身就是根据变量差异来分组的,再用同一批数据去做ANOVA。因此ANOVA在这里是事后描述工具,不是事前假设检验,不能像传统ANOVA那样说"拒绝原假设"。因此,解读该表时,只需关注F值的相对大小而非绝对显著性。

输出结果七:每个聚类中的个案数目
该表展示了每一个聚类中,最终被分配到的个案数量。
在本次示例中,大部分案例被划分到了第三类聚类。但是该类客户群体在所有服务使用指标上均显著低于平均水平,属于典型的低活跃、低消费客户,利润贡献微薄。
尽管整体表现为低价值,但大样本量(48%)本身蕴含细分潜力,后续可以尝试将聚类数增至4,可能会进一步挖掘出第四类更具盈利潜力的细分群体。这部分内容将在下一篇文章中进行介绍。



夜雨聆风