乐于分享
好东西不私藏

【统计分析软件SPSS】151、K均值聚类分析——结果解读

【统计分析软件SPSS】151、K均值聚类分析——结果解读

本系列文章(基于SPSS 31版本)配套数据可通过百度网盘获取:

链接:https://pan.baidu.com/s/1AGizNngKrzAVapWtNcc-VA?pwd=mnsj 提取码:mnsj
由于微信公众号已发布文章的内容及排版顺序无法二次编辑,为了方便大家后续查阅、检索,同时便于我对内容进行补充更新与完善,我已将所有已发布的推文,在个人网站上以结构化文档的形式重新整理、归档。欢迎前往查看:
https://www.mizhushare.com/docs/
01
应用场景
在前一篇文章中,我们已经完成了K均值聚类分析的菜单操作。
【统计分析软件SPSS】150、K均值聚类分析——操作步骤
本文将在前一篇文章的基础上逐表拆解SPSS的K均值聚类分析的输出图表。
02
操作步骤
  • 输出结果一:初始聚类中心
该表显示了算法开始时随机选择的每个聚类的初始位置,它们是算法迭代计算的起点。算法会根据这些初始中心将所有个案分配到最近的聚类,然后重新计算新的中心,如此反复,直到收敛。

在 SPSS 中,初始聚类中心的来源主要有两种:

  • 系统自动生成:系统会从数据中自动选择k个彼此距离较远的观测值,直接用这k个观测值的变量值作为初始聚类中心。

  • 用户指定:需在K均值聚类分析主对话框中勾选「读取初始聚类中心」并指定数据来源(例如,基于业务经验或前期探索性分析的结果)。

  • 输出结果二:迭代历史记录
迭代历史记录了聚类中心在每次迭代过程中如何逐步调整,直至算法收敛或者达到设置的最大迭代次数。这是判断聚类过程是否稳定、结果是否可靠的重要诊断工具。
如果算法是因为达到最大迭代次数而停止,可能需要考虑增加该上限值,因为此时得出的解可能并不稳定。
在本次示例中,可以看到,在初始迭代阶段,聚类中心会发生较大的位移。到了最后几次迭代时,已基本稳定在最终位置的附近区域,仅是对中心位置进行了微调。
  • 输出结果三:聚类成员

该表为K均值聚类分析完成后,每个个案的聚类信息,包括:

  • 聚类编号:表示该个案最终被分到了第几类(如 1、2、3)。

  • 距离:该个案到其所属聚类中心的欧几里得距离。

如果在聚类分析中的「保存」对话框中勾选了保存为新变量选项,每个个案的聚类信息会以新变量保存在数据集中。

............
  • 输出结果四:最终聚类中心
最终聚类中心是根据每个聚类中各变量的平均值计算得出的,反映了各个聚类中典型案例的特征。
在本次示例中,通过对比各变量在不同聚类中的表现,可以识别出不同类型客户,用于指导后续制定差异化的运营策略。因为分析变量均已标准化(均值为0,标准差为1),因此数值大小直接反映其相对于整体平均水平的高低(正值表示高于平均、负值表示低于平均、绝对值越大表示偏离程度越高
  • 聚类1:多项服务使用值均较高。表示高价值、多服务使用型用户
  • 聚类2:通话相关服务较高,其他服务值较小。表示中等消费、传统通话为主用户
  • 聚类3:该类用户通常消费极低,且购买的服务种类很少。
  • 输出结果五:最终聚类中心之间的距离

该表格显示了最终聚类中心之间的欧几里得距离。用于衡量各个聚类之间的分离程度或差异大小——聚类之间的距离越大,表明它们的差异性越显著。

在本次示例中:

  • 聚类1和聚类3的差异最大(最不相似)。

  • 聚类2与聚类1/聚类3的相似度大致相同。

虽然通过观察最终聚类中心也能大致推断出这些聚类间的关系,但随着聚类数量和变量数量的增加,这种判断将变得愈发困难。

  • 输出结果六:方差分析(ANOVA)表

方差分析(ANOVA)表显示了哪些变量对聚类结果的贡献最大。

指标
含义

聚类均方

聚类间的变异程度。值越大,说明该变量在不同聚类间差异越大。

自由度

固定值,取决于聚类数K。

误差均方

聚类内的变异程度。值越小,说明同类个案越相似。

误差自由度

样本量-聚类数。反映样本规模。

F值

核心指标,表示聚类间变异/聚类内变异。F 值较大的变量能提供最佳的聚类区分度。

显著性

统计检验p值。

需要注意的是,K-均值聚类本身就是根据变量差异来分组的,再用同一批数据去做ANOVA。因此ANOVA在这里是事后描述工具,不是事前假设检验,不能像传统ANOVA那样说"拒绝原假设"。因此,解读该表时,只需关注F值的相对大小而非绝对显著性。

  • 输出结果七:每个聚类中的个案数目

该表展示了每一个聚类中,最终被分配到的个案数量。

在本次示例中,大部分案例被划分到了第三类聚类。但是该类客户群体在所有服务使用指标上均显著低于平均水平,属于典型的低活跃、低消费客户,利润贡献微薄。

尽管整体表现为低价值,但大样本量(48%)本身蕴含细分潜力,后续可以尝试将聚类数增至4,可能会进一步挖掘出第四类更具盈利潜力的细分群体。这部分内容将在下一篇文章中进行介绍。