
R语言聚类算法比较
在使用不同的聚类算法完成数据聚类操作后,我们可以对算法的性能进行评估,绝大多数情况下,我们即可以使用簇内距离也可以使用簇间距离作为评价标准。使用fpc算法包的cluster.stat函数来比较不同的聚类算法。
操作
导入fpc包,选择层次聚类算法,距离计算采用single方法(最短距离法),将得到簇存放在hc_single中:
library(fpc)
single_c = hclust(dist(customer),method = "single")
hc_single = cutree(single_c,k = 4)
选择层次聚类算法,距离计算采用complete方法(最长距离法),将得到的簇存放在hc_complete:
complete_c = hclust(dist(customer),method = "complete")
hc_complte = cutree(complete_c,k = 4)
选择k均值聚类算法,将得到的簇存放km对象中:
set.seed(22)
km = kmeans(customer,4)
获得km聚类算法聚类结果的基本统计信息:
cs = cluster.stats(dist(customer),km$cluster)
通常我们习惯使用within.cluster.ss和avg.silwidth这两个函数来验证聚类算法:
cs[c("within.cluster.ss","avg.silwidth")]
$within.cluster.ss
[1] 61.3489
$avg.silwidth
[1] 0.4640587
将得到的不同方法生成聚类结果的统计信息并以列表显示:
sapply(list(kmeans = km$cluster,hc_single = hc_single,hc_complte = hc_complte), function(c)cluster.stats(dist(customer),c)[c("within.cluster.ss","avg.silwidth")])
kmeans hc_single hc_complte
within.cluster.ss 61.3489 136.0092 65.94076
avg.silwidth 0.4640587 0.2481926 0.4255961
原理
聚类结果的验证通常采用两种技术:簇内距离和簇间距离。其中,簇间距离距离越大,聚类效果越好,而簇内距离越小,聚类效果越理想。使用fpc包中的cluster.stat函数来计算训练好的聚类对象的相关统计信息。
从输出结果可以得知,within.cluster.ss计算的是每个聚类内部的距离平方程,而avg.silwidth计算的是平均轮廓值。within.cluster.ss的计算结果体现了同一个簇之间对象的相关程度,该值越小,簇内对象的相关性越大。而avg.silwidth值则同时考虑了簇内对象的聚合度和簇内对象的聚合度簇间对象的分离度。数学上对于每个点x可以采用下列公式计算其轮廓系数:
轮廓系数(x) = [b(x) - a(x)]/max([b(x),a(x)])
其中,a(x)是点x到所有与它在同一簇中的其他点的平均距离,而b(x)则是点x到所有与它不在同一簇的点平均距离的最小值。通常轮廓系数取值范围为0~1,越接近于1说明聚类效果越好。
从最后产生的结果可以知道,在within.cluster.ss和avg.silwidth测量长度下基于最长距离的层次聚类算法的聚类效果要优于最短距离层次聚类算法和k均值算法。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
正态分布与偏态分布的核心区别解析 在统计学中,数据的分布形态是理解数据特征、选择分析方法的基础。正态分布与偏态分布作为两 ...
2025-08-06基于 SPSS 的中介效应分析结果解读:揭示变量间的隐性关联 在社会科学与自然科学研究中,变量之间的关系往往并非简单的直接作用 ...
2025-08-06抖音数据分析师:驱动平台增长的幕后推手 在抖音这个日活用户数以亿计的超级平台上,每一次用户的滑动、点赞、评论,每一条 ...
2025-08-06解析 F 边界检验:协整分析中的实用工具 在计量经济学的时间序列分析中,判断变量之间是否存在长期稳定的均衡关系(即协整关系) ...
2025-08-05大数据时代的隐患:繁荣背后的隐忧 当我们在电商平台浏览商品时,系统总能 “精准” 推送心仪的物品;当我们刷短视频时,算法 ...
2025-08-05CDA 数据分析师考试全解析 在当今数字化时代,数据已成为企业发展的核心驱动力,数据分析师这一职业也愈发受到重视。CDA 数据分 ...
2025-08-05CDA认证在国际市场上的认可度正在逐渐增长。CDA(Certified Data Analyst)认证,源自中国,面向全球,旨在提升数字化人才的数据 ...
2025-08-04本次活动市场价2000元,现面向会员免费开放,会员朋友更可以邀请一位非会员免费参加。 【活动目标】 ...
2025-08-04MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-04反向传播神经网络:突破传统算法瓶颈的革命性力量 在人工智能发展的历史长河中,传统算法曾长期主导着数据处理与模式识别领域 ...
2025-08-04CDA 数据分析师行业标准:构建数据人才的能力坐标系 在数据驱动决策成为企业核心竞争力的时代,CDA(数据分析师)行业标准作为 ...
2025-08-04评判两组数据与初始数据准确值的方法 在数据分析与研究中,我们常常会面临这样的情况:需要对通过不同方法、不同过程得到的两组 ...
2025-08-01通过 COX 回归模型诊断异常值 一、COX 回归模型概述 COX 回归模型,又称比例风险回归模型,是一种用于生存分析的统计方法。它能 ...
2025-08-01CDA 数据分析师报考条件详解:迈向专业认证的指南 在数据分析行业蓬勃发展的当下,CDA 数据分析师认证成为众多从业者提升专业 ...
2025-08-01K-S 曲线、回归与分类:数据分析中的重要工具 在数据分析与机器学习领域,K-S 曲线、回归和分类是三个核心概念与工具,它们各 ...
2025-07-31大数据时代对定性分析的影响 在大数据时代,海量、多样、高速且低价值密度的数据充斥着我们的生活与工作。而定性分析作为一 ...
2025-07-31CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-07-31SASEM 决策树:理论与实践应用 在复杂的决策场景中,如何从海量数据中提取有效信息并制定科学决策,是各界关注的焦点。SASEM 决 ...
2025-07-30SPSS 语法使用详解 在当今数据驱动的时代,SPSS( Statistical Package for the Social Sciences)作为一款功能强大的统计分析软 ...
2025-07-30人工智能对CDA数据分析领域的影响 人工智能对 CDA(Certified Data Analyst,注册数据分析师)数据分析领域的影响是全方位、多层 ...
2025-07-30