
R语言使用密度聚类笔法处理数据
说明
除了使用距离作为聚类指标,还可以使用密度指标来对数据进行聚类处理,将分布稠密的样本与分布稀疏的样本分离开。DBSCAN是最著名的密度聚类算法。
操作
将使用mlbench包提供的仿真数据
library(mlbench)
library(fpc)
使用mlbench库绘制Cassini问题图:
set.seed(2)
p = mlbench.cassini(500)
plot(p$x)
根据数据密度完成聚类:
ds = dbscan(dist(p$x),0.2,2,countmode = NULL,method = "dist")
> ds
dbscan Pts=500 MinPts=2 eps=0.2
1 2 3
seed 200 200 100
total 200 200 100
绘制聚类结果散点图,属于不同簇的数据点选用不的颜色:
plot(ds,p$x)
根据聚簇标号绘制的彩色散点图
调用dbscan来预测数据点可能被划分到那个簇,在样例中,首先在矩阵P中处理三个输入值:
生成y矩阵
y = matrix(0,nrow = 3,ncol = 2)
y[1,] = c(0,0)
y[2,] = c(0,-1.5)
y[3,] = c(1,1)
y
[,1] [,2]
[1,] 0 0.0
[2,] 0 -1.5
[3,] 1 1.0
预测数据点属于那个簇:
predict(ds,p$x,y)
[1] 3 1 2
原理
基于密度的聚类算法利用了密度可达以及密度相连的特点,因而适用于处理非线性聚类问题。当探讨密度聚类算法的处理过程前,我们要知道基于密度的聚类算法通常需要考虑两个参数,eps和MinPts,其中eps为最大领域半径,MinPts是领域半径范围内的最小点数。
确定好这两个参数后,如果给定对象其领域范围内的样本点个数大于MinPts,则称该对象为核心点。
如果一个对象其领域半径范围内的样本点个数小于MinPts,但紧挨着核心点,则称该对象为边缘点。
如果P对象的eps领域范围内样本点个数大于MinPts,则称该对象为核心对象。
进一步,我们还要定义两点间密度可达的概念,给定两点p和q,如果p为核心对象,且q在p的eps邻域内,则称p直接密度可以达q。如果存在一系列的点,p1,p2,…,pn。且p1 = q,pn = p,根据Eps和MinPts的值,当1<=i<=n,pi + 1 直接密度可以达pi,则称p的一般密度可以达q。
DBSCAN处理过程:
1.随机选择一个点p
2.给定Eps和MinPts的条件下,获得所有p密度可达的点
3.如果p是核心对象,则p和所有p密度可达的点被标记成一个簇,如果p是一个边缘点,找不到密度可达点,则将其标记为噪声。接着处理其它点。
4.重复这个过程,直到所有的点被处理。
本例使用dbscan算法聚类Cassini数据集,将可达距离设置为0.2,最小可达点个数设置为2,计算进度设为NULL,使用距离矩阵做为计算依据。经过算法处理,数据被划分成三个簇,每个簇的大小分别为200,200,100.通过聚簇的结果示意图也可以发现Cassini图被不同颜色区分开来。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
正态分布与偏态分布的核心区别解析 在统计学中,数据的分布形态是理解数据特征、选择分析方法的基础。正态分布与偏态分布作为两 ...
2025-08-06基于 SPSS 的中介效应分析结果解读:揭示变量间的隐性关联 在社会科学与自然科学研究中,变量之间的关系往往并非简单的直接作用 ...
2025-08-06抖音数据分析师:驱动平台增长的幕后推手 在抖音这个日活用户数以亿计的超级平台上,每一次用户的滑动、点赞、评论,每一条 ...
2025-08-06解析 F 边界检验:协整分析中的实用工具 在计量经济学的时间序列分析中,判断变量之间是否存在长期稳定的均衡关系(即协整关系) ...
2025-08-05大数据时代的隐患:繁荣背后的隐忧 当我们在电商平台浏览商品时,系统总能 “精准” 推送心仪的物品;当我们刷短视频时,算法 ...
2025-08-05CDA 数据分析师考试全解析 在当今数字化时代,数据已成为企业发展的核心驱动力,数据分析师这一职业也愈发受到重视。CDA 数据分 ...
2025-08-05CDA认证在国际市场上的认可度正在逐渐增长。CDA(Certified Data Analyst)认证,源自中国,面向全球,旨在提升数字化人才的数据 ...
2025-08-04本次活动市场价2000元,现面向会员免费开放,会员朋友更可以邀请一位非会员免费参加。 【活动目标】 ...
2025-08-04MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-04反向传播神经网络:突破传统算法瓶颈的革命性力量 在人工智能发展的历史长河中,传统算法曾长期主导着数据处理与模式识别领域 ...
2025-08-04CDA 数据分析师行业标准:构建数据人才的能力坐标系 在数据驱动决策成为企业核心竞争力的时代,CDA(数据分析师)行业标准作为 ...
2025-08-04评判两组数据与初始数据准确值的方法 在数据分析与研究中,我们常常会面临这样的情况:需要对通过不同方法、不同过程得到的两组 ...
2025-08-01通过 COX 回归模型诊断异常值 一、COX 回归模型概述 COX 回归模型,又称比例风险回归模型,是一种用于生存分析的统计方法。它能 ...
2025-08-01CDA 数据分析师报考条件详解:迈向专业认证的指南 在数据分析行业蓬勃发展的当下,CDA 数据分析师认证成为众多从业者提升专业 ...
2025-08-01K-S 曲线、回归与分类:数据分析中的重要工具 在数据分析与机器学习领域,K-S 曲线、回归和分类是三个核心概念与工具,它们各 ...
2025-07-31大数据时代对定性分析的影响 在大数据时代,海量、多样、高速且低价值密度的数据充斥着我们的生活与工作。而定性分析作为一 ...
2025-07-31CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-07-31SASEM 决策树:理论与实践应用 在复杂的决策场景中,如何从海量数据中提取有效信息并制定科学决策,是各界关注的焦点。SASEM 决 ...
2025-07-30SPSS 语法使用详解 在当今数据驱动的时代,SPSS( Statistical Package for the Social Sciences)作为一款功能强大的统计分析软 ...
2025-07-30人工智能对CDA数据分析领域的影响 人工智能对 CDA(Certified Data Analyst,注册数据分析师)数据分析领域的影响是全方位、多层 ...
2025-07-30