京公网安备 11010802034615号
经营许可证编号:京B2-20210330
Canopy聚类算法是一个将对象分组到类的简单、快速、精确地方法。每个对象用多维特征空间里的一个点来表示。这个算法使用一个快速近似距离度量和两个距离阈值 T1>T2来处理。基本的算法是,从一个点集合开始并且随机删除一个,创建一个包含这个点的Canopy,并在剩余的点集合上迭代。对于每个点,如果它的距离第一个点的距离小于T1,然后这个点就加入这个聚集中。除此之外,如果这个距离<T2,然后将这个点从这个集合中删除。这样非常靠近原点的点将避免所有的未来处理,不可以再做其它Canopy的中心。这个算法循环到初始集合为空为止,聚集一个集合的Canopies,每个可以包含一个或者多个点。每个点可以包含在多于一个的Canopy中。
Canopy算法其实本身也可以用于聚类,但它的结果可以为之后代价较高聚类提供帮助,其用在数据预处理上要比单纯拿来聚类更有帮助。Canopy聚类经常被用作更加严格的聚类技术的初始步骤,像是K均值聚类。建立canopies之后,可以删除那些包含数据点数目较少的canopy,往往这些canopy是包含孤立点的。
Canopy算法的步骤如下:
(1) 将所有数据放进list中,选择两个距离,T1,T2,T1>T2
(2)While(list不为空)
{
随机选择一个节点做canopy的中心;并从list删除该点;
遍历list:
对于任何一条记录,计算其到各个canopy的距离;
如果距离<T2,则给此数据打上强标记,并从list删除这条记录;
如果距离<T1,则给此数据打上弱标记;
如果到任何canopy中心的距离都>T1,那么将这条记录作为一个新的canopy的中心,并从list中删除这个元素;
}
需要注意的是参数的调整:
当T1过大时,会使许多点属于多个Canopy,可能会造成各个簇的中心点间距离较近,各簇间区别不明显;
当T2过大时,增加强标记数据点的数量,会减少簇个个数;T2过小,会增加簇的个数,同时增加计算时间;
下面用Java来简单实现算法,考虑简单,点只用了二维。
public class CanopyBuilder {
private double T1 = 8;
private double T2 = 4;
private List<Point> points = null;
private List<Canopy> canopies = null;
public CanopyBuilder() {
init();
}
public void init() {
points = new ArrayList<Point>();
points.add(new Point(8.1, 8.1));
points.add(new Point(7.1, 7.1));
points.add(new Point(6.2, 6.2));
points.add(new Point(7.1, 7.1));
points.add(new Point(2.1, 2.1));
points.add(new Point(1.1, 1.1));
points.add(new Point(0.1, 0.1));
points.add(new Point(3.0, 3.0));
canopies = new ArrayList<Canopy>();
}
//计算两点之间的曼哈顿距离
public double manhattanDistance(Point a, Point b) {
return Math.abs(a.getX() - b.getX()) + Math.abs(a.getY() - b.getY());
}
//计算两点之间的欧氏距离
public double euclideanDistance(Point a, Point b) {
double sum = Math.pow(a.getX() - b.getX(), 2) + Math.pow(a.getY() - b.getY(), 2);
return Math.sqrt(sum);
}
public void run() {
while (points.size() > 0) {
Iterator<Point> iterator = points.iterator();
while (iterator.hasNext()) {
Point current = iterator.next();
System.out.println("current point: " + current);
//取一个点做为初始canopy
if (canopies.size() == 0) {
Canopy canopy = new Canopy();
canopy.setCenter(current);
canopy.getPoints().add(current);
canopies.add(canopy);
iterator.remove();
continue;
}
boolean isRemove = false;
int index = 0;
for (Canopy canopy : canopies) {
Point center = canopy.getCenter();
System.out.println("center: " + center);
double d = manhattanDistance(current, center);
System.out.println("distance: " + d);
//距离小于T1加入canopy,打上弱标记
if (d < T1) {
current.setMark(Point.MARK_WEAK);
canopy.getPoints().add(current);
} else if (d > T1) {
index++;
}
//距离小于T2则从列表中移除,打上强标记
if (d <= T2) {
current.setMark(Point.MARK_STRONG);
isRemove = true;
}
}
//如果到所有canopy的距离都大于T1,生成新的canopy
if (index == canopies.size()) {
Canopy newCanopy = new Canopy();
newCanopy.setCenter(current);
newCanopy.getPoints().add(current);
canopies.add(newCanopy);
isRemove = true;
}
if (isRemove) {
iterator.remove();
}
}
}
for (Canopy c : canopies) {
System.out.println("old center: " + c.getCenter());
c.computeCenter();
System.out.println("new center: " + c.getCenter());
ShowUtils.print(c.getPoints());
}
}
public static void main(String[] args) {
CanopyBuilder builder = new CanopyBuilder();
builder.run();
}
}
Canopy类
[java] view plain copy
public class Canopy {
private Point center = null;
private List<Point> points = null;
public Point getCenter() {
return center;
}
public void setCenter(Point center) {
this.center = center;
}
public List<Point> getPoints() {
if (null == points) {
points = new ArrayList<Point>();
}
return points;
}
public void setPoints(List<Point> points) {
this.points = points;
}
public void computeCenter() {
double x = 0.0;
double y = 0.0;
for (Point point : getPoints()) {
x += point.getX();
y += point.getY();
}
double z = getPoints().size();
setCenter(new Point(x / z, y / z));
}
}
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动的精细化运营体系中,指标是业务判断、效果复盘、策略优化的核心依据。随着企业数据化程度提升,指标数量持续膨胀,但 ...
2026-07-23在用户运营与产品增长体系中,留存是衡量产品真实价值与用户粘性的核心标尺,也是决定用户生命周期价值、获客投产比的底层因素。 ...
2026-07-23 很多数据分析师精通Excel、SQL、Python等工具,但当被问到“面对一个具体的业务问题,该用什么分析方法”“描述性分析和诊断 ...
2026-07-23【核心关键词】埋点、产品、互联网、数据库、决策、数据分析、产品经理、商业模式、移动互联网、指标体系、运营模块、大数据平 ...
2026-07-22在高并发、大数据量的业务系统中,单表数据量达到千万级甚至亿级后,会出现查询性能骤降、索引维护成本飙升、存储扩容困难等问题 ...
2026-07-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-07-22在金融风控、企业运营、行业研究等数据分析场景中,大量数据以面板数据形态存在:例如多家分支机构连续多个季度的风险指标、多位 ...
2026-07-21 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-07-21一、活动介绍 2026暑期CDA备考冲刺季,为想利用假期拿证的你量身打造。考点胶囊内容搭配多重硬核福利,让你在旅行、实习、居家 ...
2026-07-21金融行业的运营风险贯穿业务全流程,涵盖交易欺诈、操作违规、流程漏洞、合规偏差、客户信用异常等多元场景,是银行、保险、证券 ...
2026-07-17财产保险作为金融行业的核心板块,涵盖车险、家财险、责任险、企财险等多元品类,是个人与企业抵御财产风险、经营风险的重要保障 ...
2026-07-17 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-07-17【核心关键词】模块、餐饮、客户、门店、企业、订单、供应链、多样化、产品、生产计划、数据分析、生产管理、物料管理、业务分 ...
2026-07-16在数字化分析时代,原始数据本身不具备业务价值,只有通过科学的统计学方法加工、拆解、验证与解读,才能挖掘数据背后的规律、差 ...
2026-07-16 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-07-16在描述性统计分析、数据预处理、异常值排查与多组数据分布对比工作中,箱线图(Box Plot)是应用最广泛的可视化与统计工具之一。 ...
2026-07-15在企业数据存储、业务统计与数据分析工作中,绝大多数业务数据都带有时间维度属性,例如订单创建时间、用户注册时间、支付完成时 ...
2026-07-15 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-07-15【核心关键词】产品、经营、客户、调研、销售额、宏观、会计行业、客户满意度、发展趋势、经营状况、数据分析、竞争对手、数据 ...
2026-07-14问卷调查是市场调研、用户研究、社会调研与产品分析的核心数据采集方式。问卷数据大多以分类数据为主,例如用户性别、年龄分层、 ...
2026-07-14