
决策树故名思意是用于基于条件来做决策的,而它运行的逻辑相比一些复杂的算法更容易理解,只需按条件遍历树就可以了,需要花点心思的是理解如何建立决策树。
举个例子,就好像女儿回家,做妈妈的给女儿介绍对象,于是就有了以下对话:
妈妈:女啊,明天有没有时间,妈妈给你介绍个对象
女儿:有啊,对方多大了。
妈妈:年龄和你相仿
女儿:帅不帅啊
妈妈: 帅
女儿:那我明天去看看
妈妈和女儿对话的这个过程中,女儿的决策过程可以用下图表示:
你可能会认为,这个决策的过程本质上就是对数据集的每一个做if--else的判断,这不很简单吗?那为什么还要专门弄一个算法出来呢?
不妨可以考虑两点,假如训练数据集中存在无关项,比如以下的例子:
10-1 #表示第一项特征是1,第二项特征是0,最后推出的结果是1,以下同理
12-1
05-0
09-0
17-1
……
显然的,最后结果和第二个特征无关,如果仍要做判断就会增加了损耗。所以在建立决策树的过程中,我们就希望把这些无关项扔掉。
第二点,回到妈妈给女儿介绍对象的这个例子,上图是为了方面读者理解,所以按照顺序画出,但事实上,有一个严重的问题,比如说女儿可能不能容忍某个缺点,而一旦对方的性格中具有这个缺点,那么其他一切都不用考虑。也就是说,有一个特征跟最后的结果相关度极高,这时我们就希望这个数据出现在根节点上,如果核心条件不满足那就结束遍历这棵树了,避免无谓的损耗。
总言言之,决策树第一个是需要从大量的已存在的样本中推出可供做决策的规则,同时,这个规则应该避免做无谓的损耗。
算法原理
构造决策树的关键步骤是分裂属性。分裂属性值得就是在某个节点处按照某一特征属性的不同划分构造不同的分支,其目标是让各个分裂子集尽可能地“纯”。尽可能“纯”就是尽量让一个分裂子集中待分类项属于同一类别。这时分裂属性可能会遇到三种不同的情况:
对离散值生成非二叉决策树。此时用属性的每一个划分作为一个分支。
对离散值生成二叉决策树。此时使用属性划分的一个子集进行测试,按照“属于此子集”和“不属于此子集”分成两个分支。
属性是连续值。确定一个split_point,按照>split_point和<=split_point转成成离散,分别建立两个分支
构造决策树的关键性内容是进行属性选择度量,属性选择度量是一种选择分裂准则,是将给定的类标记的训练集合的数据划分D“最好”地分成个体类的启发式方法,它决定了拓扑结构及分裂点split_point的选择。
在这里仅介绍比较常用的ID3算法。
从信息论知识中我们直到,期望信息越小,信息增益越大,从而纯度越高。所以ID3算法的核心思想就是以信息增益度量属性选择,选择分裂后信息增益最大的属性进行分裂。
循序本系列的从工程角度理解算法,而非数学角度理解算法的原则,因此这里只给出信息增益度量的计算方式,如果需要深入了解其数学原理,请查阅专业资料。
设D为用类别对训练元组进行的划分,则D的熵计算方法为:
其中pi表示第i个类别在整个训练集中出现的概率。
当按照特征A分割后,其期望信息为:
其中Di/D表示每一个D在整体训练集占的比例。
而信息增益即为两者的差值:
其中当gain(A)达到最大时,该特征便是最佳的划分特征,选中最佳特征作为当前的节点,随后对划分后的子集进行迭代操作。
算法实现
github
在本专栏的前面的文章描述了基于决策树的五子棋游戏,算是一个基于决策树的应用了。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
2025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-06-052025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-05-27CDA数据分析师证书考试体系(更新于2025年05月22日)
2025-05-26解码数据基因:从数字敏感度到逻辑思维 每当看到超市货架上商品的排列变化,你是否会联想到背后的销售数据波动?三年前在零售行 ...
2025-05-23在本文中,我们将探讨 AI 为何能够加速数据分析、如何在每个步骤中实现数据分析自动化以及使用哪些工具。 数据分析中的AI是什么 ...
2025-05-20当数据遇见人生:我的第一个分析项目 记得三年前接手第一个数据分析项目时,我面对Excel里密密麻麻的销售数据手足无措。那些跳动 ...
2025-05-20在数字化运营的时代,企业每天都在产生海量数据:用户点击行为、商品销售记录、广告投放反馈…… 这些数据就像散落的拼图,而相 ...
2025-05-19在当今数字化营销时代,小红书作为国内领先的社交电商平台,其销售数据蕴含着巨大的商业价值。通过对小红书销售数据的深入分析, ...
2025-05-16Excel作为最常用的数据分析工具,有没有什么工具可以帮助我们快速地使用excel表格,只要轻松几步甚至输入几项指令就能搞定呢? ...
2025-05-15数据,如同无形的燃料,驱动着现代社会的运转。从全球互联网用户每天产生的2.5亿TB数据,到制造业的传感器、金融交易 ...
2025-05-15大数据是什么_数据分析师培训 其实,现在的大数据指的并不仅仅是海量数据,更准确而言是对大数据分析的方法。传统的数 ...
2025-05-14CDA持证人简介: 万木,CDA L1持证人,某电商中厂BI工程师 ,5年数据经验1年BI内训师,高级数据分析师,拥有丰富的行业经验。 ...
2025-05-13CDA持证人简介: 王明月 ,CDA 数据分析师二级持证人,2年数据产品工作经验,管理学博士在读。 学习入口:https://edu.cda.cn/g ...
2025-05-12CDA持证人简介: 杨贞玺 ,CDA一级持证人,郑州大学情报学硕士研究生,某上市公司数据分析师。 学习入口:https://edu.cda.cn/g ...
2025-05-09CDA持证人简介 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度、美团、阿里等 ...
2025-05-07相信很多做数据分析的小伙伴,都接到过一些高阶的数据分析需求,实现的过程需要用到一些数据获取,数据清洗转换,建模方法等,这 ...
2025-05-06以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/g ...
2025-04-30CDA持证人简介: 邱立峰 CDA 数据分析师二级持证人,数字化转型专家,数据治理专家,高级数据分析师,拥有丰富的行业经验。 ...
2025-04-29CDA持证人简介: 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度,美团,阿里等 ...
2025-04-28CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-27