1.数据分析和数据挖掘的概念
数据分析(Data Analysis) 是以数据为分析对象,以探索数据内的有用信息为主要途径,以解决业务需求为最终目标,包含业务理解、数据采集、 数据清洗、数据探索、数据可视化、数据建模、模型结果可视化、分析结果的业务应用等步骤在内的一整套分析流程。
数据挖掘(Data Mining) : 是一个跨学科的计算机科学分支,它是用人工智能、机器学习、统计学和数据库的交叉方法在相对较大型的数据集中发 现模式的计算过程。
2.数据分析的八个层次
数据分析的目的:发现有价值的信息、提出结论、为业务发展提供辅助决策。它描述了 ”过去发生了什么“、”现在 正在发生什么“ 和 “未来可能发生什么”。根据分析层次的级别不同,分为常规报表、即席查询、多维分析(又称钻 取或OLAP)、警报、统计分析、预报(或者时间序列预测)、预测型建模(Predictive Model)和优化。
3.大数据对传统小数据的拓展及其区别与联系
数据上:小数据重抽样,大数据重全体。由于传统小数据分析的本质是基于样本推断总体,因此在分析过程中十分 注重抽样的科学性。只有抽样是科学的,其推断结果才具有科学意义。而大数据虽然不一定是总体,但由于在建模 方法上已经更偏向于机器学习,因此抽样已经不是必要的手段和方法论了。
方法上:小数据重实证,大数据重优化。传统的小数据在方法上更重视实证研究,强调在相关理论的前提下建立假设,收集数据,建立模型并验证假设。而大数据往往更重视方法论中的自我迭代和自我优化过程,可能运算的第一 个结果与标准答案相差甚远,但是可以通过与正确答案的不断校准(往往建立损失函数),使得模型的精度不断提高。
目标上:小数据重解释,大数据重预测。小数据的分析往往注重归因分析,探索变量之间的内部影响机理,例如究竟什么样的生活习惯会提高癌症的发病率。但是大数据往往关心的是对于未知对象的预测,例如判别某个人是否患有癌症,或者患有癌症的概率是多少。
4.数据分析目标的意义、过程及其本质
可以认为数据分析涉及到公司运营的方方面面,这包括对企业部门经营情况的评估、内部员工的管理、生产流程的监管、 产品结构优化与新产品开发、财务成本优化、市场结构的分析和客户关系的管理。其中,关于客户与市场的数据分析是 “重头戏”。下面以客户全生命周期管理为例介绍数据分析运用场景和挖掘主题,如下图所示。
1.CRISP-DM 方法论
CRISP-DM方法论将数据挖掘项目生命周期分为6个阶段,它们分别是业务理解、数据理解、数据准备、建模、模型评 估和模型发布,如下图所示。
下图呈现了通用数据挖掘方法论(CRISP-DM)流程的6个阶段。下面简短地介绍了每个阶段的要点。
业务理解(Business Understanding) 该初始阶段集中在从商业角度理解项目的目标和要求,通过理论分析转化为数据挖掘可操作的问题,制定实现目标的初 步计划。
数据理解(Data Understanding) 数据理解阶段开始于原始数据的收集,然后是熟悉数据、标明数据质量问题、探索对数据的初步理解、发觉有趣的子集 以形成对探索关系的假设。
数据准备(Data Preparation) 数据准备阶段包括所有从原始的、未加工的数据构造数据挖掘所需信息的活动。数据准备任务可能被实施多次,而且没 有任何规定的顺序。这些任务的主要目的是从源系统根据维度分析的要求,获取所需要的信息,需要对数据进行转换和 清洗。
建模(Modeling) 在此阶段,主要是选择和应用各种建模技术,同时对它们的参数进行校准,以达到最优值。通常对同一个数据挖掘问题 类型,会有多种建模技术。一些技术对数据格式有特殊的要求,因此,常常需要返回到数据准备阶段。
模型评估(Evaluation) 在模型最后发布前,根据商业目标评估模型和检查建立模型的各个步骤。此阶段关键目的是,判断是否存在一些重要的 商业问题仍未得到充分考虑。
模型发布(Deployment) 模型完成后,由模型使用者(客户)根据当时背景和目标完成情况,决定如何在现场使用模型。比如,在网页的实时个 人化中或营销数据的重复评分中。
2.SEMMA 方法论
SAS公司的数据挖掘项目实施方法论,对CRISP-DM方法中的数据准备和建模环节进行了拓展,被称为SEMMA方法, 如下图所示。
3.5个步骤中的主要任务,如下图所示。
数据整理
涉及数据采集、数据合并与抽样的操作,目的是为了构造分析用到的数据。分析人员根据维度分析获得的结果作为整理 数据的依据,将散落在公司内部与外部的数据进行整合。
样本探索
这个步骤的主要任务是对数据质量的探索。变量质量方面涉及错误值(如:年龄=-30)、恰当性(客户的某些业务指标 为缺失值,实际上是没有这个业务,值应该为“0”)、缺失值(没有客户的收入信息)、一致性(收入单位为人民币, 而支出单位为美元)、平稳性(某些数据的均值变化过于剧烈)、重复值(相同的交易被记录两次)和及时性(银行客 户的财务数据更新的滞后时长)等方面。这部分的探索主要解决变量是错误时是否可以修改、是否可以使用的问题。
变量修改
根据变量探索的结论,需要对数据质量问题和变量分布情况分别作变量修改。数据质量问题的修改涉及改正错误编码、 缺失值填补、单位统一等操作。变量分布情况的修改涉及函数转换和标准化方法,具体的修改方法需要与后续的统计建 模方法相结合。
建模 根据分析的目的选取合适的模型,这部分内容在“数据分析方法分类介绍”已经作了详细的阐述,这里不再赘述。
模型检验 这里指模型的样本内验证,即使用历史数据对模型表现的优劣进行评估。比如,对有监督学习会使用ROC曲线和提升度 等技术指标评估模型的预测能力。
数据分析中不同人员的角色与职责
业务问题是需求,最终需要转换成统计或数据挖掘等问题,用数据分析的思路来解决,因此数据分析师在业务与数据间 起到协调作用,是业务问题能否成功转换成统计问题的关键。通常来说,业务问题需要一个或多个字段来表达,这些字 段以什么形式出现(如测量级别),因为字段的形式会决定选择的方法,而每种方法又用于解决特定的需求,此外由于 模型对业务人员或企业高管来说可能过于专业,因此需要将模型输出通俗的表达出来。所以协调者、数据分析师、报告 人的角色,决定了数据分析师是一名(精通数理和软件的)综合型人才。
1.公司营销部门每月例会报告的经营指标汇总,属于下列哪一类数据分析?
A. 客户行为的数据挖掘报告
B. 描述性数据分析报告
C. 产品和行为倾向报告
D. 以上都不对
答案:B 解析:按照惯例经营指标汇总,通常是报告业绩指标的数量、金额、百分比或排名等信息,这类 分析多数归属于描述性数据分析,而且是单变量分析的内容。AC项涉及行为特点和商品特征的关 系,属于多变量分析的内容。
2.以下哪些内容包含在数据分析层次级别中?
A. 即席查询
B. 多维分析(又称为钻取或者OLAP)
C. 统计分析与警报
D. 与业务人员协商知识点
答案:ABC 解析:考察数据分析的八个层次,需要在理解的基础上加以记忆。
3.统计模型主要用于解决哪几类问题?
A. 预测分类问题
B. OLAP分析问题
C. 相关分析
D. 市场细分问题
答案:ACD 解析:A项、C项和D项是统计模型的典型问题,但OLAP分析问题并不是统计模型。
4.下列关于数据挖掘流程表达正确的一项是:
A. 方法论CRISP-DM与SEMMA是业内公认的权威流程,严格按照步骤做数据分析总不会出错的
B. CRISP-DM(译为“跨行业”数据挖掘)在任何数据分析行业中均适用
C. SEMMA方法论是对CRISP-DM方法中的数据准备和建模环节进行了拓展
D. 由于数据比较整洁,所以可以不需要再做数据预处理,直接从建模开始
答案:C 解析:AB两项都犯同一类错误,就是过于迷信方法论的共识性,D项中数据分析的一般性 描述是很重要的预分析过程,不仅如此,模型对于数据的要求也很高,样本探索、变量整理等预处理工作都不可省去。
5.关于客户生命周期管理,下列哪一项不属于对既有高价值客户的分析内容?
A. 行为信用评分
B. 初始信用评分
C. 产品精准营销
D. 客户留存管理
答案:B 解析:高价值客户属于企业的既有客户,而初始信用评分属于对潜在响应客户的 策略分析。
6.统计模型主要用于解决哪几类问题?
A.预测分类问题
B.OLAP分析问题
C.相关分析
D.市场细分问题
答案:ACD 解析:A项、C项和D项是统计模型的典型问题,但OLAP分析问题并不属于统计模型。
点击CDA题库链接,获取免费版CDA题库入口,祝考试顺利,快速拿证!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
持证人简介:贺渲雯 ,CDA 数据分析师一级持证人,互联网行业数据分析师 今天我将为大家带来一个关于用户私域用户质量数据分析 ...
2025-04-18一、CDA持证人介绍 在数字化浪潮席卷商业领域的当下,数据分析已成为企业发展的关键驱动力。为助力大家深入了解数据分析在电商行 ...
2025-04-17CDA持证人简介:居瑜 ,CDA一级持证人,国企财务经理,13年财务管理运营经验,在数据分析实践方面积累了丰富的行业经验。 一、 ...
2025-04-16持证人简介: CDA持证人刘凌峰,CDA L1持证人,微软认证讲师(MCT)金山办公最有价值专家(KVP),工信部高级项目管理师,拥有 ...
2025-04-15持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。在实际生活中,我们可能会 ...
2025-04-14在 Python 编程学习与实践中,Anaconda 是一款极为重要的工具。它作为一个开源的 Python 发行版本,集成了众多常用的科学计算库 ...
2025-04-14随着大数据时代的深入发展,数据运营成为企业不可或缺的岗位之一。这个职位的核心是通过收集、整理和分析数据,帮助企业做出科 ...
2025-04-11持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。 本次分享我将以教培行业为 ...
2025-04-11近日《2025中国城市长租市场发展蓝皮书》(下称《蓝皮书》)正式发布。《蓝皮书》指出,当前我国城市住房正经历从“增量扩张”向 ...
2025-04-10在数字化时代的浪潮中,数据已经成为企业决策和运营的核心。每一位客户,每一次交易,都承载着丰富的信息和价值。 如何在海量客 ...
2025-04-09数据是数字化的基础。随着工业4.0的推进,企业生产运作过程中的在线数据变得更加丰富;而互联网、新零售等C端应用的丰富多彩,产 ...
2025-04-094月7日,美国关税政策对全球金融市场的冲击仍在肆虐,周一亚市早盘,美股股指、原油期货、加密货币、贵金属等资产齐齐重挫,市场 ...
2025-04-08背景 3月26日,科技圈迎来一则重磅消息,苹果公司宣布向浙江大学捐赠 3000 万元人民币,用于支持编程教育。 这一举措并非偶然, ...
2025-04-07在当今数据驱动的时代,数据分析能力备受青睐,数据分析能力频繁出现在岗位需求的描述中,不分岗位的任职要求中,会特意标出“熟 ...
2025-04-03在当今数字化时代,数据分析师的重要性与日俱增。但许多人在踏上这条职业道路时,往往充满疑惑: 如何成为一名数据分析师?成为 ...
2025-04-02最近我发现一个绝招,用DeepSeek AI处理Excel数据简直太爽了!处理速度嘎嘎快! 平常一整天的表格处理工作,现在只要三步就能搞 ...
2025-04-01你是否被统计学复杂的理论和晦涩的公式劝退过?别担心,“山有木兮:统计学极简入门(Python)” 将为你一一化解这些难题。课程 ...
2025-03-31在电商、零售、甚至内容付费业务中,你真的了解你的客户吗? 有些客户下了一两次单就消失了,有些人每个月都回购,有些人曾经是 ...
2025-03-31在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的需求持续飙升。世界经济论坛发布的《未来就业报告》, ...
2025-03-28你有没有遇到过这样的情况?流量进来了,转化率却不高,辛辛苦苦拉来的用户,最后大部分都悄无声息地离开了,这时候漏斗分析就非 ...
2025-03-27