京公网安备 11010802034615号
经营许可证编号:京B2-20210330
CDA数据分析师 出品
作者:李诗怡
核心观点:单独一个数字没有意义,有对比才有判断。例如“小明考了85分”——对比全班平均75分(横向)、他上次90分(纵向),结论完全不同
记忆点:同一分数,对比对象不同,结论完全不同
核心观点:整体出问题时,拆开看才能定位病根。把整体指标按某维度拆成小部分分别看,哪部分异常,问题就在哪
思路链条:整体出问题 → 按维度拆 → 找异常 → 定位问题
常用维度:时间、渠道、人群、产品、地区
使用原则:不知道问题在哪 → 多维度都拆一遍;有假设 → 按假设相关维度拆
经典案例:店铺总转化率下降 → 按渠道拆分 → 仅A渠道暴跌 → 问题锁定A渠道,无需全盘排查
核心观点:发现问题只是第一步,找到原因才能解决问题。只有找到真正原因,解决方案才有效
三者分工:对比告诉你“发生了什么”,拆解告诉你“问题在哪”,归因告诉你“为什么会这样”
经典案例:留存率下降 → 按版本拆,新版本留存低 → 注册流程多一步 → 真正原因:注册变复杂 → 解决方案:简化注册流程,而非盲目发优惠券
定义:把大问题像树一样层层拆成小问题,直到小问题可以直接回答。逻辑树是MECE原则的典型应用
与细分拆解区别:细分拆解:按一个维度把整体分成部分,是“横向切”;逻辑树:从问题出发层层追问“为什么/怎么办”,是“纵向挖”
| 类型 | 拆的问题 | 说明 |
|---|---|---|
| 议题树 | 是什么 | 把大问题拆成小问题 |
| 假设树 | 为什么 | 先假设原因,再验证 |
| 是否树 | 怎么办 | 用是/否判断引导决策 |
核心观点:没有目标的数据分析是瞎分析。拿到数据先问:我要解决什么问题?
SMART原则:定目标的标准:S具体、M可衡量、A可实现、R相关、T有时限
核心观点:你看到的数据可能只是一部分。用样本推断总体时,样本必须有代表性
| 样本偏差 | 含义 |
|---|---|
| 幸存者偏差 | 只看到活下来的,没看到死掉的 |
| 选择偏差 | 抽样方法有问题 |
| 缺失偏差 | 数据缺失导致结论偏差 |
考试关键词:目标思维:“先定目标再分析”“SMART原则”;样本思维:“样本代表性”“幸存者偏差”“选择偏差”“数据缺失”
口诀:目采清处分结:目标 → 采集 → 清洗 → 处理 → 分析 → 结论。标准流程六步走,不会漏环节
核心:做分析前先问清楚:要解决什么问题、为谁解决、什么时候要。目标不清晰,后面全白做
| 要素 | 回答的问题 |
|---|---|
| Why 为什么 | 为什么要做这个分析?业务背景是什么? |
| Who 为谁做 | 给谁看?老板、运营还是产品? |
| When 何时要 | 什么时候要结果?日报、周报还是专题? |
| Where 在哪看 | 数据从哪来?分析哪个范围? |
| What 做什么 | 分析什么问题?提升销量?降低成本? |
| How 怎么做 | 用什么方法?对比?拆解?归因? |
| How much 做到什么程度 | 目标要可衡量,如“Q3销量提升20%”,不是“提升销量” |
核心:目标定清楚后,问:要回答这个问题需要哪些数据?数据从哪来?
| 数据来源 | 说明 | 数据类型 |
|---|---|---|
| 业务数据库 | 订单、用户、商品等,用SQL查询 | 结构化数据 |
| 日志数据 | 用户行为埋点:点击、浏览、停留 | 半结构化数据 |
| 外部数据 | 行业报告、爬虫、API接口、公开数据,补充内部不足 | 外部补充 |
| 人工录入 | 问卷、调研、Excel手工录入 | 人工数据 |
采集质量注意:①数据口径一致:同一指标不同来源定义可能不同,必须先统一口径;②数据范围明确:时间、业务、用户范围要和目标匹配,不能多采也不能漏采
核心:数据质量决定分析质量,脏数据做出来的分析一定是错的。清洗是最花时间的一步(占60%-80%)
| 质量标准 | 含义 |
|---|---|
| 完整性 | 没有缺失值 |
| 准确性 | 没有异常值、错误值 |
| 一致性 | 口径统一、格式统一 |
| 唯一性 | 没有重复数据 |
缺失值五种处理:①删除 ②均值/中位数填充 ③众数填充 ④前后值填充 ⑤模型预测
异常值三种判断:①业务经验判断 ②统计方法判断 ③对比判断
核心:清洗后的数据是原始数据,需要计算、转换、聚合,变成能分析的指标
| 指标类别 | 常用指标 |
|---|---|
| 集中趋势 | 均值、中位数、众数 |
| 离散程度 | 方差/标准差、极差、四分位距 |
| 分布形态 | 偏度、峰度、频率分布 |
数据处理三动作:①数据转换:单位统一、格式转换、编码转换;②数据聚合:按天/周/月汇总、按维度分组汇总;③衍生指标:从原始数据计算新指标
核心:用前面学的四大思维,从数据中找规律、找原因、找机会
| 分析层次 | 回答的问题 | 所用思维 |
|---|---|---|
| 描述分析 | 发生了什么?销售额多少、增长多少 | 对比思维 |
| 诊断分析 | 为什么发生?哪个渠道出问题 | 拆解 + 归因思维 |
| 预测分析 | 将来会怎样?下个月销售额多少 | 趋势 + 模型 |
| 决策分析 | 该怎么办?投哪个渠道 | 逻辑树 + 假设 |
常用方法:①对比分析:和目标比、和历史比、和行业比;②细分分析:按维度拆解找异常;③归因分析:找根本原因;④相关分析:看变量之间的关系
核心:不能只摆数据,要告诉业务“该怎么办”。数据分析的价值不在于分析本身,而在于驱动决策和行动
好建议三标准:①有依据 ②可执行 ③有预期
结论结构(金字塔):结论先行:先说核心结论 → 论据支撑:再用数据支撑 → 建议落地:最后给建议


CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24随着数字经济快速发展,数据已成为核心生产要素,各行各业的业务沉淀、用户行为、设备运行、市场交易均产生海量数据。数据处理作 ...
2026-09-24 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-09-24在时序数据分析中,大部分业务数据并非持续平稳变化,而是会在某些时间节点出现突然抬升、断崖下跌、趋势反转、波动异变等现象, ...
2026-09-23在统计学与数据分析中,研究多组数据差异最常用的方法为单因素方差分析与事后多重比较。很多数据分析初学者容易混淆两者功能,认 ...
2026-09-23