京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据分析一定要避免辛普森悖论
辛普森悖论是一种统计现象,实验群体由具有不同统计特性的子群体组成,观察到的现象是总体水平可能与单个子群体的水平不相关。换句话说,辛普森悖论是在一个数据集中的变量被分组之后,他们之间的相关性可能会发生改变。
辛普森悖论在数据集方面看上去广泛,而且没有被分解成有意义的片段。辛普森悖论是研究中被忽略的“混淆变量”结果。混淆变量本质上是一个与核心研究无关的变量,它随着自变量的改变而改变。
例如,一个移动应用程序的用户群,其中1万人使用Android设备,5千人使用iOS设备。用户的总体转化率是5%,iOS设备的转化率是4%,Android设备的转化率是5.5%:
假设相同的货币化(也就是Android用户和iOS用户在游戏中花的钱一样多),资源有限的产品经理可能根据这些数据会做出一些极端的决定,也许会优先考虑安卓功能的开发,甚至干脆取消iOS项目。
然而当数据按照设备再次细分,用户群的不同的情况如下:
现在发现iOS平板的转换率比Android平板高一点,iOS手机的转换率同样比Android手机高。如果看到了这一点,产品经理可能会对未来的产品做一系列不同的决策。
在这种情况下,设备类型是一个混淆变量:当数据按照设备类型细分,子群体具有完全无法相比的统计特性。
iOS能在设备转化方面打败Android,但是在整体水平上却输给Android的原因是,每个平台的设备类型不同:平板的转化率比手机的转化率高,在这个用户群中,iOS平板占iOS设备的比例(30%)低于Android平板所占的比例(80%),尽管Android平板上的转化率比IOS低。 把数据混合到一起就变成一个很大的问题,去比较两组与完全不同的属性的东西 —— 就像是去比较苹果和橙子的区别一样。
混淆变量经常用于分析免费增值产品,有以下几个原因:
1. 基数大小。免费增值产品因为固有的低转化率需要大量用户基数来产生收入。这些庞大的用户通常由来自世界各地,来自不同地区,并且使用设备广泛。这种多样性的呈现致使比较后的平均值几乎没有任何意义;
2. LTV曲线。免费增值产品受益于长尾货币化曲线。为了娱乐而消费的使用者,消费的指标可能很接近,因此可以作为分界的界限。
3. 大部分用户不会消费。先前提到的免费增值产品的固有低转化率 作为一个基本的区分两类用户而存在 :付费和非付费。基于这个原因,把非付费用户群作为一个整体的任何指标都是有缺陷的,因为它把所有指标都倾斜到了绝大多数永远不会付费的用户(这就是为什么最低可行的指标模型包括ARPU和ARPPU)
避免辛普森悖论的关键——关于用户基础的结论,不反映现实的不同类型的用户与产品的交互——是明智地应用维度分析。用户细分在数据分析中是非常重要的,特别是对免费增值产品,“普通用户”不仅不存在,而且他的特征作为一个警示,避免开发人员被误导。当一个用户群以广泛多元化的特征存在时,通用数据是无用的。
当考到产品开发路线图时,用户分类是至关重要的:如果数据分析表明哪些特性由于确定非常有价值而优先开发,那么它同时也决定了应该给哪些人做推销以增长用户群。也正因此,从聚类分析得出似是而非的结论,不仅会造成开发错误功能,也会把更多错误的用户加入到用户群中。
为了避免这种情况,用于优先功能开发的基本维度(“过滤器”,或用户特性),应该在用户分类方面建立粗糙集。对于移动产品,最基础的设置一般包括:
位置(国家)
设备(平台、外形,设备型号)
采集源;
早期行为线索( 如盈利/ 参与里程碑);
加入日期(用于控制季节性)
对于一些收购渠道(如Facebook),其他人口统计数据点,如年龄,性别等可能也是重点。
用这些维度进行分析比先前引用的“iOS和Android”的例子提供了更为可靠的见解。最终分析的目标是为真正使用它的人改善产品。如果这个分析在一个错误的前提下进行,那么用户的真正问题并不会得到解决。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20定量报告的核心价值是传递数据洞察,但密密麻麻的表格、复杂的计算公式、晦涩的数值罗列,往往让读者望而却步,导致核心信息被淹 ...
2026-01-20在CDA(Certified Data Analyst)数据分析师的工作场景中,“精准分类与回归预测”是高频核心需求——比如预测用户是否流失、判 ...
2026-01-20在建筑工程造价工作中,清单汇总分类是核心环节之一,尤其是针对楼梯、楼梯间这类包含多个分项工程(如混凝土浇筑、钢筋制作、扶 ...
2026-01-19数据清洗是数据分析的“前置必修课”,其核心目标是剔除无效信息、修正错误数据,让原始数据具备准确性、一致性与可用性。在实际 ...
2026-01-19在CDA(Certified Data Analyst)数据分析师的日常工作中,常面临“无标签高维数据难以归类、群体规律模糊”的痛点——比如海量 ...
2026-01-19在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16在游戏行业“存量竞争”的当下,玩家留存率直接决定游戏的生命周期与商业价值。一款游戏即便拥有出色的画面与玩法,若无法精准识 ...
2026-01-16为配合CDA考试中心的 2025 版 CDA Level III 认证新大纲落地,CDA 网校正式推出新大纲更新后的第一套官方模拟题。该模拟题严格遵 ...
2026-01-16在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12