
三招揪出问卷中的李鬼_数据分析_大数据
相信许多做个调查报告的人都会有这样的问题——问卷的不真实使得数据分析不能。但是如果能在问卷整理的时候就及时发现问题,那么你就不会在deadline的前夜被劣质的数据折磨的如此狼狈不堪。现在,我"数据分析师"分享一下数据抓鬼的三班斧,一来能帮你审核数据、辨识真假,使得从统计秘籍上学来的分析招数能有用武之地;二来也能间接自律一下前线的调研,顺便整治一下市调行业的不良之风。
第一招:设置同质题目,一个问题,多处提问。
同质题目是指一个问题在问卷中设置两种问法,对一个受访者访问两次,只要这两个答案不一致,哈哈虚假数据!比如:年龄和身份证号码一起问,小孩的年龄与年级一起问。还有就是利用态度量表,设计正反问法。例如在一份测度啤酒消费习惯的态度量表中,问题1是:“我很喜欢喝啤酒”和问题5是“要不是应酬的需要,我绝对不喝啤酒”一对同质问题,设置“非常符合、比较符合、不太符合、与表述相反” 并赋值“1、2、3、4”。当某个案,问题1与问题5的选项之和超出【4,6】的范围,我们可以判定是虚假个案。比如:问题1选1,问题5选2,两者相加得分为3;问题1选3,问题5选4,两者相加得分为7。3分和7分都超出了所能容忍的范围,判处该个案死刑。
第二招:测度选项比例,判定虚假。
一般来说,数据分析师通过分析每一份个案中同一选项的比例,可以发现虚假数据。比如,在某个30道题目的调查问卷中,某选项的比例超过70%,比如70%的选项全是C,则可将该份问卷判定为虚假问卷。同理,通过计算某个访问员所有调查问卷中选项的比例,如果某一项的比例超过阀值,则可以认定该访问员造假。那么不要手软,坚决对该访问员判死刑。
第三招:测度总分分布,衡量整体质量。
这里重点介绍如何通过测度数据的分布,来判定调查问卷数据的可靠性。以满意度调查为例。数据分析师在对数据量表量化之后,可以计算出每个个案所有量表的总分。比如,一共有30题,每题的得分范围为1-10分。那么总分的理论取值范围就是30-300。如果我们一共收集了500份问卷,那么就应该有500个总得分。理论上讲,一项服务的满意度应该服从正态分布。因为大多数被访者的评价应该差不多,高分和低分的评价应该比较少。当然,这只是经验判断。那么现在我们来看,调查结果的总得分分布,如果接近正态分布,则可以说明该调查数据是可信的。如果数据远远偏离正态分布,则认为该数据存在比较严重的质量问题。这样任何分析都是没有意义的,应该对本次调查判死刑。
招外招:记录填写时间,越短越可疑。
最后,分享一个招外招。如果你做的是网络调查,那么这一招很管用,堪称绝招。具体做法就是系统自动记录用户的答题时间。如果用户答题所用的时间很短,则认为该用户纯粹是在骗奖品。如果你们的服务器很牛b,牛b到可以记录被访者填写每一道题目的时间耗费,那么纵然李鬼潜伏的再深,也得乖乖束手就擒。cda数据分析师培训
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01CDA 数据分析师:企业数字化转型的核心引擎 —— 从能力落地到价值跃迁 当数字化转型从 “选择题” 变为企业生存的 “必答题”, ...
2025-09-01数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29CDA 数据分析与量化策略分析流程:协同落地数据驱动价值 在数据驱动决策的实践中,“流程” 是确保价值落地的核心骨架 ——CDA ...
2025-08-29CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-08-28CDA认证:数据时代的职业通行证 当海通证券的交易大厅里闪烁的屏幕实时跳动着市场数据,当苏州银行的数字金融部连夜部署新的风控 ...
2025-08-28PCU:游戏运营的 “实时晴雨表”—— 从数据监控到运营决策的落地指南 在游戏行业,DAU(日活跃用户)、MAU(月活跃用户)是衡量 ...
2025-08-28Excel 聚类分析:零代码实现数据分群,赋能中小团队业务决策 在数字化转型中,“数据分群” 是企业理解用户、优化运营的核心手段 ...
2025-08-28CDA 数据分析师:数字化时代数据思维的践行者与价值推动者 当数字经济成为全球经济增长的核心引擎,数据已从 “辅助性信息” 跃 ...
2025-08-28ALTER TABLE ADD 多个 INDEX:数据库批量索引优化的高效实践 在数据库运维与性能优化中,索引是提升查询效率的核心手段。当业务 ...
2025-08-27Power BI 去重函数:数据清洗与精准分析的核心工具 在企业数据分析流程中,数据质量直接决定分析结果的可靠性。Power BI 作为主 ...
2025-08-27CDA 数据分析师:数据探索与统计分析的实践与价值 在数字化浪潮席卷各行业的当下,数据已成为企业核心资产,而 CDA(Certif ...
2025-08-27t 检验与 Wilcoxon 检验:数据差异比较的两大统计利器 在数据分析中,“比较差异” 是核心需求之一 —— 如新药疗效是否优于旧药 ...
2025-08-26季节性分解外推法:解锁时间序列预测的规律密码 在商业决策、资源调度、政策制定等领域,准确的预测是规避风险、提升效率的关键 ...
2025-08-26CDA 数据分析师:数据治理驱动下的企业数据价值守护者 在数字经济时代,数据已成为企业核心战略资产,其价值的释放离不开高 ...
2025-08-26