京公网安备 11010802034615号
经营许可证编号:京B2-20210330
"为大数据“去魅” ——对《大数据时代》的一点反思
去逛一些大型商场,有时你会发现,啤酒旁边摆放的竟然是尿布。这种做法最先起源于沃尔玛,沃尔玛通过对超市人群购买行为的大量数据分析,发现男性来买啤酒的时候,通常也会买尿布。于是超市将尿布和啤酒摆放在一起出售,从而提高利润。
尿布与啤酒之间的奇妙关联,背后是大量数据的挖掘与分析。这个小小的案例体现的便是一种大数据思维。维克托迈尔舍恩伯格在《大数据时代》提出大数据思 维的三个原则:一、不是因果关系,而是相关性;二、样本=全部不是随即样本,而是全部数据;三、不是精确性,而是混杂性。也就是说,大数据经 由尽可能多的数据挖掘出那些我们平时根本无法察觉到的隐秘联系,轻松地知其然,即使我们完全不知其所以然。
大数据描绘了一个激动人心的未来,也难怪很长一段时间以来,大数据成为最热门的概念之一。人们对大数据的拥趸和美好想象,一方面是我们生活的世界正在 数据化:物联网上,购买行为的数据化;导航时,方位的数据化;微博微信上,沟通的数据化这为大数据时代提供了可能;另一方面,现代社会仍面临 着许多未解的难题,许多跨不过的障碍,人们期冀于大数据能够力挽狂澜,帮助现代人走出困境。
在这样的背景下,大数据正被不断神化。纽约时报专栏作者大卫布鲁克斯《大数据不能做什么?》很难得地发出了不同的声音。他指出大数据的几个缺陷。首 先,大数据擅长于分析关系的数量而非质量,因此它会忽略很多举足轻重的信息。比如社交网络的数据可以分辨出你的6个同事,你一天中有76%的时间会见他 们,却很难发现你一个一年只见两次面的童年伙伴。其次,大数据不懂背景。我们说一句话究竟是认真的还是开玩笑,是为了表达愤怒还是善意,这些要放在具体语 境分析,数据分析很难搞清楚这些。还比如大数据会带来大量毫无意义的伪相关;数据偏爱潮流,忽视创新;原始数据其实并不原始,原始数据往往会被扭曲,等 等。
除此,也有人以为,大数据最大的问题在于,它过分夸大了数据的作用,以为数据越多越好。事实上,我们最大的难题永远都不是如何获取数据,而是如何找到数据 之间的联系,近十年来概率模型应用的规模一再扩大,可准确率却停滞不前这个教训不该被忘记。啤酒与尿布只是最表层数据挖掘,真正的数据处理比谷歌翻译 复杂成千上万倍,但即便谷歌翻译已如此先进,你也别指望它信达雅。一个太平洋是水,加个大西洋也是一样的水,数据规模到达一定程度之后,继续 扩充的意义已经不大,没有发现关联,再多数据也百无一用,混杂性其实就是伪相关。
人人呼唤大数据,就像人人都呼唤要创新、要改革。然而,问题的难度永远在于:如何创新,如何改革。我们需要大数据思维为我们点亮思想的火花,但同时必须正 视寻找数据关联存在的巨大艰难。否则,大数据很容易成为一个空洞的原地打转的话语,徒然给了很多人打了鸡血般的鲁莽和热情,投入大量的人力物力财力,以为 挖到了一座金山,实际却是一堆无用的数据。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10