京公网安备 11010802034615号
经营许可证编号:京B2-20210330
你信步走进一家赌场。在赌场门口,你能领到一张电子磁卡。这张电子磁卡会记录下你的一些基本信息,比如你是男性还是女性、多大年纪、什么种族。它还能记录下你每一次赌博的输赢。
赌徒和赌徒千差万别。有的人进到赌场,输了10块钱就开始痛不欲生,有的输掉100万都面不改色心不跳。但是,不管是谁,都会有一个“痛苦点”。过了这个“痛苦点”,你就再也不愿意回到这家赌场,因为这里是你的伤心地啊。
其实,在你一脚踏进赌场的时候,赌场老板就已经根据他掌握的数据库和你的基本信息,算出了你的“痛苦点”。比如说,像你这种35岁的华人男性“土豪”,“痛苦点”是8000美元。对赌场老板来说,什么是最优的选择?最优的选择就是在你快要达到“痛苦点”的那一刻,让你住手。
于是,神奇的事情发生了。当你输到7900美元的时候,身边会突然出现一个年轻貌美的公共经理。她会跟你说:“先生,玩得很累了吧。我们赌场刚刚请到一位法国大厨,会做最拿手的法国菜。恭喜您,您是我们今天的幸运顾客。我们邀请您带上家人,一起来享用免费的法国大餐”。
这就是伊恩·艾瑞斯(Ian Ayres)在《超级数字天才》(Super Crunchers)一书中讲的故事。艾瑞斯教授是耶鲁大学的一位计量经济学家,也是大数据的推崇者。和其他的大数据推崇者一样,他在书中讲了很多“超级数字天才”战胜各路专家的励志故事。
过去,球探们靠一场场地看比赛,靠自己多年积累下来的经验,挑选潜在的棒球明星。但就有一个球队的经理不信邪,他请了个经济学家,帮他用数学模型来选球员。结果,他们球队赢了(这个故事可参看获奖电影《点球成金》)。
品酒师也是个高度依靠经验和天赋的行业,但偏偏杀进一匹黑马,一个普林斯顿的经济学家声称他不用品尝葡萄酒,只要看看一连串降雨、气温的数据,就能预测出某一年葡萄酒的品质。
结果,他的预测居然是对的。有个病人得了一种怪病,一群医生围着她束手无策。病人自己说,我可能得的是某某病。结果,她说的是对的。医生们奇怪地问她:“你是怎么知道的?”她说:“很简单,我在Google里输入自己的主要症状,结果就自动出来了”。
伊恩·艾瑞斯情不自禁地引用《圣经》赞美大数据:
“耶和华啊,你已经鉴察我,认识我。
我坐下,我起来,你都晓得;
你从远处知道我的意念。
我行路,我躺卧,你都细察;
你也深知我一切所行的。”(《诗篇139》)
但对你我这些并非“超级数字天才”的凡人来说,大数据的到来,到底是福是祸?
当然,大数据会给我们带来很多便利,如同过去的一切技术进步一样。大数据能够打破信息不对称的壁垒,那些装模作样、自己都不知道自己在说什么却又能发号施令的“专家”们,以后可要小心了。
我们可能会拿着电脑上打印下来的资料,质问医生为什么这么给我们开药。我们也可以要求政府公开更多的数据,以便公众的参与和监督。
但是,真的会是这样吗?在一个信息已经爆炸的年代,更多的数据很可能只会使你越来越糊涂。数据分析师纳特·西尔弗(Nate Silver)在《信号与噪音》(The Signal and the noise)一书中就讲到,信息增长的速度远远快于真理增长的速度,一个自然的推论是,在日益增长的信息中,噪音的比重会越来越高。
别忘了,在大多数情况下,你不会想到怎么用大数据去“掘金”,你只是一个普普通通的消费者。在大数据的时代,当你收到“超级数字天才”送来的礼物时,你会怎么想呢?
如果你是一个赌徒,当你的身边突然出现了一个漂亮的公共经理,那很可能意味着,你的最后一分钱已经被别人榨干了。传统的经济学教科书告诉我们,商家很难对不同的消费者搞价格歧视。有精明的消费者,也有懒惰的消费者。
精明的消费者会为了买到一条最便宜的牛仔裤把全城的商场都逛一遍,懒惰的消费者随便找一家商场买了就走。但是,懒惰的消费者会搭精明消费者的便车,他只要知道精明的消费者去哪家商场购物,跟着进去就行。结果,商家不得不对所有的消费者统一定价。
但是,在大数据时代,“超级数字天才”们会比你自己更了解你的行为。你以为自己与众不同,其实你和别人一样。他一眼就能看出来,像你这样的人,能买得起多少钱的衣服、一年会旅游几次、什么时候你会想起来健身、什么时候你可能会生病。
商家可以精准地根据每个人的心理底价报价。“超级数字天才”们能干得事情更多,他根据Visa卡的消费记录,就能预测你未来五年的离婚概率。他甚至能知道,像你这样的人,犯罪的概率是多少。
有一天,会不会出现斯皮尔伯格导演的电影《少数派报告》中的一幕:一个人还没有出门就被逮捕,因为根据预防犯罪系统,他出门杀人的概率是99%。会不会有一辆汽车在东四环就被截下来,因为它到天安门爆炸的概率是88%?
为什么“超级数字天才”能如此准确地预知你的行为?因为你把个人信息拱手送给了他们。你从大数据时代得到的便利越多,能守住的隐私权就越少。而且,以后你很可能再也要不回来这些隐私权了。
福布斯中文网上曾经刊登了一篇文章,讲到美国当下最红的资本寡头们不是东部的华尔街巨头,而是西部的科技精英。美国前十家科技公司中有七家都座落在西海岸。诸如亚马逊、苹果、Facebook和谷歌这样的西海岸科技寡头们过去一直对政治很淡漠,但现在也开始积极影响政治。他们会要什么?
首先,许多科技企业赚钱赚得很多,交税却交得很少。他们很可能会强烈地要求保留自己的优惠特权。其次,他们很可能会努力促使网民隐私变得更加难以得到保护,因为他们的大量利润依赖于掌握并出售用户的个人信息。
美丽的大数据、神奇的大数据已经降临。问题是,你是否已经准备好了,像信主一样去信仰大数据?
“我往哪里去躲避你的灵?
我往哪里逃,躲避你的面?”(《诗篇139》)
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13在数据统计分析与数据清洗工作中,箱线图是一种简洁高效、客观性强的数据可视化图表,能够直观呈现数据集的分布特征、离散程度和 ...
2026-08-13 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-08-13在自动化办公、数据采集、定时统计、日志清理、系统监控等场景中,程序往往需要按照固定时间间隔重复执行指定任务,这种运行机制 ...
2026-08-12在数据分析日常工作中,Excel数据筛选是数据清洗、数据提取、样本筛选的核心基础操作。传统Excel手动筛选、函数筛选方式,面对多 ...
2026-08-12 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-08-12在数据分析、统计建模、数据挖掘与商业调研过程中,原始数据往往无法做到绝对干净规整。受系统故障、人工录入失误、设备误差、突 ...
2026-08-11在数据分析工作中,聚类分析是典型的无监督学习方法,核心作用是依据数据自身的多维特征,将相似样本自动划分为若干类别,实现“ ...
2026-08-11 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-11AB实验是互联网产品迭代、营销优化、功能升级的核心科学验证手段,通过流量随机分组、对照组与实验组对比,科学验证策略、功能、 ...
2026-08-10在MySQL数据库优化中,索引是提升查询效率、降低数据库IO开销、优化系统性能的核心手段。普通单列索引仅适配简单查询场景,面对 ...
2026-08-10