京公网安备 11010802034615号
经营许可证编号:京B2-20210330
“大数据”突然间变得无处不在,似乎每个人都想收集、分析大数据、并从中获利,同时也有人在夸耀或者害怕它的巨大影响。不论我们是在讨论利用谷歌庞大的搜索数据来预测流感的爆发还是利用通话记录来预测恐怖活动,又或者是利用航空公司的数据找到买机票的最佳时机,大数据都可以帮上忙。将现代计算技术和数字时代众多的数据结合起来,似乎可以解决任何问题——犯罪,公共卫生,用语的变化,约会的危险,只要我们把这些数据利用起来。
似乎它的拥护者这样宣称。“在接下来的二十年,”记者帕特里克·塔克在他最近的大数据声明中这样写道,“是透明的未来,”“我们可以以一种前所未有的准确度预测未来的诸多领域,甚至包括一些长久以来被认为人类无法干预的领域。”但大数据其实从来没有听上去那么好。
大数据真的像说的那么好?毫无疑问大数据确实是一个有价值的工具,并在某些领域产生了至关重要的影响。比如,几乎近二十年人工智能计算机程序的成功,从谷歌的搜索引擎到IBM的沃森电脑问答系统,都包括了大量数据的处理。但是正是因为它最近如此受欢迎并得到广泛应用,我们需要清晰的看待大数据究竟能做什么和不能做什么。
大数据能告诉我们是什么,但不能告诉我们为什么
首先,尽管大数据能够非常好地检测相关性,特别是那些用小数据集可能无法测出的微妙相关性,但是它并不会告诉我们哪一种相关性是有意义的。比如,大数据分析可能会揭示从2006年到2011你那美国谋杀案比例与IE浏览器的市场份额是极度相关的,都呈急速下降趋势。但是很难相信这两者之间有什么因果关系。又比如,从1998到2007被诊断出的自闭症患者与有机食物的销售具有相关性(都呈急速上升趋势),但是这种相关性本身不会告诉我们饮食和自闭症的关系。
大数据只能是辅助工具
第二,大数据可以辅助科学调查,但不可能成功地完全代替。比如,分子生物学家很想从潜在的DNA序列中推断出蛋白质的三维结构,有一些科学家已经在用大数据来解决这个难题。但是没有任何科学家认为你可以完全依靠处理数据来解决这个难题,不论这个数据分析是多么的强有力,你依旧需要基于对物理和生物化学的理解上来处理这些数据。
基于大数据的工具易造假
第三,基于大数据的很多工具很容易造假。批改学生作文的大数据程序通常依赖于句子长度和用词的复杂性,数据表明这和老师批改的分数很相关。但是一旦学生知道这个程序如何运作,他们就开始写一些长句子并用晦涩的词语而不是去学会如何规范清晰的表达,组成连贯的篇章。甚至谷歌的著名的搜索引擎,这个通常被认为成功的大数据案例也不能免于信息繁杂,无用的搜索结果,一些人为的原因使得一些搜索结果排在前面(搜索广告)。
通过大数据下结论是有风险的
第四,即便大数据的结果没有人为地造假,但是它看上去也不那么有效。比如谷歌预测流感的案例曾经是大数据的典范。2009年,谷歌通过相当大的宣传称它可以通过分析与流感相关的搜索预测流感爆发的趋势,这种准确性和快速甚至超过了疾病控制和预防中心等官方机构。但是几年后,谷歌宣称的流感预测并没有得到好的结果,最近两年,它做的更多地是不准的预测。
最近一篇《科学杂志》的文章解释道,谷歌流感预测的失败很大程度上是因为谷歌搜索引擎自己在不断的更新,这个时候收集的数据未必能够适用于下一个时候收集的数据。正如统计学家冯启思(《数据统治世界》的作者)所说的,依赖于网站的大数据收集常常把一些用不同方法、有不同目的数据整合起来,有时候这会产生负面的影响。从这样的数据样本得出结论是需要冒风险的。
大数据的智能应用会导致错误被加强
第五个需要注意的就是“恶性循环”,这也是因为大量的数据都来自于网络。不论何时,大数据分析的信息源本身就是一种大数据产品,这很可能会导致恶性循环。谷歌翻译等翻译程序是从不同语言中抽取相似的文本去辨别这些语言的翻译模式,比如同样的维基百科条目有两种语言。这是一个很合理的策略,要不是有很多语言并不具有太多相似性,维基百科自己都可以用谷歌翻译写条目。在这种情况下,任何谷歌翻译的错误都会影响维基百科,而这又会反映到谷歌翻译上,使这种错误不断加强。
大数据可能会导致大错误
第六个需要担心的就是太多相关性导致的危险。如果你在两个变量中不断地寻找相关性,那么你很可能会纯粹出于偶然发现虚假的相关性,即便在这些变量中并没有实际意义的联系。缺乏谨慎的检查,大数据的量级会扩大这些错误。
听上去科学的解释未必正确
第七,大数据很容易对那些无法精确的问题给出听上去很科学的解释。比如在过去几个月,基于维基百科的数据给人们排名有两个不同的尝试:根据历史重要性或者文化贡献。其中一本书叫做《谁更强?历史人物真实的排名在哪里》,作者是电脑工程师Steven Skiena 和工程师Charles Ward,另一本叫做《万神殿》,来自于麻省理工学院媒体实验室项目。
这些尝试在某些方面是正确的,耶稣、林肯、莎士比亚确实是极为重要的人物,但是两者都犯了一些严重的错误。《谁更强?》指出法兰西斯.史考特.凯伊(Francis Scott Key )在历史上是19世纪最重要的作家,远远超过简·奥斯汀(第78名)和乔治·爱略特(第380名)。更严重的是,两本书呈现出了利用所谓的精确误导人,而在本质上是模糊升值无意义的。大数据可以把任何事都简化为数字,但是你不应该被这些“科学”的表现愚弄。
罕见事件,大数据不起作用
最后,大数据在分析那些普通事件很在行,但是在分析罕见事件常失败。比如,用大数据处理文本的程序如搜索引擎和翻译程序,常常依赖于所谓的“三字”:连续三个词的序列(比如“in a row”)。可靠的数据信息可以编制常规的三字模型,正是因为他们常出现,但是现有的数据并没有多到足够包括人们可能使用的所有“三字”,因为人们在不断创造新语言。
随便挑一个例子,Rob Lowe 最近为报纸写的书评有九个“三词序列”比如“dumbed-down escapist fare”,这在谷歌的文本里从未出现过。对于这些新鲜词汇谷歌有很多限制,谷歌将“dumbed-down escapist fare”西安翻译为德文然后再翻译为英文,最后出现了这样一个不合逻辑的词语“scaled-flight fare.”Lowe先生的本意和利用大数据的翻译真是完全不搭边。
等等,我们几乎忽略了最后一个问题:炒作。大数据的支持者宣称它是革命性的进步。但是即便是给出大数据的成功例子,比如谷歌流感趋势的预测,即便有用但对于一些更大的事这些显得微不足道。相比19世纪和20世纪的伟大发明比如抗生素,汽车,飞机,大数据所得出的东西实在算不了什么。
我们需要大数据,毫无疑问。但是我们也需要更加清醒的认识到,这只是一种每个人都可以分析的重要资源,并不是什么新技术。
是在讨论利用谷歌庞大的搜索数据来预测流感的爆发还是利用通话记录来预测恐怖活动,又或者是利用航空公司的数据找到买机票的最佳时机,大数据都可以帮上忙。将现代计算技术和数字时代众多的数据结合起来,似乎可以解决任何问题——犯罪,公共卫生,用语的变化,约会的危险,只要我们把这些数据利用起来
似乎它的拥护者这样宣称。“在接下来的二十年,”记者帕特里克·塔克在他最近的大数据声明中这样写道,“是透明的未来,”“我们可以以一种前所未有的准确度预测未来的诸多领域,甚至包括一些长久以来被认为人类无法干预的领域。”但大数据其实从来没有听上去那么好。
大数据真的像说的那么好?毫无疑问大数据确实是一个有价值的工具,并在某些领域产生了至关重要的影响。比如,几乎近二十年人工智能计算机程序的成功,从谷歌的搜索引擎到IBM的沃森电脑问答系统,都包括了大量数据的处理。但是正是因为它最近如此受欢迎并得到广泛应用,我们需要清晰的看待大数据究竟能做什么和不能做什么。
我们需要大数据,毫无疑问。但是我们也需要更加清醒的认识到,这只是一种每个人都可以分析的重要资源,并不是什么新技术。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27在数字化时代,企业积累的海量数据如同散落的珍珠,若缺乏有效的梳理与分类,终将难以发挥实际价值。CDA(Certified Data Analys ...
2026-02-27在问卷调研中,我们常遇到这样的场景:针对同一批调查对象,在不同时间点(如干预前、干预后、随访期)发放相同或相似的问卷,收 ...
2026-02-26在销售管理的实操场景中,“销售机会”是核心抓手—— 从潜在客户接触到最终成交,每一个环节都藏着业绩增长的关键,也暗藏着客 ...
2026-02-26在CDA数据分析师的日常工作中,数据提取、整理、加工是所有分析工作的起点,而“创建表”与“创建视图”,则是数据库操作中最基 ...
2026-02-26在机器学习分析、数据决策的全流程中,“数据质量决定分析价值”早已成为行业共识—— 正如我们此前在运用机器学习进行分析时强 ...
2026-02-25在数字化时代,数据已成为企业决策、行业升级的核心资产,但海量杂乱的原始数据本身不具备价值—— 只有通过科学的分析方法,挖 ...
2026-02-25在数字化时代,数据已成为企业核心资产,而“数据存储有序化、数据分析专业化、数据价值可落地”,则是企业实现数据驱动的三大核 ...
2026-02-25在数据分析、机器学习的实操场景中,聚类分析与主成分分析(PCA)是两种高频使用的统计与数据处理方法。二者常被用于数据预处理 ...
2026-02-24在聚类分析的实操场景中,K-Means算法因其简单高效、易落地的特点,成为处理无监督分类问题的首选工具——无论是用户画像分层、 ...
2026-02-24数字化浪潮下,数据已成为企业核心竞争力,“用数据说话、用数据决策”成为企业发展的核心逻辑。CDA(Certified Data Analyst) ...
2026-02-24CDA一级知识点汇总手册 第五章 业务数据的特征、处理与透视分析考点52:业务数据分析基础考点53:输入和资源需求考点54:业务数 ...
2026-02-23CDA一级知识点汇总手册 第四章 战略与业务数据分析考点43:战略数据分析基础考点44:表格结构数据的使用考点45:输入数据和资源 ...
2026-02-22CDA一级知识点汇总手册 第三章 商业数据分析框架考点27:商业数据分析体系的核心逻辑——BSC五视角框架考点28:战略视角考点29: ...
2026-02-20CDA一级知识点汇总手册 第二章 数据分析方法考点7:基础范式的核心逻辑(本体论与流程化)考点8:分类分析(本体论核心应用)考 ...
2026-02-18第一章:数据分析思维考点1:UVCA时代的特点考点2:数据分析背后的逻辑思维方法论考点3:流程化企业的数据分析需求考点4:企业数 ...
2026-02-16