京公网安备 11010802034615号
经营许可证编号:京B2-20210330
认清大数据四大误区:大数据终将消除经济自由是最大谬误
在互联网时代,大数据已充斥了我们生活和工作的方方面面。有了大数据,人们对于经济社会的认识与把握进入到一个全新的时代,即进入到一个较信息经济更高位阶的新阶段,也就是“数字经济”。数字经济时代,似乎“谁”“掌握”了大数据,就能够对经济活动乃至经济社会做到“全知”,进而能够“预知”经济社会的未来,甚或能够“全能性”地主宰经济社会,但其实这些都是关于“大数据”的认识误区。
误区一:大数据终将主宰经济社会,消除个体差异,成就一元化的经济体系。
网络经济时代,人们在经济社会中的诸种活动通过网络账户体系来实现,这些活动也就是所谓的网络账户活动,其基本内容更多地体现为账户间的关系。这些账户活动及其账户关系是由数字网络程序所设定的、驱动的,且被实时地记录下来。这就形成了所谓的“大数据”。因此,大数据来源于大量的网络账户的活动及其有效的记录,简言之,大数据是网络账户数据。
有人认为,大数据意味着“全知”,进而“全知”意味着“全能”,发展开去,大数据终将主宰经济社会,消除个体差异,成就一元化的经济体系。这是关乎大数据最大的谬误。
“大数据”是“经济自由”所投射下的数字影像,它无法反噬掉“经济自由”,成为经济社会的主宰。经济社会中的大数据,是经济活动的网络化、账户化、数字化的产物,是经济人自由意志的集合映射。换言之,没有高度的经济自由,没有充分而多样化的经济选择,就无所谓“大数据”。
大数据就是社会经济活动的一层“数据化的外衣”而已,不管它多么服帖、合体或随心,活动着的是里面的“身体”,且这个“身体活动”是自由意志所决定的。如果认为掌握了大数据就能影响乃至决定人们的经济决策,将自身的意志贯彻到别人的头上去,这就是本末倒置了。
误区二:大数据是全量数据,能够预知未来。
“大数据”并不能“全能性”地预设未来,但是能否“先知”般地预知未来?同样,做不到。因为,大数据在时间上是有约束条件的。依凭历史数据,能够预知未来吗?
大数据是全量数据,源于事实,也是事实,它并非既有经济理论变量性的函数分析,并不能在时间轴上理所应当地延展开去。在时间轴上,大数据终归是局部的,远非全量,它是实然的,是已发生的,即其性质上仍然是历史数据而已。
大数据本身不是先知,也没有谁能通过大数据成为先知。基于大数据并不能建构所谓的“历史规律”,更谈不上把同大数据有所谓“关系”的某人或某类人嵌入到这一所谓的历史规律中去,进而使其发挥主观能动性,担纲某种角色。历史数据对于未来有一定的作用,但是根本上讲,历史数据并不能决定未来。没人能够凭依大数据而可预知未来,成为先知。
误区三:大数据包揽一切信息。
数据的标准化与格式化,决定了大数据不是“全息”的。
全知是指在一定标准或口径下的全量数据,但并不意味着包揽所有信息。信息的完整性是一个抽象而复杂的问题。数据信息往往是静态的,是在一定时间点下的结论,其被有效地获取甚或表达出来,就意味着一部分信息是确定的、静态的,而另一部分则是不确定、动态的。这就好像猫的眼睛一样,当你用相机去拍摄它时,它便发生变化,也就是必然丢失掉或隐去一部分信息。所以,全知是就对象自身而言的,并非是与对象有关的全部信息而言的。
现实中,人们对于大数据的感受确是非常丰满有力、醒目而刺激的,这种情况一时间使人们感性上误以为这就是全息的。事实上,这种情形以往也反复出现过,有如第一次听到电话听筒里传来另一端亲友的话语,便以为那是真声音。
误区四:把“大数据”当作“小数据”用,分析采用部分局部数据。
经济社会中,如果取得的数据样本有限,就需要确立有效的分析框架,建立模型,确立函数关系,做回归分析。然而,如果样本不仅是充分的,而且是完整的,是全量的,那么数据分析就要摆脱既有的旧模式了。从全样本的大数据中,收窄样本数量,只选取部分样本用来分析,是一种缩量的方法,缩量样本分析后的结论又要适用于总量,这就是对大数据的“小用”。
举例来说,如果能够获得一个城镇全部机动车以及全部外埠入城车辆的运行状况,我们就可依所设议题来直接抓取数据,获得结论。抽样建模分析及其回归分析,就不仅累赘,而且极有可能铸成大错。简单来说,大数据,就是扳手指头数不过来的状况,交给机器与程序去“扳”,不仅数得过来,而且数出来了。大数据往往更多地可以直接抓取并使用,而非在数理化、模型化、函数化等“加工”后再使用。
大数据具有完整性和全局性的特质,如果采用部分局部数据,然后试图得出超出部分局部数据范围的结论,这种既有的思维惯性,并不适用于大数据的逻辑和现实。大数据不能当作小数据用,小数据终归拼不出完整的大数据。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13在数据统计分析与数据清洗工作中,箱线图是一种简洁高效、客观性强的数据可视化图表,能够直观呈现数据集的分布特征、离散程度和 ...
2026-08-13 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-08-13在自动化办公、数据采集、定时统计、日志清理、系统监控等场景中,程序往往需要按照固定时间间隔重复执行指定任务,这种运行机制 ...
2026-08-12