京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据何以成为“主义”
数据者,有广义与狭义之分。狭义的数据,就是数字或数值,如1、2、3、4、5⋯⋯;广义的数据,则可概括为人类观察、实验、计算等的记录。
作为这些记录的符号,或数字,或文字,或图像,或音视频,从上古时代的结绳记事、楔形文字、甲骨文,到古代乃至现代以竹简、布帛、羊皮、纸张等为载体的图文,直至现在以比特为单位的电子信息,可谓无所不包。
也许,正是由于互联网技术工程师们习惯于把以电子信息方式存在的内容统称为“数据”,于是,“数据”一词便由狭义的“数字”或“数值”演变为主要指向通用的广义“数据”。
随着计算机、互联网、现代通信以及相关软硬件技术的飞速发展,大数据和云计算,如同一枚硬币不可分离的两面,成为我们这个时代的高频词。
大数据之大,不仅大在巨量或海量——由人们熟知的千字节(KB)、兆(MB)、千兆(GB)和太字节(TB),跃升为专业人士才了解的拍字节 (PB)、艾字节(EB)、泽字节(ZB),乃至尧字节(YB)。 (1KB=1024B,1MB=1024KB,1GB=1024MB,1TB=1024GB,1PB=1024TB,1EB=1024PB,1ZB=1024EB,1YB=1024ZB)。
其中,不变的是基本单位B,即比特或字节,而从K到Y,则是成千倍的递增,以致有人据此宣称,目前的数据计算已经进入“PB时代”。
大数据之大,还大在数据结构的有容乃大——它不再需要传统的数据库表格来整齐排列,几乎可以无所不包地记录、存储和计算各种规则的结构化数据和不规则的非结构化数据,于是,便有了逐步演变为一个数字化世界的可能。
如此庞大和复杂的数据,远远超出传统计算机的处理能力,于是,建立在互联网基础上的云计算技术应运而生,承担起存储、传输、计算和应用大数据的重任。而正是大数据与云计算的有效互动,打开了世界观、方法论乃至价值观的新视野。
在本书中,作者引用专业研究机构的统计,揭示了大数据的规模与速度:一方面,到2014年,全世界电子化数据已增至4.4ZB,即4.4亿万亿 字节,如果将如此之巨的信息量存入只有7.5毫米厚的苹果平板电脑,后者叠加起来的厚度可达地球与月球间距离的2/3;另一方面,有史以来90%的数据 量,都是在过去两年的时间里产生的。
由此不难预期,一个电子化的、独立于物质世界的“数字世界”,正在大数据和云计算的互动中迅速构建,它虽然不可能穷尽物质世界全部存在,越来越逼近物质世界本体却是不争的事实。
尤为值得注意的是,许许多多以往被闲置的数据,由于一些精明商家的开发和利用,开始“变废为宝”。一个耳熟能详的案例,就是那个“尿片+啤酒” 的商业发现与行动。世界最大零售商沃尔玛通过大数据统计和分析发现,男性顾客在购买婴儿尿片时,常常会顺便买上几瓶啤酒,于是推出将啤酒和尿片捆绑销售的 促销方式,从而有效地提高了啤酒销量。
凡此种种表明,如同宇宙大爆炸般飞速扩张的“数字世界”,不仅日益成为外在的客观物质世界的“镜像”,而且正在越来越多地包含对人类自身行为的追踪和记录,成为人类观察和认识自我的“镜子”。
二者的叠加,形成一个有趣的悖论:由大数据构筑而成的数字世界,在日趋脱离客观物质世界的同时,又越来越接近世界的本原。因此,人们在解码这样一个虚拟世界的同时,也在一定程度上改变着对世界的看法。
然而,就在哲学家们对数字世界的属性还没有来得及给出明确界定之际,为利益所驱动的商家们却迫不及待地启动了对这一新矿藏的发掘。
它们是如此急切:还没来得及弄清两个相关现象之间的互动机理或因果关系,便急匆匆地将其中的商机转化为提升经济效益的手段;云计算技术刚刚出现,便迅速地将统计分析对象由随机采样拓展为可获取的全部数据;为寻求“大数据的高效率”,不惜置“小数据的精确度”于不顾⋯⋯
回过头来看,正是这近乎“饥不择食”的匆忙,竟在无意中成就了认识数字世界的锁钥:不再执着于因果关联,不再满足于抽样分析,不再一味地追求精 确度的提高,转而直面模糊与混杂,关注看似不相关的相关现象。这一系列有别于以往的方法,为人类认识世界、解决问题提供了传统工具箱中没有的新工具。
诚如史蒂夫.洛尔在本书中的比喻,这些大数据时代的新工具,犹如“望远镜”和“显微镜”。“望远镜”让人们看得更远,发现新的星系;“显微镜”则将比细胞更加微小的世界展示在人们面前,人们据此看到并计量之前一无所知的事物。
抛开学术和技术层面的研讨,大数据及其应用几乎与生俱来就伴随了喋喋不休的争论。
其中有两个关键词,一是“开放”,一是“保护”。如果说开放就是要打破垄断分割,推动信息与数据互联互通;变革体制机制,实现数据资源共有共 享;鼓励技术创新,促进大数据资源开发利用⋯⋯最大限度地拓展数字世界“公共空间”,让大数据和云计算普惠大众,造福人类;那么保护则意味着要在数字世界 为个人留下一方“私密领地”,或者为公权力画上一道不能逾越的“红线”——“风可进,雨可进,国王不能进”。
开放与保护,“公共空间”与“私密领地”,在这里构成既对立又统一的关系。对立在开放与保护“井水不犯河水”,统一在“公共空间”与“私密领地”共存于同一个数字世界,且双方都以对方的存在为自身存在的证据,正所谓没有“公”即没有“私”,没有“私”亦没有“公”。
一言以蔽之,数字世界与现实世界理应奉行同样的价值理念:该开放的一定要最大限度开放,该保护的必须严格加以保护。
本书向读者展示了这样一幅图景:不管你自觉还是不自觉,乐意还是不乐意,大数据正以空前的速度和规模渗透到人类社会生活的方方面面,它在一定程 度上已经和正在改变人们观察、认识、思考乃至生存与发展的方式。特别是这后一方面的变化,或许就是“大数据”之所以成为“主义”的原因。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
线性回归是数据分析中最常用的预测与关联分析方法,广泛应用于销售额预测、风险评估、趋势分析等场景(如前文销售额预测中的多元 ...
2026-03-10在SQL Server安装与配置的实操中,“服务名无效”是最令初学者头疼的高频问题之一。无论是在命令行执行net start启动服务、通过S ...
2026-03-10在数据驱动业务的当下,CDA(Certified Data Analyst)数据分析师的核心价值,不仅在于解读数据,更在于搭建一套科学、可落地的 ...
2026-03-10在企业经营决策中,销售额预测是核心环节之一——无论是库存备货、营销预算制定、产能规划,还是战略布局,都需要基于精准的销售 ...
2026-03-09金融数据分析的核心价值,是通过挖掘数据规律、识别风险、捕捉机会,为投资决策、风险控制、业务优化提供精准支撑——而这一切的 ...
2026-03-09在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心工作,是通过数据解读业务、支撑决策,而指标与指标体系 ...
2026-03-09在数据处理的全流程中,数据呈现与数据分析是两个紧密关联却截然不同的核心环节。无论是科研数据整理、企业业务复盘,还是日常数 ...
2026-03-06在数据分析、数据预处理场景中,dat文件是一种常见的二进制或文本格式数据文件,广泛应用于科研数据、工程数据、传感器数据等领 ...
2026-03-06在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心价值,早已超越单纯的数据清洗与统计分析,而是通过数据 ...
2026-03-06在教学管理、培训数据统计、课程体系搭建等场景中,经常需要对课时数据进行排序并实现累加计算——比如,按课程章节排序,累加各 ...
2026-03-05在数据分析场景中,环比是衡量数据短期波动的核心指标——它通过对比“当前周期与上一个相邻周期”的数据,直观反映指标的月度、 ...
2026-03-05数据治理是数字化时代企业实现数据价值最大化的核心前提,而CDA(Certified Data Analyst)数据分析师作为数据全生命周期的核心 ...
2026-03-05在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02