京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据时代 需要一点想象力
今天在业内鼓吹大数据时代即将到来的时候,得到最多的仍然是同样两类反应。虚无派说大数据云山雾罩,看不出有什么钱途。停滞派说大数据有什么新奇,老子的数据很大,挖掘技术很高。我想,今后几年的产业发展又将证明这两类说法的无知与荒谬。

一些不肯认真读点想点东西的人,一看到大数据这个词,就望文生义地想到数据要大,却忘记了大数据的其他基本特性,需要反复加以提醒。
大数据的特性之一是数据的完整性和综合性。很多业内朋友一谈起大数据,就习惯性地盘点起自己那点存货,或者那些可以直接从自身服务中可以获取的东西。考虑到目前互联网的发展还在非常初级的阶段,现有网络服务都是简化,扭曲,片面地对现实世界的浓缩和裁剪,由此产生的数据是零乱的,破碎的,局部的,其中所含有的含金量是极其有限的。如果同意这个世界上的万事万物可以而且正在被数据化和网络化,那么由此产生的大数据就必然是完整的和综合的,不仅包括网络公司通过自身服务所获得的用户行为数据,而且包括社会的,经济的,政治的,自然的方方面面的数据。这些数据当然分散在不同企业,机构和政府部门手中,汇聚整合在一起绝非易事,但操作上的困难并不能否定大数据本身的完整性和综合性。今天之所以讨论大数据时代的到来,是因为互联网发展到目前阶段使得现实世界数据化发展到了一定程度,各种信息终端普及到了一定程度,数据获取的成本降到了一定程度,使得完整和综合的数据不仅是一种理想,也正在变为现实。
大数据的特性之二是数据的开放性和公共性。正是因为完整的综合的大数据难以由一家公司,机构或政府部门所获得,所以大数据必然产生于一个开放的,公共的网络环境之中。这种开放性和公共性的实现取决于若干个网络开放平台或云服务以及一系列受到法律支持或社会公认的数据标准和规范。任何封闭的或单向获取的数据都不可能是大数据,无论这些数据的规模有多大。
大数据的特性之三是数据的动态性和及时性。天体物理学和理论物理学早就依赖于从宇宙间获取的大量数据,类似的学科还有环境生态学,医药学,和自控技术。但是,这和我们今天讨论的大数据不是一回事。今天的大数据是基于互联网的及时动态数据,不是历史的或严格控制环境下产生的东西。
所以,今天我们谈论的大数据是完整综合的,开放公共的,动态及时的,这样的大数据是我们过去从未有机会获取利用过的全新挑战,也是我们未来应该努力去争取利用的全新战略机会。如果有人以为过去积累的那点数据就是大数据,或者过去积累的数据处理利用能力和经验就可以在大数据时代自然领先,那不是无知就是狂妄。
近来媒体上对大数据方向的进展报道颇多,其中一个很能说明我心目中大数据的性质及其利用的前景。据8月30日《纽约时报》的报道:一家名为气候公司(Climate
Corporation)的创业企业每天都会对美国境内超过一百万个地点,未来两年的天气情况进行超过1万次模拟。随后,该公司将根系结构和土壤孔隙度的相关数据,与模拟结果相结合,为成千上万的农民提供农作物保险。
通过遥感获取土壤数据,这和我们过去所熟悉的通过网络服务获取用户网络行为数据不是一回事,数据的概念得以极大的扩充。每天对百万以上地点进行成万次的模拟,其数据量庞大,动态,及时。要想对每块田地提供精准的保险服务,肯定还需要与土地数据相配套的农产品期货数据,气候预测数据,国际贸易数据,国际政治和军事安全数据,国民经济各方面的数据,产业竞争数据,等等。在如此庞杂的大数据基础上推出的商业模式,是创新的,同现有农作物保险方式相比是具备极大竞争力的,是可持续和规模化的。更妙的是,这家公司基于大数据的运营,完全没有进行高额的网络设施投资,只是租用了亚马逊的公共云服务,一个月几万美元而已。
如果留心观察,这样的案例已经很多了,虽然都还比较简单初级,但足以说明问题。如果展开一下我们的想象力,类似上述案例的创新,在即将到来的大数据时代可以在任何行业,任何服务,任何公共管理上出现,由此可能产生的服务和商业模式是无穷尽的。同现有或现在还没有的服务和商业模式相比,服务更加精准,成本更加低廉,利润更加丰厚。这不是目前网络业所熟知的对现有用户数据的挖掘,不是对用户进行更精细的分组,不是现有数据技术的普及应用,而是一个全新的世界,一个全新的网络地球和数据地球。一个理想的前景是,一个以网络业为核心的大数据服务业会成为今后几十年世界经济和社会发展的主要推动力。当然,这事未必一定发生,尤其是在中国。如果我们网络业的朋友们没有雄心,没有想象力,那也可能除了少数公司成为大数据服务业的主力外,其他大部分公司仍然固守在陈旧的网络业内苦苦挣扎,变成大数据时代的传统产业大军中的一员。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28