光“大”是不行的，开放才能实现大数据的深发展

热线电话：13121318867

光“大”是不行的，开放才能实现大数据的深发展_数据分析师

2014-12-31

光“大”是不行的，开放才能实现大数据的深发展_数据分析师

围墙里的大数据注定成为死数据。大数据需要开放式创新，从数据的开放、共享和交易，到价值提取能力的开放，再到基础处理和分析平台的开放，让数据如同血液在数据社会的躯体中长流，滋润数据经济，让更多的长尾企业和数据思维创新者产生多姿多彩的化学作用，才能创造大数据的黄金时代。

　　我的大数据研究轨迹

　　我做了4-5年的移动架构和Java虚拟机，4-5年的众核架构和并行编程系统，最近4-5年也在追时髦，先是投入物联网，最近几年一直在做大数据。我们团队的大数据研究轨迹如下图所示：

　　2010-2012年，主要关注数据和机器的关系：水平扩展、容错、一致性、软硬件协同设计，同时厘清各种计算模式，从批处理(MapReduce)到流处理、Big SQL/ad hoc query、图计算、机器学习等等。事实上，我们的团队只是英特尔大数据研发力量的一部分，上海的团队是英特尔Hadoop发行版的主力军，现在英特尔成了Cloudera的最大股东，自己不做发行版了，但是平台优化、开源支持和垂直领域的解决方案仍然是英特尔大数据研发的重心。

　　从2013年开始关注数据与人的关系：对于数据科学家怎么做好分布式机器学习、特征工程与非监督学习，对于领域专家来说怎么做好交互式分析工具，对于终端用户怎么做好交互式可视化工具。英特尔研究院在美国卡内基梅隆大学支持的科研中心做了GraphLab、Stale Synchronous Parallelism，在MIT的科研中心做了交互式可视化和SciDB上的大数据分析，而中国主要做了Spark SQL和MLlib(机器学习库)，现在也涉及到深度学习算法和基础设施。

　　2014年重点分析数据和数据的关系：我们原来的工作重心是开源，后来发现开源只是开放式创新的一个部分，做大数据的开放式创新还要做数据的开放、大数据基础设施的开放以及价值提取能力的开放。

　　数据的暗黑之海与外部效应

　　下面是一张非常有意思的图，黄色部分是化石级的，即没有联网、没有数字化的数据，而绝大多数的数据是在这片海里面。只有海平面的这些数据(有人把它称作Surface Web)才是真正大家能访问到的数据，爬虫能爬到、搜索引擎能检索到的数据，而绝大多数的数据是在暗黑之海里面(相应地叫做Dark Web)，据说这一部分占数据总量的85%以上，它们在一些孤岛里面，在一些企业、政府里面躺在地板上睡大觉。

　　数据之于数据社会，就如同水之于城市或者血液之于身体一样。城市因为河流而诞生也受其滋养，血液一旦停滞身体也就危在旦夕。所以，对于号称数据化生存的社会来说，我们一定要让数据流动起来，不然这个社会将会丧失诸多重要功能。

　　所以，我们希望数据能够像“金风玉露一相逢”那样产生化学作用。马化腾先生提出了一个internet+的概念，英特尔也有一个大数据X，相当于大数据乘以各行各业。如下图所示，乘法效应之外，数据有个非常奇妙的效应叫做外部效应(externality)，比如这个数据对我没用但对TA很有用，所谓我之毒药彼之蜜糖。

　　比如，金融数据和电商数据碰撞在一起，就产生了像小微贷款那样的互联网金融;电信数据和政府数据相遇，可以产生人口统计学方面的价值，帮助城市规划人们居住、工作、娱乐的场所;金融数据和医学数据在一起，麦肯锡列举了很多应用，比如可以发现骗保;物流数据和电商数据凑在一块，可以了解各个经济子领域的运行情况;物流数据和金融数据产生供应链金融，而金融数据和农业数据也能发生一些化学作用。比如Google analytics出来的几个人，利用美国开放气象数据，在每一块农田上建立微气象模型，可以预测灾害，帮助农民保险和理赔。

　　所以，要走数据开放之路，让不同领域的数据真正流动起来、融合起来，才能释放大数据的价值。

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；