京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据系统与关系型数据的共存
大数据在2011年崭露头角,2012年一飞冲天,它可能会以一种戏剧性的方式改变数据管理的很多方面。大数据系统给管理和操纵计算机数据、连续提取、转换和加载功能、运作商业智能、动态大数据以及基于云的数据仓库等等都带来了变化。
不过,随着大数据进入2013年,已经没有什么系统技术能比NoSQL数据库和Hadoop框架更活跃了,看起来这两款产品还有更大的发展空间。根据MarketAnalysis.com 2012年的一份报告看,单单是Hadoop-MapReduce市场,预计复合年增长率将达到58%,在2018年将达到22亿美元。
NoSQL和Hadoop的出现主要是为应对非结构化数据的,比如文本数据或者web日志。就像Apache Hadoop一样,这些技术通常是从开源起步,逐渐成为新的商业产品。
Judith Hurwitz是Hurwitz and Associates公司的总裁兼CEO,该公司位于美国马萨诸塞州,她认为大数据架构和大规模并行处理大大改变了数据景象。她说:在此之前,即便数据真的对公司很重要,人们也没有能力获取巨大数据量并进行实时分析。
她认为:现在,不现实的东西正变得实用。这种情况已经把数据带出了舒适区。
SQL受创,即将回击
我们可以在网站上看到,2012年伊始,对主流关系型数据库陷入困境的预测就出现了。部分预言已成为现实。SQL关系型数据库在与未来几年可能成为其替代品的产品经过一系列斗争之后,现在(或者很快)似乎面临着关于处理整个企业大数据量过滤的最为剧烈的竞争。
这一趋势背后的推动力是企业对以更快的速率获取更多非结构化数据的渴望,这样企业才能更加依靠数据驱动做出决策。惯用的处理方式正在改变,以适应最好的新技术。
这些来自2012年特定数据管理供应商的举动展现出大数据和Hadoop对关系型数据冲击的现状:
IBM公司还在继续创立小型数据和分析公司,尽管比2011年少了些。蓝色巨人的努力方向从小的改进(比如,针对DB2 10的NoSQL图形库和InfoSphere Warehouse 10)到非常巨大的PureData系统装置,目的都是为了给企业搞定大数据。
甲骨文公司在年初推出了大数据设备。这一发布是紧跟着Oracle NoSQL数据库2.0之后发布的,Oracle NoSQL数据库2.0已经自动实现重新平衡,新的应用编程接口可以处理大型对象,与Oracle数据库有更紧密的集成,支持直接用SQL查询Oracle NoSQL数据库记录。
微软公司展示了Hadoop对Windows Azure和Windows Server支持的预览;Teradata公司发布了其Aster大数据分析产品;而Informatica公司发布了PowerCenter套件的大数据版,据说消除了Hadoop手工编码的需求,并把编程任务带入了Informatica开发环境。
SQL在2012年可能只有一两次回击,但是它积极应对市场挑战的举动有重要意义。在非主流NoSQL和Hadoop方面比较专业的公司更新了他们去年的SQL认证。一个典型的例子是Hadoop创立了Cloudera公司,该公司期望增强SQL与Impala的协作程度(Impala是一款Hadoop软件产品,支持标准SQL做交互式查询)。
大数据的变动
这样的举动可能代表了一定的势头人们看到SQL和NoSQL一起被提及的机会更多了。在某种程度上,SQL在早期大数据喧闹的讨论中有点被淡化了。
Ronnie Beggs是美国旧金山SQLstream公司的副总裁,该公司是一家流媒体数据库制造商。他说:在过去的几年里,由于大数据运动,SQL已经不再挂在每个人的嘴边了。同时,他还说:大数据和NoSQL双剑合璧,已经冲击到了主流。
他还表示,在2013年,我们应该会看到明显的变化,并提到近几年在使NoSQL数据库更好地适应SQL风格的开发方面所作出的各种努力。
Beggs说:它是不断变化的。我们接下来这一年会看到SQL的回归,它将成为所有大数据平台的接口。
这种发展走向了Hadoop框架、NoSQL和SQL方法的共存,这标志着在大数据的成熟度方面迈出了新的一步。2013年,大数据有可能从一个热门话题变为切实的实践。
Colin White是美国俄勒冈州Ashland BI研究机构的总裁和创始人,他说:我认为人们正努力通过大数据的炒作,来真正理解业务价值。在2013年,我认为我们将看到人们从大数据中获得业务价值的优秀案例。问题不在于大数据本身,而在于你的运用。
虽然企业对新技术有着广泛的兴趣,但不是所有公司都会以同样的程度全面部署大数据系统。关于这一点,在最近TechTarget举办的一次重点银行会议上,一位集成服务经理也有所提及。
他认为银行业只有部分涉足了基本的大数据,而不是全部。银行和其它领域只看到了大数据的数量,而没有留意到它的非结构性。至少目前还是这样。
他谈到:大数据的含义有两部分。第一部分是它们的量很大,第二部分是数据为非结构化。银行明显属于第一部分。但是我们不会去收集tweets,至少目前还没有。我们还在观望,等待金融数据服务市场的应对。(文章来自:CDA数据分析师)
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24随着数字经济快速发展,数据已成为核心生产要素,各行各业的业务沉淀、用户行为、设备运行、市场交易均产生海量数据。数据处理作 ...
2026-09-24 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-09-24在时序数据分析中,大部分业务数据并非持续平稳变化,而是会在某些时间节点出现突然抬升、断崖下跌、趋势反转、波动异变等现象, ...
2026-09-23在统计学与数据分析中,研究多组数据差异最常用的方法为单因素方差分析与事后多重比较。很多数据分析初学者容易混淆两者功能,认 ...
2026-09-23 很多数据分析师每天都在写 SQL,但当被问到“DQL 的本质是什么”“SELECT 子句的书写顺序与执行顺序为何不同”“INNER JOIN ...
2026-09-23 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-09-22CDA数据分析师 出品 作者:李诗怡 1. 金字塔原理 定义: 一种“先总后分、先结论后原因”的思考和表达方式。顶层为核心观点,中 ...
2026-09-22