京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据系统与关系型数据的共存
大数据在2011年崭露头角,2012年一飞冲天,它可能会以一种戏剧性的方式改变数据管理的很多方面。大数据系统给管理和操纵计算机数据、连续提取、转换和加载功能、运作商业智能、动态大数据以及基于云的数据仓库等等都带来了变化。
不过,随着大数据进入2013年,已经没有什么系统技术能比NoSQL数据库和Hadoop框架更活跃了,看起来这两款产品还有更大的发展空间。根据MarketAnalysis.com 2012年的一份报告看,单单是Hadoop-MapReduce市场,预计复合年增长率将达到58%,在2018年将达到22亿美元。
NoSQL和Hadoop的出现主要是为应对非结构化数据的,比如文本数据或者web日志。就像Apache Hadoop一样,这些技术通常是从开源起步,逐渐成为新的商业产品。
Judith Hurwitz是Hurwitz and Associates公司的总裁兼CEO,该公司位于美国马萨诸塞州,她认为大数据架构和大规模并行处理大大改变了数据景象。她说:在此之前,即便数据真的对公司很重要,人们也没有能力获取巨大数据量并进行实时分析。
她认为:现在,不现实的东西正变得实用。这种情况已经把数据带出了舒适区。
SQL受创,即将回击
我们可以在网站上看到,2012年伊始,对主流关系型数据库陷入困境的预测就出现了。部分预言已成为现实。SQL关系型数据库在与未来几年可能成为其替代品的产品经过一系列斗争之后,现在(或者很快)似乎面临着关于处理整个企业大数据量过滤的最为剧烈的竞争。
这一趋势背后的推动力是企业对以更快的速率获取更多非结构化数据的渴望,这样企业才能更加依靠数据驱动做出决策。惯用的处理方式正在改变,以适应最好的新技术。
这些来自2012年特定数据管理供应商的举动展现出大数据和Hadoop对关系型数据冲击的现状:
IBM公司还在继续创立小型数据和分析公司,尽管比2011年少了些。蓝色巨人的努力方向从小的改进(比如,针对DB2 10的NoSQL图形库和InfoSphere Warehouse 10)到非常巨大的PureData系统装置,目的都是为了给企业搞定大数据。
甲骨文公司在年初推出了大数据设备。这一发布是紧跟着Oracle NoSQL数据库2.0之后发布的,Oracle NoSQL数据库2.0已经自动实现重新平衡,新的应用编程接口可以处理大型对象,与Oracle数据库有更紧密的集成,支持直接用SQL查询Oracle NoSQL数据库记录。
微软公司展示了Hadoop对Windows Azure和Windows Server支持的预览;Teradata公司发布了其Aster大数据分析产品;而Informatica公司发布了PowerCenter套件的大数据版,据说消除了Hadoop手工编码的需求,并把编程任务带入了Informatica开发环境。
SQL在2012年可能只有一两次回击,但是它积极应对市场挑战的举动有重要意义。在非主流NoSQL和Hadoop方面比较专业的公司更新了他们去年的SQL认证。一个典型的例子是Hadoop创立了Cloudera公司,该公司期望增强SQL与Impala的协作程度(Impala是一款Hadoop软件产品,支持标准SQL做交互式查询)。
大数据的变动
这样的举动可能代表了一定的势头人们看到SQL和NoSQL一起被提及的机会更多了。在某种程度上,SQL在早期大数据喧闹的讨论中有点被淡化了。
Ronnie Beggs是美国旧金山SQLstream公司的副总裁,该公司是一家流媒体数据库制造商。他说:在过去的几年里,由于大数据运动,SQL已经不再挂在每个人的嘴边了。同时,他还说:大数据和NoSQL双剑合璧,已经冲击到了主流。
他还表示,在2013年,我们应该会看到明显的变化,并提到近几年在使NoSQL数据库更好地适应SQL风格的开发方面所作出的各种努力。
Beggs说:它是不断变化的。我们接下来这一年会看到SQL的回归,它将成为所有大数据平台的接口。
这种发展走向了Hadoop框架、NoSQL和SQL方法的共存,这标志着在大数据的成熟度方面迈出了新的一步。2013年,大数据有可能从一个热门话题变为切实的实践。
Colin White是美国俄勒冈州Ashland BI研究机构的总裁和创始人,他说:我认为人们正努力通过大数据的炒作,来真正理解业务价值。在2013年,我认为我们将看到人们从大数据中获得业务价值的优秀案例。问题不在于大数据本身,而在于你的运用。
虽然企业对新技术有着广泛的兴趣,但不是所有公司都会以同样的程度全面部署大数据系统。关于这一点,在最近TechTarget举办的一次重点银行会议上,一位集成服务经理也有所提及。
他认为银行业只有部分涉足了基本的大数据,而不是全部。银行和其它领域只看到了大数据的数量,而没有留意到它的非结构性。至少目前还是这样。
他谈到:大数据的含义有两部分。第一部分是它们的量很大,第二部分是数据为非结构化。银行明显属于第一部分。但是我们不会去收集tweets,至少目前还没有。我们还在观望,等待金融数据服务市场的应对。(文章来自:CDA数据分析师)
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据处理的全流程中,数据呈现与数据分析是两个紧密关联却截然不同的核心环节。无论是科研数据整理、企业业务复盘,还是日常数 ...
2026-03-06在数据分析、数据预处理场景中,dat文件是一种常见的二进制或文本格式数据文件,广泛应用于科研数据、工程数据、传感器数据等领 ...
2026-03-06在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心价值,早已超越单纯的数据清洗与统计分析,而是通过数据 ...
2026-03-06在教学管理、培训数据统计、课程体系搭建等场景中,经常需要对课时数据进行排序并实现累加计算——比如,按课程章节排序,累加各 ...
2026-03-05在数据分析场景中,环比是衡量数据短期波动的核心指标——它通过对比“当前周期与上一个相邻周期”的数据,直观反映指标的月度、 ...
2026-03-05数据治理是数字化时代企业实现数据价值最大化的核心前提,而CDA(Certified Data Analyst)数据分析师作为数据全生命周期的核心 ...
2026-03-05在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02在数字化运营中,时间序列数据是CDA(Certified Data Analyst)数据分析师最常接触的数据类型之一——每日的营收、每小时的用户 ...
2026-03-02在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27