京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据中心基础设施是大数据战略成败的关键
为了成功实施大数据战略,企业数据中心基础设施的建设应当从围绕云计算,过渡到围绕大数据展开,这需要数据中心基础架构为大数据作出五大改变。
以下内容转自机房360:
为大数据选择新的硬件、存储和其它数据中心基础设施,这是IT专业人员们所面临的新挑战。
大数据是具备空前规模和形式的非结构化信息。它包括视频、图像,以及半结构化的数据(例如在Web上常见的电子邮件和文本)。随着基于传感器的移动Web监视设备和输出数据越来越多,可用的数据量将继续呈指数级增长。
推行大数据战略的压力往往来自高层,因为管理者相信,能有效运用数据的企业将比落后者具备更大优势。大数据战略需要数据中心基础架构作出的改变主要有五点:
一、支持大数据的硬件
大数据导致的存储需求量每年都将增长60%至80%,鉴于这种快速增长和当前的成本限制,IT采购者应选择在可扩展性和存储速度上最具成本效益的硬件。类似大型机的向上扩展体系结构重新兴起,因为它们能够经济高效地扩展,降低总体拥有成本。同样,在提升性能方面,固态硬盘(SSD)和固态卡带都比传统磁盘做得更好。
类似IBM Netezza和Oracle Exadata的硬件装置已被证实能有效兼顾可扩展性和性能。考虑采用硬件装置来支持关键大数据业务,但也应确认设备的架构能在未来提供快速性能升级。
二、围绕大数据选择存储
在成功的大数据策略下,企业可以将来自内部的高质量数据与Hadoop挖掘自多个云供应商的低质量数据进行整合。这也就改善了业务相关数据的质量,让分散在各地的数据能组织成为具备一致和及时性的大数据资源。
大数据正在改变中央数据仓储和松耦合数据集市的决策基础,后者的存储库规模要小得多,既可以替代中央数据仓库,也可以成为中央数据仓库的数据源。随着各地办事机构或者国际子公司的增加,中央管理层在业务线扩大的同时更需要高质量的数据来维持管控力度,避免权力的分散。
新的软件技术承担了繁重的存储相关处理工作。由Composite Software(刚刚被Cisco收购)和Denodo提供的数据虚拟化软件能自动发现数据源并提取数据充实全局元数据存储库,为整个组织提供跨越内部和外部的所有数据的公共数据库外观和体验。主数据管理软件通过创建公用主记录提高了数据质量,消除了费时的数据仓库检索。
企业Web外链需求加深了对公众和混合云的依赖。许多大型企业发现他们需要来自于多个云供应商的大数据,却不能指望供云应商会负责整合这些数据。企业只能从数据虚拟化供应商寻求工具来跨多个云整合大数据。
三、利用SSD的存储分层策略
存储成本很高,而且越快的存储也就越昂贵。最重要的是,大数据要求存储同时提供大容量和“大”性能。存储分层在存储资源池中提供多种成本/性能选项,从昂贵的高性能固态存储到传统的串行SCSI(SAS)磁盘存储,这些选项的组合降低了总拥有成本。在主内存和磁盘之间增加一个固态层将有助于将大数据任务的性能维持在高位,而且不会引起存储成本失控。
SSD的用量应遵从“90-10”的存储分层规则:成本和速度的最佳组合比例是:使用大约10%的SSD和90%的机械硬盘。这一策略让IT公司用仅增加10%成本的代价就能获得90%以上的性能提升。主内存和SSD的容量比例也遵从同样的规则。
由于SSD的性能价格比的提升速度超过传统磁盘(容量提升,价格降低),预计在不久的将来传统磁盘和SSD的配置比例会变为遵循80-20的规则。
IBM BLU Acceleration这类最新的纵列和内存数据库设施能利用SSD获得远超传统磁盘的性能,它们的设计能够有效发挥SSD这类“扁平化磁盘”的优势。
四、大数据分析和报告能力
虽然嵌入式分析工具已经可以利用报告和自动优化功能改善业务流程,但大数据再次改变了分析规则。例如,和传统上对单个客户进行主要行为分析洞察相比,大数据战略能为每个客户创建一个迭代和洞察分析线程,让公司能跟踪客户并更好地维持与所有客户的长期关系。
典型的大数据分析从业人员被称为数据科学家,和常规的IT主管不同,他们更可能同时担任CMO(营销总监)。然而,IT专业人员必须明白他们公司的大数据策略对数据科学家的工作产生的影响。
这意味着需要在自动化的报告和嵌入分析之外人工添加第三方审议内容:专设和松散耦合分析。支持专设查询的分析和统计工具是必要的软件前提。许多传统IT供应商以及云供应商——如IBM、Cognos和Birst——正在扩充这些功能。
五、企业中的Hadoop
Hadoop为数据密集型应用提供“紧贴着”MapReduce文件系统处理程序框架的分布式文件系统。此文件系统支持针对富文本数据的并行事务扩展,例如社交媒体数据。
许多IT公司通过在企业内创建自己的Hadoop版本来解决从Web获取Hadoop数据源的问题。然而,缺乏专业知识是一种挑战:精通这种发展中的Web数据管理框架的专业和艺术的IT管理人员犹如凤毛麟角。
组织开发他们自己的数据管理工具时应该留意,如IBM、Oracle和EMC的这些主要供应商,往往既提供专有产品用于访问Hadoop数据,也可进行定制开发,让IT公司不需要专门的数据归纳措施就能访问需要的数据。如果您决定搭建自己的数据平台,供应商也提供整合服务,使Hadoop更贴合现有IT资源来高效运作。
每个公司围绕大数据的相关决策都会有所不同。请记住,随着围绕大数据的技术演变,大数据战略也应当及时调整,与时俱进。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA一级知识点汇总手册 第三章 商业数据分析框架考点27:商业数据分析体系的核心逻辑——BSC五视角框架考点28:战略视角考点29: ...
2026-02-20CDA一级知识点汇总手册 第二章 数据分析方法考点7:基础范式的核心逻辑(本体论与流程化)考点8:分类分析(本体论核心应用)考 ...
2026-02-18第一章:数据分析思维考点1:UVCA时代的特点考点2:数据分析背后的逻辑思维方法论考点3:流程化企业的数据分析需求考点4:企业数 ...
2026-02-16在数据分析、业务决策、科学研究等领域,统计模型是连接原始数据与业务价值的核心工具——它通过对数据的规律提炼、变量关联分析 ...
2026-02-14在SQL查询实操中,SELECT * 与 SELECT 字段1, 字段2,...(指定个别字段)是最常用的两种查询方式。很多开发者在日常开发中,为了 ...
2026-02-14对CDA(Certified Data Analyst)数据分析师而言,数据分析的核心不是孤立解读单个指标数值,而是构建一套科学、完整、贴合业务 ...
2026-02-14在Power BI实操中,函数是实现数据清洗、建模计算、可视化呈现的核心工具——无论是简单的数据筛选、异常值处理,还是复杂的度量 ...
2026-02-13在互联网运营、产品迭代、用户增长等工作中,“留存率”是衡量产品核心价值、用户粘性的核心指标——而次日留存率,作为留存率体 ...
2026-02-13对CDA(Certified Data Analyst)数据分析师而言,指标是贯穿工作全流程的核心载体,更是连接原始数据与业务洞察的关键桥梁。CDA ...
2026-02-13在机器学习建模实操中,“特征选择”是提升模型性能、简化模型复杂度、解读数据逻辑的核心步骤——而随机森林(Random Forest) ...
2026-02-12在MySQL数据查询实操中,按日期分组统计是高频需求——比如统计每日用户登录量、每日订单量、每日销售额,需要按日期分组展示, ...
2026-02-12对CDA(Certified Data Analyst)数据分析师而言,描述性统计是贯穿实操全流程的核心基础,更是从“原始数据”到“初步洞察”的 ...
2026-02-12备考CDA的小伙伴,专属宠粉福利来啦! 不用拼运气抽奖,不用复杂操作,只要转发CDA真题海报到朋友圈集赞,就能免费抱走实用好礼 ...
2026-02-11在数据科学、机器学习实操中,Anaconda是必备工具——它集成了Python解释器、conda包管理器,能快速搭建独立的虚拟环境,便捷安 ...
2026-02-11在Tableau数据可视化实操中,多表连接是高频操作——无论是将“产品表”与“销量表”连接分析产品销量,还是将“用户表”与“消 ...
2026-02-11在CDA(Certified Data Analyst)数据分析师的实操体系中,统计基本概念是不可或缺的核心根基,更是连接原始数据与业务洞察的关 ...
2026-02-11在数字经济飞速发展的今天,数据已成为核心生产要素,渗透到企业运营、民生服务、科技研发等各个领域。从个人手机里的浏览记录、 ...
2026-02-10在数据分析、实验研究中,我们经常会遇到小样本配对数据的差异检验场景——比如同一组受试者用药前后的指标对比、配对分组的两组 ...
2026-02-10在结构化数据分析领域,透视分析(Pivot Analysis)是CDA(Certified Data Analyst)数据分析师最常用、最高效的核心实操方法之 ...
2026-02-10在SQL数据库实操中,字段类型的合理设置是保证数据运算、统计准确性的基础。日常开发或数据分析时,我们常会遇到这样的问题:数 ...
2026-02-09