京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据背景下如何保护数据
如果在百度谷歌去搜索“大数据”,你会发现,大数据包括三个V,第一个V数据量足够大;第二个V是指数据的种类非常多、结构复杂;第三个V则是对于数据的实时性要求非常高。所以,拥有大量的数据,能够快速将这些数据进行抽取,挖掘,分析,并且可供拥有者实时访问,调用,能够满足其实际需求,这就是大数据。
大数据的出现与互联网的发展息息相关,从搜索引擎、社交网站到移动终端,互联网上的信息总量正以每年50%的增速不断膨胀,其中90%的信息来自近三年,包括每个月Facebook上分享的30亿条内容,每天12TB的Twitter信息,每天淘宝上超过30亿条店铺、商品浏览记录以及上千万的成交、收藏记录等等。据IDC统计,2011年全球所产生的数据总量是1.8ZB(10的21次方),如果把这些数据刻录到CD此片中门起摞起来的高度等于地球到月球的距离!
大数据没有限定的数量,比如多少TB,或者EB的数据。若是中小企业用户,可能企业内部只有十几、二十几个人,那么十个TB对这个企业来说就是大数据了,所以大数据的概念因人而异。工信部十二五的物联网规划引人注意,其中包括海量级的数据存储,数据挖掘,图象视频的智能分析,以及信息感知和信息传输,这些规划提供了一个警示信号,即大数据是未来的发展方向,所以在此后的一段时间内,热门话题会是大数据、云存储、以及对象存储。这些都是在存储或者计算领域热门的话题。
大数据——数据管理“令人不安”
“大数据”是大势所趋。纵观整个数据市场,甚至存储市场,用户的数据量正呈现出爆炸式的增长态势。大概四、五年前,一个邮件系统用终端存储就可以满足一个中等规模企业的需要,数据量大概在30-50T。随着企业员工数量逐年增长,邮件系统的空间也呈爆炸式增长,由于人员沟通之间邮件更容易成为沟通的桥梁,邮件的附件越来越大,邮件系统的数据量亦随之水涨船高。现在该企业的数据量恐怕已增长到2.5PB甚至更多,需要添置一台存储设备或是几台储备设备做邮件系统,可见存储需求量增长之快。
尽管大数据的产生多半是因为企业发展及数据产生的种类多元化这个“大环境”所致,但是面对这些快速增长的大数据所暴露出的问题还是让企业管理者们不安。到底该如何管理这些大数据?如何进行安全有效的保护?出现问题时怎样进行恢复?这些都是企业待解的难题。
第一、在大数据愈演愈烈之时,对于企业来说,如何经济、高效访问数据值得探讨。并非购买了最高端的存储,更昂贵的备份存储就可以高枕无忧,如何经济、高效的访问数据才是企业目前需要研究的课题之一。通常情况下,按照数据被访问频率的高低,可以将这些大数据分为热数据和冷数据,热点数据放在昂贵的介质上没有任何异议,但是冷数据放在昂贵的介质上面则会导致IT建设成本上升,是一种浪费。所以如何将冷、热数据进行分层存储,既能优化存储系统的性能,又可以有效地降低存储系统的整体拥有成本,实现一举两得是企业的突破方向。
第二,如何组织、检索、存储、处理分析这些大数据。最近开展的题为“大数据:商业领袖们的经验”的全球调查发现,稿营收企业的成功与明确的数据战略之间有着极强的关联性。大数据的时代迎面袭来,企业重视大数据的潜在价值只是一个良好的开始,如何应对海量数据在管理方面的挑战才是企业至关重要的策略之一。
第三,数据备份。数据备份可谓“老生常谈”,大家一直在谈数据需要备份,备份是企业最后的保障、最后的一个利器,可以保护企业的系统依然有数据可用。10年前的“9.11”事件,早给过我们惨痛的教训:世贸中心中大约2/3企业因为未做数据备份而导致彻底倒闭。 无独有偶,就在前不久前,雅虎日本服务器系统发生故障,导致近5700家企业数据丢失,除了小林制药这样日常进行数据备份的用户可以在几天之内恢复数据外,其他用户的数据绝无回复的可能,其损失可谓“惨重”。一个企业的数据信息决定着企业的生死存亡。但是今天,数据量的持续增长增加了备份和恢复的时间,是企业面临着严重的合规和宕机风险,数据备份却越来越困难。用户数据量越来越大,备份时间窗口又那么小,设备又是有限的,怎样快速把大数据中的核心数据抽取出来,保障企业数据信息能够适时进行恢复,成为企业CIO们共同考量的当务之急。
第四、重复数据删除。由于存储经理们继续降低备份数据量,重复数据删除技术从而一度成为热门的技术,但尽管这个话题已经“风靡”了多年,近三、五年的时间大家都在讲重复数据的删除。基本上主流的厂商和用户能够接受的还是把带库删除。如周一到周五的数据一样,就把重复的数据删掉,以后每天把增量的数据保存。但是有一些厂家也提倡在线存储删除,这也可行。只是现在某些技术尚不完全成熟,所以现在的重复数据删除重点还是在备份领域涉猎较多。
第五,如何节省电力、节约空间、节约成本等。面临数据爆炸式增长带来的问题,我们将怎么样节省电力、空间、成本呢?近几年企业在采购存储时,会发现存储硬件的成本在逐年走低。回顾过去,硬盘价格都是高高在上的,而现在不管是传统的机械硬盘还是SSD(固态硬盘)都开始变得越发“亲民”,而价格更低的同时容量却更高了。但是,对于很多企业来说,整体的存储成本却不降反升,原因就是存储的管理成本在逐年走高。因为大数据的接茬大涨需要大量的人力管理和维护,所以如何节约IT资源,减少IT人员的压力等也是现在企业需要考虑的因素。
大数据——数据保护“成人之美”
随着大数据时代的到来,数据信息日益重要,数据保护问题日渐突出,各种灾难性事件给用户敲醒很多警钟。数据保护,数据的容灾是非常重要的话题。以前的数据容灾,都是拿盘阵来做,从A复制到B,A坏了到B上去,是一个“有甚于无”的方案,属于一种保护机制。但是今天的企业要求更加完善的数据保护系统,很多企业已经开始完成了备份数据的容灾。所以,在备份数据方面企业会面临很多问题,比如生产系统一般都是在白天运行,或者高峰是在白天去运行,夜间可能有三、五个小时时间窗口,这些窗口怎样在最短时间之内把尽可能做的数据备份出来,是用户面临的问题。
另外是灾难恢复。当发生灾难能否通过盘阵的方式、通过备份的方式恢复数据。现在很多企业非常关注的是,能否把分支机构也保护起来。例如,国美大中苏宁,这种零售企业,在全国每一个省都会有很小的数据中心或是小型机房。里面有独立的一些数据,这些数据能否集中备份到总部统一保护起来,以最低的成本保护这些“大数据”。
最后就是恢复的时间问题。很多企业在考虑备份时往往会忽略这点,从而导致发生灾难或是意外事件时数据恢复时间过长,严重影响企业生产系统的正常运行。所以,大数据的挑战就是备份的窗口。
大数据在给行业带来巨大商业价值的同时也带来了一系列的“疑难杂症”,面对这些大困惑,我们又该如何应对呢?
谈到大数据,现在很多企业都有若干个分支机构,以前用户对分制机构进行保护的时候拿盘阵来做或者拿物理磁带通过汽车搬运到其他地方,这样做既增加人力又消费时间,而且效率很低,恢复起来效果也特别差。所以,大数据环境下的数据保护是一个非常完整的解决方案,譬如,企业拥有一个很小的分支机构,可能是一个分公司或者是其中一个站点。数据会很多,企业有可能各分机构也有一个虚拟带库设备,如果是很小的分支机构,有虚拟的带库设备,可以先备份当中,然后有这个设备自动的通过很窄的广域网复制到虚拟带库里面去。如果企业的数据中心没有这样的虚拟带库设备,要减少成本,而只有服务器,也没有任何问题,只要自动的把数据在源端进行重复数据的删除,删除完成以后,将这些重复数据删除以后的数据远端传到总部的数据中心,这样来实现数据保护,同时企业还可以再复制另外一份,从一个数据中心复制到另外一个数据中心,而且这个复制过程是不需要把数据做完整性恢复的。A到B传递数据的时候,已经把重复数据删掉传过去,但是对于重复数据删除1.0的技术来说,要把这一份数据传过去要恢复成完整的数据,以前需要有一个服务器,把所有的完整数据算出来以后才能够传到另外一个上面,现在企业需要做的只需要传递一份数据,而且是没有重复的,这会大大降低企业在数据保护上的成本。
小 结:
在大数据时代,尽管这些快速增长的海量数据所引发的一系列蹩脚问题,足以让CIO们感到炙手可热,但是管理这些数据所带来的几多挑战并不能令人窒息。完整的数据保护解决方案或许能够成为“成人之美”的一剂良药。毕竟,实践是检验真理的唯一标准,这的确是不易之论。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28随着大数据技术的快速普及,各行各业积累了海量的用户数据、交易数据、生产数据与行为数据。单纯的数据统计与报表分析只能呈现表 ...
2026-05-28在Python网络请求、接口测试、数据爬取、业务对接开发中,Requests库是最简洁、最高效的HTTP请求工具,凭借简洁的语法、完善的适 ...
2026-05-272025 年,零售与服务行业的竞争已从 “经验驱动” 全面转向 “数据驱动”。中小企业门店普遍面临数据零散、分析浅层、决策凭感觉 ...
2026-05-27 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-05-27在统计学分析、实验研究、业务数据复盘过程中,单因素方差分析是检验自变量对因变量是否存在显著影响的核心方法。其中,两个水平 ...
2026-05-26【核心关键词】算法、客户、大数据、互联网、调优、建模、模型优化、机器学习、评分卡模型、模型开发、智能风控、业务场景、数 ...
2026-05-26 很多数据分析师写过无数个 SELECT,但当被问到“新建一张表,该如何定义字段类型来保证数据质量”“创建视图和存储物理表有 ...
2026-05-26在数据清洗、统计分析与数据质量检测工作中,箱型图(又称箱线图、Box Plot)是最直观、最高效的可视化分析工具之一。相较于柱状 ...
2026-05-25在大数据分析、数据清洗、质量管控、风险监测等领域,异常数据识别是保障数据质量、确保分析结论精准、规避业务决策失误的核心基 ...
2026-05-25 很多数据分析师精通Excel函数和透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么关系 ...
2026-05-25数字化经营时代,企业的市场竞争早已从经验决策转向数据决策。门店营收、用户转化、产品销量、成本损耗、存量资产等所有经营行为 ...
2026-05-22在MySQL数据库日常运维、业务数据校验、数据迁移与数据清洗场景中,自增主键ID的连续性校验是一项基础且关键的工作。MySQL的Auto ...
2026-05-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-05-22【核心关键词】大数据、可视化、存储、架构、客户、离线、产品、同步、实时、数据仓库、数据分析、数据可视化、存储数据、离线 ...
2026-05-21在电商流量红利消退、公域获客成本持续走高的当下,存量用户深度挖掘已成为店铺增收增效的核心抓手。相较于付费投放获取的陌生新 ...
2026-05-21