京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据扫盲!你不得不了大数据知识精髓_数据分析师考试
谈到大数据,就自然而然会想到大数据的4V特点:Volume(数据量大)、Velocity(实时性强)、 Variety(种类多样)、Veracity(真实性)。另外,通常还大数据还具有Value(价值)的特点,这 也是人们纷纷关注大数据的主要驱动力之一。这里的“V字仇杀队”指的是大数据时代下价值的重新定义和挖掘,让数据价值充斥在社会的每个角落。
大数据是多维的,而且极具复杂性。大数据带来的价值包括但不限于:数据的组织和管理,基础架构,决策支持和自动化界面和分析。随着社交数据、企业内容、交易与应用数据等新数据源的兴起,传统数据源的局限性被打破,企业愈发需要有效的信息治理以确保其真实性及安全性。
大数据的四大要素及挑战
Volume——数据体量巨大。从TB级别,增长到PB级别。截至目前,人类生产的所有印刷材料的数据量是200PB(1PB=1024TB),而历史上全人类说过的所有的话的数据量大约是5EB(1EB=1024PB)。当前,典型个人计算机硬盘的容量为TB量级,而一些大企业的数据量已经接近EB量级。
Velocity——处理速度快,1秒定律。根据IDC的“数字宇宙”的报告,预计到2020年,全球数据使用量将达到35.2ZB。在如此海量的数据面前,处理数据的效率就是企业的生命。
Variety——数据类型繁多,络日志、视频、图片、地理位置信息等等。类型的多样性也让数据被分为结构化数据和非结构化数据。相对于以往便于存储的以文本为主的结构化数据,非结构化数据越来越多,这些多类型的数据对数据的处理能力提出了更高要求。
Veracity——只有真实而准确的数据才能让对数据的管控和治理真正有意义。
大数据的4V特点(来源:f5)
Value——价值密度低。价值密度的高低与数据总量的大小成反比。如何通过强大的机器算法更迅速地完成数据的价值“提纯”成为目前大数据背景下亟待解决的难题。随着社交数据、企业内容、交易与应用数据等新数据源的兴起,传统数据源的局限性被打破,企业愈发需要有效的信息治理以确保其真实性及安全性。
大数据对于每个人来说都是机遇和挑战并存。在大数据科学、网络日志、RFID(无线射频识别技术)、传感网络、社交网络、社交数据、网络文档、互联网搜索、呼叫中心、天文学、气象学、地理学 、生物学和其他数据庞大的学术性领域和民用、军用、视频、电子商务等等,都有着广泛的应用。
大数据科学
大型强子对撞机(Large Hadron Collider)是一座位于瑞士日内瓦近郊欧洲核子研究组织CERN的对撞型粒子加速器,主要作为国际高能物理学展开研究。该实验室分布有1.5亿个传感器,平均每秒传输的 数据多达4000万倍,在每秒钟内有6亿次碰撞。其中有99.999%的数据是经过过滤并没有记录下来的, 也就是仅有100次碰撞(每秒)的数据最具有价值。
大型强子对撞机
·因此,真正需要采集并处理的数据仅为传感器数据中的0.001%。整个LHC实验室的数据年增长为25PB(不考虑数据备份)。
·如果所有的传感器数据都需要记录下来并进行处理的话,那么其工作量将极其庞大并变得难以为继。那样的话,年数据增长将达1.5亿PB,也就是相当于每天500EB。
政府部门
去年,美国奥巴马管理当局宣布成立大型数据研究和发展倡议(Big Data Research and Development Initiative),致力于帮助政府部门如何利用大数据解决重大问题。该倡议包括84个不同的大数据项目工程和6个部门。此外,美国联邦政府还拥有当今世界上最顶级的十大超级计算机中的六个。负责气象模拟的NASA部门,在其发现者号超级计算机集群中也存储有32PB气象观测和模拟数据。这些,其实 也都说明政府部门对大数据的重视,以及为此而展开的应用。
商业领域
在商业领域,大数据解决方案和应用则更是百花齐放百家争鸣。著名的Facebook社交平台,早已开展了基于用户行为分析的数据挖掘和决策分析能够对其所有用户的500亿张照片进行分析处理。沃尔玛每个小时处理的客户交易量超过百万次,这些交易量数据容量高达2.5PB(2560TB)——相当于美国国会图书馆藏书量的167倍。
Facebook数据信息
应用开发
根据广义的信息和通信技术促进发展(ICT4D)的有效应用来看,大数据在社会经济发展中能够发挥重 要贡献。一方面,可以借助大数据提供具有成本效益的决策分析,比如在医疗、招聘、经济发展、预防犯罪、自然灾害、资源管理等领域。另一方面,隐私、互操作性挑战、算法的完善方面,以及由于缺乏技术基础设施和人才资源而产生新的数字鸿沟:以数据为基础的决策支持带来的信息鸿沟。
从这里我们不难看出,大数据在各个行业和领域,由于其面临的应用和业务不同而产生不同的挑战或者机遇,但无论怎么说,大数据都是一种趋势,一种会在短期内带来伤痛的机遇。也正是因为 如此,我们也还需要特别了解,大数据目前的一些解决方案和成功的应用案例。
相比之下,人们更容易看懂Sandy Bridge、Ivy Bridge等处理器架构和USB 3.0、雷电接口等技术规范,而大数据领域的解决方案和产品,由于其涉及规模较为庞杂,而成为了很多人并不熟知的一个新生事物。
大数据需要有不同于传统的技术,以有效地处理大量的容忍经过时间内的数据。适用于大数据的技术 ,包括大规模并行处理(MPP)数据库,数据挖掘电网,分布式文件系统,分布式数据库,云计算平台 ,互联网,和可扩展的存储系统。
大数据解决方案,通常都是基于集群的物理设施平台上,通过分布式处理系统来实现对海量数据的处理和分析。也正是如此,这种解决方案更多的是侧重于软硬一体或者分布式的软件系统平台来实现。
在大数据解决方案中,最为常见的当属Hadoop。Hadoop 是一个能够对大量数据进行分布式处理的软件 框架。Hadoop项目包括三部分,分别是Hadoop Distributed File System(HDFS)、HadoopMapReduce 编程模型,以及Hadoop Common。
英特尔:作为与Linux具有一样都具有革命性意义的Hadoop,英特尔还推出了基于该平台的发行版(包括免费发行版),以帮助用户更轻松地构建架构和使用分布式计算平台,开发和处理海量数据。
Intel Hadoop发行版(来源:Intel)
在英特尔所提出的大数据方案之中,至强处理器将为大数据分析提供原动力。英特尔还展示了其即将发行的Hadoop发行版——Intel Hadoop Manager 2.0。英特尔的Hadoop发行版着重对英特尔平台上的Hadoop进行了优化,企业可即时实施,安装、配置都非常简单。
微软:为帮助企业快速采用其大数据解决方案,微软将在 Microsoft Windows Azure平台上提供基于云端的Hadoop服务,同时在 Windows Server 上提供基于本地的 Hadoop 版本。 Hadoop 的丰富洞察可以与 Microsoft Business Intelligence (BI) 平台无缝结合,使客户能够借助Office和SharePoint以及公用的数据和服务来丰富他们的模型。
Windows Azure Hadoop优势
EMC:Greenplum统一分析平台(UAP)结合Greenplum DB 和Greenplum Hadoop为企业构建高效处理结构化,半结构化,非结构化数据的大数据分析平台。并且客户可 以以此平台为基础利用Greenplum行业和数学统计方面 的专家,充分挖掘自身数据价值,实现数据资产从成本 中心到利润中心的转变,以数据驱动业务。
甲骨文:提供了大数据软硬一体优化集成解决方案,其行业解决方案包括移动应用用户行为统计分析、基于日志和访问内容的用户画像、机顶盒用户使用习惯和精准营销、语义分析和搜索引擎实时处理、海量指纹识别以及人脸识别查询系统、分布式大数据存储和管理系统、海量历史数据分析平台、基于互联网的舆情监控系统等。Exadata就是一个预配置的软硬件结合体,可提供高性能的数据读写操作。
IBM:IBM 提供了全面的大数据解决方案,InfoSphere大数据分析平台包括BigInsights和 Streams,Streams采用内存计算方式分析实时数据,可以动态地分析大规模的结构化和非结构化数据。BigInsights基于Hadoop,增加了文本分析、统计决策工具,同时在可靠性、安全性、易用性、管理性方面提供了工具,并且可与DB2、Netezza等集成。
SAP:和甲骨文Exadata类似,SAP提供了一个高性能的数据查询功能,用户可以直接对大量实时业务数据进行查询和分析的软硬一体化解决方案HANA。
“信息将成为‘二十一世纪的石油’。”(Gartner,2010年)“数据正在成为商业的新型原材料:经济投入几乎相当于资本与劳动力。”(援引《经济学家》,2010年)。这些,无不说明大数据带来的巨大商机和潜在价值。在本文,主要给读者介绍大数据带来的两方面益处:更智能;更富有。
更智能和更富有,有时候并不等同。随着各大企业业务的扩展和市场经济节奏的加快,人们在制定市场策略的时候,需要更多的真实有效的数据作为决策支撑平台。而在大数据带来的致富方面,不仅对于商家来说是潜在商机,对于个人来说,也是创业实现自身价值的良好途径。手中握有数据的公司基 于数据交易即可产生很好的效益;其次,基于数据挖掘会有很多商业模式诞生。
大数据现象将无处不在
大数据成智能手段
君不见,各大网站的广告都会根据网民行为而展示、推送类似用户曾经浏览过的商品的宣传内容?比如一个网民经常浏览单反相机及其配件类产品,在访问其他网站的时候,就很容易看到类似镜头、单反相机和闪关灯之类的广告展示。
这种情况,在当今的社交媒体(比如微博)平台上,则会显得更为普遍的。因为大数据时代下,展示给每一个微博用户的品牌、产品宣传内容,这种无差异化的市场营销行为不仅无利于精准挖掘潜在客户,而且还有害于微博平台本身的用户体验。
谷歌搜索、Facebook的帖子和微博消息使得人们的行为和情绪的细节化测量成为可能。挖掘用户的行为习惯和喜好,凌乱纷繁的数据背后找到更符合用户兴趣和习惯的产品和服务,并对产品和服务进行针对性地调整和优化。大数据也日益显现出对各个行业的推进力。
此外,大数据还可以帮助实现智能交通、智能城市,帮助银行及时准确评估客户消费和信用信息等等。
智能城市大数据的特征
大数据成致富捷径
未来,数据可能成为最大的交易商品。未来大数据将如同基础设施一样,有数据提供方、管理者、监管者,数据的交叉复用将大数据变成一大产业。
相比传统的致富资本——原材料、资金等等,它们一般都具有排他性,但数据却能够很容易地实现共享,并且通过共享实现更大的价值。此外,此数据和彼数据如果能有机地结合到一起,可能就会产生新的信息和知识,并且实现大幅增值。麦肯锡的报告就曾经指出:“已经有越来越多令人信服的证据表明:大数据将成为竞争的关键性基础,并成为下一波生产率提高、创新和为消费者创造价值的支柱”。
可以预见,基于知识的竞争,将集中表现为基于数据的竞争。而这种数据竞争,将成为经济发展的必然。随着全球竞争的不断深化,企业的地理优势也将淡化,各种国家和地区性的保护措施也将逐步取消,一项专利很快会被模仿、复制、推广,创新将越来越艰难。但在除去这些要素之外,还有一点可以构成企业竞争的基础,那就是以“低成本、高效率”的方式来开展公司的业务。这种竞争,要求公司制定流线型的商业过程,各个过程之间必须无缝隙、无摩擦地对接,并保证每一个商业决策明智、正确,在竞争的过程中不犯错误。(引自:美国信息经济领域的著名教授托马斯·达文波特)
要做到这些,企业必须广泛推行以事实为基础的决策方法,大量使用数据分析来优化企业的各个运营环节,通过基于数据的优化,将业务流程中的价值充分得到提炼,从而最大化节约成本、实现效益最优最大。
编后语:
本文主要围绕大数据的特点、行业应用和面临的挑战、相应解决方案和未来潜在价值这几个最为重要的领域展开论述,由于大数据这个话题本身很“大”很宽泛,也不可能面面俱到,因此主要在于通过这些内容的讲解,给广大网民和读者提供普及性的分享。
另外一个特别值得关注的事实是,大数据时代已经真真切切的来了,它已经存在我们的现实生活中,未来也将会在个人、企业、政府、教育、科研和军事等各种领域全面展开普及应用。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12在CDA(Certified Data Analyst)数据分析师的日常工作中,“挖掘变量间的关联关系”是高频核心需求——比如判断“用户停留时长 ...
2026-01-12在存量竞争时代,用户流失率直接影响企业的营收与市场竞争力。无论是电商、互联网服务还是金融行业,提前精准预测潜在流失用户, ...
2026-01-09在量化投资领域,多因子选股是主流的选股策略之一——其核心逻辑是通过挖掘影响股票未来收益的各类因子(如估值、成长、盈利、流 ...
2026-01-09在CDA(Certified Data Analyst)数据分析师的工作场景中,分类型变量的关联分析是高频需求——例如“用户性别与商品偏好是否相 ...
2026-01-09数据库中的历史数据,是企业运营过程中沉淀的核心资产——包含用户行为轨迹、业务交易记录、产品迭代日志、市场活动效果等多维度 ...
2026-01-08在电商行业竞争日趋激烈的当下,数据已成为驱动业务增长的核心引擎。电商公司的数据分析师,不仅是数据的“解读官”,更是业务的 ...
2026-01-08在数据驱动决策的链路中,统计制图是CDA(Certified Data Analyst)数据分析师将抽象数据转化为直观洞察的关键载体。不同于普通 ...
2026-01-08在主成分分析(PCA)的学习与实践中,“主成分载荷矩阵”和“成分矩阵”是两个高频出现但极易混淆的核心概念。两者均是主成分分 ...
2026-01-07在教学管理、学生成绩分析场景中,成绩分布图是直观呈现成绩分布规律的核心工具——通过图表能快速看出成绩集中区间、高分/低分 ...
2026-01-07