京公网安备 11010802034615号
经营许可证编号:京B2-20210330
Spark会成为大数据分析的新里程碑_数据分析师
在年初于纽约举行的Spark Summit East大会上,Databrick成为了焦点所在,通过新发布的数据处理云服务,该公司力图将Spark与MapReduce及Hadoop系统划清界限。
经过本次大会,Spark在业界的逐渐普及已是不争的事实。Apache Spark是一个开源的大数据处理引擎,能够被用于解决各界面临的高难度问题:如何快速识别针对比特币网络的拒绝服务攻击?如何将车辆与物联网或互联网相连接?如何识别出那些极为隐秘的洗钱行为?
对于Spark的兴趣不仅仅局限于具有纯天然数字化基因的企业,或者提供Spark相关技术的厂商。诺华制药(Novartis)、有线电视网Comcast和高盛等公司也在会上为Spark唱起了赞歌。但是,本次Spark Summit与其说是一次会议,不如说是一次Databrick的专场演出。Databrick发布了商业版的Spark系统,并且撇清与Hadoop生态的任何关系 -- 既非敌人也不是朋友。Databrick这次发布的是基于云的Spark服务。
顺势而生
Databrick由加州伯克利大学AMP实验室团队所创建,即Apache Spark的开发者。自从诞生伊始,Spark就被拿来与MapReduce进行比较,MapReduce是Hadoop最初的数据处理引擎。MapReduce因其对大数据集的分布式处理能力而广受关注,但是也一直在效率方面饱受责难。MapReduce以批处理方式进行计算,无法很好地应对流处理模式(比如物联网项目)。而且,MapReduce没有内存计算的选项,每次计算后都要将结果写入外部存储,这使得迭代式的任务相当耗时。
MapReduce的种种缺陷,使得诸如Spark之类的新一代处理引擎应运而生。“MapReduce的设计始于15年以前,”Databrick的联合创始人Patrick Wendell表示:“而Spark则是基于当代最新的硬件,完全重新设计而成的。”
同时,Databrick实现了Spark与Hadoop环境的兼容,并坚信Spark将在大数据生态中扮演更重要的角色。“我认为Spark将凌驾于Hadoop之上,在更多的场景中发挥作用。目前,在很大程度上这一点已经成为现实。”Wendell说。
去年春季,Databrick与DataStax建立了合作伙伴关系,后者专注于提供NoSQL数据库Cassandra的商业版。去年秋天,Databrick发布了Databrick云,基于Amazon S3存储提供Spark环境,实现所谓的大数据即服务。由于在可用性方面受限,有传闻Databrick云最终将驻留在Google Compute Engine和微软Azure云上。与MapReduce不同,Databrick尽量让使用Spark的技术门槛降低,能够面向更为广泛的受众。比如,Databrick为用户提供了各种高级和低级的API接口 – 所谓高级接口,主要针对那些对数据科学或分布式系统不熟悉的用户,使之同样能从复杂的机器学习算法中受益。
应者云集
如果说本次Spark Summit East大会带来的影响,应该就是CIO们,或者更确切地说是那些一直追踪大数据技术发展的数据分析师们会认为Spark将是继Hadoop之后的新里程碑。Databrick宣称Spark大数据处理引擎将改变企业分析的形态(过去的情况是,诸如Cloudera一类的Hadoop提供商一直扮演着支撑的角色)。Databrick同样让与会者相信,即使那些“普通”(normal,先前举行的Hadoop World大会上,Cloudera使用了这个词)的公司,也能够从Spark中受益,比如诺华制药和Comcast,以及不那么有名的Automatic和Shopify公司。
对于Spark的赞美同样来自于其他与会者。Tresata的创始人和首席执行官Abhishek Mehta表示:“我认为Spark应对了当前大数据研究中的所有热点问题。”高盛的Matt Glickman表示,Spark代表了未来发展的方向,将成为大数据分析的通用工具。Alteryx(致力于为普通用户提供分析语言R和大数据分析能力)的首席运营官George Mattew则描述了在集成R和MapReduce时的遭遇。
“有人说,旧约中并没有对地狱的具体描述。”Mathew回忆到:“但是,当我们试图将R和MapReduce集成时,却有了切身体会。在引入其他通用的计算能力时,MapReduce的步伐是如此艰难。”
这听起来非常刺耳,曾经的大数据明星,如今被Spark的光芒所掩盖 – 至少在某些大数据信徒看来,事实就是如此。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
随着新零售模式的快速普及,零售行业从传统的“货品驱动”全面转向“用户驱动”。门店交易数据、线上消费记录、浏览轨迹、复购频 ...
2026-08-27在数据分析、爬虫采集、接口开发、数据归档等场景中,JSON与CSV是两种使用率最高的数据存储格式。JSON为键值对结构化格式,适配 ...
2026-08-27 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-08-27在数据分析工作中,时间序列是最常见的数据类型之一,订单时间、日志时间、交易时段、统计周期等数据均离不开时间处理。原始数据 ...
2026-08-26在数据分析与数据预处理工作中,原始数据普遍存在录入错误、系统故障、偶然极值等问题,极易产生异常数据。异常数据会严重干扰数 ...
2026-08-26 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-08-26在数理统计与数据分析领域,多因素方差分析与线性回归模型是研究变量关系、因素影响、数据差异规律的两大核心工具。二者均属于经 ...
2026-08-25数据分析的核心价值不在于数据计算与图表制作,而在于清晰、精准、有逻辑地输出结论、支撑业务决策。日常数据分析报告普遍存在结 ...
2026-08-25 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-08-25平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-08-24 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18