京公网安备 11010802034615号
经营许可证编号:京B2-20210330
【每周一期-数据蒋堂】SQL用作大数据计算语法好吗
当前的大数据平台在处理结构化数据时大都仍然以提供SQL语法为主流。兼容SQL的好处是很明显的,SQL的应用非常广泛,会SQL的程序员很多,如果继续采用SQL则可以避免许多学习成本。支持SQL的前端软件也很多,使用SQL的大数据平台很容易融入这个现成的生态圈中。大数据平台打算替代的传统数据库也是SQL语法的,这样兼容性会很好,移植成本相对较低。
但继续使用SQL也有缺点,最大的问题就是难以获得大数据计算最需要的高性能。
我们在前面的文章中提到过,SQL中缺乏一些必要的数据类型和运算定义,这使得某些高性能算法无法描述,只能寄希望于计算引擎在工程上的优化。传统商业数据库经过几十年的发展,优化经验已经相当丰富,但即使这样仍有许多场景难以被优化,理论层面的问题确实很难在工程层面解决。而新兴的大数据平台在优化方面的经验还远远不如传统数据库,算法上不占优,就只能靠集群更多的机器获得性能提升。另外,SQL还是一种描述性语言,不擅长指定执行路径,而想获得高性能常常需要专门优化的执行路径,这又需要增加许多特殊的修饰符来人为干预,那还不如直接用过程性语法更为直接,这也会妨碍用SQL写出高性能的代码。
SQL发明之初的计算机硬件能力还比较差,要保证实用性,SQL的设计必须适应当时的硬件条件,这就导致了SQL很难充分利用当代计算机的硬件能力,具体来说就是大内存、多线程和集群。SQL中的JOIN是按键值对应的,而大内存情况下其实可以直接用地址对应,不需要计算HASH值和比对,性能可以提高很多;SQL的数据表无序,单表计算时还容易做到分段并行,多表关联运算时一般就只能事先做好固定分段,很难做到同步动态分段,这就无法根据机器的负载临时决定并行的线程数量;对于集群运算也是这样,SQL在理论上不区分维表和事实表,JOIN运算简单地定义为笛卡尔积后过滤,要实现大表JOIN就会不可避免地产生占用大量网络资源的HASH Shuffle动作,在集群节点数太多时,网络传输造成的延迟会超过节点多带来的好处。
如果我们设计新的代数体系和运算模型,就可能克服SQL的这些缺点,一方面更好地描述高性能算法,另一方面能充分利用当前的硬件资源,从而获得更高的性能。
不过,这样一来,对外的接口也就不再是SQL语法了,不能再兼容以往的代码了。
顺便提一句,新的运算模型并不是指当前业内的NoSQL,NoSQL并不是为高性能计算设计的,事实上它以牺牲计算能力为代价而换取了可横向扩展的能力,对于复杂大数据计算的需求而言是个倒退。
有没可能让高性能和兼容性共存呢?比如采用新的内核模型,然后基于它去解释SQL语法,或者能将SQL代码自动移植到新体系下。
理论上是可能的,解释或移植SQL是有不少工作量,但并不是非常困难。不过,这样做只能获得语法的兼容性,并不能得到高性能。高效的代码要针对运算模型的特征去编写,而SQL语法中并没有体现这些信息,一定要把SQL移植过来,仍然会面临前述的工程层面优化问题,没办法做得最优效果。事实上,两种均采用SQL的数据库,要让其特有的语法能够互相解释和移植,在不影响性能的前提下都是很难做到的。新兴的大数据厂商都愿意提供这种可移植的技术以降低老数据库的移植成本,但并没有多少成功者。
那么,结论是什么呢?
对于中短期目标的产品,那么继续采用SQL是合理的,这将有利于产品的快速应用,性能主要依靠硬件能力或更大规模的集群来提升。而面向长期目标的产品,那就有必要采用取代关系代数体系的运算型,为获得高性能,不能也不必再提供兼容SQL的方案了,需要忍受漫长的健全生态圈过程。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在神经网络模型搭建中,“最后一层是否添加激活函数”是新手常困惑的关键问题——有人照搬中间层的ReLU激活,导致回归任务输出异 ...
2025-12-05在机器学习落地过程中,“模型准确率高但不可解释”“面对数据噪声就失效”是两大核心痛点——金融风控模型若无法解释决策依据, ...
2025-12-05在CDA(Certified Data Analyst)数据分析师的能力模型中,“指标计算”是基础技能,而“指标体系搭建”则是区分新手与资深分析 ...
2025-12-05在回归分析的结果解读中,R方(决定系数)是衡量模型拟合效果的核心指标——它代表因变量的变异中能被自变量解释的比例,取值通 ...
2025-12-04在城市规划、物流配送、文旅分析等场景中,经纬度热力图是解读空间数据的核心工具——它能将零散的GPS坐标(如外卖订单地址、景 ...
2025-12-04在CDA(Certified Data Analyst)数据分析师的指标体系中,“通用指标”与“场景指标”并非相互割裂的两个部分,而是支撑业务分 ...
2025-12-04每到“双十一”,电商平台的销售额会迎来爆发式增长;每逢冬季,北方的天然气消耗量会显著上升;每月的10号左右,工资发放会带动 ...
2025-12-03随着数字化转型的深入,企业面临的数据量呈指数级增长——电商的用户行为日志、物联网的传感器数据、社交平台的图文视频等,这些 ...
2025-12-03在CDA(Certified Data Analyst)数据分析师的工作体系中,“指标”是贯穿始终的核心载体——从“销售额环比增长15%”的业务结论 ...
2025-12-03在神经网络训练中,损失函数的数值变化常被视为模型训练效果的“核心仪表盘”——初学者盯着屏幕上不断下降的损失值满心欢喜,却 ...
2025-12-02在CDA(Certified Data Analyst)数据分析师的日常工作中,“用部分数据推断整体情况”是高频需求——从10万条订单样本中判断全 ...
2025-12-02在数据预处理的纲量统一环节,标准化是消除量纲影响的核心手段——它将不同量级的特征(如“用户年龄”“消费金额”)转化为同一 ...
2025-12-02在数据驱动决策成为企业核心竞争力的今天,A/B测试已从“可选优化工具”升级为“必选验证体系”。它通过控制变量法构建“平行实 ...
2025-12-01在时间序列预测任务中,LSTM(长短期记忆网络)凭借对时序依赖关系的捕捉能力成为主流模型。但很多开发者在实操中会遇到困惑:用 ...
2025-12-01引言:数据时代的“透视镜”与“掘金者” 在数字经济浪潮下,数据已成为企业决策的核心资产,而CDA数据分析师正是挖掘数据价值的 ...
2025-12-01数据分析师的日常,常始于一堆“毫无章法”的数据点:电商后台导出的零散订单记录、APP埋点收集的无序用户行为日志、传感器实时 ...
2025-11-28在MySQL数据库运维中,“query end”是查询执行生命周期的收尾阶段,理论上耗时极短——主要完成结果集封装、资源释放、事务状态 ...
2025-11-28在CDA(Certified Data Analyst)数据分析师的工具包中,透视分析方法是处理表结构数据的“瑞士军刀”——无需复杂代码,仅通过 ...
2025-11-28在统计分析中,数据的分布形态是决定“用什么方法分析、信什么结果”的底层逻辑——它如同数据的“性格”,直接影响着描述统计的 ...
2025-11-27在电商订单查询、用户信息导出等业务场景中,技术人员常面临一个选择:是一次性查询500条数据,还是分5次每次查询100条?这个问 ...
2025-11-27