
2017将至,大数据准备好了么
去年,大数据市场完全围绕Hadoop生态系统周围的技术。从那时起,重心一直是通过已证明增加收入、提高生产力和降低风险而带来投资回报的使用场合,“将大数据切实利用起来”。现在,大数据继续高奏凯歌。明年我们预计会看到更主流的公司采用大数据和物联网,大中型企业保守和怀疑的企业组织会开始一头扎入其中。
与几年前我们刚开始接触Hadoop时相比,数据融合会来得更重要。通过高级分析平台,结合社交数据、移动应用程序、客户关系管理(CRM)记录和购买历史记录,这让营销人员得以通过发现当前和未来购买行为方面的隐藏模式和宝贵信息,从而洞察未来。
自助式数据分析的普及,加上云计算和Hadoop的广泛采用,正在整个行业带来变化,许多公司会抓住这一形势,或者无视变化、因此面临险境。实际上,工具仍在出现,而Hadoop平台承诺的还没有达到公司缺少不了它的地步。
下面是明年将塑造大数据行业的五大趋势:
物联网(IoT)
公司日益期望从所有数据中获得价值;制造、销售和支持实物的大型工业公司将与其“物件”连接的传感器接入到互联网。企业组织将不得不改动技术,以便与物联网数据衔接起来。这在数据治理、标准、健康保障、安全和供应链等方面带来了无数新的挑战和机遇。
物联网和大数据是同一枚硬币的两面;数十亿与互联网连接的“物件”将生产大量数据。然而,这本身不会引发另一场工业革命,不会改变日常的数字化生活,也不会提供拯救地球的预警系统。来自设备外部的数据才是企业让自己与众不同的方面。结合上下文来捕获和分析这种类型的数据为公司带来了新的发展前途。
研究表明,相比计划维修,预测性维护最多可省下12%的成本,因而使维护成本降低30%,将设备故障造成的停运时间缩短70%。对于制造工厂或运输公司来说,从数据驱动的决策获得这些结果,意味着在改进运营和节省成本方面大有机会。
深度学习是一套基于神经网络的机器学习技术,它仍在发展之中,不过在解决业务问题方面显示出大有潜力。它让计算机能够从大量非结构化数据和二进制数据中找出感兴趣的内容,并且推导出关系,而不需要特定的模型或编程指令。
这些算法的源动力主要来自人工智能领域,人工智能的总体目标是模拟人类大脑观察、分析、学习和做决定的能力,尤其是处理极其复杂的问题。深度学习方法的一个关键概念就是数据的分布式表示,因而可以对输入数据的抽象特征实现大量的组合,从而可以紧凑表示每个样本,最终获得更丰富的泛化。
深度学习主要用于从大量未标记/未监督的数据当中学习,因而对于从大数据中提取有意义的表示和模式颇具吸引力。比如说,它可以用来识别许多不同类型的数据,比如视频中的形状、颜色和对象,或者甚至是图像中的猫,就像谷歌研制的一个神经网络在2012年所做的那样。
因此,企业可能会看到更多的注意力投向半监督式或未监督式训练算法来处理进入的大量数据。
内存中分析
不像常规的商业智能(BI)软件对存储在服务器硬盘上的数据运行查询,内存中技术查询的是载入到内存中的信息,这可以通过减少或甚至消除磁盘输入/输出瓶颈来显著提升分析性能。就大数据而言,正是由于TB级系统和大规模并行处理,让内存中分析技术更令人关注。
在现阶段,大数据分析的核心其实是发现数据。要是没有毫秒级延迟,面对数百万次/数十亿次的迭代,运行迭代以查找数据点之间的关联就不会成为现实。在内存中处理的速度比磁盘上处理要快三个数量级。
2014年,Gartner创造了HTAP(混合事务/分析处理)这个术语,描述这样一种新技术:让事务和分析可以在同一个内存中数据库中处理。它让应用程序领导人通过更强的情境意识和改进的业务敏捷性来进行创新,然而这需要彻底改变原有架构,还需要相应的技术和技能,才能使用内存中计算技术作为赋能者(enabler)。
许多公司已经在充分利用混合事务/分析处理(HTAP);比如说,零售商能够迅速识别在过去一小时内最畅销的时尚商品,并立即为该商品定制优惠促销活动。
但是HTAP方面炒作得很厉害,许多公司一直在过度使用它。如果用户需要在一天内多次以同一方式查看同一数据,数据又没有什么显著的变化,那么使用内存中技术是浪费钱。虽然你可以使用HTAP更快地执行分析,但所有事务必须驻留在同一个数据库中。问题是,今天的大多数分析工作是把来自许多不同系统的事务集中起来。
混合云和公共云服务越来越受欢迎。大数据成功的关键是在弹性基础设施上运行(Hadoop)平台。
我们会看到数据存储和分析趋于融合,带来新的更智能的存储系统,它们将经过优化,用于存储、管理和排序庞大的PB级数据集。展望未来,我们可以预计会看到基于云的大数据生态系统在整个继续迎来发展,不仅仅局限于“早期采用者”。
许多公司想要让自己可以扩展的平台,通过大力投资于最终僵化的数据中心是不可能做到这点的。比如说,人类基因组计划一开始是个GB级项目,但是很快达到了TB级和PB级。一些领先的企业已经开始以双模(bi-modal)方式来拆分工作负载,在云端运行一些数据工作负载。许多人预计,随着这种解决方案在采用周期上深入发展,这个潮流会加快发展。
现在大家很重视API,以一种可重用的方式来发掘数据和功能,许多公司期望在云端和数据中心运行其API。本地API提供了一种无缝的方式来发掘传统系统,并将它们与云应用程序连接起来,这对于希望实现云优先战略的公司来说至关重要。
更多的公司会在云端运行API,提供弹性,以便更好地应对需求高峰,并建立高效的连接,从而让它们能够比竞争对手更迅速地适应和创新。
Apache Spark
Apache Spark在点亮大数据。流行的Apache Spark项目提供了Spark Streaming技术,通过主要采用一种在内存中微批量处理的方法,近实时地处理数据流。它已从Hadoop生态系统的一部分,变成许多企业青睐的一种大数据平台。
Spark现在是最庞大的大数据开源项目,相比Hadoop它提供了显著加快的数据处理速度;因此,对于程序员来说极其自然、极加精确、极其方便。它为并行执行提供了一种高效的通用框架。
Spark Streaming是Spark的主要部分,被用来借助处理器核心,流式传输大块的数据,为此将大数据分割成更小的数据包,然后对其进行转换,因而加快弹性分布式数据集(RDD)的创建。这在当下非常有用,如今数据分析通常需要一组协同运行的机器的资源。
然而值得一提的是,Spark旨在改进而不是替换Hadoop架构。为了从大数据获得更大的价值,许多公司考虑结合使用Hadoop和Spark,以获得更好的分析和存储功能。
越来越复杂的大数据需求意味着,创新的压力仍然会很高。许多公司会开始明白,客户的成功离不开数据方面的工作。不利用数据分析的公司会开始歇业,而成功的企业认识到发展的关键是数据精炼和预测分析。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11在机器学习建模流程中,“特征重要性分析” 是连接 “数据” 与 “业务” 的关键桥梁 —— 它不仅能帮我们筛选冗余特征、提升模 ...
2025-10-11在企业的数据体系中,未经分类的数据如同 “杂乱无章的仓库”—— 用户行为日志、订单记录、商品信息混杂存储,CDA(Certified D ...
2025-10-11在 SQL Server 数据库操作中,“数据类型转换” 是高频需求 —— 无论是将字符串格式的日期转为datetime用于筛选,还是将数值转 ...
2025-10-10在科研攻关、工业优化、产品开发中,正交试验(Orthogonal Experiment)因 “用少量试验覆盖多因素多水平组合” 的高效性,成为 ...
2025-10-10在企业数据量从 “GB 级” 迈向 “PB 级” 的过程中,“数据混乱” 的痛点逐渐从 “隐性问题” 变为 “显性瓶颈”:各部门数据口 ...
2025-10-10在深度学习中,“模型如何从错误中学习” 是最关键的问题 —— 而损失函数与反向传播正是回答这一问题的核心技术:损失函数负责 ...
2025-10-09本文将从 “检验本质” 切入,拆解两种方法的核心适用条件、场景边界与实战选择逻辑,结合医学、工业、教育领域的案例,让你明确 ...
2025-10-09在 CDA 数据分析师的日常工作中,常会遇到这样的困惑:某电商平台 11 月 GMV 同比增长 20%,但究竟是 “长期趋势自然增长”,还 ...
2025-10-09Pandas 选取特定值所在行:6 类核心方法与实战指南 在使用 pandas 处理结构化数据时,“选取特定值所在的行” 是最高频的操作之 ...
2025-09-30球面卷积神经网络(SCNN) 为解决这一痛点,球面卷积神经网络(Spherical Convolutional Neural Network, SCNN) 应运而生。它通 ...
2025-09-30在企业日常运营中,“未来会怎样” 是决策者最关心的问题 —— 电商平台想知道 “下月销量能否达标”,金融机构想预判 “下周股 ...
2025-09-30Excel 能做聚类分析吗?基础方法、进阶技巧与场景边界 在数据分析领域,聚类分析是 “无监督学习” 的核心技术 —— 无需预设分 ...
2025-09-29XGBoost 决策树:原理、优化与工业级实战指南 在机器学习领域,决策树因 “可解释性强、处理非线性关系能力突出” 成为基础模型 ...
2025-09-29在标签体系的落地链路中,“设计标签逻辑” 只是第一步,真正让标签从 “纸上定义” 变为 “业务可用资产” 的关键,在于标签加 ...
2025-09-29在使用 Excel 数据透视表进行多维度数据汇总时,折叠功能是梳理数据层级的核心工具 —— 通过点击 “+/-” 符号可展开明细数据或 ...
2025-09-28在使用 Pandas 处理 CSV、TSV 等文本文件时,“引号” 是最容易引发格式混乱的 “隐形杀手”—— 比如字段中包含逗号(如 “北京 ...
2025-09-28