京公网安备 11010802034615号
经营许可证编号:京B2-20210330

作者:William Vorhies
CDA数据分析研究院原创作品, 转载需授权
2018年刚刚结束,在2019年到来之际,让我们一起展望在今年数据科学、机器学习和人工智能领域会有怎样的发展趋势。
首先让我们快速回顾一下,去年我们曾做出了哪些预测。
2018年预测回顾
预测1
模型生产和数据准备都将越来越自动化。
大型的数据科学操作将集中在一个平台上。这两种趋势都是为了提高效率,从而让更少的数据科学家完成更多工作。
结果
预测正确。 无代码数据科学和端对端集成平台都处于上升发展阶段。
预测2
数据科学将继续专业化,意味着全栈型数据科学家将消失。
结果
是的。如今比起数据科学家,数据工程师更受关注。数据工程师是那些让数据科学模型在现实中发挥作用的人。
预测3
非数据科学家将比数据科学家执行更多复杂的分析。
结果
这是真的。Data Viz和Visual Analytics等技术作为桥梁,让非数据科学家能够从复杂的数据科学工具中获取更多价值。
预测4
深度学习很复杂。很少有数据科学家掌握刚领域的技能,这将阻碍人工智能的应用,直到深度学习平台得到更为简化和产品化。
结果
微软和谷歌都在2018年推出了自动化深度学习平台。这些平台从转移学习开始,但正朝着完整自动化深度学习发展。同时也还有一些集成自动深度学习平台。OneClick.AI有完整的自动化机器学习和自动化深度学习平台。
预测5
尽管有大肆宣传和炒作,但人工智能和深度学习在各大市场中渗透的速度和广度都比你想象更慢更窄。
结果
除了聊天机器人的出现,人工智能在商业中的实际应用非常有限。他们来了,但还没有。在我知道最全面的研究表明,在大型公司中,只有五分之一到三分之一的公司在大规模实施人工智能。在较小的公司中,这个比例要小得多。而且我们不确定哪些是否是“真正的”人工智能。
预测6
政府将开始认真看待人工智能对社会和隐私的影响,无论是有意的还是无意的。
结果
只要看到这方面的新闻就会发现,政府在针对这方面出台相关的监管机制。对人工智能设计的隐私等方面进行规定。
我们队2018年的预测基本正确,当中有些预测趋势也可以用于新的一年,下面继续看到对2019年数据科学、机器学习和人工智能领域的预测。
2019年预测
预测1:
数据变得比算法更重要
我们已经有一年多美元在深度学习和机器学习方面取得任何重大突破了。当中也有一些渐进式的改进,比如使用时间卷积网(TCN)而不是RNN来减少NLP的延迟,但没有很大的新创新。性能最佳的算法很有名,或者可通过自动机器学习轻松发现。
目前,随着公司开始实现数字化转型,拥有更多更好的数据是成功的关键。实际上,这为同时想多个方向提供数据相关解决方案的提供了竞争机会。
一个方面,获得准确标记的图像或文本的训练数据仍然非常昂贵且耗时。Figure Eight这样专注于标记数据的公司正在推广智能的成本效益策略,比如Active Learning,让你在标记数据和模型准确性之间取得最佳权衡。这涉及多次迭代,添加人工标记或机器标记的数据,然后重新训练以找到最佳方案。
第二个方面是访问第三方数据。像DymstData这样的服务公司已经进入该领域,作为数百种附加数据的结算方。他们还承担着确保敏感PII受到保护等服务,这些信息在金融和医疗服务中尤为重要。
第三个方面是自动跟踪并记录模型中使用数据的来源。特别是当不同来源的流数据被集成,且随时间变化时,知道其来源以和使用方式对准确性和合规性都是至关重要的。Tibco和其他分析平台正在整合此功能。
围绕数据的服务产品在今年将大幅扩展。
预测2:
随着人工智能和机器学习从分析平台转移到行业或流程特定应用,一切将变得更容易。
纵观人工智能和机器学习创业公司,可以看到竞争正在转向行业或流程特定的应用。这些应用程序或小型平台主要解决市场营销、B2B销售、医疗保健、金融技术等行业特定问题。
这些新应用程序专注于嵌入人工智能和机器学习,从而企业在进行更新和改进时,只需依赖这些开发人员,而无需大型内部数据科学家团队。
有人将这称之为人工智能和机器学习商品化,但更准确地说,你可以将其视为人工智能和机器学习的专业化。
如果你熟悉90年代后期从流程再造(Reengineering)到企业资源计划(ERP)的过渡,其实这是一回事。最初,流程再造呼吁公司使用复杂的定制IT解决方案来改进流程,因为当时还不存在标准化解决方案。这为Oracle、PeopleSoft、SAP等采用集成ERP的企业带来了机遇。我们的行业目前正在经历同样的变化。
这些新的企业都致力于在各自特定领域提供广泛的解决方案,但不可避免地最终得到不太大的ERP规模平台。
还要注意中小型公司中人工智能和机器学习的采用率,这些公司不再需要大型数据科学团队,而可以完全依赖定制的开发模型。
预测3:
数据工程师和数据分析师的崛起
这并不是说数据科学家以及不受欢迎了,远非如此。当你缺乏某种技能时,市场会以不同的方式填补这种短缺。
一种方法是通过上文讨论的行业和流程特定智能应用,这些应用程序不需要大量的内部数据科学家。
第二种方法是自动机器学习平台在迅速涌现。这意味着效率的提高,更少的数据科学家能够完成更多的工作。
模型的数量没有减少,而是增加了,这将工作负荷转移到具备两方面技能的数据工程师上。
第一是能够创建数据科学所需的基础架构,如数据湖和Spark实例。
第二是采用模型,确保模型在操作系统中实现,并跟踪模型的准确性和更新。
一些数据工程师还负责数据操作,确保数据流干净和预处理环节。
分析平台的另一个发展是视觉分析和数据可视化工具的发展。如今,这些工具大多与数据科学工具集完全集成,让数据分析师和高层能从中提取更多价值,甚至指导分析工作。他们不会取代数据科学家,但强化了高级分析中的团队作用。
预测4:
神经形态芯片:人工智能与物联网走向前沿
两种不同的技术同时达到半成熟阶段,从而解决长期存在的延迟问题。
例如,当你想用移动设备自动将文本或图像外来词翻译成其他语言时,你的设备将信号发送到云端进行翻译,然后传回设备。
谷歌等即时翻译服务已经从RNN转为专门的CNN结构,称为时间卷积网,因为RNN 不能很好地适应大规模并行处理,而CNN可以。这样能够减少延迟,但仍然保证信号的完整传输。
解决这个问题的两种技术之一是5G网络。5G速度更快,但其真正的好处是能够承载的流量密度。这能够让一切信息都能在互联网上传输,具体的传输量还有待观察。
第二种解决方案是引入新的且更好的神经形态芯片(又称脉冲神经网络)。我们希望这些全新的神经网络能够实现通用人工智能,虽然这还有很长的路要走。
如今,主要的芯片制造商和几家初创公司都在发布现在正在发布脉冲神经芯片,专门针对芯片上的CNN和RNN型号进行了优化。其中一些还针对极低功耗进行了优化。
这些特性结合在一起非常适合将深度学习转移到网络边缘的芯片上。从今年开始,随着这些新功能的出现,物联网和其他流媒体数据应用程序将出现爆炸式增长。
预测5:
不同的人工智能框架将学会相互交流
现在,文本、语音、图像和视频模型已成为主流,我们遇到了意想不到的障碍。在一个框架(Caffe2、PyTorch、Apache MXNet、Microsoft Cognitive Toolkit和TensorFlow)上构建的模型无法轻松移植到不同的框架。
幸运的是,这个痛点推动了创新。AWS、Facebook和Microsoft合作构建了开放式神经网络交换(ONNX),使模型可以在不同的框架上实现互操作。
随着开发人员、应用程序和设备之间共享的模型数量越来越多,ONNX将成为今年的关键技术。
以上就是2019年数据科学、机器学习和人工智能领域的相关预测。让我们拭目以待,期待这些领域在今年的发展和创新。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
近日,由 CDA 数据科学研究院重磅发布的《2026 全球数智化人才指数报告》,被中国教育科学研究院官方账号正式收录, ...
2026-04-22在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22 很多数据分析师每天盯着GMV、转化率、DAU等数字看,但当被问到“什么是指标”“指标和维度有什么区别”“如何搭建一套完整的 ...
2026-04-22在数据分析与业务决策中,数据并非静止不变的数值,而是始终处于动态波动之中——股市收盘价的每日涨跌、企业月度销售额的起伏、 ...
2026-04-21在数据分析领域,当研究涉及多个自变量与多个因变量之间的复杂关联时,多变量一般线性分析(Multivariate General Linear Analys ...
2026-04-21很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度”“这 ...
2026-04-21在数据处理与分析的全流程中,日期数据是贯穿业务场景的核心维度之一——无论是业务报表统计、用户行为追踪,还是风控规则落地、 ...
2026-04-20在机器学习建模全流程中,特征工程是连接原始数据与模型效果的关键环节,而特征重要性分析则是特征工程的“灵魂”——它不仅能帮 ...
2026-04-20很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问题, ...
2026-04-20在数字化时代,数据已成为企业决策的核心驱动力,数据分析与数据挖掘作为解锁数据价值的关键手段,广泛应用于互联网、金融、医疗 ...
2026-04-17在数据处理、后端开发、报表生成与自动化脚本中,将 SQL 查询结果转换为字符串是一项高频且实用的操作。无论是拼接多行数据为逗 ...
2026-04-17面对一份上万行的销售明细表,要快速回答“哪个地区卖得最好”“哪款产品增长最快”“不同客户类型的购买力如何”——这些看似复 ...
2026-04-17数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16在机器学习无监督学习领域,Kmeans聚类因其原理简洁、计算高效、可扩展性强的优势,成为数据聚类任务中的主流算法,广泛应用于用 ...
2026-04-16在机器学习建模实践中,特征工程是决定模型性能的核心环节之一。面对高维数据集,冗余特征、无关特征不仅会增加模型训练成本、延 ...
2026-04-16在数字化时代,用户是产品的核心资产,用户运营的本质的是通过科学的指标监测、分析与优化,实现“拉新、促活、留存、转化、复购 ...
2026-04-15在企业数字化转型、系统架构设计、数据治理与AI落地过程中,数据模型、本体模型、业务模型是三大核心基础模型,三者相互支撑、各 ...
2026-04-15数据分析师的一天,80%的时间花在表格数据上,但80%的坑也踩在表格数据上。 如果你分不清数值型和文本型的区别,不知道数据从哪 ...
2026-04-15在人工智能与机器学习落地过程中,模型质量直接决定了应用效果的优劣——无论是分类、回归、生成式模型,还是推荐、预测类模型, ...
2026-04-14