
CDA数据分析师 出品
来源:datacamp
编译:Mika
根据《韦氏词典》,数据指的是用作推理、讨论或计算基础的事实信息。
基于这个定义,我们可以进一步得出:数据可以理解为是收集到的任何信息,可以使用、进一步处理和分析以获得见解。而且通常与计算机联系在一起,因为数据通常是在计算机中生成和存储的,然而数据存在的时间比我们想象的要长得多。
人类存储和分析数据的最早例子可以追溯到公元前18000年,当时人们发现史前人类使用计数棒进行初步计算。这些旧石器时代部落的人在木棍和骨头上刻上刻痕,以记录人类的活动,比如交易和监控物资。到公元前2400年,在巴比伦发明出了用于计算的算盘。
纵观历史,数据收集、处理和分析的不断发展是通过石板、粘土、纸莎草、木头和纸卷上的大量文字来体现的。最终,随着更多形式的数据被发现,处理、收集、存储和分析数据的需求也在不断发展。
随着人类社会的进步,对数据处理的要求也越来越高。
19世纪,在美国开始人口普查进行。人口普查中的数据点数量呈指数增长,美国人口普查局估计,收集和分析人口普查中的所有数据需要几年甚至几十年的时间。
这是个很大的问题,因为只有在下一次人口普查即将开始时,才会完成对当前人口普查数据的汇编和分析。
幸运的是,一位名叫赫尔曼·霍勒里斯的年轻工程师和发明家开发了霍勒里斯制表机。这是一种机电式制表机,将收集和分析人口普查数据所需的时间从几年缩短到仅仅几个月。正因为如此,霍勒里思被视为现代自动计算之父,后来因创立IBM而闻名。
快进到20世纪,计算机出现了。随着功能更强大的计算机的出现,对数据存储的要求也越来越高。
德国-奥地利工程师弗里茨·普夫勒默发明了一种在磁带上磁性存储信息的方法。他的一些发明原理至今仍被用于数字数据存储。
在这个时代,“商业智能”一词越来越流行,因为对新兴软件以及用于分析商业和运营绩效的系统的需求迅速增加。
1989年,蒂姆·伯纳斯·李创建了万维网(又称互联网),数据革命发生了真正的变化。这导致了全世界人民之间的自动信息共享。这意味着今天有更多的数据被共享、创建和存储,从而产生了收集、使用和分析数据的新方法。
由于20世纪90年代互联网的惊人增长以及个人电脑和计算设备的稳定发展,在线设备的数量以及由此产生的数据量迅速增长。
虽然大数据的概念早在20世纪90年代就已经存在,但直到2005年罗杰·穆加拉斯才正式给它贴上标签。他将其描述为"使用传统商业智能工具几乎无法管理和处理的大量数据"。
大数据是一个用来描述大量数据的术语,包括结构化数据和非结构化数据,这些数据每天都会淹没企业。它包括信息量、创建和收集信息的速度,以及所覆盖数据点的种类或范围。
考虑到大数据的规模和复杂性,收集、组织和分析它以发现模式和其他有用信息的过程已经成为帮助许多组织做出商业决策的一部分。这反过来又催生了数据科学——一个跨学科领域,它使用科学方法、流程、算法和系统从大量数据中发现模式,并使商业领袖能够获得见解。
根据IBM的说法,数据科学是一种多学科方法,可以从当今组织收集和创建的大量且不断增加的数据中提取可操作的见解。
该领域通常需要计算机科学和纯科学技能,因为数据科学家在其方法中应用科学方法,并使用预测分析和人工智能从数据中提取见解。
如今,“数据科学”经常被企业和组织用作处理大量数据的通用术语,无论是准备、清理、分析数据还是可视化数据以揭示模式。
以下我们列出了可从事的七种数据相关职业:
数据科学家需要能够应用数学、统计学和科学方法。
使用多种工具和技术来清理和准备数据;进行预测分析和人工智能;并解释如何利用这些结果来为商业问题提供数据驱动的解决方案。数据科学家需要的技能比数据分析师多得多。
数据分析师收集、处理和执行统计数据分析,为组织得出有意义的结论。
数据分析师将大型数据集转化并处理成可用的形式,如报告或演示。他们还通过研究重要的模式来帮助决策过程,并从数据中收集洞察力,然后有效地传达给组织领导,以帮助商业决策。
数据工程师负责准备、处理和管理收集和存储的数据,用于分析或操作用途。
像传统的工程师一样,数据工程师建立和维护数据 "管道",将数据从一个系统连接到另一个系统,使数据科学家能够获得信息。正因为如此,数据工程师被要求了解数据科学中使用的几种编程语言,如Python、R和SQL。
数据架构师主要是设计和创建数据管理系统的蓝图,然后由数据工程师建立。
类似于传统的建筑师,数据架构师是 "远见者",因为他们负责可视化和设计一个组织的数据管理框架。此外,数据架构师改善现有系统的性能,确保数据库管理员和分析师能够使用这些系统。
商业智能开发者是专门的工程师,他们使用软件工具将数据转化为有用的见解,以帮助商业决策。
他们负责简化技术信息,让公司里的其他人都能轻松理解。简而言之,他们创建和运行包含他们使用商业智能工具找到的数据的报告,并将信息转化为更通俗的术语。
鉴于统计学是数据科学的主要基础之一,许多统计学家可以轻松地过渡到数据科学领域。
统计学家主要负责数据的收集和处理。他们决定需要什么数据以及如何收集数据。此外,他们设计实验,分析和解释数据,并报告结论。
机器学习工程师是另一组专业工程师,他们专注于研究、构建和设计人工智能和机器学习系统,以实现预测模型的自动化。
基本上,他们开发的算法使用输入数据并利用统计模型预测输出,同时在新数据可用时不断更新输出。
下面我们看看以上这些数据科学职业的最受欢迎程度。下图显示了2021年12月8日美国的职位空缺情况。
数据架构师是最受欢迎的数据科学职业道路,因为他们在创建其他数据科学专业人员随后使用的数据管理系统方面非常重要。
接下来是机器学习工程师,考虑到利用人工智能预测许多科技公司结果的重要性。
需求最少的是统计人员,主要是因为许多传统的统计学家现在正在成为数据科学家。统计学家从纯统计学转向数据科学相对简单是,他们已经拥有成为一名成熟的数据科学家所需的基础知识。
毫无疑问,数据科学如今非常流行,但更好的问题是,它在未来还会如此流行吗?根据就业预测,情况似乎的确如此。
美国劳工统计局2020-2030就业预测的数据显示,数据科学职业,包括统计学、数据科学以及数据工程等其他基于数学和科学的职业,从2020年到2030年的百分比变化来看,将呈现出非常高的增长率。统计学家总体排名第14位,而数据科学家和其他数学科学职业在数据中包含的790个职位中总体排名第31位。
尽管统计学家和数据科学家在总劳动力中所占的份额与其他职业相比很小,但随着数据科学职业道路变得越来越流行,这些数字预计将在未来几年增加。
下图显示了统计学家、数据科学家和其他数学科学职业与其他预计增长率较高的职业的对比情况。
数据相关职业备受欢迎的一个主要原因在于其收入高。
下图显示了纽约市10种不同职业--包括数据科学家和数据分析师的工资范围。这些数据来自Teleport,该网站汇总了不同城市的生活条件,如工资的数据。
根据Teleport的数据,数据科学家的年薪中位数在纽约市排名第四,为114105美元,仅次于企业高管和医护人员。事实上,在马尼拉等其他一些城市,数据科学家的排名高达第二,仅次于企业高管。
数据分析师的薪资也很可观,数据分析师的年薪中位数为61818美元,仍然相当于纽约市的平均家庭收入。
数据科学受欢迎的另一个主要原因是,如今的企业将数据科学的原理整合到日常运作中。下图显示了工作中涉及数据科学的前10个行业,其中涉及到8000家公司的样本数据。
毫不奇怪,包括谷歌、苹果和优步等科技公司占据了榜首。毕竟,大数据的激增是由互联网的诞生引起的,互联网与软件和技术密切相关。数据科学实际上是使用各种工具和技术处理大量信息。
接下来是金融服务公司,这是金融科技公司崛起带来的。作为“金融”和“技术”的门户,金融科技公司将技术和创新整合到其服务和产品中,以改善其对客户的交付,扰乱传统金融服务。由于它涉及处理大量数据,如客户信息,金融服务公司看到了数据科学工具的潜力,可以帮助简化和优化流程,改进服务。
数据科学是一条非常有发展的职业道路,而且没有放缓的迹象。在未来的许多年里,它将继续塑造和影响企业和组织的运作方式。
至于你应该走哪条特定的数据科学职业道路,这主要取决于你的个人优势和总体兴趣。重要的是,上述任何职业都是值得的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04CDA 数据分析师:驾驭数据范式,释放数据价值 在数字化转型浪潮席卷全球的当下,数据已成为企业核心生产要素。而 CDA(Certified ...
2025-09-04K-Means 聚类:无监督学习中数据分群的核心算法 在数据分析领域,当我们面对海量无标签数据(如用户行为记录、商品属性数据、图 ...
2025-09-03特征值、特征向量与主成分:数据降维背后的线性代数逻辑 在机器学习、数据分析与信号处理领域,“降维” 是破解高维数据复杂性的 ...
2025-09-03CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01CDA 数据分析师:企业数字化转型的核心引擎 —— 从能力落地到价值跃迁 当数字化转型从 “选择题” 变为企业生存的 “必答题”, ...
2025-09-01数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29CDA 数据分析与量化策略分析流程:协同落地数据驱动价值 在数据驱动决策的实践中,“流程” 是确保价值落地的核心骨架 ——CDA ...
2025-08-29CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-08-28CDA认证:数据时代的职业通行证 当海通证券的交易大厅里闪烁的屏幕实时跳动着市场数据,当苏州银行的数字金融部连夜部署新的风控 ...
2025-08-28