京公网安备 11010802034615号
经营许可证编号:京B2-20210330
我对数据科学的热情始于大约两年半前。我在做一份与数据科学无关的工作。对我来说,转行是一个很大的挑战,因为我有很多东西要学。
经过两年的学习和奉献,我终于找到了第一份数据科学家的工作。当然,我的学习之旅并没有停止。当我做数据科学家的时候,我学到了很多新东西。
学习部分不会改变。然而,我学什么和怎么学发生了巨大的变化。在本文中,我想详细说明这些变化。如果你正在努力成为一名数据科学家,你可能会经历同样的事情。
重要的是要强调,作为一名数据科学家需要不断学习。数据科学仍在发展,你需要时刻保持新鲜。我认为数据科学还不是一个成熟的领域,所以新的技术和概念经常被引入。
对于一个现实生活中的问题来说,1000万行并不多。
对我来说,最明显的变化是数据的大小。当我自己学习的时候,我正在练习最多有10万行的数据集。我现在认为它是一个小数据集。数据的大小取决于您正在处理的字段和问题。一般来说,1000万行对于一个实际的问题来说并不多。
使用大型数据集有其自身的挑战。首先,我需要学习能够处理此类数据集的新工具。在我开始做数据科学家之前,熊猫对我来说绰绰有余。然而,它并不是一个拥有大规模数据的高效工具。
允许分布式计算的工具更受青睐。Spark是其中最受欢迎的一个。它是一个用于大规模数据处理的分析引擎。Spark允许您将数据和计算分散到集群中,以实现性能的大幅提升。
幸运的是,可以将Spark与Python代码一起使用。PySpark是一个用于Spark的Python API,它结合了Python的简单性和Spark的高效性。
另一个大的变化是从本地环境到云环境。当我学习的时候,我在电脑里做所有的事情(即本地工作)。这对练习和学习来说已经足够了。
然而,一家公司在当地经营的可能性极小。大多数公司都在云中工作。数据存储在云中,计算在云中完成,等等。
为了高效地完成工作,获得对云工具和服务的全面理解是非常重要的。云提供商多种多样,但主要参与者是AWS、Azure、Google云平台。我必须学习如何使用他们的服务和管理存储在云中的数据。
作为一名数据科学家,我经常使用的另一个工具是ISGit。我在学习的时候学会了基本的git命令。但是,在生产环境中工作时就不同了。Git是一个版本控制系统。它维护对代码所做的所有更改的历史记录。
Git允许协作工作。你可能会作为一个团队在项目上工作。因此,即使你在一家小型初创企业工作,git也是一项必备技能。项目是用Git开发和维护的。
Git比它从外部看起来要复杂一点。然而,你在做了几个项目后就习惯了。
工具并不是我学习过程中唯一改变的东西。我处理数据的方式也发生了变化。当您处理一个可随时使用的数据集时,在清理和处理数据方面,您无能为力。例如,在机器学习任务的情况下,您可以在几个简单的步骤后应用模型。
在你的工作中情况会不同。一个项目的很大一部分花费在准备数据上。我不是说只是清理原始数据。这也是重要的一步。然而,探索数据中的底层结构和理解特征之间的关系是至关重要的。
如果您正在处理一个新问题,定义数据需求也将是您的工作。这是另一个需要一套特殊技能的挑战。领域知识是其中必不可少的一部分。
特征工程比机器学习模型的超参数调整重要得多。通过超参数调优可以实现的功能是有限的,因此可以在一定程度上提高性能。另一方面,一个信息特性有可能大大改善一个模型。
在我作为一名数据科学家开始工作之前,我专注于理解机器学习算法和如何调整模型。我现在把大部分时间都花在准备数据上。
我所说的就绪包括许多步骤,例如
统计知识对这些步骤非常重要。因此,我强烈建议提高你在这方面的知识。它会在你的数据科学生涯中帮助你很多。
有大量的资源来学习数据科学。您可以使用它们来提高您在数据科学的任何构建块中的技能。然而,这些资源并不能提供真正的工作经验。没有错。当你找到第一份工作时,让自己准备好学习一套不同的材料。
谢谢你的阅读。如果你有任何反馈请让我知道。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在大数据时代背景下,海量行业数据亟需通过专业化工具挖掘潜在价值,辅助企业业务决策、优化运营模式、规避经营风险。Python凭借 ...
2026-08-28SQL是数据分析领域最基础、最核心的工具,承担着取数、清洗、统计、分层、归因的全流程工作。不同于单纯的语法练习,实战化SQL数 ...
2026-08-28 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-28随着新零售模式的快速普及,零售行业从传统的“货品驱动”全面转向“用户驱动”。门店交易数据、线上消费记录、浏览轨迹、复购频 ...
2026-08-27在数据分析、爬虫采集、接口开发、数据归档等场景中,JSON与CSV是两种使用率最高的数据存储格式。JSON为键值对结构化格式,适配 ...
2026-08-27 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-08-27在数据分析工作中,时间序列是最常见的数据类型之一,订单时间、日志时间、交易时段、统计周期等数据均离不开时间处理。原始数据 ...
2026-08-26在数据分析与数据预处理工作中,原始数据普遍存在录入错误、系统故障、偶然极值等问题,极易产生异常数据。异常数据会严重干扰数 ...
2026-08-26 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-08-26在数理统计与数据分析领域,多因素方差分析与线性回归模型是研究变量关系、因素影响、数据差异规律的两大核心工具。二者均属于经 ...
2026-08-25数据分析的核心价值不在于数据计算与图表制作,而在于清晰、精准、有逻辑地输出结论、支撑业务决策。日常数据分析报告普遍存在结 ...
2026-08-25 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-08-25平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-08-24 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19