京公网安备 11010802034615号
经营许可证编号:京B2-20210330
他说数据科学家就是做算术的,还说这是件好事
两年前,一项来自LinkedIn的调查结果显示,“统计分析和数据挖掘”是2014年最大的求职法宝。在大数据技术飞速发展的今天,数据科学家成了炙手可热的大红人。
数据科学家是谁?干嘛的?他们好找工作吗?
度娘说,
666的样子啊。不过太严肃了,我都没听懂,and what about you?
还有一种听起来就像人话的多了,
“你擅长数学,会用Python编程,而且还对某个行业了如指掌?如果你拥有这样的技能集,那你就有可能当上数据科学家。”
嗯,“技能集”。技能集?!能吃吗?
是不是对当上数据科学家再不敢奢望,但如果我告诉你,有一些看上去站着说话不腰疼的人说了这样的话,
“ 数据科学家大多只做算术,这是件好事。”
比如这位——在Basecamp(37signals公司旗下一款项目管理软件 )团队工作的Noah。很多时候他被人称为“数据科学家”,但在他自己看来,大部分情况下他只是做做算术,而且他也很喜欢。
这是Noah在过去几周里所做的一些工作,每一项都是为了应对Basecamp在实际业务中面临的问题:
分析来自不同国家用户的对话内容、试用完成度和平均帐单数量 确定人们当人们登录至一个现有帐户时偶然注册Basecamp的比例,以及长期以来这个现象的变化情况 分析和报告一些Basecamp产品的财务业绩 对帐户所有者进行调查并分析 对一项影响Basecamp用户行为特征的AB测试进行分析
在过去的两周里,Noah所做过的最“复杂”的数学是一些有力的分析和重要测试。他工作的大部分是写SQL queries 来获取数据,对数据进行基本的运算(计算差异,百分比等),绘制结果,并写下注释或建议。
注意昂~可没有编码任何算法、构建推荐引擎昂~也没有部署深度学习系统,或是建立一个神经网络昂~
为什么没有?可能因为现在 Basecamp 还不需要那些东西吧。
在繁花似锦的“数据科学”下有个不怎么光彩的小秘密,那就是大多数人谈论的所谓的数据科学,并不是企业实际需要的东西。企业需要的是准确和可操作的信息,来帮助他们决定如何花费他们的时间和资源。通常一个通过机器学习解决业务中小问题的最佳解决方案,往往只需要高质量的数据,以及一个如何使用最简单的方法解决问题的理念。
也行有人会说,Noah描述的价值并不来自“数据科学”,而是“商业智能”或“数据分析”。我没有资格对数据妄下主观定义,但不管你叫它什么 - 它仍然是对那些花费时间从事数据工作的人,最有价值的方式。
在Noah他们那儿,相当多希望进入“数据科学”领域的朋友都给他发来邮件,希望得到一些建议。在这些邮件中不乏这样的问题:
Dear诺亚,我是应该先得到一个硕士学位?还是应该参加一堆Kaggle比赛?
Noah的建议非常简单:兄弟,都不用。你就学习最基础的数学就行了。然后你再知道如何编写基本的SQL查询,了解企业的经营方式,以及想要成功它需要什么。如果你想成为一名对企业有价值的贡献者,就利用你的周末时间真正进入一家小企业“体验生活”,实际工作一把,而不是参加什么数据挖掘竞赛。去与客户交谈,去注意哪些产品畅销,哪些没有。去试着想想推动业务的经济形式,以及你如何能帮助它更得更多的成功。
所以,知道问题是什么才是迈入精英数据科学家梯队的关键一步。但不要那么傻白甜,因为上面说的技能集,该攒还是得攒!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28