京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据科学家Michael Galarnyk著
我以前写过《如何构建数据科学投资组合》,其中包括向潜在的雇主展示你能做什么而不是告诉他们你能做什么的重要性。这个博客利用aSuccess is Iceberg ImagebyOrysya Stusas框架来展示人们在获得数据科学成功的过程中经常隐藏的几个方面。这篇博客旨在表明,大多数人都不得不花费相当多的努力来达到他们现在的水平。他们必须努力工作,有时经历失败,表现出纪律,坚持不懈,为目标献身,有时牺牲或冒险。说完,我们开始吧!
正如你在上面为hertweet创建的GIF中看到的那样,人们在日常模型构建中会犯很多技术错误/失败。
我们大多数编写代码或从事数据科学的人经常看到彼此工作的最终产品--而不是作为过程一部分的草稿、错误和决策。这些步骤的一点透明度会有很大的帮助。
Jake VanderPlasis在Atweeton中似乎也表达了类似的观点,在开源领域,人们通常只看到成品而不是过程。
但我敢打赌,在任何一个成功的开源项目的表面上,都有很多痛苦、痛苦和自我怀疑。
除了技术上的失败,还有其他类型的失败,包括你可以穿的类型(期刊拒绝,电子邮件拒绝,等等)。凯特琳·K·科比(Caitlin K.Kirbyy)确实穿了她的失败/拒绝。《华盛顿邮报》上有一篇文章详细描述了她的裙子是一件手工制作的及膝服装,由她在过去五年中收到的17封拒绝信(期刊拒绝、电子邮件拒绝等)制成。
顺便说一句,如果你想要更多与软件/数据科学相关的拒绝故事,有一个完整的拒绝网站,你可以去看看,这可能会启发你。
大多数人都必须努力工作才能达到他们现在的水平。我绝对不是说你必须每周例行公事地工作70-90小时,因为这听起来不健康。雷切尔·托马斯的帖子提到了这种态度可能是歧视性的和适得其反的。
我们需要尽可能地摆脱工作时间的数量才是最重要的这种肤浅的想法。科技行业对长时间工作的痴迷不仅对许多残疾人来说是不可及的,对每个人的健康和人际关系都是有害的,而且正如奥利维亚·戈尔迪尔为Quartz at Work指出的那样,关于生产率的研究表明,这只是效率低下:
正如无数研究表明的那样,这根本不是真的。工作时间越长,生产率就会急剧下降,一旦人们每周工作55小时,生产率就会完全下降,以至于平均每周工作70小时的人的生产率不会超过少工作15小时的同事。
疯狂的长时间工作在学术界也很常见,因为杰克·范德普拉斯在下面的推特上说。
虽然这条推文不是对吴恩达早先推文的评论,但我认为它表明有不同的方法可以获得成功,而不是持续不断地工作。thePython数据科学手册的作者似乎做得很好。(推特上的杰克·范德普拉斯)
与其努力工作,也许我们应该谈谈坚韧或坚持,因为杰里米·霍华德和西尔万·古格的新书中有一段关于坚韧的精彩文章。
推特上的内容是杰里米·霍华德(Jeremy Howard)“Sand Sylvain Gugger”新书的摘录。
简而言之,我认为从这件事中得到的最好的东西是:
你将面临许多障碍,既有技术上的障碍,也有(甚至更困难的)你周围不相信你会成功的人。有一种方法肯定会失败,那就是停止尝试。
生活中的许多成功都是关于坚持不懈。有很多成功人士的故事,比如爱彼迎的数据科学家彭凯利,他们真的坚持不懈,不断地工作和改进。在她的一篇博客文章中,她查看了她申请和面试了多少个职位。
Applications: 475
Phone interviews: 50
Finished data science take-home challenges: 9
Onsite interviews: 8
Offers: 2
Time spent: 6 months
她显然申请了很多工作,并一直坚持下去。在她的文章中,她甚至提到你需要如何不断地从面试经验中学习。
记下所有你被问到的面试问题,尤其是那些你没能回答的问题。你可以再次失败,但不要在同一地点失败。你应该一直在学习和提高。
这篇文章的一个主要主题是每个人都经历过一些失败。重要的部分是,有些人竭尽全力去实现那里的目标。在Andreas Madsen发布的博客中,他描述了进入人工智能(通常是计算机科学系)的顶级博士学位是多么困难。基本上,他和所有的教授交谈过,他被告知他需要“在顶级ML场馆发表1-2篇论文”才能进入顶级博士学位项目。他连续花了7个月的时间在一个没有资金和主管的研究项目上,以产生可以出版的作品。
牺牲和风险可以以许多不同的形式出现。一个风险可能是忽略来自上面的命令。WhenGreg Lindenwas在亚马逊,他做了几个有趣的项目,尽管他应该做其他事情。在他的一篇博客文章中,他描述了一个项目,这个项目是:
根据亚马逊购物车中的商品进行推荐。添加一些东西,看看弹出什么。再加几个,看看有什么变化…我黑了一个原型。在一个测试网站上,我修改了Amazon.com购物车页面,以推荐您可能喜欢添加到购物车中的其他商品。在我看来挺不错的。我开始四处展示。
出了个问题。
虽然反应是积极的,但也有一些担忧。特别是,一个营销高级副总裁坚决反对它……在这一点上,我被告知我被禁止在这方面做任何进一步的工作。我被告知亚马逊还没有准备好推出这个功能。它应该停在那里。
相反,我为在线测试准备了该特性。我相信购物车的推荐。我想衡量一下销售影响。
我听说SVP发现我在推出一个测试时很生气。但是,即使对高管来说,也很难阻止测试。测量是好的。反对测试的唯一好理由是,负面影响可能如此严重,以至于亚马逊负担不起,这是一个很难做出的声明。测试开始了。
结果很清楚。它不仅赢了,而且这个功能以如此大的优势赢了,以至于不让它直播让亚马逊付出了巨大的变革代价。随着新的紧迫性,购物车推荐推出…
当时,亚马逊肯定是混乱的,但我怀疑我忽视来自上面的命令是在冒险。尽管亚马逊很好,但它还没有一种完全包容测量和辩论的文化。
虽然我不主张忽视上级的建议,但似乎在某些情况下,冒险对公司和你自己都是有益的。
希望你能从这个博客中找到一些对你的数据科学之旅有用的建议和例子。请记住,成功人士的许多建议都存在生存偏见。总是半信半疑地接受建议或分享经验。如果你有任何问题、想法,或者只是想分享你自己的经历,请给我们留言。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12在CDA(Certified Data Analyst)数据分析师的日常工作中,“挖掘变量间的关联关系”是高频核心需求——比如判断“用户停留时长 ...
2026-01-12在存量竞争时代,用户流失率直接影响企业的营收与市场竞争力。无论是电商、互联网服务还是金融行业,提前精准预测潜在流失用户, ...
2026-01-09在量化投资领域,多因子选股是主流的选股策略之一——其核心逻辑是通过挖掘影响股票未来收益的各类因子(如估值、成长、盈利、流 ...
2026-01-09在CDA(Certified Data Analyst)数据分析师的工作场景中,分类型变量的关联分析是高频需求——例如“用户性别与商品偏好是否相 ...
2026-01-09数据库中的历史数据,是企业运营过程中沉淀的核心资产——包含用户行为轨迹、业务交易记录、产品迭代日志、市场活动效果等多维度 ...
2026-01-08在电商行业竞争日趋激烈的当下,数据已成为驱动业务增长的核心引擎。电商公司的数据分析师,不仅是数据的“解读官”,更是业务的 ...
2026-01-08在数据驱动决策的链路中,统计制图是CDA(Certified Data Analyst)数据分析师将抽象数据转化为直观洞察的关键载体。不同于普通 ...
2026-01-08在主成分分析(PCA)的学习与实践中,“主成分载荷矩阵”和“成分矩阵”是两个高频出现但极易混淆的核心概念。两者均是主成分分 ...
2026-01-07在教学管理、学生成绩分析场景中,成绩分布图是直观呈现成绩分布规律的核心工具——通过图表能快速看出成绩集中区间、高分/低分 ...
2026-01-07