
数据科学家Michael Galarnyk著
我以前写过《如何构建数据科学投资组合》,其中包括向潜在的雇主展示你能做什么而不是告诉他们你能做什么的重要性。这个博客利用aSuccess is Iceberg ImagebyOrysya Stusas框架来展示人们在获得数据科学成功的过程中经常隐藏的几个方面。这篇博客旨在表明,大多数人都不得不花费相当多的努力来达到他们现在的水平。他们必须努力工作,有时经历失败,表现出纪律,坚持不懈,为目标献身,有时牺牲或冒险。说完,我们开始吧!
正如你在上面为hertweet创建的GIF中看到的那样,人们在日常模型构建中会犯很多技术错误/失败。
我们大多数编写代码或从事数据科学的人经常看到彼此工作的最终产品--而不是作为过程一部分的草稿、错误和决策。这些步骤的一点透明度会有很大的帮助。
Jake VanderPlasis在Atweeton中似乎也表达了类似的观点,在开源领域,人们通常只看到成品而不是过程。
但我敢打赌,在任何一个成功的开源项目的表面上,都有很多痛苦、痛苦和自我怀疑。
除了技术上的失败,还有其他类型的失败,包括你可以穿的类型(期刊拒绝,电子邮件拒绝,等等)。凯特琳·K·科比(Caitlin K.Kirbyy)确实穿了她的失败/拒绝。《华盛顿邮报》上有一篇文章详细描述了她的裙子是一件手工制作的及膝服装,由她在过去五年中收到的17封拒绝信(期刊拒绝、电子邮件拒绝等)制成。
顺便说一句,如果你想要更多与软件/数据科学相关的拒绝故事,有一个完整的拒绝网站,你可以去看看,这可能会启发你。
大多数人都必须努力工作才能达到他们现在的水平。我绝对不是说你必须每周例行公事地工作70-90小时,因为这听起来不健康。雷切尔·托马斯的帖子提到了这种态度可能是歧视性的和适得其反的。
我们需要尽可能地摆脱工作时间的数量才是最重要的这种肤浅的想法。科技行业对长时间工作的痴迷不仅对许多残疾人来说是不可及的,对每个人的健康和人际关系都是有害的,而且正如奥利维亚·戈尔迪尔为Quartz at Work指出的那样,关于生产率的研究表明,这只是效率低下:
正如无数研究表明的那样,这根本不是真的。工作时间越长,生产率就会急剧下降,一旦人们每周工作55小时,生产率就会完全下降,以至于平均每周工作70小时的人的生产率不会超过少工作15小时的同事。
疯狂的长时间工作在学术界也很常见,因为杰克·范德普拉斯在下面的推特上说。
虽然这条推文不是对吴恩达早先推文的评论,但我认为它表明有不同的方法可以获得成功,而不是持续不断地工作。thePython数据科学手册的作者似乎做得很好。(推特上的杰克·范德普拉斯)
与其努力工作,也许我们应该谈谈坚韧或坚持,因为杰里米·霍华德和西尔万·古格的新书中有一段关于坚韧的精彩文章。
推特上的内容是杰里米·霍华德(Jeremy Howard)“Sand Sylvain Gugger”新书的摘录。
简而言之,我认为从这件事中得到的最好的东西是:
你将面临许多障碍,既有技术上的障碍,也有(甚至更困难的)你周围不相信你会成功的人。有一种方法肯定会失败,那就是停止尝试。
生活中的许多成功都是关于坚持不懈。有很多成功人士的故事,比如爱彼迎的数据科学家彭凯利,他们真的坚持不懈,不断地工作和改进。在她的一篇博客文章中,她查看了她申请和面试了多少个职位。
Applications: 475
Phone interviews: 50
Finished data science take-home challenges: 9
Onsite interviews: 8
Offers: 2
Time spent: 6 months
她显然申请了很多工作,并一直坚持下去。在她的文章中,她甚至提到你需要如何不断地从面试经验中学习。
记下所有你被问到的面试问题,尤其是那些你没能回答的问题。你可以再次失败,但不要在同一地点失败。你应该一直在学习和提高。
这篇文章的一个主要主题是每个人都经历过一些失败。重要的部分是,有些人竭尽全力去实现那里的目标。在Andreas Madsen发布的博客中,他描述了进入人工智能(通常是计算机科学系)的顶级博士学位是多么困难。基本上,他和所有的教授交谈过,他被告知他需要“在顶级ML场馆发表1-2篇论文”才能进入顶级博士学位项目。他连续花了7个月的时间在一个没有资金和主管的研究项目上,以产生可以出版的作品。
牺牲和风险可以以许多不同的形式出现。一个风险可能是忽略来自上面的命令。WhenGreg Lindenwas在亚马逊,他做了几个有趣的项目,尽管他应该做其他事情。在他的一篇博客文章中,他描述了一个项目,这个项目是:
根据亚马逊购物车中的商品进行推荐。添加一些东西,看看弹出什么。再加几个,看看有什么变化…我黑了一个原型。在一个测试网站上,我修改了Amazon.com购物车页面,以推荐您可能喜欢添加到购物车中的其他商品。在我看来挺不错的。我开始四处展示。
出了个问题。
虽然反应是积极的,但也有一些担忧。特别是,一个营销高级副总裁坚决反对它……在这一点上,我被告知我被禁止在这方面做任何进一步的工作。我被告知亚马逊还没有准备好推出这个功能。它应该停在那里。
相反,我为在线测试准备了该特性。我相信购物车的推荐。我想衡量一下销售影响。
我听说SVP发现我在推出一个测试时很生气。但是,即使对高管来说,也很难阻止测试。测量是好的。反对测试的唯一好理由是,负面影响可能如此严重,以至于亚马逊负担不起,这是一个很难做出的声明。测试开始了。
结果很清楚。它不仅赢了,而且这个功能以如此大的优势赢了,以至于不让它直播让亚马逊付出了巨大的变革代价。随着新的紧迫性,购物车推荐推出…
当时,亚马逊肯定是混乱的,但我怀疑我忽视来自上面的命令是在冒险。尽管亚马逊很好,但它还没有一种完全包容测量和辩论的文化。
虽然我不主张忽视上级的建议,但似乎在某些情况下,冒险对公司和你自己都是有益的。
希望你能从这个博客中找到一些对你的数据科学之旅有用的建议和例子。请记住,成功人士的许多建议都存在生存偏见。总是半信半疑地接受建议或分享经验。如果你有任何问题、想法,或者只是想分享你自己的经历,请给我们留言。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11在机器学习建模流程中,“特征重要性分析” 是连接 “数据” 与 “业务” 的关键桥梁 —— 它不仅能帮我们筛选冗余特征、提升模 ...
2025-10-11在企业的数据体系中,未经分类的数据如同 “杂乱无章的仓库”—— 用户行为日志、订单记录、商品信息混杂存储,CDA(Certified D ...
2025-10-11在 SQL Server 数据库操作中,“数据类型转换” 是高频需求 —— 无论是将字符串格式的日期转为datetime用于筛选,还是将数值转 ...
2025-10-10在科研攻关、工业优化、产品开发中,正交试验(Orthogonal Experiment)因 “用少量试验覆盖多因素多水平组合” 的高效性,成为 ...
2025-10-10在企业数据量从 “GB 级” 迈向 “PB 级” 的过程中,“数据混乱” 的痛点逐渐从 “隐性问题” 变为 “显性瓶颈”:各部门数据口 ...
2025-10-10在深度学习中,“模型如何从错误中学习” 是最关键的问题 —— 而损失函数与反向传播正是回答这一问题的核心技术:损失函数负责 ...
2025-10-09本文将从 “检验本质” 切入,拆解两种方法的核心适用条件、场景边界与实战选择逻辑,结合医学、工业、教育领域的案例,让你明确 ...
2025-10-09在 CDA 数据分析师的日常工作中,常会遇到这样的困惑:某电商平台 11 月 GMV 同比增长 20%,但究竟是 “长期趋势自然增长”,还 ...
2025-10-09Pandas 选取特定值所在行:6 类核心方法与实战指南 在使用 pandas 处理结构化数据时,“选取特定值所在的行” 是最高频的操作之 ...
2025-09-30球面卷积神经网络(SCNN) 为解决这一痛点,球面卷积神经网络(Spherical Convolutional Neural Network, SCNN) 应运而生。它通 ...
2025-09-30在企业日常运营中,“未来会怎样” 是决策者最关心的问题 —— 电商平台想知道 “下月销量能否达标”,金融机构想预判 “下周股 ...
2025-09-30Excel 能做聚类分析吗?基础方法、进阶技巧与场景边界 在数据分析领域,聚类分析是 “无监督学习” 的核心技术 —— 无需预设分 ...
2025-09-29XGBoost 决策树:原理、优化与工业级实战指南 在机器学习领域,决策树因 “可解释性强、处理非线性关系能力突出” 成为基础模型 ...
2025-09-29在标签体系的落地链路中,“设计标签逻辑” 只是第一步,真正让标签从 “纸上定义” 变为 “业务可用资产” 的关键,在于标签加 ...
2025-09-29在使用 Excel 数据透视表进行多维度数据汇总时,折叠功能是梳理数据层级的核心工具 —— 通过点击 “+/-” 符号可展开明细数据或 ...
2025-09-28在使用 Pandas 处理 CSV、TSV 等文本文件时,“引号” 是最容易引发格式混乱的 “隐形杀手”—— 比如字段中包含逗号(如 “北京 ...
2025-09-28