京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据科学家Michael Galarnyk著
我以前写过《如何构建数据科学投资组合》,其中包括向潜在的雇主展示你能做什么而不是告诉他们你能做什么的重要性。这个博客利用aSuccess is Iceberg ImagebyOrysya Stusas框架来展示人们在获得数据科学成功的过程中经常隐藏的几个方面。这篇博客旨在表明,大多数人都不得不花费相当多的努力来达到他们现在的水平。他们必须努力工作,有时经历失败,表现出纪律,坚持不懈,为目标献身,有时牺牲或冒险。说完,我们开始吧!
正如你在上面为hertweet创建的GIF中看到的那样,人们在日常模型构建中会犯很多技术错误/失败。
我们大多数编写代码或从事数据科学的人经常看到彼此工作的最终产品--而不是作为过程一部分的草稿、错误和决策。这些步骤的一点透明度会有很大的帮助。
Jake VanderPlasis在Atweeton中似乎也表达了类似的观点,在开源领域,人们通常只看到成品而不是过程。
但我敢打赌,在任何一个成功的开源项目的表面上,都有很多痛苦、痛苦和自我怀疑。
除了技术上的失败,还有其他类型的失败,包括你可以穿的类型(期刊拒绝,电子邮件拒绝,等等)。凯特琳·K·科比(Caitlin K.Kirbyy)确实穿了她的失败/拒绝。《华盛顿邮报》上有一篇文章详细描述了她的裙子是一件手工制作的及膝服装,由她在过去五年中收到的17封拒绝信(期刊拒绝、电子邮件拒绝等)制成。
顺便说一句,如果你想要更多与软件/数据科学相关的拒绝故事,有一个完整的拒绝网站,你可以去看看,这可能会启发你。
大多数人都必须努力工作才能达到他们现在的水平。我绝对不是说你必须每周例行公事地工作70-90小时,因为这听起来不健康。雷切尔·托马斯的帖子提到了这种态度可能是歧视性的和适得其反的。
我们需要尽可能地摆脱工作时间的数量才是最重要的这种肤浅的想法。科技行业对长时间工作的痴迷不仅对许多残疾人来说是不可及的,对每个人的健康和人际关系都是有害的,而且正如奥利维亚·戈尔迪尔为Quartz at Work指出的那样,关于生产率的研究表明,这只是效率低下:
正如无数研究表明的那样,这根本不是真的。工作时间越长,生产率就会急剧下降,一旦人们每周工作55小时,生产率就会完全下降,以至于平均每周工作70小时的人的生产率不会超过少工作15小时的同事。
疯狂的长时间工作在学术界也很常见,因为杰克·范德普拉斯在下面的推特上说。
虽然这条推文不是对吴恩达早先推文的评论,但我认为它表明有不同的方法可以获得成功,而不是持续不断地工作。thePython数据科学手册的作者似乎做得很好。(推特上的杰克·范德普拉斯)
与其努力工作,也许我们应该谈谈坚韧或坚持,因为杰里米·霍华德和西尔万·古格的新书中有一段关于坚韧的精彩文章。
推特上的内容是杰里米·霍华德(Jeremy Howard)“Sand Sylvain Gugger”新书的摘录。
简而言之,我认为从这件事中得到的最好的东西是:
你将面临许多障碍,既有技术上的障碍,也有(甚至更困难的)你周围不相信你会成功的人。有一种方法肯定会失败,那就是停止尝试。
生活中的许多成功都是关于坚持不懈。有很多成功人士的故事,比如爱彼迎的数据科学家彭凯利,他们真的坚持不懈,不断地工作和改进。在她的一篇博客文章中,她查看了她申请和面试了多少个职位。
Applications: 475
Phone interviews: 50
Finished data science take-home challenges: 9
Onsite interviews: 8
Offers: 2
Time spent: 6 months
她显然申请了很多工作,并一直坚持下去。在她的文章中,她甚至提到你需要如何不断地从面试经验中学习。
记下所有你被问到的面试问题,尤其是那些你没能回答的问题。你可以再次失败,但不要在同一地点失败。你应该一直在学习和提高。
这篇文章的一个主要主题是每个人都经历过一些失败。重要的部分是,有些人竭尽全力去实现那里的目标。在Andreas Madsen发布的博客中,他描述了进入人工智能(通常是计算机科学系)的顶级博士学位是多么困难。基本上,他和所有的教授交谈过,他被告知他需要“在顶级ML场馆发表1-2篇论文”才能进入顶级博士学位项目。他连续花了7个月的时间在一个没有资金和主管的研究项目上,以产生可以出版的作品。
牺牲和风险可以以许多不同的形式出现。一个风险可能是忽略来自上面的命令。WhenGreg Lindenwas在亚马逊,他做了几个有趣的项目,尽管他应该做其他事情。在他的一篇博客文章中,他描述了一个项目,这个项目是:
根据亚马逊购物车中的商品进行推荐。添加一些东西,看看弹出什么。再加几个,看看有什么变化…我黑了一个原型。在一个测试网站上,我修改了Amazon.com购物车页面,以推荐您可能喜欢添加到购物车中的其他商品。在我看来挺不错的。我开始四处展示。
出了个问题。
虽然反应是积极的,但也有一些担忧。特别是,一个营销高级副总裁坚决反对它……在这一点上,我被告知我被禁止在这方面做任何进一步的工作。我被告知亚马逊还没有准备好推出这个功能。它应该停在那里。
相反,我为在线测试准备了该特性。我相信购物车的推荐。我想衡量一下销售影响。
我听说SVP发现我在推出一个测试时很生气。但是,即使对高管来说,也很难阻止测试。测量是好的。反对测试的唯一好理由是,负面影响可能如此严重,以至于亚马逊负担不起,这是一个很难做出的声明。测试开始了。
结果很清楚。它不仅赢了,而且这个功能以如此大的优势赢了,以至于不让它直播让亚马逊付出了巨大的变革代价。随着新的紧迫性,购物车推荐推出…
当时,亚马逊肯定是混乱的,但我怀疑我忽视来自上面的命令是在冒险。尽管亚马逊很好,但它还没有一种完全包容测量和辩论的文化。
虽然我不主张忽视上级的建议,但似乎在某些情况下,冒险对公司和你自己都是有益的。
希望你能从这个博客中找到一些对你的数据科学之旅有用的建议和例子。请记住,成功人士的许多建议都存在生存偏见。总是半信半疑地接受建议或分享经验。如果你有任何问题、想法,或者只是想分享你自己的经历,请给我们留言。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析师的日常,常始于一堆“毫无章法”的数据点:电商后台导出的零散订单记录、APP埋点收集的无序用户行为日志、传感器实时 ...
2025-11-28在MySQL数据库运维中,“query end”是查询执行生命周期的收尾阶段,理论上耗时极短——主要完成结果集封装、资源释放、事务状态 ...
2025-11-28在CDA(Certified Data Analyst)数据分析师的工具包中,透视分析方法是处理表结构数据的“瑞士军刀”——无需复杂代码,仅通过 ...
2025-11-28在统计分析中,数据的分布形态是决定“用什么方法分析、信什么结果”的底层逻辑——它如同数据的“性格”,直接影响着描述统计的 ...
2025-11-27在电商订单查询、用户信息导出等业务场景中,技术人员常面临一个选择:是一次性查询500条数据,还是分5次每次查询100条?这个问 ...
2025-11-27对数据分析从业者和学生而言,表结构数据是最基础也最核心的分析载体——CRM系统的用户表、门店的销售明细表、仓库的库存表,都 ...
2025-11-27在业务数据可视化中,热力图(Heat Map)是传递“数据密度与分布特征”的核心工具——它通过颜色深浅直观呈现数据值的高低,让“ ...
2025-11-26在企业数字化转型中,业务数据分析师是连接数据与决策的核心纽带。但“数据分析师”并非单一角色,从初级到高级,其职责边界、能 ...
2025-11-26表格结构数据以“行存样本、列储属性”的规范形态,成为CDA数据分析师最核心的工作载体。从零售门店的销售明细表到电商平台的用 ...
2025-11-26在pandas数据处理工作流中,“列标签”(Column Labels)是连接数据与操作的核心桥梁——它不仅是DataFrame数据结构的“索引标识 ...
2025-11-25Anaconda作为数据科学领域的“瑞士军刀”,集成了Python解释器、conda包管理工具及海量科学计算库,是科研人员、开发者的必备工 ...
2025-11-25在CDA(Certified Data Analyst)数据分析师的日常工作中,表格结构数据是最常接触的“数据形态”——从CRM系统导出的用户信息表 ...
2025-11-25在大数据营销从“粗放投放”向“精准运营”转型的过程中,企业常面临“数据维度繁杂,核心影响因素模糊”的困境——动辄上百个用 ...
2025-11-24当流量红利逐渐消退,“精准触达、高效转化、长效留存”成为企业营销的核心命题。大数据技术的突破,让营销从“广撒网”的粗放模 ...
2025-11-24在商业数据分析的全链路中,报告呈现是CDA(Certified Data Analyst)数据分析师传递价值的“最后一公里”,也是最容易被忽视的 ...
2025-11-24在数据可视化实践中,数据系列与数据标签的混淆是导致图表失效的高频问题——将数据标签的样式调整等同于数据系列的维度优化,或 ...
2025-11-21在数据可视化领域,“静态报表无法展现数据的时间变化与维度关联”是长期痛点——当业务人员需要分析“不同年份的区域销售趋势” ...
2025-11-21在企业战略决策的场景中,“PESTEL分析”“波特五力模型”等经典方法常被提及,但很多时候却陷入“定性描述多、数据支撑少”的困 ...
2025-11-21在企业数字化转型过程中,“业务模型”与“数据模型”常被同时提及,却也频繁被混淆——业务团队口中的“用户增长模型”聚焦“如 ...
2025-11-20在游戏行业“高获客成本、低留存率”的痛点下,“提前预测用户流失并精准召回”成为运营核心命题。而用户流失并非突发行为——从 ...
2025-11-20