京公网安备 11010802034615号
经营许可证编号:京B2-20210330
作者尤金·颜,亚马逊应用科学家
“与其手动检查我们的数据,为什么不试试领英的做法呢?它帮助他们实现了95%的准确率和80%的召回率。“
然后我的队友分享了如何使用k-最近邻来识别不一致的标签(在职位名称中)。然后,LinkedIn在一致的标签上训练支持向量机(SVM);然后用支持向量机对不一致的标签进行更新。这帮助他们在职称分类器上达到95%的精确度。
这个建议在我们的讨论中是最有用的。对它的跟踪导致我们的产品分类器的最终准确率达到95%。我问她,她是如何贡献出这种批判性的见解的。“哦,我只是偶尔看看报纸。”她回答。具体来说,她每周都会读1-2篇论文,通常是围绕团队正在研究的主题。
通过阅读论文,我们能够了解其他人(例如LinkedIn)发现哪些有用(或者不有用)。然后我们可以适应他们的方法,而不必重新发明火箭。这有助于我们以更少的时间和精力交付工作解决方案。
如果说我比别人看得更远,那是因为我站在巨人的肩膀上。
-艾萨克·牛顿
阅读论文还拓宽了我们的视野。尽管我们可能在数据科学的狭隘领域工作,但切向研究的发展往往是有帮助的。例如,Word嵌入和graphshave的思想在推荐系统中很有用。同样,来自计算机视觉的思想--如迁移学习和数据增强--对自然语言处理(NLP)有帮助。
阅读论文还使我们了解最新情况。在过去的十年里,自然语言处理领域取得了长足的进步。尽管如此,通过阅读最关键的10篇左右的论文,我们可以很快跟上速度。通过了解最新情况,我们在工作中变得更有效,从而需要更少的时间和精力。然后我们有更多的时间阅读和学习,导致一个良性循环。
如果我们开始养成这个习惯,我们可以阅读任何我们感兴趣的东西--大多数论文都会有一些东西教我们。阅读我们感兴趣的话题也会更容易养成习惯。
我们也可以根据实用性来选择论文。例如,我们可能需要快速理解一个项目的域。在开始一个项目之前,我几乎总是留出时间进行文献综述。花几天时间研究论文可以节省几周甚至几个月的死胡同和不必要的重新发明轮子。
建议也是确定要阅读的有用论文的方便方法。一个黑客是在社交媒体上关注我们崇拜的人,或者订阅精心策划的时事通讯--我发现这些来源的信息噪声比很高。
我读什么报纸?出于实用性,我读的多是与工作有关的论文。这使我能够立即应用我所读到的知识,从而加强我的学习。在工作之外,我对序列感兴趣,并倾向于阅读强化学习。我特别喜欢分享什么有效什么无效的论文,比如通过消融研究。这包括关于Word2VEC、BERT和T5的论文。
在谷歌搜索“如何阅读论文”会返回无数有用的结果。但如果你觉得它势不可挡,这里有几个我发现很有帮助的:
我的方法类似于三遍法。在下面的例子中,我将分享我是如何阅读几篇recsys的论文来了解新颖性、多样性和偶然性的度量标准的。等等。
在第一遍中,我扫描摘要以了解论文是否有我需要的内容,如果有,我浏览标题以确定问题陈述、方法和结果。在这个例子中,我专门寻找如何计算各种度量的公式。我给我的单子上的所有文件一个第一关(并拒绝开始第二关,直到我完成了单子)。在本例中,大约一半的论文进行了第二次传递。
在第二遍中,我再次阅读每一篇论文,并突出显示相关章节。这有助于我在以后参考论文时迅速发现重要的部分。然后,我为每篇论文做笔记。在本例中,注释主要围绕度量(即,方法、公式)。如果是一个应用程序的文献综述(例如,recsys、产品分类、欺诈检测),说明将侧重于方法、系统设计和结果。
对于大多数论文来说,第二次通过就足够了。我已经捕获了关键信息,如果需要,可以在未来参考它。尽管如此,如果我读论文作为文献综述的一部分,或者如果我想巩固我的知识,我有时会做第三步。
阅读只为心灵提供知识材料;是思考使我们读到的东西成为我们的。
-约翰·洛克
在第三关中,我将论文中常见的概念综合成自己的注释。各种论文都有自己的方法来衡量新颖性、多样性、偶然性等,我把它们合并成一个音符,并比较它们的利弊。在这样做的时候,我经常发现笔记和知识中的空白,不得不重温原始论文。
最后,如果我认为它对其他人有用,我会写出我所学到的并在网上发布。相对于从头开始,有我的笔记作为参考让写作容易得多。这导致了诸如:
在深入你的下一个项目之前,花一两天时间浏览几篇相关的论文。我相信从中长期来看,这将为您节省时间和精力。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20定量报告的核心价值是传递数据洞察,但密密麻麻的表格、复杂的计算公式、晦涩的数值罗列,往往让读者望而却步,导致核心信息被淹 ...
2026-01-20在CDA(Certified Data Analyst)数据分析师的工作场景中,“精准分类与回归预测”是高频核心需求——比如预测用户是否流失、判 ...
2026-01-20在建筑工程造价工作中,清单汇总分类是核心环节之一,尤其是针对楼梯、楼梯间这类包含多个分项工程(如混凝土浇筑、钢筋制作、扶 ...
2026-01-19数据清洗是数据分析的“前置必修课”,其核心目标是剔除无效信息、修正错误数据,让原始数据具备准确性、一致性与可用性。在实际 ...
2026-01-19在CDA(Certified Data Analyst)数据分析师的日常工作中,常面临“无标签高维数据难以归类、群体规律模糊”的痛点——比如海量 ...
2026-01-19在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16在游戏行业“存量竞争”的当下,玩家留存率直接决定游戏的生命周期与商业价值。一款游戏即便拥有出色的画面与玩法,若无法精准识 ...
2026-01-16为配合CDA考试中心的 2025 版 CDA Level III 认证新大纲落地,CDA 网校正式推出新大纲更新后的第一套官方模拟题。该模拟题严格遵 ...
2026-01-16在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12