
十个问题让你了解数据挖掘工程师
对于如何学习大数据技能?大多资深数据分析师都会建议在学习书本的基础上参加竞赛,从实践中发现问题提升自己。今天跟我们分享的就是一位长期参加比赛的数据挖掘工程师,他有四年的工作经验,利用业余时间参加kaggle,目前也正在参加DataCastle举办的职位预测竞赛。因为热爱分享,他被其他参赛者亲切称为苍老师!
苍老师:我大学是在佐治亚理工学的计算机科学专业。毕业之初也从事一些软件开发类的职位,但在开发过程中逐渐接触到一些数据挖掘方面的工作,诸如推荐系统,算法模型一类的东西,我觉得这些非常有趣,久而久之开始专攻这一方面。现在就职于上海大岂网络科技有限公司,职位是数据挖掘工程师。
苍老师:技术方面当然会有一些优势,但是工作总因为面临到的问题会各不相同,其内因也不同,因此尤其要自己发明或习惯一种问题思考与处理的流程,学会习惯在理解数据之后再进行后续的操作。从锻炼技术的角度上来说竞赛是一个绝佳的练习与验证。通过竞赛可以学习到以后工作过程中数据处理的各个环节。同时掌握一些以后可能用到的工具与一些工程理念。
苍老师:现在在招聘领域,主要从事在CTR预测与推荐这两方面。
苍老师:我最喜欢的是特征工程的部分,因为这部分牵涉到最多对于数据内部诱因的探寻,也是最能够提升模型效果的部分。这部分工作的挑战最高带来的优化也最高。最不喜欢的是参数的调优,因为需要花费大量的时间去寻找一套最优的参数,是比较枯燥的环节,需要做的是大量计算资源和时间。同时对于ensemble工作也是有些爱恨交织的,好的ensemble可以提升效果,但是如果单个模型的效果不理想或者某一类的模型训练不到位则会拖累整体效果。
苍老师:我在工作中使用python,当然其他诸如R语言,Julia也是数据科学家可选的工具。
对于在校学生我建议是先将编程基础打扎实,无论未来想从事数据挖掘行业的哪一类工作,对于变成算法和数学基础的要求都是一样的。
还有就是数据库方面,涉及到数据的存储和处理,以后都是非常有用的。
数学基础也很重要,概率论和线性代数是非常有用的工具,能够帮助理解算法模型,并且在业务处理过程中更好的读懂数据。
还有就是多关心一些新技术的动态。虽然并不一定会用到,但是新工具和技术的诞生必将会给业界带来一些变革和方便。
苍老师:首先我觉得做数据是很有趣的一件事,并不会因为处理数据的问题而觉得枯燥。所以参加竞赛除了是自己的休闲方式之外,还能保持一种对于数据的敏感度。这能更好的帮助自己在工作中的发挥。
苍老师:这个不会,相反我觉得能够提供一些思路上的帮助对于一些新入门机器学习领域的同学来说会有帮助,免去很多我当初学习过程走的弯路。算法的调整是一个迭代过程,任何新的想法都会被放入模型中被验证,还有时间,应该还有上升的空间。
苍老师:多看论文,要有足够可信度的,还有关注一些业内大公司的发现。他们公布的一些算法模型,以及提供的开元代码实现,学习他人的代码能够带来自己的提升。
苍老师:我也这么觉得,其实数据挖掘业内都认为70%甚至更高的工作量都在于数据的预处理阶段,特征的提取和分析以及转换都是和业务理解息息相关的,这就需要对业务有一定的理解。但是如果你从一个行业跳到另一个行业,比如从招聘到金融,还是可以针对数据挖掘设计出一个固定的流程,特征提取方面应当是结合领域知识不断完善有效特征,但这并不妨碍原有的架构的搭建。
苍老师:数据方向的几个发展职位,数据科学家,数据分析师,数据工程师,数据架构师.每一种掌握的技能都不太相同,不过基本上编程能力都是必备的。同时掌握1门数据分析用的开发语言诸如python,R,julia也是必备的推荐的技能包括了c/c++/java,这一类在工程应用中会经常遇到。数据库,关系型和非关系型的优点缺点都可以熟悉下。再来就是更复杂的分布式计算,云存储等框架结构。养成从数据角度去思考的思维模式。
……
其实说了这么多归根结底是先定好一个目标,向着那个目标去努力,循序渐进的去储备自己的专业知识,有机会实践并检验自己的能力,在数据和算法过程中会遇到很多瓶颈阻碍,不要怕,相信你学习的越多越有可能去解决这些问题。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
2025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-06-052025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-05-27CDA数据分析师证书考试体系(更新于2025年05月22日)
2025-05-26解码数据基因:从数字敏感度到逻辑思维 每当看到超市货架上商品的排列变化,你是否会联想到背后的销售数据波动?三年前在零售行 ...
2025-05-23在本文中,我们将探讨 AI 为何能够加速数据分析、如何在每个步骤中实现数据分析自动化以及使用哪些工具。 数据分析中的AI是什么 ...
2025-05-20当数据遇见人生:我的第一个分析项目 记得三年前接手第一个数据分析项目时,我面对Excel里密密麻麻的销售数据手足无措。那些跳动 ...
2025-05-20在数字化运营的时代,企业每天都在产生海量数据:用户点击行为、商品销售记录、广告投放反馈…… 这些数据就像散落的拼图,而相 ...
2025-05-19在当今数字化营销时代,小红书作为国内领先的社交电商平台,其销售数据蕴含着巨大的商业价值。通过对小红书销售数据的深入分析, ...
2025-05-16Excel作为最常用的数据分析工具,有没有什么工具可以帮助我们快速地使用excel表格,只要轻松几步甚至输入几项指令就能搞定呢? ...
2025-05-15数据,如同无形的燃料,驱动着现代社会的运转。从全球互联网用户每天产生的2.5亿TB数据,到制造业的传感器、金融交易 ...
2025-05-15大数据是什么_数据分析师培训 其实,现在的大数据指的并不仅仅是海量数据,更准确而言是对大数据分析的方法。传统的数 ...
2025-05-14CDA持证人简介: 万木,CDA L1持证人,某电商中厂BI工程师 ,5年数据经验1年BI内训师,高级数据分析师,拥有丰富的行业经验。 ...
2025-05-13CDA持证人简介: 王明月 ,CDA 数据分析师二级持证人,2年数据产品工作经验,管理学博士在读。 学习入口:https://edu.cda.cn/g ...
2025-05-12CDA持证人简介: 杨贞玺 ,CDA一级持证人,郑州大学情报学硕士研究生,某上市公司数据分析师。 学习入口:https://edu.cda.cn/g ...
2025-05-09CDA持证人简介 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度、美团、阿里等 ...
2025-05-07相信很多做数据分析的小伙伴,都接到过一些高阶的数据分析需求,实现的过程需要用到一些数据获取,数据清洗转换,建模方法等,这 ...
2025-05-06以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/g ...
2025-04-30CDA持证人简介: 邱立峰 CDA 数据分析师二级持证人,数字化转型专家,数据治理专家,高级数据分析师,拥有丰富的行业经验。 ...
2025-04-29CDA持证人简介: 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度,美团,阿里等 ...
2025-04-28CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-27