京公网安备 11010802034615号
经营许可证编号:京B2-20210330
建立数据场的七大技能
成为数据极客,建立自己的数据场需要哪些技能呢?遇到普通的数据,通过SQL做分析。如果数据量比较大,可以使用Hadoop等大数据框架处理。在深入挖掘上,可用Python或者R语言进行编程。
01 数据极客
上回书说到,数据科学家是具有数据相关的完整理论和知识的人,自然境界很高。做作一个普通的IT界码农,成为数据科学家需要漫长的过程。那这个……,做不到数据科学家,我们还可以做个数据极客(Data Geek)嘛,挑战数据极限,也是挑战自己的极限。
那么,成为数据极客,建立自己的数据场需要哪些技能呢?且不说那高深复杂的理论,仅从实用的角度来分析一下,建立数据场的七个方面。
02 七大技能
二维表格数据是最常用形式了,对二维数据的处理分析也是最基本的。传统的SQL工具与大数据环境下的NoSQL工具中,以关系型的MySQL为代表,以文档型的MongoDB为代表,以大数据环境下的Hive代表。这都是数据分析的基础而强大利器,在很多场合下都能快速的解决问题。
扩展的,还会有内存型数据库Redis,图数据库Neo4j,还有全文索引的ElasticSearch和Solr,还有Hbase和Cassandra,这些根据具体的业务,选择性的掌握其中一部分。
学到什么程度并无定论,重点在具体的数据环境下,不至于永远只知道MySQL这一个工具,在不同的场景,其它的数据库能发挥出强大的优势。
总结起来说,重点不是工具,而是数据。不仅要能处理结构化数据,还要处理半结构化数据,不仅能单机处理,还要在集群环境下处理。
2.2 Linux工具集
Shell, AWK, sed, grep等基本工具集,这是很多数据简单处理的得力助手,包含数据文件编码,数据合并,数据拆分,数据规范,格式验证等等。
Linux脚本能力,简单服务配置能力,正则表达式能力,Vim或者Emacs编辑能力,文件系统常用操作命令,远程登录ssh等等,这些都能快速的处理很多问题。任何的分析或挖掘都会依托与一个系统,而Linux是其中最常用的,尤其是在服务器环境。熟悉一个系统,能让自己的数据科学工作事半功倍。
简单的数据收集与处理,很多时候也会依赖于Linux系统或者基于其上的一系列工具,比如常用的Web服务器引擎Nginx及其产生的日志,常用的文件传输scp或者rsync,常用的定时任务crontab等等这些工具,稳定又实用。
掌握一门分析专用语言,很有必要。其中以R语言和Python语言为代表。R起源于统计学,如今在数据科学领域也占有强大的阵地。Python更是一门完整的编程语言,不论是Web开发、自动化运维、云计算,还是数据科学领域,都有众多的用户。两者在数据分析中都有完整的生态圈,而且其它环境对这两者的支持也是非常好的。
无意于争端,全看个人喜好。本人只熟悉Python这块生态,因此只讨论这一块相关的。最为大众熟悉的一些包为:Numpy,Scipy, Pandas和Scikit-learn,Keras,解决了从数据分析到机器学习和深度学习的几乎所有任务。
2.4 Hadoop与Spark生态
大数据平台,无疑是以Hadoop和Spark为代表,无论在线处理还是离线分析。Hadoop比较适合离线处理。而在线处理中,Storm就是比较有名的。如果需要自己实现Map-Reduce或者对接数据之类的开发,编程语言中以Java和Scala为代表。
在线搜索相关,估计会用前面说过的ElasticSearch或者Solr。当然,区别于hadoop的Map-Reduce流程,Spark提供的弹性数据集RDD,能作用于RDD上的算子非常多,使得数据处理与分析更加方便。除此之外,Spark还提供了实时任务的Streaming,能实时的对数据进行处理与获取结果。还有Spark SQL功能,尤其以其中的DataFrame重为重要。另外,ML与MLlib也是分布式机器学习的重要部分。
Spark是Hadoop生态圈中的有力补充,并非替代品,如果要说替代,那也只是替代了MapReduce分布式计算框架而已,分布式调试与管理依然用Yarn,文件系统依然会使用HDFS。
Hadoop发行版中,主要以三大厂商的Hadoop的为代表。Cloudera发行的CDH,Hortonworks发行的HDP,这两个是目前各种大数据框架支持的主流,另外一家是修改了核心的MapR。
2.5 概率、统计与线性代数
对数据进行统计与分析,是需要统计学的基础知识。另外,很多问题都可以转化为一个概率问题,并不是要完全确定的结果,只要概率达满足即可。概率论方面的主要是贝叶斯统计,隐马尔可夫模型等之类的。这些都是深入理解算法的基础。
对数据的运算,很多时候就是直接矩阵运算,而涉及矩阵的各种运算也正是线性代数相关相关的问题。
机器学习之所以有效,是因为模型对数据的处理,最后都会变成一系列的数学优化问题,而且主要和凸优化知识相关。机器学习的各种计算,都是和数学密切相关。除了上面的概率、统计与线性代数,还会和微积分有一定的关系。
当然,但除非你深入研究算法的核心原理或者写学术论文需要,也不要被数学吓到了。在机器学习应用过程中,并不会用到太多的数学知识。而且,也并不需要完全把上面这些课程学好了再来进行机器学习。计算机基于数学,但应用型的算法,并不需要特别深厚的数学功底。如果以前课程学得不好也没有太大的关系,很多知识到了关键时刻再补一下也不迟。
数据挖掘与人工智能中和算法相关的部分,常用的分类算法,聚类算法是基础。推广开来,就是监督算法与非监督算法,监督算法中,除了分类,还有回归。非监督算法中,除了聚类,还有数据降维,还有用于个性推荐的关联规则。另外,专门处理自然语言的机器学习也即NLP,或者文本数据挖掘,是另外一个侧重方向。
对算法的理解,需要前面的统计与概率等等数学知识,还需要结合编码能力,最好能自己实现一些演示算法流程的Demo程序来辅助理解。实际应用中,最好以第三方库为准,它们经过大量人员的测试,无论是性能还是算法完整性上都会更好,自己实现的程序仅仅用于理解算法流程即可。除非你对算法理解很彻底,并且编码能力也非常强,而且觉得现有的框架不能满足你的使用。
除了算法及其参数调优外,还有另外两个重要的内容,特征提取与模型评估。如何从原始数据中提取出用于算法的特征是很关键的。很多时候,不同算法在性能差异上并不明显,但不同的特征提取方法,却能产生比较大的差距。
在某种特征上应用特定的算法,还需要做的就是模型评估,如果评估一个模型是好还是坏,在一定程度上也体现了机器学习是否有效的依据。在特征提取上,一个比较火热的领域自然是深度学习了。源于多层神经网络,是一种非监督的特征提取方法,更好的用于图片、语音与视觉处理。值得一提的是,深度学习在很多地方的性能已经超过传统的机器学习算法。
2.7 业务及杂项
除上上面的纯技术外,还有一些非技术上的技能。业务理解,商业洞察,沟通与交流能力,尤其以业务的理解能力为重要。数据是死的,无法更好的理解业务中的问题,也就无法更好的利用现有数据,甚至无法更好的解读其中的结论。
理解业务通常需要一些专业的领域知识,比如做网络安全的,需要安全的一些基础知识;做电商的,需要理解其中各个指标对当前销售的影响;做二手车估值的,需要对二手车残值评估有一定的了解。
除了业务知识外,还需要一定的文档与报表技能,比如Word、PPT与Markdown工具的使用,只有完整的文档与良好的表达,才更好体现数据所展现出来的效果。
另外,英文能力与写作也同样重要,需要经常阅读一些英文文章。阅读的主要目的,就是随时更新自己的技能,扩展知识面。而写作,就是自己知识积累的一种方式,将纸上的东西,变成自己的技能。
03 结尾
这儿列出的七项主要技能,和上一篇文章的7大技能基本相同。对于高级信号处理,主要用于特征提取,个人感觉目前可能通过学习神经网络与深度学习来解决,深度学习是专为解决特征提取的问题而来。
七大技能,总结起来,就是熟悉一门Linux系统及其上的常用工具,遇到普通的数据,可以通过SQL来做简单分析或者聚合。如果数据量比较大,可以使用Hadoop等大数据框架处理。在深入挖掘上,可用Python或者R语言进行编程,应用以概率统计为支撑的机器学习算法。
要做好数据极客,只有在各种工具与技能基础上,再加强自己的业务兴趣点,配合个人的悟性而修行。果能如此,持之以恒,则天下定有你的天地。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据可视化实践中,数据系列与数据标签的混淆是导致图表失效的高频问题——将数据标签的样式调整等同于数据系列的维度优化,或 ...
2025-11-21在数据可视化领域,“静态报表无法展现数据的时间变化与维度关联”是长期痛点——当业务人员需要分析“不同年份的区域销售趋势” ...
2025-11-21在企业战略决策的场景中,“PESTEL分析”“波特五力模型”等经典方法常被提及,但很多时候却陷入“定性描述多、数据支撑少”的困 ...
2025-11-21在企业数字化转型过程中,“业务模型”与“数据模型”常被同时提及,却也频繁被混淆——业务团队口中的“用户增长模型”聚焦“如 ...
2025-11-20在游戏行业“高获客成本、低留存率”的痛点下,“提前预测用户流失并精准召回”成为运营核心命题。而用户流失并非突发行为——从 ...
2025-11-20在商业数据分析领域,“懂理论、会工具”只是入门门槛,真正的核心竞争力在于“实践落地能力”——很多分析师能写出规范的SQL、 ...
2025-11-20在数据可视化领域,树状图(Tree Diagram)是呈现层级结构数据的核心工具——无论是电商商品分类、企业组织架构,还是数据挖掘中 ...
2025-11-17核心结论:“分析前一天浏览与第二天下单的概率提升”属于数据挖掘中的关联规则挖掘(含序列模式挖掘) 技术——它聚焦“时间序 ...
2025-11-17在数据驱动成为企业核心竞争力的今天,很多企业陷入“数据多但用不好”的困境:营销部门要做用户转化分析却拿不到精准数据,运营 ...
2025-11-17在使用Excel透视表进行数据汇总分析时,我们常遇到“需通过两个字段相乘得到关键指标”的场景——比如“单价×数量=金额”“销量 ...
2025-11-14在测试环境搭建、数据验证等场景中,经常需要将UAT(用户验收测试)环境的表数据同步到SIT(系统集成测试)环境,且两者表结构完 ...
2025-11-14在数据驱动的企业中,常有这样的困境:分析师提交的“万字数据报告”被束之高阁,而一张简洁的“复购率趋势图+核心策略标注”却 ...
2025-11-14在实证研究中,层次回归分析是探究“不同变量组对因变量的增量解释力”的核心方法——通过分步骤引入自变量(如先引入人口统计学 ...
2025-11-13在实时数据分析、实时业务监控等场景中,“数据新鲜度”直接决定业务价值——当电商平台需要实时统计秒杀订单量、金融系统需要实 ...
2025-11-13在数据量爆炸式增长的今天,企业对数据分析的需求已从“有没有”升级为“好不好”——不少团队陷入“数据堆砌却无洞察”“分析结 ...
2025-11-13在主成分分析(PCA)、因子分析等降维方法中,“成分得分系数矩阵” 与 “载荷矩阵” 是两个高频出现但极易混淆的核心矩阵 —— ...
2025-11-12大数据早已不是单纯的技术概念,而是渗透各行业的核心生产力。但同样是拥抱大数据,零售企业的推荐系统、制造企业的设备维护、金 ...
2025-11-12在数据驱动的时代,“数据分析” 已成为企业决策的核心支撑,但很多人对其认知仍停留在 “用 Excel 做报表”“写 SQL 查数据” ...
2025-11-12金融统计不是单纯的 “数据计算”,而是贯穿金融业务全流程的 “风险量化工具”—— 从信贷审批中的客户风险评估,到投资组合的 ...
2025-11-11这个问题很有实战价值,mtcars 数据集是多元线性回归的经典案例,通过它能清晰展现 “多变量影响分析” 的核心逻辑。核心结论是 ...
2025-11-11