Google首席决策师告诉你数据科学究竟是什么？-CDA数据分析师官网

热线电话：13121318867

首页精彩阅读Google首席决策师告诉你数据科学究竟是什么？

Google首席决策师告诉你数据科学究竟是什么？

2018-11-07

作者: Cassie Kozyrkov
编译: Mika
本文为 CDA 数据分析师原创作品，转载需授权

> 关于作者：
Cassie Kozyrkov，Google首席决策师。致力于统计学, 机器学习 /人工智能、数据、决策科学。

数据科学是让数据变得有用的学科。在本文中我将对数据科学中的三个概念进行解读。

* 统计
* 机器学习
* 数据挖掘/分析

1. 定义数据科学

看到数据科学这个术语的早期历史，你会发现当时有两个概念是密不可分的。

· 大数据意味着要更多地利用计算机
· 统计学很难把纸上的算法通过计算机实现

因此，数据科学诞生了。最开始数据科学家的的定义是“能够编程的统计学家”。如今看来，这个说法并不准确，但首先让我们看到数据科学本身。

2003年的数据科学期刊中曾提出："'数据科学'意味着任何与数据有关的内容。"我很同意这个观点，现在一切都离不开数据。

之后，我们看到了很多不同的观点，比如Conway的维恩图(下图)，以及Mason和Wiggins的经典观点。

Drew Conway对数据科学的定义

我个人更喜欢维基百科上的定义:

数据科学一种"结合了统计、数据分析、机器学习及其相关方法的概念"，以便用数据"理解和分析实际现象"。

这有些复杂了，让我们精简一下，即：

"数据科学是让数据有用的学科。"

你现在可能会想，但这也太精简了，“有用”这个词怎么能囊括所有这些术语呢？

那么让我们先看到下面的图。

统计学家和机器学习工程师之间的区别，并不是前者使用R语言而后者使用Python。由于许多原因，用SQL、R、Python进行分类是不明智的，如今你甚至可以用SQL进行机器学习。

新手还喜欢通过算法进行区分，许多大学课程也是这么安排的，这也是不明智的。最好不要用直方图、t检验以及神经网络进行分类。坦率地说，如果你很聪明，其实你可以用相同的算法解决任何数据科学问题。

我建议可以这样进行区分：

这指的是什么呢？当然是决定。你可以根据所需的事实，通过描述性分析得出决策。

我们的行动和决定会影响周围的世界。我们之前谈到要让数据变得有用，而这与现实世界的行动是紧密相关的。

以下是决策导向图，完成这三点能够让数据变得有用。

2. 数据挖掘

如果你不知道想做出什么样的决定，那么最好的做法就是去寻找灵感。这就称为数据挖掘、数据分析、描述性分析、探索性数据分析或(EDA)或知识发现(KD)。

分析的黄金法则：只对你所看到的做出结论。

你可以将数据集想象为在暗室中发现的一堆底片。数据挖掘就是让设备尽快曝光这些照片，看是否能从中得出启发。数据挖掘的黄金法则是：只能对你能看到的做出结论，不要对你看不到的内容做出判断，因为你需要统计数据等更多的专业知识。

数据挖掘的专业知识取决于检查数据的速度。一开始暗房会令人生畏，但其实也没什么大不了的，只是学会使用设备就行了。当你开始乐在其中时，你就可以称为数据分析师了；当你能够飞速地曝光照片时，你就可以称为分析师专家了。

3. 统计推断

灵感很容易获得，但严谨来之不易。如果你想重复利用数据，那么则需要专业的培训。作为本科和硕士都学统计学专业的人，我认为统计推断(简称统计)是三个领域中最难且最具哲学内涵的。想学好统计需要花费大量时间。

如果你打算做出高质量、风险可控的重要决策，那么你需要在分析团队中加入统计技能。在不确定的情况下，统计学是能改变你想法的学科。

4. 机器学习

机器学习实质上是使用例子而不是指令来实现操作。关于机器学习我曾写过一些文章，如关于机器学习与AI 的区别；如何入门机器学习等，如果感兴趣的话可以看看。

* The simplest explanation of machine learning you’ll ever read
https://hackernoon.com/the-simplest-explanation-of-machine-learning-youll-ever-read-bebc0700047c

* Are you using the term ‘AI’ incorrectly?
https://medium.com/@kozyrkov/are-you-using-the-term-ai-incorrectly-911ac23ab4f5

* Why businesses fail at machine learning
https://hackernoon.com/why-businesses-fail-at-machine-learning-fbff41c4d5db

5. 数据工程

那么数据工程是什么呢？数据工程指的是为数据科学团队提供数据的工作。数据工程本身就是一个复杂的领域，它更接近软件工程，而不是统计学。

数据工程和数据科学之间的差异是前后的区别。获取数据前的大部分技术工作都可以简单地称为“数据工程”，而得到数据后我们所做的一切都是“数据科学”。

6. 决策智能

决策智能是关于决策的，包括对根据大量数据进行决策，因此这也使其成为一个工程学科。它利用社会和管理科学的理念，增强数据科学的应用。

决策智能是社会和管理科学的组成部分。换而言之，它是数据科学的超集，而不涉及为通用用途创建基本方法之类的研究工作。

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

机器学习数据挖掘数据分析 SQL 神经网络 R语言直方图人工智能

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇CDA数据分析研究院深度分享：数据科学家工作融入及面试技巧

下一篇GitHub 2018年度报告 | 万万没想到你是这样的程序员

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

Google首席决策师告诉你数据科学究竟是什么？

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

CDA持证人专访：杨旭谈数据产品经理的工作实践与核 ...

【CDA干货】Python变量定义与类实例化：核心原理、 ...

从“单元格”到“洞察”：CDA数据分析师视角下的表 ...

【CDA干货】联合索引与覆盖索引：本质区别、实战场 ...

【CDA干货】维度表与事实表：数据仓库建模的核心逻 ...

从“指标堆砌”到“体系落地”：CDA数据分析师视角 ...

【CDA干货】SQL计算列值趋势的全场景实现方法与实战 ...

【CDA干货】用户决策链路全解析：从认知到复购的增 ...

CDA 三级《敏捷数据挖掘》教材知识体系全面解读 ...

【CDA干货】付费玩家流失的核心原因与游戏行业长效 ...

CDA持证人专访：蒋少涵谈传统制造业与互联网行业数 ...

学完商业数据分析，开启 CDA 量化策略：从业务思维 ...

CDA持证人专访：赵森淼谈药企数据分析从业体验与转 ...

【CDA干货】卡方检验与T检验结果的标准化解读方法及 ...

以指标为锚，以体系为纲：CDA数据分析师视角下的指 ...

【CDA干货】MySQL查询不包含指定列的实现方法、实操 ...

【CDA干货】Python中content属性的核心特性、实操应 ...

从零基础到数据科学家：CDA三本官方教材全解读 ...

【CDA干货】资金财务领域本体模型与业务领域模型的 ...

【CDA干货】数字经济下企业数据战略的落地实践与案 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载