京公网安备 11010802034615号
经营许可证编号:京B2-20210330
关于作者:
Cassie Kozyrkov,Google首席决策师。致力于统计学, 机器学习 /人工智能、数据、决策科学。
数据科学是让数据变得有用的学科。在本文中我将对数据科学中以下三个概念进行解读:
统计
数据挖掘/分析
1. 定义数据科学
看到数据科学这个术语的早期历史,你会发现当时有两个概念是密不可分的。
大数据意味着要更多地利用计算机
统计学很难把纸上的算法通过计算机实现
因此,数据科学诞生了。最开始数据科学家的的定义是“能够编程的统计学家”。如今看来,这个说法并不准确,但首先让我们看到数据科学本身。
2003年的数据科学期刊中曾提出:“‘数据科学’意味着任何与数据有关的内容”。我很同意这个观点,现在一切都离不开数据。
之后,我们看到了很多不同的观点,比如Conway的维恩图(下图),以及Mason和Wiggins的经典观点。
Drew Conway对数据科学的定义
我个人更喜欢维基百科上的定义:
数据科学是“结合了统计、数据分析、机器学习及其相关方法的概念”,以便用数据“理解和分析实际现象”。
这有些复杂了,让我们精简一下,即:
“数据科学是让数据有用的学科。”
你现在可能会想,但这也太精简了,“有用”这个词怎么能囊括所有这些术语呢?
那么让我们先看到下面的图。
统计学家和机器学习工程师之间的区别,并不是前者使用R语言而后者使用Python。由于许多原因,用SQL、R、Python进行分类是不明智的,如今你甚至可以用SQL进行机器学习。
新手还喜欢通过算法进行区分,许多大学课程也是这么安排的,这也是不明智的。最好不要用直方图、t检验以及神经网络进行分类。坦率地说,如果你很聪明,其实你可以用相同的算法解决任何数据科学问题。
我建议可以这样进行区分:
这指的是什么呢?当然是决定。你可以根据所需的事实,通过描述性分析得出决策。
我们的行动和决定会影响周围的世界。我们之前谈到要让数据变得有用,而这与现实世界的行动是紧密相关的。
以下是决策导向图,完成这三点能够让数据变得有用。
2. 数据挖掘
如果你不知道想做出什么样的决定,那么最好的做法就是去寻找灵感。这就称为数据挖掘、数据分析、描述性分析、探索性数据分析或(EDA)或知识发现(KD)。
分析的黄金法则:只对你所看到的做出结论。
你可以将数据集想象为在暗室中发现的一堆底片。数据挖掘就是让设备尽快曝光这些照片,看是否能从中得出启发。数据挖掘的黄金法则是:只能对你能看到的做出结论,不要对你看不到的内容做出判断,因为你需要统计数据等更多的专业知识。
数据挖掘的专业知识取决于检查数据的速度。一开始暗房会令人生畏,但其实也没什么大不了的,只是学会使用设备就行了。当你开始乐在其中时,你就可以称为数据分析师了;当你能够飞速地曝光照片时,你就可以称为分析师专家了。
3. 统计推断
灵感很容易获得,但严谨来之不易。如果你想重复利用数据,那么则需要专业的培训。作为本科和硕士都学统计学专业的人,我认为统计推断(简称统计)是三个领域中最难且最具哲学内涵的。想学好统计需要花费大量时间。
如果你打算做出高质量、风险可控的重要决策,那么你需要在分析团队中加入统计技能。在不确定的情况下,统计学是能改变你想法的学科。
4. 机器学习
机器学习实质上是使用例子而不是指令来实现操作。关于机器学习我曾写过一些文章,如关于机器学习与AI 的区别;如何入门机器学习等,如果感兴趣的话可以看看。
The simplest explanation of machine learning you’ll ever read
https://hackernoon.com/the-simplest-explanation-of-machine-learning-youll-ever-read-bebc0700047c
Are you using the term 'AI' incorrectly?
https://medium.com/@kozyrkov/are-you-using-the-term-ai-incorrectly-911ac23ab4f5
Why businesses fail at machine learning
https://hackernoon.com/why-businesses-fail-at-machine-learning-fbff41c4d5db
5. 数据工程
那么数据工程是什么呢?数据工程指的是为数据科学团队提供数据的工作。数据工程本身就是一个复杂的领域,它更接近软件工程,而不是统计学。
数据工程和数据科学之间的差异是前后的区别。获取数据前的大部分技术工作都可以简单地称为“数据工程”,而得到数据后我们所做的一切都是“数据科学”。
6. 决策智能
决策智能是关于决策的,包括对根据大量数据进行决策,因此这也使其成为一个工程学科。它利用社会和管理科学的理念,增强数据科学的应用。
决策智能是社会和管理科学的组成部分。换而言之,它是数据科学的超集,而不涉及为通用用途创建基本方法之类的研究工作。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16在机器学习无监督学习领域,Kmeans聚类因其原理简洁、计算高效、可扩展性强的优势,成为数据聚类任务中的主流算法,广泛应用于用 ...
2026-04-16在机器学习建模实践中,特征工程是决定模型性能的核心环节之一。面对高维数据集,冗余特征、无关特征不仅会增加模型训练成本、延 ...
2026-04-16在数字化时代,用户是产品的核心资产,用户运营的本质的是通过科学的指标监测、分析与优化,实现“拉新、促活、留存、转化、复购 ...
2026-04-15在企业数字化转型、系统架构设计、数据治理与AI落地过程中,数据模型、本体模型、业务模型是三大核心基础模型,三者相互支撑、各 ...
2026-04-15数据分析师的一天,80%的时间花在表格数据上,但80%的坑也踩在表格数据上。 如果你分不清数值型和文本型的区别,不知道数据从哪 ...
2026-04-15在人工智能与机器学习落地过程中,模型质量直接决定了应用效果的优劣——无论是分类、回归、生成式模型,还是推荐、预测类模型, ...
2026-04-14在Python网络编程、接口测试、爬虫开发等场景中,HTTP请求的发送与响应处理是核心需求。Requests库作为Python生态中最流行的HTTP ...
2026-04-14 很多新人学完Python、SQL,拿到一张Excel表还是不知从何下手。 其实,90%的商业分析问题,都藏在表格的结构里。 ” 引言:为 ...
2026-04-14在回归分析中,因子(即自变量)的筛选是构建高效、可靠回归模型的核心步骤——实际分析场景中,往往存在多个候选因子,其中部分 ...
2026-04-13在机器学习模型开发过程中,过拟合是制约模型泛化能力的核心痛点——模型过度学习训练数据中的噪声与偶然细节,导致在训练集上表 ...
2026-04-13在数据驱动商业升级的今天,商业数据分析已成为企业精细化运营、科学决策的核心手段,而一套规范、高效的商业数据分析总体流程, ...
2026-04-13主讲人简介 张冲,海归统计学硕士,CDA 认证数据分析师,前云南白药集团资深数据分析师,自媒体 Python 讲师,全网课程播放量破 ...
2026-04-13在数据可视化与业务分析中,同比分析是衡量业务发展趋势、识别周期波动的核心手段,其核心逻辑是将当前周期数据与上年同期数据进 ...
2026-04-13在机器学习模型的落地应用中,预测精度并非衡量模型可靠性的唯一标准,不确定性分析同样不可或缺。尤其是在医疗诊断、自动驾驶、 ...
2026-04-10数据本身是沉默的,唯有通过有效的呈现方式,才能让其背后的规律、趋势与价值被看见、被理解、被运用。统计制图(数据可视化)作 ...
2026-04-10在全球化深度发展的今天,跨文化传播已成为连接不同文明、促进多元共生的核心纽带,其研究核心围绕“信息传递、文化解读、意义建 ...
2026-04-09在数据可视化领域,折线图是展示时序数据、趋势变化的核心图表类型之一,其简洁的线条的能够清晰呈现数据的起伏规律。Python ECh ...
2026-04-09在数据驱动的时代,数据分析早已不是“凭经验、靠感觉”的零散操作,而是一套具备固定逻辑、标准化流程的系统方法——这就是数据 ...
2026-04-09长短期记忆网络(LSTM)作为循环神经网络(RNN)的重要改进模型,凭借其独特的门控机制(遗忘门、输入门、输出门),有效解决了 ...
2026-04-08