京公网安备 11010802034615号
经营许可证编号:京B2-20210330
盘点:数据挖掘历史中的那些重要里程碑
数据挖掘现在随处可见,而它的故事在《点球成金》出版和“棱镜门”事件发生之前就已经开始了。下文叙述的就是数据挖掘的主要里程碑,历史上的第一次,它是怎样发展以及怎样与数据科学和大数据融合。
数据挖掘是在大数据集(即:大数据)上探索和揭示模式规律的计算过程。它是计算机科学的分支,融合了统计学、数据科学、数据库理论和机器学习等众多技术。
1763年Thomas Bayes 的论文在他死后发表,他所提出的 Bayes 理论将当前概率与先验概率联系起来。因为 Bayes 理论能够帮助理解基于概率估计的复杂现况,所以它成为了数据挖掘和概率论的基础。1805年Adrien-Marie Legendre 和 Carl Friedrich Gauss 使用回归确定了天体(彗星和行星)绕行太阳的轨道。回归分析的目标是估计变量之间的关系,在这个例子中采用的方法是最小二乘法。自此,回归成为数据挖掘的重要工具之一。1936年计算机时代即将到来,它让海量数据的收集和处理成为可能。在1936年发表的论文《论可计算数(On Computable Numbers)》中,Alan Turing 介绍了通用机(通用图灵机)的构想,通用机具有像今天的计算机一般的计算能力。现代计算机就是在图灵这一开创性概念上建立起来的。1943年Warren McCullon 和 Walter Pitts 首先构建出神经网络的概念模型。在名为 《A logical calculus of the ideas immanent in nervous activity》 的论文中,他们阐述了网络中神经元的概念。每一个神经元可以做三件事情:接受输入,处理输入和生成输出。1965年Lawrence J. Fogel 成立了一个新的公司,名为 Decision Science, Inc,目的是对进化规划进行应用。这是第一家专门将进化计算应用于解决现实世界问题的公司。1970年随着数据库管理系统趋于成熟,存储和查询百万兆字节甚至千万亿字节成为可能。而且,数据仓库允许用户从面向事物处理的思维方式向更注重数据分析的方式进行转变。然而,从这些多维模型的数据仓库中提取复杂深度信息的能力是非常有限的。1975年John Henry Holland 所著的《自然与人工系统中的适应》问世,成为遗传算法领域具有开创意义的著作。这本书讲解了遗传算法领域中的基本知识,阐述理论基础,探索其应用。1980年HNC 对“数据挖掘”这个短语注册了商标。注册这个商标的目的是为了保护名为“数据挖掘工作站”的产品的知识产权。该工作站是一种构建神经网络模型的通用工具,不过现在早已销声匿迹。也正是在这个时期,出现了一些成熟的算法,能够“学习”数据间关系,相关领域的专家能够从中推测出各种数据关系的实际意义。1989年术语“数据库中的知识发现”(KDD)被Gregory Piatetsky-Shapiro 提出。同样这个时期,他合作建立起第一个同样名为KDD的研讨会。1990年“数据挖掘”这个术语出现在数据库社区。零售公司和金融团体使用数据挖掘分析数据和观察趋势以扩大客源,预测利率的波动,股票价格以及顾客需求。1992年Berhard E. Boser, Isabelle M. Guyon 和 Vladimir N. Vanik对原始的支持向量机提出了一种改进办法,新的支持向量机充分考虑到非线性分类器的构建。支持向量机是一种监督学习方法,用分类和回归分析的方法进行数据分析和模式识别式。1993年Gregory Piatetsky-Shapiro 创立“ Knowledge Discovery Nuggets (KDnuggets) ”通讯。本意是联系参加KDD研讨会的研究者,然而KDnuggets.com的读者群现在似乎广泛得多。2001年尽管“数据科学”这个术语在六十年代就已存在,但直至 2001 年,William S. Cleveland 才以一个独立的概念介绍它。根据《Building Data Science Teams》所著,DJ Patil 和 Jeff Hammerbacher 随后使用这个术语介绍他们在 LinkedIn 和 Facebook 中承担的角色 。2003年Micheal Lewis 写的 《点球成金》 出版,同时它也改变了许多主流联赛决策层的工作方式。奥克兰运动家队(美国职业棒球大联盟球队)使用一种统计的,数据驱动的方式针对球员的素质进行筛选,这些球员被低估或者身价更低。以这种方式,他们成功组建了一支打进2002和2003年季后赛的队伍,而他们的薪金总额只有对手的1/3。2015年在 2015 年二月,DJ Patil成为白宫第一位首位数据科学家。今天,数据挖掘已经遍布商业、科学、工程和医药,这还只是一小部分。信用卡交易,股票市场流动,国家安全,基因组测序以及临床试验方面的挖掘,都只是指数据挖掘应用的冰山一角。随着数据收集成本变得越来越低,数据收集设备数目激增,像大数据这样的专有名词现在已经是随处可见。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28