
MIT做了一个全自动大数据分析
信息爆炸引爆了大数据时代的到来,前一两年大数据到达了炒作的高峰,而马云则称今后 30年 属于数据技术(DT)。但是最近一段时间大数据似乎没有那么大的动静了,这固然有技术炒作周期曲线的规律作用,也跟大数据遭遇到的一些瓶颈有关。
这个最大的瓶颈之一便是人。隐藏在大数据里面的模式挖掘很长程度上需要依靠人的建模和直觉,但是数据科学家的数量却跟不上大数据的规模发展。不过 MIT 正在为打破这个瓶颈而努力,其研发的一款名为 Data Science Machine(数据科学机器)的软件实现了无人参与下的大数据分析,经过对比发现,其表现已经与数据分析师不分高下。
Data Science Machine 由 MIT CSAIL 的 Max Kanter 和他的指导老师 Kalyan Veeramachaneni 等人设计。其关键突破是它不仅会寻找模式,还会自己设计特征集。学机器学习的人都知道特征工程的重要性。特征工程是指利用数据的领域知识来创建特征以便让机器学习算法可以工作的过程,这个过程往往需要人的直觉。而 Data Science Machine 却利用了关系数据库的不同表间的结构化关系作为线索来进行特征构造,从中生成一批候选的特征集,然后再通过分析值的相关性来缩小特征集的范围,从而免去了人的参与。然后,Data Science Machine 还会把这个特征集运用到样本数据上,再用不同的方式重新组合特征来优化预测的准确率。
为了测试这套系统的第一款原型,研究人员让它参与了三项数据科学方面的竞赛,竞赛的目标是在不常见的数据集中寻找出预测性的模式。三场竞赛供有 906 支队伍参加,Data Science Machine 的成绩比其中的 615 支队伍都要高。
在准确率方面,Data Science Machine 在其中两场竞赛的准确率分别达到了 94%和 96%。另外一场的准确率略低,为 87%。但是效率方面却是人类不能比的,因为 Data Science Machine 得出结果用时在 2-12 小时之间,而人类团队的预测性算法往往要折腾数月的时间。
目前 Data Science Machine 已能对哪些学生有可能退出 MIT 的在线课程做出分析,它选出的两个特征分析学生开始写作业时间的早晚,以及在网上学习课程的时间长短。尽管这种能力看起来还不够强大,但是这只是开始,一旦机器具备真正的自我学习能力,在计算能力指数增长的作用下,其进化速度将是我们难以想象的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
DBeaver 实战:实现两个库表结构同步的高效路径 在数据库管理与开发工作中,保持不同环境(如开发库与生产库、主库与从库)的表 ...
2025-08-08t 检验与卡方检验:数据分析中的两大统计利器 在数据分析领域,统计检验是验证假设、挖掘数据规律的重要手段。其中,t 检验和卡 ...
2025-08-08CDA 数据分析师:解锁数据价值的专业力量 在当今这个数据爆炸的时代,数据已成为像石油一样珍贵的战略资源。而 CDA 数据分析师, ...
2025-08-08人工智能对CDA数据分析领域的影响 人工智能对 CDA(Certified Data Analyst,注册数据分析师)数据分析领域的影响是全方位、多层 ...
2025-08-07SPSS 语法使用详解 在当今数据驱动的时代,SPSS( Statistical Package for the Social Sciences)作为一款功能强大的统计分析软 ...
2025-08-07SASEM 决策树:理论与实践应用 在复杂的决策场景中,如何从海量数据中提取有效信息并制定科学决策,是各界关注的焦点。SASEM 决 ...
2025-08-07CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-08-07大数据时代对定性分析的影响 在大数据时代,海量、多样、高速且低价值密度的数据充斥着我们的生活与工作。而定性分析作为一 ...
2025-08-07K-S 曲线、回归与分类:数据分析中的重要工具 在数据分析与机器学习领域,K-S 曲线、回归和分类是三个核心概念与工具,它们各 ...
2025-08-07CDA 数据分析师考试全解析 在当今数字化时代,数据已成为企业发展的核心驱动力,数据分析师这一职业也愈发受到重视。CDA 数据分 ...
2025-08-07大数据时代的隐患:繁荣背后的隐忧 当我们在电商平台浏览商品时,系统总能 “精准” 推送心仪的物品;当我们刷短视频时,算法 ...
2025-08-07解析 F 边界检验:协整分析中的实用工具 在计量经济学的时间序列分析中,判断变量之间是否存在长期稳定的均衡关系(即协整关系) ...
2025-08-07CDA 数据分析师报考条件详解:迈向专业认证的指南 在数据分析行业蓬勃发展的当下,CDA 数据分析师认证成为众多从业者提升专业 ...
2025-08-07通过 COX 回归模型诊断异常值 一、COX 回归模型概述 COX 回归模型,又称比例风险回归模型,是一种用于生存分析的统计方法。它能 ...
2025-08-07评判两组数据与初始数据准确值的方法 在数据分析与研究中,我们常常会面临这样的情况:需要对通过不同方法、不同过程得到的两组 ...
2025-08-07CDA 数据分析师行业标准:构建数据人才的能力坐标系 在数据驱动决策成为企业核心竞争力的时代,CDA(数据分析师)行业标准作为 ...
2025-08-07反向传播神经网络:突破传统算法瓶颈的革命性力量 在人工智能发展的历史长河中,传统算法曾长期主导着数据处理与模式识别领域 ...
2025-08-07MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-07抖音数据分析师:驱动平台增长的幕后推手 在抖音这个日活用户数以亿计的超级平台上,每一次用户的滑动、点赞、评论,每一条 ...
2025-08-07基于 SPSS 的中介效应分析结果解读:揭示变量间的隐性关联 在社会科学与自然科学研究中,变量之间的关系往往并非简单的直接作用 ...
2025-08-07