
大数据时代和数据分析需求,统计还沾边吗
大数据时代的悄然到来和计算能力爆炸式增长,让做统计分析的各类人士不禁要重新打量一下自己的技能包,看看是不是很快要被时代浪潮以大浪淘沙的方式清洗掉了。
到底大数据是怎么来的呢?可以用来干什么呢?我们就先拿2012美国总统大选来举个例子看看。比如说我们想预测在2012年11月6日,
我们可以用什么数据来做这个预测呢?最常用的就是民调数据了,通过有选择性的挑选一些可能选民来问他们的倾向。这好像是个传统统计干的事。早在1962年John Tukey就已经开始做了。
这也不难回答,我们还是可以用民调数据了,只不过要在每个州都进行抽样调查,在仔细的分析汇总一下。数据量也就比预测全国的结果时用的多几十倍而已。而且如果知道了那些州两人相差太大,一方就没有必要再大肆花钱做广告了 :)
再做更小范围,更详细的抽样调查也许可行,也就是在加上几十到几百的数据量和相应的花费吧,同时为了提高准确性我们或许还需要收集和用到更多的其他辅助数据,比如各地的人口构成,年龄构成。。。但这个问题如果回答的好的话就可以更有效的投放广告到地方市场了。
(这个数据可视化很灿,还有更酷的在这里,by Robert J. Vanderbei, Professor ofOperations Research and Financial Engineering at Princeton。看,不是统计学家做的吧。)
对这个问题的回答就比较费些劲了,这就牵扯到选战中的精细估计(micro-targeting)了。如果这个估计的可以做的准,对于摇晃选民就可以电话或上门拜访,狂轰滥炸,试图说服了。
那怎么对每个人的投票倾向有个好的估计呢?关于个人很多因素就可以粉墨登场了,比如:党派,年龄,性别,职业,婚姻情况,家庭人数,所开汽车型号,所用手机型号,等等。。。这数据量一下就上去了。再加上这些年随着社交网络的兴起,我们可以在用上个人和其他人的社交关系,朋友活动,发帖转帖等等等。。。一下子数据量级就上去了,也就可以成为大数据了。这些海量数据也让我们有机会回答以前很难想到能够回答的问题。
从这几个关心问题的转变过程中,我们可以看到与问题对应的所需数据收集和分析方法的演化。当我们关心的问题越细节,越多样化,所需要的资源和技术就越多。
问题问了一圈,这些听起来都很是十足的统计分析啊。本应该是统计分析人士应该是施展才华的时代,那为何还会有要被时代淘汰的论调呢?记得Leo Brieman 在1994年Berkeley 统计系毕业典礼上的讲话中提到的:
要知道何去何从,我们必须清楚自己真正所擅长的是什么。统计的核心是什么?需要我们是一流的数学家吗?几乎不用。那是什么呢?成为收集信息,分析信息,并得出结论的专家!这才是我们真正所擅长的。所以我认为,这正是我们统计学家应有的定位,我们的身份危机才会到解决。
在大数据的时代,我们还有资格说我们是“收集信息,分析信息,并得出结论的专家” 吗?如果我们不具备收集和处理大数据所需要的计算能力和技巧,没有数据分析的直觉和经验,如何能得出有说服力和经得起检验的结论呢?
现在讨论我们是否是一流的数学家好像已经没有很么意义。我们不妨问问自己,比起一流的计算机学家,我们还有何优势能更好的“收集信息,分析信息,并得出结论”?当我们数据收集和处理能力越来越强时,大家关心的问题的范围也越来越广,细节要求越来越高,需要的数据越来越多。这个发展趋势不广在商业,计算机信息领域天天看到,我们在科学研究,医疗制药,政府服务等各个方面的能力和雄心都在爆炸式的增长,由此带来的问题和分析需求也在爆炸。
在这形势下,我们可以考虑一下在这些牵扯大数据的问题中,统计又如何能更有效的帮助别人分析问题,得出结论。我们的曾经的神器,极限定理以及其赖以生存的测度理论,是否还有那么神奇和有用呢?与此同时我们欠缺的是什么工具呢?如果我们做的理论问题的假设与实际问题和数据的统计距离太显著,还有没有必要钻这牛角尖?如果我们不和做实际问题的一起工作,一起了解问题的细节,有怎能帮助他们呢?
从另一个角度看,我想在拥有与计算机专业的同事相差不算远的计算机技能的基础上,统计专科在数据收集方法(试验设计,抽样方法等),模型选择以及模型对outlier和模型假设的敏感度,在数据支持下对可能结论的批判型思维,以及对结论的不确定型描述等方面还是很大优势的。不过这些方面的技能好像还都不是简单的靠读理论统计课本能直接学习到或证明数学定理能解决的,它们都是在解决实际问题和数据分析的过程中通过不断犯错误来提高的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
本次活动市场价2000元,现面向会员免费开放,会员朋友更可以邀请一位非会员免费参加。 【活动目标】 本课程 ...
2025-07-28CDA 数据分析师必备技能全解析 在数据驱动决策的时代,CDA 数据分析师作为连接数据与业务价值的桥梁,需要具备多元化的技能体系 ...
2025-07-28PowerBI 添加索引列全攻略 在使用 PowerBI 进行数据处理与分析时,添加索引列是一项极为实用的操作技巧。索引列能为数据表中的每 ...
2025-07-28t 检验与 Wilcoxon 检验:数据差异分析的两大核心方法 在数据分析的广阔领域中,判断两组或多组数据之间是否存在显著差异是一项 ...
2025-07-28PyTorch 核心机制:损失函数与反向传播如何驱动模型进化 在深度学习的世界里,模型从 “一无所知” 到 “精准预测” 的蜕变,离 ...
2025-07-252025 年 CDA 数据分析师考纲焕新,引领行业人才新标准 在数字化浪潮奔涌向前的当下,数据已成为驱动各行业发展的核心要素。作为 ...
2025-07-25从数据到决策:CDA 数据分析师如何重塑职场竞争力与行业价值 在数字经济席卷全球的今天,数据已从 “辅助工具” 升级为 “核心资 ...
2025-07-25用 Power BI 制作地图热力图:基于经纬度数据的实践指南 在数据可视化领域,地图热力图凭借直观呈现地理数据分布密度的优势,成 ...
2025-07-24解析 insert into select 是否会锁表:原理、场景与应对策略 在数据库操作中,insert into select 是一种常用的批量数据插入语句 ...
2025-07-24CDA 数据分析师的工作范围解析 在数字化时代的浪潮下,数据已成为企业发展的核心资产之一。CDA(Certified Data Analyst)数据分 ...
2025-07-24从 CDA LEVEL II 考试题型看 Python 数据分析要点 在数据科学领域蓬勃发展的当下,CDA(Certified Data Analyst)认证成为众多从 ...
2025-07-23用 Python 开启数据分析之旅:从基础到实践的完整指南 在数据驱动决策的时代,数据分析已成为各行业不可或缺的核心能力。而 Pyt ...
2025-07-23鸢尾花判别分析:机器学习中的经典实践案例 在机器学习的世界里,有一个经典的数据集如同引路明灯,为无数初学者打开了模式识别 ...
2025-07-23解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-07-22解析神经网络中 Softmax 函数的核心作用 在神经网络的发展历程中,激活函数扮演着至关重要的角色,它们为网络赋予了非线性能力, ...
2025-07-22CDA数据分析师证书考取全攻略 一、了解 CDA 数据分析师认证 CDA 数据分析师认证是一套科学化、专业化、国际化的人才考核标准, ...
2025-07-22左偏态分布转正态分布:方法、原理与实践 左偏态分布转正态分布:方法、原理与实践 在统计分析、数据建模和科学研究中,正态分 ...
2025-07-22你是不是也经常刷到别人涨粉百万、带货千万,心里痒痒的,想着“我也试试”,结果三个月过去,粉丝不到1000,播放量惨不忍睹? ...
2025-07-21我是陈辉,一个创业十多年的企业主,前半段人生和“文字”紧紧绑在一起。从广告公司文案到品牌策划,再到自己开策划机构,我靠 ...
2025-07-21CDA 数据分析师的职业生涯规划:从入门到卓越的成长之路 在数字经济蓬勃发展的当下,数据已成为企业核心竞争力的重要来源,而 CD ...
2025-07-21