京公网安备 11010802034615号
经营许可证编号:京B2-20210330
假如给你一天大数据的生活_数据分析师培训
百度在北京举办大数据引擎技术论坛。百度董事长兼CEO李彦宏难得一见出现在论坛上。他在十分钟的演讲里,最让我印象深刻的是他提到一个观点,即互联网在逐个改变传统行业,但谁来改变互联网?他给出的答案是技术。那么这个技术会是什么?李彦宏的答案是大数据技术。
大数据这个概念火了好几年了。最早的时候我看过一本叫做《大数据时代》的书,里面列举了一些大数据的应用。印象中有这么一个例子,记得不是特别准确,大致意思说的是,在美国,某个当爹的有一天收到一个电商公司寄来的关于婴幼儿产品的广告信息。他很愤怒地,觉得这种垃圾广告骚扰到了自己。他甚至找到这个电商公司理论。结果几个月之后,他知道自己的女儿未婚先孕,他要当外公了。而电商公司之所以能提前预测到他对婴幼儿产品的需求,是因为根据他女儿此前的购物、搜索和社交网络等信息所作出的猜测。
推荐购物。这是很多人对于大数据应用的了解。那么几年过去了,大数据技术的应用到底发展到一个怎样的层次和水平?今天新闻观止就结合百度大叔就搜索引擎上几个嘉宾提到的案例,通过虚拟一天的大数据生活,来让大家对大数据这个技术有更多直观的了解。
大家准备好了吗?来吧,大数据的一天开始了。
一早上,你被手机闹钟叫醒。昨晚你带着一款小型可穿戴设备睡觉的。这个设备连接着你手机里的一款大数据的APP,你打开它。就可以看到昨晚你睡觉时候的身材状况。比如你是什么时候晨勃的,勃起了几次。另外你昨晚睡觉翻身了几次,心跳和血压状况都有一个详细的统计告诉你。最后这个软件会告诉你,根据昨晚你的身体状况,建议你今天出门之前喝点什么,或者回家的时候记得去药店带回点维生素之类的营养品。
现在已经有很多可穿戴设备能够24小时每天监控我们的健康状况,包括了我们的血压、心跳、睡眠状况、运动状况。检测我们汗液、血液,监测我们身体情况。当我们把24小时检测数据上传到大数据中心,跟医院关联以后,就会产生新的价值点出来。
用心脏病做一个例子,我们每年有几百万人得了心脏病,如果我们的大数据中心具有很好的计算能力,我们能够从这几百万患者的24小时监控数据里头找到它的共性。我们提前两天给人发预警,如果你再这样下去就有可能得心脏病,由医院给人群发出警告。
在大数据时代,便携式的可穿戴传感器会越来越多,设备越来越多。原来在医院做,现在都可以在家做。这个带来的变化是你可以7*24小时对身体的进行监测。在西方有个非常时髦的术语叫量化自我,时刻想知道自己身体上的变化。在美国量化自我的先锋们,每两周做一次核磁共振,然后去做血的检查。这些设备产生出来所有的数据,全部都存储在云端,它的数据慢慢在云端去积累,当量达到一定阶段就是数据的量变了。
大数据对于医生和医院都将带来改变。百度搜索研发部副总监高亮举个了例子,他一个同学岳母,年轻时候一直在协和医院看病,到今天为止已经80岁了。到医院慢慢积累这个病例,这个病例也就是牛皮纸这么厚,这么大一个袋子,大概250px厚,这是一个人一生的医疗数据。
现在这些纸质的数据慢慢变成了电子化。但这个数据太大,大到你没有传统办法去看,去分析,去识别。仅仅是三个月医疗数据,让医生看一下,医生可能都没有办法,也没有时间看,他一定需要一些工具才把特征提取出来,辅助他做出诊断。
此外,对医院来说,数据大了带来两个问题,医院现有IT系统比较难存储,试想一个人一生数据在几个T的话,价钱最好的电脑可能也就只能存一部分。这个成本在医院来说是比较高的。
所以,这些数据持续膨胀的问题给传统行业带来而来挑战。这些挑战大数据可以解决。比如百度就提供了百度开放云,百度数据工厂等数据解决方案。
洗漱完之后,你想起今天要带一个来北京的朋友去逛逛故宫。你打开百度的大数据产品百度预测,看看北京故宫今天预计会有多少人。再看看北京今天的交通预测。百度预测通过每天几十亿次用户向百度请求定位信息,计算出景区热地图。
百度的大数据产品百度大脑已经能够预测到两个星期以内的城市旅游热度,这些旅游人会从哪一个城市过来,百度能提供两星期的预测,如果把这个更细一点,在城市景点,百度能预测两天景点拥挤程度。4月24日,玉渊潭和陶然亭哪个公园更拥挤,也可以运用百度大脑计算出来。
到了单位后,如果你是个名人,估计想知道今天你昨天是否被人偷拍了。你用手机给自己拍了一张照片,上传到百度搜图网页上,通过以图搜图和图片识别技术,就能把以前关于你的新闻图片全部搜寻出来。
到了中午你到一个餐馆用餐。大数据软件,你可以告诉你餐馆附近多少车位,算出你可能会遇到的拥堵时间,到了是否还有多少车位等可能性。你在用餐的时候,可以提前看到餐馆的视频环境。看看是否人多。大数据还可以把你脸的部分打成马赛克,你不用担心个人信息泄露。
吃完中饭,你收到催缴电话费短信。你很好奇自己过去三年每个月的消费记录。但过去运营商都是只能让你查到六个月以内的消费信息。为什么?因为中国移动至少有5亿用户,每天至少能产生10次以上计费记录。每天50亿的计费记录,包括上短信,打电话之了,一年下来就是1800亿条记录。这是一个大大数据的存储和归纳技术难题。在大数据时代,过去几年的电话通讯信息都可以查到了。
下班回家的路上,你再也看不到路边电线杠上贴的嫌疑犯通缉图。警察叔叔们使用先进的以图搜图功能,在海量监控视频中,就很快可以通过比对把嫌犯找到。最近嫌犯在哪个城市,哪条街道,哪个商店出现过,就不用上街贴照片。
看过美剧《疑犯追踪》的人,应该对于大数据对于阻止犯罪的作用印象深刻。这部美剧中,软件天才Finch发明了一个程序,通过观测已有的模式来识别有可能进行暴力犯罪的罪犯,他雇用了一位被推定死亡的前美国特种部队绿色贝雷帽队员和前CIA探员Reese,二人使用国家级的监测技术,加以Reese的专业技能和Finch的无限财富,开始“法外执法”,力图在犯罪发生前就对其加以阻止。
当你回到家的时候,你的可穿戴设备告诉你,今天你在室内和室外的时间分别都是多少,你一天内吸入了多少雾霾。
晚上睡觉的时候,你的孩子哭闹起来。你把孩子的哭声录入一个大数据软件中。软件能告诉你孩子为什么哭。是饿了,还是哪里不舒服,还是说想撒撒娇。文章来源:CDA数据分析师官网
为什么能做到这点?很简单。百度大脑把海量的婴儿声纹,上传到大数据中心提取特征学习,从而帮助到年轻父母,录下婴儿哭声上网比对,就知道孩子因为什么哭,让没有带孩子经验的父母得到帮助。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在神经网络模型搭建中,“最后一层是否添加激活函数”是新手常困惑的关键问题——有人照搬中间层的ReLU激活,导致回归任务输出异 ...
2025-12-05在机器学习落地过程中,“模型准确率高但不可解释”“面对数据噪声就失效”是两大核心痛点——金融风控模型若无法解释决策依据, ...
2025-12-05在CDA(Certified Data Analyst)数据分析师的能力模型中,“指标计算”是基础技能,而“指标体系搭建”则是区分新手与资深分析 ...
2025-12-05在回归分析的结果解读中,R方(决定系数)是衡量模型拟合效果的核心指标——它代表因变量的变异中能被自变量解释的比例,取值通 ...
2025-12-04在城市规划、物流配送、文旅分析等场景中,经纬度热力图是解读空间数据的核心工具——它能将零散的GPS坐标(如外卖订单地址、景 ...
2025-12-04在CDA(Certified Data Analyst)数据分析师的指标体系中,“通用指标”与“场景指标”并非相互割裂的两个部分,而是支撑业务分 ...
2025-12-04每到“双十一”,电商平台的销售额会迎来爆发式增长;每逢冬季,北方的天然气消耗量会显著上升;每月的10号左右,工资发放会带动 ...
2025-12-03随着数字化转型的深入,企业面临的数据量呈指数级增长——电商的用户行为日志、物联网的传感器数据、社交平台的图文视频等,这些 ...
2025-12-03在CDA(Certified Data Analyst)数据分析师的工作体系中,“指标”是贯穿始终的核心载体——从“销售额环比增长15%”的业务结论 ...
2025-12-03在神经网络训练中,损失函数的数值变化常被视为模型训练效果的“核心仪表盘”——初学者盯着屏幕上不断下降的损失值满心欢喜,却 ...
2025-12-02在CDA(Certified Data Analyst)数据分析师的日常工作中,“用部分数据推断整体情况”是高频需求——从10万条订单样本中判断全 ...
2025-12-02在数据预处理的纲量统一环节,标准化是消除量纲影响的核心手段——它将不同量级的特征(如“用户年龄”“消费金额”)转化为同一 ...
2025-12-02在数据驱动决策成为企业核心竞争力的今天,A/B测试已从“可选优化工具”升级为“必选验证体系”。它通过控制变量法构建“平行实 ...
2025-12-01在时间序列预测任务中,LSTM(长短期记忆网络)凭借对时序依赖关系的捕捉能力成为主流模型。但很多开发者在实操中会遇到困惑:用 ...
2025-12-01引言:数据时代的“透视镜”与“掘金者” 在数字经济浪潮下,数据已成为企业决策的核心资产,而CDA数据分析师正是挖掘数据价值的 ...
2025-12-01数据分析师的日常,常始于一堆“毫无章法”的数据点:电商后台导出的零散订单记录、APP埋点收集的无序用户行为日志、传感器实时 ...
2025-11-28在MySQL数据库运维中,“query end”是查询执行生命周期的收尾阶段,理论上耗时极短——主要完成结果集封装、资源释放、事务状态 ...
2025-11-28在CDA(Certified Data Analyst)数据分析师的工具包中,透视分析方法是处理表结构数据的“瑞士军刀”——无需复杂代码,仅通过 ...
2025-11-28在统计分析中,数据的分布形态是决定“用什么方法分析、信什么结果”的底层逻辑——它如同数据的“性格”,直接影响着描述统计的 ...
2025-11-27在电商订单查询、用户信息导出等业务场景中,技术人员常面临一个选择:是一次性查询500条数据,还是分5次每次查询100条?这个问 ...
2025-11-27