京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据当然需要大量、海量的数据,但究竟是不是有些研究者和论者所说的无限数据,是一个重大疑问。
要懂得从大数据中还原数据真实,《决战大数据:驾驭未来商业的利器》一书传达的这个观点给笔者留下了深刻印象。大数据当然需要大量、海量的数据,但究竟是不是有些研究者和论者所说的无限数据,是一个重大疑问。信息搜集需要成本,还将面临用户隐私意识等障碍。更大的成本来源于存储和分析。
信息和数据分布从来就遵循幂律特点,如果数据挖掘以拒绝遗漏为原则,将产生大量的无意义劳动消耗,因为根据一部分数据其实就可以得出足够推导出80%-90%的结论。再者,大数据分析的重要意义在于改善实时分析,对数据搜集及处理速度有很高的要求,譬如电商企业不得不切实提高与用户的有效互动,要尽可能依据掌握并不全面的用户数据给出推荐,并就疑难及时响应。相反,如果数据处理和响应总带有迟滞性,企业希望搜集到足够的、全面的用户数据再给予响应,就必然错过时机。
海量数据还可能包含大量看上去彼此矛盾,甚至根本就带有误导性的数据内容。《决战大数据:驾驭未来商业的利器》一书的作者是阿里巴巴集团商业智能部副总裁、数据委员会会长车品觉,他在书中描绘了消费者通过智能手机等终端购物的一种常见场景:消费者早上看到某款好看的衣服,想要购买,在网上搜出大批量的相关商品;正在挑选时,被叫去开会,在开会时打开手机应用,发现了有诱惑力的促销广告,就下单购买了另外一类商品(比如手机)。
这起场景中,消费者先后使用了手机端和PC端,如果均保持同一个用户名的登录状态,其搜索数据和最终购买数据汇集在一起显然会让许多数据分析师抓狂。如果企业要求数据分析师从这些数据挖掘、还原用户的真实需求,难度可想而知。如果这一个消费者在手机端、PC端还使用不同用户名,又该搜集哪些、多少数据,才能做到辨识其身份?
车品觉指出,“大数据的真正价值是将数据用于形成主动收集数据的良性循环,以带动更多的数据进入这个自循环中”。要做到这一点必然是困难的,上述场景非常常见,直接原因是普通消费者使用互联网具有多场景,完全可能灵活的轮换使用PC端、手机端、智能穿戴设备等终端;往深了说,移动互联网时代,很多人的注意力是高度涣散的。许多时候,用户可能长时间停留于某个页面,这并不能表明其一定是在专心停留阅读,更大的可能在于消费者这时有事走开了,或者切换到别的终端界面。因此,数据挖掘分析必须承认这种手段的相对有效性、局限性。
书中提出,数据具有5大价值:识别与串联价值(根据大数据中的核心数据对用户真实身份、真实行为进行还原)、描述价值(在特定框架内找出核心用户、紧密购买行为数据)、时间价值(在特定时间段分析历史数据)、预测价值、产出数据的价值。这其中提到的特定框架,也就是说从海量数据中根据关联性,提取核心有用数据的范围。比如一个企业要判断是否继续使用导航网站的广告,就要明确导航网站引进的新老用户比、引进的新老用户的投入产出比和转化率、推断一旦撤去广告会带来的流失影响,还要对竞争对手进行行为分析预测(对方可能加强导航广告投入),这些限定因素将使得数据提取及后续分析就不会毫无章法。
这本书第二部分对阿里巴巴的大数据实践作了基本介绍。阿里巴巴成长到今天的规模,还能继续驾驭宏大的产品线和业务范围,电商行业内外有识之士都认为这应归功于阿里巴巴能够很好的实现数据化运营,可以通过海量数据成功实现即便是细小范围内的业务对比、细分及趋势预估。车品觉分享指出,阿里巴巴数据化运营落地是从“人”做起,利用好了“混、通、晒”三板斧。“混”就是让数据分析师与业务部门的人经常“混”在一起,这是确保两大部门培养商业和数字直觉的前提;“通”就是打通“混”的数据;在此基础上,让数据得以最有效的获取、使用、分享、协同、连接和组合,就是“晒”。
车品觉认为,2011年起,阿里巴巴已经开始从数据化运营向运营数据发展,形成了良性循环,走到了运营数据的外三板斧“存、管、用”。“存”指的是搜集并存储有效数据;“管”涵盖了数据的安全管理、让数据更趋准确稳定、更好运用数据等范畴;“用”,就是要从数据本身实现分裂和重组,推动颠覆性创新。书中就此对“用”这一层次,结合作者长期以来的从业实践及对京东、一号店等其他知名电商企业运营经验的观察,展开了颇为深入的梳理剖析。文章来源:CDA数据分析师培训官网
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据处理的全流程中,数据呈现与数据分析是两个紧密关联却截然不同的核心环节。无论是科研数据整理、企业业务复盘,还是日常数 ...
2026-03-06在数据分析、数据预处理场景中,dat文件是一种常见的二进制或文本格式数据文件,广泛应用于科研数据、工程数据、传感器数据等领 ...
2026-03-06在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心价值,早已超越单纯的数据清洗与统计分析,而是通过数据 ...
2026-03-06在教学管理、培训数据统计、课程体系搭建等场景中,经常需要对课时数据进行排序并实现累加计算——比如,按课程章节排序,累加各 ...
2026-03-05在数据分析场景中,环比是衡量数据短期波动的核心指标——它通过对比“当前周期与上一个相邻周期”的数据,直观反映指标的月度、 ...
2026-03-05数据治理是数字化时代企业实现数据价值最大化的核心前提,而CDA(Certified Data Analyst)数据分析师作为数据全生命周期的核心 ...
2026-03-05在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02在数字化运营中,时间序列数据是CDA(Certified Data Analyst)数据分析师最常接触的数据类型之一——每日的营收、每小时的用户 ...
2026-03-02在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27