京公网安备 11010802034615号
经营许可证编号:京B2-20210330
二、大数据面面观
当前,大数据正处于快速发展期,每个人对于大数据都有不同的认识,那么什么是大数据?其基本特征又是什么呢?这就需要我们从多个维度来理解和认识大数据。
(一)何谓大数据
所谓大数据,是指以服务于决策为目的,需要新型数据处理模式才能对其内容进行采集、存储、管理和分析的海量、高增长率和多样化的信息资本。认真分析大数据,其本质体现在如下五个方面:第一,数据量大。相对于传统的抽样调查的数据,大数据无疑是巨大的,尤其是依靠传统的计算手段难以有效计算的。第二,服务于决策。大数据的主要目的是服务于各类决策,能够帮助各类组织和个人大幅度提升决策能力。第三,需要新处理模式。由于大数据数量大且非结构化数据很多,现有的处理模式不能有效处理大数据,需要新处理模式。第四,信息资本。大数据是一种信息资本,而不仅仅是一堆数据和成本。所谓信息资本,是指其能够为政府和企业带来未来经济利益的信息资源,更是和土地、资本、人才等一样的新生产要素。第五,更为复杂。大数据比海量数据更为复杂,海量数据包括结构化和半结构化的交易数据,而大数据除此之外还包括非结构化数据和交互数据。
(二)大数据的特点
大数据在量度、频度、速度、维度和温度五个方面具有显著的特点,具体如下:
第一,在量度方面,具有海量性特点,即大数据规模巨大,当前通常指10TB规模以上的数据量,而且随着数据的迅猛增加,大数据的量级还会进一步增加。
第二,在频度方面,具有高频率的特点,即发生的频率很高,重点在于用户参与与互动而产生的数据。在这方面,传统媒体的发行用户数据的价值就很小,关键在于其发行用户非在线,基本上一年才更新一次。
第三,在速度方面,具有实时性的特点,即大数据能够实时反应。例如,在Google搜索框内输入一个关键词,就能够瞬间呈现与其相关的信息,一旦其反应速度稍有不及,就会有大量的用户流失。
第四,在维度方面,具有全样本、多维度、非结构化的特点,即大数据是全体样本的数据,而不是抽样的数据;大数据是多个维度的数据,而不是单个维度的数据;大数据既有惯常的结构化的数据,也有音频、视频等非结构化的数据,而不仅仅是结构化数据。
第五,在温度方面,具有在线性特点,即大数据是永远在线的,能够随时被调用的,这就要求必须基于用户数量巨大的互联网平台。这些平台记录了用户的行为、情感、思想、爱好与需求,能够科学地分析用户的需求。
此外,可以按照生产的主体不同,把大数据分为商务过程数据(由传统的信息系统产生)、环境状态数据(由传感器产生)、社会行为数据(由社交媒体产生)、物理实体数据(由数字化制造产生)四种类型。当然也可以按照归属主体分为政府数据和企业数据,其中政府数据又分为民意数据、业务数据和环境数据。
(三)大数据蕴含着新思想和新思维
在大数据出现之前的小数据时代,我们只能通过抽样调查的方式来回答“为什么”,即找出“因果关系”,找出事情的前因后果。即使有相关关系的研究,重点也是研究“因果关系”。
在大数据时代,大数据大大拓宽了研究范围,大数据能通过全样本的方式来回答“是什么”,即发现相关关系,这能够帮助我们更好地认识和了解世界。因此,大数据既能处理“因果关系”,又能处理“相关关系”,即不仅能够回答“为什么”,又能够回答“是什么”。
典型的相关关系而非因果关系的案例主要有:沃尔玛啤酒与尿布的混搭;鲨鱼对人类的攻击次数和冰淇淋的销量是正相关的;儿童的蛀牙数量与他们的词汇量是正相关的;在美国,自2004年以来,“体重增加”与“房屋出租”的相关性达到90%。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12在CDA(Certified Data Analyst)数据分析师的日常工作中,“挖掘变量间的关联关系”是高频核心需求——比如判断“用户停留时长 ...
2026-01-12在存量竞争时代,用户流失率直接影响企业的营收与市场竞争力。无论是电商、互联网服务还是金融行业,提前精准预测潜在流失用户, ...
2026-01-09在量化投资领域,多因子选股是主流的选股策略之一——其核心逻辑是通过挖掘影响股票未来收益的各类因子(如估值、成长、盈利、流 ...
2026-01-09在CDA(Certified Data Analyst)数据分析师的工作场景中,分类型变量的关联分析是高频需求——例如“用户性别与商品偏好是否相 ...
2026-01-09数据库中的历史数据,是企业运营过程中沉淀的核心资产——包含用户行为轨迹、业务交易记录、产品迭代日志、市场活动效果等多维度 ...
2026-01-08在电商行业竞争日趋激烈的当下,数据已成为驱动业务增长的核心引擎。电商公司的数据分析师,不仅是数据的“解读官”,更是业务的 ...
2026-01-08在数据驱动决策的链路中,统计制图是CDA(Certified Data Analyst)数据分析师将抽象数据转化为直观洞察的关键载体。不同于普通 ...
2026-01-08在主成分分析(PCA)的学习与实践中,“主成分载荷矩阵”和“成分矩阵”是两个高频出现但极易混淆的核心概念。两者均是主成分分 ...
2026-01-07在教学管理、学生成绩分析场景中,成绩分布图是直观呈现成绩分布规律的核心工具——通过图表能快速看出成绩集中区间、高分/低分 ...
2026-01-07