京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据分析的基本流程和方法
在大数据时代,数据分析的重要性显得更加突出,但是数据分析是一个相对比较专业的领域。数据分析的目的性很强,数据收集、数据处理和数据建模都要围绕数据分析的目的展开;同时数据分析有对专业知识和技巧要求比较高,如概率统计、数学建模的等。本文将介绍数据分析的基本流程和方法,并以一个数据分析的具体实例来来揭开数据分析的神秘面纱。
某大型牙膏制造企业为了更好地拓展产品市场,有效地管理库存,公司董事会要求销售部门根据市场调查,找出公司生产的牙膏销售量与销售价格、广告投入等之间的关系,从而预测出在不同价格和广告费用下的销售量。
定义问题
明确数据分析目标是数据分析的出发点。明确数据分析目标就是要明确本次数据分析要研究的主要问题和预期的分析目标等,简单的说就是定义问题。
针对这个具体问题,最根本的目标是预测不同价格和广告费用下的销售量,而且也决定了途径,找出牙膏销售量与销售价格和广告投入之间的关系。所以预期的分析目标确定了,就是预测不同价格和广告费用下的销售量,主要问题如何找到牙膏销售量与销售价格和广告投入之间的关系。
当对研究对象的内在特性和各因素间的关系有比较充分的认识时,一般用机理分析方法进行数据分析,但是如果由于客观事物内部规律的复杂性及人们认识程度的限制,无法分析实际对象内在的因果关系,建立合乎机理规律的数学模型,那么通常的办法是搜集大量的数据,基于对数据的统计分析找到相关因素的关系。
预测牙膏销量的问题,是一个“灰箱”问题,无法准确地在已掌握市场运行规律的基础上去推理分析药膏销量与价格和广告投入之间的关系,再者,要考虑到市场中不只是只有一家牙膏公司。显然,整个问题是无法通过简单推理分析来确定销量与价格和广告投入之间的关系的。
收集数据
正确收集数据是指从分析目标出发,排除干扰因素,正确收集服务于既定分析目标的数据。正确的数据对于实现数据分析目的将起到关键性的作用。如何正确的收集数据呢?简单的说就是用恰当的数据收集方法收集正确的的数据。
总体上讲有三类原始数据收集的方法原始数据包括实验方法、调查方法、观察方法等,
实验研究是一种受控的观测方法,通过一个或多个自变量的变化来评估它对一个或多个因变量产生的效应。统计调查研究(survey research)已经广泛应用于各个领域,包括政治学、社会学、经济学、教育学和管理学科。它是以研究样本的数据为基础辨析总体状况的研究方法。实地研究(fieldresearch)是对自然状态下的研究对象进行直接观察,收集一段时期内若干变量的数据。实地研究(fieldresearch)是对自然状态下的研究对象进行直接观察,收集一段时期内若干变量的数据。每种数据收集的方法都有自己的优缺点和适用范围,这里不详谈。
针对这个问题将采用样本统计调查(sample survey)的方法,但是该收集那些数据呢?研究的主要问题就是发现本公司牙膏销量与牙膏价格和广告投入的关系。正确的数据肯定包含该公司各个销售周期的销售量、销售价格和广告投入。但是从上面的分析中可以看到,本公司的牙膏销量绝对和其他公司的牙膏价格有关系,因此把其他牙膏公司的销售价格也作为数据收集对象。
数据处理
在明确数据分析目标基础上收集到的数据,往往还需要进行必要的加工整理后才能真正用于分析建模。数据的加工整理通常包括数据缺失值处理、数据的分组、基本描述统计量的计算、基本统计图形的绘制、数据取值的转换、数据的正态化处理等,它能够帮助人们掌握数据的分布特征,是进一步深入分析和建模的基础。
回到具体问题,收集到的数据有该公司的每个销售周期的牙膏销售量、价格、广告投入、和其他牙膏公司的价格。其他牙膏公司的价格和各公司的牙膏销售量有关系,但是其他公司的药膏价格却是有很多统计变量组成的,但是这些变量的影响作用是具有同样的规律,可以把这些变量看做一个整体,于是可以对这些统计变量做个取均值的处理,这是对数据处理的第一步。
由于牙膏是生活必需品,对大多数顾客来说,在购买同类产品的牙膏时更多地会在意不同品牌之间的价格差异,而不是它们的价格本身因此,在研究各个因素对销售量的影响时,用价格差代替公司销售价格和其它厂家平均价格更为合适。这是对数据处理的第二步。
记牙膏销售量为y,其它厂家平均价格与公司销售价格之差(价格差)为x1公司投入的广告费用为x2,其它厂家平均价格和公司销售价格分别为x3和x4, x1=x3-x4.
为了大致分析请y与x1和x2的关系,我们可以分别简单的绘制y对x1和x2的散点图。
图 1 y对x1的散点图
从图1可以发现,随着x1的增加,y的值有比较明显的线性增长趋势,图中的直线是用线性模型。
图 2 y对x2的散点图
当x2增大时,y有向上弯曲增加的趋势,图中的曲线使用二次函数拟合的,可以看到二者具有非线性关系。
数据加工整理完成后一般就可以进行进一步的数据分析了。分析时应切忌滥用和误用统计分析方法。滥用和误用统计分析方法主要是由于对方法能解决哪类问题、方法适用的前提、方法对数据的要求不清等原因造成的。另外,统计软件的不断普及和应用中的不求甚解也会加重这种现象。因此,在数据分析中应避免盲目的"拿来主义",否则,得到的分析结论可能会偏差较大甚至发生错误。
另外,选择几种统计分析方法对数据进行探索性的反复分析也是极为重要的。每一种统计分析方法都有自己的特点和局限,因此,一般需要选择几种方法反复印证分析,仅依据一种分析方法的结果就断然下结论是不科学的。
很对本问题,经过数据的简单处理和分析,已经可以看到销售量总体上和价格差成线性关系,销售量和广告投入上成非线性关系,因此可以建立一个回归模型,根据统计信息来求解模型,获得变量的系数,完成对模型的求解。
从图1可以发现,随着x1的增加,y的值有比较明显的线性增长趋势,可以得到公式1,
(1)
从图2中可以你发现,当x2增大时,y有向上弯曲增加的趋势,可以得到公式2,
(2)
根据以上分析可以建立如下回归模型(3)
(3)
其中和成为回归变量,,,,就是回归系数,影响的其它因素包含在随机误差中。
直接利用MATLAB中统计工具箱中的命令regress求解,使用格式为
[b,bint,r,rint,stats] = regress(y,x,alpha).其中,y为表中30个周期的销售量,长度为30的一向量,x为回归系数的数据矩阵[1,,,],是一个30*4的向量,b为回归系数向量的估计值,bint为其置信区间,r为残差向量,rint为残差向量的置信区间,stats为回归模型的检验统计量,包括三个变量,回归方程的决定系数,F统计变量值,与F统计变量值对应的概率p。
分析与结论
数据分析的直接结果是统计量和统计参数。正确理解它们的统计含义是一切分析结论的基础,它不仅能帮助人们有效避免毫无根据地随意引用统计数字的错误,同时也是证实分析结论正确性和可信性的依据,而这一切都取决于人们能否正确地把握统计分析方法的核心思想。
另外,将统计量和统计参数与实际问题相结合也是非常重要的。客观地说,统计方法仅仅是一种有用的数据分析工具,它绝不是万能的。统计方法是否能够正确地解决各学科的具体问题不仅取决于应用统计方法或工具的人能否正确地选择统计方法,还取决于他们是否具有深厚的应用背景。只有将各学科的专业知识与统计量和统计参数相结合,才能得出令人满意的分析结论。
本问题的计算结果如下:
且=0.9054, F = 82.9409, p= 0
=0.9054表示销售量的90.54%可由上述模型确定,F值远超过F检验的临界值,p远小于0.05,因而从总体上看模型是可用的。
回归模型的一个重要应用是,对于给定的回归变量的取值,可以以一定的置信度预测因变量的取值范围,即预测区间。比如当x1=0.2,x2=6.5 时可以算出牙膏销售量的置信度为95的预测区间[7.8230,8.7636],它表明在将来的某个销售周期中,如公司维持产品的价格差为0.2元,并投入650万元的广告费用,那么可以有95%的把握保证牙膏的销售量在7.8230,8.7636百万支之间,实际操作时,预测上限可以用来作为库存管理的目标值,即公司可以生产(或库存)8.763百万支牙膏来满足该销售周期顾客的需求;预测下限则可以用
来较好地把握(或控制)公司的现金流,理由是公司对该周期销售7.8230 百万支
牙膏十分自信.这在实际中将具有非常大的作用。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据处理的全流程中,数据呈现与数据分析是两个紧密关联却截然不同的核心环节。无论是科研数据整理、企业业务复盘,还是日常数 ...
2026-03-06在数据分析、数据预处理场景中,dat文件是一种常见的二进制或文本格式数据文件,广泛应用于科研数据、工程数据、传感器数据等领 ...
2026-03-06在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心价值,早已超越单纯的数据清洗与统计分析,而是通过数据 ...
2026-03-06在教学管理、培训数据统计、课程体系搭建等场景中,经常需要对课时数据进行排序并实现累加计算——比如,按课程章节排序,累加各 ...
2026-03-05在数据分析场景中,环比是衡量数据短期波动的核心指标——它通过对比“当前周期与上一个相邻周期”的数据,直观反映指标的月度、 ...
2026-03-05数据治理是数字化时代企业实现数据价值最大化的核心前提,而CDA(Certified Data Analyst)数据分析师作为数据全生命周期的核心 ...
2026-03-05在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02在数字化运营中,时间序列数据是CDA(Certified Data Analyst)数据分析师最常接触的数据类型之一——每日的营收、每小时的用户 ...
2026-03-02在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27