京公网安备 11010802034615号
经营许可证编号:京B2-20210330
为了找出color、rarity、flower number、type of species对price的影响,由此,price为因变量,color、rarity、flower number、type 为自变量。
研究自变量对因变量的影响,可以选用的方法有两种,一种是传统的线性回归模型OLS,另一种是广义线性模型GLM(Generalized Linear Model)。传统模型(OLS)要求因变量服从正态分布,广义线性模型(GLM)则适用的范围更广,不要求因变量一定服从正态分布,并且方差也可以不稳定。
第一步:考察因变量price的分布类型。
基于以上的分析,为了判断应该适用OLS还是使用GLM。需要先对因变量price的分布状况进行分析。首先,检验因变量price是否服从正态分布,检验的结果如下:
Table 1 Tests of Normality
|
|
Kolmogorov-Smirnova |
Shapiro-Wilk |
||||
|
|
Statistic |
df |
Sig. |
Statistic |
df |
Sig. |
|
Price |
.149 |
156 |
.000 |
.818 |
156 |
.000 |
|
a. Lilliefors Significance Correction |
||||||
上表是正态性检验的结果,K-S检验和S-W检验的SIG.全部小于0.05.由此可以知道,因变量price不服从正态分布。因此,研究color、rarity、flower number、type of species对price的影响不能选用传统线性模型(OLS)分析,必须选用GLM模型。
通过price不服从正态分布这一结论,得出必须选用GLM模型之后,还需要进一步找出因变量price到底服从哪种分布。经过尝试,得出因变量price服从Gamma分布。
第二步:GLM分析
确定选用GLM模型和因变量price是服从Gamma分布的,进行GLM分析,结果如下:
Table 2
|
Case Processing Summary |
||
|
|
N |
Percent |
|
Included |
156 |
100.0% |
|
Excluded |
0 |
0.0% |
|
Total |
156 |
100.0% |
上表的结果陈述了,参与分析的案例个数为156。
Table 3
|
Categorical Variable Information |
||||
|
|
N |
Percent |
||
|
Factor |
Color |
Green |
30 |
19.2% |
|
Red |
30 |
19.2% |
||
|
White |
29 |
18.6% |
||
|
Black |
30 |
19.2% |
||
|
Yellow |
22 |
14.1% |
||
|
Blue |
15 |
9.6% |
||
|
Total |
156 |
100.0% |
||
|
Rarity |
Rare |
83 |
53.2% |
|
|
Commom |
73 |
46.8% |
||
|
Total |
156 |
100.0% |
||
|
FlowerNumber |
Single flower |
72 |
46.2% |
|
|
Multiple flowers |
84 |
53.8% |
||
|
Total |
156 |
100.0% |
||
|
TypeofSpecies |
Native species |
61 |
39.1% |
|
|
First generation hybrids |
42 |
26.9% |
||
|
Complex hybrids |
53 |
34.0% |
||
|
Total |
156 |
100.0% |
||
上表的结果展现了4个自变量中每个类别的选择的人数及其占比。
Table 4
|
Goodness of Fita |
|||
|
|
Value |
df |
Value/df |
|
Deviance |
68.838 |
146 |
.471 |
|
Scaled Deviance |
166.574 |
146 |
|
|
Pearson Chi-Square |
68.353 |
146 |
.468 |
|
Scaled Pearson Chi-Square |
165.400 |
146 |
|
|
Log Likelihoodb |
-767.832 |
|
|
|
Akaike's Information Criterion (AIC) |
1557.665 |
|
|
|
Finite Sample Corrected AIC (AICC) |
1559.498 |
|
|
|
Bayesian Information Criterion (BIC) |
1591.213 |
|
|
|
Consistent AIC (CAIC) |
1602.213 |
|
|
|
Dependent Variable: Price Model: (Intercept), Color, Rarity, FlowerNumber, TypeofSpecies |
|||
|
a. Information criteria are in small-is-better form. |
|||
|
b. The full log likelihood function is displayed and used in computing information criteria. |
|||
上表是GLM模型的拟合优度分析结果,拟合优度分析是用于反映模型总体上对数据信息的表达是否充分。Deviance拟合优度检验法和Pearson Chi-Square拟合优度检验法计算出的显著性水平分别为0.471和0.468,均大于0.05,由此可以知道,模型的拟合情况良好,即模型能够比较真实可靠地反映出数据。
来CDA学业务数据分析师,SPSS理论结合实战进行项目数据分析,助你成为从事数据采集、清洗、处理、分析并能制作业务报告、提供决策的新型数据分析人才,点击了解课程详情!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28