
sas输出基尼方差,F检验
有时候,我们在建模前期会有一个变量探索的单变量与因变量的数据分析报告,但其实,不同的数据形式有不同的指标来衡量变量与因变量的解释能力
今天的代码介绍的就是单变量与因变量之间的基尼方差,F检验的输出,你会说那proc reg中就有p值的输出啊,为什么要自己写。我个人是觉得proc reg是针对线性回归的,但是我们今天用到的因变量依旧还是二元的分类变量,所以就用我自己写到啦。
01
基尼方差
基尼方差被定义为衡量以下三种情况下变量之间的关联性指标:
1、一个连续变量和一个名字或顺序变量。
2、两个名字变量。
3、两个顺序变量。
这里介绍一个连续变量以及一个名义变量x的情况。介绍之前先明白几个符号的由来
基尼方差可以定义为:
G=1-SSE/STD
02
F检验
F检验衡量的是一个连续变量和一个名义变量之间的关联性,其中,谁是因变量不重要,该检验对两种情况都有效,F检验的统计量定义为:
F=MSTR/MSE
如果x是二元变量,并用0,1表示,F值及其相关联的p值可以用线性回归模型进行计算,模型中的y作为因变量,x作为唯一的自变量,用线性回归计算出来的f值可以用p值进行解释。这里你肯定你懵逼,你这不是打脸吗,说好y是二元的。因为我这部分是只有y和x两个变量,所以谁做因变量都无所谓。p值是可以建立模型的概率,及变量x和y之间无关联的概率。数据分析师培训
终于可以贴代码了!!!
%let DSin=test.SCORE_TOTAL_LIST_TEST_4;
%let Xvar=customer_status;
%let YVar=var1;
%macro CalcGrF(DSin, Xvar, YVar, M_Gr, M_Fstar, M_Pvalue);
proc freq data=&DSin noprint ;
tables &XVar /missing out=Temp_Cats;
run;
Data _null_;
retain N 0;
set Temp_Cats;
N=N+count;
call symput ("X_" || left(_N_), compress(&XVar));
call symput ("n_" || left(_N_), left(count));
call symput ("K", left(_N_));
call symput ("N", left(N));
Run;
proc sql noprint;
select avg(&YVar) into :Ybar from &DSin;
%local i;
%do i=1 %to &K;
select avg(&YVar) into :Ybar_&i
from &DSin where &XVar = "&&X_&i";
%end;
select var(&YVar) into: SSTO from &DSin;
%let SSTO=%sysevalf(&SSTO *(&N-1));
%let SSR=0;
%let SSE=0;
%do i=1 %to &K;
select var(&YVar) into: ssei
from &DSin where &Xvar="&&X_&i";
%let SSE=%sysevalf(&SSE + &ssei * (&&n_&i - 1)) ;
%let SSR=%sysevalf(&SSR+ &&n_&i * (&&Ybar_&i - &Ybar)*(&&Ybar_&i - &Ybar));
%end;
quit;
%let MSR=%sysevalf(&SSR/(&K-1));
%let MSE=%sysevalf(&SSE/(&N-&K));
%let M_Gr=%Sysevalf(1-(&SSE/&SSTO));
%let M_Fstar=%sysevalf(&MSR/&MSE);
%let M_PValue=%sysevalf(%sysfunc(probf(&M_Fstar,&K-1,&N-&K)));
data result;
M_Gr=&M_Gr.;
M_Fstar=&M_Fstar.;
M_PValue=&M_PValue.;
run;
proc datasets library=work nolist;
delete temp_cats;
run; quit;
%mend;
%CalcGrF(DSin=&DSin., Xvar=&Xvar., YVar=&YVar.);
结果如下:
这个结果显示的是:p值很高,没有什么关联性。具体的解释也可以自行百度哈
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
2025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-06-052025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-05-27CDA数据分析师证书考试体系(更新于2025年05月22日)
2025-05-26解码数据基因:从数字敏感度到逻辑思维 每当看到超市货架上商品的排列变化,你是否会联想到背后的销售数据波动?三年前在零售行 ...
2025-05-23在本文中,我们将探讨 AI 为何能够加速数据分析、如何在每个步骤中实现数据分析自动化以及使用哪些工具。 数据分析中的AI是什么 ...
2025-05-20当数据遇见人生:我的第一个分析项目 记得三年前接手第一个数据分析项目时,我面对Excel里密密麻麻的销售数据手足无措。那些跳动 ...
2025-05-20在数字化运营的时代,企业每天都在产生海量数据:用户点击行为、商品销售记录、广告投放反馈…… 这些数据就像散落的拼图,而相 ...
2025-05-19在当今数字化营销时代,小红书作为国内领先的社交电商平台,其销售数据蕴含着巨大的商业价值。通过对小红书销售数据的深入分析, ...
2025-05-16Excel作为最常用的数据分析工具,有没有什么工具可以帮助我们快速地使用excel表格,只要轻松几步甚至输入几项指令就能搞定呢? ...
2025-05-15数据,如同无形的燃料,驱动着现代社会的运转。从全球互联网用户每天产生的2.5亿TB数据,到制造业的传感器、金融交易 ...
2025-05-15大数据是什么_数据分析师培训 其实,现在的大数据指的并不仅仅是海量数据,更准确而言是对大数据分析的方法。传统的数 ...
2025-05-14CDA持证人简介: 万木,CDA L1持证人,某电商中厂BI工程师 ,5年数据经验1年BI内训师,高级数据分析师,拥有丰富的行业经验。 ...
2025-05-13CDA持证人简介: 王明月 ,CDA 数据分析师二级持证人,2年数据产品工作经验,管理学博士在读。 学习入口:https://edu.cda.cn/g ...
2025-05-12CDA持证人简介: 杨贞玺 ,CDA一级持证人,郑州大学情报学硕士研究生,某上市公司数据分析师。 学习入口:https://edu.cda.cn/g ...
2025-05-09CDA持证人简介 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度、美团、阿里等 ...
2025-05-07相信很多做数据分析的小伙伴,都接到过一些高阶的数据分析需求,实现的过程需要用到一些数据获取,数据清洗转换,建模方法等,这 ...
2025-05-06以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/g ...
2025-04-30CDA持证人简介: 邱立峰 CDA 数据分析师二级持证人,数字化转型专家,数据治理专家,高级数据分析师,拥有丰富的行业经验。 ...
2025-04-29CDA持证人简介: 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度,美团,阿里等 ...
2025-04-28CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-27