京公网安备 11010802034615号
经营许可证编号:京B2-20210330
假设检验是统计学中的一种推断方法,用来判断两个样本或总体间的差异是由于抽样误差引起的还是本质差别造成的。R语言中提供了很多假设检验函数,如F检验,t检验和卡方检验等等。本篇文章介绍如何使用R语言中的这些函数进行假设检验。
二项分布检验
假设一个广告的点击率为0.02,更换新的广告创意后1000次曝光获得了23次点击,新广告在点击率上是否明显优于老广告?
H0:新广告与老广告效果无差异
H1:新广告效果优于老广告
#老广告点击率0.02,新广告1000次广告曝光获得23次点击是否明显优于老广告binom.test(x =23,n = 1000,p = 0.02,alternative ="greater",conf.level = 0.95 )
p-value = 0.2778>0.05,在0.95的置信区间下接受原假设H0。新广告与老广告在点击率上没有显著差异。
#1000次访问0.02点击率下差异显著的临界值qbinom(p = 0.95,size = 1000,prob = 0.02)
[1] 28
新广告在1000次广告曝光中点击量需要提升到28次以上才能明显优于老广告的效果。
假设一次市场推广活动中前一个小时有50人注册,后一个小时有60人注册,后一小时的注册人数是否明显高于前一小时?
H0:前一小时与后一小时注册人数无差异
H1:后一小时注册用户数量高于前一小时
#上一小时50人注册,下一小时60人注册,后一小时是否显著高于前一小时poisson.test(x = 60,T = 50,alternative ="greater",conf.level = 0.95)
p-value = 0.09227>0.05,在0.95的置信区间下接受原假设H0,后一小时注册人数与前一小时无差异。
#与上一小时50人注册差异显著的临界值
qpois(0.95,lambda=50)
[1] 62
后一小时的注册用户数需要提升到62以上才能明显高于前一小时的注册用户数。
假设某流量渠道的目标是每日带来150个咨询,在过去的一周带来的咨询用户数量分别为229,164,121,137,145,127,123,我们是否能认为该渠道已经达到目标,即每日的平均咨询量大于150?
这里使用单样本t检验,首先建立假设。
H0:每日平均咨询量不大于153,未达到目标。
H1:每日平均咨询量大于153,达到目标。
#将过去一周咨询用户数量赋给XX=c(229,164,121,137,155,127,143)#计算过去一周咨询量的均值mean(X)
[1] 153.7143
#过去一周咨询用户数量是否达到目标
t.test(X,alternative ="greater",mu=153,conf.level = 0.95)
p-value = 0.4801>0.05,在0.95的置信区间下接受原假设H0,流量渠道的咨询量没有达到目标。
假设两个流量渠道在过去的一周分布为网站带来咨询用户,这两个流量渠道带来的咨询用户数量是否有显著差异?
这里使用双样本t检验,首先建立假设。
H0:两个流量渠道带来的咨询用户数量没有显著差异。
H1:两个流量渠道带来的咨询用户数量存在有显著差异。
#流量渠道1带来的咨询用户数量赋值给
XX=c(229,164,121,137,155,127,143)
#流量渠道2带来的咨询用户数量赋值给
YY=c(175,120,187,144,117,184,135)
进行双样本t检验之前先进行方差检验,确定两组样本方差是否相同。 H0:两个总体方差相同 H1:两个总体方差不同
#方差检验,确定两个流量渠道的咨询量是否相同
var.test(x = X,y = Y,conf.level =0.95)
p-value = 0.6469>0.05,在0.95的置信区间下接受原假设H0,两个总体方差相同。进行等方差t检验。
#等方差t检验,两个流量渠道带来的咨询用户数量是否有差异
t.test(X,Y,var.equal=TRUE,alternative ="two.sided")
p-value = 0.9125>0.05,接受原假设H0,在0.95的置信区间下两个流量渠道的咨询用户量没有显著差异。
假设网站对咨询流程进行了优化并进行了测试,那么改版后的效果是否明显优于改版前?
这里使用成对t检验,首先建立假设。
H0:改版后的效果与改版前无差异
H1:改版后的效果明显优于改版前
#改版前注册用户量赋给before
before=c(229,164,121,137,155,127,143)
#改版后注册用户量赋给after
after=c(217,284,155,190,158,170,180)
#改版前的咨询量是否小于改版后的咨询量
t.test(before-after,alternative ="less",conf.level = 0.95)
p-value = 0.02362<0.05,拒绝原假设H0,接受备择假设H1。在0.95的置信区间下改版后的效果明显优于改版前。
假设广告创意A1315次访问,65次转化,转化率4.94%,广告创意B939次访问,54次转化,转化率5.75%。广告创意B的效果是否优于广告创意A?
这里使用卡方检验,首先建立假设。
H0:两个广告创意的效果无差异
H1:广告创意B的效果优于广告创意A
对源数据近整理,广告创意A1250次未购买,65次购买,广告创意B885次未购买,54次购买。以此建立列联表。
#创建列联表X=c(1250,885,65,54)
dim(X)=c(2,2)
X
#使用卡方检验chisq.test(X,correct =FALSE)
p-value = 0.3978>0.05,在0.95的置信区间下接受原假设H0,两个广告创意效果没有显著差异。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28