京公网安备 11010802034615号
经营许可证编号:京B2-20210330
作者:丁点helper
来源:丁点帮你
回忆一下上一讲用到的例子:
输入数据的代码在上一讲详细讲解过,这里总结如下:
age <- c(25, 34, 59, 60, 20)
#患者年龄type <- c(1, 2, 2, 2, 1)
#糖尿病类型status <- c("poor", "improved", "excellent", "poor", "excellent")
#病情comorbidity<- c(TRUE, FALSE, FALSE, TRUE, FALSE)
#出现并发症
age、type、status、comorbidity中分别仅有一种数据类型,它们都是向量。本文介绍生成向量之后,如何对其进行简单的操作。
1. 查看与改变向量的数据类型
看到一个向量,首先要搞清楚其中包含的数据类型。就本例而言,从表面看也很容易区分,但实际上一项统计分析工作用到的向量可能很多,用函数class()可以快速知晓某向量的数据类型,例如:
class(age) [1] "numeric"class(type) [1] "numeric"class(status) [1] "character"class(comorbidity)[1] "logical"
不同类型的数据可以根据需要互相转换,用as.目标数据类型()函数:
as.numeric() #将括号中的内容转变为数值型数据 as.character() #转变为字符型as.logical() #转变为逻辑型as.factor() #转变为因子型
所以也可用as.character()将type中的数值型数据转变为字符型:
type[1] 1 2 2 2 1class(type) [1] "numeric" type <- as.character(type) # 注意要将新的结果赋值给typetype[1] "1" "2" "2" "2" "1"class(type)[1] "character"
之前讲过,将定性变量(即分类变量)以因子的形式输入会有助于后续的统计分析工作,factor()这个函数可以帮我们把数据转变为因子型:
type <- c(1, 2, 2, 2, 1) type <- factor(type) type[1] 1 2 2 2 1 Levels: 1 2class(type)[1] "factor"
用1和2这样的阿拉伯数字其实不太利于准确地表达数据内容,可以给原来的1和2加上标签:
type <- factor(type, levels = c("1", "2"),
labels = c("Type 1", "Type 2"))
type[1]
Type 1 Type 2 Type 2 Type 2 Type 1
Levels: Type 1 Type 2
所以在输入定性变量(分类变量)时可以采用这种简便方法。
再看另一个例子:
status[1] "poor" "improved" "excellent" "poor" "excellent" status <- factor(status)status[1] poor improved excellent poor excellentLevels: excellent improved poorclass(status)[1] "factor"
由于status是一个有序分类变量,所以在转变为因子时还应体现其顺序:
status <- factor(status, levels = c('poor', 'improved','excellent'),ordered = TRUE)
status[1]
poor improved excellent
poor excellentLevels:
poor < improved < excellent
这里的顺序是根据levels这个命令中的内容生成的,可自行调整levels命令中的顺序:
status <- factor(status, levels = c('excellent','improved' ,'poor'),ordered = TRUE)
status[1]
poor improved excellent
poor excellentLevels:
excellent < improved < poor
2. 向量中的数据定位
以age这个向量为例:
age <- c(25, 34, 59, 60, 20) age [1] 25 34 59 60 20
输出向量中排在第3位的数据:
age[3] [1] 59
输出排在1,2,5位的数据:
age[c(1,2,5)] [1] 25 34 20
输出1至3位的数据:
age[c(1:3)] [1] 25 34 59
3. 向量中的数据计算
以age这个向量为例:
age <- c(25, 34, 59, 60, 20) # 仍以age为例age [1] 25 34 59 60 20 age+4 # 给向量中每个数都加4 [1] 29 38 63 64 24 sqrt(age) # 求平方根 [1] 5.000000 5.830952 7.681146 7.745967 4.472136 sort(age) # 给数据从低到高排序 [1] 20 25 34 59 60 sort(age, decreasing =T) # 给数据从高到低排序 [1] 60 59 34 25 20 age2 <- c(20,30,40,50,60) # 再生成一个向量 age+age2 # 将两向量中的元素相加 [1] 45 64 99 110 80
4. 生成特定形式的向量
生成重复数据。用rep(x, ……),x表示要重复的内容。
rep(1,times=5) #times表示重复的次数 [1] 1 1 1 1 1 rep(c(1,2),4) #times这个表达可以省略 [1] 1 2 1 2 1 2 1 2 rep(c(1,2),each=4) #each也是针对重复次数的命令 [1] 1 1 1 1 2 2 2 2
特定间隔的数据。用seq(from,to,by)这个函数,from为起始值,to为终止值,by为数据之间的间隔。
seq(1,100,19) #from,to,by都可以省略 [1] 1 20 39 58 77 96 seq(1,10) #如果不指定by的内容,则默认为1 [1] 1 2 3 4 5 6 7 8 9 10
下一篇介绍数据框的相关操作。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】客户、数据分析、指标体系、数据采集、数据指标、业务数据、分析思路、业务需求、分析方法 【专访摘要】本次 CDA ...
2026-07-24在数据分析、业务建模与数字化运营体系中,原始业务数据普遍存在缺失、重复、异常、口径不一致等质量问题,直接用于分析与建模会 ...
2026-07-24 很多数据分析师能熟练计算均值、标准差,但当被问到“如何用一张图让业务方3秒内看懂核心结论”“面对不同数据类型该怎么选 ...
2026-07-24在数据驱动的精细化运营体系中,指标是业务判断、效果复盘、策略优化的核心依据。随着企业数据化程度提升,指标数量持续膨胀,但 ...
2026-07-23在用户运营与产品增长体系中,留存是衡量产品真实价值与用户粘性的核心标尺,也是决定用户生命周期价值、获客投产比的底层因素。 ...
2026-07-23 很多数据分析师精通Excel、SQL、Python等工具,但当被问到“面对一个具体的业务问题,该用什么分析方法”“描述性分析和诊断 ...
2026-07-23【核心关键词】埋点、产品、互联网、数据库、决策、数据分析、产品经理、商业模式、移动互联网、指标体系、运营模块、大数据平 ...
2026-07-22在高并发、大数据量的业务系统中,单表数据量达到千万级甚至亿级后,会出现查询性能骤降、索引维护成本飙升、存储扩容困难等问题 ...
2026-07-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-07-22在金融风控、企业运营、行业研究等数据分析场景中,大量数据以面板数据形态存在:例如多家分支机构连续多个季度的风险指标、多位 ...
2026-07-21 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-07-21一、活动介绍 2026暑期CDA备考冲刺季,为想利用假期拿证的你量身打造。考点胶囊内容搭配多重硬核福利,让你在旅行、实习、居家 ...
2026-07-21金融行业的运营风险贯穿业务全流程,涵盖交易欺诈、操作违规、流程漏洞、合规偏差、客户信用异常等多元场景,是银行、保险、证券 ...
2026-07-17财产保险作为金融行业的核心板块,涵盖车险、家财险、责任险、企财险等多元品类,是个人与企业抵御财产风险、经营风险的重要保障 ...
2026-07-17 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-07-17【核心关键词】模块、餐饮、客户、门店、企业、订单、供应链、多样化、产品、生产计划、数据分析、生产管理、物料管理、业务分 ...
2026-07-16在数字化分析时代,原始数据本身不具备业务价值,只有通过科学的统计学方法加工、拆解、验证与解读,才能挖掘数据背后的规律、差 ...
2026-07-16 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-07-16在描述性统计分析、数据预处理、异常值排查与多组数据分布对比工作中,箱线图(Box Plot)是应用最广泛的可视化与统计工具之一。 ...
2026-07-15在企业数据存储、业务统计与数据分析工作中,绝大多数业务数据都带有时间维度属性,例如订单创建时间、用户注册时间、支付完成时 ...
2026-07-15