京公网安备 11010802034615号
经营许可证编号:京B2-20210330
作者:丁点helper
来源:丁点帮你
上篇文章利用泰坦尼克号沉船事件中乘客的存活情况介绍了描述性数据分析,计算了不同舱位乘客的幸存率,今天我们来看看如何用图像来直观表达。
我们先来简单复习一下titanic.csv的内容。
# 导入数据
titanic <- read.csv("//Users//Desktop//titanic.csv",header = TRUE)
names(titanic) # 查看titanic中的变量名
head(titanic) # 查看titanic前6行
上篇文章计算的不同舱位乘客的死亡与幸存人数如下:
table(titanic$survived,titanic$pclass)
1st 2nd 3rd
died 123 158 528
survived 200 119 181
不同舱位生存率:
survpct=paste(round(tab1[2, ]/apply(tab1,2,sum)*100,2),"%",sep="") survpct [1] "61.92%" "42.96%" "25.53%"
如果我们想直观地描述不同舱位乘客的幸存率,可以用下面的做法:
绘制柱状图
barplot(table(titanic$survived,titanic$pclass))
barplot()是绘制柱状图的函数,该函数括号中的命令为绘图所需的数据,就是前面我们计算过的不同舱位死亡及幸存者人数。
柱状图的颜色也可调整,下面的代码中,col是更改柱状图颜色的命令:
barplot(table(titanic$survived,titanic$pclass),
col=c("yellow","dark blue"))
每个舱位死亡与幸存人数柱子的排列方式也可调整,beside为改变柱状图排列方式的命令;beside=T意为两个柱子并排,beside=F意为两个柱子上下叠放。
barplot(table(titanic$survived,titanic$pclass),
col=c("yellow","dark blue"), beside=T)
至此,我们已经可以将数字转变为直观的图像了,但是黄色和蓝色的柱子分别代表幸存者还是死亡者呢?此外,图像的标题等重要信息也未标示出来,图像的可读性还需要通过下面的步骤来提升:
设置图例、标题、坐标轴标签等
做法比较简单,在上面代码的基础上,增加一些命令即可:
barplot(table(titanic$survived,titanic$pclass),
col=c("yellow","dark blue"),
beside=T, legend=T, args.legend=list(x="topleft"),
main="Survival (Pct) by Passenger Class",
xlab="Class",ylab="Count",
ylim=c(0,600))
legend为设置图例的命令;args.legend为设置图例位置的命令;
main为设置图标题的命令;
xlab、ylab分别为设置x轴和y轴名称的命令;
ylim为设置y轴范围的命令。
从这个图像可以清晰地看出,一等舱的幸存者人数为三个舱位中最多的,而三等舱的死亡者人数远高于其他两个舱位。但是这个图像还缺少一个信息,就是各舱位的存活率,我们可以在每个舱位的柱子上面标记一下:
text(c(2,5,8),c(250,250,570),survpct, cex=1.2)
text()为给图片中增加文字的函数。
其中前两个命令为文字的位置信息,第一个命令为文字设置x轴方向的位置信息,c(2,5,8)表示将文字分别放置在x取值为2,5,8处。
第二个命令为文字增加y轴方向的位置信息,c(250,250,570)表示将其分别放置在y取值为250,250,570处。
第三个命令为文字的具体内容,survpct是之前程序的运行结果,为一、二、三等舱乘客的幸存率。
第四个命令cex为文字字号,默认值为1,此处设置为1.2,意为比默认字号大20%。
以上代码默认标题、x轴、y轴的文字均为英文,但有时我们也需要将其设置为中文,此时只需在上面这段代码中增加一个『字体 (family)』命令:将图片中的文字设置成中文。
barplot(table(titanic$survived,titanic$pclass), col=c("red","blue"),
beside=T, legend=T, args.legend=list(x="topleft"),
main="不同舱位乘客幸存数(率)", xlab="舱位",ylab="人数",family = "SimHei",
ylim=c(0,600))
family命令需要赋值字体的英文名称,本文将字体设置为"SimHei",即黑体。
此处还可设置其他字体,以下链接中总结了常见中文字体的英文名,大家可根据自己的需要选择。
部分字体中英文名称,资料来源于下面的链接
http://guangzheng.name/2017/12/18/%E5%A6%82%E4%BD%95%E8%B0%83%E6%95%B4R%E8%AF%AD%E8%A8%80%E7%BB%98%E5%9B%BE%E7%9A%84%E5%AD%97%E4%BD%93/
想从事业务型数据分析师,您可以点击>>>“数据分析师”了解课程详情;
想从事大数据分析师,您可以点击>>>“大数据就业”了解课程详情;
想成为人工智能工程师,您可以点击>>>“人工智能就业”了解课程详情;
想了解Python数据分析,您可以点击>>>“Python数据分析师”了解课程详情;
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在传统零售行业同质化竞争激烈、大众营销转化率持续走低的背景下,依托经验与直觉的粗放式营销逐渐失效。美国塔吉特百货(Target ...
2026-10-10随着智能客服、数字化服务、用户精细化运营的快速普及,传统零散、非标准化的客户服务数据与业务体系逐渐难以支撑高效服务治理。 ...
2026-10-10 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-10-10CDA数据分析师 出品 作者:李诗怡 定义区别 · 场景举例 · 指标分类 · 计算方法 知识体系总览 模块 包含内容 一、核 ...
2026-10-09在数据分析工作流中,业务数据大多存储在各类关系型数据库内,例如MySQL、PostgreSQL、SQLite等。Pandas是Python生态中主流的数 ...
2026-10-09在数字化精细化运营时代,海量用户存在需求差异、行为差异、价值差异与偏好差异。如果企业采用“一刀切”的统一营销、统一服务、 ...
2026-10-09 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-10-09指标体系是企业数字化分析、业务监控、经营决策的核心基础框架,是将零散数据转化为可衡量、可对比、可落地业务价值的关键体系。 ...
2026-10-08随着市场竞争日趋饱和,同质化低价竞争逐渐陷入内卷僵局,传统以价格、渠道、促销为核心的营销模式边际效益持续递减。在此背景下 ...
2026-10-08 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-10-08你有没有想过,手机里点外卖、刷社交软件、转一笔账,背后到底是谁在替你"记着账"? 答案其实很简单:数据库,以及跟它对话的那 ...
2026-10-07CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29