
基本描述数据汇总的图形显示
除了在大部分统计或图形数据表示软件包中使用的条形图、饼图和线图之外,还有一些常用的图用于显示数据汇总和分布,包括直方图、分位数图、q-q图、散布图和局部回归(loess)曲线。对于数据的直观观察,这些图是非常有帮助的。
画直方图(或频率直方图)是一种概括给定属性分布的图形方法。属性A的直方图将A的数据分布划分成不相交的子集或桶。通常,每个桶的宽度是一致的。每个桶用一个矩形表示,其高度等于桶中的值计数或相对频率。如果A是分类的,如车型或商品类型,则对A的每个已知值画一个矩形,而结果图更多地称作条形图。如果A是数值的,更多地使用术语直方图。对于数值属性,构造直方图的划分规则在2.5.4节讨论。例如,在等宽的直方图中,每个桶代表数值属性A的等宽值域。
表2-1 AllElectronics的一个分店销售的商品单价数据集
图2-4显示表2-1中数据的直方图,其中,桶定义成等宽的,代表增量20美元,而频率是商品的销售数量。直方图至少有一个世纪了,是一种广泛使用的单变量图形方法。然而,对于比较单变量观测组,它可能不如分位数图、q-q图和盒图方法有效。
图2-4 表2-1中数据集的直方图
分位数图(quantile plot)是一种观察单变量数据分布的简单有效方法。首先,它显示给定属性的所有数据(允许用户评估总的情况和不寻常的出现)。其次,它绘出了分位数信息。
这一步使用的机制与2.2.2节讨论的百分位数计算稍微有点不同。设xi (i = 1, ., N)是按递增序排序的数据,使得x1是最小的观测值,而xN是最大的。每个观测值xi与一个百分数fi配对,指出大约100fi%的数据小于或等于xi。我们说“大约”,因为可能没有一个精确的小数值fi,使得数据的fi%小于或等于xi。注意,0.25分位数对应于四分位数Q1,0.50分位数对应于中位数,而0.75分位数对应于Q3。令
这些数由1/2N(稍大于0)到1-1/2N(稍小于1),以相同的步长1/N递增。在分位数图中,xi 对着fi画出。这使得我们可以基于分位数比较不同的分布。例如,给定两个不同时间段销售数据的分位数图,我们一眼就可以比较它们的Q1,中位数,Q3,以及其他fi值。图2-5显示了表2-1单价数据的分位数图。
图2-5 表2-1单价数据的分位数图
分位数-分位数图或q-q图对着另一个对应的分位数,绘制一个单变量分布的分位数。它是一种强有力的可视化工具,使得用户可以观察从一个分布到另一个是否有移位。
假定对于变量单价有两个观测集,取自两个不同的分店。设x1, ., xN是取自第一个分店的数据,y1, ., yM是取自第二个分店的数据,每组数据都按递增序排序。如果M = N(即每个集合中的点数相等),则我们简单地对着xi画yi,其中yi和xi都是各自数据集的第(i-0.5) / N个分位数。如果M < N(即第二个分店的观测值比第一个少),则可能只有M个点在q-q图中。这里,yi是y数据的第(i-0.5) / M个分位数,对着x数据的第(i-0.5) / M个分位数画。在典型情况下,该计算涉及插值。
图2-6显示在给定的时间段,AllElectronics的两个不同分店销售的商品单价数据的分位数分位数图。每个点对应于每个数据集的相同的分位数,并显示分店1与分店2相对的销售商品单价。例如,左下角的最低点对应于分位数0.03。(为帮助比较,我们也画了一条直线,代表对于给定的分位数,两个分店的单价相同的情况。此外,加黑的点分别对应于Q1、中位数和Q3。)我们看到,在分位数0.03,分店1销售的商品单价比分店2稍低。换言之,在分店1销售
的商品3%低于或等于40美元,而在分店2销售的商品3%低于或等于42美元。在最高分位数,我们看到分店2的商品单价稍微低于分店1。一般地,我们注意到分店1的分布相对于分店2有一个移位,分店1销售的商品单价趋向于比分店2低。
散布图(scatter plot)是确定两个数值属性之间看上去是否有联系、模式或趋势的最有效的图形方法之一。为构造散布图,每个值对视为一个代数坐标对,并作为一个点画在平面上。图2-7 显示表2-1中数据集的散布图。散布图是一种观察双变量数据有用的方法,用于观察点的簇和离群点,或考察相关联系的可能性。在图2-8中,我们看到两个不同数据集中两个属性之间的正相关和负相关的例子。图2-9显示了三种情况,每个数据集的两个属性之间都不存在相关联系。
图2-6 两个不同分店的单价数据的分位数-分位数图
图2-7 表2-1中数据的散布图
图2-8 散布图可以用来发现属性之间的a)正相关或b)负相关
图2-9 三种情况,其中每个数据集中两个属性之间都不存在观察到的相关
图2-10 表2-1中数据集的loess曲线
在处理多个属性时,散布图矩阵(scatter-plot matrix)是散布图的一种有用的扩充。给定n个属性,散布图矩阵是散布图的n×n栅格,提供每个属性(或维)与每个其他属性的可视化表示。随着所研究的属性数量增加,散布图的有效性降低。在这种情况下,用必要进行诸如放大(zooming)和摇动(panning)等用户交互操作,帮助有效地解释单个散布图。
loess曲线是另一种重要的图形探查工具,它添加一条光滑曲线到散布图,以便更好地理解依赖模式。loess一词是“局部回归”(local regression)的缩写。图2-10显示表2-1中数据集的loess曲线。
为了拟合loess曲线,需要设置两个参数—光滑参数α,被回归拟合的多项式的次数λ。α可以是正数(典型值在1/4~1之间),而λ可以是1或2。选择α的目的是产生一个拟合,它尽59 ~可能光滑,而不过分破坏数据中潜在的模式。曲线随α增大而变得更光滑。然而,可能出现拟60 合不足,表明可能“丢失”数据模式。如果α太小,跟踪了潜在的模式,但可能过分拟合数据,曲线中的局部“摆动”可能不被数据支持。如果数据的潜在模式具有“温和的”曲率,而没有局部极大和极小,则局部线性拟合通常就足够了(λ = 1)。然而,如果存在局部极大和极小,则二次拟合(λ = 2)一般做得更好,它遵循数据模式并且保持局部光滑性。
总而言之,描述性数据汇总提供了数据总体行为的有价值的洞察。通过帮助识别噪声和离群点,它们对于数据清理特别有用。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA数据分析师与数据指标:基础概念与协同逻辑 一、CDA 数据分析师:数据驱动时代的核心角色 1.1 定义与行业价值 CDA(Certified ...
2025-08-22Power Query 移动加权平均计算 Power Query 移动加权平均设置全解析:从原理到实战 一、移动加权平均法的核心逻辑 移动加权平均 ...
2025-08-22描述性统计:CDA数据分析师的基础核心与实践应用 一、描述性统计的定位:CDA 认证的 “入门基石” 在 CDA(Certified Data Analy ...
2025-08-22基于 Python response.text 的科技新闻数据清洗去噪实践 在通过 Python requests 库的 response.text 获取 API 数据后,原始数据 ...
2025-08-21基于 Python response.text 的科技新闻综述 在 Python 网络爬虫与 API 调用场景中,response.text 是 requests 库发起请求后获取 ...
2025-08-21数据治理新浪潮:CDA 数据分析师的战略价值与驱动逻辑 一、数据治理的多维驱动引擎 在数字经济与人工智能深度融合的时代,数据治 ...
2025-08-21Power BI 热力地图制作指南:从数据准备到实战分析 在数据可视化领域,热力地图凭借 “直观呈现数据密度与分布趋势” 的核心优势 ...
2025-08-20PyTorch 矩阵运算加速库:从原理到实践的全面解析 在深度学习领域,矩阵运算堪称 “计算基石”。无论是卷积神经网络(CNN)中的 ...
2025-08-20数据建模:CDA 数据分析师的核心驱动力 在数字经济浪潮中,数据已成为企业决策的核心资产。CDA(Certified Data Analyst)数据分 ...
2025-08-20KS 曲线不光滑:模型评估的隐形陷阱,从原因到破局的全指南 在分类模型(如风控违约预测、电商用户流失预警、医疗疾病诊断)的评 ...
2025-08-20偏态分布:揭开数据背后的非对称真相,赋能精准决策 在数据分析的世界里,“正态分布” 常被视为 “理想模型”—— 数据围绕均值 ...
2025-08-19CDA 数据分析师:数字化时代的价值创造者与决策智囊 在数据洪流席卷全球的今天,“数据驱动” 已从企业战略口号落地为核心 ...
2025-08-19CDA 数据分析师:善用 Power BI 索引列,提升数据处理与分析效率 在 Power BI 数据分析流程中,“数据准备” 是决定后续分析质量 ...
2025-08-18CDA 数据分析师:巧用 SQL 多个聚合函数,解锁数据多维洞察 在企业数据分析场景中,单一维度的统计(如 “总销售额”“用户总数 ...
2025-08-18CDA 数据分析师:驾驭表格结构数据的核心角色与实践应用 在企业日常数据存储与分析场景中,表格结构数据(如 Excel 表格、数据库 ...
2025-08-18PowerBI 累计曲线制作指南:从 DAX 度量到可视化落地 在业务数据分析中,“累计趋势” 是衡量业务进展的核心视角 —— 无论是 “ ...
2025-08-15Python 函数 return 多个数据:用法、实例与实战技巧 在 Python 编程中,函数是代码复用与逻辑封装的核心载体。多数场景下,我们 ...
2025-08-15CDA 数据分析师:引领商业数据分析体系构建,筑牢企业数据驱动根基 在数字化转型深化的今天,企业对数据的依赖已从 “零散分析” ...
2025-08-15随机森林中特征重要性(Feature Importance)排名解析 在机器学习领域,随机森林因其出色的预测性能和对高维数据的适应性,被广 ...
2025-08-14t 统计量为负数时的分布计算方法与解析 在统计学假设检验中,t 统计量是常用的重要指标,其分布特征直接影响着检验结果的判断。 ...
2025-08-14