如何利用SAS进行随机抽样-CDA数据分析师官网

热线电话：13121318867

如何利用SAS进行随机抽样

2015-11-26

如何利用SAS进行随机抽样

利用SAS进行随机抽样

在构建数据挖掘模型过程中，有时我们无法对所有的整体进行全面研究，有时我们希望将整体划分为训练集、验证集、测试集三份用于不同目的的数据集，甚至在K-折交叉验证中，我们需要把样本随机的划分为K份数据子集。本文介绍SAS的SURVEYSELECT过程和RANUNI函数在随机抽样方面的应用。

0、读入数据集，并对数据集按分层变量进行排序。本文数据集采用students.txt：

* 从students.txt读入文件到数据集students;

DATA students;

INFILE ‘C:\students.txt’;

INPUT id class $ gender $ math english history chem phys literat;

RUN;

* 查看数据集内容;

PROC PRINT DATA = students;

TITLE ‘Students”s class gender & scores’;

RUN;

* 对二维列联表（班级、性别）进行频数统计;

PROC FREQ DATA = students;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

* 首先对数据集按分层变量进行排序;

PROC SORT DATA = students;

BY class gender;

RUN;

1、利用SURVEYSELECT过程进行等比例分层抽样

* 利用SURVEYSELECT过程对数据集进行等比例分层抽样;

PROC SURVEYSELECT DATA = students out = samp1 method = srs samprate = .5 seed = 9876;

STRATA class gender;

RUN;

* 查看分层抽样的结果;

PROC FREQ DATA = samp1;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

2、利用SURVEYSELECT过程进行不等比例分层抽样

* 利用SURVEYSELECT过程对数据集进行等不比例分层抽样;

PROC SURVEYSELECT DATA = students out = samp2 method = srs samprate = (.4 .6 .4 .6 .4 .6)seed = 9876;

STRATA class gender;

RUN;

* 查看分层抽样的结果;

PROC FREQ DATA = samp2;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

3、利用SURVEYSELECT过程根据抽样数量进行分层抽样

* 利用SURVEYSELECT过程对数据集进行指定数量的分层抽样;

PROC SURVEYSELECT DATA = students out = samp3 method = srs n = (8 4 6 8 5 7) seed =9876;

STRATA class gender;

RUN;

* 查看分层抽样的结果;

PROC FREQ DATA = samp3;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

4、利用随机数函数RANUNI对数据集进行粗略划分

* 利用RANUNI函数将数据集粗略的划分为N=5份;

DATA s1 s2 s3 s4 s5;

SET students;

r = RANUNI(991889);

IF r<0.2 THEN OUTPUT s1;

ELSE IF r<0.4 THEN OUTPUT s2;

ELSE IF r<0.6 THEN OUTPUT s3;

ELSE IF r<0.8 THEN OUTPUT s4;

ELSE OUTPUT s5;

DROP r;

RUN;

5、利用随机数函数RANUNI对数据集进行精确划分

* 根据数据集创建视图students_v,增加随机数列;

DATA students_v /view=students_v;

SET students;

srt = RANUNI(999890);

RUN;

* 按照随机数列对数据集进行排序,创建数据集students_srt,删除随机数列;

PROC SORT DATA = students_v OUT = students_srt(DROP = srt);

BY srt;

RUN;

* 将数据集精确地划分为N=5份;

DATA s1 s2 s3 s4 s5;

RETAIN per ;

SET students_srt NOBS= total;

IF _N_ = 1 THEN per = INT(total/5);

if _N_<= per then output s1;

ELSE IF _N_<= 2 * per THEN OUTPUT s2;

ELSE IF _N_<= 3 * per THEN OUTPUT s3;

ELSE IF _N_<= 4 * per THEN OUTPUT s4;

ELSE OUTPUT s5;

DROP per;

RUN;

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

数据挖掘

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇图论在大数据分析中的作用！

下一篇CDA认证再升一档！与国家共同推进大数据人才培养标准教育事业！

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

如何利用SAS进行随机抽样

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

【CDA干货】联合索引与覆盖索引：本质区别、实战场 ...

【CDA干货】维度表与事实表：数据仓库建模的核心逻 ...

从“指标堆砌”到“体系落地”：CDA数据分析师视角 ...

【CDA干货】SQL计算列值趋势的全场景实现方法与实战 ...

【CDA干货】用户决策链路全解析：从认知到复购的增 ...

CDA 三级《敏捷数据挖掘》教材知识体系全面解读 ...

【CDA干货】付费玩家流失的核心原因与游戏行业长效 ...

CDA持证人专访：蒋少涵谈传统制造业与互联网行业数 ...

学完商业数据分析，开启 CDA 量化策略：从业务思维 ...

CDA持证人专访：赵森淼谈药企数据分析从业体验与转 ...

【CDA干货】卡方检验与T检验结果的标准化解读方法及 ...

以指标为锚，以体系为纲：CDA数据分析师视角下的指 ...

【CDA干货】MySQL查询不包含指定列的实现方法、实操 ...

【CDA干货】Python中content属性的核心特性、实操应 ...

从零基础到数据科学家：CDA三本官方教材全解读 ...

【CDA干货】资金财务领域本体模型与业务领域模型的 ...

【CDA干货】数字经济下企业数据战略的落地实践与案 ...

从“杂乱数据”到“分析资产”：CDA数据分析师视角 ...

CDA持证人专访：刘伟谈金融行业数据分析实践与转岗 ...

【CDA干货】SQL LEFT JOIN查询耗时过长的成因分析与 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载