
通过IMPORT过程读取外部文件数据
通过IMPORT过程读取外部文件数据
除了可以通过DATA步读取外部文本文件数据外,SAS还提供了IMPORT过程,通过它可以从外部数据源读取数据并写入到SAS数据集中。而且,如果使用SAS/ACCESS to PC Files,IMPORT过程除了可以导入带分隔符的文件外,还可以读取PC文件中的外部数据,包括Microsoft Access数据库文件、Miscrosft Excel工作薄、Lotus 1-2-3文件、dBase文件、JMP文件、SPSS文件、Stata文件、Paradox等。SAS变量的定义根据输入记录确定。
在SAS窗口环境选择菜单文件=>导入数据可以打开导入窗口,通过导入向导可读取上述类型的数据。导入过程所生成的SAS语句也可以保存起来供以后使用。
对应于IMPORT过程和SAS窗口环境的IMPORT向导,SAS还提供了EXPORT过程和EXPORT向导(选择菜单文件=>导出数据),以便将SAS数据集中的数据导出到上述类型的文件。对此这里不做讲解,有兴趣的读者可以通过SAS帮助文档学习。
IMPORT过程的导入数据的基本形式如下:
PROC IMPORT
DATAFILE=文件名|文件引用 | DATATABLE=表名
DBMS=数据源标识符
OUT=数据集名称;
RUN;
在上述形式中:
DATAFILE=指定输入文件的完整路径和文件名,或文件引用。文件引用通常通过FILENAME语句指定。
下面给出了几个例子,分别讲解通过IMPORT过程导入CSV文件、Microsoft Excel工作薄和Microsoft Access数据库文件中的数据。
读取CSV文件
外部文件contact.csv的内容如下,文件第一行给出了各个数据行中数据值字段的名称,后面的各行则为对应的字段值。
Name,Age,Position,Marriage,Address
Greg William,42,Manager,Single,"14 Bridge St. San Francisco, CA"
Emily Cooker,33,Sales,Married,"42 Rue Marston"
Henry Cooper,,Office,Married,"52 Rue Marston Paris"
Jimmy Cruze,34,Manager,Single,"Box 100 Cary, NC"
使用IMPORT过程导入该文件的代码如下:
proc import out=saslib.contact
datafile="c:\sas\data\contact.csv"
dbms=csv replace;
getnames=yes;
datarow=2;
run;
proc print data=saslib.contact noobs;
run;
所生成的数据集为saslib逻辑库中的contact数据集,数据文件为c:\sas\data\contact.csv,选项DBMS=指定数据库类型为csv。其中文件扩展名可以省略,SAS会根据DBMS=选项指定的据库类型自行加上。
代码中还使用了REPLACE选项,表示当OUT=指定的数据集存在时覆盖该数据集。GETNAMES语句表示是否从该文件中的第一行读取变量值,默认为YES,表示读取。值为NO表示不读取,这时IMPORT过程会自动产生名为F1、F2、F3的变量等。
DATAROW=语句也会经常使用,用于指定IMPORT语句开始读数据的行号。默认情况下,当GETNAMES=NO时,DATAROW=1,当GETNAMES=NO时,DATAROW=2。该选项可用于跳过数据文件开始处的多行内容。
PRINT过程打印的数据集内容如图2.47所示。
图2.47 PRINT过程打印的数据集
读取 Microsoft Excel 工作薄
IMPORT过程可以导入Microsoft Excel工作薄中的数据。在Excel 2007中文件的工作薄pag的内容如图4.28所示。在该图中,共包含了A~E五列,第一行为字段名称,从第二行开始为数据值。
图2.48 工作薄pag的内容
下面使用IMPORT过程读入该工作薄的指定区域。
proc import out=saslib.contact
datafile="c:\sas\data\contact.xlsx"
dbms=xlsx replace;
range="pag$A1:E5"n;
run;
proc print data=saslib.contact noobs;
run;
IMPORT过程中可以使用RANGE=语句指定所导入的区域。在使用IMPORT过程处理工作薄的数据之前,可先通过Microsoft Excel的“名称管理器”定义要处理的数据的区域,在IMPORT过程中,使用RANGE=语句指定该数据区域的名称,或直接在RANGE=语句中指定数据区域。本例中为直接指定,区域为工作薄为pag的从A1到E5的矩形区域。PRINT过程打印的数据集的内容如图2.49所示。
图2.49
注意:
1) DBMS=XLSX可以处理Microsoft Excel 2007或Microsoft Excel 2010的工作薄。对于其他更早版本的Microsoft Excel生成的工作薄,需使用其他类型,例如XLS、EXCEL4、EXCEL5。
2) 还可使用EXCEL数据库类型EXELCS并通过SAS PC文件服务器来读取相应版本的Excel工作薄。
3) 也可以直接使用LIBNAME语句通过SAS/ACCESS EXCEL引擎来访问Excel工作薄。
具体请参考SAS帮助文档。
通过DBMS=XLS或DBMS=XLSX来读取Excel文件中的数据还有一个好处,即可以直接在UNIX环境下读取Excel工作薄中的数据,不需要访问PC文件服务器。
读取 Microsoft Access 数据库文件
Microsoft Access是一个桌面关系型数据库系统,通常使用Microsoft ACE引擎(.accdb文件格式)或Microsoft Jet引擎(.mdb文件格式)。在IMPORT过程中指定DBMS为ACCESS,SAS可以读取在Microsoft Access 97、Microsoft Access 2000、Microsoft Access 2003、Microsoft Access 2007和Microsoft Access 2010中的文件。例如:
proc import out=saslib.customer
datatable="customer"
dbms=access replace;
database="c:\sas\data\customer.accdb";
RUN;
在IMPORT过程中使用access数据库类型,实际使用的是SAS/ACCESS LIBNAME引擎。也可以直接使用LIBNAME语句通过SAS/ACCESS ACCESS引擎来访问Microsoft Access数据库文件。
DATATABLE=指定输入DBMS表名。数据源可以通过DATAFILE或DATATABLE指定。
DBMS=指定要导入的数据类型。SAS支持多种数据类型,例如CSV、TAB、ACCESS、XLSX、XLS、EXCEL、JMP、DTA、SPASS等。其中CSV、TAB表示要导入的数据文件分别由逗号和tab符号分隔、ACCESS表示使用LIBNAME语句的Miscrosoft Access 表、XLSX表示Micorsoft Excel 2007或2010的工作薄,等等。可参考SAS帮助文档关于导入数据类型和各类型的详细信息。
OUT=指定输出的数据集名称。该语句后面还可以添加数据集选项。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
2025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-06-052025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-05-27CDA数据分析师证书考试体系(更新于2025年05月22日)
2025-05-26解码数据基因:从数字敏感度到逻辑思维 每当看到超市货架上商品的排列变化,你是否会联想到背后的销售数据波动?三年前在零售行 ...
2025-05-23在本文中,我们将探讨 AI 为何能够加速数据分析、如何在每个步骤中实现数据分析自动化以及使用哪些工具。 数据分析中的AI是什么 ...
2025-05-20当数据遇见人生:我的第一个分析项目 记得三年前接手第一个数据分析项目时,我面对Excel里密密麻麻的销售数据手足无措。那些跳动 ...
2025-05-20在数字化运营的时代,企业每天都在产生海量数据:用户点击行为、商品销售记录、广告投放反馈…… 这些数据就像散落的拼图,而相 ...
2025-05-19在当今数字化营销时代,小红书作为国内领先的社交电商平台,其销售数据蕴含着巨大的商业价值。通过对小红书销售数据的深入分析, ...
2025-05-16Excel作为最常用的数据分析工具,有没有什么工具可以帮助我们快速地使用excel表格,只要轻松几步甚至输入几项指令就能搞定呢? ...
2025-05-15数据,如同无形的燃料,驱动着现代社会的运转。从全球互联网用户每天产生的2.5亿TB数据,到制造业的传感器、金融交易 ...
2025-05-15大数据是什么_数据分析师培训 其实,现在的大数据指的并不仅仅是海量数据,更准确而言是对大数据分析的方法。传统的数 ...
2025-05-14CDA持证人简介: 万木,CDA L1持证人,某电商中厂BI工程师 ,5年数据经验1年BI内训师,高级数据分析师,拥有丰富的行业经验。 ...
2025-05-13CDA持证人简介: 王明月 ,CDA 数据分析师二级持证人,2年数据产品工作经验,管理学博士在读。 学习入口:https://edu.cda.cn/g ...
2025-05-12CDA持证人简介: 杨贞玺 ,CDA一级持证人,郑州大学情报学硕士研究生,某上市公司数据分析师。 学习入口:https://edu.cda.cn/g ...
2025-05-09CDA持证人简介 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度、美团、阿里等 ...
2025-05-07相信很多做数据分析的小伙伴,都接到过一些高阶的数据分析需求,实现的过程需要用到一些数据获取,数据清洗转换,建模方法等,这 ...
2025-05-06以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/g ...
2025-04-30CDA持证人简介: 邱立峰 CDA 数据分析师二级持证人,数字化转型专家,数据治理专家,高级数据分析师,拥有丰富的行业经验。 ...
2025-04-29CDA持证人简介: 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度,美团,阿里等 ...
2025-04-28CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-27