京公网安备 11010802034615号
经营许可证编号:京B2-20210330
SAS正则式之prxsubstr 以及prxnext
今天介绍的正则式中的prxsubstr函数以及prxnesth函数。
这两个函数需要配合call使用,生成start以及length两个变量以供后面的使用。先介绍基本的参数。
Call prxsubtr(pattern_id,string,strat,length)
pattern_id:跟prxmatch的用法一样,需要填入prxparse函数规定的字符形式,需要规定一个变量储存。譬如re=prxparse(‘\/d/d/d\’)即搜索任意三个数字。
String:填入的是你要搜索的目标,即你在哪里搜索上面的任意三个数字;
Start:这参数不用填,这个数字是运行之后会返回的变量,即在搜索目标中的起点位置
Length:跟start的意思一样,但是如果是已经知道位数的这个参数就没上面意义了,如果对于re=prxparse(‘\/d+\’)就有意义啦。
那么趁热打铁,来个例子;
datazipcode;
if_n_=1thenre=prxparse("/ \d{5}(-\d{4})?/");
retainre;
inputstring$80.;
lengthzip_code$10.;
callprxsubstr(re,string,start,length);
ifstart gt0thendo;
zip_code=substr(string,start+1,length+1);
output;
end;
datalines;
john smith 12 broad street flaemington, nj 08822
philip judson apt #1,building 7 777 route 730 kerrville, tx 78028
dr.roger alan 44 commonwealth ave. boston, ma 02116-7364
;
procprintdata=zipcodenoobs;
title"listing of data set zipcode";
run;
结果:
代码中寻找的prxparse("/ \d{5}(-\d{4})?/");在任意五个数字之前有一个空格,看清楚哈,\d{5}前面是有一个空格的,然后不知道后面是否接着“-\d{4}”的数字串。这里的substr(string,start+1,length+1)为什么要加1呢,因为有空格的存在,空格也占一个字符。估计这么一个简单的例子,也能知道prxsubstr的用法了。
接下来介绍的是prxnest这个函数。
Call prxnext(pattern_id,start,stop,position,length)
pattern_id:跟上面的那个prxsubstr一样填的是prxparse返回的搜索的目标;
start:就是你想在目标变量中那个位置开始搜索;
stop:就是你想在目标变量中的那个位置结束搜索。
Position:发现目标字符串的开始位置,所以这里的start跟之前的start是不一样的,要记住。
Length:这个就跟上面的prxsubstr的length一样,可以参照上面的。
那现在话不多说,直接上个例子!!
datafind_num;
if_n_=1thenret=prxparse("/\d+/");
retainret;
inputstring$40.;
start=1;
stop=length(string);
callprxnext (ret,start,stop,string,position,LENGTH);
ARRAYX[5];
DOI=1TO5WHILE(POSITION GT0);
X[I]=INPUT(SUBSTR(STRING,position,length),9.);
callprxnext(ret,start,stop,string,position,length);
end;
keepx1-x5 string;
datalines;
this 45 line 98 has 3 numbers
none here
12 34 78 90
;
procprintdata=find_numnoobs;
title"listing of data set find_num";
run;
结果是:
这个过程就是把string中全部的数字的部分提取出来,并赋予给x1-x5,这个就是涉及到你要生成多少个xi的问题,建议看下最长的那个观测能生成的数字个数,就设置i等于多少。这里眼神一下,譬如你先有份数据是什么“2016年12月5号,在麦当来消费56块钱”,你这时候需要提取这个时间以及金额就可以运用这个过程啦。数据分析师培训
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13在数据统计分析与数据清洗工作中,箱线图是一种简洁高效、客观性强的数据可视化图表,能够直观呈现数据集的分布特征、离散程度和 ...
2026-08-13 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-08-13在自动化办公、数据采集、定时统计、日志清理、系统监控等场景中,程序往往需要按照固定时间间隔重复执行指定任务,这种运行机制 ...
2026-08-12