京公网安备 11010802034615号
经营许可证编号:京B2-20210330
来源:Python爬虫与数据挖掘
作者: Python进阶者
大家好,我是Python进阶者。
大家好,我是Python进阶者,上个礼拜的时候,我的Python交流群里有个名叫程序的大佬,头像是绿色菜狗的那位,在Python交流群里边的人应该都知道我说的是哪个大佬了,他提供了一份初始淘宝数据,数据乍看上去非常杂乱无章,但是经过小小明大佬的神化处理之后,一秒就变清晰了,真是太神了,然后就有了后续的数据分词处理和可视化等内容了,可能群里的人平时工作太忙,没有来得及看群消息,作为热心的群主,这里给大家整理成一篇文章,感兴趣的小伙伴,可以去实操一下,还是可以学到很多东西的。言归正传,一起来学习下今天的数据分析内容吧。
1、原始数据
在未经过处理之前的数据,长这样,大家可以看看,全部存储在一个单元格里边了,看得十分的让人难受。如下图所示。
按照常规来说,针对上面的数据,我们肯定会选择Excel里边的数据分列进行处理,然后依次的去根据空格、冒号去分割,这样可以得到一份较为清晰的数据表,诚然,这种方法确实可行,但是小小明大佬另辟蹊径,给大家用Python中的正则表达式来处理这个数据,处理方法如下。
2、原始数据预处理
小小明大佬直接使用正则表达式re模块和pandas模块进行处理,方法可谓巧妙,一击即中,数据处理代码如下。
import re import pandas as pd
result = [] with open(r"淘宝数据.csv") as f: for line in f:
row = dict(re.findall("([^:t]+):([^:t]+)", line)) if row:
result.append(row)
df = pd.DataFrame(result)
df.to_excel('new_data.xlsx', encoding='utf-8')
print(df)
之后我们可以看到效果图,如下图所示,这下是不是感觉到清爽了很多呢?
至此,我们对原始的数据进行了预处理,但是这还不够,我们今天主要的目标是对上面数据中的两列:配料表和保质期进行数据分析,接下来继续我们的数据处理和分析。
一开始的时候,程序大佬对配料表和保质期这两列的数据进行处理,但是来回得到的分词中总有一些特殊字符,如下图所示,我们可以看到这些字符里边有%、顿号、空格等内容。
我们都知道,这些是我们不需要的字符,当时我们在群里讨论的时候,我们就想到使用停用词去针对这些扰人的字符进行处理,代码如下。
# 创建停用词list def stopwordslist(filepath): stopwords = [line.strip() for line in open(filepath, 'r', encoding='gbk').readlines()] return stopwords # 对句子进行分词 def seg_sentence(sentence): sentence_seged = jieba.cut(sentence.strip())
stopwords = stopwordslist('stop_word.txt') # 这里加载停用词的路径 outstr = '' for word in sentence_seged: if word not in stopwords: if word != 't':
outstr += word
outstr += " " return outstr
其中stop_word.txt是小编之前在网上找到的一个存放一些常用特殊字符的txt文件,这个文件内容可以看看下图。
如上图所示,大概有1894个词左右,其实在做词频分析的时候,使用停用词去除特殊字符是经常会用到的,感兴趣的小伙伴可以收藏下,也许后面你会用到呢?代码和数据我统一放到文末了,记得去取就行。经过这一轮的数据处理之后,我们得到的数据就基本上没有太多杂乱的字符了,如下图所示。
得到这些数据之后,接下来我们需要对这些词语做一些词频统计,并且对其进行可视化。如果还有想法的话,也可以直接套用词云模板,生成漂亮的词云图,也未尝不可。
关于词频统计这块,小编这里介绍两种方法,两个代码都是可以用的,条条大路通罗马,一起来看看吧!
方法一:常规处理
这里使用的是常规处理的方法,代码亲测可用,只需要将代码中的1.txt进行替换成你自己的那个需要分词统计的文档即可,然后系统会自动给你生成一个Excel表格和一个TXT文件,内容都是一样的,只不过一个是表格,一个是文本。
#!/usr/bin/env python3 # -*- coding:utf-8 -*- import sys import jieba import jieba.analyse import xlwt # 写入Excel表的库 # reload(sys) # sys.setdefaultencoding('utf-8') if __name__ == "__main__":
wbk = xlwt.Workbook(encoding='ascii')
sheet = wbk.add_sheet("wordCount") # Excel单元格名字 word_lst = []
key_list = [] for line in open('1.txt', encoding='utf-8'): # 1.txt是需要分词统计的文档 item = line.strip('nr').split('t') # 制表格切分 # print item tags = jieba.analyse.extract_tags(item[0]) # jieba分词 for t in tags:
word_lst.append(t)
word_dict = {} with open("wordCount_all_lyrics.txt", 'w') as wf2: # 打开文件 for item in word_lst: if item not in word_dict: # 统计数量 word_dict[item] = 1 else:
word_dict[item] += 1 orderList = list(word_dict.values())
orderList.sort(reverse=True) # print orderList for i in range(len(orderList)): for key in word_dict: if word_dict[key] == orderList[i]:
wf2.write(key + ' ' + str(word_dict[key]) + 'n') # 写入txt文档 key_list.append(key)
word_dict[key] = 0 for i in range(len(key_list)):
sheet.write(i, 1, label=orderList[i])
sheet.write(i, 0, label=key_list[i])
wbk.save('wordCount_all_lyrics.xls') # 保存为 wordCount.xls文件
方法二:使用Pandas优化处理
这里使用Pandas方法进行处理,代码如下,小编也是亲测有效,小伙伴们也可以去尝试下。
def get_data(df): # 将食品添加剂这一列空的数据设置为无 # print(df) df.loc[:,'食品添加剂'] = df['食品添加剂'].fillna('无')
df.loc[:,'保质期'] = df['保质期'].fillna('无')
df.loc[:, '配料表'] = df['配料表'].fillna('无') # 分词并扩展提取 names = df.配料表.apply(jieba.lcut).explode() # 过滤长度小于等于1的词并去重 df1 = names[names.apply(len) > 1].value_counts() with pd.ExcelWriter("taobao.xlsx") as writer:
df1.to_excel(writer, sheet_name='配料')
df2 = pd.read_excel('taobao.xlsx', header=None, skiprows=1, names=['column1', 'column2'])
print(df2)
上面两个代码都是可以用的,最后得到的表格数据,如下图所示。
从上图我们可以看到配料表里边的配料占比详情,有了上述的数据之后,接下来我们就可以对其进行可视化操作了。关于可视化的内容,小编也给大家已经准备好了,等待下一篇原创文章,给大家输出,敬请期待。
大家好,我是Python进阶者。本文写到这里,基本上就告一段落了。本文基于一份杂乱的淘宝原始数据,利用正则表达式re库和Pandas数据处理对数据进行清洗,然后通过stop_word停用词对得到的文本进行分词处理,得到较为”干净“的数据,之后利用传统方法和Pandas优化处理两种方式对数据进行词频统计,针对得到的数据,下一步将利用Pyecharts库,进行多重可视化处理,包括但不限于饼图、柱状图、Table表、漏斗图、极化图等,通过一系列的改进和优化,一步步达到想要的效果,可以说是干货满满,实操性强,亲测有效。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动的精细化运营体系中,指标是业务判断、效果复盘、策略优化的核心依据。随着企业数据化程度提升,指标数量持续膨胀,但 ...
2026-07-23在用户运营与产品增长体系中,留存是衡量产品真实价值与用户粘性的核心标尺,也是决定用户生命周期价值、获客投产比的底层因素。 ...
2026-07-23 很多数据分析师精通Excel、SQL、Python等工具,但当被问到“面对一个具体的业务问题,该用什么分析方法”“描述性分析和诊断 ...
2026-07-23【核心关键词】埋点、产品、互联网、数据库、决策、数据分析、产品经理、商业模式、移动互联网、指标体系、运营模块、大数据平 ...
2026-07-22在高并发、大数据量的业务系统中,单表数据量达到千万级甚至亿级后,会出现查询性能骤降、索引维护成本飙升、存储扩容困难等问题 ...
2026-07-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-07-22在金融风控、企业运营、行业研究等数据分析场景中,大量数据以面板数据形态存在:例如多家分支机构连续多个季度的风险指标、多位 ...
2026-07-21 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-07-21一、活动介绍 2026暑期CDA备考冲刺季,为想利用假期拿证的你量身打造。考点胶囊内容搭配多重硬核福利,让你在旅行、实习、居家 ...
2026-07-21金融行业的运营风险贯穿业务全流程,涵盖交易欺诈、操作违规、流程漏洞、合规偏差、客户信用异常等多元场景,是银行、保险、证券 ...
2026-07-17财产保险作为金融行业的核心板块,涵盖车险、家财险、责任险、企财险等多元品类,是个人与企业抵御财产风险、经营风险的重要保障 ...
2026-07-17 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-07-17【核心关键词】模块、餐饮、客户、门店、企业、订单、供应链、多样化、产品、生产计划、数据分析、生产管理、物料管理、业务分 ...
2026-07-16在数字化分析时代,原始数据本身不具备业务价值,只有通过科学的统计学方法加工、拆解、验证与解读,才能挖掘数据背后的规律、差 ...
2026-07-16 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-07-16在描述性统计分析、数据预处理、异常值排查与多组数据分布对比工作中,箱线图(Box Plot)是应用最广泛的可视化与统计工具之一。 ...
2026-07-15在企业数据存储、业务统计与数据分析工作中,绝大多数业务数据都带有时间维度属性,例如订单创建时间、用户注册时间、支付完成时 ...
2026-07-15 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-07-15【核心关键词】产品、经营、客户、调研、销售额、宏观、会计行业、客户满意度、发展趋势、经营状况、数据分析、竞争对手、数据 ...
2026-07-14问卷调查是市场调研、用户研究、社会调研与产品分析的核心数据采集方式。问卷数据大多以分类数据为主,例如用户性别、年龄分层、 ...
2026-07-14