数十万数据Excel数据不好处理怎么办？-CDA数据分析师官网

热线电话：13121318867

首页大数据时代数十万数据Excel数据不好处理怎么办？

数十万数据Excel数据不好处理怎么办？

2020-07-16

文章转载自：微信公众号 Python的乐趣

作者：一粒米饭

比如像电商行业，每月有上百万条订单发货数据需要与仓库的数据进行核对计算，涉及到数据计算，筛选，匹配等步骤，用excel表超级卡，并且经常卡死。

这时如果你会Python，十几行代码就可以搞定。

这里需要两个Python库，一个是os库，一个是pandas库。

os库

os是Python内置库，不需要额外安装，只要用import导入就可以用了。os模块封装了常见的文件和目录操作，利用它可以轻松的对系统上的目录和文件进行各种操作，比如获取当前目录、列举当前文件夹中的所有文件和文件夹、判断文件或目录是否存在、删除文件等，具体见下图。

pandas库

pandas是第三方库，需要手动安装才能使用。pandas是专门用来做数据分析的强大类库，可以方便地从csv、Excel和其他文本文件以及数据库中读取数据，然后对数据进行加和、求平均值、求方差、计算最大值最小值等数据分析，支持生成Excel等格式文件或进行可视化操作，函数如下：

其中读Excel需要依赖xlrd库，写Excel依赖openpyxl，pandas、xlrd和openpyxl安装命令如下：

$ pip install xlrd openpyxl pandas

下面开始进行数据处理...

这里假设数据是按日期命名的Excel文件并且放在excel_data文件夹中,每个Excel文件包含用户ID、商品ID、商品属性列表、购买数量这几列信息。

文件夹中的所有文件如下，在linux下用ls命令列举excel_data下所有文件：

$ ls excel_data

结果：

20120702.xlsx 20131018.xlsx 20150203.xlsx 20170416.xlsx
20120703.xlsx 20131019.xlsx 20150204.xlsx 20170417.xlsx
20120704.xlsx 20131020.xlsx 20150205.xlsx 20170418.xlsx
20120705.xlsx 20131021.xlsx 20160101.xlsx 20170419.xlsx
...

实现的思路是利用os库获取所有的Excel文件，然后用pandas依次读取所有文件并合并到一起进行数据,计算出每个商品的总量以及销量前十的商品。

1.列举所有Excel文件

import os
files = os.listdir("excel_data")

2.用pandas读取所有数据并合并到一起

import pandas as pd
df_list = [pd.read_excel(os.path.join("excel_data", f)) for f in files]
data = pd.concat(df_list)

3.统计每个商品的数量

sum_of_product = data[["商品ID", "购买数量"]].groupby(["商品ID"]).sum()
sum_of_product

结果

购买数量
商品ID	
1662	1
201826	17
203319	67
203320	494
203322	332
...	...

122680025	21
122680026	8
122690023	16
122692024	48
122696024	5

获取销量前十的商品

sum_of_product.sort_values('购买数量', ascending=False).head(10)

结果：

商品ID	      购买数量
50018831	56632
50007016	8291
50011993	6351
50013636	6340
50003700	6325
211122	5823
50010558	5248
50016006	4948
50006602	4692
50002524	4123

完整代码如下：

import os
import pandas as pd

# 获取所有Excel文件并读取数据
files = os.listdir("excel_data")
df_list = [pd.read_excel(os.path.join("excel_data", f)) for f in files]
data = pd.concat(df_list)

# 统计每个商品的数量，并输出到Excel文件中
sum_of_product = data[["商品ID", "购买数量"]].groupby(["商品ID"]).sum()
sum_of_product.to_excel("各个商品数量统计.xlsx")

# 统计销量前十的商品
sum_of_product.sort_values('购买数量', ascending=False).head(10)

结果：

商品ID	购买数量
50018831	56632
50007016	8291
50011993	6351
50013636	6340
50003700	6325
211122	5823
50010558	5248
50016006	4948
50006602	4692
50002524	4123

教程就到这里，不足之处欢迎交流指正

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

pandas 数据分析

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇聊聊Python的一个彩蛋：Python之禅

下一篇谷歌、脸书、魔兽世界都在用！InnoDB是什么？有哪些关键特性？

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

数十万数据Excel数据不好处理怎么办？

os库

pandas库

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

CDA持证人专访：贺译册谈产品经理的市场洞察力与数 ...

【CDA干货】多维度对比评估：分析逻辑与可视化效果 ...

从“单元格”到“字段”：CDA数据分析师视角下的表 ...

【CDA干货】漏斗拆解：核心逻辑、实操方法与业务优 ...

【CDA干货】SQL数值转日期函数全解析：主流数据库语 ...

数据分析必修课：CDA数据分析师视角下的表格结构数 ...

CDA持证人专访：杨旭谈数据产品经理的工作实践与核 ...

【CDA干货】Python变量定义与类实例化：核心原理、 ...

从“单元格”到“洞察”：CDA数据分析师视角下的表 ...

【CDA干货】联合索引与覆盖索引：本质区别、实战场 ...

【CDA干货】维度表与事实表：数据仓库建模的核心逻 ...

从“指标堆砌”到“体系落地”：CDA数据分析师视角 ...

【CDA干货】SQL计算列值趋势的全场景实现方法与实战 ...

【CDA干货】用户决策链路全解析：从认知到复购的增 ...

CDA 三级《敏捷数据挖掘》教材知识体系全面解读 ...

【CDA干货】付费玩家流失的核心原因与游戏行业长效 ...

CDA持证人专访：蒋少寒谈传统制造业与互联网行业数 ...

学完商业数据分析，开启 CDA 量化策略：从业务思维 ...

CDA持证人专访：赵森淼谈药企数据分析从业体验与转 ...

【CDA干货】卡方检验与T检验结果的标准化解读方法及 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载