数据工程师需要掌握的18个python库-CDA数据分析师官网

热线电话：13121318867

数据工程师需要掌握的18个python库

2020-07-24

python之所以这么火，是因为它的应用广泛，之所以应用广泛，是因为它包含有许多功能强大的库。对于不是专业数据分析人员的我们，平时在工作和生活中，主要是用python来获取信息，制作可视化报表，但是专业的数据工程师就需要使用一些更专业的python库。今天小编跟大家分享的这篇文章就是数据工程师需要掌握的18个python库，希望对大家有所帮助。

文章来源：早起Python

作者：刘早起早起

本文对python中在数据分析中需要掌握的库进行了整理，一起来看看吧！

数据获取

Selenium
Scrapy
Beautiful Soup

数据清洗

Spacy
NumPy
Pandas

数据可视化

Matplotlib
Pyecharts

数据建模

Scikit-learn
PyTorch
TensorFlow

模型检查

Lime

音频数据处理

Librosa

图像数据处理

OpenCV-Python
Scikit-image

数据通信

Pymongo

数据分析结果web部署

Flask
Django

数据获取

Selenium

Selenium是一个Web测试自动化框架，最初是为软件测试人员创建的。它提供了Web驱动程序API，供浏览器与用户操作交互并返回响应。它运行时会直接实例化出一个浏览器，完全模拟用户的操作，比如点击链接、输入表单，点击按钮提交等。所以我们使用它可以很方便的来登录网站和爬取数据。

可以使用 brew install selenium 的方式来快速安装selenium。

数据获取

Scrapy

Scrapy是Python开发的一个快速、高层次的屏幕抓取和web抓取框架，用于抓取web站点并从页面中提取结构化的数据。其吸引人的地方在于任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类，如BaseSpider、sitemap爬虫等，最新版本又提供了web2.0爬虫的支持。我们可以启用选择器（例如XPath，CSS）从网页中提取数据。

我们需要先安装Twisted，因为直接安装scrapy的话，安装会失败。所以使用 pip install Twisted-18.9.0-cp37-cp37m-win32.whl 来安装，然后使用pip install scrapy 来安装scrapy就可以了

数据获取

Beautiful Soup

Beautiful Soup也是一个从网站爬取数据的库，他提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱，通过解析文档为用户提供需要抓取的数据，因为简单，所以不需要多少代码就可以写出一个完整的应用程序。

可以使用 brew install beautifulsoup4 的方式来快速安装bf4。

数据清洗

Spacy

spacy可以用于进行分词，命名实体识别，词性识别等等，最核心的数据结构是Doc和Vocab。Doc对象包含Token的序列和Token的注释，Vocab对象是spaCy使用的词汇表，用于存储语言中共享的数据，spaCy通过集中存储字符串，单词向量和词汇属性等，避免存储数据的多个副本。

数据清洗

NumPy

NumPy(Numerical Python) 是 Python 语言的一个扩展程序库，支持大量的维度数组与矩阵运算，此外也针对数组运算提供大量的数学函数库。对数组执行数学运算和逻辑运算时，NumPy 是非常有用的。在用 Python 对 n维数组和矩阵进行运算时，NumPy 提供了大量有用特征。

数据清洗

Pandas

pandas 是基于NumPy 的一种工具，该工具是为了解决数据分析任务而创建的。Pandas 纳入了大量库和一些标准的数据模型，提供了高效地操作大型数据集所需的工具。pandas提供了大量能使我们快速便捷地处理数据的函数和方法。你很快就会发现，它是使Python成为强大而高效的数据分析环境的重要因素之一。

数据可视化

Matplotlib

matplotlib是受MATLAB的启发构建的。MATLAB是数据绘图领域广泛使用的语言和工具。MATLAB语言是面向过程的。利用函数的调用，MATLAB中可以轻松的利用一行命令来绘制，然后再用一系列的函数调整结果。它有一套完全仿照MATLAB的函数形式的绘图接口，在matplotlib.pyplot模块中。这套函数接口方便MATLAB用户过度到matplotlib。

数据可视化

Pyecharts

Echarts 是一个由百度开源的数据可视化工具，凭借着良好的交互性，精巧的图表设计，得到了众多开发者的认可，当 Python 遇到了 Echarts，就变成了 PyEcharts，目的就是为了与 Python 进行对接，方便在 Python 中直接使用数据生成图。

数据建模

Scikit-learn

scikit-learn包含众多顶级机器学习算法，主要有六大基本功能，分别是分类、回归、聚类、数据降维、模型选择和数据预处理。scikit-learn拥有非常活跃的用户社区，基本上其所有的功能都有非常详尽的文档供用户查阅。可以研读scikit-learn的用户指南及文档，对其算法的使用有更充分的了解。

数据建模

Pytorch

PyTorch是美国互联网巨头Facebook在深度学习框架Torch的基础上使用Python重写的一个全新的深度学习框架，它更像NumPy的替代产物，不仅继承了NumPy的众多优点，还支持GPUs计算，在计算效率上要比NumPy有更明显的优势；不仅如此，PyTorch还有许多高级功能，比如拥有丰富的API，可以快速完成深度神经网络模型的搭建和训练。

数据建模

Tensorflow

TensorFlow是一个采用数据流图（data flow graphs），用于数值计算、机器学习、神经网络的开源软件库。节点（Nodes）在图中表示数学操作，图中的线（edges）则表示在节点间相互联系的多维数据数组，即张量（tensor）。它灵活的架构让你可以在多种平台上展开计算，例如台式计算机中的一个或多个CPU（或GPU），服务器，移动设备等等。

模型检查

Lime