tensorflow_datasets 如何load本地的数据集？-CDA数据分析师官网

热线电话：13121318867

首页大数据时代tensorflow_datasets 如何load本地的数据集？

tensorflow_datasets 如何load本地的数据集？

2025-03-26

TensorFlow Datasets（TFDS）是一个用于下载、管理和预处理机器学习数据集的库。它提供了易于使用的API，允许用户从现有集合中选择并下载各种数据集。然而，在一些情况下，用户可能需要使用本地数据集进行模型训练和测试。在本文中，我们将介绍如何使用TFDS加载本地数据集。

为了加载本地数据集，我们需要做以下几个步骤：

1.准备数据集 2.创建TFDS数据集描述文件 3.使用描述文件加载数据集

准备数据集

首先，我们需要准备我们要使用的数据集。这通常涉及到收集、清洗和组织数据，以便可以轻松地访问数据。在本例中，我们将使用一个简单的示例数据集，其中包含数字图像和相应的标签。

该数据集的目录结构类似于以下内容：

data/
    0/
        image1.png
        image2.png
        ...
    1/
        image1.png
        image2.png
        ...
    ...

在上面的目录结构中，每个数字目录代表一个唯一的标签，并包含与该标签相关联的所有图像。

创建TFDS数据集描述文件

接下来，我们需要创建一个TFDS数据集描述文件。该文件告诉TFDS如何读取和使用我们的本地数据集。描述文件通常是一个Python模块，其中包含有关数据集的元数据和函数，该函数将数据集加载到内存中。

在描述文件中，我们需要定义以下元数据：

1.名称：数据集的名称。 2.版本：数据集的版本号。 3.描述：数据集的简短描述。 4.特征：数据集的特征（例如，输入和输出的形状、数据类型等）。 5.拆分：数据集应该如何划分以进行训练、验证和测试。 6.下载URL（可选）：如果数据集没有被打包成一个文件，请提供一个URL以下载数据集。

以下是一个简单的描述文件示例：

import tensorflow_datasets as tfds import os # Define the metadata for the dataset _DESCRIPTION = 'A dataset containing images of digits.' _VERSION = tfds.core.Version('1.0.0')
_NAME = 'my_dataset' def my_dataset(split): # Define the path to the data directory data_dir = os.path.join(os.getcwd(), 'data') # Define the classes classes = ['0', '1', '2', '3', '4', '5', '6', '7', '8', '9'] # Load the data dataset_builder = tfds.builder(_NAME)
    dataset_builder.data_dir = data_dir
    dataset_builder.add_images(
        os.path.join(data_dir, '*/*'), 
        labels=classes,
    ) return dataset_builder.as_dataset(split=split)

在上面的代码中，我们定义了一个名为my_dataset的函数，该函数将数据集加载到内存中。我们还定义了元数据，包括数据集的名称、版本和描述，以及数据集的特征和拆分方式。

最后，我们使用tfds.builder()函数创建了一个dataset_builder对象，并使用add_images()方法将图像添加到数据集中。请注意，此处我们使用了data_dir变量来指定数据集的路径。如果您的数据集存在其他位置，则需要更改此变量的值以反映正确的路径。

使用描述文件加载数据集

使用上述描述文件，我们可以通过调用tfds.load()函数来加载本地数据集。这个函数需要传递三个参数：数据集名称、数据集拆分方式和描述文件的路径或模块。

以下是一个简单的例子：

import tensorflow_datasets as tfds # Load the data my_dataset = tfds.load(
    name='my_dataset',
    split='train',
    data_dir='./data',
    download=False,
    with_info=True,
) # Print

在上面的代码中，我们使用tfds.load()函数来加载名为my_dataset的数据集，使用了train拆分并指定了数据集路径。此外，我们将with_info参数设置为True以获取有关数据集的元信息。

一旦数据集被加载到内存中，我们可以像其他TFDS数据集一样使用它进行训练或测试。

总结

在本文中，我们介绍了如何使用TFDS加载本地数据集。首先，我们准备了数据集，并创建了一个TFDS数据集描述文件。然后，我们使用tfds.load()函数将数据集加载到内存中，并使用它来训练或测试模型。虽然这种方法可能需要更多的手动操作，但它允许用户使用自己的数据集进行机器学习，从而获得更好的控制和灵活性。

相信读完上文，你对算法已经有了全面认识。若想进一步探索机器学习的前沿知识，强烈推荐机器学习之半监督学习课程。

学习入口：https://edu.cda.cn/goods/show/3826?targetId=6730&preview=0
涵盖核心算法，结合多领域实战案例，还会持续更新，无论是新手入门还是高手进阶都很合适。赶紧点击链接开启学习吧！

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

机器学习特征数据类型监督学习半监督学习半监督

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇如果一个神经网络的总loss＝loss1＋loss2，那么这个网络是如何反向传递更新loss1的呢?

下一篇神经网络损失函数由多部分组成怎么设置权重？

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

tensorflow_datasets 如何load本地的数据集？

准备数据集

创建TFDS数据集描述文件

使用描述文件加载数据集

总结

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

CDA一级知识点汇总手册：第1章数据分析思维 ...

【CDA干货】统计模型的分类与应用场景全解析：从理 ...

【CDA干货】SELECT * 与指定个别字段查询效率深度分 ...

指标体系：CDA数据分析师的核心能力载体，用体系化 ...

【CDA干货】Power BI函数大全：分类、实操与实战全 ...

【CDA干货】次日留存率计算公式：原理、实操与应用 ...

指标的基本概念：CDA数据分析师的实操根基与洞察抓 ...

【CDA干货】随机森林特征重要性：原理、实操与应用 ...

【CDA干货】MySQL按日期分组：保证每天都有数据，无 ...

描述性统计：CDA数据分析师的入门必修课，让数据特 ...

【马年宠粉｜集赞0元领】转发CDA真题海报，水杯/颈 ...

【CDA干货】Anaconda下载库慢？3种实操方法，彻底解 ...

【CDA干货】Tableau两表未连接部分显示0而非Null： ...

统计基本概念：CDA数据分析师的实操根基与价值落地 ...

【CDA干货】一文读懂如何规避数据滥用风险：全流程 ...

【CDA干货】小样本配对数据：Wilcoxon检验与配对样 ...

透视分析方法：CDA数据分析师的核心实操工具与价值 ...

【CDA干货】一文搞定SQL字段varchar转double：语法 ...

【CDA干货】一文搞定数据透视表两列相互计算：从基 ...

表结构数据的获取、加工与使用：CDA数据分析师的核 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载

tensorflow_datasets 如何load本地的数据集？

准备数据集

创建TFDS数据集描述文件

使用描述文件加载数据集

总结

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

CDA一级知识点汇总手册：第1章 数据分析思维 ...

【CDA干货】统计模型的分类与应用场景全解析：从理 ...

【CDA干货】SELECT * 与指定个别字段查询效率深度分 ...

指标体系：CDA数据分析师的核心能力载体，用体系化 ...

【CDA干货】Power BI函数大全：分类、实操与实战全 ...

【CDA干货】次日留存率计算公式：原理、实操与应用 ...

指标的基本概念：CDA数据分析师的实操根基与洞察抓 ...

【CDA干货】随机森林特征重要性：原理、实操与应用 ...

【CDA干货】MySQL按日期分组：保证每天都有数据，无 ...

描述性统计：CDA数据分析师的入门必修课，让数据特 ...

【马年宠粉｜集赞0元领】转发CDA真题海报，水杯/颈 ...

【CDA干货】Anaconda下载库慢？3种实操方法，彻底解 ...

【CDA干货】Tableau两表未连接部分显示0而非Null： ...

统计基本概念：CDA数据分析师的实操根基与价值落地 ...

【CDA干货】一文读懂如何规避数据滥用风险：全流程 ...

【CDA干货】小样本配对数据：Wilcoxon检验与配对样 ...

透视分析方法：CDA数据分析师的核心实操工具与价值 ...

【CDA干货】一文搞定SQL字段varchar转double：语法 ...

【CDA干货】一文搞定数据透视表两列相互计算：从基 ...

表结构数据的获取、加工与使用：CDA数据分析师的核 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载

CDA一级知识点汇总手册：第1章数据分析思维 ...