深度学习实战 fashion-mnist数据集预处理技术分析-阿里云开发者社区

深度学习实战 fashion-mnist数据集预处理技术分析

2023-06-15 145

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 深度学习实战 fashion-mnist数据集预处理技术分析

keras的fashion-mnist数据集的源码为：

def load_data():

"""Loads the Fashion-MNIST dataset.

# Returns

Tuple of Numpy arrays: `(x_train, y_train), (x_test, y_test)`.

"""

dirname = os.path.join('datasets', 'fashion-mnist')

base = 'http://fashion-mnist.s3-website.eu-central-1.amazonaws.com/'

files = ['train-labels-idx1-ubyte.gz', 'train-images-idx3-ubyte.gz',

't10k-labels-idx1-ubyte.gz', 't10k-images-idx3-ubyte.gz']

paths = []

for fname in files:

paths.append(get_file(fname,

origin=base + fname,

cache_subdir=dirname))

with gzip.open(paths[0], 'rb') as lbpath:

y_train = np.frombuffer(lbpath.read(), np.uint8, offset=8)

with gzip.open(paths[1], 'rb') as imgpath:

x_train = np.frombuffer(imgpath.read(), np.uint8,

offset=16).reshape(len(y_train), 28, 28)

with gzip.open(paths[2], 'rb') as lbpath:

y_test = np.frombuffer(lbpath.read(), np.uint8, offset=8)

with gzip.open(paths[3], 'rb') as imgpath:

x_test = np.frombuffer(imgpath.read(), np.uint8,

offset=16).reshape(len(y_test), 28, 28)

return (x_train, y_train), (x_test, y_test)

fashion-mnist数据集以四个gzip格式的方式存储在远程服务器上，利用keras的get_file()下载到本地的keras缓存目录。

然后利用gzip的open()打开文件，利用numpy的frombuffer方法直接加载numpy的数组。如果是图像数据的话，需要进行reshape操作。

此处，为什么加载图片数据的时候需要offset=16，标签数据的时候需要offset=8？

fashion-mnist图像数据集的预处理方式和mnist有很大的不同，四个gz文件分别存放了x_train, y_train, x_test, y_test四个部分，然后分别读取四个文件利用np.frombuffer()方式加载。这种处理方式相对mnist来说复杂一些。为什么会这样处理？

深度学习实战 fashion-mnist数据集预处理技术分析

热门文章

最新文章

相关课程

相关电子书

相关实验场景

热门

活动广场

任务中心

开发者评测

高校计划

乘风者计划

训练营

阿里云MVP

话题

直播

下载

镜像站

技术资料

插件

深度学习实战 fashion-mnist数据集预处理技术分析

热门文章

最新文章

相关课程

相关电子书

相关实验场景