前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >深度学习实战 mnist数据集预处理技术分析

深度学习实战 mnist数据集预处理技术分析

作者头像
算法与编程之美
发布2019-07-17 17:55:56
1.3K0
发布2019-07-17 17:55:56
举报

欢迎点击「算法与编程之美」↑关注我们!

本文首发于微信公众号:"算法与编程之美",欢迎关注,及时了解更多此系列文章。

mnist数据集可以从https://s3.amazonaws.com/img-datasets/mnist.npz 这个网址进行下载,下载的文件是一种称为npz格式的文件,这是numpy库生成的特有的压缩包格式。

numpy可以将numpy.array格式的数组以文件的形式进行序列化存储到文件,然后以反序列化的方式读取文件并直接还原成之前的数组。

存储的文件主要有两种形式:*.npy和*.npz。

npy的基本用法

import numpy as npa = np.array([x for x in range(3)])np.save('test-a', a) #文件的扩展名默认为.npy,因此完整文件名是test-a.npyaa = np.load('test-a.npy')print(aa) # [0 1 2]

npz的基本用法

当需要将多个数组保存在一个文件的时候,则需要用到npz文件格式存储。

import numpy as npa = np.array([x for x in range(3)])b = np.array([y for y in range(3,6)])np.savez('test-ab.npz', a = a, b = b)data = np.load('test-ab.npz')print(data['a']) # [0 1 2]print(data['b']) # [3 4 5]

了解npy和npz的基本用法之后,接下来将介绍keras中mnist的数据集加载过程。

from tensorflow import kerasimport numpy as npfname = 'mnist.npz'path = keras.utils.get_file(fname=fname, origin='https://s3.amazonaws.com/img-datasets/mnist.npz')with np.load(path, allow_pickle=True) as f: x_train, y_train = f['x_train'], f['y_train'] x_test, y_test = f['x_test'], ['y_test'] print(x_train.shape) # (60000, 28, 28) print(x_test.shape) # (10000, 28, 28)

注:keras中下载的数据集默认的存放位置是:~/.keras/datasets/ 目录下。

可以看到mnist数据集的处理流程是将28x28x1的图片文件处理成四个numpy数组:x_train, y_train, x_test, y_test。然后将这四个数组写入到文件生成mnist.npz文件。

在使用数据集的时候,利用keras的get_file()先从指定的URL地址下载npz文件,然后加载得到两个tuple,下面是keras官方提供的mnist数据集load_data()方法:

def load_data(path='mnist.npz'): """Loads the MNIST dataset. # Arguments path: path where to cache the dataset locally (relative to ~/.keras/datasets). # Returns Tuple of Numpy arrays: `(x_train, y_train), (x_test, y_test)`. """ path = get_file(path, origin='https://s3.amazonaws.com/img-datasets/mnist.npz', file_hash='8a61469f7ea1b51cbae51d4f78837e45') with np.load(path, allow_pickle=True) as f: x_train, y_train = f['x_train'], f['y_train'] x_test, y_test = f['x_test'], f['y_test'] return (x_train, y_train), (x_test, y_test)

END

主 编 | 张祯悦

责 编 | chen

where2go 团队


微信号:算法与编程之美

温馨提示:点击页面右下角“写留言”发表评论,期待您的参与!期待您的转发!

本文参与 腾讯云自媒体分享计划,分享自微信公众号。
原始发表:2019-05-27,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 算法与编程之美 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
相关产品与服务
文件存储
文件存储(Cloud File Storage,CFS)为您提供安全可靠、可扩展的共享文件存储服务。文件存储可与腾讯云服务器、容器服务、批量计算等服务搭配使用,为多个计算节点提供容量和性能可弹性扩展的高性能共享存储。腾讯云文件存储的管理界面简单、易使用,可实现对现有应用的无缝集成;按实际用量付费,为您节约成本,简化 IT 运维工作。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档