【Python | TensorBoard】用 PCA 可视化 MNIST 手写数字识别数据集

Principal component analysis (PCA) is a statistical procedure that uses an orthogonal transformation to convert a set of observations of possibly correlated variables into a set of values of linearly uncorrelated variables called principal components.

主成分分析(PCA)是一种常用的数据降维方法,可以将高维数据在二维或者三维可视化呈现。具体原理我在这里就不再详述,网上有很多教程都不错,可以参考 这里 或者 PCA 的维基百科页面

原理

我在这里简单的叙述下。假设我们的数据集是 m×nm×n 的,即 mm 个样本,每个样本 nn 个属性(特征),那么我们想要将这些数据呈现在图上,以便让我们对数据有个直观的了解或者其他用途。换句话说,需要 n<=3n<=3 ,一般来说为 2(平面) 或者 3(立体),需要一种变换来让新产生的属性可以代替原来的属性,可以通过下式来变换,

Y=XW

Y=XW 其中 YY 是变换后的新属性,XX 是原始属性,WW 是变换矩阵,而这个变换矩阵的列是 XTXX^TX 的特征向量。YY 中的新变量依据该变量对原始变量的解释能力(解释的总方差)从高到低排序,那么第一个就称为第一主成分,第二个就称为第二主成分,以此类推。假如我们需要降到 3 维以便于我们可视化,那就取前三个主成分作为原始属性的代表。即假如原来每个样本有 64 个属性,那么现在每个样本就有 3 个属性,就可以绘图了。

数据集

本文使用的数据集不是完整的 MNIST 数据集,而是 scikit-learn 自带的手写数字识别数据集。

该数据集的信息如下:

  • 类别数:10
  • 每类样本数:约为180
  • 总样本数:1797
  • 特征维数:64(8*8)

代码

from sklearn import datasets
from sklearn import decomposition
import matplotlib.pyplot as plt
import numpy as np
import seaborn
from mpl_toolkits.mplot3d import Axes3D
%matplotlib notebook

mnist = datasets.load_digits()
X = mnist.data
y = mnist.target
pca = decomposition.PCA(n_components=3)
new_X = pca.fit_transform(X)

fig = plt.figure()
ax = fig.gca(projection='3d')
ax.scatter(new_X[:, 0], new_X[:, 1], new_X[:, 2], c=y, cmap=plt.cm.spectral)
plt.show()

结果

结果如上图,实际上这个图是可以来回拖动和缩放的,所以建议在本地实际运行程序。图中每个颜色代表一个数字(0-9),可以大致看出每类数字分布在相近的区域。

此外,可以使用 pca.explained_variance_ratio_ 查看各个主成分解释的总方差:[ 0.14890594, 0.13618771, 0.11794594] ,这三个主成分解释了大约 40% 的原始信息,这个比例还是很低的,不过我们这里的目的是可视化而不是抽取信息。使用 pca.get_covariance() 得到上文提到的变换矩阵。

TensorBoard

12月7号 Google 在其开发者博客中宣布了一个开源的高维数据可视化工具:Open sourcing the Embedding Projector: a tool for visualizing high dimensional data,其中一个是在和 TensorFlow 一起使用的 TensorBoard ,另一个是独立版本,用户可以直接在网页上访问,地址在 这里(可能需要梯子)。如下图:

目前有 4 个数据集可以选择:Word2Vec All(71291×200),MNIST(10000×784),Word2Vec 10K(10000×200),Iris(150×4),可以选择是否用颜色标注、降维方法(T-SNE,PCA,自定义)、夜间模式、3D标签模式等。以MNIST为例,可以看到这三个主成分对原始信息的解释比例只有 25.9%

END

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏机器之心

教程 | 从零开始PyTorch项目:YOLO v3目标检测实现(下)

选自Medium 作者:Ayoosh Kathuria 机器之心编译 参与:Panda 前几日,机器之心编译介绍了《从零开始 PyTorch 项目:YOLO v...

2.8K6
来自专栏奇点大数据

Pytorch神器(3)

上次我们的连载讲到用最简便的方法,也就是pip方法安装Pytorch。大家都成功了吧。

1341
来自专栏小小挖掘机

windows下使用word2vec训练维基百科中文语料全攻略!(三)

训练一个聊天机器人的很重要的一步是词向量训练,无论是生成式聊天机器人还是检索式聊天机器人,都需要将文字转化为词向量,时下最火的词向量训练模型是word2vec,...

3735
来自专栏ATYUN订阅号

【技术】使用深度学习自动为图像添加字幕(PyTorch)

深度学习现在发展十分迅猛,每天都会出现多种应用程序。而想要了解深度学习的最好方法就是亲自动手。尽可能尝试自己做项目。这将帮助你更深入地了解它们,并帮助你成为更好...

1355
来自专栏数据派THU

三步教你搭建给黑白照片上色的神经网络 !(附代码)

来源:量子位 本文长度为7970字,建议阅读8分钟 本文为你介绍通过搭建神经网络,来给黑白照片上色的教程。 深度学习云平台FloydHub最近在官方博客上发了一...

5609
来自专栏云时之间

什么是自编码?

各位小伙伴们,大家好,今天让我们来如何用神经网络来处理非监督的学习,也就是AutoEncoder,自编码。 首先,我们听到自编码,一定会想到,AutoEncod...

36010
来自专栏王小雷

基于Python3 神经网络的实现

基于Python3 神经网络的实现(下载源码) 本次学习是Denny Britz(作者)的Python2神经网络项目修改为基于Python3实现的神经网络(本篇...

28410
来自专栏机器之心

听说你用JavaScript写代码?本文是你的机器学习指南

4006
来自专栏机器学习算法工程师

史上最详细的XGBoost实战(下)

作者:章华燕 编辑:田 旭 四 XGBoost 参数详解 在运行XGboost之前,必须设置三种类型成熟:general parameters,booster...

1.4K9
来自专栏目标检测和深度学习

教程 | 从零开始PyTorch项目:YOLO v3目标检测实现(下)

2102

扫码关注云+社区

领取腾讯云代金券