前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >GEO数据集详细介绍

GEO数据集详细介绍

作者头像
医学数据库百科
发布2020-06-04 12:24:17
2.9K0
发布2020-06-04 12:24:17
举报
文章被收录于专栏:医学数据库百科

1

数据集整体介绍

对于一个数据集而言,首先能看到的是提交这个数据的作者对于这个数据集的基本介绍。其中包括了数据集的题目、检测的物种、测序的类型和实验的整体设计。

我们主要是通过这一部分来选择我们想要的数据集,数据集是否符合我们的要求还是看我们想要做什么样子的分析。最基本的需要确定的就是:疾病分组、所用物种以及测序类型是否是我们想要的就行。

2

数据集贡献者信息

在这一部分我们能看到提交数据的作者的信息。

在这里面,我们主要还是看作者之前用这个数据集发表了什么文献,了解了人家发表了什么,我们才能去找其他方面的创新点。

3

数据集作用的平台

数据集所有的平台(Platforms),也就是我们指我们是用什么公司的什么检测技术来做的数据。例如,这个数据集就是用了Affymetrix公司的Human Genome U133 Plus 2.0芯片。

这里的平台还要出了告诉我们是用什么技术做的数据。另外的话,如果是芯片数据的话。还会包括一个注释文件。这里简单的说一下注释文件这个东西。

3.1 注释文件

注释文件:类似于密码解读器一样。我们在做芯片检测的时候,检测的一般都是一些核苷酸序列。这个就类似于一段看不懂的密码。对于我们而言,其实只是想知道基因的变化。通过注释文件,我们就知道一段段的密码对应的是什么基因了。那这段密码的变化也就代表这个基因的变化了。

拿这个表达谱芯片而言,我们点击GPL570的链接,就可以看到这个芯片的注释文件了。

4

样本信息

再往下,我们看到的就是样本信息了。每一个数据集都包括很多个样本。每个样本的基本信息,我们就可以在这个部分看到。

通过下图,可以看到这个数据集包括20个样本。其中10个是胃癌组织,另外十个则是正常对照组织。

所以对于GEO的数据而言,如果是GSE开头的就是数据集;如果是GSM开头的就是数据集里面的一个样本。

5

原始数据下载

在原始数据下载部分,GEO提供了多种下载方式。对于我们而言,如果想要下载原始数据的话,下载 矩阵文件(Series Matrix File(s)) 即可。如果一定要最原始的数据的话,则可以下载下面那个附加文件。

5.1 矩阵文件介绍

我们在下载了矩阵文件,解压之后可以用excel打开。

打开之后,主要也包括三种信息:

  • 数据集的信息: 以Series开头
  • 每一个样本的信息: 以sample开头。这里有时候会包括一些临床信息的。有的比如每个样本的TNM分期;预后信息都很良心的放到里面的。
  • 基因每一个ID在每个样本之间的表达信息。第一列是每一个探针的ID号,至于这个ID号对应的基因是什么。可以去注释文件当中找的

5.2 原始文件的用处

对于高通量数据而言,我们在得到这么多维度的数据,可以做点儿什么呢?

对于表达数据的分析,第一步要做的往往是找哪些在不同的疾病分组当中,存在差异的基因有哪些?这个俗称差异表达分析。如果我们只是来做差异表达分析的话,那其实也不用下载原始数据。在GEO里面有一个自带的工具就可以做。这个工具叫做GEO2R。这个我们明天在介绍。

PS: 那既然在线软件可以做了,为啥还要下载原始数据呢?原始数据其实也可以做其他的分析的嘛。我们矩阵当中一行就代表一个基因在各个样本的表达量,那例如:作者还提供了样本信息,比如说,提供了癌症患者的生存信息,那我们就可以来做每个基因是不是和生存有关系了。如果提供了TNM分期,那也就可以分析每个基因和TNM分析有没有关系了。至于如何分析嘛,最简单的SPSS应该还是可以做的吧。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2020-06-03,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 数据库百科 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 数据集贡献者信息
  • 数据集作用的平台
    • 3.1 注释文件
    • 样本信息
    • 原始数据下载
      • 5.1 矩阵文件介绍
        • 5.2 原始文件的用处
        领券
        问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档