【直播】我的基因组56:探索遗传起源

首先,节日快乐!在这个众人狂欢的节日里,我冷静了冷静,听说知识量储备差太多的人做不了朋友,于是默默的搬起了板凳专心学习。

昨天我们看了看千人基因组计划的公共数据的PCA分群。

【直播】我的基因组55:简单的PCA分析千人基因组的人群分布

今天,我用我自己的基因型数据跟千人基因组数据进行比较,差不多算是祖源分析吧。在前面的直播中,我们粗暴的利用了R里的因子把千人基因组计划里面的基因型字符串(0/0,0/1,1/0,1/1)直接赋值为1,2,3,4了,但是有更优的解决方案,可以将基因类型数据转换成连续值。将有参考字母的两份拷贝的样本设为0,一份参考拷贝和一份替代拷贝的设为0.5,有两份替代拷贝的设为1.0。另外,我们会丢弃千人基因组的人群面板中存在'None'的任何变量,因为它们并不含信息,如下图所示:

然后我再把自己的基因型数据根据上次随机挑选的千人基因组计划的1号染色体的1000个位点把对应的基因型挑选出来!【直播】我的基因组55:简单的PCA分析千人基因组的人群分布

这个脚本 跟从fasta序列里面挑子集有点类似:http://www.biotrainee.com/thread-696-1-1.html

这里的数据处理跟前面的差不多,我就不放代码了!

最后得到的图如下:

可以很明显的看到,用前两个主成分来分类的话,我是被划分到东亚人中(符合认知,我是标准的黄皮肤人)。

但是千人基因组计划里的东亚人也还是可以继续细分的,所以我就根据前两个主成分算了一下所有人与我的距离,挑了最近的5个人,看了一下。确实好乱!

越南人,日本人,汉人和傣族人,我也是醉了。

那么我把东亚人单独拿出来,跟我的基因型一起再画一个图吧!

好吧,这时候我算是明白了,原来是我挑位点的方式大错特错了,我选择的是allel frequency 接近于0.5的那些位点,就是在人群中基因型一半一半的,这样就造成,进化时间上接近的人种难以区分。

但是不管怎么说吧, PCA在人群分类的作用力大家应该有目共睹了,接下来的的重点是挑选合适的位点来做分析。

除了祖先,基因数据可以用于预测疾病风险,药物副作用,甚至构建脸部模型,不过那个需要有足够多的表型数据,而不仅仅只是一个人种的记录信息啦。(https://www.newscientist.com/article/mg22129613-600-genetic-mugshot-recreates-faces-from-nothing-but-dna/)

参考文档:

使用Python,分析23AndMe数据,获取遗传起源

http://stats.stackexchange.com/questions/72839/how-to-use-r-prcomp-results-for-prediction

http://www.cnblogs.com/panpansky/p/4604008.html

http://blog.csdn.net/qq_25040013/article/details/52578235

文:Jimmy

图文编辑:吃瓜群众

原文发布于微信公众号 - 生信技能树(biotrainee)

原文发表时间:2017-02-14

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏华章科技

全球顶尖公司的烧脑面试题,普通人一道都答不出来!

一些世界知名的企业在招聘时,可能会提供面试智力题,来筛选应聘者。那些越是大牌,越是有名的国内500强,乃至世界500强,给出的面试真是一般人都答不出来。

822
来自专栏量化投资与机器学习

【精选】破解波动性突破实盘系统

1、波动性突破实盘系统介绍 1.1 系统设计思想 波动性突破, 本身带有一定程度自适应市场的特点, 为趋势跟踪系统中的上品, 我们再加入时间清仓、 顺势下轿的...

2797
来自专栏大数据文摘

随手画个圆,你是怎么画的?我们分析了10万个圆,得到了这样的结论

1474
来自专栏WOLFRAM

一行代码论英雄—2018 Wolfram 语言“一行代码竞赛”结果

在今年刚结束的 Wolfram 技术大会上, 图像和机器学习是One-Liner竞赛的热门主题。One-Liner竞赛要求参赛者用Wolfram 语言实现一个酷...

911
来自专栏落影的专栏

《音视频开发进阶指南》—— 读书笔记

前言 之前偶然看到一个PPT,是一些视频特效的讲解。首页如下: ? PPT解析了模糊镜像、电击效果、灵魂出窍、动态晕影等视频处理效果,最后推荐作者自己写的书: ...

6275
来自专栏用户2442861的专栏

IT比试概率数学题

http://www.cnblogs.com/renyuan/archive/2012/09/24/2699654.html

1011
来自专栏奇点大数据

遗传算法(1)

与其说遗传算法是一个算法,不如说是一种处理问题的思想方式更为恰当,因为遗传算法整个体系说来说去都是在说对于一种问题处理的思路和原则,而不是一个具体的代码编写过...

3437
来自专栏生信宝典

pre-mRNA中存在的修饰及其对剪接影响

RNA修饰是很火的领域,前天推出的大神师弟Nature系列一作文章勤能补拙,过目不忘,提高m6A助力好记性?中科院王秀杰/杨运桂合作最新成果阐述了m6A在长期记...

1085
来自专栏生信技能树

FDA致病菌检测挑战赛结果发布,厦门极元科技总分排名第二

近期,美国食品药品监督局FDA通过在线平台precisionFDA (https://precision.fda.gov) 举办了CFSAN Pathogen ...

1062
来自专栏新智元

【白硕】穿越乔家大院寻找“毛毛虫”

看标题,您八成以为这篇文章讲的是山西的乔家大院的事儿了吧?不是。这是一篇烧脑的技术贴。如果您既不是NLP专业人士也不是NLP爱好者,就不用往下看了。 咱说的这...

3528

扫码关注云+社区