【直播】我的基因组48:我可能测了一个假的全基因组

背景知识

男性只有一条X染色体和一条Y染色体,所以,理论上它们上面的SNV都应该是纯合的! X,Y除了同源区域外,其它地方差异很大。所以在女性样本里面即使是混入了极低量的男性样本,也很容易检测出来。同理,男性样本里面混入了女性样本,会给男性带来大量的X染色体的杂合SNV,也很容易检测出来。

我的测序结果

我对前面步骤call到的vcf格式的变异位点文件进行了X,Y染色体的简单统计,代码如下:

cat  jmzeng.freebayes.vcf |grep -w 'chrY'|grep -v "^#" |cut -f 10|cut -d":" -f 1 |sort |uniq -c
cat  jmzeng.freebayes.vcf |grep -w 'chrX'|grep -v "^#" |cut -f 10|cut -d":" -f 1 |sort |uniq -c

结果不是很妙!

  • 按照道理,不管是X,Y染色体,我都只有一条呀!
  • 但是为什么我call出来的snp位点, 居然~~~这么多杂合的????
  • 尽管测序会有错误,不那么精准,但是误差不应该那么大吧!

我测试了另外一个软件call出来的snp位点,也用同样的脚本进行统计!

zcat jmzeng.bcftools.vcf.gz |grep -w 'chrX'|grep -v "^#" |cut -f 10|cut -d":" -f 1 |sort |uniq -c
zcat jmzeng.bcftools.vcf.gz |grep -w 'chrY'|grep -v "^#" |cut -f 10|cut -d":" -f 1 |sort |uniq -c

结果也不容乐观!

起初我怀疑是我的snv结果没有进行过滤,所以造成了这么大的误差,那么就用测序深度来进行过滤吧!

很明显,纯合杂合的问题,并没有测序深度的偏差,我暂时还不能确定问题出在哪里,接下来4篇帖子都会围绕着这个问题展开!

关于NGS数据探索性别相关问题,更多阅读,请自行前往我的博客搜索!

原文发布于微信公众号 - 生信技能树(biotrainee)

原文发表时间:2017-01-20

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏阮一峰的网络日志

巧用Photoshop进行科学研究

Photoshop CS3 Extended是一个强大的软件。你可以用它,让你的报名照变得漂亮一些,然后上传到社交网站上;你也可以将一个名人的脑袋,移植到一张裸...

872
来自专栏玉树芝兰

如何用Python提取中文关键词?

本文一步步为你演示,如何用Python从中文文本中提取关键词。如果你需要对长文“观其大略”,不妨尝试一下。

982
来自专栏ATYUN订阅号

【实践操作】在iPhone上创建你的第一个机器学习模型

最近的苹果iPhone X发布会,你会看到iPhone X有一些很酷的功能,比如FaceID,Animoji和AR。我们需要弄明白建立这样一个系统需要什么。 当...

3376
来自专栏生信技能树

点点鼠标就能完成的NMR代谢组学实战

代谢组学几乎完全不涉及生物信息学最核心的序列比对,包括武汉中科院数物所波谱国重实验室等主流科研机构都是利用化学计量学和多元统计分析方法,对通过核磁共振(NMR)...

923
来自专栏机器人网

工业控制PID系统的十五个基本概念

PID调节系统PID功能由PID调节器或DCS系统内部功能程序模块实现,了解与PID调节相关的一些基本概念,有助于PID入门新手快速熟悉调节器应用,在自动调节系...

2656
来自专栏ATYUN订阅号

【干货】圣诞老人是否真实存在?训练Tensorflow的对象检测API能够告诉你答案

背景:最近我们看到了一篇文章,关于如何用于你自己的数据集,训练Tensorflow的对象检测API。这篇文章让我们对对象检测产生了关注,正巧圣诞节来临,我们打算...

2978
来自专栏iOSDevLog

Turi Create 机器学习模型实战:你也能轻松做出Prisma 风格的图片!

如果你一直有关注Apple去年所发布的消息,就会知道他们在机器学习上投入了大量心力。自他们去年在WWDC 2017上推出Core ML以来,已经有大量结合机器学...

962
来自专栏AI研习社

Github 项目推荐 | Facebook 密集人体姿态估计工具 DensePose

DensePose-RCNN 在 Detectron 框架下由 Caffe2 实现。

1062
来自专栏黑白安全

追寻特征码轻松免杀灰鸽子

随着杀毒软件病毒库的日益庞大,病毒被杀的的概率也越来越大。往往早上编写完成的病毒,到了下午就被列入病毒库。面对病毒被杀的尴尬,我们只能走一条路:免杀。

743
来自专栏生信技能树

GEO数据挖掘-第一期-胶质母细胞瘤(GBM)

lncRNAs PVT1 and HAR1A are prognosis biomarkers and indicate therapy outcome for...

924

扫码关注云+社区