中国教育热线  >  新闻  >  肠·道刘永鑫想学菌群生物信息分析21分钟带你入门

肠·道刘永鑫想学菌群生物信息分析21分钟带你入门

放大字体  缩小字体 2019-10-08 19:33:58  阅读:3487 来源:自媒体 作者:热心肠先生

原标题:肠·道 | 刘永鑫:想学菌群生物信息剖析?21分钟带你入门!

“肠·道”是由热心肠研讨院录制的类TED讲演节目,本文为第七期第九位讲演嘉宾刘永鑫博士的讲演内容,视频请观看:http:///talks/s/643abe7f702641f5ba9fd1cb4a6d4a3f

导言:一线研讨和科普专家无保留共享:菌群生物信息剖析的根本思想、作业环境、根本技能以及常用软件和东西。

————————————————————

讲演者介绍

刘永鑫 中国科学院遗传与发育生物学研讨所工程师;宏基因组大众号创始人;热心肠智库专家

刘永鑫博士,2008年结业于东北农业大学微生物专业,2014年于中科院遗传发育所获生物信息学博士,2016年遗传学博士后出站留所作业,任宏基因组学试验室工程师。现在首要研讨方向为宏基因组数据剖析和植物微生物组,QIIME 2项目参加人。现在在Science、Nature Biotechnology等杂志宣布论文十余篇。2017年7月兴办“宏基因组”大众号,现在共享宏基因组、扩增子原创文章400余篇,代表博文有《扩增子图表解读、剖析流程和核算绘图三部曲(21篇)》、《Nature总述:手把手教你剖析菌群数据(1.8万字)》、《QIIME2中文教程(18篇)》等,重视人数5.5万+,累计阅览800万+。

————————————————————

图文实录

首要感谢热心肠蓝总的约请,很快乐有这次时机共享一下我从事的作业范畴。

我叫刘永鑫,是来自中科院遗传发育所的一名工程师,也是咱们了解的《宏基因组》大众号的创始人。

我今日为咱们共享的主题是“微生物组剖析入门攻略”,期望协助咱们可以少走弯路,更好的探究咱们这个范畴。

我认为这张图是对我进入这个范畴15年的进程的一个很好总结。

我读了四年的微生物学的本科,之后又经过六年的尽力,取得了生物信息学的博士学位,然后做了两年的博士后,我认为我到了一个科研的很高的高度。

这个时分,经过了12年的学习,我才发现我取得了一张入场券,让我看到微生物组这么一个有出路的范畴,然后我就一头扎了进来。

其实提到生物信息,纷歧定说你是专业的人才需求学。其实,假如你作业中涉及到数据剖析,它是一个十分好的手法。

我就给咱们介绍一下学习生物信息的必要性,以及和它能给你带来哪些收益。

举一个简略的比方,咱们高中的时分都学过孟德尔的豌豆试验,也便是遗传学的初步。

他用紫花豌豆和白花豌豆进行杂交,然后经过F1代的自交,他在子孙发现了别离的现象。然后他就核算了不到1000株的子孙的子代,发现了有一个3:1的花样规则。

这是在传统的遗传学傍边,1000个以内的数量,咱们是可以很简略的核算出它其间规则的。

而到了人类基因组年代,咱们人类的基因组就有30亿个碱基,咱们把它印在书上的话,咱们终身都读不完这本书。

你觉得人类的基因组现已很巨大了吗?其实咱们人类的基因组上只需25000个左右编码基因。而咱们肠道仍是一个十分简略的微生物的体系,它有1000万个基因。

面临这么大的数据,咱们人类是无法用简略的数理核算来处理了。咱们有必要凭借每秒可以核算10亿次,乃至是可以到达万亿次的超级核算机,来协助咱们解析微生物组大数据。

咱们已然想用核算机的话,咱们要对核算机有必定的了解。关于核算机,首要只需三个硬件需求咱们把握它的根本参数。

近十年,CPU的核算速度现已进入了一个瓶颈,可是现在咱们是添加CPU的数量。服务器便是可以装更多的CPU,像超级核算机或许就会装载不计其数的CPU,来添加并行才干。

还有一个重要的目标是内存,咱们的一般电脑,或许是4Gb、8Gb,你用来剖析个微生物的多样性的数据,或许是够的。可是你假如要处理宏基因组数据的话,你或许需求有几百G乃至是几千G的内存。

最终一个重要的目标便是硬盘,一般是几百G;而服务器的话,或许一般有几TB。

特别阐明一点便是,比方你手里有10 Gb的数据,你假如是想做一个剖析的话,你至少要预留30倍以上的空间。尤其是在多人运用的服务器上,假如你把硬盘空间用光了的话,会让一切人的项目停掉,这是一个很风险的事。

什么是集群?集群便是把多台服务器放在机架上,并排放在一同,到时分咱们需求使命,可以进行并行运算。

其实一般的科研院所和大学都有自己的核算中心,你们直接请求一个帐号,就可以便利的运用。

咱们假如有了服务器可以处理大数据,咱们怎样去操作它?你就需求有一个随手的作业渠道,其实简略来说便是一个笔记本,它能满意咱们移动作业的需求。

笔记本的屏幕一般比较小,所以我就引荐咱们买一个扩展显示器,这样的话能极大进步咱们的作业功率,引荐买这种28寸以上的大显示器。

最终说一下,咱们学习编程究竟有什么含义。

举个比方,咱们在日子和作业中经常会遇到许多重复的劳作,比方处理各种报表、各种核算。假如你不会编程的话,你的作业时刻和你的作业量永远是成线性的。

假如你学会了程序,是什么样的呢?你可以手动的做几十条相应的作业,然后规划一个脚本,或许只需求写几十个字母或许是几行代码。

你把作业用这个脚本最终一处理,瞬间就可以把今后相似的作业都悉数完结。你可以在同类的作业中节省许多的时刻,这便是编程的含义。

了解了生物信息学的重要性,我就再介绍一下数据剖析的根本思想和根本功。由于你只需真实的可以读懂同行的东西,才是一个真实的科研的开端.

微生物组学研讨的首要是分为这四个进程。

一是微生物的取样,可以从DNA、RNA乃至更多的层面取到;然后经过高通量的测序设备得到宏组学数据;咱们得到数据,就要进行数据的处理,首要包含质控和定量两个部分;然后处理完的数据,咱们就可以进行核算剖析和可视化,从里边去发掘一些生物学规则。

我把数据剖析的根本思想总结分为三步走,咱们可以看这个图。

咱们首要拿到的数据,一般测的数据是这种大数据,根本都是ATGC碱基,它的数量级可以到达十的九次方。

大数据咱们人类是不可读的,咱们要把它转化成一种大表,便是一个定量和质控的进程。

那定量和质控一般便是转化成Count Data(计数数据),便是里边第二个大表。那Count Data一般是什么?基因表达矩阵或许你的物种组成表。但它的维度还很大,或许还有十的五次方、四次方,咱们人类也不可读。

然后你可以接着往下剖析,进行进一步的抽提。比方咱们常见的α多样性、β多样性,还有什么差异比较,其实都是把大表再抽提成一个小表。这样的话一般便是几十行、几百行,最多也不会超越千行,咱们人类就可读了。

其实咱们现在仍是不太乐意看数字和看文字的,由于它比较累。咱们喜爱把它转化成图,由于一图抵千字嘛,我就可以一眼就可以看到咱们发现的规则。假如你一眼没看到,你就多看几眼。

其实这个进程的根本思想首要就涉及到两个词,一个叫做降维,一个叫做可视化。

咱们都清楚了生物信息剖析的进程之后,咱们怎么完结呢?完结它就涉及到两门言语,一个便是Shell,一个是R。

咱们从大数据到大表的话只能用Shell,由于Shell它是十分高效的体系的底层言语。然后从大表到小表这个阶段,由于数据也不是满意大了,咱们可以用初级的Shell言语来完结,也可以用高档言语R来完结。

然后到可视化这方面,初级言语就搞不定了,就需求高档言语R来完结,R是一个比较优异的交互可视化的言语。由于R言语也是一个生物学家开发的一门言语,它比较合适于咱们生物学家来运用。

咱们Shell的话,最常用的便是Xshell。咱们可以看这界面,比较像《骇客帝国》里的那个场景,是吧?

你看到他人敲代码、探究数据,比较花哨、比较美丽,但其实这个进程也是需求十分强壮的根本功的。你需求记住许多的代码和指令,然后跟它进行交互。

有没有一个东西可以把这两门言语整合起来,都在一个东西里来完结,你就不必去打代码,也不必仿制和张贴,直接在一个东西完结从大数据到小数据的Shell剖析和R剖析呢?

其实是有的,近两年来开展的RStudio就满意了咱们这个需求。尤其是上一年(2018年)它最新更新的1.1版,就现已整合了Shell的剖析流程。

它的窗口有四个界面。榜首个是代码修改区,曾经咱们每个代码要不然就打上去,要不然就仿制张贴上去,现在它可以都保存,你也可以再选中、运转单行或多行的代码。

右边是环境变量区,这个变量区便利咱们实时探究内存中的数据进行调试和剖析,极大的进步了咱们数据Debug(调试)的功率,由于咱们数据剖析经常会碰到许多过错,咱们要进行调试。

左下角这个代码履行区,便是保留了之前的像Xshell和R中跟数据不断进行交互的进程。

右边那个数据的可视化区,咱们可以实时看到剖析的效果,咱们也可以把这个效果便利的保存成各种的格局和各种的巨细,直接用于宣布就够了。

你想要看懂他人的代码,仍是需求学一点根本功的,最起码要学习这两门言语里中常见的几十个单词究竟是什么意思。

假如你计划专门去从事数据剖析,或许你每年有许多的时刻要做数据剖析的话,可以引荐你体系的学习两本书。

榜首本是《鸟哥的私房菜》,可以体系介绍Linux体系的运用,并且还能介绍常见的Shell指令都是什么用处、什么功用。

假如你要进行R言语的核算剖析和可视化的话,可以读Ggplot2的作者出的这本书,叫《数据剖析与图片艺术》。

你也可以花几个小时,学习一下我和同行们编写的一些简明的教程。这或许更合适咱们生物学布景的人,由于它们涉及到的只需生物信息用到的一些常见的指令,并且还有一些咱们的阅历和技巧在里边。

咱们现在有了根本功了,可以看懂同行的代码,可以进行数据剖析,然后咱们就开端真实的数据剖析之旅。

微生物组的研讨办法首要就分为以上图示的这五个层面。

咱们首要取得的微生物组材料,便是Microbiome(微生物组)。咱们拿到了材料后,其实咱们最重要应该干的一件事,而大多数人都没有干的事是什么呢?便是把材料里边的成分进行别离培育,也便是Culturomics(培育组学)方面的作业。

由于其实咱们只需拿到了你研讨目标里的材料,咱们才干够在发现了差异之后,进行因果的验证,才干把相关的层面转移到真实的因果上,进行单要素的剖析。而现在大部分的研讨还处于描绘阶段。

然后,最常见的作业便是咱们把样本进行提DNA。

在DNA层面咱们有三个常用的技能,一个是扩增子测序技能,它是根据Marker(标志物)基因的PCR就可以拿到样本。然后结合高通量测序,它可以来研讨咱们研讨目标的微生物的多样性。

可是它的局限性,只能研讨微生物多样性,我想研讨更多的东西,怎样做呢?咱们就一般需求测宏基因组,便是把DNA全测了,用Shotgun(鸟枪)的办法。

你可以拿到物种组成,又可以取得它的功用组成,一起还能拿到新基因,这个就很全面了。

可是宏基因组的数据量比较大,第二个问题关于宏基因组、扩增子测序都是相同的,便是对研讨目标不分死活。就比方说土壤,许多都是遗址DNA,可是它也能被测出来。

假如想研讨活性物质部分,你就需求研讨它的RNA层面。就把咱们传统的转录组测mRNA的技能运用上来,叫宏转录组便是metatranome。

此外还有宏蛋白组和宏代谢组的层面,别的值得一提的是病毒组。

假如咱们真想全面研讨病毒组,你需求既把宏基因组测掉,也要把宏转录组测掉,才干拿到一切的DNA和RNA病毒。并且病毒在研讨目标中的含量也是比较低的,所以你的测序量也会要求比较高,剖析也会比较复杂。

咱们接下来就看一下一些测序仪。这是市面上用的干流的六款测序仪,我把它分成了三个年代。

一代测序便是Sanger测序。其实它是十分好的一个测序技能,它测的比较长,也比较准。

现在咱们首要用的二代测序,便是赛默飞的Ion Torrent、华大基因的BGISEQ和Illumina 的Seq系列。

Ion Torrent,它是测序周期比较短,比较合适临床一些比较着急的项目。华大基因的BGISEQ的准确度和读长比较折中,它在宏基因组上有较多的运用。

最终便是Illumina 的Seq系列,它的读长有长有短,所以在扩增子和宏基因组上都有特别多的运用。假如你要测扩增子,它一般要求读长比较长,所以只需Hiseq 2500和Novaseq 6000能测P250的形式,比较合适扩增子的研讨。

最终面两款是三代测序仪,一个是Pacbio,一个是Nanopore。它们的读长是有肯定的优势的,可以测到几十K乃至是几百K。

它们现在还遭到测序准确度比较低,以及相应的配套软件和算法还在开发中,各种不老练的困扰,但它们必定是明日之星。

咱们挑选了测序渠道之后,咱们就来介绍一下这个范畴重要的软件。

软件特别多,至少有几十款,上百款都有。可是我就挑了这三个代表性的人物,由于他们每个人都有一款近几年被引证近万次的软件。

榜首款便是密苏里大学的Patrick D. Schloss开发的,叫做Mothur。

在他之前,只需极少数的试验室可以把握扩增子的剖析技能。他之前开发过叫Son、Daughter,便是儿子、女儿的各种软件,都是为扩增子开发的。

他后来开发了Mothur,把这“一家人”装在一同了,是一个完好的流程,咱们可以自始至终的剖析扩增子数据。

然后在2010年的时分,Rob Knight教授也发布了一款整合了200多个软件的扩增子流程,叫做QIIME 。QIIME pipeline是真实的推进这个范畴走进了寻常百姓家,QIIME现在也引证了有1.5万次。

其实这个范畴有两个流程树立之后,咱们可以剖析了。但其实流程中的许多细节还不完善,还有待进一步开发。

这时我就介绍第三位大佬,Robert Edgar。他还不是一位教授,他也没有单位,他就坐在家里头搞科学研讨,自称独立研讨员,为这个范畴做出了巨大的奉献。

他在2010年的时分,发布了一款Usearch的软件,便是在序列比对上特别快速,较传统的Blast办法可以快10倍到1000倍。

这个软件在扩增子和宏基因组都有较多的运用。他后来在扩增子剖析的多个流程、进程中都进行极大的改进。

比方他创造UCHIME算法,也是去嵌合体的经典算法;然后他创造UPARSE算法,也是被作为OTU聚类和代表性序列挑选的金规范;并且他后来推出了UNOISE算法,对Illumina测序的过错去噪进行了一个很好的改进。

他现在的个人引证到达了6万屡次。

由于没有科研经费的支撑,他就把Usearch改编成了一个有200多个功用的微生物组的剖析流程,变成一个收费的软件。假如你要剖析大数据的话,就可以购买他这个64位的软件。

咱们现在也跟他协作,联合开发它的中文版,期望同行能更便利的运用。

由于它是收费的,假如你要没有满意的经费,没有买这个更好的软件,你可以用一个免费版。是由于有一个作者开发一个叫做Vsearch的软件,便是仿照Usearch的绝大部分功用,写了一个免费版,咱们可以运用。

从2016年起,Rob Knight又主张树立QIIME2,由于QIIME1的结构现已满意不了其时的需求了。

很有幸,他也召集了我参加到这个项目中。这个项目下个月(2019年8月)就会在Nature Biotechnology正式见刊,到时分咱们假如用它的话,就可以高雅地引证这个软件。

上面这些软件首要是把大数据转到大表,咱们的下流的核算和可视化,需求在R里来完结。其实你不必去编程,你只需运用他人现成的函数,直接可视化你的数据就可以了。

这儿引荐三个比较好用的微生物范畴剖析的包。

一个是vegan,它在多样性剖析和环境因子的相关上有许多十分老练的函数和体系;还有一个便是phyloseq,它把进化树的信息整合进来了,你可以做比较美丽的关于进化的讨论和一些美化;还有microbiome这个包,它在跟多组学相关还有跟表型的相关上,有一些自定义的函数可以运用。

其实这些软件剖析的效果或许也便是几十种,但咱们在文章里会发现有上百种乃至上千种不同的剖析,那它们是怎么完结的呢?

你假如看见图,你不知道怎么完结,怎样办呢?其实咱们可以看他的文章,他宣布的时分尽管没有宣布一个老练的软件,但他是把代码共享出来的,这些代码就放在Github上。

这儿边,我搜集收拾了一些可以共享代码的课题组,他们有许多文章都在他们的Github上面。

假如看到他们的文章有相关的剖析,你也不必自己去编,用这些现成代码去直接运转一下他的测验项目,然后再略微改改,运用到自己的课题上,可以节省许多的时刻。

我在两年前,经过了一年多的堆集,也记了许多的笔记,我就想假如把它们共享出来,应该对同行有许多协助,就兴办了一个《宏基因组》大众号。

我坚持了两年多,每天都没有停歇。这700多天里发布了400多篇原创的文章,一共书写了200多万字,其间包含扩增子的入门的图表解读、剖析流程和绘图的教程(三部曲)21篇。

还有QIIME2的官方中文文档有18篇,还有一些宏基因组的剖析流程,还有300多篇相关的总述文献解读。

现在我的大众号有五万多同行的重视,有800多万的阅览量。

其时其实我只想建一个500人的圈子。

效果开展两年,现在应该有了5万多人。我也才智到咱们国内这个范畴究竟有多大。

现在咱们大众号有30多位国内外的同行投稿,咱们现在也有一个安稳的团队和稿源。

我也欢迎广阔同行共享你的阅历、你的效果解读和技能办法。其实你把这个东西收拾出来、宣布出来之后,你从他人视点去写成一个教程的时分,你对自己的进步是特别大的。

这两年,我在这个大众号上也花费了许多时刻。每年或许要花费上千小时的时刻去收拾这些材料。

有人说,那你收拾这些材料,你还有时刻去做科研吗?其实这些都是用我的业余时刻完结的,我的首要使命仍是做科研。

作业三年,我也阅历了文章投稿,被拒,就连送审都不送审;然后文章投稿,被大修;然后文章投稿,接纳,这三个进程。

近一年多,我有七篇文章被接纳,包含一篇Science和两篇Nature Biotechnology,累计影响因子有130多分。其间两篇文章也被选为封面文章,也是杂志社对咱们剖析的一个认可。

咱们也在想,怎样样让没有编程根底的人用好这些R言语的图,让他们更好地展现自己的数据呢?

我也和我的同行们开发了一个网站,叫ImageGP,供给R言语在线制作。20多种常见的图,还有一些微生物常见的剖析,咱们都把它完结了在线化。

举个比方,你把数据张贴在这,点一下plot,就可以制作出相应的图表。

咱们将来进一步还会敞开它的源代码,你可以用咱们这个网站来写一个绘图的代码的结构,你在技能上可以进一步改。

最终我再总结一下我这个陈述的首要内容,就讲微生物组数据剖析,究竟咱们需求把握哪些根本思想、作业环境、根本技能以及东西挑选的阅历。

要入门微生物组数据剖析的话,咱们研讨的根本进程就首要是这四个——采样、测序、数据剖析和核算可视化。

咱们剖析的根本思想,其实便是三步走,咱们要从大数据降维到大表,从大表再降维到小表,从小表再可视化成图。

咱们怎么来完结呢?其实你只需把握一个软件,便是Rstudio这个软件。在这个环境里,可以办理shell的流程,可以办理R言语的核算和绘图。

并且项目是可重复的,你假如在做相似一个项目,你只需把数据一替换,点一下Run,你的相同的效果就会出来了,这是十分进步作业功率的一种作业方式。

在软件的挑选上,假如你是新人刚上手的话,就引荐运用Usearch。但它是收费的,假如经费答应的话,仍是主张可以购买。

假如你想运用免费版,可以运用Vsearch。你是Windows电脑、Mac电脑都可以用,它是跨渠道的。

假如你是有必定根底的话,你拓宽一些它没有的剖析的话,你可以学习QIIME2。QIIME2只能是在Linux体系上运用。也有人用Mothur,这个我倒不是很了解。

在可视化方面,引荐咱们必用的两个包,一个是vegan,一个是phyloseq。

咱们即便找不到的一些剖析办法,也可以去看文章,找那些文章中有顺便代码的文章。

假如你仍是看代码看得就头疼,你很厌烦代码,也不要紧,现在有许多在线的渠道,你可用在线渠道去剖析数据,然后去绘图。

但记住,在线渠道在简略的一起,也在捆住了你的四肢,也约束了你剖析的自由度。只需敞开代码才是无所不能的。

最终引荐咱们一个习气,便是咱们要养成共享和记载笔记的习气。引荐咱们用有道云笔记、为知笔记,记这种Markdown格局的电子笔记。

由于它是纯文本的,不管笔记有多多,咱们都能检索。另一个便是,你学会了,你自己会用了,你把你的笔记收拾成一篇教程,可以协助同行更节省时刻去学习。

把它共享在渠道上协助更多人,表面上是一个很浪费时刻的作业,但其实假如你收拾共享出来的话,对你自己是一个进步。你从一个学生的层面变成一个教师的层面,你的才干和各方面进步是显而易见的。

最终共享一张图,这个盲人摸象的故事,咱们应该都很了解。

其实我这15年做科研,最大的一个感悟便是,咱们做科研其实跟盲人摸象是彻底相同的。

早先在单基因研讨的年代,咱们克隆个基因,研讨个功用,说这个有什么功用,其实像盲人摸象相同,咱们只能以点带面了。

可是咱们现在在组学年代,咱们一次测序可以拿到肠道微生物的上千万的基因。可是咱们真的便是以天主视角全面的看大象吗?其实不是的,咱们仍然是盲人摸象的状况。

由于假如你测了多组学,比方你测了宏基因组,又有宏转录组,又有代谢组,你会发现不同组学之间,数据效果是纷歧样的,有的乃至是对立抵触的。

可是假如你见过这张图,你就知道每个技能仅仅一个看问题的视点,所以说它们是不抵触的。这样的话可以能更好地了解咱们的效果。

最终,祝咱们可以带着置疑的精力去科研,勇敢地发掘你的微生物组数据。让咱们更好地探究人类和微生物的联系,让咱们日子变得更夸姣。

最终谢谢在场的一切的教师和同学,也感谢热心肠的约请。

谢谢咱们!

责任修改: