新一代测序技术的文库制备方法研究进展

李琳 钱四化 吕天琦 王宇辉 郑建萍

引用本文: 李琳, 钱四化, 吕天琦, 王宇辉, 郑建萍. 新一代测序技术的文库制备方法研究进展[J]. 应用化学, 2021, 38(1): 11-23. doi: 10.19894/j.issn.1000-0518.200158 shu
Citation:  Lin LI, Si-Hua QIAN, Tian-Qi LYU, Yu-Hui WANG, Jian-Ping ZHENG. Recent Progress of Library Construction for Next-generation Sequencing[J]. Chinese Journal of Applied Chemistry, 2021, 38(1): 11-23. doi: 10.19894/j.issn.1000-0518.200158 shu

新一代测序技术的文库制备方法研究进展

    通讯作者: 王宇辉, E-mail: wangyuhui@nimte.ac.cn; 郑建萍, E-mail: zhengjianping@nimte.ac.cn
  • 基金项目:

    浙江省自然科学基金 LY20B050003

    宁波市3315创新团队 2019A-14-C

    宁波市科技重大专项 2016C50009

摘要: 具有高通量优势的新一代测序技术(Next Generation Sequencing,NGS)是基因测序领域的一场技术革命,为生物医学领域向纵深发展提供了越发全面的解决方案。文库制备作为基因测序的上游技术,其高质量与低成本的制备技术是测序的关键。随着各大测序平台的兴起,NGS的文库制备技术方案也呈现多样化发展,但是各具优缺点。本文在已有研究基础上,综述了新一代测序的最新文库制备方法,以及单细胞测序文库制备的全流程最新进展。我们希望本综述能为研究人员在文库制备方案的选择,新的NGS文库制备技术尤其是国内文库制备试剂盒的开发提供指导。

English

  • 20世纪80年代,基于DNA测序技术,全球研究者通力合作启动“人类基因组计划”,测定了人类基因组DNA的30亿个碱基对的序列,成功绘制了人类基因组图谱[1-2]。这项工作为解码生命、了解生命起源、认识疾病发生机制和疾病治疗提供了科学依据。同时,“人类基因计划”的思想和技术也可用于研究其他生物,进而发展形成了基因组学。由此可见,基因测序技术是分子生物学最重要的研究工具之一,极大地推动了生物医学、药学和农学等相关领域的飞速发展。

    目前,测序技术分为第一代测序技术和新一代测序技术,其中新一代测序技术包括以高通量闻名的第二代测序技术和具有超长读长优势的第三代测序技术[3]。测序前,实验对象中提取的核酸样品必须转换成标准样本,这种转换过程即为文库制备,转换后能直接用于测序的样品即为文库。文库的质量直接决定测序的准确性。因而,本文在已有研究的基础上,综述第二代测序和第三代测序文库制备方法,以及单细胞测序文库制备新方法。我们希望能够为研究人员在文库制备策略的选择以及新的文库制备技术尤其是国内起步较晚的文库制备试剂的开发提供指导。

    桑格测序技术[4]是测序的金标准,但是存在通量低、操作复杂和成本高等问题。为了克服桑格测序技术中存在的问题,基于焦磷酸测序、边合成边测序和连接法测序等原理,科学家们开发了高通量、低成本以及可自动化测序的二代测序技术[5]。二代测序技术可以在短时间内以较低单位成本实现数百万个DNA小片段的并行测序[6-9],是检测DNA和RNA序列的有力工具[10-12]。近年来,二代测序技术已经广泛应用于从头测序、靶向测序、单细胞测序、甲基化测序、免疫沉淀测序以及RNA免疫沉淀测序[13]。根据测序对象的不同,二代测序的文库制备方法分为基因组和转录组测序两类方法。

    基因组是生物体所有遗传物质的总和,具有一致性、稳定性和连续性,研究基因组对理解生命演变具有重要意义。基因组学研究分为结构基因组学和功能基因组学,二代测序技术是研究基因组结构的重要工具。因此,本文针对应用二代测序技术探究基因组结构的过程中所涉及的文库制备方法进行综述。根据样品打断方式的不同,基因组测序的文库制备方法可分为:物理性机械打碎和酶消化切割。

    1.1.1   基于机械打碎的文库制备方法

    机械打碎是使用物理的方法将DNA分子打碎成DNA小片段,包括超声波法、喷雾法和水动力剪切法[14]。基于超声波法研发的超声波破碎仪,是常用的DNA打碎设备。以PCR free文库试剂盒为例,如图 1所示,gDNA样品文库制备过程包括片段化、末端修复、脱氧腺苷(deoxyadenosine,dA)加尾以及连接接头步骤。

    图 1

    图 1.  Truseq PCR free试剂盒(Illumina)文库制备流程[8]
    Figure 1.  Library preparation workflow for Truseq PCR free library preparation kit (Illumina)[8]
    1.1.1.1   小片段DNA的末端修复及dA加尾

    机械法打碎的DNA片段末端可能带有5′-凸出和3′-凸出,且其5′末端和3′末端不一定存在磷酸基团或羟基基团。为了将测序接头连接在DNA片段两端,必须将DNA的凸出末端转化成平末端且DNA的5′末端修饰磷酸基团,此过程即为末端修复。T4 DNA聚合酶或DNA聚合酶I(Klenow)大片段以及T4多聚核苷酸激酶的酶活性可以实现末端修复。在脱氧核糖核苷三磷酸(Deoxy-ribonucleoside Triphosphate,dNTP)存在的条件下,T4 DNA聚合酶或DNA聚合酶I大片段的DNA聚合酶活性将5′端突出末端补平。待dNTP耗尽,T4 DNA聚合酶或DNA聚合酶I大片段的3′-5′DNA外切酶活性又会将3′端突出末端切平。随后T4多聚核苷酸激酶的正向反应活性,在腺苷三磷酸(Adenosine Triphosphate,ATP)存在条件下,实现DNA的5′平末端磷酸化。

    DNA末端修复后,基于Klenow片段的DNA聚合酶非模板依赖性DNA聚合酶活性且缺失3′-5′DNA外切核酸酶活性,DNA的3′端又选择性地添加并保存dA。然而,T4 DNA聚合酶或DNA聚合酶I大片段的3′-5′DNA外切核酸酶活性与Klenow片段的DNA聚合酶非模板依赖性DNA聚合酶活性不能兼容,因此DNA末端修复和DNA末端加dA必须分为两步进行,中间必须进行DNA纯化。Taq DNA聚合酶与Klenow片段具有相同的酶活性,但是Taq DNA聚合酶仅在高温72 ℃具有活性,而T4 DNA聚合酶和T4多聚核苷酸激酶仅在低温20 ℃具有活性,所以Taq DNA聚合酶不会干扰DNA修复过程。因此,Taq DNA聚合酶替代DNA聚合酶I大片段可以在同一试管中完成末端修复和dA加尾,简化文库制备流程,缩短文库制备时间[15]

    1.1.1.2   DNA片段连接接头

    采用Illumina测序平台进行测序时,文库制备试剂的接头通常包括与固定在流动槽中寡核苷酸序列互补的序列(P5/P7)以及簇生成引物序列(Read SP)。为了充分利用测序空间,节约成本,通过在接头中插入用于标记不同文库的标签序列(index),对不同样本进行同时测序。建库试剂盒中常用的接头结构包括平端双链接头、U型接头和Y型双链接头,但这些接头连接效率较低。冯延叶等[16]将开放式的Y型接头一条链延长,且增加的序列与较短链上的序列反向互补,在长链不互补位置形成单个泡型接头。泡型结构的张力能确保接头解链,同时有效地减少接头二聚体(接头自连)。NEBNext DNA文库制备试剂采用包含尿嘧啶的发夹结构接头,发夹结构可以减少接头二聚体,从而提高接头与DNA片段末端的连接效率。

    传统方法采用连接酶催化DNA片段与接头连接,此过程容易形成接头二聚体和片段二聚体(片段自连)。本课题组郑建萍研究员首次利用拓扑酶高效连接DNA的独特特点,创新性地开发出高效且高质量的DNA文库制备试剂“Topomize DNA Library Prep Kit”[17](如图 2)。该试剂利用DNA拓扑酶激活接头形成DNA拓扑接头(TOPO-adaptor),随后与末端修复的DNA片段直接连接,从而省略了DNA的5′端磷酸化以及dA加尾过程,可以处理10 ng到1μg的DNA样本,时间控制在90 min内。

    图 2

    图 2.  Topomize DNA文库制备试剂盒(MCLAB)文库制备流程[17]
    Figure 2.  Library Preparation Workflow for Topomize DNA Library Prep Kit (MCLAB)[17]
    1.1.2   基于酶消化切割的文库制备方法

    酶消化法主要利用核酸外切酶或Tn5转座酶切割双链DNA。NEBNext DNA双链片段化酶包括两种酶,一种酶随机地在双链DNA上产生切刻,另一种酶识别切刻处并对DNA链进行切割,产生双链DNA片段,建库流程与机械打断法类似。Tn5转座酶可以在DNA链上随机插入部分序列。基于这一特性,Nextera XT DNA文库制备试剂利用Tn5转座酶在溶液中打断DNA链,并在其末端连接接头(如图 3)[18-19]。所得DNA片段通过PCR扩增反应嵌入index以及P5/P7,即可得到待上机测序片段,待其完成洗脱与混合后即可上机测序,具体建库流程见图 3(a)。Nextera DNA Flex文库制备试剂则采用固定有转座酶的磁珠,在磁珠上同时介导DNA片段化与接头序列标记DNA片段,具体建库流程见图 3(b)。本课题组郑建萍研究员带领团队自主研发的“MCNext DNA Sample Prep Kit”也是基于转座酶原理,采用两个不同的转座酶二聚体切割DNA,实现了有方向地打碎DNA。总而言之,采用转座酶的建库方法简化了文库制备步骤,能明显缩短建库时间。

    图 3

    图 3.  Nextera文库制备流程[18-19]

    (a)Nextera XT DNA文库制备试剂盒(Illumina); (b)Nextera DNA Flex文库制备试剂盒(Illumina)

    Figure 3.  Library Preparation Workflow for Nextera[18-19]

    (a) Nextera XT DNA Library Pre Kit (Illumina); (b) Nextera DNA Flex Library Pre Kit (Illumina)

    当样品DNA长度超过测序仪测序范围时,可以采用物理性机械打碎及酶消化切割的方法进行DNA文库制备。而靶向测序仅对PCR扩增得到的特定区域序列进行测序,且扩增获得的DNA链长度通常不超过200 bp,因此不需要进行DNA片段化步骤。于个性化设计的多对引物,Ion AmpliSeq文库制备试剂盒可靶向扩增多个基因[20]

    转录组是指特定细胞或组织中全部转录产物,包括信使RNA(Messenger RNA,mRNA)、核糖体RNA(Ribosomal RNA,rRNA)、转运RNA(Transfer,tRNA)及其它的非编码RNA(noncoding RNAs,nc RNA)。转录组学通过研究特定条件下基因编码RNA和非编码RNA的表达水平及其调控规律,进一步推动基因功能和nc RNA调控机制的研究。目前,广泛应用于生物体转录组分析的方法包括基于杂交的基因芯片和基于NGS的RNA测序(RNA sequencing,RNA-seq),其中RNA-seq是最主要的检测手段[21-23]

    与DNA-seq直接对DNA进行测序分析不同,RNA-seq将RNA反转录成cDNA后,通过对cDNA进行测序来间接获得转录组信息,以NEBNext Ultra II RNA文库试剂盒为例,如图 4所示,mRNA样品文库制备过程包括目标RNA靶向富集,RNA片段化,反转录生成第1条cDNA链,合成第2条cDNA链,末端修复,dA加尾,连接接头以及PCR扩增步骤。同时,RNA的大小、序列、结构和数量均存在差异,因此不同类型的RNA文库制备方法各不相同。总之,转录组测序文库制备中主要需要考虑:1)如何从总RNA中捕获感兴趣的RNA类型;2)如何将RNA反转录成适当大小的cDNA片段;3)如何把接头连接到cDNA末端。

    图 4

    图 4.  NEBNext Ultra II RNA试剂盒(New England Biolabs)文库制备流程[18]
    Figure 4.  Library Preparation Workflow for NEBNext Ultra II RNA Library Prep Kit(New England Biolabs)[18]
    1.2.1   目标RNA富集方法

    RNA文库制备首先必须从RNA样品中捕获感兴趣的RNA类型,即RNA富集。RNA样品富集策略主要包括靶向捕获目标RNA和消除rRNA。

    1.2.1.1   靶向捕获聚腺苷酸化RNA

    真核生物中,聚腺苷酸化(Polyadenylation,Poly(A))RNA包括mRNA和长非编码RNA(>200 nt),仅占总RNA量的1%~5%[24]。研究人员根据聚胸腺嘧啶(oligo-dT)与Poly(A)杂交的特性,设计oligo-dT探针,实现了从总RNA中捕获到聚腺苷酸化RNA的目的。商业试剂通常利用oligo-dT修饰的磁珠或纤维素或者反转录过程中利用oligo-dT引物富集聚腺苷酸化RNA。

    1.2.1.2   消除rRNA实现目标RNA富集

    oligo-dT探针富集的方法通常不适用于原核生物mRNA(未聚腺苷酸化)、福尔马林固定或石蜡包埋的RNA样品。RNA中存在大量rRNA,约占RNA总量的82%[25]。因此,消除rRNA可以实现目标RNA样品的富集目的。消除rRNA的方法主要包括Ribo-Zero-seq法、RNA酶消化法以及根据rRNA特性开发的方法[26]

    Ribo-Zero-seq法采用生物素标记的探针捕获rRNA,随后链霉亲和素修饰的纳米磁珠吸附探针,即可分离出溶液中的rRNA。基于Ribo-Zero-seq法原理,Peter等[27]开发了一款软件,可用于设计捕获不同rRNA的探针序列。酶消化法利用单链DNA探针吸附rRNA,通过核糖核酸酶H(RNase H)和脱氧核糖核酸酶H(DNase I)分别降解rRNA和DNA探针。RNase H是一种核糖核酸内切酶,能够特异性水解杂交到DNA链上的RNA磷酸二酯键。DNase I是一种非特异性核酸内切酶,切割DNA产生具有3′羟基和5′磷酸末端的二核苷酸、三核苷酸和寡核苷酸产物。

    除了上述方法,还可以根据rRNA特性来消除rRNA。基于DNA复性动力学原理,C0T杂交法利用双链特异性核酸酶(Duplex-specific Nuclease,DSN)降解杂交过程中形成的双链cDNA[28]。高丰度RNA如rRNA形成双链cDNA的速度较快,所以降解得越多,而低丰度RNA如mRNA形成双链cDNA的速度较差,反而降解得越少。终止子核酸外切酶(5′-Monophosphate Dependent Terminator Exonuclease,TEX)法也可以实现选择性降解,TEX可降解带有5′单磷酸的RNA如rRNA和tRNA,而不会降解具有5′三磷酸、5′帽子结构(如大多数真核生物mRNA)或5′羟基的RNA[29]

    1.2.2   RNA/cDNA片段化方法

    富集的核酸样品经打碎后符合测序仪要求的长度,该过程即RNA片段化。RNA片段化的方法包括化学法和酶消化法。化学法采用碱性溶液或二价正电离子如Mg2+溶液打断RNA。反应温度升高可以减小碱性溶液或二价正电离子对RNA结构的影响,但化学法的缺点是对RNA打断具有一定选择性,并不是随机性的片段化。酶消化法利用核糖核酸酶打断RNA,但这种酶倾向于打断双链RNA[30]。此外,还可以将RNA反转录成cDNA,运用DNA片段化方法如超声波法和转座酶等打碎cDNA。

    1.2.3   RNA逆转录成cDNA方法

    逆转录聚合酶链式反应(Reverse Transcription-Polymerase Chain Reaction,RT-PCR)是RNA逆转录的主要手段。RT-PCR反应过程中,随机引物或Oligo-dT反转录引物在反转录酶的作用下以mRNA片段为模板合成互补的cDNA[20, 31]。此外,特异性反转录引物也能将目标RNA反转录成cDNA,并且能抑制rRNA反转录。NuGEN Ovation RNA-seq采用DNA/RNA复合反转录引物,其DNA部分能特异性杂交5′端的ploy(A)[32]

    RNA逆转录合成第1条cDNA链后,以cDNA为模板在DNA聚合酶作用下可扩增生成第2条cDNA链。但此方法无法确认cDNA双链中哪一条链与初始RNA链一致,导致原始RNA链的信息丢失。例如,一些反义RNA可能具有调节基因表达的作用[33]。定向建库的策略是通过一定手段识别第二条cDNA链[34]。NEBNext Ultra Directional RNA Library Preparation Kit for Illumina在第2条cDNA合成过程中使用dUTP替代了dTTP,通过USER酶特异性识别并消化含有尿嘧啶的链,从而抑制第2条cDNA链的合成[35]。基于SMARTScribe反转录酶的末端转移酶活性,SMARTer Ultra Low RNA Kit for Illumina在第1条cDNA链3′端添加一段非模板序列作为标记,从而区分第二条cDNA链[36]

    1.2.4   cDNA/RNA片段连接接头

    接头连接主要分为cDNA末端连接接头和RNA末端直接连接接头。cDNA末端连接接头方法与DNA建库方法一致。大部分商业化RNA-seq建库试剂盒如NEBNext Ultra RNA Library Prep Kit for Illumina和TruSeq RNA Sample Preparaticon均采用该策略完成建库。

    小RNA长度为20~35 nt,且一般5′端有磷酸基团和3′端有羟基基团,因此小RNA不需要特殊修饰即可与接头连接[37]。TruSeq Small RNA Lirary preparation Kit和NEBNext Small RNA Library Prep Kit利用T4 RNA连接酶2[38](截短型)催化5′端预腺苷酸化的DNA接头与小RNA的3′端连接,且DNA接头的3′端封闭,可以减少产生接头二聚体。溶液中添加5′端RNA接头、ATP以及T4 RNA连接酶后,T4 RNA连接酶可催化接头与小RNA的5′端连接。