针对PacBio单分子测序——第三代测序技术的测序原理和读长
 
 

DNA基因测序技术从上世纪70年代起,历经三代技术后,目前已发展成为一项相对成熟的生物产业。测序技术的应用也扩展到了生物、医学、制药、健康、农林、园艺、花卉、环保、法医等许多领域,并成为一项与我们衣食住行密切相关的高技术产业。据最新统计,2012年全球基因测序市场的产值已超过百亿,按最近几年增长速度,预计2017年市场产值将加倍。因此可以说,基因测序在我国生物科技领域具有非常重要的战略意义。
        “第三代测序技术”的研发已有近十年时间,商业化的第三代测序仪上市也有三年,目前,国内对Pacbio单分子测序研究也有了最新进展:

一,中科院药植所采用PacBio单分子测序揭示丹参叶绿体DNA修饰之间复杂的相互作用:编码及非编码RNA的表达

2014年6月10日,中科院药用植物研究所(IMPLAD)刘昶团队在《PLOS ONE》杂志上发表了利用PacBio测序技术揭示丹参(Salvia miltiorrhiza)叶绿体DNA修饰之间复杂相互作用的相关文章,该文章报道了丹参叶绿体中编码及非编码RNA的表达情况。这也是国内PacBio第三代测序用户在国际性杂志发表的第一篇文章。
        丹参是最广泛使用的药用植物之一。作为基于叶绿体基因工程手段开发使丹参活性成分过表达方法的第一步,该研究团队从基因组,转录组,和碱基修饰三方面对丹参叶绿体进行了分析。先从新鲜叶片中提取总基因组DNA和RNA,然后进行链特异性RNA测序和PacBio公司的单分子实时(Single-Molecule Real-Time, SMRT)测序分析。
       实验先是将RNA测序得到的reads mapping到基因组,使该研究小组确定了80个蛋白质编码基因的相对表达水平。此外,还明确了19个多顺反子转录单元和136个假定反义和基因间非编码RNA(ncRNA)基因。将蛋白编码基因的转录本(cRNA)丰度与重叠反义非编码RNA(asRNA)相比较表明,asRNA的存在与cRNA的丰度增加有关(P<0.05)。使用SMRT Portal软件预测到了2687个潜在的DNA修饰位点和2个潜在的DNA修饰基序。两个基序包括TATA盒样基序(CPGDMM1, ''TATANNNATNA''),以及一个未知的基序 (CPGDMM2, ''WNYANTGAW'')。
        研究采用二代和三代DNA测序技术并用,使在基因组层面研究非编码RNA和DNA修饰成为可能。然而,原来关于反义RNA和DNA修饰研究在实验上具有相当大的困难。首先,大多数asRNA转录本表达水平显著偏低,因而难以用经典技术如Northern Blot和原位杂交进行验证。第二,正义和反义转录本之间错综复杂的关系意味着实验扰动会不可避免地干扰其他转录本的表达。因此,通过knocking-in和knocking-out技术确定转录本的生物学功能是复杂的。第三,虽然SMRT技术已被证明能够检测到潜在的DNA修饰,但验证这些修饰仍然是个挑战性的任务。第四,叶绿体asRNA和DNA修饰的存在和功能的验证是更加困难的。
       综上所述,本研究所描述的一些发现从目前的技术上来讲是有巨大进步的。然而,本研究提出的数据已经证实了由asRNA和DNA修饰引起的基因表达调控的复杂性。

二,三代基因测序组装算法和软件研发获突破

“第三代测序技术”的研发已有近十年时间,商业化的第三代测序仪上市也有三年。但目前测序市场仍为二代测序技术所垄断(我国顶级科研机构和商业公司所拥有的三代测序仪可能仅有数十台)。三代测序技术产生的读段更长,测序成本更低,其取代二代技术是测序技术发展的必然趋势。然而由于三代测序技术错误率高,现有的组装软件多是对第二代测序数据组装软件的“修补”而并没有充分考虑到三代测序技术的数据特征。事实上,基因组装算法问题被广泛认为是计算生物学和生物信息学领域最复杂的计算难题之一,也是目前阻碍基因测序产业从二代技术升级到三代技术最大的技术障碍。
  最近,美国马里兰大学 Chengxi Ye, James A. Yorke, Aleksey Zimin 等与中国科学院昆明动物研究所遗传资源与进化国家重点实验室马占山研究员在这一领域的合作研发取得新突破。该研究团队在一篇题为DBG2OLC: Efficient Assembly of Large Genomes Using the Compressed Overlap Graph 的文章中引入了一种新的针对三代测序技术的基因组装算法,并开发出一款软件(DBG2OLC)。另外作者(Ye et al. 2011, 2012)于2011年发布的SparseAssembler曾经比当时主流的基因组装软件节省90%的内存空间,而其计算时间和组装质量却毫不逊色。著名的SOAPdenovo的升级版,也是目前最广泛应用的基因组装软件SOAPdenovo2即采用了SparseAssembler算法。
  多组测序数据的测试表明:与目前用于三代测序最优秀的一些基因组装软件(例如PacBio2CA, HGAP, ECTools)相比,DBG2OLC在计算时间和内存空间的消耗通常仅为其它算法的1/10。理论上,DBG2OLC 在时间和空间的使用上相对其它同类软件可减少达1000倍。例如组装关键步骤之一的“两两比对”计算,采用一组由 PacBio提供的人类基因组数据,DBG2OLC 使用一台普通PC仅用了6小时完成。而同样计算,Pacific Biosciences所报道的时间为 405000 CPU小时,而且是在Google的计算集群上完成。因此,DBG2OLC 算法基本解决了目前三代测序技术所面临的计算技术挑战,从而为推进基因测序技术的产业升级奠定了良好的技术基础。

三,PacBio RS II 测序系统原理

PacBio RS测序仪系统能够对单个DNA(脱氧核糖核酸)分子进行测序,而目前市场上
的主流测序仪只能对分子群体进行平均测序。单分子测序能对DNA中罕见的序列变异进行分析,也不需要在测序之前对DNA样本进行放大,因为放大过程可能引发错误,导致对某个DNA序列检测失败。其工作原理是用一种聚合酶将DNA的复制限制在一个微小的间隙中,给各种碱基加上荧光示踪标记,当碱基合成DNA链时,这些荧光标记就会发出不同颜色的闪光,根据闪光颜色就可识别出不同的碱基。

PacBio RS II 测序系统特点
1、测序读长长:平均测序读长能达到3,000至5,000碱基,最长的序列能达到20,000碱基;

2、准确率高:对基因组组装和基因组变异检测,可以最多达到99.999%的准确率;选用特殊测序模式,测序准确率可以在达到单个分子99%准确率的条件下,读长超过经典的Sanger测序法;

3、极度的敏感性:可以检测频率在0.1%的 minor variants;

4、直接检测广泛的碱基修饰:除了5-methylcytosine修饰以外, 还可以检测N6-methyladenine, N4-methylcytosine, DNA氧化损伤 以及其它碱基的修饰.

5、GC偏向性(GC bias)小:在极端高GC和极端低GC区域,可以轻松测定,从而保证序列的均匀覆盖度;

6、无PCR扩增偏向性:样本不需要进行PCR扩增,避免了覆盖度不均一和PCR artifacts.

第三代PacBio测序技术的测序原理和读长的更多相关文章

  1. 基因组所三代单分子测序PacBio完成技术升级—超长读长助力基因组学研究

    基因组所三代单分子测序PacBio完成技术升级—超长读长助力基因组学研究 2015-09-23 | 作者:所级中心基因组平台 张兵 [关闭] 近日,基因组所所级中心基因组平台三代单分子实时测序PacB ...

  2. 解读生命密码的基本手段 ——DNA测序技术的前世今生

    解读生命密码的基本手段 ——DNA测序技术的前世今生 任鲁风  于军 (中国科学院基因组科学及信息重点实验室,北京基因组研究所) DNA(脱氧核糖核酸)和RNA(核糖核酸)是生命体的两种最基本组成物质 ...

  3. ChIP-seq实战 | 染色质免疫共沉淀技术 | ATAC-seq | 染色质开放性测序技术

    参考:生信技能树 ChIP-Seq综述 一些简单的copy,纯属个人笔记. ChIP-seq的原理 用于在全基因组范围中研究DNA结合蛋白(相互反应).组蛋白修饰(表观遗传标记)和核小体的技术,研究这 ...

  4. DNA methylation|Transcription factors|PTM|Chromosome conformation|表观遗传学测序技术

    生物医疗大数据-DNA element functions and identification Genetic vs epigenetic GENETICS  遗传学 DNA Code: 64 tr ...

  5. 单细胞RNA测序技术之入门指南

    单细胞RNA测序技术之入门指南 [字体: 大 中 小 ] 时间:2018年09月12日 来源:生物通   编辑推荐: 在这个飞速发展的测序时代,DNA和RNA测序已经逐渐成为“实验室中的家常菜”.若要 ...

  6. 单细胞测序技术(single cell sequencing)

    单细胞测序技术(single cell sequencing) 2018-03-02 11:02   来源: 一呼百诺  点击次数:6587关键词:   前言 单细胞生物学最近几年是非常热门的研究方向 ...

  7. 单细胞转录组测序技术(scRNA-seq)及细胞分离技术分类汇总

    单细胞测序流程(http://learn.gencore.bio.nyu.edu) 在过去的十多年里,高通量测序技术被广泛应用于生物和医学的各种领域,极大促进了相关的研究和应用.其中转录组测序(RNA ...

  8. CSS3图片倒影技术实现及原理

    CSS3图片倒影技术实现及原理 目前为止我们已经探讨了很多CSS3中的新功能和新特征.除了上面这些,实际上还有很多CSS新属性并未包含进CSS3官方标准中,像谷歌浏览器或火狐浏览器等都会利用CSS的浏 ...

  9. 表达谱(DGE)测序与转录组测序的差别

    DGE-seq和普通的transcriptomic profiling相比较有什么不同,有什么特点? DGE就是用酶将mRNA切断,只使用靠近poly A的一小段RNA去测序. #1 由于不是测定mR ...

随机推荐

  1. 【转载】 迁移学习与fine-tuning有什么区别

    原文地址: https://www.cnblogs.com/fangpengchengbupter/p/8276204.html ----------------------------------- ...

  2. osg ifc数据渲染着色器

    //顶点着色器 static const char* vertShader = { "varying vec4 color;\n" "void main(void)\n& ...

  3. osg define shape(create box)

    #ifdef _WIN32 #include <Windows.h> #endif // _WIN32 #include <osgViewer/Viewer> #include ...

  4. 深入理解Java虚拟机 - 书评

    谈起<深入理解java虚拟机>这本书,让我印象深刻的就是换工作跳槽面试的时候,当时刚进入java开发这个行业的时候,平时只是做一些对数据库的增删改查等功能,当自己技术增长一些的时候,就开始 ...

  5. MySQL性能优化最佳实践20条

    今天,数据库的操作越来越成为整个应用的性能瓶颈了,这点对于Web应用尤其明显.关于数据库的性能,这并不只是DBA才需要担心的事,而这更是我们程序员需要去关注的事情.当我们去设计数据库表结构,对操作数据 ...

  6. curl 的用法指南

    简介 curl 是常用的命令行工具,用来请求 Web 服务器.它的名字就是客户端(client)的 URL 工具的意思. 它的功能非常强大,命令行参数多达几十种.如果熟练的话,完全可以取代 Postm ...

  7. iOS面试-assign与retain

    assign 对基础数据类型 (NSInteger,CGFloat)和C数据类型(int, float, double, char)等等.        此标记说明设置器直接进行赋值,这也是默认值.在 ...

  8. python的jenkins三方包

    jenkinsapi 比较重,实现不好 python-jenkins 比较轻,建议使用,可以进行二次开发和封装

  9. sql server 全角与半角字符转换

      /****** SQL转换全角/半角函数 开始******/CREATE FUNCTION ConvertWordAngle ( @str NVARCHAR(4000), --要转换的字符串 @f ...

  10. 配置Linux描述网络安全CIA模型之可用性案例

    在Linux中防御SYN型DOS攻击的方法比较常见的有: 1.增大队列SYN最大半链接数 2.利用SYN cookie技术   下面分别进行分析. 1.增大队列SYN最大半连接数 在LINUX中执行命 ...