第二章 · 2.2

2.2 新一代测序平台

Next-Generation Sequencing Platforms

本节摘要 本节讨论新一代测序的共性技术范式:随机片段化建库、克隆扩增与循环式边合成边检测,及其以读长换取 10⁵–10⁷ 并行度的工程逻辑;继而剖析 454 焦磷酸测序、Illumina 可逆终止子合成测序与 SOLiD 双碱基连接酶法的化学原理、读长与错误谱,比较三大平台的工程学权衡,说明配对末端配置的意义,回顾测序成本的雪崩式下降轨迹,并前瞻单分子与长读长测序。

上一节的结尾留下一个明确的矛盾:毛细管电泳版 Sanger 法把读长与准确率推到了可靠的高位,但并行度被毛细管数目锁死在数百道,每条泳道都需要样本制备、试剂与人工的伺候;以这样的通量读完约 3.1 Gb 的人类基因组,需要以年计的时间与以十亿美元计的预算。新一代测序(next-generation sequencing, NGS)——亦称第二代测序或大规模平行测序——的革命性之处,并不在于读取碱基的化学更加精妙,而在于一次实验中同时读取的分子数目跃升了三到五个数量级(Mardis, 2008)。本节以原书第三版出版前后(2009 年)的技术版图为主线,先抽取三大平台共享的技术范式,再逐一考察 454、Illumina/Solexa 与 SOLiD 的工程细节,最后讨论平台对比、成本轨迹与单分子长读长的前沿方向;其后的产业演化以括注说明。

2.2.1 共性技术范式:文库、克隆扩增与循环检测

无论哪一家平台,2009 年前后的 NGS 工作流都可以分解为四个连续阶段。第一阶段是文库构建:基因组 DNA 经超声或雾化等机械力随机打断,末端修补后连接通用接头(adapter)——接头携带引物结合位点与测序引物互补区,使来源不同的全部片段可以在同一套引物、同一套化学下被统一处理;在本书的时代,多样品混合测序的条形码化(barcode)也已出现。片段化是随机的,这一性质直接决定了 2.3 节鸟枪法拼装的统计基础。

第二阶段是克隆扩增。单分子检测的灵敏度不足是 NGS 首先要绕开的物理限制:单个模板分子每轮化学只释放有限的荧光光子,淹没在背景散射与杂质荧光之中。因此三大平台都把每个模板分子在原位克隆扩增上千倍,使信号从"单分子"变为"上千条相同分子之和":454 与 SOLiD 把模板连同引物磁珠包进油包水乳胶的皮升级液滴,做乳化PCR(emulsion PCR);Illumina 则在流通池(flow cell)玻璃表面做桥式PCR(bridge PCR)。克隆扩增的收益是信号,代价同样明确:聚合酶链式反应固有的 GC 偏好、重复区扩增失败与偶发的扩增错误,会以"整个克隆共同出错"的形式进入数据。

第三阶段是循环检测,第四阶段是碱基调用。反应试剂按固定次序逐轮流过反应表面,每一轮完成一步化学——聚合一个碱基、或连接一段探针——随后照相机对整个表面整体成像;图像处理软件识别每个位点的位置,把逐轮累积的强度或颜色序列翻译为碱基序列,并逐碱基给出质量值。这种"每个碱基自带可信度"的数据观,与 2.1 节的 phred 哲学一脉相承。

由此可以准确说出 NGS 与 Sanger 法的本质区别。第一,并行度:毛细管仪一次运行数百条泳道,NGS 一次运行可读位点在 10⁵–10⁷ 量级。第二,读长:Sanger 法可靠读出约 500–1 000 bp,NGS 各平台在 25–400 bp 之间。第三,错误结构:Sanger 的错误随读长末端质量衰减,NGS 则形成平台特异的错误谱(同聚物插入缺失、替换、颜色码连锁)。第四,取样方式:从克隆定向测序变为对基因组的随机采样,"测哪一段"的选择权交给统计学与拼装算法。读长的牺牲换来的是每碱基成本的雪崩式下降——这笔账将在 2.2.5 与 2.2.6 节算清。

定义

新一代测序(next-generation sequencing, NGS):以大规模平行化、循环式"边合成边检测"(或连接检测)与表面整体成像为共同特征的 DNA 测序技术家族;因相对于以电泳分离链长为基础的 Sanger 法(第一代)而得名,亦称第二代测序。其技术内核是"文库构建—克隆扩增—循环化学—成像与碱基调用"的四段式流程(Gibson & Muse, 2009;Mardis, 2008)。

2.2.2 454 平台:乳化 PCR 与焦磷酸测序

454 Life Sciences 于 2005 年推出的 GS 20 是第一台商业化 NGS 仪器(Margulies et al., 2005):单次运行即对约 0.58 Mb 的生殖道支原体基因组实现约 96% 的覆盖,一致序列准确率约 99.4%——"大规模平行、边合成边检测"由此证明可以工业化。其前端是乳化 PCR:水相(携带引物的微磁珠、稀释的模板与 PCR 试剂)与油相混合剪切,形成数百万个皮升级液滴;极限稀释使多数液滴至多含一条模板,理想情况下"一珠一模板"。热循环后,模板在各自珠表面扩增出上千条同源拷贝("一珠一克隆");经富集,携带扩增产物的磁珠与更小的、负载检测酶的微珠一同沉积到光纤微孔板(PicoTiterPlate, PTP)——一块化学蚀刻出微米级微孔阵列的光纤玻片上。一珠一孔、互不干扰,每个孔底即是一个独立的皮升级反应器。

检测化学是焦磷酸测序(pyrosequencing)(Ronaghi et al., 1998):四种 dNTP 依固定次序逐一流过 PTP 板;某孔的模板若恰好需要当前流过的碱基,聚合酶将其掺入并释放焦磷酸(PPi),下游的酶级联把 PPi 逐步转化为可见闪光,CCD 相机记录整板每个孔的光强;未被掺入的 dNTP 被降解清洗后,换下一种碱基再流一轮。如此循环,"哪种碱基流过时发光"这一事实本身即构成序列。

方法

焦磷酸检测的酶级联。焦磷酸测序的每一轮包含四步接力(Ronaghi et al., 1998;Margulies et al., 2005):

  1. DNA 聚合酶:(DNA)n + dNTP → (DNA)n+1 + PPi——仅当 dNTP 与模板配对时发生,一次掺入几个同种碱基即释放几份 PPi;
  2. ATP 硫酸化酶:PPi + APS → ATP——把焦磷酸转化为三磷酸腺苷(APS 为腺苷酰硫酸);
  3. 荧光素酶:荧光素 + ATP + O2 → 氧化荧光素 + 光——光子数正比于 ATP 量,也即正比于本轮掺入的碱基数;
  4. 腺苷三磷酸双磷酸酶(apyrase):降解残余的 dNTP 与 ATP,使本底在下一轮之前归零。

要点在于光强是模拟量:掺入一个碱基发一份光,掺入五个发约五份光。强度与掺入数仅在有限的线性区间内成比例,超出后趋于饱和——这正是同聚物误差的物理根源(见下文与习题 2.2-2)。

读长与错误谱:GS 20 的平均读长约 100 bp;GS FLX 提升至约 250 bp;原书时代的 GS FLX Titanium 化学约 400 bp,为当时 NGS 诸平台之最长。错误以插入/缺失(indel)为主,集中于同聚物(homopolymer)(连续相同碱基)区段,散在的单碱基替换相对少见;原始读准确率约 99% 量级。凭借相对长的读长与较早的成熟度,454 在小基因组 de novo 拼装与扩增子测序(如 16S 标签)中率先普及;2007 年完成的 J. D. Watson 个人基因组亦出自该平台,成为 NGS 走向个体基因组时代的标志事件(详见 Mardis, 2008 的综述)。

习题 2.2-2

某 454 读段与参考序列比对时,几乎全部不匹配都表现为同聚物区段长度的多一或少一(如参考 AAA 被读成 AA 或 AAAA),散在替换则很少。(a) 从焦磷酸测序的检测原理说明:为什么同聚物区段特别容易产生 indel 型错误?(b) 为什么同样的问题在 Illumina 的可逆终止子化学中基本不存在?

参考解答

(a) 焦磷酸测序对同聚物不逐碱基计数,而是以一次闪光的光强估计掺入个数;光强是模拟量,受检测线性范围、酶反应动力学与成像噪声的共同影响,同聚物越长光强越接近饱和、相对误差越大,故对较长同聚物(经验上约超过 5–6 个)常多读或少读一个碱基,形成 indel。(b) Illumina 每轮用 3′ 封闭的可逆终止子强制每条链至多延伸一个碱基:同聚物被拆成多次"一次一个"的循环,每一轮只需作"是哪种颜色"的离散判别,而非"有多亮"的模拟估计,因此其错误以替换为主,且不随同聚物长度系统恶化。

2.2.3 Illumina/Solexa:桥式成簇与可逆终止子合成测序

第二条路线由英国 Solexa 公司发展,2006 年并入 Illumina 后以 Genome Analyzer 之名推广,2008 年即以该化学完成了一个非洲裔个体的全基因组测序(Bentley et al., 2008)。它把克隆扩增从液滴搬到玻璃表面:流通池内表面共价固定着与接头互补的致密寡核苷酸层;单链模板一端先与表面引物结合,另一端弯下腰去与邻近的另一种引物互补,弓成一座"桥"。经变性—退火—延伸的桥式 PCR 循环(约 35 轮),每个起始位点长成一个亚微米尺度的克隆(cluster),含上千条相同拷贝;簇与簇的间距足以在显微镜下分辨,整片表面于是成为一张布满反应位点的"棋盘"。

测序化学是带可逆终止子(reversible terminator)合成测序(sequencing by synthesis, SBS):四种 dNTP 同时存在、竞争掺入,但每一种的 3′ 羟基都被可切除的封闭基团锁住,并携带标明碱基种类的荧光基团——因此每轮每条链至多延伸一个碱基。洗去游离 dNTP 后整板成像,每个簇的颜色即该轮掺入的碱基;再以化学方法切除荧光基团、解除 3′ 封闭,进入下一轮。"掺入—成像—切除"周而复始,每个簇的颜色序列即其碱基序列(图 2.2-1)。

A · 桥式 PCR:在流通池表面长出克隆簇 带接头的单链模板与表面固定引物互补、弓成"桥",经变性—退火—延伸循环原位扩增 桥式扩增:同一模板在原位复制出上千条相同拷贝,构成一个簇 相邻位点各自成簇:测序时整片表面一次成像 流通池(flow cell)玻璃表面:致密固定两种与接头互补的引物 每处一个"簇":同一模板的上千条拷贝 B · 合成测序循环:可逆终止子保证每轮只延伸一个碱基 引物 聚合酶 T A C 可逆终止子 dNTP:3′ 封闭基团阻止继续延伸,荧光基团标记碱基种类 G 3′ 封闭 + 荧光标记 逐轮读出: T A C G G T …(每个簇并行进行) 1 掺入:至多一个碱基 2 整板成像:颜色即碱基 3 切除染料并解除封闭 4 下一轮:读长 +1 灰色小球 = 已读出的碱基;浅色大球 = 本轮正在掺入的可逆终止子。颜色序列即碱基序列。
图 2.2-1 Illumina 平台的桥式扩增与合成测序循环。A 带接头的单链模板在流通池表面弓成"桥",经桥式 PCR 原位克隆扩增成簇(靛蓝弧线),相邻位点各自独立成簇(灰弧线);B 带 3′ 封闭基团与荧光标记的可逆终止子使每轮每链至多延伸一个碱基,"掺入—成像—切除"逐轮推进。悬停各元素可查看说明。

这一化学把 Illumina 的长短板刻画得非常清楚。短板是读长:发布时单端 25–35 bp;逐轮累积的合成不同步(phasing)与荧光残留使错误率随循环数上升,原始错误率约 1% 量级,且以碱基替换(substitution)为主——替换不改变读段的相位,比 indel 更容易在拼装的一致性投票中被纠正。长板是通量与成本:数以千万计的簇并行成像,单次运行即产出 Gb 级数据,每碱基成本降至 Sanger 法的百分之一以下量级(约数;简单账目见式 (2.2-1))。(原书出版于 2009 年;其后读长与通量持续攀升,至 2014 年前后的 HiSeq 系列已使 2×150 bp 读长与 Tb 级单次运行成为常规,市场亦逐渐由 Illumina 主导。)

2.2.4 SOLiD:连接酶法与双碱基颜色编码

第三个平台的思想源自哈佛大学 Church 实验室的菌落(polony)测序(Shendure et al., 2005),2007 年由 Applied Biosystems 商品化为 SOLiD。模板制备与 454 同路——乳化 PCR 扩增到磁珠上、铺于玻片表面;不同的是催化反应的酶:不请聚合酶,而请 DNA 连接酶来"拼读"。

SOLiD 的双碱基编码(two-base encoding)安排在一个八碱基探针池里:探针 5′ 端第 1、2 位是"讯问碱基",第 3–8 位为简并碱基;16 种二核苷酸组合按固定规则映射到四种荧光通道(图 2.2-2A)——同碱基对(AA/CC/GG/TT)记 0 号码,AC/CA/GT/TG 记 1 号,AG/CT/GA/TC 记 2 号,AT/CG/GC/TA 记 3 号,四种组合共享一个颜色。每轮加入探针池:与模板正确配对的探针被连接酶连接到引物 3′ 端,成像记录颜色——它报告的是"相邻两位碱基的组合类别",而非某一位碱基本身;随后在探针第 5、6 位碱基之间化学切断,弃去带荧光的 3′ 端三碱基,保留结合在模板上的五聚体,下一个探针紧接其后连接——每次连接沿读段方向推进 5 个碱基。

一轮 5–7 次连接结束后,变性剥离全部产物,换用错开一位的引物重新开始,共进行五轮(引物依次错开 n、n−1、n−2、n−3、n−4)。错开使每个模板碱基先后落入两次独立的讯问(图 2.2-2B);配合文库另一端反向读取的第二条读段,校验更加充分。解码时需以已知的第一个碱基为起点,把颜色码序列逐步翻译为碱基序列——数据因此原生生活在颜色空间(color space)中,比对与变异检测须使用专门的算法。

A · 双碱基编码盘:16 种二核苷酸组合映射为 4 个颜色码 行 = 探针第 1 位碱基(5′ 端),列 = 第 2 位;同色四格共享一个荧光通道 ← 第 2 位 第 1 位 ↓ ACGT AC GT 编码矩阵是一个拉丁方:每行每列各含 0–3 四码各一次 AAACAGAT CACCCGCT GAGCGGGT TATCTGTT 0123 1032 2301 3210 颜色码 0 1 2 3(四个荧光通道) 每一行、每一列恰好包含 0–1–2–3 各一次:任一碱基与四种伙伴的组合各占一色, 故由已知起点碱基出发,相邻两码即可唯一解码出中间的碱基。 B · 错开一位的两轮连接:每个碱基被讯问两次 模板碱基行:第 7 位(靛蓝底)先后落入两轮连接的讯问 A T G C A C G G T A C G T 1713 第 1 轮(引物 n):每次连接推进 5 个碱基 第 2 轮(引物 n−1,错开一位) 第 7 位碱基先后落入两次讯问:两个颜色码须一致, 不一致即暴露错误;真实变异则表现为相邻两码同时改变。
图 2.2-2 SOLiD 双碱基编码与错开讯问。A 编码盘(拉丁方):探针第 1、2 位碱基的组合决定四种荧光通道之一,同色四格共享一个颜色码;B 两轮连接的讯问位置各错开一位(每次连接推进 5 个碱基),使每个模板碱基(如第 7 位)先后被两个独立颜色码覆盖。悬停可查看说明。

双碱基编码的冗余带来结构性的纠错能力:一次真实的单碱基变异会恰好改变相邻两个颜色码,而孤立的单一颜色失配更可能是测序错误——错误与变异在数据结构上即可区分(习题 2.2-3)。因此 SOLiD 的原始单碱基准确率在三大平台中最高(标称可达 99.9% 以上);代价是读长最短(发布时 25–35 bp,后延至 50–75 bp),以及颜色空间数据带来的算法复杂度。

习题 2.2-3

采用图 2.2-2A 的编码规则(0:AA/CC/GG/TT;1:AC/CA/GT/TG;2:AG/CT/GA/TC;3:AT/CG/GC/TA)。(a) 已知读段第一个碱基为 T,其后颜色码依次为 2、3、1、1,写出对应的碱基序列。(b) 若该读段某处的颜色码异常,而前后相邻的颜色码均与参考一致,应判为测序错误还是真实变异?说明判据。

参考解答

(a) 逐码翻译:T 经码 2(含 TC)得 C;C 经码 3(含 CG)得 G;G 经码 1(含 GT)得 T;T 经码 1(含 TG)得 G。故序列为 TCGTG。(b) 判为测序错误。真实的单碱基变异改变的是模板上一位碱基,而该碱基同时参与其左、右两个颜色码(各对应与左邻、右邻的组合),必然表现为相邻两个颜色码同时改变;只有单个颜色码孤立失配、相邻码正常的模式与真实变异不相容,应归为检测错误,并在一致性阶段予以纠正。

2.2.5 平台工程学对比与配对末端配置

表 2.2-1 从核心化学、扩增方式、读长、错误类型、相对通量与代表性应用六个维度比较 Sanger 与三大 NGS 平台。表中一律使用"约/量级"表述:同一平台的化学与仪器版本迭代极快,精确的读长与产出数字随时间即失效,而各平台背后的工程权衡才是稳定的教学要点。这一权衡可以用一个简单的账目概括:

T ≈ N × L × η, c = Crun / T (2.2-1) N:单次运行可读位点数(并行度);L:平均读长(bp);η:可定位合格读段比例;T:单次运行的有效产出(bp);Crun:单次运行总成本;c:每碱基成本。Sanger 法的 N 约为 10²,NGS 为 10⁵–10⁷:读长即使缩短约一个数量级,并行度三至五个数量级的增益仍使 T 与 c 占绝对优势——这就是"以读长换并行"的算术。
表 2.2-1四大测序平台的工程学对比(2009 年前后的量级;具体参数随化学版本而变)
平台(推出)核心化学克隆扩增读长(约)单碱基错误类型单次运行产出(量级)代表性应用
Sanger 毛细管
(1980 年代末自动化)
双脱氧链终止 + 四色荧光 + 电泳 无(纯化模板直接测) 500–1 000 bp 替换为主,末端衰减 约 0.1 Mb finishing、验证与定向测序
454 GS FLX(2005) 焦磷酸测序(PPi 转化为光) 乳化 PCR(磁珠入 PTP 微孔) 100 → 400 bp 同聚物区 indel 为主 数百 Mb 小基因组 de novo、16S 标签类扩增子
Illumina GA(2006) 四色可逆终止子合成测序 桥式 PCR(流通池表面成簇) 25–35 bp 起,其后渐增 替换为主 数 Gb–数十 Gb 全基因组重测序、转录组、表观基因组
SOLiD(2007) 连接酶法 · 双碱基编码 乳化 PCR(磁珠铺片) 25–35 bp,后延至 50–75 bp 原始准确率最高;错误可被双码判别 数 Gb–数十 Gb 高精度重测序与 SNP 检测

注:通量与读长取 2009 年前后的公开量级(Gibson & Muse, 2009;Mardis, 2008)。原书出版后,454 于 2013–2016 年间退出市场、SOLiD 亦渐式微,Illumina 系列经多次换代成为主流(Metzker, 2010)。

表中隐含的一项通用配置值得单独强调:三大平台都支持配对末端(paired-end)测序——同一 DNA 片段的两端各测一条读段,二者方向相对、间距由文库插入片段的长度分布(约数百 bp 至数 kb 不等)给出。其意义有三:其一,把两条短读段锚定在一段已知跨度上,可跨越单条读长覆盖不了的重复区与缺口,是 2.3 节支架(scaffold)拼装的关键证据;其二,两端间距或方向的异常直接指示缺失、倒位、易位等结构变异,是后续变异分析的基础;其三,构建多档插入长度的文库,相当于给拼装器配备多把不同刻度的尺子。可以说,配对末端让"短读长"的劣势在很大程度上被信息设计所补偿。

习题 2.2-1

三个匿名数据集的错误谱与读段形态如下——:读长约 400 bp,错误集中于同聚物区段的插入/缺失;:读长 32 bp 的数千万对配对读段,散在替换错误随循环数缓慢上升;:原始碱基级准确率三者最高,但数据以"首碱基 + 颜色码序列"的形式给出,读长约 35 bp。请判断三者分别最可能来自哪个平台,并为每个数据集各推荐一类最适配的应用。

参考解答

甲为 454:焦磷酸测序以光强估计同聚物长度,indel 为主、读长为三平台最长,适合小基因组 de novo 拼装与 16S 标签类扩增子分析。乙为 Illumina:可逆终止子逐轮成像,替换型错误、读段短而簇数巨大,适合全基因组重测序与转录组计数类应用。丙为 SOLiD:双碱基编码的颜色空间数据、原始准确率最高,适合对准确性要求高的重测序与 SNP 检测。判断线索是"错误类型—读长—数据形态"三者的组合,而非任何单一指标。

2.2.6 成本与产出轨迹:从 30 亿美元到十万美元量级

把本节的技术放进货币与时间坐标,变化的剧烈程度超出多数人的预期。人类基因组计划(1990–2003)耗资约 3×10⁹ 美元(含图谱构建等全部成本);2007 年,J. D. Watson 的个人基因组由 454 平台在约两个月内完成,成本降至约百万美元量级;到本书第三版出版前后(2008–2009 年),以 NGS 交付一份人类基因组图谱的成本已进入 10⁵–10⁶ 美元量级,且仍在快速下探(详见 Mardis, 2008 的综述)。

案例

成本雪崩与"千元基因组"愿景。美国国家人类基因组研究所(NHGRI)在 2000 年代中期即把"1 000 美元基因组"设为长期资助目标,希望把全基因组测序推进到常规检查的成本区间。以 2009 年的技术看,这一目标尚远,但方向已无悬念:同一时期半导体单位计算成本约每两年减半,而测序每碱基成本的下降长期快于此——即所谓"超摩尔定律"的表述(NHGRI 成本数据;并见 Sboner et al., 2011 的讨论)。真正的问题开始转移:当"读出"接近免费,存储、分析与"读懂"反而成为新的成本大头。(原书出版后:市场由 Illumina 主导,2014 年其 HiSeq X Ten 平台把群体规模的人类基因组测序推至约 1 000 美元/人的行业口径。)

产出的增速同样惊人:进入 2000 年代后期,全球测序数据产量的年增速超过摩尔定律对应的翻倍节奏,这一表述在后来的综述中被反复量化(Sboner et al., 2011)。对基因组科学而言,这意味着研究瓶颈从"产生数据"移向"管理、处理与解释数据"——本书后续各章的计算主题(拼装、注释、比对、变异与表达分析),都建立在这一转折之上。

2.2.7 前瞻:单分子与长读长测序(原书出版后的主流化)

原书第三版出版时,NGS 的下一步方向已经清楚:消除克隆扩增。扩增是信号的来源,也是偏差的来源——GC 偏好、重复区丢失与"整簇共同"的扩增错误皆由此而来。两条路线在 2008–2009 年间先后给出原理验证。

其一是 Helicos 的真单分子测序(tSMS;Harris et al., 2008):模板分子不经扩增直接固定于表面,每轮掺入一种带可逆终止子的荧光核苷酸,成像后切除,循环往复。它彻底摆脱了扩增偏差,但单分子信号弱,读长与准确率均受限,商业上也未能持续。

其二是 Pacific Biosciences 的单分子实时测序(SMRT;Eid et al., 2009),关键器件是零模式波导(zero-mode waveguide, ZMW):孔径小于激发光波长的微孔,使入射光场在孔内沿深度指数衰减,仅孔底约 10⁻²¹ 升(zeptoliter)量级的体积被有效照明。把单个 DNA 聚合酶固定在孔底,掺入带荧光磷酸标记的 dNTP 时,标记基团随焦磷酸释放而自动脱落——聚合反应无需中断,光信号被连续摄像记录:聚合酶每写一个碱基,仪器便实时读一个碱基。读长可达 kb 级;原始错误率偏高,但错误近似随机,多次覆盖后的共识序列可将其纠正。

注记

"第几代"是教学便利,不是技术定义。习惯上把 Sanger 法称为第一代,克隆扩增加循环检测的 454/Illumina/SOLiD 称为第二代,单分子实时或长读长测序称为第三代(牛津纳米孔技术有时被单列为第四代)。称谓并无严格判据,稳定的区分维度是:是否扩增、是否实时、读长与错误结构。2009 年前后 PacBio 尚处原理演示阶段;其在原书出版后逐步商业化,与纳米孔技术一道,使重复区拼装、结构变异与转录本异构体的研究发生了实质变化。

就本书主线而言,本节确立的数据形态——海量短读段、逐碱基质量值与配对信息——在 2009 年已经定型,并在此后十余年基本稳定。平台会更替,而"如何把数百万条读段拼回一个基因组"的问题,正是下一节(2.3 全基因组鸟枪法拼装)的主题。

关键术语

新一代测序 (next-generation sequencing, NGS)
以大规模平行化、循环式边合成边检测与表面成像为特征的测序技术家族,亦称第二代测序。
接头 (adapter)
连接在片段化 DNA 两端的通用短序列,携带引物结合位点,使全部片段可被统一扩增与测序。
乳化PCR (emulsion PCR)
在油包水液滴中以"一珠一模板"方式进行的克隆扩增,为 454 与 SOLiD 提供信号放大。
桥式PCR (bridge PCR)
模板两端与流通池表面固定引物交替退火延伸的原位扩增,每个位点长出一个克隆簇。
焦磷酸测序 (pyrosequencing)
以酶级联把掺入释放的焦磷酸转化为光信号、按碱基流动次序读序的方法。
可逆终止子 (reversible terminator)
3′ 羟基被可切除基团封闭并带荧光标记的 dNTP,保证每轮每链至多延伸一个碱基。
双碱基编码 (two-base encoding)
SOLiD 以相邻两碱基组合决定荧光通道的编码方案,使每个碱基被两个颜色码覆盖。
颜色空间 (color space)
SOLiD 数据的原生表示:首碱基加颜色码序列,需专门算法解码与比对。
同聚物 (homopolymer)
连续相同的碱基区段;其长度只能由光强估计,是 454 indel 错误的集中来源。
配对末端 (paired-end)
同一片段两端各测一条、方向相对且间距约已知的测序配置,服务于支架拼装与结构变异检测。

参考文献与延伸阅读

  1. Gibson G, Muse SV. 2009. A Primer of Genome Science, 3rd ed. Sunderland (MA): Sinauer Associates. (Chapter 2)
  2. Margulies M, Egholm M, Altman WE, et al. 2005. Genome sequencing in microfabricated high-density picolitre reactors. Nature 437: 376–380.
  3. Bentley DR, Balasubramanian S, Swerdlow HP, et al. 2008. Accurate whole human genome sequencing using reversible terminator chemistry. Nature 456: 53–59.
  4. Shendure J, Porreca GJ, Reppas NB, et al. 2005. Accurate multiplex polony sequencing of an evolved bacterial genome. Science 309: 1728–1732.
  5. Mardis ER. 2008. Next-generation DNA sequencing methods. Annual Review of Genomics and Human Genetics 9: 387–402.
  6. Ronaghi M, Uhlen M, Nyren P. 1998. A sequencing method based on real-time pyrophosphate detection. Science 281: 363–365.
  7. Metzker ML. 2010. Sequencing technologies — the next generation. Nature Reviews Genetics 11: 31–46.(原书出版后的综述,括注采用)
  8. Harris TD, Buzby PR, Babcock H, et al. 2008. Single-molecule DNA sequencing of a viral genome. Science 320: 106–109.
  9. Eid J, Fehr A, Gray J, et al. 2009. Real-time DNA sequencing from single polymerases. Science 323: 133–138.
  10. Sboner A, Mu XJ, Greenbaum D, Auerbach RK, Gerstein MB. 2011. The real cost of sequencing: higher than you think! Genome Biology 12: 125.