第一章 · 1.6

1.6 基因组数据库与生物信息资源

Genomic Databases and Bioinformatics Resources

本节摘要 本节讨论基因组数据的存储、组织与获取方式:GenBank、EMBL-Bank 与 DDBJ 三中心每日交换数据的一级档案协作,GenBank 记录结构与登录号体系及其与 RefSeq 的区别,Ensembl、UCSC 基因组浏览器与模式生物专库的职能分工,以装配坐标与轨道为核心的浏览器数据组织,Entrez、BLAST 等检索分析工具生态,以及数据共享、引用与持久性的学术规范。

前几节叙述了基因组计划如何组织与产出数据:百慕大原则要求长度不少于 1 kb 的序列在 24 小时内提交公共数据库(第 1.4 节)。数据被“倾倒”之后去了哪里、以什么形态存在、如何被全世界研究者反复取用,是本节要回答的问题。生物信息资源并非序列测定完成之后的附设品,而是基因组科学得以成立的先决条件之一:没有统一的存储、编号与检索体系,3×109 bp 级的共享参照系就无从谈起(Gibson & Muse, 2009)。

理解本节内容需要一个观念转变:数据库应当被当作一件“科学仪器”来理解,与测序仪、作图工具同属学科的基础设施——望远镜之于天文学,数据库之于基因组学。仪器隐喻有三重含义:其一,仪器需要设计,数据模型与检索能力决定可做实验的边界;其二,仪器需要维护与校准,对应数据库的持续更新与人工审校;其三,仪器昂贵且必须共享,对应数据库的公共经费支持与开放获取制度。以下依次考察一级档案库(1.6.1)、GenBank 的数据组织(1.6.2)、二级与模式生物数据库(1.6.3)、基因组浏览器(1.6.4)、检索与分析工具生态(1.6.5),最后讨论数据共享与持久性的学术规范(1.6.6)。

1.6.1 一级数据库的国际协作

迄今所有公开的核酸序列,其正式归宿是一套被称为一级数据库(primary database)的原始档案系统,由三个中心构成(表 1.6-1):美国的 GenBank 于 1982 年建立在洛斯阿拉莫斯国家实验室,1992 年起转由美国国家生物技术信息中心(NCBI)管理,该中心隶属国家医学图书馆,设于马里兰州贝塞斯达;欧洲的 EMBL-Bank 由欧洲分子生物学实验室(EMBL)在 20 世纪 80 年代初创建于海德堡,1995 年起随欧洲生物信息学研究所(EBI)落户英国欣克斯顿;日本的 DDBJ 于 1986 年建立在静冈县三岛的国立遗传学研究所(NIG)。

表 1.6-1国际核酸序列数据库协作的三大中心(工具与门户为原书时点的主要入口)
中心机构与地点建立主要门户与配套工具
GenBankNCBI(美国国家医学图书馆),马里兰州贝塞斯达1982(1992 年转由 NCBI 管理)Entrez 一体化检索、BLAST、RefSeq、PubMed
EMBL-BankEBI,英国欣克斯顿(初建于 EMBL 海德堡)20 世纪 80 年代初SRS 跨库检索、Ensembl 注释系统
DDBJ国立遗传学研究所(NIG),日本三岛1986SAKURA 提交系统、getentry 检索服务

三个中心自 20 世纪 80 年代末起建立每日交换数据的协作机制,后正式定名为国际核酸序列数据库协作(International Nucleotide Sequence Database Collaboration, INSDC)。研究者向任一中心提交序列,即等同于向三家提交:序列连同元数据每日互换,因此无论查询哪一家,看到的都是同一份全球档案。与每日交换配套的是统一的编号体系——每条记录由首次受理的中心签发一个登录号(accession number),该号码在三家中心同号出现、永久有效;早期格式为 1 字母加 5 位数字(如 U49845),随提交量增长扩展为 2 字母加 6 位数字(如 AY543210)。“提交一次、全球可见、编号永久”的制度设计,是一级库充当公共档案的基石,也使百慕大原则的 24 小时公开在技术上可行。

一级库的规模长期保持指数增长:GenBank 所含碱基数约每 18 个月翻一番,至原书出版前后已进入 1011 bp 量级(Benson et al., 2009;数值随发布版本变化,此处为量级估计)。增长来自三方面——新物种的基因组计划、表达标签与 EST 等大规模项目、以及高通量测序的兴起。指数增长反过来塑造了检索体系的设计:当“通读式”使用不再可能时,索引、交叉链接与批量查询成为刚性需求(见 1.6.5 节)。

定义

一级数据库与二级数据库:一级数据库直接收录研究者的原始提交,只做格式与质量检查而不改动其科学内容,是“不可变的档案”,如 INSDC 三中心;二级数据库在一级库数据基础上再加工——装配、注释、去冗余、整合文献与表型——形成的衍生资源,是“可更新的解释”,如 RefSeq、Ensembl、UCSC Genome Browser 与各类模式生物专库。判断一个资源属于哪一类,可问两个问题:数据是否直接来自研究者提交;记录被修订时是否保留并公示历史版本。档案与解释的分工,使原始证据与加工结论可以相互回溯。

1.6.2 GenBank 的数据组织

一级库以平面文件(flat file)格式组织每条记录,GenBank 格式是事实标准之一。一条记录由三部分组成:描述区给出记录的身份信息;FEATURES 特征表把序列上的注释组织为结构化条目;ORIGIN 之后为碱基序列,记录以 “//” 结束。表 1.6-2 列出描述区的主要字段。

表 1.6-2GenBank 记录描述区的主要字段(示例取自 NCBI 官方示例记录 U49845,节选)
字段含义示例
LOCUS位标行:长度、分子类型、拓扑、数据类别与日期5028 bp DNA PLN 15-JUN-1993
DEFINITION对序列内容的一句话描述Saccharomyces cerevisiae TCP1-beta gene
ACCESSION登录号,记录的永久主键U49845
VERSION登录号.版本号,序列变更时版本递增U49845.1
SOURCE / ORGANISM物种来源与分类地位Saccharomyces cerevisiae(酵母)
REFERENCE相关文献,含提交者信息1 (bases 1 to 5028)
FEATURES特征表(见正文)gene、mRNA、CDS 等
ORIGIN序列区起始标记,其后为编号的碱基行1 gatcctccat …

FEATURES 表是记录的信息核心。每个特征(feature)由特征键(feature key,如 source、gene、mRNA、CDS)加位置描述(location)构成:位置既可以是连续区间(如 1296..4399),也可以用 join 把多个外显子连为一个分子级对象——CDS complement(join(1296..1500,1787..4399)) 表示该编码区位于反向互补链、由两段外显子剪接而来。特征之下可挂限定词(qualifier),如 /gene="TCP1-beta"、/product、/translation,分别给出基因名、产物名与翻译产物序列。其中编码区注释(CDS feature)是基因注释的最小单元,其预测与审校方法将在第 2 章系统展开。需要强调:特征表内容由提交者或后续注释者给出,一级库不做科学性审校,质量参差——这正是使用时必须核对证据来源的原因。

提交与发布有明确流程。研究者经网页工具 BankIt 或本地软件 Sequin 提交(大型项目常用批量程序),中心完成格式检查与载体污染筛查后即签发登录号,数据随即进入每日更新的在线库,并汇入约每两个月一次的正式发布版本。此后的修订不覆盖历史:序列变更使版本号递增(U49845.1 变为 U49845.2),旧版本仍可回溯。档案“不可变”的设计,使任何分析都能精确指认其所依据的数据。

定义

登录号(accession)与 RefSeq 的区别:GenBank 与 RefSeq 同由 NCBI 运行、常被初学者混淆,但分属两类资源。GenBank 是 INSDC 的原始提交档案,任何实验室都可就同一基因独立提交,因此存在冗余,登录号为“字母+数字”形式(如 U49845、AY543210)。RefSeq(Reference Sequence)则是 NCBI 在档案基础上经人工审校与计算整合建立的非冗余参考序列库,每类分子给出一个权威代表,登录号带类型前缀:NM_/NR_(人工审校的转录本)、XM_/XR_(注释流水线预测的模型)、NP_/XP_(蛋白质)、NC_/NG_(染色体与基因组区段)。二者关系是“多对一”:一条 RefSeq 记录往往汇总多条 GenBank 提交的证据(Pruitt et al., 2007)。使用规则可概括为:查“谁提交过什么”用 GenBank,查“该基因的规范序列”用 RefSeq。

1.6.3 二级数据库与模式生物数据库

若一级库是档案柜,二级数据库(secondary database)就是按问题重组档案的阅览室。综合类二级资源中最重要的三家门户是 NCBI、Ensembl 与 UCSC。Ensembl 由 EBI 与维康信托桑格研究所于 1999 年联合创建,其特色是自动化注释流水线:每当新的基因组装配发布,流水线即完成重复序列掩蔽、蛋白质与转录本证据比对、基因模型预测,并赋予稳定标识符(如人类基因的 ENSG00000139618 形式);对人类等关键物种,自动注释再与 Havana 团队的人工审校合并,形成质量更高的合并基因集(Hubbard et al., 2009)。UCSC Genome Browser 由加州大学圣克鲁兹分校在 2000—2001 年间开发,最初正是为人类基因组草图的组装与网络展示而写,其以“轨道”组织一切数据的界面范式影响深远(Karolchik et al., 2008;见 1.6.4 节)。NCBI 则以 Entrez 一体化检索与 Map Viewer 等工具把序列、文献与图谱串联为一个体系(Wheeler et al., 2008)。

与综合门户相对,模式生物数据库(model organism database, MOD)只服务一个物种,但做得更深(表 1.6-3)。其四项经典职能为:其一,人工文献审校(curation)——专职审校员逐篇阅读文献,把突变表型与功能注释(如基因本体术语)录入结构化字段;其二,命名规范——充当该物种基因命名的权威登记处,抑制同义名与歧义;其三,表型与互作数据——系统收录遗传互作、物理互作与突变表型;其四,与种质资源中心(如果蝇的 Bloomington 种原中心)互链,使序列信息可以落到可订购的实体材料上。综合门户的自动注释广而浅,模式生物库的人工审校窄而深:前者提供坐标,后者提供权威解释,二者互补。

表 1.6-3主要模式生物数据库及其核心职能(机构为原书时点的主要主持方)
物种数据库主持机构核心特色
酿酒酵母SGD斯坦福大学(美国)基因组级文献审校与命名权威(Cherry et al., 1997)
黑腹果蝇FlyBase多机构联盟(哈佛大学等)百年遗传学文献的系统化与等位基因表型编目
秀丽隐杆线虫WormBase多机构联盟体细胞谱系与发育数据整合(承自 AceDB 体系)
拟南芥TAIR卡内基科学研究所与斯坦福联盟植物参考注释与种质资源链接
小鼠MGI杰克逊实验室(美国)命名权威、品系与等位基因-表型数据库

1.6.4 基因组浏览器的数据组织

基因组浏览器(genome browser)是二级资源的统一界面范式,其数据组织依赖两个概念。第一是坐标系统:以某物种某一次基因组装配(genome assembly)为参照,每条染色体是一条带编号的坐标轴,任何对象的位置写作“染色体:起止”,如 chr7:117,120,001–117,180,000。坐标的含义完全依附于装配版本:人类的 GRCh37/hg19 与 GRCh38/hg38 是长度不同的两套坐标轴,同一基因在两套坐标中的位置并不相同;跨版本工作须用 LiftOver 等工具换算,并在成果中注明版本。第二是轨道(track):凡能映射到坐标的信息——基因模型、mRNA 与 EST 证据、SNP、重复序列、物种间保守性——都画成一条与坐标轴平行的横带。由于所有轨道共享同一坐标,不同来源、不同实验乃至不同物种的数据可在同一窗口内直接对齐比较;“坐标+轨道”因此被称为基因组学的通用语言:写下 chr7 约 117 Mb,全球任何浏览器都会给出同一窗口。

浏览器的第二个一般机制是缩放与过滤。视图可从整条染色体一路放大到单个碱基,不同尺度自动呈现不同粒度的轨道——染色体级视图显示带型与基因密度,基因级视图显示外显子结构与剪接方式,碱基级视图显示具体序列与变异位点;过滤则按证据类型、得分阈值或组织来源控制轨道的开关与密度,避免数十条轨道相互遮挡。图 1.6-1 给出典型界面的示意。

以坐标为轴、以轨道为层:所示窗口 chr7:117,120,001–117,180,000(GRCh37 坐标,示意) 染色体 当前视图在染色体上的区段(约 60 kb);窗口以下的标尺与轨道均展示该区段 坐标 117.12 117.13 117.14 117.15 117.16 117.17 117.18 Mb 基因 基因 A(正链):方块为外显子,细线为内含子,箭头指向转录方向 基因 A 基因 B(负链):转录方向向左,与基因 A 分列上下两行以免重叠 基因 B 转录本 同一基因的可变剪接异构体:细矮块为 UTR,高实心块为编码区(CDS) 异构体 1 异构体 2 SNP SNP 轨道:竖线密度示意变异位点的分布,基因区与侧翼区密度不同 保守性 多物种序列保守性:柱高示意保守程度,编码区常形成显著保守峰 编码区保守峰 外显子 内含子(细线) 转录方向 SNP 位点 柱高为保守程度
图 1.6-1 基因组浏览器界面示意(学术风格化)。自上而下:染色体带型图,深色窗标出当前视图区段(约 60 kb);坐标标尺,刻度每 10 kb;基因轨道,方块为外显子、细线为内含子、箭头示转录方向,正负链基因分列上下;转录本轨道,同一基因的两个剪接异构体,实心块为编码区、细矮块为 UTR;SNP 轨道,竖线示变异位点;保守性轨道,柱高示多物种序列保守程度,编码区形成显著保守峰。悬停各轨道元素可查看说明。
方法

第一次使用基因组浏览器(以查找某基因的序列为目标)

  1. 选物种与装配版本:如人类 GRCh38/hg38,并随手记录——后续引用必须注明版本;
  2. 定位:在检索框输入基因名(如 CFTR)、RefSeq 编号或坐标区间,跳转到目标窗口;
  3. 读基因轨道:方块为外显子、连线为内含子、箭头为转录方向;点击基因模型可进入详情页查看引用与证据;
  4. 增开与过滤轨道:按需勾选 SNP、保守性、EST 与蛋白质证据等轨道并调节密度,缩放至碱基级核对起始密码子等细节;
  5. 导出与记录:导出目标区段的 FASTA 序列与注释表,连同装配版本、坐标一起存档,再进入后续分析。

不同浏览器(Ensembl、UCSC、NCBI)界面各异,但“选版本—定位—读轨道—导出记录”四步一致。

1.6.5 检索与分析工具生态

面对超过千亿碱基的档案,逐条浏览不可想象,检索工具与数据库同步成长。NCBI 的 Entrez 是一体化检索的代表:以统一界面查询数十个子库(文献 PubMed、核酸 Nucleotide、蛋白质 Protein、变异 dbSNP、结构 Structure 等),并在结果之间提供“邻接”链接——由一篇文献跳到其序列、由序列跳到其引文与同源蛋白,构成一张可导航的数据网络(Wheeler et al., 2008)。EBI 一侧历史上以 SRS(Sequence Retrieval System)提供跨库查询,并发展出 BioMart 式的批量检索:以表单定义过滤条件与输出字段,一次取出成千上万条记录供下游分析。NCBI 的 Map Viewer 则把遗传图、物理图与序列图叠合显示(原书出版于 2009 年,此后 Map Viewer 已被新一代基因组视图工具取代,但其“多图同屏”的思想延续至今)。

单条序列对全库的搜索由基本局部比对搜索工具(Basic Local Alignment Search Tool, BLAST)承担:把查询序列与库中全部序列做局部比对,返回按显著性排序的相似片段。按查询与库的分子类型组合为 blastn(核酸对核酸)、blastp(蛋白质对蛋白质)、blastx(翻译的核酸对蛋白质库)、tblastn(蛋白质对翻译的核酸库)等(Altschul et al., 1997)。BLAST 是“以序列找序列”的通用入口,其统计学原理与参数选择将在第 2 章第 2.6 节展开。

工具之间以少数标准文件格式交换数据。FASTA 只有两要素——以“>”开头的标识行与随后的序列行,是一切分析程序的默认输入;GenBank 平面文件则把序列与 FEATURES 注释装在同一文本中,兼顾人类可读与程序可解析:

—— FASTA 格式 ——
>U49845.1 Saccharomyces cerevisiae TCP1-beta gene, partial cds
gatcctccat ...

—— GenBank 平面文件格式(NCBI 示例记录 U49845 节选)——
LOCUS       SCU49845     5028 bp    DNA     linear   PLN 15-JUN-1993
DEFINITION  Saccharomyces cerevisiae TCP1-beta gene, partial cds.
ACCESSION   U49845
VERSION     U49845.1
FEATURES             Location/Qualifiers
       source        1..5028
       gene          complement(1296..4399)
                     /gene="TCP1-beta"
       CDS           complement(join(1296..1500,1787..4399))
                     /gene="TCP1-beta"
ORIGIN
        1 gatcctccat ...
//

浏览器与注释系统还广泛使用 BED、GFF 等以“染色体—起点—终点—属性”为骨架的坐标型格式,其思想与轨道一一对应。至此可以把本节资源叠成一张分层图(图 1.6-2):底层是每日互通的一级档案库;其上是由装配与注释构成的综合门户,把散乱记录组织为带坐标的参照系;再上是对单一物种深挖的模式生物专库;顶层是研究者经检索工具发起的查询与再分析。数据自下而上汇入,提问自上而下贯通。

数据自下而上汇入,提问自上而下贯通 顶层:研究者通过检索工具查询并再分析数据,引用时记录登录号与版本 研究者的检索、浏览与再分析 Entrez · BLAST · BioMart · 基因组浏览器 模式生物专库:人工审校文献、命名规范、表型与互作数据 模式生物专库(人工审校) SGD · FlyBase · WormBase · TAIR · MGI 参考装配与综合注释门户:提供坐标系统、基因模型与轨道式视图 参考装配与综合注释门户 NCBI · Ensembl · UCSC —— 坐标系与轨道 一级档案库(INSDC):原始提交、登录号永久、三中心每日互换 一级档案库(原始提交,INSDC) GenBank · EMBL-Bank · DDBJ —— 登录号永久、每日互换 装配与注释 坐标与注释供给 整合服务 数据向上汇入 检索与引用贯通
图 1.6-2 基因组数据资源的分层生态。底层为 INSDC 一级档案库(原始提交、登录号永久);其上为参考装配与综合注释门户(NCBI、Ensembl、UCSC,提供坐标与轨道);再上为模式生物专库(SGD、FlyBase、WormBase、TAIR、MGI,人工审校与命名规范);顶层为研究者的检索与再分析(Entrez、BLAST、BioMart、基因组浏览器)。左列箭头示数据向上汇入的加工链条,右列箭头示检索与引用的向下贯通——记录登录号与版本号是贯通两层时保持可重复性的关键。悬停各层可查看说明。

1.6.6 数据共享与持久性

数据库是长期运行的基础设施,其经费与治理并不因科学重要性而自动稳定。大型档案库(NCBI、EBI)由公共资助体系长期支持;模式生物库与专题库规模较小,常随项目经费周期波动——拟南芥资源 TAIR 在原书出版后数年即因资助结构调整转入非营利机构运营并尝试订阅制,是常被引用的一例(原书出版于 2009 年,此为后续发展)。资源一旦停运,数据本身通常仍可在档案库中获得,但审校、命名登记与社区服务的中断会造成难以恢复的损失。因此“保存数据”与“保存服务”须分开评估,数据库的可持续性也被资助方列为专门议题。

绝大多数公共序列数据开放获取,但使用仍受学术规范约束。数据库通常在使用条款中提出两项基本要求:一是引用其数据库论文——多数数据库在《核酸研究》每年一月的数据库专辑中发表年度更新论文,规范做法是引用所用车份的最新版本;二是具体数据可追溯——引用时给出登录号与版本号(如 U49845.1)、装配版本(如 GRCh38)与取数日期。模式生物库还常要求在涉及基因命名与功能注释时标注其命名权威地位。

公共数据可以被任何人再分析,这正是档案库的设计目标;但再分析须满足三个条件方能为同行接受:其一,指明数据来源的登录号集合与版本,使他人能够重建同一数据集;其二,说明筛选与处理步骤(剔除标准、参数与软件版本);其三,若再分析结论与原始发表不符,应在发表前核对差异来源——版本差异、样本定义或方法差异——必要时与原作者沟通。这些要求与实验科学的材料可追溯性同理,只是“试剂清单”换成了“数据清单”。2016 年提出的 FAIR 数据原则(可发现、可访问、可互操作、可再利用)是对上述实践的系统性总结(Wilkinson et al., 2016;原书出版于 2009 年,未及收录)。

注记

引用与记录清单:使用任何数据库资源时,研究记录中应固定保存四项信息——所查数据库及版本(或其数据库论文);检索式或工具与参数;命中记录的登录号与版本号;取数日期与装配版本。这一习惯的成本极低,却是数据可重复性的全部凭据;缺失版本信息的“已知基因序列”,在事后几乎无法复核。

习题 1.6-1

判断下列登录号各属哪类资源,并说明理由:(a) AF099741.1;(b) NM_007294.4;(c) NC_000017.11。

参考解答

(a) “1 字母+5 位数字”且无前缀,为 GenBank 原始提交记录,小数点后为版本号;(b) 带 NM_ 前缀,为 RefSeq 中经人工审校的成熟转录本参考序列(该号即 BRCA1 的参考 mRNA),同一条参考序列汇总了多条 GenBank 提交的证据;(c) 带 NC_ 前缀,为 RefSeq 的人类 17 号染色体完整参照序列,版本 11 对应某一装配版本。区分要点有二:是否带类型前缀,以及该记录是原始提交档案还是审校后的参考序列。

习题 1.6-2

某论文写道“候选变异位于 chr17:43,044,000–43,125,000(GRCh37)”,而你的浏览器默认装配为 GRCh38。若不做任何处理直接按该坐标检索,会出现什么问题?正确的处理流程是什么?

参考解答

直接检索会得到错误结果或空结果:GRCh37 与 GRCh38 是两套不同长度的坐标轴,两次装配之间发生过缺口填补、错误修正与序列重排,同一坐标号码在两套轴上指向的物理位置并不一致。正确流程是:先确认论文所用装配版本,再用 LiftOver 之类的坐标换算工具把区间从 GRCh37 映射到 GRCh38(并核对映射成功率),或直接把浏览器切换到 GRCh37 查看;无论采用哪种方式,都必须在自己的报告里注明“坐标+装配版本”这一绑定关系——只写坐标而不写版本,等于没有给出位置。

习题 1.6-3

你克隆并测得一段新的酵母基因序列,拟公开发表。请按本节的资源分层说明:(1) 序列应提交到哪里、获得什么;(2) 该数据随后如何进入二级资源;(3) 论文发表时应如何引用这些资源。

参考解答

(1) 应提交到 INSDC 三中心之一(如 DDBJ、EMBL-Bank 或 GenBank),经格式检查后获得永久登录号(及版本号);多数期刊已把提交公共数据库作为发表序列数据的前提。(2) 该记录连同元数据每日互换进入三家档案;Ensembl 等门户在新装配注释中纳入其证据,SGD 的审校员则阅读论文、把基因名、表型与功能注释录入酵母专库——档案层保证可回溯,解释层提供权威摘要。(3) 引用应包括:数据库论文(如所用车份的 GenBank 与 SGD 更新论文)、具体登录号与版本号,以及所用装配版本;遵循数据库使用条款中的引用要求,是数据再利用的基本学术规范。

关键术语

一级数据库 (primary database)
直接收录研究者原始提交数据的档案库,只做格式与质量检查而不改动科学内容。
二级数据库 (secondary database)
在一级库数据基础上经装配、注释、整合而形成的衍生资源,如 Ensembl 与模式生物专库。
国际核酸序列数据库协作 (INSDC)
GenBank、EMBL-Bank 与 DDBJ 三中心每日交换数据、统一登录号的国际档案协作体系。
登录号 (accession number)
标识一条数据库记录的永久编号,可附版本号(如 U49845.1)以追踪序列修订。
参考序列 (RefSeq)
NCBI 维护的非冗余、经审校的参考序列库,登录号带 NM_、NP_、NC_ 等类型前缀。
特征表 (feature table)
GenBank 记录中以“特征键—位置—限定词”组织序列注释的结构化部分。
基因组装配 (genome assembly)
由测序片段拼接而成、作为坐标参照的基因组序列版本,如 GRCh37/hg19 与 GRCh38/hg38。
基因组浏览器 (genome browser)
以装配坐标为轴、以轨道呈现多层信息的基因组数据可视化界面。
轨道 (track)
浏览器中与坐标轴平行、承载一类信息(基因、SNP、保守性等)的显示层。
基本局部比对搜索工具 (BLAST)
以局部比对在数据库中搜索与查询序列相似的片段的基本工具族。

参考文献与延伸阅读

  1. Gibson G, Muse SV. 2009. A Primer of Genome Science, 3rd ed. Sunderland (MA): Sinauer Associates. (Chapter 1)
  2. Benson DA, Karsch-Mizrachi I, Lipman DJ, Ostell J, Sayers EW. 2009. GenBank. Nucleic Acids Research 37 (Database issue): D26–D30.
  3. Wheeler DL, Barrett T, Benson DA, et al. 2008. Database resources of the National Center for Biotechnology Information. Nucleic Acids Research 36 (Database issue): D13–D21.
  4. Hubbard TJP, Aken BL, Ayling S, et al. 2009. Ensembl 2009: the approaches for assembly, gene and motif prediction. Nucleic Acids Research 37 (Database issue): D696–D703.
  5. Karolchik D, Kuhn RM, Baertsch R, et al. 2008. The UCSC Genome Browser Database: 2008 update. Nucleic Acids Research 36 (Database issue): D773–D779.
  6. Pruitt KD, Tatusova T, Maglott DR. 2007. NCBI Reference Sequence (RefSeq): a curated non-redundant sequence database of genomes, transcripts and proteins. Nucleic Acids Research 35 (Database issue): D61–D65.
  7. Altschul SF, Madden TL, Schäffer AA, et al. 1997. Gapped BLAST and PSI-BLAST: a new generation of protein database search programs. Nucleic Acids Research 25: 3389–3402.
  8. Cherry JM, Adler C, Ball C, et al. 1997. Genetic and physical maps of Saccharomyces cerevisiae. Nature 387 (6632 Suppl): 67–73.
  9. Wilkinson MD, Dumontier M, Aalbersberg IJ, et al. 2016. The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data 3: 160018.