4.1 节指出,Northern 印迹与 RT-PCR 一类逐基因的测量工具无法回答"整个表达程序如何改变"的问题。微阵列(microarray)对此给出的回答是:把分子杂交的识别原理微缩、并行化——在指甲盖大小的基片上按网格固定成千上万条序列已知的探针(probe),让溶液中带荧光标记、与之互补的靶(target)分子与之杂交,每个点上"留下多少荧光"即被读作对应基因"表达多少"。原书第 3 版(Gibson & Muse, 2009)系统比较了两大主流平台:斯坦福谱系的双色点样 cDNA 阵列与 Affymetrix 的原位合成寡核苷酸阵列。本节先建立二者共同依赖的固相杂交物理化学,再依次剖析其设计逻辑、延伸平台与探针设计原则,最后讨论平台间可比性与选型决策。
4.2.1 固相杂交的物理化学
微阵列的一切定量性质都根植于同一个物理化学过程:固相杂交(solid-phase hybridization)。探针固定于基片表面,溶液中的标记靶分子经 Watson–Crick 碱基配对与之结合;洗涤除去弱结合分子后,探针上保留的标记量即被读作对应序列的丰度。杂交是热变性的逆过程:升温使双链解离,降温使其复性;双链的稳定性由碱基组成、序列邻接关系、长度与溶液条件共同决定。
将双链体系缓慢升温并跟踪杂交分数(仍处于双链状态的分子比例),得到一条 S 形的解链曲线;曲线中点对应的温度即解链温度(melting temperature, Tm)——一半双链解离、一半保持配对的温度,是衡量双链稳定性的标准量。对短寡核苷酸,最粗略的估计是经验性的 Wallace 规则:
杂交严格性(hybridization stringency)指反应条件对错配双链的容忍程度,由三个可调变量共同决定。温度越接近乃至略高于探针—靶双链的 Tm,含错配的双链越容易解离,严格性越高;盐浓度方面,一价阳离子屏蔽磷酸骨架间的静电排斥,盐越高双链越稳定、有效严格性越低;甲酰胺破坏碱基对之间的氢键,按体积比每 1% 约降低 Tm 0.6 °C,故在杂交液中加入 30–50% 甲酰胺可以在更低温度下维持同等严格性,减少靶分子的热降解。杂交后的梯度洗涤遵循同一逻辑:洗涤温度逐级升高、盐浓度逐级降低,把残留的弱结合分子依次洗脱。单个错配对稳定性的削弱与其位置有关:置于探针中央的错配使双链失去堆积连续性,Tm 下降最多;近末端的错配影响甚微——这正是 PM/MM 探针对(4.2.3 小节)与等位基因特异性寡核苷酸杂交(3.2 节)共同的物理基础。
严格性决定阵列的选择性,而选择性失守的产物就是交叉杂交(cross-hybridization):靶分子与并不完全互补的探针借助足够长的局部配对区结合。同源基因家族成员、重复元件与低复杂度序列是交叉杂交的主要来源;一旦发生,该点的荧光便成为数种转录本的混合物,信号无法归因于单一基因。更须警惕的是,这类偏差是系统性的而非随机的:重复实验不能消除它,只会忠实地复制它,使其在统计检验中获得虚假的显著性。
杂交动力学与信号噪声。杂交是二级反应:结合速率取决于探针与靶的浓度及靶向表面扩散的通量(固定化使探针附近的靶被局部耗竭,结合速率受扩散限制);解离速率则对双链稳定性呈指数依赖——完全配对双链与中央错配双链的解离速率常数可相差数个量级。过夜孵育(12–16 h)的意义正在于此:让慢解离的特异结合充分积累,而让快解离的非特异结合在结合—解离循环中被部分淘汰。信号的下限由非特异吸附与片基自发荧光决定,上限由探针容量与扫描仪线性范围决定;在低强度端,背景涨落使比值估计的方差急剧增大。这一"低信号、高方差"的误差结构并非本节独有,它将在 4.4 节的方差分析与归一化中再次出现。
习题 4.2-1
两条长度均为 14 nt 的候选探针:探针甲含 8 个 G/C 与 6 个 A/T,探针乙含 4 个 G/C 与 10 个 A/T。用 Wallace 规则估算二者的 Tm;说明在固定的杂交温度下哪条探针实际经受的严格性更低、其后果可能是什么,并指出该规则本身的两点局限。
参考解答由式 (4.2-1):Tm(甲) ≈ 2×6 + 4×8 = 44 °C;Tm(乙) ≈ 2×10 + 4×4 = 36 °C。若杂交温度固定(例如 42 °C),探针乙已处于其 Tm 之上,接近完全严格的条件,特异信号微弱;探针甲则比其 Tm 低约 2 °C,相对"宽松",故甲经受的有效严格性更低,更容易容忍含错配乃至部分互补的交叉杂交,信号中可能混入同源转录本的贡献。局限:其一,该规则只依赖碱基组成,忽略邻接堆积——组成相同而排列不同的序列 Tm 可差 10 °C 以上,故不能用于筛选 Tm 一致的探针组;其二,它隐含固定的盐浓度(约 1 mol/L 钠盐),不含甲酰胺项,也不反映探针固定于固体表面后的动力学改变。实用设计应采用最近邻热力学模型,并同时报告盐与甲酰胺条件。
4.2.2 双色 cDNA 点样阵列
第一张微阵列诞生于斯坦福大学 Brown 实验室:Schena、Shalon、Davis 与 Brown(1995)将拟南芥 45 个基因的 cDNA 点在载玻片上,把根与叶两个组织的 mRNA 分别以两种荧光染料标记后混合,在同一张片上杂交,一次读出 45 个基因在两个组织中的相对表达。这一实验确立了此后十年表达谱研究的两个基本范式——并行化与比值定量(Schena et al., 1995)。
制备。双色点样阵列的探针早期是从 cDNA 文库克隆经 PCR 扩增的产物(长数百 bp 至约 2 kb),其后多改为合成的 65–70-mer 长寡核苷酸。点样机器人(arrayer)以劈开钢针的接触式点样或压电非接触喷射,把它们沉积为直径约 100 μm 的点阵,每片数千至上万点。载玻片表面须经化学包被:多聚赖氨酸依靠静电吸附固定探针,操作简便但杂交中耐严格洗涤的能力有限;醛基硅烷表面则与氨基修饰的探针形成共价席夫碱连接,可耐受更严的洗涤条件(Shalon et al., 1996)。
双色共杂交与比值读出。实验流程为:两组 RNA 分别反转录为 cDNA,常用氨基烯丙基-dUTP 间接标记——先把带活性氨基的碱基掺入 cDNA,再与 Cy3、Cy5 两种花菁染料(cyanine dye)的 NHS 酯偶联,以避免大体积染料直接掺入对酶促反应效率的干扰。等量混合两种标记产物后覆盖于阵列,45–65 °C 孵育过夜;洗涤后以双激光共聚焦扫描分别用 532 nm 与 635 nm 激发两通道,逐点读取荧光。对每个点定义
双色设计的精髓是内参化:两个样品在同一张片、同一个点上同时竞争同一批固定探针,点与点之间探针固定量的差异、局部杂交条件的起伏、扫描增益的漂移,对两个通道而言是共同的,在比值 M 中大体抵消。比较在片内完成,而不必依赖片与片之间的一致性——这是双色平台对抗制作变异的核心手段。叠加伪色图上,黄点表示两样品相当,红点与绿点分别偏向 Cy5 与 Cy3 一侧。需要强调的是,染料并非完美对称:Cy3 与 Cy5 的掺入效率、量子产额与光漂白速率不同,且偏差随信号强度变化,故配对实验须配合染料交换(dye swap)或平衡设计,详见 4.3 节。
Schena 1995:第一张微阵列上的根与叶。45 个拟南芥基因的 cDNA PCR 产物以自制点样仪印于载片;根与叶的 poly(A) RNA 分别以两种荧光标记后同片杂交。结果与生理学直觉严丝合缝:光合作用相关基因在叶片中信号占优,而根中富集的转录本一目了然;同一基因的比值与既知 Northern 结果方向一致。该实验的意义不在于基因数目——45 个远谈不上"组"——而在于证明了标记—混合—共杂交—比值读出这一流程的可扩展性。斯坦福团队随后公开点样仪图纸与实验规程(Shalon et al., 1996),使学术界得以自制阵列,形成了与商品化芯片并行的"斯坦福谱系"。
4.2.3 Affymetrix 原位合成寡核苷酸阵列
与"先制备探针再点样"的路线相反,Affymetrix 路线把探针直接在基片上合成。Fodor 等(1991)将半导体光刻与固相磷酰胺化学结合:石英基片上的连接子带光敏保护基,光刻掩膜选择性地照射部分特征(feature),曝光处保护基被去除、暴露出活性端,随后偶联一种仍带保护的核苷;更换掩膜、更换碱基,逐轮迭代。每轮循环使用对应四种碱基的掩膜组,25 轮即得长度为 25 的寡核苷酸,故称 25-mer。特征尺寸逐代微缩,使每片可容纳数十万乃至上百万个特征。Lockhart 等(1996)证明该平台能以与定量 PCR 一致的动力学监测基因表达,奠定了商品化 GeneChip 的基础。
探针组与 PM/MM 设计。每个基因并非只对应一条探针,而是一个探针组(probe set):典型地由 11–20 条彼此不重叠的 25-mer 组成,取自转录本 3′ 端约 600 bp 范围内(兼顾降解 RNA 与扩增反应的 3′ 偏置,见 4.2.5 小节);多条探针的汇总使单条探针的偶发交叉杂交不至于主导结论。对每条完全匹配探针(perfect match, PM),另合成一条错配探针(mismatch, MM):除中央(第 13 位)碱基被置换外与 PM 完全相同。设计意图是:非靶分子的交叉杂交主要取决于序列的整体组成与长度,而非某一个特定碱基,因此 MM 与 PM 结合非靶分子的行为几乎相同;二者相减(PM − MM)即可近似扣除非特异背景,保留特异信号。
标记与读出。Affymetrix 平台采用单色体系:样品 RNA 经含 T7 启动子的引物反转录后,以体外转录线性扩增为生物素标记的 cRNA,片段化后杂交;洗涤后以链霉亲和素—藻红素染色扫描。一个样品对应一张芯片,任何比较都在片间进行——这恰与双色平台互为镜像:点样阵列把比较压进片内,寡核苷酸阵列把比较交给片间的归一化(4.4 节)。
从 PM − MM 到 RMA:汇总算法的演进。第一代软件以探针组的平均差(各对 PM − MM 的均值)估计表达量,常出现负值;MAS 5.0 改用 Tukey 双权平均,并在 MM 信号高于 PM 时以"理想错配"替代;RMA(Irizarry et al., 2003)则根本改变了假设——背景不用 MM 估计,而是以全片低强度分布的卷积模型估计,汇总只用 PM、在对数尺度以中位数平滑跨探针加权,方差更小、重复性更好。方法演进的教训是:算法也是平台的一部分,比较不同研究时必须同时比较其数据处理流程。
习题 4.2-2
简答:(1) Affymetrix 阵列为每条 PM 探针配套一条中央碱基被置换的 MM 探针,其设计意图是什么?(2) 为什么这一设计后来被认为存在问题,后续算法如何处置 MM?
参考解答(1) 意图是逐探针估计并扣除非特异杂交:MM 与 PM 序列仅差中央一个碱基,整体组成、长度几乎相同,故与无关靶分子交叉杂交的行为几乎一致;而真靶与 PM 完全互补、与 MM 含一个中央错配,结合强度有差。因此 PM − MM 近似等于"特异信号"。(2) 问题在于 25-mer 中单个中央错配只使 Tm 降低数度至十余度,MM 对真靶仍有可观结合,PM − MM 会连真实信号一并扣除,低表达基因的差值甚至为负、方差被放大。后续处置:MAS 5.0 在 MM 大于 PM 时引入"理想错配"替代;RMA(Irizarry et al., 2003)干脆弃用 MM,改以全片强度分布建模背景并只用 PM 汇总。此后 MM 主要退居质量控制角色——其用途在平台存续期内被持续弱化,是"设计意图必须接受数据检验"的典型案例。
4.2.4 其他平台与演进
喷墨原位合成长寡核苷酸阵列。Agilent 的路线以非接触式压电喷头把四种磷酰胺"墨水"直接喷印到载片上原位合成 60-mer 探针。喷墨无需光刻掩膜,更换设计只需重排喷印指令,定制极为灵活。Hughes 等(2001)系统评估了该平台:60-mer 在灵敏度上显著优于 25-mer(信号高数倍),同时保留了足够的单碱基分辨能力,与 cDNA 阵列的结果一致性良好——长寡核苷酸从此成为点样与原位合成两条路线的共同选择。
微珠阵列。Illumina 的 Sentrix 珠阵把每类探针做成独立的单元:直径约 3 μm 的硅珠上偶联约十万条同一序列的寡核苷酸(另含一段地址标签),珠子以自组装方式落入玻片蚀刻的微孔,每个微孔恰容一珠。由于哪类珠落入哪个孔是随机的,需经数轮荧光"解码"杂交读出每个微孔的身份。珠阵的显著优点是内部冗余:每类探针通常有二三十颗珠分布在不同位置,其信号取中位数后对局部缺陷稳健;Sentrix Array Matrix 进一步把 96 束光纤束组装为矩阵,使其可以像 96 孔板一样整板并行处理 96 个样品,样本试剂消耗也远低于玻片阵列。
用途的分化。伴随平台成熟,阵列按科学问题分化出多个亚型:全基因组表达谱阵列以每基因一个探针组测量总体表达;全外显子阵列为每个外显子布设多条探针,把分辨率推进到外显子与剪接异构体层面;tiling 阵列则抛开基因注释,在非重复基因组上按固定步长铺满探针,用于发现未知转录本、绘制广泛转录的非编码 RNA 图谱,并衍生出 ChIP-on-chip(转录因子结合与组蛋白修饰定位)与 array-CGH(拷贝数变异检测)等重要应用。表 4.2-1 对主要平台作系统比较。
| 平台 | 探针长度 | 合成/固定方式 | 标记体系 | 通量(每片探针数) | 主要厂商谱系 |
|---|---|---|---|---|---|
| 双色点样 cDNA 阵列 | 0.2–2 kb PCR 产物,或 65–70-mer 长寡核苷酸 | 点样机器人(接触钢针/压电喷射)沉积于多聚赖氨酸或醛基包被载片 | Cy3/Cy5 双标记,同片共杂交,比值读出 | 约 104 点/玻片 | 斯坦福自制谱系(Schena et al., 1995;Shalon et al., 1996),后有多种商品化点样系统 |
| Affymetrix GeneChip | 25-mer | 光刻掩膜 + 磷酰胺步进原位合成 | 生物素 cRNA 单标记,链霉亲和素—藻红素显色 | 约 105–106 特征/片 | Affymetrix(Fodor et al., 1991;Lockhart et al., 1996) |
| 喷墨原位合成阵列 | 60-mer | 非接触压电喷墨原位合成,无掩膜、可定制 | Cy3/Cy5 双色或单色 | 约 105 探针/片 | Rosetta Inpharmatics → Agilent(Hughes et al., 2001) |
| 微珠阵列 | 约 50-mer 捕获探针(连于微珠,含地址标签) | 硅珠自组装入蚀刻微孔,系列解码杂交定址 | 生物素或 Cy3 单色 | 约 105 珠/样品 | Illumina(Sentrix Array Matrix / BeadChip) |
表中各行并非简单的竞争关系,而是"探针长度—合成方式—标记体系"在不同约束下的组合权衡:长探针灵敏而交叉杂交风险高,短探针特异而信号弱;双色设计内参化但染料不对称,单色设计片间比较但流程标准化;点样灵活自制但片间变异大,原位合成一致性好但探针一经定型便无法测量设计之外的序列。理解这些权衡,是 4.2.6 小节选型讨论的前提。
4.2.5 探针设计原则
无论何种平台,阵列质量的第一道关口都是探针设计。设计可概括为一个滑动窗口的筛选问题:在候选转录本上滑动取窗,按以下原则逐条过滤与排序(图 4.2-2)。
- 特异性。探针应唯一匹配目标基因。候选序列须与参考转录组/基因组比对筛查(所用工具即 2.6 节的 BLAST 一类局部比对算法):要求唯一命中,或至少与次佳命中的得分差距足够大;命中同源基因家族共有结构域、低复杂度或重复序列的候选一律剔除。否则信号将是家族若干成员之和,既不能归因,也无法在家族成员间分辨。
- Tm 一致性。一次杂交只有一个温度、盐浓度与甲酰胺比例,故同一阵列上所有探针的预测 Tm 应收敛在窄区间内(常用最近邻参数而非 Wallace 规则计算),并把 GC 含量控制在约 40–60% 的窗口。否则同一张片上有的探针已饱和、有的尚未有效结合,基因之间便失去了共同的定量标尺。
- 3′ 端偏向。oligo-dT 引导的反转录与基于 T7 的体外转录都自 poly(A) 端出发,部分降解的 RNA 也倾向保留 3′ 端,因此靠近 3′ 的探针信号更稳定;Affymetrix 探针组即取自 3′ 端约 600 bp。代价是 3′ 非翻译区注释不全、种属特异且富含多态,故在 RNA 质量允许时,现代设计(如外显子阵列)更倾向于沿全转录本散布探针。
- 避开多态位点。探针(尤其中心区)落在 SNP 密集区时,不同基因型样品的结合效率不同,会制造与表达无关的"假性差异",跨个体、跨品系比较中尤须核查。
- 兼顾可变剪接的布局。要把异构体区分开,须布设外显子接合探针(exon junction probe):25-mer 中如 13 nt 取自前一外显子末端、12 nt 取自后一外显子起点,则该探针只匹配发生了这一特定剪接连接的分子;配合外显子内探针,可推断外显子跳读等事件。设计时须注意接合探针的 Tm 与普通探针一致化,以及内含子保留事件造成的覆盖盲区。
4.2.6 平台间可比性与选型
平台如此多样,一个自然的问题随之而来:不同平台测得的同一致谢物状态,可比吗?微阵列质量控制联盟(MicroArray Quality Control, MAQC)针对这一问题组织了大规模系统研究:同一批参考 RNA 样品(含两种通用参考样品及两个按已知比例混合的样品)被分发至多个实验室,在多类商业化平台上重复测量,并对全部数据用统一的分析流程重新处理(MAQC Consortium, 2006)。其结论可定性概括为三点:其一,平台内与实验室内的重复性很高;其二,平台间 log 比值的一致性属中等——高丰度、高强度基因的一致性最好,低强度区差异明显;其三,也许最具警示意义的是,同一平台不同实验室(及不同数据处理方案)得到的差异基因列表之间的方差,往往大于不同平台之间的方差。换言之,操作与分析的标准化程度,比平台本身更决定结果的可重复性。
批次效应的普遍性。试剂批号、阵列批次、扫描日期、操作者、RNA 提取的日期——每一个与生物学无关的操作因素都可能留下系统性的指纹,统称批次效应(batch effect)。当批次与生物学分组发生混杂(例如全部对照样品在第一周处理、全部病例样品在最后一月处理),批次效应将直接冒充生物学差异,且任何统计检验都无法在事后将其分离。MAQC 之所以把同一批样品分发到多个站点,正是为了把"平台、实验室、操作"从生物学变量中解耦。防线的两道关口分别在设计与分析:4.3 节的随机化、区组与平衡设计使批次无法与分组混杂,4.4 节的归一化与批次建模则处理残余的系统偏移。
在上述认识的基础上,平台选择可以整理为一棵决策树(图 4.2-3)。第一层是科学问题本身:若需要发现未知转录本、新剪接形式或序列变异,阵列原则上无能为力——探针一经固定,便只能测量"预先设计好"的分子,这类问题的答案属于 RNA 测序(4.7 节)。第二层是样品约束:RNA 起始量少或部分降解时,应选扩增需求低、探针偏 3′ 的平台(如微珠阵列一类小样品量体系)。第三层才是通量与预算的经济学:配对比较且预算有限时,双色点样阵列以"一张片完成一次比较"内参化,片数减半;大样本多中心研究则宜选标准化程度高的商品化单色平台;聚焦特定基因集或异构体的课题可利用喷墨定制或外显子/接合探针阵列。需要说明的是,原书出版于 2009 年,彼时微阵列仍是转录组测量的主力平台,RNA 测序刚刚开始接管发现型任务;此后十年测序成本持续下降,但阵列以其低成本、标准化与成熟的分析生态,在表达谱分型等场景中长期保有位置。
归结起来,本节的中心论点可以压缩为一句话:平台选择不是在"最好与最差"之间挑选,而是让误差结构与研究问题相匹配。双色阵列把片间变异折叠进比值,代价是染料不对称;寡核苷酸阵列以短探针与探针组换取特异性,代价是片间比较依赖归一化;珠阵以冗余换取稳健,喷墨以灵活换取规模经济。理解每种设计"用什么误差换掉了什么误差",才能读懂数据的可信边界——这正是下一节实验流程与设计(4.3 节)要正面处理的问题。
习题 4.2-3
为以下三个研究场景各选择一种最合适的微阵列平台,并从比较结构(片内/片间)、样品约束与误差控制三方面说明理由:(1) 30 对配对的肿瘤与癌旁组织,预算有限,关心的是每对组织的相对表达变化;(2) 多中心临床分型研究,需在数百份冻存 RNA 样品上测量全基因组表达并跨中心汇总;(3) 在注释良好的模式生物中,系统区分某基因家族各成员的可变剪接异构体。
参考解答(1) 双色点样 cDNA/长寡核苷酸阵列:配对设计恰好契合"两个样品同片共杂交",比较在片内完成,点间与片间制作变异在比值中抵消,30 张片即可完成 30 次配对比较,片数与预算减半;辅以染料交换控制染料偏倚。(2) 商品化单色平台(Affymetrix 或微珠阵列):数百份样品逐一上片、比较在片间进行,需要标准化制备、稳定的质量控制与成熟的归一化流程;多中心场景下尤须按 MAQC 的教训统一操作规程与分析管线,并以随机化、区组化防止批次与中心、分组混杂。(3) 外显子阵列或含外显子接合探针的定制喷墨阵列:异构体分辨要求接合探针跨外显子边界、外显子内探针全覆盖,同时须避开家族共有域以保证成员特异——这正是喷墨定制平台"改设计无需换硬件"的优势所在;若还需发现注释之外的新异构体,则超出任何阵列的能力范围,应转入 RNA 测序(4.7 节)。
关键术语
- 探针 (probe)
- 固定于阵列基片、序列已知的核酸分子;与之互补结合的样品分子称为靶。
- 解链温度 (melting temperature, Tm)
- 一半双链解离为单链时的温度,衡量双链稳定性;由组成、邻接关系与溶液条件共同决定。
- 杂交严格性 (hybridization stringency)
- 温度、盐浓度与甲酰胺共同决定的条件严苛程度,控制错配双链能否存留。
- 交叉杂交 (cross-hybridization)
- 靶分子借局部配对区与不完全互补探针结合的现象,是阵列系统性噪声的主要来源。
- 双色微阵列 (two-color microarray)
- 两个样品以 Cy3/Cy5 分别标记后同片共杂交、以 log₂ 比值定量的阵列设计。
- 原位合成 (in situ synthesis)
- 在基片表面以光刻或喷墨方式逐碱基直接合成寡核苷酸探针的制备路线。
- PM/MM 探针对 (perfect match / mismatch probe pair)
- 序列仅中央碱基不同的成对探针;PM − MM 曾用于扣除非特异信号,后被全片背景建模取代。
- 探针组 (probe set)
- 针对一个基因、取自转录本不同位置的十余条探针的集合,汇总后估计该基因表达量。
- 外显子接合探针 (exon junction probe)
- 跨越外显子—外显子边界的探针,只匹配特定剪接连接,用于区分异构体。
- 批次效应 (batch effect)
- 由试剂、阵列批次、扫描日期等与生物学无关的因素引起的系统性信号偏移。
参考文献与延伸阅读
- Gibson G, Muse SV. 2009. A Primer of Genome Science, 3rd ed. Sunderland (MA): Sinauer Associates. (Chapter 4)
- Schena M, Shalon D, Davis RW, Brown PO. 1995. Quantitative monitoring of gene expression patterns with a complementary DNA microarray. Science 270: 467–470.
- Shalon D, Smith SJ, Brown PO. 1996. A DNA microarray system for analyzing complex DNA samples using two-color fluorescent-probe hybridization. Genome Research 6: 639–645.
- Fodor SP, Read JL, Pirrung MC, Stryer L, Lu AT, Solas D. 1991. Light-directed, spatially addressable parallel chemical synthesis. Science 251: 767–773.
- Lockhart DJ, Dong H, Byrne MC, Follettie MT, Gallo MV, Chee MS, Mittmann M, Wang C, Kobayashi M, Horton H, Brown EL. 1996. Expression monitoring by hybridization to high-density oligonucleotide arrays. Nature Biotechnology 14: 1675–1680.
- Hughes TR, Mao M, Jones AR, et al. 2001. Expression profiling using microarrays fabricated by an ink-jet oligonucleotide synthesizer. Nature Genetics 25: 333–337.
- Irizarry RA, Hobbs B, Collin F, et al. 2003. Exploration, normalization, and summaries of high density oligonucleotide array probe level data. Biostatistics 4: 249–264.
- MAQC Consortium. 2006. The MicroArray Quality Control (MAQC) project shows inter- and intraplatform reproducibility of microarray measurements. Nature Biotechnology 24: 1151–1161.