第4章 · 4.6

4.6 批次效应:诊断、设计与校正

Batch Effects: Diagnosis, Design and Correction
摘要 批次效应沿标记组、进样 run 与日/仪器三个尺度渗入定量矩阵;每批仅十来个细胞、缺失密布,偏移既估不准,又易与缺失结构纠缠。本节先给诊断工具,再立主线:设计先于校正——随机化、参考通道与同型对照在数据产生之前切断混杂;进而梳理从参考通道比率化、ComBat 收缩到线性模型协变量的方法谱系,并交代校正的边界与报告义务。

4.6.1 批次的三种尺度与物理来源

任何定量测量都嵌在材料与时间之中:试剂有批号,色谱柱有寿命,仪器有漂移。批次效应(batch effect)指与研究的生物学变量无关、却按样品的分组方式系统出现的定量偏移。它值得单列一节,是因为分组不止一个层级,而每一层都有自己的物理来源。以本教程沿用的 SCoPE2 子集为例——4 个 run、每 run 一个 16 通道 TMT 组(Gomoryova and Hecht, 2025)——至少可以分辨三个尺度。

定义

批次效应:与生物学无关、按样品分组(标记反应组、进样 run、制备日、仪器)系统出现的定量偏移。它区别于随机噪声——方向系统、可重复出现;也区别于生物学差异——换一批试剂、重新校准仪器后即可改变。判断一个偏移是不是批次效应,看它是否随分组而非随条件变化。

最细的一层在多重标记组(multiplexing batch)内部:16 个通道共用一次 TMT 标记反应,各通道试剂的反应效率与同位素纯度不尽相同,通道之间因此带有固定的相对偏倚;教程数据里载体、参考、空白与 13 个单细胞通道同处一组,任何一个通道的标记效率偏低,分给它的细胞便整列偏暗。第二层是 run(进样针次):同一序列里这一针与下一针之间,色谱柱在老化、喷雾稳定性在变化、上样量有出入,整组通道随针次整体漂移。第三层最粗,跨 run 而存在:制备日不同(试剂批号、温湿度)、仪器校准漂移、操作者更换,都属于日/仪器批次。图 4.6-1 把三个尺度画在同一张嵌套图里。

批次效应的三个尺度:TMT 组内通道差异、run 间漂移、日/仪器批次 批次效应的三个尺度:通道 — 针次 — 日/仪器 日 / 仪器批次(跨 run) 校准漂移 · 试剂批号 · 制备环境 run 1 · 进样针次 载体 参考 空白 13 个单细胞通道 柱老化 喷雾稳定性 上样量波动 run 间漂移 run 2 · 进样针次 载体 参考 空白 13 个单细胞通道 整组随针次 整体偏移 通道尺度(TMT 组内):标记试剂效率 · 同位素纯度 · 通道间偏倚 run 尺度(针次间):色谱柱老化 · 喷雾稳定性 · 上样量波动 日 / 仪器尺度(跨 run):校准漂移 · 试剂批号 · 制备环境 示例口径:SCoPE2 子集,4 个 run × 16 通道,每 run 一个 TMT 组(Gomoryova and Hecht, 2025)
图 4.6-1 批次效应的三个尺度。绿色括线标出 TMT 组内的通道尺度:载体、参考、空白与 13 个单细胞通道共用一次标记反应,通道间带有试剂效率与同位素纯度带来的相对偏倚;实线框为 run 尺度,整组通道随针次漂移(柱老化、喷雾稳定性、上样量);虚线框为日/仪器尺度,跨 run 的校准漂移与试剂批号变化。三个尺度层层嵌套,各自需要不同的对策。

三个尺度的相对分量并不相同。标记效率与上样量以乘法作用在通道或整列上,第 4.3 节的双重归一化已经折掉大半;run 间与日间的漂移作用在组间,归一化看不见分组结构,必须显式处理。SCoPE2 把单细胞强度先表达为相对参考通道的比值(Specht et al., 2021),正是在测量现场先行锚定 run 尺度的乘法漂移——这一步的意义到 4.6.4 再展开。

实践中三个尺度常被合并处理。教程数据里每个 run 就是一个 TMT 组,批次变量径直取 run;若多个 run 同日完成,日尺度与 run 尺度部分重合,硬性区分反而无益——批次变量的取值应与"可能一起漂移的样品组"对应,而不是照抄日历(Gomoryova and Hecht, 2025)。定义批次本身就是一次建模决策。

4.6.2 单细胞蛋白组为何格外脆弱

批次校正的统计核心,是估计每批的偏移再把它扣除。估计的原料是批内样品:Bulk 蛋白组一个批次动辄几十上百个样品,单细胞蛋白组一个 run 至多 16 个通道,扣除载体、参考与空白后只剩十来个细胞;摊到每个蛋白上,缺失让可用数值更少。批均值的方差与批内有效样本量成反比——量少,估计就抖。同一批细胞换一天重跑,得到的批偏移估计可能相去甚远;这不是算法的过错,是数据给不出更稳的估计。

以教程数据为例:每个 run 扣除载体、参考与空白后留下 13 个单细胞通道,一个蛋白若再缺失三成,批均值便建立在九个数值上;Bulk 实验一个批次常有数百样品。估计的原料相差一个数量级以上,这不是精巧算法能够弥补的差距。

缺失让局面更糟。某个 run 灵敏度下降,低丰度肽段率先跌破检出限,缺失于是按 run 聚集:信号差的批缺失多。这种与批次相关的缺失会系统抬高该批观测值的中位数——能被检出的本来就是偏高的那部分。此后的每一步都继承这个偏倚:归一化的中位数被抬高,填补从其他批借值抹掉结构,ComBat 在填补后的矩阵上估计批均值时,看到的是被缺失与填补改写过的批次结构(填补先于批次校正的顺序约束见 4.3.6)。诊断因此必须先看缺失按批次的分布,再谈校正(Grégoire et al., 2024)。

两件事合起来,给出本节的立场:单细胞蛋白组的批次问题首先是设计问题。批内样品少、缺失密,留给校正算法的冗余很少;算法救不回估计不出的量。与其指望校正,不如让数据在产生之初就便于把批次与生物学分开——这是 4.6.4 的主题,先看诊断。

4.6.3 诊断:PCA、参考通道与重复样品

第一件工具是按批次着色的 PCA。把蛋白矩阵(教程流程中即 ComBat 之前的矩阵)投影到前两个主成分,分别用批次与生物条件各画一张:批次着色的图上若各批自成一群,警讯即成立——数据的最大方差方向被技术差异占据。读图须记住 PCA 只呈现前两维,批次若藏在更低的维度,还需按批分组的分布图辅助。图 4.6-2 并排画出两种典型情形。

体检还有第零步:看缺失按批次的分布。逐 run 画出每个细胞的缺失比例,信号差的 run 缺失明显偏高时,先回 4.3 的 run 规模过滤与 4.4 的缺失机制讨论,再谈校正——缺失结构未被辨认之前,任何批次估计都在被它悄悄改写。表 4.6-1 把整套体检整理成检查单。

表 4.6-1批次体检检查单:四件工具各盯一个层面
工具看什么警讯
缺失按批分布逐 run 的细胞缺失比例某批缺失系统性偏高:偏移已与缺失结构纠缠
批次着色 PCA前两主成分上点团的归属各批自成一群:最大方差被技术差异占据
条件着色 PCA与批次着色图对照两图同形:批次与条件完全混杂
参考通道轨迹逐 run 的参考中位 log2 强度某点大幅偏离:该 run 整体漂移
对照细胞跨批 CV同型对照的批间变异校正后不降反升:过度校正
PCA 诊断:左为平衡设计(条件与批次方向正交),右为完全混杂(一个方向承载两种差异) PCA 诊断:批次与条件的两种关系(示意数据) 平衡设计:两个方向正交 A B PC1:条件方向(可分离) PC2:批次方向(可作协变量扣除) 完全混杂:一个方向、两种解释 条件与批次同向,无法区分 A(仅 run 1) B(仅 run 2) PC1:条件与批次混同 PC2 A · run 1 A · run 2 B · run 1 B · run 2 完全混杂:A 全在 run 1、B 全在 run 2;任一分离方向都同时解释两种差异
图 4.6-2 PCA 诊断的两种情形(示意数据)。左:平衡设计下每个 run 都含 A、B 两条件,条件差异落在 PC1、批次偏移落在 PC2,两个方向正交——批次可作为协变量扣除,条件差异照常可估。右:两 run 分别只放 A 与 B,条件与批次共享同一根轴,四个点团的位置既可解释为条件差异,也可解释为批次偏移,PCA 上无法再拆开(式 4.6-1 的不可识别)。
案例

从 PCA 认出混杂。某次分析画出两张图:按条件着色,两个点团清晰可分;按 run 着色,还是同样两个点团——条件与 run 一一对应。此时任何"条件差异"的解释都不成立:观察到的分离可以全部来自条件,也可以全部来自 run,或是两者的任意混合(式 4.6-1)。正确处置不是换更强的校正算法,而是回到设计:下一批实验把两个条件的细胞混进每个 run。混杂一旦进入数据,图上无法再拆开。

第二件工具是参考通道的跨批轨迹。每个 run 都有一个来自同一匀浆池的参考通道,它不携带生物学变量;逐 run 画出其中位 log2 强度,得到的曲线就是仪器与流程漂移的直接记录——某个 run 整体低半截,曲线立刻显形。参考通道是唯一在所有批次中内容不变的样品,轨迹的起伏为 run 间偏移提供幅度参考,也顺带校核校正参数是否量级合理(式 4.6-2 的 τ 与 σ)。

第三件工具是跨批重复样品的变异系数。在每批放入同种对照细胞(4.6.4 的设计要求),同一蛋白在这些细胞间的 CV 便是技术噪声的直接估计:批内 CV 给出测量下限,跨批 CV 给出批次引入的额外方差。校正前后各算一次,跨批 CV 下降说明校正起效;不降反升,即过度校正的信号(4.6.6)。三件工具各盯一个层面:PCA 看全局结构,参考通道看尺度漂移,重复样品看绝对噪声——合起来才是一次完整的批次体检。

4.6.4 设计先于校正:切断混杂

校正算法的工作对象是既成的数据;设计决定数据里可不可能把批次与生物学分开。随机化(randomization)是第一原则:把各条件的细胞均衡分进每个批次,每个 run 里 A 与 B 都有、比例一致。如此批次指示变量与条件指示变量近似正交,模型得以分别估计二者——可估,是可校正的前提。用最小的模型把这句话说清:

yij = μ + β·xj + γ·zj + εij
(4.6-1)yij 为蛋白在细胞 j 的 log2 定量;xj 为条件指示(条件 B 取 1),zj 为批次指示;β 是要检验的生物学差异,γ 是批次偏移,ε 为噪声。β 与 γ 能否分别估计取决于设计:x 与 z 近似正交时二者皆可识别;x = z(完全混杂(confounding))时数据只含 β + γ。

反例用最小的算术就能讲清。两批各测两个细胞:批 1 只放条件 A,批 2 只放条件 B。记 A 的期望为 μ、B 为 μ + β,批 2 相对批 1 偏移 γ,则两团观测的期望分别为 μ 与 μ + β + γ,数据能提供的只有两团之差 d = β + γ——一个方程,两个未知数。(β, γ) 取 (d, 0) 与 (0, d) 给出完全相同的拟合:前者断言差异全是生物学,后者断言全是批次,任何中间分配同样合法。这不是算法不够强,是可识别性(identifiability)的失效:校正软件必须在无穷多组解里挑一组,挑选依据是它内置的假设——批效应均值为零、多数蛋白不变之类——而假设对不对,数据无法作证。完全混杂的设计,等于把结论押在看不见的假设上。

平衡设计(balanced design)是随机化的落实形态:不仅每个 run 都含各条件,各 run 间的条件比例也保持一致(如习题 4.6-2 的 6/7 交替)。比例一致时,条件均值与批次均值在代数上互不污染;比例失衡但未混杂时模型仍可估计,只是方差增大——失衡越重,留给批次估计的自由度越少。

警示

校正救不了坏设计。两批分别只放条件 A 与 B 时,批次与条件共享同一个指示变量,任何校正方法都在做同一件事:用自身假设替代数据给不出的信息。ComBat 会按它的先验把两团拉开到"合理"的程度;"先校正再检验"的流程再把这个假设带进显著性。唯一的解法在数据产生之前:随机化、平衡、每个 run 都放各条件的细胞。

设计端还有两件常规武器。其一是参考通道(reference channel)贯穿所有批次:每个 TMT 组都由同一匀浆池占一个通道,单细胞强度表达为相对它的比值,run 层的乘法漂移在测量现场即被锚定(SCoPE2 的惯例,Specht et al., 2021)。其二是每批放入同型对照细胞(same-type control cells):一种不参与比较、各批都有的细胞,为批次体检提供重复样品(4.6.3 的第三件工具),也为"数据是否正常"提供批内基线。

方法

参考通道锚定的机理与前提。载体通道负责放大信号(4.5),参考通道负责固定尺度:它均一、足量,组内取值稳定,单细胞除以它便消去该组共同的乘法因子。两个前提要盯住:一是参考池必须同源且充分混匀,否则各 run 分到的"同一参考"并不相同,锚定反而引入漂移;二是参考强度须落在单细胞与载体之间可用的动态范围内,太低则自身的测量噪声经由除法进入每个细胞。参考通道解决 run 尺度;日/仪器尺度仍靠随机化与制备批管理。

习题 4.6-1

两批数据:批 1 只含条件 A 的 3 个细胞,某蛋白 log2 强度均值为 10.0;批 2 只含条件 B 的 3 个细胞,均值为 12.2。(a)写出观测差 d,并按式 (4.6-1) 说明 d 由哪两个参数构成。(b)给出三组都完全拟合数据的 (β, γ),并说明各组对应什么假设。(c)在三组解释下,批 2 的"校正后均值"各是多少?由此说明完全混杂时校正结果由什么决定。

参考解答

(a)d = 2.2 = β + γ(以批 1 为基准,γ 为批 2 的批次偏移)。(b)(2.2, 0)、(0, 2.2)、(1.1, 1.1),以及一切满足 β + γ = 2.2 的组合都给出同一组观测期望:(2.2, 0) 断言差异全为生物学、批次无偏移;(0, 2.2) 断言两条件蛋白量相同、差异全为批次;(1.1, 1.1) 各占一半。(c)批 2 校正后均值 = 12.2 − γ,三组解释分别得 12.2、10.0、11.1,相去甚远;数据无法在三者之间裁决,结果完全由方法内置的假设决定——这就是不可识别。

习题 4.6-2

为 4 个 run × 16 通道的 TMT 实验设计随机化排布。可用品类:载体通道(200 个细胞,同池)、参考通道(同池匀浆)、空白通道,以及条件 A 与条件 B 的单细胞各 26 个。(a)给出每个 run 的通道分配方案,说明条件如何平衡。(b)通道位置(126、127N、127C……)要不要随机化?为什么?(c)列出至少两条"设计即校正"的措施,并注明各自针对的批次尺度。

参考解答

(a)每个 run:1 载体 + 1 参考 + 1 空白 + 13 个单细胞;13 拆为 A 6 / B 7 与 A 7 / B 6 交替,4 个 run 合计 A 26、B 26。每个 run 内两条件同在,批次不再与条件一一对应,式 (4.6-1) 的 β 与 γ 皆可估计。(b)要。TMT 各通道的试剂效率与同位素纯度存在细微差异(通道尺度),若 A 总占低质量数通道、B 总占高者,通道偏倚便与条件混杂;把细胞随机分到通道位置可切断这条相关。(c)例如:参考通道贯穿 4 个 run——锚定 run 尺度;载体与参考自同一池分装——控制标记批差异;全部细胞在同一制备批(如 nPOP 一张玻片)完成——消除制备日尺度;空白通道监控残留污染。任答两条即可。

4.6.5 校正方法的谱系

设计把可识别性安排好之后,剩下的组间偏移交给校正。方法大致四档,表 4.6-2 总览。最简单的一档其实已在设计端完成大半:把每个通道表达为相对参考通道的比值,run 层的乘法偏移随除法消去。这是对齐而非建模——不估计任何参数,前提只有参考通道本身的稳定。

表 4.6-2批次校正方法谱系:输入层级、核心假设与单细胞下的风险
方法层级与输入核心假设单细胞下的风险与对策
参考通道比率化run 内,通道层参考样品稳定、足量只折乘法偏移;参考自身漂移则全体跟着漂
中位数/分位数归一化列或行的稳健统计量多数蛋白跨批不变不识别分组;每蛋白观测少,分位数估计不稳
ComBat蛋白层,完整矩阵,按 run 分批批均值可估;设计矩阵保护真实差异小批次估计不稳,靠经验贝叶斯收缩缓解
线性模型协变量(scplainer)蛋白层,建模与检验一体批次与条件在设计上可分设计混杂时模型不可识别,须先回 4.6.4

第二档是中位数或分位数归一化:假设多数蛋白在批间不变,用稳健统计量强行对齐分布。该假设在 Bulk 数据有经验支撑,在单细胞下更脆——每个蛋白在每个细胞里的观测常只有一两个,"多数不变"无从检验;分布对齐还会把大跨度的真实生物学结构(如分化带来的整体重塑)一并压平。更要紧的是它不识别分组:归一化按列或行进行,看不见"这几列同属一个 run"的结构,批间偏移只是被顺带稀释,并非针对校正。第 4.3 节的双重归一化属于此类,正因如此它之后还要有专门的批次步。

归一化

作用于列或行自身,折的是尺度:上样量、标记效率、离子化效率。它不识别分组结构——看不见"这几列同属一个 run";对数尺度上等价于减去一个稳健统计量。

批次校正

作用于组间,折的是偏移:run 与日/仪器的系统漂移。它显式使用分组信息,且以"批次与条件在设计上可分"为前提。二者次第使用,互不替代。

第三档是 ComBat。它按显式批次分组建模:对每个蛋白先估各批的均值偏移 γ 与尺度偏移,再用经验贝叶斯(empirical Bayes)把逐蛋白的估计向全体蛋白的分布收缩(shrinkage),最后减去收缩后的均值偏移、除以尺度偏移(Johnson et al., 2007)。收缩恰好命中单细胞的软肋:批内样品少,单蛋白的批均值估计方差大;借全体蛋白的信息,估计被拉向更稳的中心,权随本批样本量与信噪比变化(式 4.6-2)。教程流程正是在蛋白层按 run 使用 ComBat,并以样品类型构造设计矩阵,把单核与巨噬细胞的真实差异保护在校正之外(Gomoryova and Hecht, 2025;Grégoire et al., 2024)。

γb* = ( nbτ2·γ̂b + σ2·γ̄ ) / ( nbτ2 + σ2 ) = wb·γ̂b + (1 − wb)·γ̄
(4.6-2)γ̂b 为批 b 的观测批均值,γ̄ 为跨批先验均值,nb 为批内样本量,τ2 为批效应的批间方差,σ2 为批内噪声方差。权 wb = nbτ2/(nbτ2 + σ2):样本量越大、批效应越强,w 越接近 1,估计由数据主导;噪声越大,w 越小,估计向先验收缩。此为共轭正态下的示意形式,ComBat 的参数化实现细节不同,思想一致。

第四档不再产出"校正后的矩阵",而是把批次当协变量放进线性模型,与条件同时估计、同时检验——差异检验与批次处理一步完成(scplainer 思路,Vanderaa and Gatto, 2025)。两段式流程(先校正再检验)会把校正的估计误差固化进数据,后续检验无从知道这些值已被改动;一体建模则让批次的不确定性与条件的假设检验共享同一套方差框架。代价是对设计的要求更硬:混杂的设计在这里同样不可识别,只是报错更早。

习题 4.6-3

某蛋白在 6 个同型对照细胞中的 log2 强度:批 1 为 10.0、10.4、10.8;批 2 为 12.8、13.2、13.6。给定 τ2 = 1(批效应方差)、σ2 = 1(批内噪声方差)。(a)求两批均值与总均值,计算去均值法的 γ̂1、γ̂2 并写出校正后的数值。(b)按式 (4.6-2) 计算收缩权 w 与收缩后的 γ*,再做校正,问残余批间差还有多少。(c)若 σ2 增大到 9,w 变为多少?由此说明收缩何时强烈。

参考解答

(a)批均值 10.4 与 13.2,总均值 11.8;γ̂1 = −1.4,γ̂2 = +1.4。去均值校正后两批均为 11.4、11.8、12.2,批间差清零。(b)w = 3×1/(3×1 + 1) = 0.75;γ1* = −1.05,γ2* = +1.05。校正后批 1 为 11.05、11.45、11.85,批 2 为 11.75、12.15、12.55,残余批间差 2.8 − 2×1.05 = 0.7。收缩刻意少扣,把证据不足的部分留给数据。(c)w = 3/(3 + 9) = 0.25,收缩更强。批内噪声越大、批内样本越少,估计越不可信,先验的分量越重——这正是 ComBat 为小批次设计的用意(Johnson et al., 2007)。

4.6.6 校正的边界与报告义务

边界先从批次数说起。批效应的方差成分(式 4.6-2 的 τ2)靠批间变异估计,两三个 run 给出的估计本身就大幅波动;批次数少到这个地步,任何方法都只是在假设之间做选择。可行的缓解仍是设计性的:

  • 通量允许时增加 run 数、让每个 run 小一些,比把所有细胞塞进少数几个大 run 更利于估计批间方差;
  • 参考通道与对照细胞留下的漂移记录,可以部分顶替缺失的批次数。

第二个边界是过度校正(overcorrection)。条件若与批次部分相关(设计不完美但未完全混杂),模型会把重叠部分划给批次,真实生物学被削去一角。过度校正有三个可观察的迹象:

  • 同型对照细胞跨批的 CV 校正后不降反升;
  • 重复样品在校正后的降维图上彼此散开;
  • 按理不应变化的蛋白(如看家蛋白)出现大范围"差异"。

校正前后各做一次 4.6.3 的体检,是发现这些迹象的唯一办法——校正不是终点动作,而是需要验收的动作。

最后是报告义务。社区白皮书把批次的设计与处理列入报告要求:实验设计(批的定义、各批的条件构成、随机化方案)、诊断证据(批次着色的降维图、参考通道轨迹)与校正方法(算法、参数、保护变量)都须写明,使结果可审计、可复现(Gatto et al., 2023)。这与全章反复出现的原则一致:把分析的自由度摊在明处。


本节收束第四章的数据处理主线,三条结论值得带走:

  • 批次有三个尺度——TMT 组内通道、进样 run、日/仪器——各有物理来源,也各有对策;
  • 单细胞的脆弱性来自批内样本少与缺失按批聚集,批次均值估不准,校正还会被缺失结构误导;
  • 设计先于校正:随机化切断混杂,参考通道锚定尺度,同型对照提供验收基准;ComBat 的经验贝叶斯收缩与线性模型协变量,都只对可识别的设计有效;
  • 校正需要验收:前后各做一次批次体检,警惕过度校正的三个迹象。

矩阵至此完整:过滤、归一化、填补、批次校正各就各位。下一章带着这张矩阵进入统计——降维与聚类看结构,差异丰度检验看条件,线性模型把本节的批次协变量正式接进假设检验。

关键术语

批次效应 (batch effect)
与生物学无关、按样品分组系统出现的定量偏移。
多重标记组 (multiplexing batch)
一次标记反应标记的一组通道,通道间差异所在的尺度。
混杂 (confounding)
批次与条件共享同一指示变量,二者不可分离。
随机化 (randomization)
把各条件细胞均衡分入每批,切断批次与条件的相关。
参考通道 (reference channel)
每批来自同一匀浆池的参照通道,锚定跨批尺度。
同型对照细胞 (same-type control cells)
各批都有的同一类型细胞,提供批内基线与跨批 CV。
可识别性 (identifiability)
参数可由数据唯一确定的性质;完全混杂时失效。
经验贝叶斯 (empirical Bayes)
跨蛋白借信息以稳定小样本参数估计的统计框架。
收缩 (shrinkage)
估计向先验中心加权靠拢;权随样本量与信噪比变化。
过度校正 (overcorrection)
校正削去真实生物学的失效模式;重复样品分散为其迹象。

参考文献与延伸阅读

  1. Johnson WE, Li C, Rabinovic A. 2007. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics 8: 118–127.
  2. Gomoryova K, Hecht H. 2025. Single cell proteomics data analysis with bioconductor-scp. Galaxy Training, training.galaxyproject.org.
  3. Grégoire S, Vanderaa C, Gatto L. 2024. Standardized workflow for mass-spectrometry-based single-cell proteomics data processing and analysis using the scp package. Methods in Molecular Biology 2817: 177–.
  4. Vanderaa C, Gatto L. 2025. scplainer: using linear models to understand mass spectrometry-based single-cell proteomics data. Genome Biology 26: 237.
  5. Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
  6. Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
  7. Vanderaa C, Gatto L. scp 包(Bioconductor,UCLouvain),配套 scplainer 下游建模. uclouvain-cbio.github.io/scp/.