第4章 · 4.3

4.3 标准化流程:从 PSM 过滤到蛋白矩阵

A Standardized Workflow: From PSM Filtering to the Protein Matrix
摘要 质谱下机的定量原始值不能直接比较:上样量、标记效率、离子化效率与 run 间偏移层层叠加。本节沿 scp 包与 Galaxy 教程固化的共识流程,把 PSM 过滤、肽段质控、双重归一化、对数变换、蛋白聚合与批次校正这八步逐一展开,说明每一步消除哪一类差异、为何必须处在特定位置,并讨论默认参数的来历、敏感性与报告义务。

4.3.1 流程总览:八步与一条原则

4.2 节把多层定量数据装进了 QFeatures 对象;本节处理数据本身。质谱下机时的定量原始值不具备跨细胞可比性:上样量有差异,标记效率有差异,肽段的离子化效率相差可达几个数量级,run 与 run 之间还有系统偏移。这些技术差异若不先行折算,下游的一切比较都会把它们误认作生物学差异。Galaxy 教程把 scp 包的共识处理固化为图形化流程(Gomoryova and Hecht, 2025;Grégoire et al., 2024),其演示数据为 SCoPE2 的一个子集:4 个 run、每 run 16 个 TMT 通道(共 64 通道),证据表 1,362 行;每个 run 含载体通道(200 个细胞)、参考通道、空白通道与一批单细胞通道。SCoPE2 的惯例是先把单细胞通道的报告离子强度表达为相对参考通道的比值,然后才进入下列八步。

表 4.3-1 给出八步总表,图 4.3-1 画出流程瀑布与矩阵形状的变化。八步按"过滤、聚合、换尺度、再过滤、再聚合、收尾"组织,贯穿一条原则:在错误最容易被辨认的层级上把错误除掉。共分离污染、载体异常、失败进样只在 PSM 层看得清,聚合之后便混进中位数无从追认;尺度问题(上样量、离子化效率)交给归一化;run 间的系统偏移留到蛋白层、待矩阵完整之后才校正(Specht et al., 2021)。

表 4.3-1八步流程总表:层级、操作、关键参数与统计动机(Galaxy 教程口径)
步骤层级操作关键参数统计动机
PSM剔除反向序列与污染物;PIF、SCR、run 规模与 FDR 过滤PIF ≥ 0.8;平均 SCR < 0.1;每 run ≥ 150 个 PSM;蛋白 FDR ≤ 1%把共分离污染、载体异常与失败进样挡在聚合之外
PSM→肽段按修饰后序列归并,逐通道取中位数中位数聚合同一肽段的多次匹配取中位,抗偶发离群
肽段只保留单细胞与空白通道;逐细胞中位 CV 过滤中位 CV ≤ 0.65;CV 计算需每蛋白 ≥ 5 条肽段观测剔除定量不一致的细胞;空白通道参与计算后弃去
肽段列归一化:每细胞除以其中位强度列中位数消除上样量与标记效率的乘法差异(式 4.3-1)
肽段行归一化:每肽段除以其跨细胞均值行均值消除肽段间离子化效率差异(式 4.3-2)
肽段对数变换log2右偏分布趋于对称;乘法差异变加法差异
肽段→蛋白剔除高缺失肽段;按前导剃刀蛋白归并缺失率 ≤ 99%;逐通道中位数去掉近乎无信息的行;稳健地聚合出蛋白行
蛋白列、行减法归一化;kNN 填补;ComBat 批次校正k = 3;按 run 分批统一尺度;补全矩阵;消除 run 间系统偏移
八步流程瀑布:PSM 层、肽段层与蛋白层的操作序列及矩阵形状变化 八步流程:从 PSM 表到蛋白矩阵 PSM 层 肽段层 蛋白层 ① PSM 层过滤 剔除反向序列与污染物;PIF ≥ 0.8;平均 SCR < 0.1 每 run ≥ 150 个 PSM;蛋白层 FDR ≤ 1% ② PSM → 肽段聚合 按修饰后序列归并;逐通道取中位数(抗离群) ③ 肽段层质控 只留单细胞与空白通道;每细胞中位 CV ≤ 0.65 每蛋白 ≥ 5 条肽段观测(CV 计算前提) ④ 列归一化(细胞之间) 每细胞除以其中位强度 —— 式 (4.3-1) ⑤ 行归一化(肽段之间) 每肽段除以其跨细胞均值 —— 式 (4.3-2) ⑥ 对数变换 log2:右偏 → 对称;乘法差异 → 加法差异 ⑦ 缺失过滤与蛋白聚合 剔除缺失 > 99% 的肽段;按前导剃刀蛋白 逐通道取中位数归并 ⑧ 蛋白层收尾 列/行减法归一化 → kNN 填补(k = 3)→ ComBat 按 run 分批;设计矩阵保护样品类型差异 1,362 行 PSM × 64 通道 失败 run 整批出局 多次匹配 → 一条肽段 行数压缩 坏细胞(列)出局 空白通道用毕即弃 形状不变 细胞间尺度统一 形状不变 肽段之间可比 形状不变 数值进入对数尺度 肽段矩阵 → 蛋白矩阵 行由肽段变为蛋白 蛋白 × 单细胞 完整矩阵上校正批次 输出:蛋白 × 单细胞、批次已校正的完整矩阵 → PCA / UMAP(5.1 展开)
图 4.3-1 八步流程瀑布与矩阵形状的变化。左栏为数据层级,中栏为各步操作与参数,右栏注明矩阵形状的演变:①在 PSM 层剔除坏行坏列,②③把矩阵过渡到肽段层并裁去不可靠的细胞,④⑤⑥只换数值不换形状,⑦把行由肽段换成蛋白,⑧在完整矩阵上完成尺度统一、填补与批次校正。参数取自 Galaxy 教程的核实口径(Gomoryova and Hecht, 2025)。

4.3.2 第①步:PSM 层过滤,把不可靠的测量挡在门外

过滤在鉴定的基本单位上进行。四条规则各拦一类错误:反向序列与常见污染蛋白一律不参与定量,它们是检索的目标-诱饵机制与实验室环境带来的系统混入;母离子纯度(precursor ion fraction, PIF)低于 0.8 的 PSM 弃去;每 run 的 PSM 总数不足 150 个即整批剔除;平均样品/载体比(sample-to-carrier ratio, SCR)超过 0.1 的 PSM 弃去;鉴定质量另由蛋白层错误发现率(false discovery rate, FDR)把关,阈值 1%——由每次匹配的后验错误概率逐级汇总为 q 值后截断。

定义

母离子纯度(PIF):四极杆隔离窗口内,目标母离子的信号强度占窗口内离子总强度的比例。PIF 接近 1 说明谱图近乎纯净;PIF 低说明有其他肽段被一同隔离、一同碎裂。多重标记定量读的是报告离子,而报告离子不携带序列身份——窗口内任何肽段的碎裂都会向各通道贡献报告离子。因此对 TMT 类标记而言,PIF 是定量纯度而非鉴定纯度的指标。

PIF 阈值的机理就在这一定义里。纯度低于 0.8 时,谱图中两成以上强度来自他种肽段,其报告离子混入各单细胞通道,定量被系统性污染;这类误差的方向不可预测,也无法在下游校正,只能在源头拦截。

run 规模阈值针对失败进样。一次进样若只鉴定到不足 150 个 PSM,多半是色谱或喷雾出了故障,整个 run 连同其中的单细胞通道一起出局。教程数据中这条规则剔除的恰是一个特征数只有其他 run 约三分之一的空白 run:空白通道本不该有太多鉴定,但规模悬殊到这个程度说明该 run 整体失败。

SCR 阈值的方向常被记错,值得把账算清。载体通道由 200 个细胞汇成,一个单细胞的信号理应只有载体的约 1/200 ≈ 0.005,实测分布的峰在 0.01 附近。某 PSM 的平均 SCR 若超过 0.1——单细胞通道的强度达到载体的一成——只有两种解释:该 PSM 的载体信号异常偏低,或单细胞通道混入了残留污染;两种情形都会让比值失真,因此剔除的是高 SCR 的 PSM,保留的是低者(Budnik et al., 2018;Gomoryova and Hecht, 2025)。

习题 4.3-1

某批次 4 个 run 的 PSM 计数分别为 520、380、300、96。(a)按"每 run ≥ 150 个 PSM"的规则,哪些 run 被整批剔除?(b)被剔除 run 中的单细胞通道结局如何?为何无法从其他 run 补救?(c)若被剔除的是一个空白 run,损失的是什么?

参考解答

(a)96 < 150,第 4 个 run 整批剔除,其余保留。(b)细胞以通道的形式嵌在 run 之内,run 出局即其中全部单细胞通道丢失;每个细胞只被测量一次,别处没有副本,无从补救——这正是 4.6 节强调"批次设计先于算法"的原因。(c)损失的是污染监控能力而非细胞:空白通道的作用是估计残留污染的本底,剔除一个失败 run 的空白列,不影响任何单细胞的定量。

4.3.3 第②③步:聚合到肽段,再做肽段层质控

通过过滤的 PSM 按修饰后序列(modified sequence)归并:同一序列的多次匹配——不同电荷态、不同保留时间、重复碎裂——并为一个肽段行,数值逐通道取中位数。取中位数而非均值是抗离群的标准选择:同一肽段的多次测量偶有一次劣化,中位数不为所动,均值则被拉动。

肽段矩阵随后裁列:只保留单细胞通道与空白通道,载体与参考通道完成相对化的使命后退出。空白通道并非废列——它与单细胞一起参与下一步的质控计算,用毕即弃。

细胞级质控的核心是中位变异系数(median coefficient of variation, median CV)。计算分三步:先把每列除以其中位数、再把每条肽段在其 run 内除以其均值,两次内部定标使通道之间、肽段之间可比;然后按蛋白分组,在每个细胞内计算组内标准差与均值之比——同一蛋白的各条肽段经定标后理应给出一致的相对量,变异系数大即说明该细胞定量混乱;最后对全部蛋白取中位数,作为该细胞的分数。计算要求每个蛋白在该细胞中至少有 5 条肽段观测——这个 5 是 CV 计算的参数(观测数下限),并非蛋白层的保留阈值。中位 CV 超过 0.65 的细胞整列剔除;阈值 0.65 取自教程数据的 QC 分布——单核与巨噬细胞通道聚在低处、空白通道散在高处,0.65 恰落在两类之间(Gomoryova and Hecht, 2025;Vanderaa and Gatto, scp 包文档)。

4.3.4 第④–⑥步:两次归一化与对数变换

裁剪完毕,剩下的是尺度问题。归一化(normalization)分两步,方向一列一行。上样量、标记效率与进样波动作用在同一细胞的所有肽段上,是乘法性的尺寸因子(size factor);列归一化把每个细胞除以其中位强度(式 4.3-1)。选尺寸因子的统计考量是稳健:中位数不被少数高表达肽段左右,而均值会。

y′ij = yij / mj, mj = mediani yij
(4.3-1)yij 为肽段 i 在细胞 j 的强度;mj 为细胞 j 全部肽段强度的中位数,充当该细胞的尺寸因子。上样量、标记效率与进样波动以乘法作用在整列上,故校正用除法。

离子化效率作用在同一肽段的所有细胞上:行归一化把每条肽段除以其跨细胞均值。两步之后(式 4.3-2),定量值的含义从"这条肽段在这个细胞多强"变成"相对该肽段的典型水平,这个细胞偏高还是偏低"——这恰是细胞间比较需要的量。

xij = log2( y′ij / ri ) = log2 yij − log2 mj − log2 ri
(4.3-2)ri 为肽段 i 跨细胞的均值(离子化效率因子)。右端说明:原尺度上的两次除法,在对数尺度上就是两次减法——对数变换把乘法结构的校正与差异全部变为加法。
方法

两次归一化各管什么。列归一化管"细胞之间":同一细胞内的全部肽段共享一个因子——上样量、标记效率、进样波动,除以列中位数即把它折掉。行归一化管"肽段之间":同一条肽段在所有细胞共享一个因子——离子化效率与色谱行为,除以行均值即把它折掉。方向不同、互不可替代:只做列归一化,离子化好的肽段永远偏暗,行间的结构差异依旧;只做行归一化,上样多的细胞整体偏高,列间的尺度差异依旧。顺序也有讲究:先用列归一化折掉尺寸因子,行统计量才不被上样差异污染。

列归一化消除细胞间(列)尺度差异,行归一化消除肽段间(行)尺度差异 两次归一化各消除哪一种差异(示意数据) 原始强度 上样差异+离子化差异叠加 列归一化后 列间差异消除,行间差异保留 再行归一化后 行列差异皆消,只剩细胞间差异 肽1 肽2 肽3 肽4 肽5 细A 细B 细C 细D 上样多(整列偏深) 离子化好 (整行偏深) 列归一化 ÷ 每列中位数 肽1 肽2 肽3 肽4 肽5 细A – 细D 各列模式完全一致 行归一化 ÷ 每行均值 肽1 肽2 肽3 肽4 肽5 细A – 细D 回到同一基准 高(强度) 行 = 肽段,列 = 细胞;深色 = 高强度
图 4.3-2 列归一化与行归一化的分工(示意数值)。左:原始强度中,细C 通道上样偏多表现为整列偏深,肽3 离子化好表现为整行偏深,两种差异乘法叠加。中:每列除以其中位数后,四列的模式完全一致——细胞间尺度差异消除,肽3 仍偏深。右:再每行除以均值后全部回到同一基准,矩阵中只剩细胞特有的差异,即下游比较的对象。

第三步换尺度。对数变换(log transformation)之前,强度跨几个数量级、分布重尾右偏,噪声呈乘法性——大值多报、小值少报,方差随丰度增长。log2 之后分布近似对称、方差趋于稳定,两个细胞之间的倍数关系变成对数之差,"log2 倍变化"正是差异分析的自然单位。式 (4.3-2) 的右端同时说明:对数变换放在两次归一化之后,不是因为中位数只在原尺度可算,而是乘法校正本就定义在原尺度上;若先换尺度,等价的写法是把除法换成减法(见习题 4.3-3)。

习题 4.3-2

某细胞 4 条肽段的强度(任意单位)为 200、800、1000、2000。(a)求列中位数并做列归一化,写出结果。(b)另一细胞的强度恰为上述值的二倍(400、1600、2000、4000),归一化后与(a)比较并解释。(c)证明"先归一化再取 log2"与"先取 log2 再减去 log2 中位数"给出同一结果。

参考解答

(a)m = (800 + 1000)/2 = 900;归一化后为 2/9 ≈ 0.222、8/9 ≈ 0.889、10/9 ≈ 1.111、20/9 ≈ 2.222。(b)m′ = 1800,归一化后各值与(a)完全相同——乘法性的尺寸差异被整列消去,两个细胞进入同一尺度。(c)log2(y/900) = log2y − log2900,除以中位数与减去对数中位数严格等价。这正是式 (4.3-2) 的内容:原尺度上的除法就是对数尺度上的减法。

4.3.5 第⑦⑧步:从肽段矩阵到蛋白矩阵

缺失率(missingness)超过 99% 的肽段几乎不携带跨细胞信息,留着只会稀释聚合、加重填补负担,先行剔除。这条过滤只看每行的缺失比例,对单调变换不变,故与 log2 的先后可以互换:scp 包的参考实现把它放在归一化与对数之间,Galaxy 教程放在对数之后,结果相同(Grégoire et al., 2024)。

聚合按前导剃刀蛋白(leading razor protein)归行——共享肽段的归属歧义在 1.4 节已经讨论,取唯一或首选注释是务实的约定——数值仍逐通道取中位数。蛋白矩阵由此诞生:行是蛋白,列是细胞,值是 log2 相对量。

蛋白层先重复一次双重归一化,但对数尺度上运算换成减法(式 4.3-3):每细胞减去其中位数、每蛋白减去其行均值。与第④⑤步相比,尺度变了,运算从除法换成减法,含义不变。

wpj = xpj − Mj − Rp
(4.3-3)xpj 为蛋白 p 在细胞 j 的 log2 强度;Mj 为细胞 j 的列中位数,Rp 为蛋白 p 的行均值。这是式 (4.3-1)(4.3-2) 在对数尺度上的直接对应:乘法因子已变成加法项。

随后处理缺失与批次,二者的先后有硬性依赖。ComBat 要求输入为无缺失的完整矩阵,因此 填补(imputation)在前:kNN 取 3 个最相似的细胞推值(缺失机制与填补的克制,4.4 展开);批次效应(batch effect)校正在后:以 run 为批次变量,用样品类型构造设计矩阵,ComBat 的经验贝叶斯收缩让小样本下的批次参数估计保持稳定,设计矩阵则保证校正不会把单核与巨噬细胞的生物学差异一并抹去(Johnson et al., 2007;机理与诊断在 4.6 展开)。归一化与批次校正的分工由此清晰:前者统一单个细胞或单个蛋白自身的尺度,后者消除按 run 分组的系统偏移,前者不识别分组结构,后者不能替代前者。

收尾的矩阵行是蛋白、列是细胞,无缺失、批次已校正,直接进入 PCA 与 UMAP 的降维可视化(5.1 展开)与差异丰度建模。从 1,362 行 PSM 到这张矩阵,每一步都可复现、可审计——这正是"标准化"的本义(Grégoire et al., 2024)。

4.3.6 顺序为什么重要

八步的次序不是编排习惯,每一处都有一条统计理由。

过滤先于聚合。反向序列与污染物是系统误差,不是随机离群;一旦混进聚合,中位数只会把它们当作"正常肽段"稳定地保留下来。PIF、SCR 这些量只在 PSM 层有定义,聚合后无从计算。同理,细胞级的中位 CV 过滤必须等 PSM 归并到肽段、且空白通道仍在矩阵中时进行——它评估的是肽段定量在蛋白内部的一致性。

列归一化先于行归一化。若上样多的细胞仍整体偏高,行统计量会把这部分偏移分摊进每条肽段的均值里,行归一化于是折不掉它;先折列,行统计量才是干净的。

对数在两次归一化之后。乘法校正定义在原尺度上,跨尺度混用运算才是真正的破坏:在原尺度上减中位数会出现零与负值,log2 无从取值;在对数尺度上除以中位数则量纲尽失。正确配对时,两种顺序在列归一化上严格等价,差别只在行统计量(习题 4.3-3)。

填补在批次校正之前,批次校正在蛋白层。ComBat 需要完整矩阵,这是硬约束;更深一层的理由是层级选择——肽段层缺失过密,逐肽段估计批次偏移既不稳也无必要,聚合之后缺失大幅减轻,蛋白层是批次结构第一次可估的层级。

警示

顺序不可随意调换。四处依赖值得记住:①过滤先于聚合——系统误差躲进中位数后无法追认;②列归一化先于行归一化——尺寸因子不除,行统计量被污染;③乘法校正配原尺度、加法校正配对数尺度——跨尺度混用运算产生零、负值或量纲错误;④填补先于批次校正、批次校正在蛋白层——完整矩阵是 ComBat 的输入要求,肽段层的批次结构不稳。改动任何一处,下游结果都会以难以察觉的方式漂移。

习题 4.3-3

若把 log2 提到两次归一化之前,并把"除以中位数/均值"相应改成"减去中位数/均值",结果会改变什么?什么情形下这种改动是真正的破坏?

参考解答

列归一化部分两种顺序严格等价:中位数与单调变换可交换,log2y − log2mj = log2(y/mj)。差别集中在行归一化:原尺度上的行均值是算术均值,对数尺度上的行均值对应原尺度的几何均值;强度分布右偏时,算术均值易被少数高值拉高,几何均值更稳健——顺序改变相当于更换行统计量,结果略变而非崩坏。真正的破坏来自跨尺度混用运算:在原尺度上"减中位数"会产生零与负值,log2 无从定义;在对数尺度上"除以中位数"则量纲全错。规则一句话:乘法校正配原尺度,加法校正配对数尺度。

4.3.7 参数的敏感性与报告义务

流程是骨架,阈值是关节。收紧 PIF(0.8 提到 0.9)、调低 SCR 上限、把 CV 阈值降到 0.5 或将每 run 的 PSM 下限翻倍,矩阵会变小、变干净——行与列双双缩减,噪声下降的同时统计功效与蛋白覆盖一起下降;放松则相反,矩阵变大、噪声变多。两者之间没有免费的午餐,只有与下游目标匹配与否:做细胞类型粗分,宽一点无妨;比较亚群间的丰度差异,宁可窄而干净。

教程把 0.65 的来历示范得很清楚:它不是常数,而是 QC 分布上单核/巨噬细胞通道与空白通道之间一个可以辩护的分界。换一种样品制备、另一种标记试剂、更深或更浅的采集,这个分界都会移动。

注记

默认参数的来历。0.8、0.1、150、0.65、5、99%、3 这组数字并非理论推导的普适常数,多数源自 SCoPE2 数据的经验固化:PIF 与 SCR 阈值来自对 TMT 定量失真模式的观察,150 与 0.65 来自该数据集的 QC 分布,k = 3 是小样本下的保守选择。把它们当作共识起点,而非真理。

因此,报告参数是分析者的义务。社区白皮书要求把数据处理的全链条——每一步操作、每一个阈值及其依据——写进任何基于此类数据的研究报告,并建议对关键阈值做敏感性检验:上下拨动一档,下游结论是否稳定(Gatto et al., 2023)。一条不报告参数的流程,等于把结论建立在不为人知的自由度之上;标准化流程的价值,恰恰在于让这些自由度全部摊在明处。


本节沿 Galaxy 教程与 scp 包的共识口径,把单细胞蛋白组学定量数据的八步标准流程走了一遍:

  • 步骤序列:PSM 过滤 → 肽段聚合 → 肽段质控 → 列归一化 → 行归一化 → log2 → 缺失过滤与蛋白聚合 → 蛋白层归一化、填补与批次校正;
  • 每步一条统计理由:系统误差在最低层剔除,乘法校正配原尺度、加法校正配对数尺度,批次校正在矩阵完整的蛋白层进行,填补为批次校正备好完整矩阵;
  • 默认参数是 SCoPE2 经验的固化:报告阈值及其依据、做敏感性检验,是使用这组数字的先决条件。

矩阵既成,两个遗留问题需要正面处理:缺失值如何产生、何时可以填补(4.4);载体通道给多重标记定量带来哪些假象(4.5)。

关键术语

归一化 (normalization)
按行或列的稳健统计量折算强度,消除技术性尺度差异的操作。
尺寸因子 (size factor)
乘法性作用在一个细胞全部肽段上的因子,如上样量与标记效率。
母离子纯度 (precursor ion fraction, PIF)
隔离窗口内目标母离子占离子总强度的比例,定量纯度的指标。
样品/载体比 (sample-to-carrier ratio, SCR)
单细胞通道与载体通道强度之比;异常偏高提示定量失真。
中位变异系数 (median coefficient of variation)
细胞级质控分:蛋白内肽段的变异系数对全部蛋白取中位数。
对数变换 (log transformation)
取对数使右偏分布趋于对称、乘法差异变为加法差异。
缺失率 (missingness)
一条肽段(行)中缺失值所占的比例,高缺失行先于聚合剔除。
前导剃刀蛋白 (leading razor protein)
肽段归属蛋白时取唯一或首选注释的约定,用于蛋白聚合。
填补 (imputation)
为缺失值给出估计值;kNN 以 k 个最相似细胞的值推补。
批次效应 (batch effect)
按 run 等分组出现的系统偏移,由 ComBat 经验贝叶斯校正。

参考文献与延伸阅读

  1. Gomoryova K, Hecht H. 2025. Single cell proteomics data analysis with bioconductor-scp. Galaxy Training, training.galaxyproject.org.
  2. Grégoire S, Vanderaa C, Gatto L. 2024. Standardized workflow for mass-spectrometry-based single-cell proteomics data processing and analysis using the scp package. Methods in Molecular Biology 2817: 177–.
  3. Vanderaa C, Gatto L. Single cell proteomics data processing and analysis (scp package, Bioconductor). uclouvain-cbio.github.io/scp/.
  4. Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
  5. Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
  6. Johnson WE, Li C, Rabinovic A. 2007. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics 8: 118–127.
  7. Budnik B, Levy E, Harmange G, Slavov N. 2018. SCoPE-MS: mass spectrometry of single mammalian cells quantifies proteome heterogeneity during cell differentiation. Genome Biology 19: 161.