4.1.1 数据的起点:run、通道与两份输入表
第 3 章结束时,细胞已完成分选、酶解与 TMT 标记。数据处理的第一课,是认清起点:手里没有"细胞×蛋白"的矩阵,只有两份表——搜索引擎输出的 evidence 表(教程数据 1,362 行 × 150 列)与注释表(sample annotation)(65 行 × 7 列,首行为表头即 64 条通道记录)。数据取自 SCoPE2 子集:U-937 单核细胞与经 PMA 分化的巨噬样细胞,一种细胞系、两种状态(Specht et al., 2021;Gomoryova and Hecht, 2025)。
实验的组织方式决定了表的形状。一次单细胞 TMT 实验等于多次独立的液相-质谱联用采集(run):每个通道组单独上柱、走梯度、采集。同一个 run 的 16 个通道(channel)共享同一段梯度与同一套质量校准,跨 run 的通道之间隔着一次重新进样。教程数据共 4 个 run、每 run 16 个 TMT 通道,合计 64 个。
evidence 表的一行是一次肽段-谱图匹配(peptide-spectrum match, PSM):一张二级谱图配一条肽段序列(鉴定视角见 1.4 节)。150 列里多数是鉴定元数据——修饰后序列、蛋白归属、电荷、保留时间、母离子纯度、q 值;其中 16 列是报告离子(reporter ion)强度,每个通道一列。定量的原子事件因此不是"某蛋白在某细胞多少",而是"某一次碎裂中 16 个通道各读到多少"。
通道与细胞不能画等号。64 个通道里,载体通道(carrier channel)装载约 200 个细胞当量,为低丰度肽段抬高峰形——SCoPE-MS 以来的标准配置(Budnik et al., 2018);另有参考通道(reference channel)(约 5 个细胞当量)、空白通道(blank channel)与未用通道,其余才是单个细胞。哪一列是谁,全凭注释表交代:run、通道、SampleType 与制备批次各占一列(表 4.1-1)。图 4.1-1 把三层矩阵与通道构成画在一处。
4.1.2 第一层:肽段-谱图匹配
第一层矩阵以 PSM 为行、64 个通道的强度列为列。1.4 节从鉴定一侧定义过 PSM,定量一侧只须补一句:它离测量最近、未经任何归并修饰,上层矩阵的每一个数归根结底都是它的函数——定义见下框。
肽段-谱图匹配(peptide-spectrum match, PSM,定量视角):一次碎裂事件所产生的全部定量与鉴定信息的记录——肽段序列与修饰、蛋白归属等元数据,加上同 run 全部通道的报告离子强度。evidences.txt 的一行即一个 PSM;单细胞 TMT 流程的第一轮质控(q 值、PIF、SCR)都在这一层完成。
元数据列合起来是每个 PSM 的"可信度名片"。q 值承接目标-诱饵控制:教程剔除反向序列与污染库命中,要求蛋白层 q 值不超过 1%。母离子隔离纯度(precursor intensity fraction, PIF)是隔离窗口内归属目标母离子的信号占比——共洗脱肽段挤进窗口越多,PIF 越低,通道间比值被压缩扭曲得越重(见 1.4、2.5 节),PIF 低于 0.8 剔除。另设整 run 关卡:run 的 PSM 不足 150 视为进样失败,整体出局(Gomoryova and Hecht, 2025)。
质控放在 PSM 层,次序上有讲究:这层的任何缺陷都会向上传染,上层却看不出下层的问题;先在源头设卡、再逐级聚合,是标准化流程的共同纪律(Grégoire et al., 2024;Gatto et al., 2023)。
4.1.3 第一跳:从 PSM 到肽段
同一肽段在 evidence 表里常占多行,原因写在采集规则里:动态排除窗口过期后同一离子再次入选、相邻循环重复选中同一色谱峰、不同电荷态各自碎裂一次(1.4 节)。行数反映仪器调优与样品复杂度,而非肽段数目。归并规则:按修饰后序列分组,组内逐通道取中位数,得到肽段层的一行。
用中位数聚合的理由:抗离群。三个 PSM 的强度 {120, 100, 130},中位数 120,均值 116.7,两者相近;可一次隔离污染足以制造 {120, 100, 130, 3,000} 这样的集合——中位数 125,几乎不动,均值 837.5,完全失真。单次碎裂的离群事件在 PSM 层并不罕见,中位数把"多数 PSM 的共识"与"单次事故"分开,事故被压制而不是被放大。代价是效率略低:中位数对分布中心的信息利用不如均值充分,但在离群风险面前,这份保守是值得的。
归并同时改写缺失结构:某通道只在三个 PSM 中的一个有值,中位数照常给出结果——肽段层缺失率低于 PSM 层;行内空洞被"至少测到过一次"填上,那一次的质量如何,聚合后不再可见(见警示框与 4.1.7)。
4.1.4 第二跳:从肽段到蛋白
蛋白层的行是蛋白,更准确地说是记账代号。归属采用 MaxQuant 的 leading razor 规则:特有肽段自然归其主;歧义肽段(序列同时出现在多种蛋白里)统一记给蛋白分组(protein group)内特有肽段最多的成员。1.4 节剖析过这种归属的先天含糊:分组内成员无法区分,共享肽段的信号是组内成员之和——蛋白层的"一个蛋白",实质是"一组肽段选出的代言人"。
聚合统计量教程仍取中位数(按 Leading.razor.protein 分组、逐通道 colMedians)。求和保留总量信息,但蛋白的值随可用肽段数目涨落;中位数对肽段子集的增删稳健,更合差异丰度分析对跨样品一致性的要求(Gomoryova and Hecht, 2025;Grégoire et al., 2024)。
两跳走完,矩阵定格:行数从 1,362(PSM,教程子集)降到肽段、再降到蛋白,列数不变。参照 SCoPE2 全量数据:1,490 个细胞中定量 3,042 种蛋白(Specht et al., 2021);教程子集过滤完毕、填补之前,蛋白矩阵仍有约 33% 缺失格——稀疏是常态,成因见 4.1.7。
聚合会掩盖层内缺陷。蛋白值由几条肽段的中位数构成时,其中一条严重离群、或某通道整条蛋白只靠一条肽段撑着,蛋白层都看不出来;肽段值同理,遮住了 PSM 间的不一致与单 PSM 的低质量。质控若只做在蛋白层,等于把体检推迟到病灶扩散之后。规范的做法是逐层设卡:PSM 层查 q 值、PIF 与 SCR,肽段层查 CV 与缺失,蛋白层再查缺失与批次(4.6 节)——每一层的指标回答各自的问题,谁也不能替谁把关(Gatto et al., 2023)。
4.1.5 注释表:矩阵的坐标系
定量矩阵的行有蛋白名作坐标,列的坐标全在注释表:SampleType 把 64 个通道分成六类(表 4.1-1),凡按列身份操作的计算都要先问它。
| SampleType | 中文 | 装载内容 | 在流程中的角色 |
|---|---|---|---|
| Carrier | 载体 | 约 200 个细胞当量的混合材料 | 抬高峰形、提高鉴定率;SCR 的分母 |
| Reference | 参考 | 约 5 个细胞当量的混合材料 | 跨 run 对齐的公共参照(4.3、4.6 节) |
| Blank | 空白 | 只走试剂与标记,无细胞 | 背景与残留污染的经验分布 |
| Unused | 未用 | 未标记或未上样 | 占位,不参与任何计算 |
| Monocyte | 单核细胞 | 单个 U-937 单核细胞 | 生物条件一,进入矩阵的列 |
| Macrophage | 巨噬样细胞 | 单个经 PMA 分化的细胞 | 生物条件二,进入矩阵的列 |
注释表在质控里反复出场:算 SCR 要找同 run 的载体列,算 MedianCV 要挑单细胞列并以空白列作参照,4.6 节的批次校正靠制备批次列。注释错一行,下游全错且错得沉默——把载体误标成细胞,SCR、列归一化与差异分析一起失真。矩阵的两维,一维写在序列里,一维写在这张表里,这也是 scp 框架把两者并列为必需输入的原因(Vanderaa and Gatto, scp 文档;Grégoire et al., 2024)。
习题 4.1-1
设某实验的 4 个 run 完全同构,每个 run 的 16 个通道分配为:1 载体、1 参考、1 空白、3 未用、10 个单细胞(4 个单核、6 个巨噬样)。(a)最终"细胞 × 蛋白"定量矩阵的列数是多少?其余通道去向何处?(b)空白通道不进矩阵,为什么要占用一个通道?(c)若把参考通道误标为单细胞,哪些计算最先失真?
参考解答(a)列数为 4 × 10 = 40。载体作 SCR 的分母与峰形助推,用后即弃;空白用于估计背景;未用通道不参与计算——它们都不进入分析矩阵。(b)空白通道给出"没有细胞时的读数",是背景、残留污染与仪器噪声的经验零分布;MedianCV 这类阈值也要靠空白通道的分布核对落点。(c)凡"按列身份挑集合"的计算全部中招:MeanSCR 的分子集合把参考通道计入、MedianCV 的细胞集合混入参考通道;参考通道装载约 5 个细胞当量,强度天然高出单细胞数倍,列归一化(除以列中位数)的尺度随之被拖偏,且这种偏差不报错、只 quietly 地改变数值。
4.1.6 三项质量控制指标
三层结构搭好后,问题是:哪些行、哪些列值得留下?三项指标各管一段——SCR 管单个 PSM 的定量是否反常,MedianCV 管整个通道是否自洽,缺失率管特征或通道还有多少观测可用(Gomoryova and Hecht, 2025)。
样品/载体比:单次定量的反常检测
样品/载体比(sample-to-carrier ratio, SCR)把每个单细胞通道的强度放到同 run 载体的标尺上:
样品/载体比(sample-to-carrier ratio, SCR):单细胞通道与同 run 载体通道的报告离子强度之比,逐 PSM、逐通道计算,再对 PSM 的全部单细胞通道取均值得 MeanSCR。载体约 200 个细胞当量,故期望值约 1/200 = 0.005;实测分布的峰在 0.01 附近。MeanSCR 高于 0.1 的 PSM 剔除——这把尺子量的是"高得反常",不是"低得可怜"。
方向容易想反。单细胞信号弱是常态,SCR 低于期望并不出局——计数过少、比值全由噪声的隐患,由计数本身与 CV 判断;出局的是 SCR 异常偏高的 PSM:单细胞信号高到只比 200 个细胞当量的载体差十倍以内,多半是隔离窗口混入别家肽段、串扰或污染,"单细胞"通道的强度已不能归给这条肽段,错误会顺着两次聚合向上传导。教程把阈值放在分布长尾的根部 0.1(图 4.1-2 上)。
习题 4.1-2
某 PSM 的载体通道强度为 4,000,各单细胞通道强度的均值为 320,MeanSCR = 0.08。(a)按教程规则,该 PSM 保留还是剔除?(b)与期望值 0.005 相比,0.08 意味着什么?(c)阈值收到 0.05 与放到 0.2,各付出什么代价?
参考解答(a)保留:0.08 低于 0.1,不在剔除之列。(b)0.08 高出期望约 16 倍,虽未越线,已落在分布右尾——这类 PSM 值得人工复查共洗脱情况与 PIF,并留意其报告离子的绝对计数是否支撑定量,而不是默认无事。(c)收到 0.05:更多可疑但尚可用的定量出局,矩阵更稀,偏向"干净"通道,数据量换可信度;放到 0.2:更多近污染的强度混进细胞列,向上聚合后形成系统性偏差,差异分析可能出现假信号。0.1 是"宁可缺、不可错"与数据量之间的折中——缺失尚可填补(4.4 节),错值会一路传导到蛋白层。
变异系数:通道自洽性的度量
变异系数(coefficient of variation, CV)是一组数值的标准差与均值之比:
教程的用法:对每个通道,把蛋白当分组,在同一细胞内对每个蛋白的肽段强度各算一个 CV,再跨蛋白取中位数,得到通道的 MedianCV。机理在化学计量——同一蛋白的肽段出自同一个母分子池,通道质量好时应给出彼此一致的相对丰度;上样不足、标记不匀、分离不稳的通道,这种内部一致性最先崩坏。MedianCV 因而是技术噪声的代理:一个数概括一个通道的自洽程度。教程剔除 MedianCV 大于 0.65 的通道,空白通道的分布给出"没有细胞时的分数"作参照(图 4.1-2 下);在通道内而非细胞间计算,为的是只量通道、不量细胞——同型细胞间的真异质性不该算进技术噪声。
缺失率:稀疏性的直接度量
缺失率(missing rate)有两种视角。行视角:一个特征(肽段或蛋白)在多少比例的细胞中缺失,直接度量矩阵的稀疏性;教程剔除缺失超过 99% 的肽段——几乎全缺的行,任何填补都接近编造。列视角:一个细胞缺失多少特征,配合强度与 MedianCV 判断通道生死。两项互补:CV 高但观测齐全,可能是真实的细胞间差异;大面积缺失,更可能是技术事故。三项指标的门槛汇总见表 4.1-2。
| 指标 | 作用层 | 怎么算 | 教程阈值 | 剔除的对象 |
|---|---|---|---|---|
| SCR | PSM × 通道 | 单细胞通道强度 ÷ 同 run 载体通道强度,按 PSM 取均值 | MeanSCR ≤ 0.1 | 信号高得反常的 PSM(疑似污染、串扰) |
| CV(MedianCV) | 通道(细胞) | 通道内、蛋白内肽段间算 CV,跨蛋白取中位数(≥5 条肽) | MedianCV ≤ 0.65 | 自洽性差的通道(上样、标记失败) |
| 缺失率 | 特征 / 通道 | 行内(或列内)NA 所占比例 | 缺失 ≤ 99% | 几乎全缺的肽段;列缺失率辅助判通道 |
习题 4.1-3
某肽段在同一 run 的 4 个单核细胞通道上有 3 个 PSM,强度如下(NA 为缺失):
| PSM | 通道 c1 | 通道 c2 | 通道 c3 | 通道 c4 |
|---|---|---|---|---|
| PSM 1 | 120 | 90 | 140 | NA |
| PSM 2 | 100 | 110 | 60 | 80 |
| PSM 3 | 130 | NA | 80 | 100 |
(a)按式 (4.1-1) 完成逐通道中位数聚合。(b)计算该肽段在 4 个通道间的 CV(同型细胞间口径,样本标准差)。(c)若这 4 个值改由同一蛋白的 4 条肽段在同一通道上读出,按教程口径这个 CV 用在何处?(d)通道 c2 只有 2 个 PSM 有值,聚合结果的可靠性如何?
参考解答(a)c1:median(120, 100, 130) = 120;c2:median(90, 110) = 100;c3:median(140, 60, 80) = 80;c4:median(80, 100) = 90。(b)四个通道值 {120, 100, 80, 90}:均值 97.5;离差 22.5、2.5、−17.5、−7.5,平方和 875,样本方差 875/3 ≈ 291.7,标准差 ≈ 17.1,CV ≈ 17.1/97.5 ≈ 0.18。(c)这是"通道内、蛋白内肽段间"口径的 CV:逐蛋白算出后跨蛋白取中位数,构成该通道的 MedianCV,与 0.65 对照。注意教程要求组内至少 5 条有值肽段(nobs = 5),4 条仅够示意方法。(d)两个观测的中位数即两值之均 100:完全失去"多数共识"的稳健性——中位数聚合的抗离群能力来自多个 PSM 的相互制衡,观测太少,制衡无从谈起。这正是各流程普遍设置最小观测数的原因。
4.1.7 双重稀疏:缺失是生成过程的属性
缺失写在两个位置。一类在"格"里:肽段级缺失——某细胞 × 某条肽段无值,成因在采集一侧:DDA 未选中(1.4 节的随机成分)或信号低于检出限,丰度越低越易缺。另一类在"列"里:通道级缺失——整列低信号或大面积无值,成因在制备一侧:上样、标记失败或细胞丢失。SCR 与 MedianCV 抓后者,前者靠缺失率刻画。
缺失不是可以一扔了之的噪声,而是生成过程的属性:一个格是否缺失,携带哪个 run、哪种通道、多低丰度的信息,且缺失概率与真值相关——低丰度肽段系统性地更易缺。当作随机噪声删除,或一律当零,都会把"测不到"错译成"不存在";填补及其前提留待 4.4 节。
还有一层容易误读:聚合让表观稀疏度逐层下降——每跳一次,行内只要剩下一个观测就有值。蛋白层热图看上去比 PSM 层"完整",部分只是归并的副产品,不是测量变好的证据。读单细胞蛋白矩阵,应先问一句:这层值之下垫着几条肽段、几个 PSM、过了哪几道卡。
本节建立了全章的数据观,三条线索收拢如下:
- 结构:一次实验 = 多个 run × 16 通道;三层矩阵(PSM、肽段、蛋白)经两次逐通道中位数归并而成,行数递减、列数不变、缺失率逐层下降;
- 坐标:注释表把通道映射到载体、参考、空白、未用与单细胞,是一切按列操作的总开关;
- 判据:SCR 查单次定量的反常(高于 0.1 剔除),MedianCV 查通道自洽性(高于 0.65 剔除),缺失率查特征与通道的可用性(高于 99% 剔除);缺失是采集与制备的内生属性,双重稀疏由此而来。
4.2 节起,这套结构将在 Bioconductor 的 scp 包与 QFeatures 框架里落地为代码对象;此后的归一化、填补与批次校正,全部踩在本节铺定的三层坐标之上。
关键术语
- 采集(run)(run)
- 一次进样上柱的完整 LC-MS/MS 分析,仪器时间与批次的原子单位。
- 通道(channel)(channel)
- 一个 TMT 标记位及其对应的报告离子强度列,每个 run 16 个。
- 肽段-谱图匹配 (peptide-spectrum match)
- 一次碎裂事件的鉴定元数据与全通道定量强度的合体,矩阵第一层的行。
- 母离子隔离纯度 (precursor intensity fraction)
- 隔离窗口内归属目标母离子的信号占比,共洗脱污染的量度。
- 注释表 (sample annotation)
- 把通道映射到样品类型与批次的坐标表,一切按列操作的总开关。
- 样品/载体比 (sample-to-carrier ratio)
- 单细胞通道与同 run 载体通道的报告离子强度之比,期望约 1/200。
- 变异系数 (coefficient of variation)
- 标准差与均值之比;教程口径为通道内、蛋白内肽段间的中位 CV。
- 中位变异系数 (MedianCV)
- 每通道一个的自洽性分:蛋白内肽段间 CV 跨蛋白取中位数。
- 缺失率 (missing rate)
- 一行(特征)或一列(通道)中缺失值所占的比例。
- leading razor 蛋白 (leading razor protein)
- 歧义肽段记账规则下的主归属蛋白,蛋白层行的名字。
- 蛋白分组 (protein group)
- 共享肽段无法彼此区分的一组蛋白。
参考文献与延伸阅读
- Gomoryova K, Hecht H. 2025. Single Cell Proteomics data analysis with bioconductor-scp. Galaxy Training, training.galaxyproject.org(2025-02-07 发布).
- Grégoire S, Vanderaa C, Gatto L. 2024. Standardized workflow for mass-spectrometry-based single-cell proteomics data processing and analysis using the scp package. Methods in Molecular Biology 2817: 177–.
- Vanderaa C, Gatto L. scp: analysis of single-cell proteomics data. Bioconductor 包及文档, uclouvain-cbio.github.io/scp/.
- Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
- Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
- Budnik B, Levy E, Harmange G, Slavov N. 2018. SCoPE-MS: mass spectrometry of single mammalian cells quantifies proteome heterogeneity during cell differentiation. Genome Biology 19: 161.