2.3.1 三处不稳:SCoPE-MS 留下的作业
2.2 节把等压载体(isobaric carrier)的机理讲完:载体通道抬高母离子的可检测性、供给碎片离子、减少样品损失。SCoPE-MS 依此第一次量化了单个哺乳动物细胞的蛋白组异质性,鉴定蛋白超千种(Budnik et al., 2018)。但作为方法学论文读,它更像一份概念验证:操作者之间、天与天之间、针与针之间的波动,没有任何指标在盯着。稳健性(robustness)指方法的输出质量对条件波动的迟钝程度——操作者、批次、仪器状态换一轮,结果仍然站得住。把"能测一个细胞"变成"能测成千上万个细胞",跨的正是这道门槛,而 SCoPE-MS 在三处欠了账。
其一,手工挑取。显微镜下用微吸管把细胞逐个挑进离心管,通量以每小时个位数计,成败系于操作者的手感;挑取路径穿过开放环境,环境蛋白与上一个样品的残留随时可能混入。挑错、挑丢、挑脏,事后无从分辨。
其二,制备链路长。聚焦超声裂解依赖专用设备,逐管操作无法并行;裂解体积约 10 µL,皮克级蛋白在这样的体积里被管壁吸附与转移步骤层层稀释——样品还没到质谱,就已经丢了一截。
其三,缺乏质量控制的语言。哪一针仪器状态不佳、哪个细胞的定量失败,没有指标可以指认;问题数据混在好数据里,以离群点和假差异的面目进入结论。方法学的可信度因此悬空:数字好看,却说不出好在哪个环节、坏在哪个环节。
SCoPE2 的回答不是换一台更灵敏的质谱仪,而是把流程当作一个系统重设(Specht et al., 2021):分离自动化、制备微型化、色谱与采集条件为皮克级样品重新调定,每一步都配上可读数的质量指标。图 2.3-1 汇总了对应关系:上排是 SCoPE-MS 的薄弱环节,下排是 SCoPE2 的针对性改造。
把稳健性当透镜,方法学论文立刻变得可读:每一段改进,要么在压低某个波动源——自动化、微型化、随机化都是;要么在给某个波动源配上读数——CV、SCR、空白孔都是。后文读到 plexDIA、nPOP 与自动化平台时,可以用同一把尺子量:它抹平了哪一处不稳,又用什么指标证明抹平了。这也是本节把 SCoPE2 当精读对象的原因:它把"改了什么、为什么有效、怎么知道有效"三件事写得最全。
2.3.2 自动化与微型化:分选、多孔板与 mPOP
细胞分离改用流式分选(fluorescence-activated cell sorting, FACS):分选仪把细胞逐个分入 384 孔 PCR 板,每孔预装 1 µL 纯水与已知量的内标肽段。孔位按随机化(randomization)布局排布,细胞类型、处理组与孔位、板位因此不相关——系统偏差交给统计去平均,而不是沉淀在结果里。原文流程共 179 个分析集(set)(共用一次 LC-MS/MS 进样的一组 TMT 通道),平均含 5 个巨噬样细胞、2 个单核细胞和 1 个空白孔,加上约 200 个细胞当量的载体,凑成 11 重或 16 重。
两个通道值得单独点名。参考通道(reference channel)装约 5 个细胞当量的混合样品,所有分析集同源,任务是为跨集定量提供公共锚点。载体干不了这件事:它与单细胞的信号比达数百倍,早已越出报告离子定量的线性范围。参考取 5 倍于单细胞的量,既改善离子计数统计,又留在线性区之内。空白对照孔(control well)不加细胞,却经历与单细胞孔完全相同的处理——加酶、标记、猝灭、合并。它本不该有任何报告离子信号,测到的信号就是共隔离干扰、试剂杂质与交叉标记的本底。空白孔因此身兼两职:给本底定价,替污染站岗。图 2.3-2 画出一个典型分析集的通道构成。
每孔预装的已知量内标肽段同样是对账工具:它们与样品走完同样的色谱、喷雾与采集,保留时间和信号强度随时可比——仪器漂移、柱效衰减因此有据可查,而不是靠感觉判断"今天状态不好"。
制备端换成mPOP(minimal proteOmic sample preparation):细胞在纯水中经冷冻与 90 °C 加热的冻融循环裂解,直接加胰酶 37 °C 酶解,标记后合并进样。全程只用质谱兼容的试剂,省去清洗除盐这一最伤低丰度样品的环节。裂解体积从约 10 µL 压到 1 µL,制备搬进多孔板与普通 PCR 仪,并行度提升、耗材与设备成本下降都超过两个数量级(Specht et al., 2021)。体积小、步骤少、并行高,直接对应的正是稳健性:管壁吸附的表面积小了,人为介入的次数少了,批与批之间才可比。
分选方式不是唯一入口。SCoPE2 的流程明确兼容手工挑取、流式分选与微流控三类分离方式,选择标准是通量、交叉污染率与对细胞状态的扰动。流式胜在通量与随机化,代价是流体压力与稀释;追求更小体积、更低残留污染的路线(液滴式 nPOP、自动挑针平台)在 2.4 节与 2.6 节展开。
习题 2.3-1
SCoPE2 每个分析集含载体(约 200 个细胞当量)与参考通道(约 5 个细胞当量)。(a)参考通道为什么取 5 倍于单细胞的量,而不是与载体相同的 200 倍?(b)若参考通道改用 200 个细胞当量,跨集归一会遇到什么困难?(c)据此概括载体与参考通道的分工。
参考解答(a)参考的职责是给跨集定量提供锚点,其信号必须与单细胞处于同一量级:5 倍于单细胞改善离子计数统计,又不越出报告离子定量的线性区。(b)200 倍当量把参考/单细胞的信号比推到数百倍,线性假设难以成立;参考通道还会像第二个载体那样抬高共隔离背景,把单细胞通道的比值进一步压缩。(c)载体负责"帮助鉴定"——抬高 MS1 可检测性、供给碎片离子,可以容忍比值压缩;参考负责"帮助归一"——必须与单细胞保持可比。两者量级不同,职责不可互换。
2.3.3 窄孔柱与低流速:为皮克级样品重设分离
灵敏度的另一半在色谱与喷雾端。机理一句话:电喷雾的离子产率随流速降低而升高。流速小,泰勒锥喷出的雾滴就小,去溶剂更完全,带电分子逃逸进气相的比例更高;Wilm 与 Mann 的经典工作表明,纳升级电喷雾相对常规流速可把进入质谱的离子占比提高两三个数量级(Wilm and Mann, 1996)。对皮克级样品这不是锦上添花:同样多的肽段分子送进小一个量级的雾滴,等效浓度随之抬高,离子计数才有机会越过检出限。
SCoPE2 的具体配置:25 cm 长、75 µm 内径的 C18窄孔柱(narrow-bore column),200 nL/min 恒流;每针总时长约 95 min,其中上样约 20 min、有效梯度约 60 min、冲洗与再平衡约 15 min(Specht et al., 2021)。梯度刻意压短,是立场明确的选择:目标是跨尽可能多的细胞定量尽可能多的蛋白,而不是把单针挖到最深。梯度每加长一倍,单针覆盖会深一些,通量按比例减半——单细胞蛋白组学几乎总是选通量。
窄孔柱还有第二重贡献。同样的肽段质量负载在更细的柱床上,洗脱峰的浓度更高:柱内径缩小带来的"少稀释",与喷雾端的"小雾滴"叠加,色谱与离子化两端同时抬高有效浓度。这也是单细胞方法几乎无一例外选择 75 µm 及以下内径的原因(Lin et al., 2024)。代价是系统更娇气:窄柱易堵、死体积敏感、对颗粒物零容忍,于是制备端的洁净与流程的标准化又反过来成为前提——稳健化是一条链,不是一个个孤立的招数。
采集端同样为低信号重设:隔离窗压到 0.7 Th 以减少共隔离;MS2 注入时间上限放宽到 300 ms,让低丰度母离子有时间积累足够的离子拷贝;仪器参数不再凭手感调,而由 DO-MS 从数据的分布反推(Huffman et al., 2019)。改造的效果可以读出数来:八成以上母离子在其色谱峰顶 3 s 以内被采样;隔离纯度的中位数——母离子分数(precursor ion fraction, PIF),MaxQuant 对隔离窗口内目标离子占比的估计——超过 97%;约 35% 的 MS2 谱图在 1% FDR 下获得肽段指认,DART-ID 再借保留时间信息在同等错误率下提升指认数量(Chen et al., 2019)。
2.3.4 性能数字的口径
性能数字必须连着口径读。SCoPE2 的覆盖分三个层次:全数据集合计定量 3,042 种蛋白(1% FDR,由 25,015 条肽段支持);单个分析集约 1,000 种蛋白、约 2,500 条肽段;"单个细胞约千种"是分析集内通道合并后的口径。平均每种蛋白只在约 305 个细胞中有值——缺失是矩阵的常态,不是例外。表 2.3-1 把各口径并列。
| 指标 | 数值 | 口径说明 |
|---|---|---|
| 覆盖(合计) | 3,042 种蛋白 / 25,015 条肽段 | 1% FDR,跨 179 个分析集汇总 |
| 覆盖(单分析集) | 约 1,000 种蛋白 / 约 2,500 条肽段 | 约 1 h 有效梯度下的平均 |
| 覆盖(单细胞) | 约 1,000 种 | 分析集内通道合并后可用 |
| 平均每蛋白有值细胞数 | 约 305 个 | 缺失为常态 |
| 合格单细胞总数 | 1,490 个单核/巨噬样细胞 | 通过逐细胞质控后保留 |
| 机时 | 10 天 | 单台仪器 |
| 每针分析时间 | 约 90–95 min | 含上样与再平衡 |
| 折合每细胞机时 | 约 6 min | 按 16 重通道折算 |
| 名义通量 | 约 200 个细胞 / 24 h | 未计质控剔除 |
通量的算术值得亲手做一遍:每针约 90–95 min,一天约 15 针;16 个通道扣除载体、参考与空白后约 13 个是单细胞通道,名义通量约 200 个细胞/24 h;再乘以质控通过率,才得到 10 天 1,490 个合格细胞的实数。名义与合格之间那三四成的差,正是下一节的质量控制要挣回来的钱。
读性能先问口径。"定量 3,042 种蛋白"与"每个细胞定量 3,042 种蛋白"相差悬殊:前者是跨细胞合计,后者从未发生。同理,"约 200 个细胞/天"是名义通量,不等于合格细胞数;"每细胞约千种蛋白"离不开合并口径。把口径写清楚,是社区报告规范对单细胞蛋白组学实验的硬性要求(Gatto et al., 2023)。
习题 2.3-2
设某机构 LC-MS/MS 机时费为 300 元/小时。SCoPE2 每针 95 min,每天有效运行 22 h;16 个通道中 13 个为单细胞通道,质控通过率约 64%。(a)名义日通量是多少个细胞?(b)每个合格细胞的机时成本约多少?(c)为什么"每细胞成本"必须注明口径?
参考解答(a)每日针数 ≈ 22×60/95 ≈ 13.9,取 13–14 针;乘以每针 13 个单细胞通道,名义通量约 169–182 个细胞/日,量级与文献的"约 200 个/24 h"一致。(b)日机时费 300×22 = 6,600 元;合格细胞 ≈ 175×0.64 ≈ 112 个,机时成本约 6,600/112 ≈ 59 元/合格细胞;若按名义口径则为 6,600/175 ≈ 38 元。(c)口径不同,成本相差近一倍;再算上 TMT 试剂、耗材与人工,报价还会上浮。比较不同方法的成本时,先统一"名义还是合格、含不含制备"的口径,数字才有可比性。
2.3.5 质量控制语言:CV、SCR 与缺失率
SCoPE2 给流程配的第一件工具是变异系数(coefficient of variation, CV):
关键在于把式 (2.3-1) 算在什么对象上。SCoPE2 的做法:对一个细胞内肽段数多于 5 的蛋白,把每条肽段的报告离子强度换算成相对全样本均值的倍数变化;同一蛋白的各条肽段本应给出一致的倍数,其离散程度即为该蛋白的 CV;一个细胞全部蛋白 CV 的中位数(中位 CV)就是这个细胞定量一致性的打分。打分低的细胞保留,打分高的剔除。同一逻辑也用于剔除实验:指认数不足 500 的 6 个分析集(进样不完整或制备失败)整针出局;9 个中位 CV 异常低的空白孔同样出局——空白孔本不该有相关的肽段信号,低 CV 反倒说明混入了真实细胞物质(Specht et al., 2021)。公开的分析教程沿用这套逻辑,以肽段层中位 CV 不超过 0.65 作为保留细胞的阈值(Gomoryova and Hecht, 2025)。
变异系数的两个聚合方向。CV 可以横着算,也可以竖着算。SCoPE2 的质控把 CV 算在"一个细胞内的多条肽段"上——同一蛋白的肽段之间应当自洽,回答的是"这个细胞测得怎么样";习题 2.3-3 把 CV 算在"一个蛋白跨多个重复细胞"上,回答的是"这个蛋白的重复性怎么样"。两个方向不可混用:前者是细胞级质控指标,后者混合了技术噪声与真实的生物学差异,直接拿后者套质控阈值是常见错误。
第二件工具是样品/载体比(sample-to-carrier ratio, SCR):单细胞通道信号与载体通道信号之比。它是双向的。比得过低,说明单细胞信号贴近噪声、定量无从谈起——教程流程据此剔除 SCR 低于 0.1 的特征(Gomoryova and Hecht, 2025);比得过高,则提示交叉标记或残留污染(carry-over)——原论文剔除单细胞平均信号超过载体一成的肽段。0.1 不是普适常数,而是"离载体太近已不可信"的量级表达。
第三件是缺失值(missing value)的结构。SCoPE2 数据里,已指认肽段约一成的缺值源于报告离子信噪比不足——这是灵敏度问题,拉长离子积累时间或收窄色谱峰可以缓解;大头则源于肽段根本没有被送进 MS2:DDA 按强度挑离子,不同分析集挑中的集合不同(1.4.6 节),这是采集方式的结构性质。分析端对两类缺失必须区别对待,而整套处理是从过滤开始的级联(教程口径,Gomoryova and Hecht, 2025):
- PSM 层:母离子分数不低于 0.8,样品/载体比不低于 0.1,每个分析集至少 150 个指认,1% FDR;
- 肽段层:逐细胞中位 CV 不超过 0.65(据此剔细胞),蛋白归并要求至少 5 条肽段支持,近乎全空的肽段(缺失逾 99%)先行剔除;
- 蛋白层:至少 15 个细胞有值方可保留,进入填补与批次校正。
级联的顺序本身就是立场:先把坏测量挡在门外,再谈填补与校正——kNN 填补、ComBat 批次校正如何动这些数字,第 4 章逐项对账。图 2.3-3 把三个核心指标画成仪表盘,读单细胞数据时,这三块表先于任何生物学结论。
习题 2.3-3
某蛋白在 5 个重复单细胞通道中的 TMT 报告离子强度为 850、940、1,010、1,120、1,080(任意单位)。(a)按式 (2.3-1) 计算该蛋白跨细胞的 CV。(b)若加入第 6 个细胞,强度为 4,000,CV 变为多少?(c)结合质控语言,应如何处置第 6 个细胞?
参考解答(a)均值 m = 5,000/5 = 1,000;离差平方和 = 150²+60²+10²+120²+80² = 47,000;样本方差 = 47,000/4 = 11,750,s ≈ 108.4;CV ≈ 0.108(约 11%),在单细胞定量的常见重复性之内。(b)六值均值 = 9,000/6 = 1,500;离差平方和 = 650²+560²+490²+380²+420²+2,500² = 7,547,000;样本方差 = 7,547,000/5 = 1,509,400,s ≈ 1,228.5;CV ≈ 0.82。一个离群通道把跨细胞 CV 从约 0.11 推到约 0.82。(c)先查再删:回看该通道的 SCR、进样记录与分选日志——4,000 的强度远超同类细胞,更像交叉标记或残留污染,而非真实高表达;确认后以质控理由整通道剔除,并把理由记录在案。不做核查、只在统计上删点,会把技术问题伪装成生物学发现。
2.3.6 生物学对照与平行验证
U-937 分化系统。U-937 是人组织细胞性淋巴瘤细胞系,悬浮生长、背景均一;经佛波酯(PMA,蛋白激酶 C 激动剂)处理后贴壁并获得巨噬样表型。SCoPE2 采用 5 nM PMA 处理 24 h、撤药恢复 48 h 的方案获得巨噬样细胞,与同步传代的未处理单核细胞对照。选它的理由是方法学的:分化提供一个清晰的阳性别照——流程若连这两种细胞都分不开,其余无从谈起;同时它留了一个开放问题:均一的起始群体,分化之后还均一吗?
对照设计有三层。第一层,单细胞对 bulk:在计算机内把单细胞数据平均,估出单核/巨噬样的蛋白倍数变化,与常规 bulk 蛋白组的估计比对,相关系数约 0.88——单细胞定量本身是准的。第二层,蛋白对 RNA:同一份细胞悬液另做 10× 平台的单细胞转录组,两套数据联合投影到同一低维空间,单核与巨噬样两簇彼此吻合,多数基因的 RNA 与蛋白协同变化。第三层,已知生物学:两簇间的差异蛋白富集到与单核、巨噬功能一致的方向——增殖与翻译对黏附与表面信号。
结果本身也成了方法的证词。用全部 3,042 种蛋白做主成分分析,1,490 个细胞沿第一主成分(约 29% 方差)分成两簇,与处理标签对应;只用信号蛋白或丰度最低的一档蛋白,分类依然成立——量到的不是少数高丰度结构蛋白的影子。更有意思的是巨噬样簇内部:蛋白组呈连续谱而非离散亚群,谱系走向与经典的 M1/M2 极化标记一致。换言之,在没有外加极化细胞因子的条件下,巨噬样细胞的异质性自发出现——这一层结论,只有单细胞分辨的数据才有资格下。
蛋白与 RNA 的关系在单细胞层面初见分岔。多数基因两层协同;TNFSF13B、TP53 等少数基因的蛋白与 RNA 走势相反,指向翻译后调控——p53 蛋白与其靶基因 RNA 的相关,强于 TP53 转录本与靶基因的相关,与其受蛋白酶体降解调控的已知事实吻合。同时,每个基因被取样的蛋白拷贝数约为 RNA 拷贝数的 10–100 倍(全文口径约 20 倍),计数统计对蛋白侧更有利。两层组学在细胞类型层面一致、在个别基因层面互补,正是平行验证想看到的形态(Specht et al., 2021)。
2.3.7 可复现性:协议、代码与数据全公开
方法学论文的最后一项指标不在数据里,而在数据之外:别人能不能原样跑通。SCoPE2 在这方面近乎示范——协议、代码、原始数据全部公开:方法与协议入口在 Slavov Lab 资源站(scp.slavovlab.net/SCoPE2),分析代码在 GitHub 的 SlavovLab/SCoPE2 仓库,原始质谱数据存 MassIVE(编号 MSV000083945 与 MSV000084660),并与 DART-ID、DO-MS 的参数文件配套。可复现性(reproducibility)由此从态度变成可以核对的清单。
第三方复现随即到来。UCLouvain 的 Vanderaa 与 Gatto 用 Bioconductor 的 scp 包把 SCoPE2 的全部分析重做了一遍(SCP.replication 系列报告):复现成立,同时也暴露出两个对结果影响很大的计算环节——批次效应(batch effect)的校正与缺失值的处理(Vanderaa and Gatto, 2021)。Galaxy 教程再把同一数据整理成可在网页端逐步跑通的标准化流程(Grégoire et al., 2024;Gomoryova and Hecht, 2025)。复现的双重价值正在于此:它既确认结论不依赖原作者的手感,又把隐藏的敏感环节翻出来交给社区。
这套逻辑后来被写成规范:单细胞蛋白组学白皮书要求报告载体大小、通道利用、CV 分布与缺失结构等口径,把"可信"从形容词变成清单(Gatto et al., 2023)。读方法学论文时不妨倒过来用:先数它给出了多少质量控制语言,再看性能数字——没有前者的后者,只是没有刻度的读数。
本节把"把流程做稳"拆成可以逐项核对的设计:
- 分离与制备:流式分选直入多孔板、mPOP 微型化裂解,自动化与小型化共同压缩人为差异与吸附损失;
- 分离与采集:窄孔柱与低流速提高离子化效率,短梯度与多重标记把机时摊到细胞数上,DO-MS 把调参变成看分布;
- 质量控制:中位 CV 逐细胞把关,空白孔与 SCR 双向监控本底与污染,缺失结构区分灵敏度与采集设计两种来源;
- 验证与开放:bulk 与平行转录组双重对照,协议、代码与数据全公开,第三方复现确认结论并暴露敏感环节。
下一节把制备进一步推到液滴里:nPOP 用一步法在载玻片上并行处理数千个单细胞,通量再上一个台阶。
关键术语
- 稳健性 (robustness)
- 方法的输出质量对条件波动(操作者、批次、仪器状态)的迟钝程度。
- 分析集 (set)
- 共用一次 LC-MS/MS 进样的一组多重标记通道,含载体、参考、单细胞与空白孔。
- mPOP (minimal proteOmic sample preparation)
- 冻融与加热循环在纯水中裂解并酶解的微型化制备方法,免清洗直接标记。
- 窄孔柱 (narrow-bore column)
- 内径约 75 µm 的色谱柱,配合低流速提高电喷雾离子化效率。
- 变异系数 (coefficient of variation)
- 标准差与均值之比,度量相对离散程度;单细胞质控的核心指标。
- 样品/载体比 (sample-to-carrier ratio)
- 单细胞通道与载体通道信号之比;双向诊断信号过低与污染。
- 空白对照孔 (control well)
- 不加细胞但经历全部制备步骤的通道,用于估计本底与交叉污染。
- 参考通道 (reference channel)
- 各分析集同源的小量混合样品,信号与单细胞同量级,用于跨集归一。
- 母离子分数 (precursor ion fraction)
- 隔离窗口内目标母离子所占比例,度量共隔离程度(PIF)。
- 缺失值 (missing value)
- 蛋白×细胞矩阵中的空缺;信噪比不足与未被送入 MS2 两类来源处理方式不同。
- 批次效应 (batch effect)
- 与实验批次相关、与生物学无关的系统差异,须靠设计与校正控制。
- 可复现性 (reproducibility)
- 他人在公开协议、代码与数据支持下重做分析并获得一致结果的可能性。
参考文献与延伸阅读
- Budnik B, Levy E, Harmange G, Slavov N. 2018. SCoPE-MS: mass spectrometry of single mammalian cells quantifies proteome heterogeneity during cell differentiation. Genome Biology 19: 161.
- Chen AT, Franks A, Slavov N. 2019. DART-ID increases single-cell proteome coverage. PLoS Computational Biology 15: e1007082.
- Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
- Gomoryova K, Hecht H. 2025. Single cell proteomics data analysis with bioconductor-scp. Galaxy Training, training.galaxyproject.org.
- Grégoire S, Vanderaa C, Gatto L. 2024. Standardized workflow for mass-spectrometry-based single-cell proteomics data processing and analysis using the scp package. Methods in Molecular Biology 2817: 177–.
- Huffman RG, Chen AT, Specht H, Slavov N. 2019. DO-MS: data-driven optimization of mass spectrometry methods. Journal of Proteome Research 18.
- Lin HJL, Webber KGI, Nwosu AJ, Kelly RT. 2024. Review and practical guide for getting started with single-cell proteomics. Proteomics 25(1–2): e202400021.
- Slavov Lab. SCoPE2 方法、协议与数据入口. scp.slavovlab.net/SCoPE2(2026-08 访问).
- Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Serra M, Kharchenko P, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
- Vanderaa C, Gatto L. 2021. Replication of single-cell proteomics data reveals important computational challenges. Expert Review of Proteomics 18(10): 835–843.
- Vanderaa C, Gatto L. scp 包:质谱单细胞蛋白组学数据分析框架(Bioconductor,UCLouvain). uclouvain-cbio.github.io/scp/.
- Wilm M, Mann M. 1996. Analytical properties of the nanoelectrospray ion source. Analytical Chemistry 68: 1–8.