3.1.1 从荧光到金属:通道数的突围
第 1 章 1.3 节把亲和路线的主角留给了抗体。荧光流式细胞术用有机荧光团作抗体的报告标签,一次测多个蛋白;它的瓶颈写在光的物理性质里。荧光发射谱很宽,半峰宽常达数十纳米,滤光片通带彼此交叠,一个通道的信号总会漏进邻通道,形成串色(spillover),须靠补偿矩阵(compensation matrix)事后剥离;样本自身的自发荧光(autofluorescence)又在低波长区垫高背景。通道越多,补偿矩阵越庞大,误差在矩阵运算里层层传递。实际配置中,荧光流式把可用通道压在约二三十个;再往上加,串色与背景很快吞掉新增通道的信息。
质谱流式(mass cytometry,商品名 CyTOF)把报告标签从光子换成原子:抗体携带镧系元素(lanthanide)的稳定同位素,通道判据由发射波长换成原子质量。同位素的质量峰极窄,相邻稳定同位素至少相差 1 原子质量单位(amu),峰宽远小于间距,通道之间天然正交;生物体内几乎不含这些重金属,背景也低。可用通道数由此提到四十个以上(Spitzer and Nolan, 2016)。仪器原理由 Bandura et al. (2009) 奠定:把流式细胞术的单细胞液流与电感耦合等离子体质谱对接,实现实时多重免疫测量。
方法学的标杆是 Bendall et al. (2011):31 种金属标签抗体,加上 DNA 嵌入剂、顺铂活性染料与事件长度,一次测量人骨髓细胞的 34 个参数,覆盖整个造血连续谱(图 3.1-1 直观给出两类标签在通道分辨上的差别)。
3.1.2 测量链路:从染色细胞到金属谱
质谱流式的一次测量可以拆成五步(图 3.1-2)。第一步在管内完成:抗体经多价螯合聚合物负载上镧系同位素原子,与表位结合后,每个靶点都挂上几十到上百个金属原子。此后细胞悬液进样,气动雾化(pneumatic nebulization)用氩气把液流打散成微米级雾滴,力求一粒雾滴至多裹一个细胞。雾滴进入约 7000 K 的电感耦合等离子体(inductively coupled plasma, ICP),细胞瞬间脱水、崩解、原子化,电子被剥离,金属标签还原成裸的单原子离子。离子束经截取锥进入飞行时间质谱(time-of-flight mass spectrometry, TOF):同一团离子云里,质荷比不同的离子飞行速度不同,先后抵达检测器;检测器按微秒级时间切片计数,把一次离子云的瞬态翻译成各质量通道的强度。每个细胞由此留下一条记录——一个事件(event),内容是该细胞携带的全部金属元素的强度谱。
事件(event):质谱流式的基本测量单位,指检测器识别到的一次离散离子云脉冲,通常对应一个细胞。一个事件携带三方面信息:各金属通道的离子计数(抗体信号)、核酸与活性等质控通道的读数、以及离子云的时间跨度(事件长度)。碎片、裸雾滴与双细胞粘连也会形成事件,须在分析前靠质控通道甄别。
表 3.1-1 把两条技术路线并排放置。三处机理差异需要展开。其一,串色近乎消失:质量通道互不渗透,补偿不再是数据处理的常规负担,残余串扰主要来自氧化物——镧系离子在等离子体中与氧结合后质量整体偏移 +16 amu,可能落进别的通道窗口,仪器调谐要把氧化水平压得足够低。其二,灵敏度:荧光流式的最强通道仍占优,质谱流式在单细胞水平上的检出限约更高,弱表达靶点的信号可能贴近本底(Spitzer and Nolan, 2016)。其三,细胞的命运:细胞在等离子体中被彻底原子化,无法像荧光流式那样分选回收活细胞,也无法回头补测同一细胞的核酸——这是与流式分选的关键分野,也是 3.2 节 CITE-seq 换一条路的动机之一。通量上同样让步:每秒数百事件,约为荧光流式的百分之一量级。
| 维度 | 荧光流式 | 质谱流式(CyTOF) |
|---|---|---|
| 报告标签 | 有机荧光团 | 镧系等元素稳定同位素 |
| 通道判据 | 发射波长与滤光片组合 | 原子质量(amu) |
| 可用通道数 | 约二三十 | 四十以上(Spitzer and Nolan, 2016) |
| 通道间串扰 | 普遍,须补偿矩阵 | 几乎无(氧化物 +16 例外) |
| 单细胞灵敏度 | 最强通道更优 | 约略逊,弱靶点贴近本底 |
| 细胞命运 | 可分选、可回收 | 完全原子化,不可回收 |
| 事件通量 | 每秒数万事件 | 每秒数百事件 |
3.1.3 通道设计:表型、信号与质控
通道数放开之后,panel 的设计变成一门独立的学问。生物学通道大体三类。第一类是表面标志,勾勒细胞的谱系身份,是聚类与注释的骨架。第二类是磷酸化蛋白(phosphoprotein):固定穿膜之后,抗体打到 pERK、pSTAT 这类信号分子的活化位点上,读出的是细胞当下的信号状态——药物扰动研究的主力正在这里,同一表型内部的细胞对同一药物的应答可以差得很远。第三类是细胞因子、转录因子等功能标志,刻画细胞的分化与效应状态。
另一组通道不问生物学,只问数据质量。DNA 嵌入剂(DNA intercalator)(铱同位素)插入核酸,完整细胞的 DNA 含量集中在二倍体附近,碎片与裸核的读数偏低,据此圈出完整细胞。顺铂(cisplatin)活性染料短时共孵育,只有膜受损的死细胞让它进入,活细胞读数极低,据此区分死活。事件长度(event length)是仪器自带的量:离子云的时间跨度。双联体(doublet)——两个细胞的粘连——近似两个单细胞信号的叠加,事件长度与各通道总强度都偏高,据此剔除。三个质控通道合起来,把"这个事件确实是一个活细胞"这句话变成可以检验的命题。
习题 3.1-1
某 panel 包含:89Y-CD45、142Nd-CD4、154Sm-pERK、165Ho-TNFα、191/193Ir 嵌入剂、195Pt-顺铂,外加事件长度。(a)把七个量按"表型通道、功能通道、质控通道"归类。(b)一个 CD4 阳性 T 细胞与一个 B 细胞在进样口粘连成双联体,哪些读数会异常?为什么会被剔除?(c)一个死细胞若混入分析,可能给磷酸化信号带来什么偏差?
参考解答(a)表型通道:89Y-CD45(白细胞标志)、142Nd-CD4(T 细胞亚群标志);功能通道:154Sm-pERK(MAPK 信号状态)、165Ho-TNFα(效应功能);质控:Ir 嵌入剂(核酸量)、195Pt-顺铂(死活)、事件长度(双联体)。(b)事件长度约翻倍;Ir 通道核酸总量与各标志通道的总强度同时偏高——CD4 与 B 细胞标志(如 CD20)可能同时阳性,违反"一个细胞一套表位"的预期。按事件长度与 DNA 含量的上界门控即可剔除。(c)死细胞膜受损,抗体非特异性进入胞内,磷酸化等胞内信号被系统性抬高,且其降解状态本身就改变磷酸化水平;不经顺铂门控剔除,会污染"药物响应"的定量。
3.1.4 样本条码:先编号,后混样
多样本实验里,最隐蔽的变异来自操作本身。十几管细胞各自染色,抗体加入量、孵育时间、洗涤效率的微小差别都会写进每管的信号,分析时与真实的生物学差异混在一起——这就是管间的批次效应,靠事后统计很难剥离干净。
样本条码(sample barcoding)把操作顺序倒过来:先给每管细胞打上同位素条码,再把各管混合成一份样品,此后染色、洗涤、上机采集全部在同一管内完成;分析时按条码组合把每个事件解卷积回它原来的样本(debarcoding)。钯同位素条码从 6 种稳定同位素中取 3 种组合,理论上 C(6,3) = 20 个条码;组合式编码自带纠错——一个事件若同时携带两个条码,说明是两个细胞的粘连,可直接判为双联体剔除(Zunder et al., 2015)。如此一来,管间染色差异随混样而消失,抗体用量与机时按样本数成比例下降,对细胞量稀少的临床样本尤为可贵。
条码必须打在染色之前。若先逐管染色、再混样,染色差异已经写进各管信号,条码只剩记账功能,消除批次效应的收益不复存在。正确顺序是:条码 → 混样 → 染色 → 采集;混样之后所有样本经历同一份试剂、同一次孵育与洗涤、同一段仪器时间。此外,条码通道占据质量窗口(钯区约 102–110 amu),设计 panel 时须与抗体的同位素分配统筹,避免撞峰。
习题 3.1-2
(a)钯条码方案取 6 种稳定同位素中的 3 种组合,可编出多少个样本?若改取 4 种呢?(b)12 管样本经条码混样后统一染色:与逐管染色相比,40 通道 panel 的抗体用量与采集机时各降到原来的几分之一?(c)仪器以每秒 300 个事件采集,门控后 50% 为有效单细胞,每天按 8 小时有效采集估算,一天可积累多少个可用细胞?这是什么量级?
参考解答(a)C(6,3) = 6!/(3!·3!) = 20 个;C(6,4) = C(6,2) = 15 个——组合数并非随位数单调上升。(b)混样后一次染色代替 12 次,抗体用量从 12×40 = 480 份降到 40 份,即 1/12;采集同样合并为 1 段,机时约降到 1/12。(c)300 × 0.5 × 8 × 3600 = 4.32×106,约四百万个细胞,即百万量级——质谱流式"宽而浅"的测量规模由此而来(与深蛋白组路线每批数百个细胞对照,见 3.3 节)。
3.1.5 数据特点:稠密、连续、偏态
质谱流式的数据矩阵是"事件 × 通道",每个事件测全部通道,缺失近乎为零。与第 1、2 章质谱蛋白组学大面积缺失的稀疏矩阵相比,这是结构性的差别:缺失值填补(imputation)通常不是这里的核心问题,主战场移到变换、归一化(normalization)与门控;面对名目繁多的处理流程组合,ANPELA 一类的工具可以系统导航选优(Zhu et al., 2025)。具体做法留给第 5 章,本节先把数据的"脾气"交代清楚。
其一,信号是连续强度值:本质为离子计数,背景扣除后可以取零、乃至取负。其二,分布右偏且横跨数个量级,直接取对数会在零与负值处失去定义——对数函数只接受正数。通行做法是反双曲正弦变换(arcsinh transformation):
arcsinh 变换的用法。c 决定线性区与对数区的交界:c 越大,弱信号被压缩得越平;CyTOF 强度常取 c = 5,荧光流式常取更大的值(如 150),量级差异来自两种仪器的计数分布。操作上,先做背景扣除,再逐通道变换;变换保号保零,负值不必截断。跨数据集比较时必须固定同一 c,否则同一强度在不同数据集里落到不同位置,批次间会产生假差异。变换后再做门控、聚类与降维。
其三,动态范围有限且高端饱和:检测器的计数上限使高强度端趋于饱和,可用动态范围约四五个量级;弱端又受检出限约束(3.1.2 节的灵敏度让步),极强与极弱的信号都须谨慎解读。其四,门控是分析的第一道工序:DNA 含量与事件长度圈掉碎片和双联体,顺铂通道圈掉死细胞,通过质控的事件才进入聚类与建模。通量按事件计:仪器每秒采集数百事件,一个工作日下来是百万量级的细胞。
习题 3.1-3
取 c = 5,手算下列变换值(保留两位小数)。(a)x = 500;(b)x = 0;(c)x = −20;(d)对比:若用常用对数变换,三个值各遇到什么问题?
参考解答(a)f(500) = arsinh(100) = ln(100 + √10001)。√10001 ≈ 100.005,故 arsinh(100) ≈ ln(200.005) ≈ 5.30。(b)f(0) = arsinh(0) = ln(1) = 0。(c)f(−20) = arsinh(−4) = −arsinh(4) = −ln(4 + √17) ≈ −ln(8.12) ≈ −2.09,负值照常变换且保号。(d)log(500) ≈ 2.70 似乎可用,但 log(0) 无定义,log(−20) 无定义——背景扣除后恰好为零或为负的通道(本底附近的真实情形)会整列报废,或须人为加一、截断为零,两者都扭曲弱信号区。arsinh 在零与负值处有定义,小信号区近似线性,这正是式 (3.1-1) 成为领域默认的原因。
3.1.6 应用形态与路线分工
质谱流式的两类经典应用形态,都建立在"高维 × 大细胞数"之上。一类是系统图谱:Bendall et al. (2011) 用 SPADE 把数十万个骨髓事件的聚类结果组织成一棵最小生成树,树的枝干复现造血系统的连续谱——从干细胞到各系成熟细胞,中间状态不再是离散的"类型",而是可度量的过渡(Qiu et al., 2011)。另一类是扰动应答:药物处理后不同时间点取样,磷酸化通道读出信号通路的动态,表型相同的细胞群体内部,应答轨迹可以截然不同——这正是均值会掩盖、而单细胞测量直接可见的异质性。
34 参数的造血图谱。Bendall et al. (2011) 对健康人骨髓细胞一次测量 34 个参数:31 种金属标签抗体(覆盖各系表面标志与胞内信号蛋白)+铱 DNA 嵌入剂(完整细胞)+顺铂活性染料(死活)+事件长度(双联体)。在同一数据集上,酪氨酸激酶抑制剂等药物扰动下的磷酸化应答按细胞状态分层呈现:同一表面表型内部的信号应答差异,比表型之间的差异更能解释药物反应。这篇论文确立了质谱流式的面板设计与分析范式,此后 panel 一路扩到四十通道以上。
与质谱路线的分工也由此清晰:质谱流式测的是预先选定的几十种蛋白,换取百万级的细胞数——宽而浅;第 2 章的质谱路线不做预先选择,一次定量数千种蛋白,但每批只有数百个细胞——窄而深。蛋白测量上两条路线如何取舍与互补,3.3 节专门讨论;其数据与转录组的联合建模,见 3.4 节与第 5 章(Lin et al., 2024)。
本节围绕质谱流式的测量原理与数据特点,要点可以收拢为四条:
- 标签换轨:荧光的宽发射谱与自发荧光把通道压在约二三十;镧系同位素的质量峰窄而正交,通道数提到四十以上;
- 链路与代价:染色—雾化—等离子体—飞行时间—事件记录;串色近乎消失,灵敏度约逊于荧光流式最强通道,细胞被销毁、不能分选回收,通量为每秒数百事件;
- 设计三件套:表型通道立骨架,磷酸化通道读状态,DNA 嵌入剂、顺铂与事件长度把关数据质量;样本条码先编号后混样,管间差异随混样消失;
- 数据脾气:几乎无缺失、连续可负、右偏跨量级——arcsinh 变换(c 常取 5)取代对数,动态范围有限、高端饱和,双联体与碎片靠质控通道门控剔除。
关键术语
- 质谱流式 (mass cytometry)
- 以金属同位素为报告标签、经等离子体质谱读出的单细胞多参数测量技术(CyTOF)。
- 串色 (spillover)
- 一个检测通道的信号漏进相邻通道的现象,荧光流式须靠补偿矩阵矫正。
- 事件 (event)
- 检测器记录的一次离散离子云脉冲,通常对应一个细胞及其全通道强度谱。
- 事件长度 (event length)
- 离子云的时间跨度,双联体近似翻倍,是剔除粘连事件的依据。
- 双联体 (doublet)
- 两个细胞的粘连,信号总量与事件长度同时偏高。
- DNA 嵌入剂 (DNA intercalator)
- 插入核酸的金属染料(铱),按 DNA 含量区分完整细胞与碎片。
- 顺铂活性染料 (cisplatin viability stain)
- 短时共孵育只进入膜受损细胞的金属染料,区分死活。
- 样本条码 (sample barcoding)
- 混样前给每管细胞打上同位素组合条码,混样后统一染色与采集。
- arcsinh 变换 (arcsinh transformation)
- 反双曲正弦变换,零与负值有定义,兼顾线性低端与对数高端的强度变换。
- 门控 (gating)
- 按质控通道圈定合格事件(完整、存活、单个细胞)的分析步骤。
参考文献与延伸阅读
- Bandura DR, Baranov VI, Ornatsky OI, et al. 2009. Mass cytometry: technique for real time single cell multitarget immunoassay based on inductively coupled plasma time-of-flight mass spectrometry. Analytical Chemistry 81: 6813–6822.
- Bendall SC, Simonds EF, Qiu P, et al. 2011. Single-cell mass cytometry of differential immune and drug responses across a human hematopoietic continuum. Science 332: 687–696.
- Qiu P, Simonds EF, Qiu P, Simonds EF, Bendall SC, et al. 2011. Extracting a cellular hierarchy from high-dimensional cytometry data with SPADE. Nature Biotechnology 29: 886–891.
- Zunder ER, Finck R, Behbehani GK, et al. 2015. Palladium-based mass tag cell barcoding with a doublet-filtering scheme and single-cell deconvolution algorithm. Nature Protocols 10: 316–333.
- Spitzer MH, Nolan GP. 2016. Mass cytometry: single cells, many features. Cell 165: 780–791.
- Lin HJL, Webber KGI, Nwosu AJ, Kelly RT. 2024. Review and practical guide for getting started with single-cell proteomics. Proteomics 25(1–2): e202400021.
- Zhu F, et al. 2025. Navigating the data processing for cytometry-based single-cell proteomics. Nature Protocols(ANPELA,idrblab.cn/anpela).