第3章 · 3.1

3.1 质谱流式:金属标签的高维细胞测量

Mass Cytometry: Measuring Cells with Metal Tags
摘要 质谱流式以镧系稳定同位素取代荧光团作报告标签:细胞经金属螯合抗体标记后雾化进入等离子体,完全原子化并离子化,飞行时间质谱按质荷比读出每个事件的金属强度谱。通道数由此提至四十以上,串色近乎消失;代价是细胞被销毁、灵敏度与通量略逊于荧光流式。本节剖析测量链路与通道设计,引入样本条码与 arcsinh 变换,并交代其数据特点与深蛋白组路线的分工。

3.1.1 从荧光到金属:通道数的突围

第 1 章 1.3 节把亲和路线的主角留给了抗体。荧光流式细胞术用有机荧光团作抗体的报告标签,一次测多个蛋白;它的瓶颈写在光的物理性质里。荧光发射谱很宽,半峰宽常达数十纳米,滤光片通带彼此交叠,一个通道的信号总会漏进邻通道,形成串色(spillover),须靠补偿矩阵(compensation matrix)事后剥离;样本自身的自发荧光(autofluorescence)又在低波长区垫高背景。通道越多,补偿矩阵越庞大,误差在矩阵运算里层层传递。实际配置中,荧光流式把可用通道压在约二三十个;再往上加,串色与背景很快吞掉新增通道的信息。

质谱流式(mass cytometry,商品名 CyTOF)把报告标签从光子换成原子:抗体携带镧系元素(lanthanide)的稳定同位素,通道判据由发射波长换成原子质量。同位素的质量峰极窄,相邻稳定同位素至少相差 1 原子质量单位(amu),峰宽远小于间距,通道之间天然正交;生物体内几乎不含这些重金属,背景也低。可用通道数由此提到四十个以上(Spitzer and Nolan, 2016)。仪器原理由 Bandura et al. (2009) 奠定:把流式细胞术的单细胞液流与电感耦合等离子体质谱对接,实现实时多重免疫测量。

方法学的标杆是 Bendall et al. (2011):31 种金属标签抗体,加上 DNA 嵌入剂、顺铂活性染料与事件长度,一次测量人骨髓细胞的 34 个参数,覆盖整个造血连续谱(图 3.1-1 直观给出两类标签在通道分辨上的差别)。

荧光流式的宽发射谱相互交叠,质谱流式的金属质量峰窄而正交 荧光流式:发射谱宽,通道相互渗透 强度 自发荧光 FITC PE APC APC-Cy7 500 550 600 650 700 发射波长(nm) 串色区(虚线圈):发射谱交叠,须用补偿矩阵矫正;自发荧光(灰带)进一步抬高背景。 质谱流式:质量峰窄,通道天然正交 离子计数 141 145 150 154 159 165 169 175 1 amu 峰宽 141 142 质量(amu) 同位素至少相差 1 amu,峰宽远小于间距,通道间几乎无串色;氧化物加成离子(+16 amu)是主要例外。
图 3.1-1 荧光流式与质谱流式的通道分辨对比(两幅图横轴等宽)。上:荧光发射谱半峰宽达数十纳米,相邻通道的谱线大面积交叠(虚线圈),须用补偿矩阵矫正,自发荧光(灰带)再抬高背景。下:镧系同位素按原子质量成峰,峰宽远小于相邻同位素间距,通道天然正交;插图放大 141 与 142 两个相邻通道,标注峰宽与 1 amu 间距的比例(Bandura et al., 2009;Spitzer and Nolan, 2016;作者整理)。

3.1.2 测量链路:从染色细胞到金属谱

质谱流式的一次测量可以拆成五步(图 3.1-2)。第一步在管内完成:抗体经多价螯合聚合物负载上镧系同位素原子,与表位结合后,每个靶点都挂上几十到上百个金属原子。此后细胞悬液进样,气动雾化(pneumatic nebulization)用氩气把液流打散成微米级雾滴,力求一粒雾滴至多裹一个细胞。雾滴进入约 7000 K 的电感耦合等离子体(inductively coupled plasma, ICP),细胞瞬间脱水、崩解、原子化,电子被剥离,金属标签还原成裸的单原子离子。离子束经截取锥进入飞行时间质谱(time-of-flight mass spectrometry, TOF):同一团离子云里,质荷比不同的离子飞行速度不同,先后抵达检测器;检测器按微秒级时间切片计数,把一次离子云的瞬态翻译成各质量通道的强度。每个细胞由此留下一条记录——一个事件(event),内容是该细胞携带的全部金属元素的强度谱。

定义

事件(event):质谱流式的基本测量单位,指检测器识别到的一次离散离子云脉冲,通常对应一个细胞。一个事件携带三方面信息:各金属通道的离子计数(抗体信号)、核酸与活性等质控通道的读数、以及离子云的时间跨度(事件长度)。碎片、裸雾滴与双细胞粘连也会形成事件,须在分析前靠质控通道甄别。

表 3.1-1 把两条技术路线并排放置。三处机理差异需要展开。其一,串色近乎消失:质量通道互不渗透,补偿不再是数据处理的常规负担,残余串扰主要来自氧化物——镧系离子在等离子体中与氧结合后质量整体偏移 +16 amu,可能落进别的通道窗口,仪器调谐要把氧化水平压得足够低。其二,灵敏度:荧光流式的最强通道仍占优,质谱流式在单细胞水平上的检出限约更高,弱表达靶点的信号可能贴近本底(Spitzer and Nolan, 2016)。其三,细胞的命运:细胞在等离子体中被彻底原子化,无法像荧光流式那样分选回收活细胞,也无法回头补测同一细胞的核酸——这是与流式分选的关键分野,也是 3.2 节 CITE-seq 换一条路的动机之一。通量上同样让步:每秒数百事件,约为荧光流式的百分之一量级。

表 3.1-1荧光流式与质谱流式的关键对比
维度荧光流式质谱流式(CyTOF)
报告标签有机荧光团镧系等元素稳定同位素
通道判据发射波长与滤光片组合原子质量(amu)
可用通道数约二三十四十以上(Spitzer and Nolan, 2016)
通道间串扰普遍,须补偿矩阵几乎无(氧化物 +16 例外)
单细胞灵敏度最强通道更优约略逊,弱靶点贴近本底
细胞命运可分选、可回收完全原子化,不可回收
事件通量每秒数万事件每秒数百事件
质谱流式测量链路:染色、雾化、等离子体、飞行时间分离与事件记录 ① 金属标签染色 抗体螯合同位素 逐管标记悬液 ② 气动雾化 氩气打散液流 一滴至多一细胞 ③ 等离子体炬 高温完全原子化 成单原子离子 ④ 飞行时间分离 离子云按质荷比 先后抵达检测器 ⑤ 事件记录 一次瞬态信号 读出全部通道 质量域:一次事件的全通道谱 离子计数 89Y CD45 142Nd CD4 154Sm pERK 165Ho TNFα 191/193Ir DNA 195Pt 顺铂 89 113 142 154 165 169 175 191·193 质量(amu) 生物学通道 质控通道 时间域:离子云脉冲 计数率 事件长度 时间 两个细胞粘连时脉冲加宽, 按事件长度门控剔除。
图 3.1-2 质谱流式的测量链路。上排五步:金属螯合抗体染色、气动雾化成单细胞雾滴、等离子体完全原子化并离子化、飞行时间分析器按质荷比展开离子云、逐事件记录。左下:一个事件在质量域的读出——各通道一根窄峰,紫峰为生物学通道(表面标志、磷酸化蛋白、细胞因子),灰峰为质控通道(DNA 嵌入剂、顺铂)。右下:同一事件在时间域的形状,脉冲宽度即事件长度(Bandura et al., 2009;Bendall et al., 2011;作者整理)。

3.1.3 通道设计:表型、信号与质控

通道数放开之后,panel 的设计变成一门独立的学问。生物学通道大体三类。第一类是表面标志,勾勒细胞的谱系身份,是聚类与注释的骨架。第二类是磷酸化蛋白(phosphoprotein):固定穿膜之后,抗体打到 pERK、pSTAT 这类信号分子的活化位点上,读出的是细胞当下的信号状态——药物扰动研究的主力正在这里,同一表型内部的细胞对同一药物的应答可以差得很远。第三类是细胞因子、转录因子等功能标志,刻画细胞的分化与效应状态。

另一组通道不问生物学,只问数据质量。DNA 嵌入剂(DNA intercalator)(铱同位素)插入核酸,完整细胞的 DNA 含量集中在二倍体附近,碎片与裸核的读数偏低,据此圈出完整细胞。顺铂(cisplatin)活性染料短时共孵育,只有膜受损的死细胞让它进入,活细胞读数极低,据此区分死活。事件长度(event length)是仪器自带的量:离子云的时间跨度。双联体(doublet)——两个细胞的粘连——近似两个单细胞信号的叠加,事件长度与各通道总强度都偏高,据此剔除。三个质控通道合起来,把"这个事件确实是一个活细胞"这句话变成可以检验的命题。

习题 3.1-1

某 panel 包含:89Y-CD45、142Nd-CD4、154Sm-pERK、165Ho-TNFα、191/193Ir 嵌入剂、195Pt-顺铂,外加事件长度。(a)把七个量按"表型通道、功能通道、质控通道"归类。(b)一个 CD4 阳性 T 细胞与一个 B 细胞在进样口粘连成双联体,哪些读数会异常?为什么会被剔除?(c)一个死细胞若混入分析,可能给磷酸化信号带来什么偏差?

参考解答

(a)表型通道:89Y-CD45(白细胞标志)、142Nd-CD4(T 细胞亚群标志);功能通道:154Sm-pERK(MAPK 信号状态)、165Ho-TNFα(效应功能);质控:Ir 嵌入剂(核酸量)、195Pt-顺铂(死活)、事件长度(双联体)。(b)事件长度约翻倍;Ir 通道核酸总量与各标志通道的总强度同时偏高——CD4 与 B 细胞标志(如 CD20)可能同时阳性,违反"一个细胞一套表位"的预期。按事件长度与 DNA 含量的上界门控即可剔除。(c)死细胞膜受损,抗体非特异性进入胞内,磷酸化等胞内信号被系统性抬高,且其降解状态本身就改变磷酸化水平;不经顺铂门控剔除,会污染"药物响应"的定量。

3.1.4 样本条码:先编号,后混样

多样本实验里,最隐蔽的变异来自操作本身。十几管细胞各自染色,抗体加入量、孵育时间、洗涤效率的微小差别都会写进每管的信号,分析时与真实的生物学差异混在一起——这就是管间的批次效应,靠事后统计很难剥离干净。

样本条码(sample barcoding)把操作顺序倒过来:先给每管细胞打上同位素条码,再把各管混合成一份样品,此后染色、洗涤、上机采集全部在同一管内完成;分析时按条码组合把每个事件解卷积回它原来的样本(debarcoding)。钯同位素条码从 6 种稳定同位素中取 3 种组合,理论上 C(6,3) = 20 个条码;组合式编码自带纠错——一个事件若同时携带两个条码,说明是两个细胞的粘连,可直接判为双联体剔除(Zunder et al., 2015)。如此一来,管间染色差异随混样而消失,抗体用量与机时按样本数成比例下降,对细胞量稀少的临床样本尤为可贵。

警示

条码必须打在染色之前。若先逐管染色、再混样,染色差异已经写进各管信号,条码只剩记账功能,消除批次效应的收益不复存在。正确顺序是:条码 → 混样 → 染色 → 采集;混样之后所有样本经历同一份试剂、同一次孵育与洗涤、同一段仪器时间。此外,条码通道占据质量窗口(钯区约 102–110 amu),设计 panel 时须与抗体的同位素分配统筹,避免撞峰。

习题 3.1-2

(a)钯条码方案取 6 种稳定同位素中的 3 种组合,可编出多少个样本?若改取 4 种呢?(b)12 管样本经条码混样后统一染色:与逐管染色相比,40 通道 panel 的抗体用量与采集机时各降到原来的几分之一?(c)仪器以每秒 300 个事件采集,门控后 50% 为有效单细胞,每天按 8 小时有效采集估算,一天可积累多少个可用细胞?这是什么量级?

参考解答

(a)C(6,3) = 6!/(3!·3!) = 20 个;C(6,4) = C(6,2) = 15 个——组合数并非随位数单调上升。(b)混样后一次染色代替 12 次,抗体用量从 12×40 = 480 份降到 40 份,即 1/12;采集同样合并为 1 段,机时约降到 1/12。(c)300 × 0.5 × 8 × 3600 = 4.32×106,约四百万个细胞,即百万量级——质谱流式"宽而浅"的测量规模由此而来(与深蛋白组路线每批数百个细胞对照,见 3.3 节)。

3.1.5 数据特点:稠密、连续、偏态

质谱流式的数据矩阵是"事件 × 通道",每个事件测全部通道,缺失近乎为零。与第 1、2 章质谱蛋白组学大面积缺失的稀疏矩阵相比,这是结构性的差别:缺失值填补(imputation)通常不是这里的核心问题,主战场移到变换、归一化(normalization)与门控;面对名目繁多的处理流程组合,ANPELA 一类的工具可以系统导航选优(Zhu et al., 2025)。具体做法留给第 5 章,本节先把数据的"脾气"交代清楚。

其一,信号是连续强度值:本质为离子计数,背景扣除后可以取零、乃至取负。其二,分布右偏且横跨数个量级,直接取对数会在零与负值处失去定义——对数函数只接受正数。通行做法是反双曲正弦变换(arcsinh transformation)

f(x) = arsinh(x / c)
(3.1-1)x 为单通道强度(背景扣除后的离子计数),c 为余因子(cofactor)。CyTOF 通道强度常取 c = 5。变换后 f(0) = 0,负值有定义:小信号区(x ≪ c)近似线性,f(x) ≈ x/c;大信号区(x ≫ c)近似对数,f(x) ≈ ln(2x/c)。
arsinh(x) = ln(x + √(x² + 1))
(3.1-2)反双曲正弦的定义式。x 较大时 √(x²+1) ≈ x,arsinh(x) ≈ ln(2x);x 较小时 arsinh(x) ≈ x。对数变换在 x ≤ 0 处无定义,arsinh 在整个实轴上光滑——线性与对数之间的一条平滑过渡带,这正是它胜出的原因。
方法

arcsinh 变换的用法。c 决定线性区与对数区的交界:c 越大,弱信号被压缩得越平;CyTOF 强度常取 c = 5,荧光流式常取更大的值(如 150),量级差异来自两种仪器的计数分布。操作上,先做背景扣除,再逐通道变换;变换保号保零,负值不必截断。跨数据集比较时必须固定同一 c,否则同一强度在不同数据集里落到不同位置,批次间会产生假差异。变换后再做门控、聚类与降维。

其三,动态范围有限且高端饱和:检测器的计数上限使高强度端趋于饱和,可用动态范围约四五个量级;弱端又受检出限约束(3.1.2 节的灵敏度让步),极强与极弱的信号都须谨慎解读。其四,门控是分析的第一道工序:DNA 含量与事件长度圈掉碎片和双联体,顺铂通道圈掉死细胞,通过质控的事件才进入聚类与建模。通量按事件计:仪器每秒采集数百事件,一个工作日下来是百万量级的细胞。

习题 3.1-3

取 c = 5,手算下列变换值(保留两位小数)。(a)x = 500;(b)x = 0;(c)x = −20;(d)对比:若用常用对数变换,三个值各遇到什么问题?

参考解答

(a)f(500) = arsinh(100) = ln(100 + √10001)。√10001 ≈ 100.005,故 arsinh(100) ≈ ln(200.005) ≈ 5.30。(b)f(0) = arsinh(0) = ln(1) = 0。(c)f(−20) = arsinh(−4) = −arsinh(4) = −ln(4 + √17) ≈ −ln(8.12) ≈ −2.09,负值照常变换且保号。(d)log(500) ≈ 2.70 似乎可用,但 log(0) 无定义,log(−20) 无定义——背景扣除后恰好为零或为负的通道(本底附近的真实情形)会整列报废,或须人为加一、截断为零,两者都扭曲弱信号区。arsinh 在零与负值处有定义,小信号区近似线性,这正是式 (3.1-1) 成为领域默认的原因。

3.1.6 应用形态与路线分工

质谱流式的两类经典应用形态,都建立在"高维 × 大细胞数"之上。一类是系统图谱:Bendall et al. (2011) 用 SPADE 把数十万个骨髓事件的聚类结果组织成一棵最小生成树,树的枝干复现造血系统的连续谱——从干细胞到各系成熟细胞,中间状态不再是离散的"类型",而是可度量的过渡(Qiu et al., 2011)。另一类是扰动应答:药物处理后不同时间点取样,磷酸化通道读出信号通路的动态,表型相同的细胞群体内部,应答轨迹可以截然不同——这正是均值会掩盖、而单细胞测量直接可见的异质性。

案例

34 参数的造血图谱。Bendall et al. (2011) 对健康人骨髓细胞一次测量 34 个参数:31 种金属标签抗体(覆盖各系表面标志与胞内信号蛋白)+铱 DNA 嵌入剂(完整细胞)+顺铂活性染料(死活)+事件长度(双联体)。在同一数据集上,酪氨酸激酶抑制剂等药物扰动下的磷酸化应答按细胞状态分层呈现:同一表面表型内部的信号应答差异,比表型之间的差异更能解释药物反应。这篇论文确立了质谱流式的面板设计与分析范式,此后 panel 一路扩到四十通道以上。

与质谱路线的分工也由此清晰:质谱流式测的是预先选定的几十种蛋白,换取百万级的细胞数——宽而浅;第 2 章的质谱路线不做预先选择,一次定量数千种蛋白,但每批只有数百个细胞——窄而深。蛋白测量上两条路线如何取舍与互补,3.3 节专门讨论;其数据与转录组的联合建模,见 3.4 节与第 5 章(Lin et al., 2024)。


本节围绕质谱流式的测量原理与数据特点,要点可以收拢为四条:

  • 标签换轨:荧光的宽发射谱与自发荧光把通道压在约二三十;镧系同位素的质量峰窄而正交,通道数提到四十以上;
  • 链路与代价:染色—雾化—等离子体—飞行时间—事件记录;串色近乎消失,灵敏度约逊于荧光流式最强通道,细胞被销毁、不能分选回收,通量为每秒数百事件;
  • 设计三件套:表型通道立骨架,磷酸化通道读状态,DNA 嵌入剂、顺铂与事件长度把关数据质量;样本条码先编号后混样,管间差异随混样消失;
  • 数据脾气:几乎无缺失、连续可负、右偏跨量级——arcsinh 变换(c 常取 5)取代对数,动态范围有限、高端饱和,双联体与碎片靠质控通道门控剔除。

关键术语

质谱流式 (mass cytometry)
以金属同位素为报告标签、经等离子体质谱读出的单细胞多参数测量技术(CyTOF)。
串色 (spillover)
一个检测通道的信号漏进相邻通道的现象,荧光流式须靠补偿矩阵矫正。
事件 (event)
检测器记录的一次离散离子云脉冲,通常对应一个细胞及其全通道强度谱。
事件长度 (event length)
离子云的时间跨度,双联体近似翻倍,是剔除粘连事件的依据。
双联体 (doublet)
两个细胞的粘连,信号总量与事件长度同时偏高。
DNA 嵌入剂 (DNA intercalator)
插入核酸的金属染料(铱),按 DNA 含量区分完整细胞与碎片。
顺铂活性染料 (cisplatin viability stain)
短时共孵育只进入膜受损细胞的金属染料,区分死活。
样本条码 (sample barcoding)
混样前给每管细胞打上同位素组合条码,混样后统一染色与采集。
arcsinh 变换 (arcsinh transformation)
反双曲正弦变换,零与负值有定义,兼顾线性低端与对数高端的强度变换。
门控 (gating)
按质控通道圈定合格事件(完整、存活、单个细胞)的分析步骤。

参考文献与延伸阅读

  1. Bandura DR, Baranov VI, Ornatsky OI, et al. 2009. Mass cytometry: technique for real time single cell multitarget immunoassay based on inductively coupled plasma time-of-flight mass spectrometry. Analytical Chemistry 81: 6813–6822.
  2. Bendall SC, Simonds EF, Qiu P, et al. 2011. Single-cell mass cytometry of differential immune and drug responses across a human hematopoietic continuum. Science 332: 687–696.
  3. Qiu P, Simonds EF, Qiu P, Simonds EF, Bendall SC, et al. 2011. Extracting a cellular hierarchy from high-dimensional cytometry data with SPADE. Nature Biotechnology 29: 886–891.
  4. Zunder ER, Finck R, Behbehani GK, et al. 2015. Palladium-based mass tag cell barcoding with a doublet-filtering scheme and single-cell deconvolution algorithm. Nature Protocols 10: 316–333.
  5. Spitzer MH, Nolan GP. 2016. Mass cytometry: single cells, many features. Cell 165: 780–791.
  6. Lin HJL, Webber KGI, Nwosu AJ, Kelly RT. 2024. Review and practical guide for getting started with single-cell proteomics. Proteomics 25(1–2): e202400021.
  7. Zhu F, et al. 2025. Navigating the data processing for cytometry-based single-cell proteomics. Nature Protocols(ANPELA,idrblab.cn/anpela).