2.5.1 免标记单细胞:为何重新可行
2.2–2.4 节的三条路线共用一个组织方式:把多个细胞装进同一针,用等压标记把它们编码进不同通道,再以载体通道把信号抬到可鉴定的高度。这是"以标记换机时"。本节换一条路:免标记定量(label-free quantification)——每针进样只放一个细胞,定量靠同一条肽段在不同 run 之间的峰面积比较,物理基础即 1.4.5 节的式 (1.4-2):峰面积正比于到达检测器的离子数。标记试剂、载体通道、通道串扰,在这条路上从源头上不存在。
免标记定量(label-free quantification):不借助任何化学标记的定量策略。每个样品独立进样(单细胞工作里通常每针一个细胞),以同一条肽段的色谱峰面积——或 DIA 下的碎片峰面积——跨 run 比较。成立前提是离子化响应在同一条肽段上跨 run 稳定,因而可比性只在"肽段内、跨 run"成立,跨肽段依旧不可比(1.4.7)。
这条路过去走不通,卡在灵敏度。单个细胞约 100–200 pg 的肽段在 MS1 里只留下微弱信号,而数据依赖采集(data-dependent acquisition, DDA)的挑选规则按强度排名——1.4.6 节已经指出,名次边界受噪声与共洗脱的扰动,低信号区的挑选近乎掷签;峰面积定量又要求把峰形"看清",信噪比不足时面积积分失真。近年的变化来自两头相加:制备端把样品损失压到纳升级(2.4 节的 nPOP,以及商品化的 Chip-Tip);仪器端的灵敏度上探一至两个数量级(2.6 节展开)。两条曲线相交,免标记重新站上可行线:Chip-Tip 流程在免标记采集下从一个细胞定量超过 6,000 种蛋白(Ye et al., 2025);全自动的免标记流程也在细胞挑选与上样自动化平台上跑通(Ctortecka et al., 2024)。
收益可以数出四项。其一,没有标记试剂的成本,也没有标记反应效率的变量;其二,没有载体通道——2.2–2.3 节讨论的载体相关假象(检出限被载体抬高、载体批次引入的额外变异)从机理上不存在;其三,没有通道之间的同位素不纯度与残留串扰要校正;其四,样品通量=进样通量:新样品随时可以上机,不必把实验切成"每十几个细胞一批"的组织方式,跨批次的设计自由度更大。
代价同样清楚:没有批内多路。每针只装一个细胞,全部机时由单细胞独占;run 与 run 之间的仪器漂移直接进入数据,批次效应的形态与多重标记的批内结构不同,下游的归一化与批次校正策略也不同(第 4 章)。换言之,免标记拿数据结构换了机时——这笔账必须算清,而不是想当然地以为"省了试剂就是省了钱"。
免标记不等于更便宜:试剂省下,机时翻倍。算一笔示意账:一针 100 min 梯度加进样与平衡约 2 h,24 h 约 12 针;16 重 TMT 同样的机时可测约 190 个单细胞(SCoPE2 正是以这类组织方式在 10 天机时里定量约 1,490 个细胞,Specht et al., 2021),免标记只测 12 个。梯度越长、深度要求越高,差距越大。免标记的合理场景是"用机时换深度与数据结构",而非省钱的默认选项。
2.5.2 DIA 机理:窗口轮转与两条鉴定路径
免标记把"run 之间的一致性"推到台前,而一致性正是数据非依赖采集(data-independent acquisition, DIA)的设计目标。1.4.6 节给出过两种时间表的对比,这里往机理深处走一步。DIA 放弃挑选:把母离子质荷比范围划成首尾相接的窗口,逐窗轮转碎裂,循环往复。窗口内的离子无论强弱一起碎裂,谱图是叠加的混合物。采集决策从"挑谁"变成"按时间表全要"——时间表一经确定,覆盖便是确定性的。
混合谱图必须靠计算解开,鉴定路径有两条。其一,谱图库(spectral library):先用 DDA 或浓缩样品测出目标肽段的参考碎裂谱(碎片组成、强度模式、保留时间),再在 DIA 数据里按库提取各肽段的信号。其二,免谱图库检索(library-free / directDIA):不建实测库,直接对 DIA 谱图做数据库检索,或以深度学习预测的理论谱作虚拟库。DIA-NN 是两条路径的代表性引擎,以神经网络打分配合干扰校正,把大规模 DIA 数据的处理做到可控的假阳性(Demichev et al., 2020)。对单细胞,免库路径还有一层实际好处:样品本就稀少,再拿去建库过于奢侈。
定量发生在碎片离子层面。一条肽段有多个碎片离子,各自的提取色谱峰面积互为内部重复;算法按干扰程度挑出干净的碎片,加权给出肽段定量。与 MS1 峰面积相比,碎片面积离共洗脱干扰更近,单看一根碎片未必更准;但可用碎片多、可交叉验证、可剔除受干扰者,统计上更稳——这是 DIA 定量精度优势的来源,也是 DIA-NN 一类软件把干扰校正做成分量的原因(Demichev et al., 2020)。
还有一条机理,对单细胞是结构性的:DIA 不要求"先看到再碎"。DDA 里一个母离子若未被 MS1 检出、或强度排名不够,就永远没有 MS2;DIA 的窗口到点即碎,离子只要在窗口内就会被采集。单细胞样品的信号贴着检出限分布,"不必先看到"意味着低丰度肽段不再因为第一眼的强弱被排除在采集之外。
2.5.3 循环时间预算:DIA 对单细胞的三重意义
DIA 带给单细胞的第一重意义在缺失值结构。窗口时间表确定,同一肽段在同批每个 run 都会被覆盖:缺失更多反映"深度不够测到",而非"运气不好没被选中"。缺失因此可预期,也更适合下游的填补与建模(第 4 章)。对照 DDA 的随机缺失——它把"测不到"与"不表达"搅在一起,缺失值本身成了混杂变量。
第二重在定量精度。碎片面积加多碎片平均,重复之间的变异更小;DIA 单细胞信息学流程的系统基准评测也显示,预处理的选择显著影响最终定量质量,而 DIA 数据在合理流程下能维持稳定的跨 run 一致性(Wang et al., 2025)。第三重在低输入兼容:如上一小节所述,不必先看到母离子也能采集——这一条只对"信号贴着检出限"的样品才称得上关键,常规微克级进样对此并不敏感。
三重意义都受同一条物理约束:循环时间。循环时间(cycle time)是完整走一遍全部窗口所需的时间,驻留时间(dwell time)是单个窗口一次碎裂停留的时长:
于是窗口数与循环时间此消彼长:窗口越窄,共碎片越少、选择性越高;但窗口数增加直接抬高循环时间,压缩每峰采样点。单细胞常用的短梯度把峰压得更窄(约 10 s 量级),时间预算更紧。图 2.5-1 把两种时间表的 run 间覆盖差异与每峰采样点并排画出。工程折中包括按离子密度设置的可变窗宽(肽段密集处窄、稀疏处宽),以及 2.5.4 节的淌度扩展——后者换了一维坐标,把这笔账重算了一遍。
循环时间准则的来历:峰面积定量的随机误差随每峰采样点数增加而下降,色谱学经验上约 10 点之后边际收益递减,故常引作采集设计约束。它是经验规则:若更长的循环换来明显更干净的谱图(更窄的窗口、更少的共碎片),在某些场景反而合算。准则服务于"定量保真"这一目的,满足它不是仪式,压着它也不必然失败——但偏离时要能说出代价是什么。
习题 2.5-1
某 DIA 方法把 400 Th 的母离子范围均分为 32 个窗口,每窗驻留 25 ms;目标肽段的色谱峰宽约 10 s(基线计)。(a)求循环时间。(b)每个色谱峰能采到多少个点?(c)按式 (2.5-2) 的经验准则判断是否达标。(d)若把窗口数加倍到 64(窗口更窄、谱图更干净)而驻留时间不变,循环时间与每峰点数如何变化?给出两种恢复达标的办法并说明各自的代价。
参考解答(a)按式 (2.5-1),T = 32 × 25 ms = 800 ms = 0.8 s。(b)点数 ≈ 峰宽 / 循环时间 = 10 / 0.8 = 12.5,即每峰约 12–13 点。(c)准则要求 T ≤ 10/10 = 1 s;0.8 s < 1 s,达标且略有富余。(d)T = 64 × 25 ms = 1.6 s,每峰约 6–7 点,低于约 10 点,峰形开始失真、面积积分不稳。恢复办法一:缩短驻留时间至约 12.5 ms(T ≈ 0.8 s),代价是每窗离子数减少、信噪比下降;办法二:收窄扫描的 m/z 范围或改用可变窗宽,把窗口数压回时间预算之内,代价是覆盖范围或窗口均匀性。
2.5.4 diaPASEF:在淌度维再分一维
离子淌度(ion mobility)给质谱加了独立于质荷比的一维分离:气相离子在缓冲气体中漂移,速率由电荷与碰撞截面(collisional cross section, CCS)共同决定——同一个 m/z 下,形状不同的离子淌度不同。对 DIA 的意义直接明了:淌度把窗口内的离子再摊开一层,共碎片干扰随之下降,谱图更干净。
timsTOF 平台的陷俘离子淌度(trapped ion mobility spectrometry, TIMS)把这件事做成了"排队":离子在电场与反向气流的対峙中被拦住、并行累积(parallel accumulation),再按淌度从快到慢依次释放(serial release);四极杆的隔离窗口与释放时刻同步扫描,这就是 PASEF(平行累积-串行碎裂)。关键收益在离子利用率:累积时不丢、释放时有序,洗脱出来的离子几乎个个都被碎裂采集。灵敏度按"用了多少离子"来算,而离子恰恰是单细胞最缺的资源(Meier et al., 2020)。
diaPASEF 再把 DIA 的窗口搬进 m/z–淌度平面。肽段的淌度与其 m/z 大体正相关,在平面上呈一条对角分布带;diaPASEF 的窗口沿对角线"斜切"——单个窗口横跨很宽的 m/z,却只取窄窄一片淌度,一次循环即扫过整条分布带。窗口按离子数计的等效宽度,远小于它在 m/z 轴上的投影:同样是"覆盖全部离子",平面上的窗口设计让每个窗口承载的离子更少、谱图更干净(图 2.5-2)。当前单细胞深度的最好成绩多出自该平台(Ye et al., 2025;2.6 节展开)。
2.5.5 plexDIA:同位素标记与 DIA 合流
DIA 给一致性与低输入兼容,多重标记给通量。plexDIA 把两者合到一次采集里:样品用 mTRAQ 试剂标记后混合,再走 DIA。mTRAQ 属同位素标记(isotopic labeling),与 2.2 节的等压标记(isobaric labeling)差别写在质量轴上:它的三个通道(Δ0、Δ4、Δ8)彼此相差固定的 4 Da,标记后同一条肽段在 MS1 里呈现三个可分辨的母离子峰;等压标记的各通道总质量相同,MS1 里只有一个峰。这一差别决定了两条路线各自适配的采集方式。
采集与读出的机理如下。三个通道的母离子间距为 4/z Th(z 为电荷),远小于窗口宽度,于是落入同一 DIA 窗口、一起碎裂;含标签末端的碎片同样按质量差错开,三套碎片可分。通道身份由母离子质量直接给出——不需要报告离子(reporter ion);定量取各通道的母离子与碎片面积之比。与 TMT 载体路线对照,三处本质不同:没有载体通道(每个通道都是样品),没有报告离子层(比率在母离子与碎片层面读出),报告离子共碎片造成的比值压缩在机理上不存在;窗口内的共碎片干扰仍在,交给干扰校正处理。
同位素标记与等压标记:同位素标记(mTRAQ)通道间有固定质量差(相邻 4 Da),MS1 可分辨,通道身份在碎裂之前已知,碎裂后各通道碎片成套错开——天然适配 DIA 的同窗共碎。等压标记(TMT)通道总质量相同,MS1 不可分,身份只能由碎裂后的报告离子携带,定量必须搬进 MS2——天然适配 DDA 的单母离子碎裂。前者无报告离子与载体之需,后者通道数更多(十余重对三重),两条路线各自的长短即由此而来。
性能账目清晰:通量随标记通道数成倍增长,而蛋白覆盖与定量精度大体保持(Derks et al., 2023)。工具链也已就位:DIA-NN 内置 plexDIA 模块,把三通道的碎片提取、干扰校正与比率计算纳入同一流程(Derks et al., 2023)。定位上,plexDIA 在"免标记 DIA 的一致性"与"TMT 的通量"之间取中——每针 2–3 个细胞,机时按通道数摊薄,批次结构仍由确定的窗口时间表保证。
习题 2.5-2
mTRAQ 三通道(Δ0、Δ4、Δ8)分别标记三个单细胞样品,混合后走 plexDIA。某肽段为双电荷(z = 2)。(a)MS1 中相邻两通道的母离子 m/z 间距是多少?(b)设 DIA 窗口宽 12.5 Th,三通道母离子会落入同一窗口吗?一起碎裂后各通道的碎片如何区分?(c)与 TMT 载体路线对照:plexDIA 为什么既不需要载体通道、也不需要报告离子?
参考解答(a)通道间中性质量差 4 Da,双电荷下 m/z 间距 = 4/2 = 2 Th。(b)三峰总跨度 2 × 2 = 4 Th,小于 12.5 Th,落入同一窗口一起碎裂;含标签末端的碎片按同样的质量差错开(碎片层面为 4/z Th 的成套偏移),形成三套可分的碎片,各通道定量取其母离子与碎片峰面积。(c)通道身份由母离子质量差直接给出,碎裂之前已经知道"这是哪个通道",故无需报告离子;比率在母离子与碎片层面读出,信号来自样品通道本身,鉴定不依赖载体放大,故无需载体通道。代价是通道数目前远少于 TMT(3 对十余重),单针通量增益有限,但每个通道都是真实样品。
2.5.6 四条采集路线的对照
把本章出现过的采集组织方式放进同一张表:免标记 DDA、免标记 DIA、plexDIA、TMT 载体 DDA。四条路线不是优劣排序,而是"机时、缺失结构、定量假象"三笔账的不同配平(表 2.5-1);社区报告规范也要求明示采集方式、定量层级与缺失值的成因,而非只报一个蛋白总数(Gatto et al., 2023)。
| 路线 | 每针细胞数 | 机时通量 | 缺失值结构 | 主要定量假象 | 试剂与机时 |
|---|---|---|---|---|---|
| 免标记 DDA | 1 | 最低 | 随机缺失多,run 间覆盖漂移 | 无标记与载体假象;低信号区挑选随机 | 试剂省;机时最高 |
| 免标记 DIA | 1 | 低 | 覆盖一致,缺失多为深度不足 | 窗口内共碎片干扰,须算法校正 | 试剂省;机时高 |
| plexDIA(mTRAQ) | 2–3 | 中,随通道数成倍增 | 通道同时覆盖,缺失少且可预期 | 通道间同位素干扰与窗口共碎片 | 试剂中等;机时摊薄至 1/2–1/3 |
| TMT 载体 DDA | 十余(另设载体通道) | 最高 | 随机缺失+通道缺失 | 比值压缩;载体抬高定量下限、引入批次变异 | 试剂贵;机时最低(按细胞计) |
表上的每一格都能追溯到机理:免标记 DDA 的缺失来自强度挑选的随机性;免标记 DIA 用确定的时间表换掉它;plexDIA 在此之上以质量差分通道、按通道数摊薄机时;TMT 路线通量最高,但把定量搬进报告离子层,载体与比值压缩的账要另算(2.2–2.3 节)。2.6 节将从仪器端继续推这张表的边界。
习题 2.5-3
三个实验场景,请分别从表 2.5-1 的四条路线中选择并说明理由。(i)稀有细胞共 24 个,机时紧张,实验室无淌度仪器,只关注细胞类型间的粗粒度差异;(ii)要尽可能深地覆盖单个细胞的低丰度蛋白(如激酶),机时不敏感;(iii)一周内分 5 个批次采集约 150 个细胞,最担心批次之间不可比。
参考解答(i)TMT 载体 DDA(SCoPE2 型):两针 16 重即可装下全部细胞与载体参比通道,机时最省;载体帮助鉴定,粗粒度的类型间差异对比值压缩不敏感。(ii)免标记 DIA——深度优先,无载体与报告离子层,低丰度肽段的碎片定量更稳;若有 timsTOF 平台则用 diaPASEF(Ye et al., 2025 一类流程)。(iii)plexDIA 或免标记 DIA:窗口时间表确定、跨 run 覆盖一致,批次结构可预期;plexDIA 每针 3 个细胞,把 150 个细胞压到 50 针,批次内还可用同一试剂批与同一窗口表压缩额外变异。三种场景对应三笔账的不同配平,没有普适的最优解。
本节把采集层的设计空间摊开。免标记与多重标记并非对立路线,而是在机时、缺失结构与定量假象之间取不同的配平:
- 免标记:每针一个细胞,无试剂与载体假象,机时全部由单细胞独占;其可行性由制备与仪器两端的灵敏度进步重新确立;
- DIA:以窗口轮转替代强度挑选,覆盖确定、缺失可预期,碎片离子层面的定量更稳;循环时间与峰宽的预算(式 2.5-1、2.5-2)是设计核心;
- diaPASEF:离子淌度把窗口内的离子再分一维,斜切窗口沿对角分布带扫过,洗脱离子的利用率接近百分之百;
- plexDIA:同位素标记与 DIA 合流,通量随通道数成倍增长,比率在母离子与碎片层面读出,既无载体也无报告离子。
采集策略的收益最终都要落回仪器本身的离子利用与扫描速度。2.6 节转向硬件:新型质量分析器、离子淌度与自动进样如何继续抬高深度与通量的边界。
关键术语
- 免标记定量 (label-free quantification)
- 不借助化学标记、按同一条肽段的峰面积跨 run 比较的定量方式,每针一个样品。
- 数据非依赖采集 (data-independent acquisition)
- 以固定窗口轮转碎裂、全范围确定覆盖的采集模式(DIA)。
- 谱图库 (spectral library)
- 预先测得的肽段参考碎裂谱集合,供 DIA 数据解卷积与信号提取。
- 免谱图库检索 (library-free / directDIA)
- 不依赖实测库、直接检索或以预测谱图解码 DIA 数据的鉴定路径。
- 循环时间 (cycle time)
- 完整走一遍全部采集窗口所需的时间,决定每个色谱峰的采样点数。
- 驻留时间 (dwell time)
- 单个窗口一次碎裂停留的时长,循环时间的构成单元。
- 离子淌度 (ion mobility)
- 气相离子按碰撞截面在缓冲气体中漂移分离的额外一维。
- 碰撞截面 (collisional cross section)
- 离子与缓冲气体碰撞的等效面积,淌度分离的物理依据。
- 陷俘离子淌度 (trapped ion mobility spectrometry)
- 在阱中并行累积离子、按淌度依次释放的淌度分离实现(TIMS)。
- 同位素标记 (isotopic labeling)
- 通道间具固定质量差的标记(如 mTRAQ),MS1 即可分辨通道。
- plexDIA (plexDIA)
- 同位素标记与 DIA 的组合采集策略,通量随标记通道数成倍增长。
参考文献与延伸阅读
- Demichev V, Messner CB, Vernardis SI, Lilley KS, Ralser M. 2020. DIA-NN: neural networks and interference correction enable deep proteome coverage in high throughput. Nature Methods 17(1): 41–44.
- Meier F, Brunner AD, Koch S, et al. 2020. diaPASEF: parallel accumulation–serial fragmentation combined with data-independent acquisition. Nature Methods 17: 1229–1236.
- Derks J, Derks J, Leduc A, Masselon C, et al. 2023. Increasing the throughput of sensitive proteomics by plexDIA. Nature Biotechnology.
- Ye Z, Sabatier P, et al. 2025. Enhanced sensitivity and scalability with a Chip-Tip workflow enables deep single-cell proteomics. Nature Methods 22: 499–509.
- Ctortecka C, et al. 2024. Automated single-cell proteomics providing sufficient proteome depth to study complex biology beyond cell type classifications. Nature Communications 15: 2474.
- Wang J, Huang Y, Fang Q. 2025. Benchmarking informatics workflows for data-independent acquisition single-cell proteomics. Nature Communications 16.
- Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
- Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.