第5章 · 5.5

5.5 评估的试金石:掺入、稀释与重复

Touchstones of Evaluation: Spike-ins, Dilution Series and Replicates
摘要 单细胞测量没有天然真值:一个细胞只被测一次,测毕即耗尽,无从核对。评估的第一步是制造已知答案。本节梳理四条路径——掺入标准品、稀释系列、重复实验与参数模拟,逐一说明各能量化哪一环误差、又在何处失明,并以社区白皮书的报告清单收束:评估不是论文的附录,而是结论可信度的地基。

5.5.1 真值从哪里来:评估的第一步是制造已知答案

本章前三节评的都是算法:5.2 评测 DIA 检索引擎,5.3 在三千余种流程组合中导航选优,5.4 比较细胞嵌入方法。这些评测默认一个前提——手里有标准答案,才谈得上打分。本节把问题倒过来:当评估对象不是软件、而是测量本身时,答案从哪里来?

单细胞蛋白组学在这个问题上处境独特:它没有天然真值(ground truth)。一个细胞在测量中就被消耗,只被测一次,别处没有副本;bulk 里"再测一遍取平均"的做法,在单细胞尺度无处着力。测得 1.6 倍的差异,究竟源自生物学还是出自仪器?没有已知答案便无解;填补、归一化、差异检验又都带着"测量误差有多大"的隐性假设——兑现它的只有实验对照。

出路是制造已知答案。四条路径各答一问:掺入标准品(spike-in standard)把已知量的外源物质放进样品,量出定量精度;稀释系列(dilution series)把 bulk 匀浆逐级稀释到单细胞水平,画出灵敏度曲线;重复实验以技术重复(technical replicate)、姊妹细胞与多细胞通道三种形态量出链条各段的噪声与线性;参数模拟(parametric simulation)则从分布模型生成数据,答案完全已知。

表 5.5-1 给出总览,图 5.5-1 画出四者与评估目标的对应。它们互不可替代,也各有一块照不到的地方——评估报告的义务,是写明所用对照覆盖到哪一环。

表 5.5-1真值的四个来源:各自提供什么、验证哪一环、盲区在哪(口径依 Gatto et al., 2023)
真值来源提供什么真值验证哪一环盲区
掺入标准品外源肽段/蛋白组的绝对量与彼此比例定量精度、倍数变化保真、检出限不经过挑细胞与单细胞制备;外源肽段行为未必同于内源
稀释系列各梯度点的输入蛋白量(如 100/50/25 pg)"制备+仪器"链条的灵敏度曲线匀浆内部同质,挑细胞损失与单细胞操作变异无从体现
重复实验仪器漂移(技术重复)、近似相同真值(姊妹细胞)、已知倍数(多细胞通道)全流程噪声与信号线性姊妹细胞的"相同"只是近似,估得的是噪声上界
参数模拟全部——数据由模型生成,答案可任意设置算法在可控注入误差下的表现只含被假设过的误差;模型外的偏差测不出来
四类真值来源各自验证链条的哪一环 四类真值来源与评估目标的映射 真值来源 · 制造已知答案 评估目标 · 验证哪一环 ① 掺入标准品 外源肽段·蛋白组:量与比例预先已知 定量精度与比值保真 检出限、压缩系数 κ 已知量与已知比值 ② 稀释系列 bulk 匀浆逐级稀释,输入量已知 灵敏度曲线 鉴定数 vs 输入量:制备+仪器 已知输入蛋白量 ③ 重复实验 技术重复·姊妹细胞·多细胞通道 全流程噪声与定量线性 挑细胞 → 谱图的整条链 近似相同 / 已知倍数 ④ 参数模拟 分布模型生成的完整定量矩阵 算法误差隔离 可控注入单一误差源 真值完全已知 四类来源各有一块照不到的地方:掺入与稀释都不经过"挑一个细胞";重复的真值只是近似;模拟只含被假设过的误差。 评估报告须写明所用对照覆盖到哪一环——盲区对照见表 5.5-1 末列。
图 5.5-1 四类真值来源与评估目标的映射。左列为"制造已知答案"的四种手段,右列为其照亮的目标环节:掺入标准品核验定量系统的精度与保真,稀释系列画出"制备+仪器"链条的灵敏度,重复实验覆盖从挑细胞到谱图的全流程噪声与线性,参数模拟在算法层注入可控误差。四种对照的盲区互不重叠,恰说明它们必须组合使用。

5.5.2 掺入标准品:把已知量放进未知体系

掺入的逻辑很朴素:往样品里放进已知量的东西,看它测出来是多少。单细胞实验的常见做法是在人源背景下加入酵母或大肠杆菌的肽段/蛋白组——异源序列不与人源背景混淆,配比可预先称量。掺入品直接回答三个问题:已知量测出多少,是定量精度;多低的量还能与背景区分,是检出限(limit of detection);已知比值测出来是否走样,是倍数变化保真度。白皮书把"以预定义比例掺入肽段、蛋白乃至整个蛋白组"列为阳性对照,并建议以不同物种蛋白组按已知比例混合核验定量准确度(Gatto et al., 2023)。

更有力的形态是两两蛋白组掺混(two-proteome mix):两种异源蛋白组按 1:1、2:1、1:2 等已知比例混合,再掺入人源背景,于是每一对通道之间的真值比值全部已知,倍数变化的保真度可以在成百上千个蛋白上成批读出。plexDIA 的方法学基准即以大肠杆菌、酵母与人源匀浆按已知比例配制,以已知混合比核验定量(Derks et al., 2023)。

Astral 分析仪的挑战实验沿用同一思路:Bubis 等把人源 HeLa 与酵母按已知比例混合(方法学中的一档为 150 pg 人源配 100 pg 酵母),在单细胞水平的输入上标定定量参数,2 倍差异仍可分辨,单个细胞定量约 5,300 种蛋白(Bubis et al., 2025)。

掺入单一标准品(肽段/蛋白)

量与比例直接可称,谱图身份明确,可专门覆盖低丰度段;但只代表少数分子,提取与色谱行为未必同于内源,难以成批核验倍数保真。

两两蛋白组掺混(整组混合)

成百上千个蛋白按同一已知比核验倍数变化,统计量充足,可直接读出压缩系数;但配比依赖称量与蛋白定量的准确度,外源蛋白组还会挤占动态范围。

掺入比值给出的最贴身指标是比值压缩(ratio compression):真值 2 倍的差异,测出来只有 1.6 倍。把观测比写成真值的幂(式 5.5-1),κ 为保真系数,1−κ 即压缩率。单细胞尺度把压缩的来源一并放大:离子数稀少使统计涨落直接写进报告离子强度,残留污染与载体干扰向通道混入外来信号,低丰度端的缺失偏向丰度低的一侧。

κ 不是常数,随丰度、比值大小与流程移动——掺入实验的价值恰在于把它量出来,而不是假装它不存在。

Robs = Rtrueκ, 0 < κ ≤ 1; 压缩率 = 1 − κ
(5.5-1)Rtrue 与 Robs 分别为真值与观测的倍数变化(如 2 与 1.6)。对数尺度上 log Robs = κ·log Rtrue,κ 由两对数之比估计(习题 5.5-1)。κ = 1 无压缩;κ 越小压缩越重。另有一种线性口径的压缩(相对衰减),见习题 5.5-1 的辨析。
定义

掺入标准品(spike-in standard):以已知量、已知比例加入样品的外源肽段、蛋白或蛋白组,为定量提供绝对参照。理想掺入品满足三条:序列可与人源背景区分(酵母、大肠杆菌是惯用选择),配比在称量误差内已知,行为与内源分子足够接近。掺入品量的是"定量系统",不含"挑出一个细胞"及其损耗——这一盲区由 5.5.4 的重复设计来补。

盲区必须说透:掺入品不经历挑取、裂解、纳升级转移中的损耗,其提取与色谱行为未必同于内源,可覆盖的蛋白也终究有限——它回答"定量系统保真几何",不回答"单细胞流程损失几何"。稀释系列与它共享这个盲区,这正是下一小节的起点。

习题 5.5-1

两两掺混实验中,酵母与大肠杆菌的真值比为 2:1,质谱测得 1.6:1。(a)按式 (5.5-1) 求保真系数 κ 与对数口径的压缩率。(b)若采用线性口径(相对衰减),压缩率是多少?两种口径为何必须注明?(c)设 κ 对该量程恒定,下游以"观测倍数变化 ≥ 1.5"判定差异:真值 1.3 倍的差异会怎样?

参考解答

(a)κ = log 1.6 / log 2 = log21.6 ≈ 0.68;压缩率 1 − κ ≈ 0.32。(b)线性口径 (2 − 1.6)/2 = 0.2,即 20%。两种口径的分母不同:对数口径作用于倍数变化的数量级(乘法结构),与式 (5.5-1) 一致;线性口径直接量相对衰减。口径不注明,同一组数据可以"20%"与"32%"并现。(c)1.30.68 = e0.68 × ln 1.3 ≈ e0.178 ≈ 1.19,低于 1.5 阈值,判为无差异。压缩把中低倍数的真差异系统性推向阈值之下:阈值名义上是 1.5,对被压缩的测量而言实际抬高到约 1.51/0.68 ≈ 2.1 倍真值。

5.5.3 稀释系列:灵敏度曲线与它的盲区

第二条路径回答"输入量走低时,测量能力折损多快":从精确计数的细胞制备匀浆,逐级稀释到单细胞水平——100、50、25 pg,必要时加一档 12.5 pg。白皮书建议从已知细胞数的裂解物出发逐级稀释到单细胞水平,并把适当稀释的 bulk 样品当作常规技术质控(Gatto et al., 2023)。每个稀释点的输入量已知,鉴定数与缺失率随输入量的变化便画出灵敏度曲线(图 5.5-2)。

曲线的读法有三:

  • 定工作点:单细胞实验落在曲线何处,离平台区与崩溃区各有多远;
  • 估检出限:曲线跌入噪声区的位置,就是该"制备+仪器"组合的底;
  • 横向比方法:同制备流程、同梯度长度、同检索参数下比较仪器与流程——跨论文的孤点数字不可直接对表。

量级锚点可取公开口径:约 5 ng 输入约 8,000 种(plexDIA);单细胞所在的 100–200 pg 区间,鉴定数在约 1,000 到逾 6,000 种之间——SCoPE2 约千种,Astral 约 5,300 种,Chip-Tip 超过 6,000 种(Derks et al., 2023;Specht et al., 2021;Bubis et al., 2025;Ye et al., 2025)。深度上限仍在推进,单细胞已可定量约半数表达蛋白(Sinn and Demichev, 2025);"鉴定数—输入量"曲线因此更该是每套流程的随行档案,而非论文里的孤例数字。

盲区在于:稀释点的每一个都是同一匀浆,内部完全同质——没有挑细胞的损耗,没有挑错细胞与双连体,没有单细胞裂解的批间变异。曲线验证的是"处理+仪器"链条,单细胞独有的操作误差它一概不见;曲线回答仪器到不到得了单细胞水平,不回答你的单细胞实验做得好不好,所以白皮书在稀释质控之外同时要求空白与对照通道监控污染(Gatto et al., 2023)。

斜率段的信息量最大:25 到 100 pg 段的折损率,直接标出单细胞工作点离检出限的余量。

稀释系列的灵敏度曲线:鉴定数随输入量折损、缺失率同步上升,标注单细胞典型工作点 100–200 pg 稀释系列的灵敏度曲线:鉴定数随输入量的折损(示意) 鉴定 / 定量蛋白数(示意,左轴) 缺失率(%,示意,右轴) 0 2,000 4,000 6,000 8,000 0 20 40 60 10 25 50 100 200 1,000 5,000 输入蛋白量(pg,对数刻度) 稀释点 约 8,000 种(plexDIA,5 ng 输入) 单细胞典型工作点 每细胞约 100–200 pg 蛋白;此处鉴定数 约 1,000 → 逾 6,000 种(仪器与流程各异) 25 pg 以下渐入检出限区,定量失稳 鉴定 / 定量蛋白数(左轴) 缺失率(右轴,示意)
图 5.5-2 稀释系列的灵敏度曲线(示意)。横轴为输入蛋白量(对数刻度),左轴为鉴定/定量蛋白数(实线),右轴为缺失率(虚线):把同一 bulk 匀浆稀释成 100/50/25 pg 的梯度,即得曲线上的一段。阴影带为单细胞典型工作点——每个哺乳动物细胞约含 100–200 pg 蛋白,工作点处的鉴定数随仪器与流程在约 1,000 种到逾 6,000 种之间(SCoPE2 约千种、Astral 约 5,300 种、Chip-Tip 超过 6,000 种);约 5 ng 输入约 8,000 种取自 plexDIA 口径(Derks et al., 2023)。曲线验证的是"制备+仪器"链条,不含挑细胞与单细胞制备的损耗。

5.5.4 重复实验的三种形态:技术重复、姊妹细胞与多细胞通道

"重复"不是一件事。按重复的对象分,单细胞实验里有三种形态,各自隔离测量链条的一段(图 5.5-3):技术重复从匀浆起步,量仪器稳定性;姊妹细胞从活细胞起步,量全流程噪声;多细胞通道以已知倍数检验信号线性。

技术重复、姊妹细胞重复与多细胞通道在测量链条上的覆盖区段 三种重复形态各覆盖测量链条的哪一段 挑选单细胞 裂解与制备 多重标记 LC-MS 进样 谱图与定量 匀浆分装在此之后,"挑细胞"一环在技术重复的盲区里 技术重复:同一匀浆分装 → 量仪器稳定性与批间差 姊妹细胞重复:从活细胞起步 → 量全流程噪声(上界) 多细胞通道:2/5/10 个细胞汇入 → 量信号线性、查双连体 三种形态的覆盖区段互补:技术重复读出方差(仪器段),姊妹细胞读出方差(全流程段,上界),多细胞通道读出倍数关系而非方差。
图 5.5-3 三种重复形态在测量链条上的覆盖区段。上排为单细胞实验的链条五环;技术重复的括号从"裂解与制备"起步——匀浆分装之后才分道,挑细胞的损耗落在它的盲区;姊妹细胞重复的括号覆盖全链条,代价是真值"近似相同"而非严格相同;多细胞通道同样覆盖全链条,但读出的是信号倍数关系(线性检查与双连体排查),不是方差。三者互补,缺一则对应区段无账可查。

技术重复:同一匀浆分装、平行处理、重复进样。分装之间没有生物学差异,数据的全部波动都来自仪器与处理——漂移、批间差、喷雾稳定性由此留档。SCoPE2 的做法可作范本:把同一份稀释 bulk 分装为"主标准"(1xM)排入多个 set,累计 76 次重复进样,仪器的长期行为由此写在数据内部(Specht et al., 2021)。Galaxy 教程数据里的空白与载体通道同样在做这类记账——空白估污染本底,载体监视进样健康(Gomoryova and Hecht, 2025)。技术重复的局限也直白:它量不到挑细胞,因为匀浆里没有"挑"这个动作。

姊妹细胞重复(sister-cell replicate):同一克隆、或同一次分裂所得的两个姊妹细胞,蛋白组预期高度相似——真值近似已知,从挑细胞到谱图的全流程噪声由此估计:当姊妹间真值差异可忽略时,某蛋白在姊妹对之间差值的方差等于两倍单次测量噪声的方差(习题 5.5-2)。使用这一设计,两件事须如实注明。其一,白皮书提醒"没有两个细胞完全相同":细胞分裂的不对称分配与随机转录涨落贡献真实差异,姊妹相等只是近似,估得的是噪声上界(Gatto et al., 2023)。

其二,这一设计并非 SCoPE2 原文的做法——SCoPE2 的可靠性估计依靠对照孔、主标准与蛋白内肽段一致性(Specht et al., 2021);姊妹细胞作为评估材料的标志性应用在早期胚胎:Iwamoto-Stohl 等以 SCoPE2 与 plexDIA 测量 2 细胞期的姊妹卵裂球,识别出 300 余种在姊妹间不对称丰度的蛋白,且不对称可回溯至受精卵(Iwamoto-Stohl et al., 2025)。成模块、可重复的姊妹间差异,本身就是信噪比的证据——纯噪声聚不出可解释的生物学结构。

定义

姊妹细胞重复(sister-cell replicate):对同一克隆来源、或同一次分裂产生的姊妹细胞做配对测量,以其蛋白组高度相似为近似真值,估计全流程(挑细胞、制备、进样、定量)噪声。它与技术重复的分野在于覆盖面:技术重复从匀浆起步,姊妹细胞从活细胞起步。估得方差 = 测量噪声 + 姊妹间真实差异,故为噪声上界;若姊妹间出现结构化、可重复的差异,那不是噪声,是信号(Iwamoto-Stohl et al., 2025)。

一个常见的替身值得辨析:拿同一细胞系的细胞当"近似重复"。可行,但同型细胞间的真实差异——细胞周期状态、体积、贴壁时长——远大于姊妹细胞,由此估出的"噪声"明显偏高;姊妹细胞把这部分差异压到最小,是最接近"重复测量同一个细胞"的替代。

多细胞通道:把 2 个(或 5、10 个)细胞一并汇入同一通道平行处理,信号应约为单细胞通道的 2(5、10)倍——一条直接检测量线性的内标。它兼查一件事:单细胞通道里到底是不是一个细胞——若某"单细胞"通道的信号逼近双细胞通道,挑样重复或双连体的嫌疑立即显形。SCoPE2 方法学评估中的阶梯 set 用意相同:按设计改变 set 内细胞规模,每种设计三次重复、共六个 set(Specht et al., 2021)。多细胞通道把稀释逻辑搬进单细胞操作内部,稀释曲线量不到的那段链条,由它补上。

习题 5.5-2

对 6 对姊妹细胞测量某蛋白(log2 尺度),姊妹间差值 d 为 +0.6、−0.6、+1.0、−1.0、+0.2、−0.2。(a)假设姊妹真值相同,估计单次测量的噪声方差与标准差。(b)把标准差换算成近似的变异系数量级。(c)为何说该估计是噪声的上界?什么证据能把其中真实的姊妹间差异分离出来?

参考解答

(a)d̄ = 0;Σd2/6 = (0.36+0.36+1+1+0.04+0.04)/6 = 2.8/6 ≈ 0.467。Var(d) = 2σ2,故 σ̂2 ≈ 0.233,σ̂ ≈ 0.48(log2 单位)。(b)小方差近似下 CV ≈ σ·ln 2 ≈ 0.48 × 0.693 ≈ 0.33,即约三成——量级上已能判断该蛋白的单次测量是否支撑精细比较。(c)估计里混有姊妹间真实差异:分裂后的不对称分配与转录涨落使"真值相同"只是近似(Gatto et al., 2023)。分离的办法在结构而非数字:真实的姊妹间差异应可重复、成模块、并与独立证据对应(Iwamoto-Stohl et al., 2025);纯噪声在重复实验间不会保持同一模式。

5.5.5 参数模拟:只测得出你假设过的错

第四条路径不再造样品,而是造数据:参数模拟从分布模型出发——丰度的对数正态结构、缺失机制、批次幅度——生成完整的定量矩阵,真值完全已知、变量可任意设置、批量不受机时限制。5.2 评测 DIA 引擎的基准骨架、5.3 流程导航依赖的可复现评测集,都有这一层(Wang et al., 2025)。模拟的长处恰是实验的短板:只注入一种误差——某类肽段系统性缺失、批次设定已知幅度——再看算法能否把它找回来;这种单一变量的可控性,任何真实实验都给不了。

模型本身要交代来历:丰度分布取自实测矩阵,缺失概率与检测强度挂钩,批次幅度对照实测批间差标定;并至少保留一种"模型外检验"——把模拟选出的算法再放到掺入或重复数据上复核。参数凭空给定的模拟,成绩再高也是自说自话。

短板也在同一处。模型里没有的偏差,模拟一概测不出:共分离污染、等压载体对报告离子的干扰、随保留时间变化的残留污染、单细胞离子稀少带来的统计涨落——这些真实测量的偏差形状,很难先验写对。模拟里满分的算法,遇到真实数据的缺失机制仍需掺入与重复兜底。分工由此清楚:模拟定位算法,实验定位测量;模拟分数回答"在这种误差假设下谁更好",不回答"你的实验可信吗"(Gatto et al., 2023)。5.2 的评测数据观在此闭合:基准结论永远是"数据集条件句",条件是否覆盖你的实验,只有对照实验能回答。

警示

模拟测不出你没假设过的错。模拟数据的真值来自生成模型,评估结论因此圈定在模型假设之内:模型假设缺失完全随机,非随机缺失结构下的表现便是盲区;模型没有共分离污染,抗污染能力便无从考察。以模拟成绩为唯一依据选算法,等于宣布真实数据的误差恰好都在你假设过的清单上——这句话事后无人能替你担保。

5.5.6 报告清单:评估是结论可信度的地基

把四条路径收拢成纪律的,是社区白皮书——Gatto、Aebersold、Slavov 等 21 位作者在 Nature Methods 发表的共识文件(Gatto et al., 2023)。它的立场可以一句话概括:评估不是论文的附录,而是结论可信度的地基。清单落在三类:

  • 样品与设计:逐通道注明类型(单细胞、载体、空白或对照)、处理与批次归属;掺入品与对照的用量、比例一并报告;
  • 数据特征:系统报告影响结论的量——每细胞鉴定数、缺失率(missingness)、批次效应;报告 CV 时写明算自哪一层、包含哪些通道,口径不明的 CV 不可比;
  • 存档:原始数据与检索结果存入 PRIDE、MassIVE 等公共库(mzML、mzIdentML、mzTab 格式),让每一个数字可回溯到谱图。

清单上每一项都对应一处可信度的计算:每细胞鉴定数与缺失率决定下游统计的功效,CV 决定可分辨的最小差异,压缩系数决定测得的 1.6 倍如何解读,存档让他人可以复核而不是只能相信。评估数字缺位时,读者面对的是一份无法审计的结论;评估在位时,可信度才从形容词变成数字。本章前三节的算法基准分数,也只有放置在这块地基上才有意义。

方法

最小可信评估方案(3 天机时)。第 1 天稀释系列:bulk 匀浆稀释至 100/50/25 pg,各两重复——灵敏度曲线、工作点余量、检出限。第 2 天两两掺混:酵母与大肠杆菌按 2:1 与 1:2 混入人源背景,各两重复——保真系数 κ、压缩率、污染本底。第 3 天同克隆细胞 set:姊妹对、双细胞通道加空白——全流程噪声上界、线性、双连体排查。进样顺序全程随机化。报告五件套:

  1. 每细胞鉴定数与缺失率;
  2. CV(注明计算层级与所含通道);
  3. 压缩系数 κ(掺混读出);
  4. 全流程噪声上界(姊妹对读出);
  5. 原始数据存档号。

理由只有一条:仪器(稀释曲线)、定量保真(掺混)、全流程(重复)三段链条各有一块只有对应对照才能照亮,缺一段,结论就悬空一段。

习题 5.5-3

你接手一套新仪器与一套新制备流程,只有 3 天机时做方法评估。请给出一套最小可信方案:安排哪几类样品、各占多少机时、每类回答什么问题;并说明为何不能用其中一类替代其余。

参考解答

按上文的骨架安排:稀释系列一天,画"鉴定数—输入量"曲线,回答仪器到不到得了单细胞水平、工作点离检出限多远——它验证"制备+仪器",但匀浆不含挑细胞的损耗;两两掺混一天,读出 κ 与压缩率,回答定量系统对已知倍数的保真——但掺入品不经历单细胞操作;同克隆细胞 set(含姊妹对、双细胞通道与空白)一天,估全流程噪声上界并查线性与双连体——但姊妹"真值相同"只是近似,且无法给出绝对参照。三类对照的盲区互不重叠:删去稀释,灵敏度只剩文献数字;删去掺混,压缩率无从谈起;删去重复,挑细胞段的噪声永远藏在生物学差异背后——三段链条缺一段,结论悬空一段。


本节把"评估"从算法收回实验设计,核心是一张账目:

  • 单细胞测量没有天然真值,评估的第一步是制造已知答案:掺入标准品、稀释系列、重复实验、参数模拟四条路径各答一问、各留一块盲区(表 5.5-1);
  • 掺入与两两掺混量出定量精度、检出限与比值压缩(式 5.5-1);稀释系列画灵敏度曲线、定工作点;重复的三种形态分别量仪器稳定性、全流程噪声上界与定量线性;模拟只测假设过的误差;
  • 白皮书的报告清单把评估变成纪律:鉴定数与缺失率、CV 口径、对照设置、原始数据存档——评估是结论可信度的地基,不是论文的附录。

这份纪律在临床场景里只会更严:诊断与分型立在测量之上,评估缺位的地基撑不起任何决定。下一节讨论单细胞蛋白组学走向临床的路。

关键术语

真值 (ground truth)
评估参照的已知正确答案;单细胞测量无天然真值,须以对照制造。
掺入标准品 (spike-in standard)
以已知量、已知比例加入样品的外源肽段、蛋白或蛋白组。
两两蛋白组掺混 (two-proteome mix)
两种异源蛋白组按已知比例混合,成批核验倍数变化保真度。
比值压缩 (ratio compression)
观测倍数变化系统性小于真值的现象,由 1 − κ 度量。
稀释系列 (dilution series)
bulk 匀浆逐级稀释至单细胞水平,画鉴定数—输入量灵敏度曲线。
检出限 (limit of detection)
能与背景噪声可靠区分的最低可测量。
技术重复 (technical replicate)
同一匀浆分装、平行处理与进样,量仪器稳定性与批间差。
姊妹细胞重复 (sister-cell replicate)
对同源姊妹细胞做配对测量,以近似相同真值估全流程噪声上界。
参数模拟 (parametric simulation)
从分布模型生成定量数据,真值已知但只含被假设过的误差。
缺失率 (missingness)
缺失值所占比例;白皮书要求系统报告的核心数据特征。

参考文献与延伸阅读

  1. Gatto L, Aebersold R, Cox J, et al., Slavov N. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
  2. Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
  3. Bubis JA, Arrey TN, Damoc E, et al. 2025. Challenging the Astral mass analyzer to quantify up to 5,300 proteins per single cell at unseen accuracy to uncover cellular heterogeneity. Nature Methods 22: 510–519.
  4. Derks J, Derks J, Leduc A, Masselon C, et al. 2023. Increasing the throughput of sensitive proteomics by plexDIA. Nature Biotechnology 41: 50–59.
  5. Iwamoto-Stohl LK, Petelski AA, Quan B, et al. 2025. Fertilization triggers early proteomic symmetry breaking in mammalian embryos. Cell 188: 7428–7444.
  6. Ye Z, Sabatier P, et al. 2025. Enhanced sensitivity and scalability with a Chip-Tip workflow enables deep single-cell proteomics. Nature Methods 22: 499–509.
  7. Sinn LR, Demichev V. 2025. Entering the era of deep single-cell proteomics. Nature Methods 22: 459–460.
  8. Wang J, Huang Y, Lu F, Xu Q, et al. 2025. Benchmarking informatics workflows for data-independent acquisition single-cell proteomics. Nature Communications 16: 10276.
  9. Gomoryova K, Hecht H. 2025. Single cell proteomics data analysis with bioconductor-scp. Galaxy Training, training.galaxyproject.org.