5.2.1 为什么需要信息学基准
DIA 把隔离窗口固定铺满质量范围,低信号样本的覆盖由此做深,已进入单细胞常规(Derks et al., 2023;Ye et al., 2025;Sinn and Demichev, 2025)。
但第四章反复出现的事实在此同样成立:仪器产出的是一摞原始文件,定量矩阵由分析者的一连串选择制造出来。选择从谱图库(spectral library)开始——用同型仪器上的低输入样品实测建库、下载公开发布的现成库、用预测软件生成库,或者不建库走无库检索(library-free search);接着选检索与定量引擎——DIA-NN(Demichev et al., 2020)、Spectronaut、PEAKS 各有算法;再往下是参数——FDR 阈值、定量设置、酶切特异性;矩阵出炉后还有填补、归一化、批次校正与差异检验(4.3、5.1)。图 5.2-1 把这条链画成一个三层组合空间:每个交点是一条候选流程,组合数按乘法增长。
组合空间大到没有哪个实验室能凭经验通吃,而各家方法论文自报的数字建立在各自的仪器、样品与默认参数上,口径互不相同——同样一句"定量约两千种蛋白",在纳克级与单细胞级进样之间并不可比。要比出高下,就得把候选组合放进同一批数据、同一套指标之下,这正是基准评测(benchmarking)的用意。Wang 等(2025)对 DIA 单细胞信息学流程做了一次系统横评,本节以它为标本:目标不是记住结论——结论会随版本过时——而是学会解剖这一类论文:数据从哪来、比了什么、怎么计分、结论在什么条件下成立。
基准评测(benchmarking):在共同的数据、统一的指标与明示的条件下,系统比较多种方法或工具组合表现的研究形式。它与单方法论文的区别在"共同基准":所有受评对象跑同一批数据、按同一口径计分。可信度取决于三件事:数据是否贴近真实场景、指标是否覆盖互相冲突的目标、条件(版本与参数)是否全部公开。
5.2.2 评测框架的解剖:数据、组合与指标
拿到一篇基准论文,先问三个问题:数据从哪里来?比的是哪些组合?用什么指标计分?三个答案合起来,就是结论的适用范围。
数据。Wang et al.(2025)的数据分三层。第一层是掺混标准品:HeLa 与酵母、大肠杆菌蛋白酶解物按设定比例混合,总上样约 200 pg,timsTOF Pro 2 上以 diaPASEF 采集、多配比各设重复——人为设定的混合比使比值准确性(ratio accuracy)获得真值(ground truth)。第二层是独立酶解的掺混蛋白组,跨两台仪器与多个批次,考察重复性与稳健性。第三层是真实单细胞:MCF-7(阿霉素处理与溶剂对照)经微流控 PiSPA 平台逐细胞制备,外掺酵母与大肠杆菌蛋白(约 20/40 pg),3 批共 60 样——真实细胞没有量的真值,但分组已知,从检索到差异检验的全链条在此受试。这些参照连同通用的模拟手段,构成图 5.2-2 的三类真值来源。
组合。受评引擎三个:DIA-NN(1.9.2)、Spectronaut(19.5;无库走 directDIA+,实测库走 Pulsar 建库)与 PEAKS Studio(12.0)。谱图库策略四种:无库、样本特异性 DDA 库(同型 LC-MS 上约 2 ng 进样反复累积)、公开发布的 bulk 级库(约 200 ng 进样、高 pH 分级)与 AlphaPeptDeep 预测的全蛋白质组库。
引擎与库策略构成检索层横评;矩阵之后另起一轮:填补 × 归一化 × 批次校正 × 差异检验,共排出 4,900 种组合。口径注记:论文未把运行效率纳入计分,不少基准研究将其列为指标,引用时须看清各自覆盖的维度。
指标。表 5.2-1 列出指标体系。覆盖类:每 run 定量的蛋白数,以及数据完整度(data completeness)——跨全部 run 均被定量的蛋白占比;精度类:重复样中蛋白强度的中位变异系数(median coefficient of variation, median CV)(式 5.2-1)。
准确性类:观测比值与设定混合比的偏差;下游类:已知条件下差异检验的精确率、召回率与 F1,批次校正以聚类与已知分组的一致性(调整兰德指数 ARI)计分;质控类:交叉物种夹带(cross-species entrapment)——样品里并不存在的物种,报出来即是假阳性,充当阴性参照。每个指标只照亮一个侧面:鉴定数不问对错,完整度不问可靠,CV 不问覆盖——表 5.2-1 的最后一列因此与定义同样重要。
| 指标 | 定义 | 它奖励什么 | 它惩罚什么 |
|---|---|---|---|
| 鉴定数 | 每 run 定量到的蛋白数(中位数与分布) | 激进策略:更低的信号门槛、更宽的匹配 | 保守策略;不区分对错——假阳性不在此扣分,须另由夹带质控兜底 |
| 数据完整度 | 跨全部 run 均被定量的蛋白占比 | 缺失少的组合(Spectronaut directDIA 57% 对 DIA-NN 48%) | 缺失多者;不问低信号定量的可靠性 |
| 中位 CV | 重复样中蛋白强度变异系数的中位数(式 5.2-1) | 定量稳定、干扰校正得力 | 噪声大的低信号定量 |
| 比值准确性 | 观测比值与设定混合比的偏差 | 抗背景干扰的定量 | 比值压缩——观测倍数向 1 收缩 |
| 差异检验(F1 等) | 已知条件下差异蛋白的检出与误报 | 全链条均衡的组合 | 任一环节的短板(覆盖、精度或检验功效) |
| 批次校正(ARI) | 聚类结果与已知分组的一致性 | 校正到位而不抹除生物学结构 | 欠校正与过校正 |
| 夹带假阳性 | 从样品中不存在的物种得到的鉴定 | 严格的 FDR 控制、克制的库规模 | 与高输入样品共检索等推高假阳性的做法 |
5.2.3 多目标评测的读法:Pareto 前沿
横评结果不是一张排行榜,而是几张互相牵制的记分卡。统一口径下:Spectronaut directDIA 每 run 定量 3,066 ± 68 种蛋白,三者最高;DIA-NN 相当(共 3,061 种)而跨 run 共有比例较低(48%,即 1,468 种,Spectronaut 为 57%,2,013 种),缺失更多;但论定量精度,DIA-NN 的中位 CV 为 16.5%–18.4%,明显优于 Spectronaut 的 22.2%–24.0%;PEAKS 鉴定居中(2,753 ± 47),精度垫底(27.5%–30.0%)(Wang et al., 2025)。三个引擎各占一角,没有一个在所有指标上领先。
这不是巧合,而是结构性交换。要把更多蛋白写进矩阵,只能放宽信号门槛、容忍更边缘的峰群匹配;拉进来的恰是低信号蛋白,其测量噪声大、干扰重,CV 随之抬高;反过来收紧标准,矩阵变小变稳。覆盖与精度在低信号区相互争夺,指标因此互斥,单指标排名没有意义:按鉴定数排,Spectronaut 第一;按 CV 排,DIA-NN 第一——两个"第一名"都真,也都只说了一半。
单指标排名的陷阱。见到"工具 X 最好"式的结论,先查三件事。其一,按哪个指标排名?换一个指标,座次可能整体翻转。其二,口径是否一致?鉴定数要统一完整度阈值再比,CV 要统一"哪些蛋白参与计算",否则是两把尺子量同一件事。其三,差距是否显著?±68 与 ±47 是重复间的标准差,两个中位数若相差不到一个波动范围,"第一"只是噪声。多目标评测的正确读法是圈出Pareto 前沿(Pareto frontier)——不被任何组合全面超越的那组组合(图 5.2-3)——再按自己的主次指标从中挑选。
习题 5.2-1
四种工具组合在同一批重复样上得到:A(完整度 36%,中位 CV 15%)、B(44%,22%)、C(66%,30%)、D(48%,18%)。(a)以完整度为横轴(越高越好)、CV 为纵轴(越低越好),判断哪些组合位于 Pareto 前沿;(b)论证四个组合中不存在"绝对最优";(c)若你的下游目标是差异丰度分析,且已知低信号定量的缺失会撕裂批次间的可比性,你倾向哪个组合?代价是什么?
参考解答(a)B 被 D 支配(48% > 44% 且 18% < 22%),故前沿为 {A, D, C}:A 的 CV 最低,C 的完整度最高,D 介于两者之间且不被任何人支配——A 完整度不足、C 的 CV 更差,均不构成对 D 的支配。(b)"绝对最优"要求两轴同时不劣于其余全部组合:A 的完整度最低、C 的 CV 最高、D 两项均非第一,B 被支配——条件无一满足;每个前沿成员都以另一项指标为代价换取自己的强项,这正是图 5.2-3 的含义。(c)缺失撕裂批次可比性,故倾向完整度高的 C;代价是 30% 的中位 CV——差异检验的功效下降、多重检验负担上升。折中可取 D,再按 75% 完整度阈值自行过滤缺失,把覆盖换成可靠性。
"推荐流程"因此都是有条件的推荐:结论绑定数据类型、仪器采集与软件版本,条件一换,排序可能重排——适用边界在 5.2.5 系统展开,引用时把条件一并引上,结论才完整。
5.2.4 真值从哪里来:掺入、夹带与模拟
基准评测的一切指标都指向同一个难题:单细胞没有真值——没有哪种独立技术能告诉你某个细胞里某蛋白的确切分子数。横评只能从三种渠道构造参照(图 5.2-2)。
其一,掺入(spike-in):把已知量或已知比例的外源物质加进样品,掺混标准品的物种混合比、真实单细胞外掺的酵母与大肠杆菌蛋白皆属此类。其二,交叉物种夹带:样品里没有的物种充当阴性参照。其三,模拟:从高输入数据稀释出"单细胞水平"的谱图,或按参数模型生成谱图——误差全部按写进模型的规则发生。
比值压缩(ratio compression)是掺入揭示的一类系统性失真。设两通道的分析物真量为 q 与 rq(真实倍数 r),另有强度 b 的背景信号(干扰、残留污染)向两通道等量注入,观测比值即式 (5.2-2)。b/q 越大,ρ 越向 1 收缩:上调被低估、下调被高估,差异分析的功效随之衰减。掺入的混合比已知,压缩程度便可逐工具量化——"比值准确性"一列的机理即在于此(表 5.2-1)。
参照数据是怎么造出来的。掺混标准品:人源与酵母、大肠杆菌蛋白酶解物按设定比例(约 0.4–1.6 倍区间)混合。稀释模拟:取高输入数据按比例衰减信号,重造"单细胞水平"的谱图。参数模拟:按丰度分布、噪声模型与缺失机制生成谱图。三者的真值都写在设计里;共同的局限是世界只按设计运行。
习题 5.2-2
掺入设定混合比 r = 1.5(通道 2 是通道 1 的 1.5 倍)。某工具在重复样上测得中位观测比值 1.2。(a)用式 (5.2-2) 反推背景信号 b 与分析物信号 q 之比;(b)计算 log2 倍变化口径下的压缩程度;(c)若收紧完整度阈值、只保留高信号蛋白,压缩会加重还是减轻?为什么?
参考解答(a)(1.5q + b)/(q + b) = 1.2,展开得 1.5q + b = 1.2q + 1.2b,即 0.3q = 0.2b,故 b = 1.5q:背景信号达到分析物信号的 1.5 倍——单细胞量级下并不夸张。(b)真值 log21.5 ≈ 0.585,观测 log21.2 ≈ 0.263,压缩程度 0.263/0.585 ≈ 0.45:倍变化的对数只剩约 45%。(c)减轻。高信号蛋白 q 大、b/q 变小,由式 (5.2-2) ρ 更接近 r;代价是矩阵收缩、缺失上升——准确性与覆盖的交换又一次出现,与 5.2.3 的机理一致。
模拟的便利正是它的风险:模拟只能测试你假设过的错误。生成模型若没有写进某种干扰——共流出、离子饱和、进样波动、载体残留——评测就对这类干扰视而不见,"工具 A 更稳健"只在模型假设的世界里成立。稀释模拟同样带着母数据的印记:高输入谱图的峰形、干扰与缺失结构未必是单细胞的样子。
Wang et al. 因此把掺混标准品、真实细胞与掺入设计并用来互相印证,而不是把评测押在单一数据来源上;5.5 节将把"评估用什么尺子"作为专题展开。论文里的一条教训可以直接救你的项目:把单细胞数据与高输入样品放在一起检索(共检索),会让样品中不存在的物种混进鉴定表,且这类假阳性靠强度阈值过滤不掉;把完整度阈值提高到 75%,能剔除其中的大部分(论文报告 10%–83%)。真值从实验设计里来,不从算法里来——这一原则对读论文与做实验同样适用。
5.2.5 结论的适用边界:场景、版本与口径
如实转述论文的推荐(均以原文为准)。引擎层面:DIA-NN 在各库策略下表现均衡、定量精度最高,且学术使用免费,是综合稳健的选择;Spectronaut directDIA 胜在鉴定数与完整度;PEAKS 鉴定居中而精度落后。库策略层面:条件允许时,用低输入样品构建的项目特异性库最有利;公开发布的 bulk 级库不占优势(对 Spectronaut 反而再现性最差);现成模型预测的谱图库对单细胞无益——预测模型多数未经单细胞数据训练优化。就 DIA-NN 而言,公开库鉴定最多、无库定量最准;下游评测统一采用无库(Wang et al., 2025)。
矩阵之后的 4,900 种组合里没有普适冠军,但结构性规律清楚:稀疏性消减对结果影响最大,75% 完整度是"多保蛋白"与"少背填补负担"之间的合理权衡;批次校正环节 ComBat(参数与非参数两式)与 limma 稳定占优;差异检验环节 DESeq2 与 limma-trend 出现频率最高;掺混标准品上表现最好的组合是 SoftImpute 填补、Sum 归一化、ComBat-P 与 DESeq2,批次聚类的 ARI 达到 1.0。
论文的建议因此不是押注单条流程,而是并行分析一组高性能组合、审视结论的一致性。
引用以上任何一条,都要连同适用边界一起引用。其一,场景边界:全部评测在 timsTOF 平台、diaPASEF 采集、皮克级上样下完成,换仪器、换采集方式,排序不保证外推。
其二,版本漂移(version drift):结论绑定 DIA-NN 1.9.2、Spectronaut 19.5、PEAKS 12.0——DIA 系软件一年数更,神经网络模型、干扰校正与评分策略都在演进,旧名次会随版本失效;引用时附版本号既是学术礼仪,更是准确性要求。其三,口径边界:评测未计运行效率,也未必覆盖你的关键指标(如肽段级比率、翻译后修饰)。社区白皮书要求基准结果连同数据、代码、参数与版本全链条公开(Gatto et al., 2023),正是让这三条边界可查的机制。把边界背下来,比把名次背下来有用:名次每版一换,读法长期有效。
习题 5.2-3
你在论文里读到"工具 X 在鉴定数上显著胜出,推荐用于 DIA 单细胞分析"。列出引用该结论前应核实的至少四件事。
参考解答①指标口径:鉴定数按什么完整度阈值与 FDR 口径统计,是否附夹带质控;②数据场景:什么仪器与采集方式、什么上样量级与样品类型,与自己的数据是否同构;③版本:工具 X 的哪个版本,与当前版本差距多大——版本漂移可能已使结论失效;④代价:该组合在中位 CV、比值准确性与完整度上的表现,是否只是 Pareto 前沿的极端端点;⑤(加分项)显著性:重复间波动多大,领先幅度是否超出噪声。核毕再引,并注明条件与版本号。
5.2.6 把方法学到手:一次迷你基准
基准评测的方法不必等一篇论文,缩小规模就能在自己的数据上跑一遍:两条流程、三个指标。它的价值不在得出普适名次,而在为自己的数据积累一份可辩护的选择依据——为什么用这条流程,此处有账可查。
迷你基准检查单(两条流程 × 三个指标)。第一步,备数据:同一样品等分后重复进样 3–5 次(给 CV),保留一个已知掺入或外源参照(给比率),跨两天各测一批(给批次稳健性)。第二步,定流程:只比两条、只差一个变量——例如 DIA-NN 无库对 DIA-NN 项目特异性库,或 DIA-NN 对 Spectronaut directDIA——其余设置全部冻结。第三步,算三样:每 run 鉴定蛋白数(中位数与分布);重复样中位 CV(式 5.2-1);统一完整度阈值(如 75%)下的鉴定数——完整度不统一,鉴定数不可比。第四步,看尾部:平均数之外,检查缺失集中在哪些蛋白、哪些 run——两条流程的差距通常藏在低信号区。第五步,写记录:两条流程的版本号、参数、原始输出路径与计算脚本全部入档;半年后版本漂移,这份档案就是重新评测的起点。
两条流程若在三个指标上互有胜负,迷你基准的产出就不是名次,而是一份诚实的认识:自己的数据上覆盖与精度如何交换、缺失集中在何处——这正好接上 5.1 的统计选择与 5.5 的评估之辨。
本节以 Wang et al.(2025)的横评为标本,把基准评测拆成可复用的读法:
- DIA 单细胞的信息学是组合问题:库策略 × 引擎 × 参数 × 下游四环节按乘法增长;口径统一的数据与指标是可比证据的前提(表 5.2-1);
- 指标互斥是结构性的:覆盖与精度在低信号区相互争夺,正确读法是 Pareto 前沿而非单指标排名,"推荐流程"皆绑定数据类型、仪器与版本;
- 真值从设计来、不从算法来:掺入给比率与阴性参照,模拟只能测试假设过的错误,共检索与库规模会推高假阳性;
- 结论的寿命等于版本的寿命:引用附版本号与条件,并可用"两条流程 × 三个指标"的迷你基准在自己的数据上复核。
下一节把镜头从质谱数据转向基于流式与成像的细胞测量,看数千种处理组合如何系统导航(ANPELA)。
关键术语
- 基准评测 (benchmarking)
- 在共同数据、统一指标与明示条件下系统比较方法或工具组合的研究形式。
- 谱图库 (spectral library)
- 已知肽段的碎片谱图与保留时间等参照信息的集合,供 DIA 检索匹配。
- 无库检索 (library-free search)
- 不依赖实测谱图库、直接由序列数据库预测或解析 DIA 数据的检索方式。
- 掺入 (spike-in)
- 向样品加入已知量或已知比例的参照物,为定量提供真值。
- 真值 (ground truth)
- 评测中充当标准答案的已知量、已知比值或已知分组。
- 数据完整度 (data completeness)
- 跨全部 run 均被定量的蛋白占比,缺失程度的反面。
- 中位变异系数 (median coefficient of variation)
- 重复测量中蛋白强度变异系数对全部蛋白取中位数,定量精度指标。
- 比值压缩 (ratio compression)
- 背景干扰使观测倍数变化向 1 收缩的现象,见式 (5.2-2)。
- Pareto 前沿 (Pareto frontier)
- 多目标评测中不被任何组合全面超越的一组组合,正确读法的落点。
- 交叉物种夹带 (cross-species entrapment)
- 以样品中不存在的物种检验假阳性的阴性参照设计。
- 版本漂移 (version drift)
- 软件版本更替使旧评测结论失效的隐患,引用须附版本号。
参考文献与延伸阅读
- Wang J, Huang Y, Lu F, Xu Q, et al. 2025. Benchmarking informatics workflows for data-independent acquisition single-cell proteomics. Nature Communications 16: 10276.
- Demichev V, Messner CB, Vernardis SI, Lilley KS, Ralser M. 2020. DIA-NN: neural networks and interference correction enable deep proteome coverage in high throughput. Nature Methods 17: 41–44.
- Derks J, Derks J, Leduc A, Masselon C, et al. 2023. Increasing the throughput of sensitive proteomics by plexDIA. Nature Biotechnology.
- Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
- Sinn LR, Demichev V. 2025. Entering the era of deep single-cell proteomics. Nature Methods 22: 459–460.
- Ye Z, Sabatier P, et al. 2025. Enhanced sensitivity and scalability with a Chip-Tip workflow enables deep single-cell proteomics. Nature Methods 22: 499–509.