第5章 · 5.3

5.3 ANPELA:数据处理流程的导航

ANPELA: Navigating Data-Processing Workflows
摘要 流式与质谱流式把每个细胞读成几十维的蛋白向量,处理它的流程却远非唯一:补偿、变换、事件质控、归一化、聚类,每一步都有多种候选,组合按乘法膨胀到千种量级。本节以 ANPELA 为载体,讨论"选流程"本身的方法论:把流程组合当作可枚举、可评估的空间,用一组可自动计算的指标打分排序并给出导航,并考察它适用于流式类数据的条件、指标背后的目标与质谱路线的分工。

5.3.1 一条算子链与一个乘法问题

3.1 节把质谱流式(CyTOF)与常规流式归入亲和测量一路:每个细胞被读成几十维的蛋白向量,奠基工作一次测量 34 个参数——31 种抗体,外加 DNA 嵌入剂、活性染料与事件长度(Bendall et al., 2011)。但下机得到的 FCS 文件并不是拿来即可分析的数据。从原始事件矩阵到一张可信的细胞分群图,中间是一条次序固定的处理序列,本节称之为算子链(operator chain)补偿(compensation)扣除跨通道的溢出(spillover)——荧光染料的发射谱尾部互相重叠,金属标签则受同位素纯度不足与氧化物离子的拖累;变换(transformation)把跨几个数量级的强度压到可比较的尺度,3.1 埋下的 arcsinh 与 biexponential 在此兑现。

再往后是事件质控(event-level quality control),剔除碎片、双联体(doublet)与采集异常时段的事件;归一化(normalization)统一仪器漂移与批次尺度,质谱流式常用微球(bead)校正;此后才是特征选择、聚类与降维、可视化与标注。五个环节各有专职:补偿管通道间的串扰,变换管数值的尺度,质控管事件的真伪,归一化管批次之间的可比,聚类管结构的呈现——一条链上没有任何一环可以替代另一环。

定义

算子链(operator chain)。数据处理中各操作环节按固定先后串成的一条链:上游环节的输出即下游环节的输入。链的关键性质是整体性——最终分群图由整条链决定,任何一环的替换都会改变传到末端的结果;因此评价与选择的单位应当是"整条链",而不是链上的某一步。链上任一环的次序也非任意:补偿必须在变换之前,否则溢出误差已被非线性尺度放大;归一化必须识别批次结构之后才有意义。

麻烦在于,每一环都不是单选题。以 ANPELA 官网口径为例(表 5.3-1):补偿这一步,流式有 AutoSpill、flowCore、MetaCyto 三种算法可选,质谱流式有 CATALYST、CytoSpill 两种;变换 14 种;事件质控 4 种;归一化流式 5 种、质谱流式 6 种;聚类也有 FlowSOM 与 PhenoGraph 两家(idrblab.cn/anpela)。

把每一环的候选数连乘,就得到全部可能的流程组合数——组合空间(combinatorial space)

N = k1 × k2 × ⋯ × ks = ∏i=1s ki
(5.3-1)s 为算子链的环节数,ki 为第 i 环的候选方法数,N 为组合空间的大小。算例:六步流程各取 3、5、4、3、4、3 种候选,N = 3×5×4×3×4×3 = 2,160——平均每步不到五种选择,总数已过两千。
案例

组合数怎么膨胀。组合数对每一步的候选数按乘法敏感:任何一环的候选翻倍,总数就翻倍;环节数每增加一个,总数再乘一次。六步各 3 种是 729,各 4 种就是 4,096,各 5 种则达 15,625。反过来读这条式子也有用:想控制组合爆炸,最有效的杠杆不是"少选几种方法",而是冻结某一环——社区共识固定了一环(k=1),空间就按比例整体缩小。质谱路线的"标准化主干"正是这样做的(5.3.3)。

由此得到两个直接推论。其一,软件附带的"默认流程"只是组合空间中的一个点,没有先验保证它适配你的数据与目标——算法选择上的无免费午餐(no free lunch)说的正是这件事:脱离数据分布与评价目标,"最优流程"无从谈起。其二,人工逐个尝试在时间上不可行,习题 5.3-1 会算这笔账。选流程于是从"跟着教程走"变成一个独立的方法学问题:谁来替你把组合空间系统地走一遍,并按统一标准打分?

算子链五步:补偿、变换、事件质控、归一化、聚类,各步候选方法数连乘构成组合空间 流式类数据处理的算子链:每一步都有多种候选 环节与候选方法据 ANPELA 官网(idrblab.cn/anpela)整理;k 为该环节的候选方法数 FCS 原始数据 事件 × 通道矩阵 ① 补偿 k:流式 3 · 质谱流式 2 AutoSpill、flowCore、MetaCyto(流式);CATALYST、CytoSpill(质谱流式) ② 变换 k:两类仪器同,14 种 arcsinh、biexponential、log 等共 14 种(协同因子 c 另计,式 5.3-3) ③ 事件质控 k:两类仪器同,4 种 flowAI、flowCut、flowClean、PeacoQC(异常时段、碎片、双联体) ④ 归一化 k:流式 5 · 质谱流式 6 GaussNorm、均值、Min-max、WarpSet、ZScore;质谱流式另加微球校正 ⑤ 聚类 / 轨迹 k:聚类 2 · 轨迹 2 类 FlowSOM、PhenoGraph(亚群识别);Scorpius、Slingshot(轨迹推断) 组合空间 = 各步候选数连乘(式 5.3-1) 流式:3×14×4×5×2 = 1,680 种 · 质谱流式:2×14×4×6×2 = 1,344 种 · 合计 3,024 种
图 5.3-1 流式类数据处理的算子链与各步候选方法数。左列为五个处理环节,右列给出每环的候选方法(ANPELA 官网口径);五环候选数连乘即组合空间:流式 1,680 种、质谱流式 1,344 种。特征选择与下游标注由分析者把握,未计入连乘;轨迹推断(Scorpius、Slingshot)是聚类的平行任务出口,两者不同时进入同一组合。

还要看清链上哪些环节进得了组合空间、哪些进不了。补偿、变换、质控、归一化、聚类五环方法可枚举、次序基本固定,因而能连乘成一个有限空间;特征选择只部分可枚举——留哪些标志物常有成法,但没有穷举的价值;至于为一个新亚群命名、判定一个分群在生物学上是否讲得通,完全依赖领域知识,不存在可自动打分的候选清单。组合导航管前者,后两者仍是分析者的责任——工具的边界画在这里,恰是它可靠的原因。

习题 5.3-1

某实验室的流式分析流程有 7 个环节,每个环节恰有 4 种候选方法。(a)组合空间多大?(b)若每天人工试一种组合,全部试完需多少年(按每年 365 天)?(c)并行计算把速度提到每天 1,000 种,需多久?(d)由(b)(c)之差说明大规模筛选类工具的存在前提。

参考解答

(a)N = 47 = 16,384 种。(b)16,384 ÷ 365 ≈ 44.9 年,接近半个职业生涯——人工穷举不可行。(c)16,384 ÷ 1,000 ≈ 16.4 天。(d)同一组合空间,串行是"一辈子",并行是"两周":当单步计算足够便宜、评价指标可自动计算时,系统穷举就从不可能变成一次预实验。这正是 5.3.3 要拆解的两个先决条件。

5.3.2 ANPELA:把"选流程"做成一次可复现的实验

ANPELA 的回答是:与其争论哪种流程好,不如把"选流程"本身做成一次可复现的实验(Sun et al., 2025)。这套工具出自浙江大学朱峰团队的 IDRB Lab,2025 年以协议论文的形式发表在 Nature Protocols。

它的做法分三步:把流程组合当作可枚举、可评估的空间,对用户提交的数据并行运行大量候选组合;用一组可自动计算的指标给每个组合的表现打分;排序并可视化,输出一份面向这批数据的推荐清单。论文把这整个动作称为在组合空间中的导航(navigation)。软件以 R 包、在线服务器与 Windows 桌面版三种形态发布,不要求编程基础,原始 FCS 文件可自动识别,作者报告单批数据的运行时长依规模从数分钟到数小时(Sun et al., 2025)。

表 5.3-1ANPELA 组合空间的构成(据官网 idrblab.cn/anpela 整理;Sun et al., 2025)
环节流式候选方法质谱流式候选方法候选数(流式/质谱流式)
① 补偿AutoSpill、flowCore、MetaCytoCATALYST、CytoSpill3 / 2
② 变换arcsinh、biexponential、log 等 14 种同左14 / 14
③ 事件质控flowAI、flowCut、flowClean、PeacoQC同左4 / 4
④ 归一化GaussNorm、均值、Min-max、WarpSet、ZScore左列五种 + 微球校正5 / 6
⑤ 聚类(亚群识别任务)FlowSOM、PhenoGraph同左2 / 2
合计(连乘,式 5.3-1)1,680 / 1,344

组合空间到底有多大?各口径略有出入,量级却一致:官网的表述是"逾 1,000 种可用流程",2023 年前作的摘要同样写"超过 1,000 种流程",协议论文摘要则以 thousands 概括(Zhang et al., 2023;Sun et al., 2025)。按表 5.3-1 的候选数连乘,流式 1,680 种、质谱流式 1,344 种,两类合并计数在三千上下。

无论采哪种口径,结论相同:这是一个人工无从穷举、却又完全有界可枚举的空间——恰好落在"值得系统筛选、也筛得起"的规模上。

打分依据是明列的指标清单,且按下游任务分两组。细胞亚群识别(CSI)配四条判据:Ca,分类精度——以近邻分类器对照已知标签,考核 F1 与 AUC;Cb,聚类紧致度——外部用 Rand 指数与纯度对照真值(ground truth)标注,内部用轮廓系数及 CH、DB、XB 指数度量簇结构;Cc,标志物稳健性——驱动分群的蛋白标志物在不同数据划分下是否一致;Cd,与先验知识的一致性——分群是否守住已知的细胞类型边界。

拟时序(pseudotime)轨迹推断(PTI)另配四条:拟合时序与物理采集顺序的一致性、蛋白水平沿轨迹的平滑度、子采样下的稳健性(Spearman 与 Kendall 相关),以及与已知信号通路层级的一致性(Sun et al., 2025;idrblab.cn/anpela)。八条判据全部可以自动计算,这正是大规模筛选可行的第三块基石。

打分之后的排序由机器学习完成,以各指标为特征给出总体表现排名,并辅以交互式图表供逐项查看(Sun et al., 2025)。

两个工程细节值得知道:其一,逾千组合靠并行计算消化,桌面版可完全离线运行——临床或合作数据不出本机,是不少课题组选桌面版的实际理由;其二,导航的输入是用户自己的数据,推荐因此是"这批数据上的实测结果",不是文献结论的照搬——这也是它与通用"最佳实践"清单的本质区别。

ANPELA 的导航逻辑:逾千种组合并行运行,多指标打分,按目标排序得到推荐前沿 从组合空间到推荐前沿:ANPELA 的导航逻辑 并行运行候选组合 → 多指标打分 → 按目标排序并交互可视化 ① 组合空间 每个点 = 一种流程组合 逾千种组合(式 5.3-1);着色者表现各异 并行运行 逐一打分 ② 多指标打分 Ca 分类精度(F1 / AUC) Cb 聚类紧致度(轮廓系数等) Cc 标志物稳健性(一致性) Cd 先验知识一致性(真值) 另设轨迹指标一组(拟时序任务) 排序 可视化 ③ 推荐前沿 指标二(如 Cb) 指标一(如 Cd) 帕累托前沿 输出:面向这批数据的组合排名与交互式可视化导航(R 包 · 在线服务器 · 桌面版)
图 5.3-2 ANPELA 的导航逻辑。左:候选组合构成的组合空间,每个点是一条完整的算子链;中:对每个组合并行计算多指标得分——亚群识别任务用 Ca–Cd 四条,轨迹推断另设一组;右:组合落在二维指标平面上,帕累托前沿(虚线连接的着色点)即不再能同时改进任何一项指标的推荐组合;前沿之下(灰色点)的组合至少被一个前沿组合全面压过。指标与软件形态依 Sun 等(2025)与官网口径绘制。
习题 5.3-2

按表 5.3-1 计算:(a)流式数据的组合数;(b)质谱流式数据的组合数;(c)两类合并计数;(d)官网为何写"逾 1,000 种"而章节叙述常出现"逾三千种",两种口径矛盾吗?

参考解答

(a)3×14×4×5×2 = 1,680 种。(b)2×14×4×6×2 = 1,344 种。(c)1,680 + 1,344 = 3,024 种。(d)不矛盾,只是计数口径不同:官网的"逾 1,000 种"针对单一数据类型的可用组合——1,680 与 1,344 都超过一千;"逾三千"把两类仪器的组合空间合并相加。论文摘要用 thousands 概括,同样是量级表述。读这类数字时应先问口径:空间按数据类型分层,数字就跟着分层。

5.3.3 这套策略为何在流式类数据上行得通

"穷举打分"听上去笨,却有三个苛刻的前提,流式类数据恰好齐备。一是链短:算子链五步上下,每个组合只是替换链上的方法,不改变链的结构。二是单步计算便宜:一次流式上样的事件数在十万量级、通道数十维,一步运算在秒级完成,逾千组合并行跑一遍是分钟到小时级的事(Sun et al., 2025)。三是指标可自动计算:分类精度、聚类紧致度、一致性得分都有现成公式,机器能自己打分,无须人工评读。三者相乘,"系统穷举"从不可能变成一次预实验。

质谱单细胞路线三条各差一截。其一,链长:4.3 节展开的八步主干之外还有谱图检索与 FDR 控制,环节多出一个量级;其二,单步昂贵:每个组合都要在数十万行 PSM 证据上检索、定量、过滤,成本高出几个量级;其三,指标难全自动:鉴定数、中位 CV、缺失模式往往仍要人审。

于是质谱路线走上另一条路——不是穷举组合,而是收敛共识:scp 包把八步主干固化为标准流程(Grégoire et al., 2024),Galaxy 教程再把它图形化(Gomoryova and Hecht, 2025),社区白皮书规定报告义务(Gatto et al., 2023),5.2 的 DIA 横评则在工具组合层面做横向基准评测(Wang et al., 2025)。组合空间小而有先验,策略就从"导航"换成"共识+横评"。两种生态、两种策略,无所谓高下,各自的计算经济学已把路指好了。

流式 / 质谱流式:穷举 + 导航

  • 链短:五步上下,结构固定;
  • 单步秒级,逾千组合可并行(分钟—小时);
  • 指标全自动(Ca–Cd 与轨迹判据);
  • 输入为用户自己的数据,推荐即实测结果;
  • 组合空间逾千,无公认默认 → 系统筛选后按目标导航(ANPELA)。

质谱单细胞:共识 + 横评

  • 链长:检索 + FDR + 八步主干(4.3);
  • 单步昂贵(数十万行 PSM 证据);
  • 指标半自动,需人审(鉴定数、CV、缺失);
  • 输出为共识主干+关键阈值的敏感性检验(4.3);
  • 空间小而有先验 → 标准化主干(scp 包)+ 工具横评(5.2)。

两条路线在方法论上正在合流。质谱一侧的基准评测(5.2)同样把"工具组合"当作评价单元;scp 包主干虽已固化,关键阈值仍要求做敏感性检验(4.3;Gatto et al., 2023)——相当于在很小的邻域内做局部导航。反过来,ANPELA 的 Ca–Cd 与质谱一侧的鉴定数、定量精度、缺失率,是同一件事在不同数据类型上的投影:都要先回答"什么叫处理好",再把答案写成可计算的式子。评估方法论是共同的骨架,数据类型只决定指标的具体形态。

5.3.4 指标即价值观:推荐是目标条件化的

指标清单读起来像客观的尺子,实际上每一条都是一种价值观——它先行声明了"什么叫处理得好"。在肿瘤样本里找占比不足百分之一的稀有亚群,最怕的是小群体被并进大簇,主指标应取 Cd(守住已知稀有类型的边界),辅以 Ca(F1 对少数类的召回敏感);Cb 反而要警惕——一味追求簇内紧致,算法倾向于合并小簇。

对健康供体做免疫群体结构概览,看重的是整体拓扑的稳定与可解释,Cb 与 Cc(标志物一致)更要紧,Cd 的权重可以放低,因为先验标注本就覆盖不全。做分化过程的研究则以轨迹指标为主。目标不同,同一组合在榜单上的位置就随之不同。

Cb 一类内部指标的计算方式值得看一眼。以轮廓系数(silhouette coefficient)为例(式 5.3-2):它把一个事件的"与自家簇的贴合程度"和"与最近邻簇的分离程度"放进同一把尺,无须真值标注即可计算——这正是它得以进入自动打分清单的原因。

s(i) = ( bi − ai ) / max( ai, bi )
(5.3-2)ai 为事件 i 与同簇其余事件的平均距离(贴合度),bi 为 i 到最近邻簇各事件的平均距离(分离度);s(i) ∈ (−1, 1],越接近 1 簇结构越清晰。对全部事件取均值,即得 Cb 的一项内部得分。距离定义在变换后的空间上——这又回到 5.3.6 要讲的变换先行地位。
表 5.3-2研究目标与指标权重的对照(示例性建议,权重应随实验设计调整)
研究目标主指标辅助指标主要风险
稀有亚群检出(如肿瘤浸润免疫细胞)Cd 先验一致性Ca 分类精度小簇并入大簇;紧致度权重过高会加重此风险
群体结构概览(如健康供体分型)Cb 聚类紧致度Cc 标志物稳健性拓扑不稳定、跨批次不可重复
标志物发现与验证Cc 标志物稳健性Cd 先验一致性标志物随流程漂移,结论不可迁移
分化与过程研究轨迹平滑度(PTI)子采样稳健性轨迹实为变换或聚类伪影
方法学比较与流程定版按下游目标另定多项并列,看前沿压成单一总分,掩盖指标间取舍

读这张表的正确方式不是查表取数,而是照着它写一段自己的论证:先陈述研究目标,再指认主指标与其风险,最后说明辅助指标如何兜住这个风险。表 5.3-2 的每一条都能还原成这样的三句话——推荐于是有了可辩护的理由,而不是黑箱的输出。

这也是流程推荐与"跑分排行"的分野。多项指标彼消此长:紧致度与稳健性常不同时取最大,把各指标压成一个总分会抹平取舍。严谨的做法是保留指标向量,让用户按目标赋权——多目标权衡下没有全胜者,只有帕累托前沿(Pareto frontier):不再能同时改进任何一项指标的那组组合(图 5.3-2 右)。

这与 5.2 的经验同源:DIA 横评的结论同样是"按场景给推荐"。推荐因而是目标条件化的(goal-conditional)——先声明下游目标,再谈流程好坏。

警示

没有普适最优流程。三层含义:①默认流程只是组合空间中的一点,换一批数据、换一个目标,它的表现没有任何保证;②单一总分会掩盖指标间的取舍,读榜单要看分项,而非只看名次;③指标最优不等于生物学正确——打分体系之外,分群是否合理、标志物是否讲得通,仍要靠领域知识复核。把"推荐"当证据,不要当裁决。

习题 5.3-3

设两项研究目标:A,在肿瘤样本中寻找稀有免疫亚群(占比可能不足 1%);B,对健康供体外周血做免疫细胞群体结构概览。请各从 Ca–Cd 中选出一条主指标与一条辅助指标,并论证理由;再说明为何不应只看总分排名。

参考解答

A:主 Cd——稀有亚群研究的头等风险是小群体并入大簇,守住已知稀有类型的边界是底线;辅 Ca——F1 与 AUC 对少数类的召回敏感,能直接考核稀有群体是否保住。Cb 只作参考:过度追求紧致反而诱发小簇合并。B:主 Cb——概览关心整体拓扑的紧致与稳定;辅 Cc——标志物一致保证分群可解释、可跨批次重复;Cd 权重可降低,因健康供体的先验标注不全。至于总分:四条指标彼消此长,加权方式本身就是一次目标选择;只看名次等于把"什么重要"的决定权让给了默认权重——与目标条件化的原则相悖。

习题 5.3-4

七个候选组合在两项指标上的得分如下(越高越好):P1 (0.72, 0.45)、P2 (0.60, 0.55)、P3 (0.68, 0.52)、P4 (0.55, 0.60)、P5 (0.75, 0.58)、P6 (0.62, 0.40)、P7 (0.70, 0.62)。(a)求帕累托前沿;(b)按权重 (0.7, 0.3) 算加权总分排名;(c)换成权重 (0.3, 0.7) 再排一次;(d)比较两次排名与前沿的关系,说明"前沿不变、名次随权重翻转"的含义。

参考解答

(a)逐一检验支配关系:P5 与 P7 互不支配(P5 指标一更高,P7 指标二更高);其余五组都至少被两者之一全面压过——如 P5 支配 P1、P3、P6,P7 支配 P2、P4。前沿 = {P5, P7}。(b)加权分 P5 = 0.699、P7 = 0.676,P5 第一。(c)加权分 P5 = 0.631、P7 = 0.644,P7 反超第一。(d)权重变的是"把前沿上的哪个点排第一",变不出前沿之外的新冠军——被支配的组合无论怎么加权都上不来。这就是看前沿优于看总分的原因:前沿由数据决定,名次由价值观决定;先把前者交还给数据,再把后者的选择权显式留在自己手里。

5.3.5 谱系:从免标记定量到流式蛋白组

ANPELA 与其说属于一篇论文,不如说属于一条方法学脉络。同一团队 2019 年即证明:免标记蛋白定量的精度、准确度与稳健性,可以靠优化"数据操作链"的取舍同时改进(Tang et al., 2019);2020 年的初版 ANPELA 把这套评测搬到宏蛋白组的免标记定量流程上(Tang et al., 2020);2023 年扩展到流式类单细胞蛋白定量,称可评逾 1,000 种组合(Zhang et al., 2023);2025 年的协议论文补齐了指标体系、导航逻辑与三种软件形态(Sun et al., 2025)。官网把流式类版本称作 ANPELA 2.0,以别于面向整体蛋白定量的初版。

一以贯之的思想只有一个:评价与优化的对象从"单步方法"升级为"整条链",组合本身成为研究单元。就此而言,本节与 5.2 讲的是同一件事的两个分支——前者为质谱路线选工具,后者为流式路线选组合,方法学内核都是基准评测。

谱系里还能读出一层连续性。2019 年那篇论文同时优化精度、准确度与稳健性三件事,已含多目标权衡的雏形;如今的 Ca–Cd 与轨迹判据,是把"好"字拆开写成可计算的分项。换言之,这条脉络里真正沉淀下来的不是某个工具实现,而是指标体系本身——软件可以重写,"什么叫处理好"的清单才是可迁移的知识。

5.3.6 实践清单:拿到一批流式/CyTOF 数据时

工具归工具,选流程前有几个问题只能由数据与实验设计来回答。

五个先行问题

  1. 有没有溢出要校正?荧光流式按单染对照估计溢出矩阵再做补偿;质谱流式按厂商提供的矩阵或实测估计。补偿处在链条最上游,不做,误差就乘法性地污染所有后续通道(见下方方法框)。
  2. 变换取什么系数?arcsinh 变换以协同因子 c 控制线性—对数过渡(式 5.3-3)。质谱流式的通行惯例 c = 5 源自 SPADE 的做法(Qiu et al., 2011);常规荧光流式常取更大的协同因子(如 150)以保留线性区。c 直接改变聚类所见的群体边界,值得做一档敏感性检查。
  3. 事件质控选哪个工具?flowAI 一类按采集时间剔除异常时段;碎片与双联体用事件长度、DNA 含量与活性通道判别(质谱流式的常规做法)。
  4. 归一化要不要微球?跨批次比较时,以内插微球的信号折算仪器漂移,把不同批次拉到同一尺度(Finck et al., 2013)。
  5. 聚类与轨迹选什么?前四问划出可行域,这一问交给组合导航:用 ANPELA 把逾千组合在这批数据上跑一遍,按研究目标读指标榜单,再对推荐组合做人工复核。
f(x) = arcsinh(x / c) = ln( x/c + √( (x/c)2 + 1 ) )
(5.3-3)c 为协同因子(cofactor)。小信号区 f(x) ≈ x/c,近线性;大信号区 f(x) ≈ ln(2x/c),近对数。c 越小,进入对数区越早,小值被相对抬得越高。质谱流式通行 c = 5(Qiu et al., 2011),荧光流式常取更大值(如 150)。
方法

补偿与变换的先行地位。补偿处在所有算子之前,是因为溢出是乘法性的通道间污染:一个通道的信号按固定比例串入其他通道,补偿不做,后续每一步都在被污染的数据上进行,且误差结构随变换发生不可逆的非线性放大。变换紧随其后,是因为它定下了数据的几何——距离、密度、聚类边界全部定义在变换后的空间里;协同因子 c 一变,同一批数据可能给出不同的群体边界。两者都在链条最上游,也都最值得先做敏感性检查,再谈下游选型。

最后是把 ANPELA 用成"预实验"而非"裁决":它给出的推荐是证据,不是结论。榜单解释不了的分群、与生物学常识相悖的标志物,都应回到人工审查。

把导航用作预实验

报告时写明所用流程、指标与权重——社区白皮书的报告义务同样适用于流式类数据(Gatto et al., 2023)。一份只写"经软件推荐"而不附流程细节的分析,等于把结论建立在不为人知的自由度之上。


本节以 ANPELA 为载体,把"选流程"当作可以正面研究的方法学问题:

  • 流式类数据处理是一条算子链,各步候选数连乘成逾千种组合(式 5.3-1),默认流程只是空间中的一点,无免费午餐;
  • ANPELA 把组合空间当作可枚举、可评估的对象:并行运行、多指标打分(Ca–Cd 与轨迹判据)、按目标排序导航——链短、计算便宜、指标全自动,是这套策略成立的三个条件;
  • 指标即价值观:推荐是目标条件化的,多目标下只有帕累托前沿,没有全胜者;质谱路线则因计算经济学不同而走向共识化主干与横评(4.3、5.2);
  • 实践次序:先答五个先行问题(补偿、变换系数、事件质控、微球归一化、任务出口),再用导航跑一遍组合,最后对推荐做人工复核与完整报告。

流式路线的答案是"导航";质谱路线的另一个前沿是把批次、缺失与建模一并交给表示学习——5.4 的 scPROTEIN。

关键术语

算子链 (operator chain)
数据处理各环节按固定次序串成的链;输出由整条链决定,评价单位应是链而非单步。
组合空间 (combinatorial space)
各环节候选方法的全部连乘组合(式 5.3-1)所构成的集合。
补偿 (compensation)
按溢出矩阵把串入各通道的信号折算扣除的校正步骤,处在链条最上游。
溢出 (spillover)
一个测量通道的信号泄漏进其他通道的现象,荧光与金属标签皆有。
arcsinh 变换 (arcsinh transformation)
以协同因子缩放后取反双曲正弦;小值近线性、大值近对数(式 5.3-3)。
协同因子 (cofactor)
arcsinh 变换的尺度参数 c,决定线性区与对数区的过渡点。
事件质控 (event-level quality control)
剔除碎片、双联体与采集异常时段事件的环节,候选工具四种。
微球校正 (bead-based normalization)
以内插微球信号折算仪器漂移、统一批次尺度的归一化方法。
拟时序 (pseudotime)
沿推断轨迹对细胞排序所得的次序变量,度量进程而非钟表时间。
真值 (ground truth)
独立可靠的参考标注,如已知的细胞类型标签。
无免费午餐 (no free lunch)
脱离数据分布与目标,不存在普适最优的算法或流程。
帕累托前沿 (Pareto frontier)
多目标下不再能同时改进任何一项指标的方案集合,推荐的可辩护边界。

参考文献与延伸阅读

  1. Sun H, Zhou Y, Jiang R, et al., Zhu F. 2025. Navigating the data processing for cytometry-based single-cell proteomics. Nature Protocols 21: 1235–1261.
  2. Zhang Y, Sun H, Lian X, Tang J, Zhu F. 2023. ANPELA: significantly enhanced quantification tool for cytometry-based single-cell proteomics. Advanced Science 10(15): e2207061.
  3. Tang J, Fu J, Wang Y, et al., Zhu F. 2019. Simultaneous improvement in the precision, accuracy, and robustness of label-free proteome quantification by optimizing data manipulation chains. Molecular & Cellular Proteomics 18(8): 1683–1699.
  4. Tang J, Fu J, Wang Y, et al., Zhu F. 2020. ANPELA: analysis and performance assessment of the label-free quantification workflow for metaproteomic studies. Briefings in Bioinformatics 21(2): 621–636.
  5. Bendall SC, Simonds EF, Qiu P, et al. 2011. Single-cell mass cytometry of differential immune and drug responses across a human hematopoietic continuum. Science 332: 687–696.
  6. Qiu P, Simmonds EF, Qiu P, Simonds EF, Bendall SC, et al. 2011. Extracting a cellular hierarchy from high-dimensional cytometry data with SPADE. Nature Biotechnology 29: 886–891.
  7. Finck R, Simonds EF, Jager A, et al. 2013. Normalization of mass cytometry data with bead standards. Cytometry Part A 83(5): 483–494.
  8. Wang J, Huang Y, Fang Q. 2025. Benchmarking informatics workflows for data-independent acquisition single-cell proteomics. Nature Communications 16.
  9. Grégoire S, Vanderaa C, Gatto L. 2024. Standardized workflow for mass-spectrometry-based single-cell proteomics data processing and analysis using the scp package. Methods in Molecular Biology 2817: 177–.
  10. Gomoryova K, Hecht H. 2025. Single cell proteomics data analysis with bioconductor-scp. Galaxy Training, training.galaxyproject.org.
  11. Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
  12. ANPELA 官网(IDRB Lab,浙江大学):idrblab.cn/anpela(组合空间构成与指标口径,2026-08 查阅)。