5.4.1 动机:分步修补的裂缝与嵌入思路
第四章把数据处理排成一条链:归一化统一尺度,填补补全矩阵,批次校正抹平 run 间偏移。链条上每一步只面对一类缺陷,各自携带一套假设与参数;前一步的输出是后一步的输入,估计误差随之在步骤之间传递——填补把不确定的估值当作事实固进矩阵,批次校正又在这些改写过的数值上估计偏移。4.4 节讲过填补的克制,4.6 节讲过"先校正再检验"怎样把校正误差带进下游检验。这类裂缝不是实现瑕疵,而是分步修补结构固有的属性。
换个角度看待这三类缺陷。肽段层测量质量参差不齐,是"同一蛋白的多次带噪测量,噪声水平各不相同";缺失高发,是"部分测量根本没有发生";批次偏移,是"同一群细胞因技术分组而整体移位"。三者性质不同,落到下游却造成同一后果:细胞之间的观测差异混入了与生物学无关的结构。5.3 节的 ANPELA 在既有流程组合的空间里导航选优,组合的原料仍是这些步骤;本节换一个问题——能否不逐项修补数据本身,而是学一个对三类缺陷同时稳健的低维表示,即嵌入(embedding),让下游任务都在表示上进行?
嵌入(embedding):把高维、含噪、含缺失的观测映射到一个低维连续空间(例如数十维的向量空间),使相似的细胞落在相邻位置的表示学习产物。嵌入只保留用于比较的结构信息,不还原任何蛋白的丰度数值。scPROTEIN 的名字即来自 single-cell proteomics embedding。
scPROTEIN 把这一设想落成两步(Li et al., 2024)。它由南开大学人工智能学院与腾讯 AI Lab 医疗团队联合开发,发表于 Nature Methods 2024 年第 21 卷 623–634 页,代码开源于 github.com/TencentAILabHealthcare/scPROTEIN。第一步用多任务异方差回归(multi-task heteroscedastic regression)把肽段整合到蛋白层,同时估计每条肽段的测量不确定度;第二步用图对比学习(graph contrastive learning)在蛋白层学出细胞嵌入。训练完成后,聚类、注释迁移、批次对齐与临床分组都从同一个嵌入出发。本节讲设计思想与适用边界,不是操作教程。
5.4.2 第一步:肽段到蛋白的异方差加权
4.1 与 4.3 节的蛋白聚合是固定规则:同一蛋白的肽段逐通道取中位数。中位数稳健、无需训练,但对所有肽段一视同仁——一条信号干净、跨细胞高度一致的肽段,与一条勉强检出的肽段,在聚合中地位相同。scPROTEIN 的第一步把同一蛋白的多条肽段看作多次带噪测量,且噪声水平因肽段而异:这就是异方差(heteroscedasticity)。
异方差(heteroscedasticity):各次测量的噪声方差互不相同的情形;方差处处相同则称同方差。单细胞蛋白定量中,离子化差的肽段噪声大、信号强的肽段噪声小,方差随肽段乃至强度变化,是典型的异方差场景。
模型用多任务回归同时输出两样东西:蛋白量的估计,以及每条肽段自己的测量方差 σ²。聚合按逆方差加权(inverse-variance weighting)进行(式 5.4-1):方差小的肽段权重大,方差大的权重小,低质量肽段自动靠边。与中位数聚合的对照由此清楚——一个是固定稳健规则,一个是可学习的加权。更重要的差别在于,不确定度不再藏在假设里,而是显式输出:蛋白层的每个估计都携带自己的方差,可以传给下游。
逆方差加权与中位数。两者都在回答"多次带噪测量如何并成一个数"。中位数不假设噪声结构、抗离群,规则固定、无需拟合;逆方差加权假设方差可估、按精度配权,在给定方差下达到最小估计方差,且天然输出不确定度。肽段较多、方差估计可靠时,加权的信息利用率高于中位数;肽段只有两三条、σ̂² 本身漂移时,中位数更稳。scPROTEIN 属于前一种情形——方差由回归模型在整个矩阵上学出,并非逐格估计。
习题 5.4-1
某蛋白在某细胞检出两条肽段,定量值(log2 尺度)y1 = 10.0、y2 = 13.0,异方差回归给出 σ̂1 = 1.0、σ̂2 = 3.0。(a)求逆方差加权平均。(b)与算术均值比较,解释差别。(c)若 σ̂2 = 10.0,加权结果趋向何处?
参考解答(a)权重为 1/1² = 1 与 1/3² = 1/9,归一化后 0.9 : 0.1;x̂ = 0.9×10.0 + 0.1×13.0 = 10.3。(b)算术均值为 11.5。高方差肽段的取值 13.0 虽然偏离更远,却只占一成权重,估计被拉向低噪声肽段的 10.0 一侧。(c)权重比变为 100 : 1,x̂ ≈ 100×10.0/101 + 1×13.0/101 ≈ 10.03,几乎完全由低噪声肽段决定——一条 σ̂ 极大的肽段即使数值离群,也几乎不再影响蛋白估计。这正是"低质量肽段自动靠边"的定量含义。
5.4.3 第二步:图对比学习得到细胞嵌入
第一步的产物是"细胞 × 蛋白(带不确定度)"的矩阵,三类缺陷还剩两个:缺失与批次。第二步不再修矩阵,而是学表示。先以细胞为节点建 k 近邻图(k-nearest neighbor graph):每个细胞与其表达谱最相近的 k 个细胞连边;再用图神经网络(graph neural network)编码——每个细胞的消息由邻居汇聚而来,单条边上的噪声被邻域平均稀释。
训练信号来自对比学习(contrastive learning)。把同一个细胞制备成两个视图:随机掩蔽一部分蛋白维度并施加小幅扰动——掩蔽恰好模拟了"部分测量没有发生"的缺失机制。两个视图互为正样本对(positive pair),其余细胞一律充当负样本。InfoNCE 类损失(式 5.4-2)的几何含义一句话可以说尽:在一批候选里,把正对的相似度顶到最高;相似度取余弦,锐度由温度参数(temperature parameter) τ 控制。
为什么这样学出的嵌入对批次不变?掩蔽与扰动是随机数据增广(data augmentation):同一细胞的两个视图承载着"应当不变的东西"——细胞类型与状态;批次是加在观测上的整体移位,不随增广同步变化。嵌入若跟着批次走,同细胞两视图就会被推远,损失立刻变大;训练于是把随批次摆动的成分挤出去。论文的口径更进一步:批次效应在 scPROTEIN 中得到隐式缓解,无需预先提供批次标签(Li et al., 2024)。这与 ComBat 形成对照——后者必须知道每个细胞属于哪个 run。便利的代价留到 5.4.6 再算:隐式校正意味着无法审计校正了多少,也无从确认有没有把生物学差异一并抹去。
习题 5.4-2
某锚细胞的嵌入与它正对视图的余弦相似度 s+ = 2,与同一小批两个负样本的相似度 s1 = 0、s2 = 1,温度 τ = 1。(a)求 InfoNCE 损失。(b)τ 降到 0.5 后损失变为多少?(c)解释 τ 在训练中的角色。
参考解答(a)分子 e² ≈ 7.389,分母 e² + e⁰ + e¹ ≈ 7.389 + 1 + 2.718 = 11.107,比值 ≈ 0.665,ℓ = −ln 0.665 ≈ 0.41。(b)τ = 0.5 时指数为 4、0、2:e⁴ ≈ 54.598,分母 ≈ 54.598 + 1 + 7.389 = 62.987,比值 ≈ 0.867,ℓ ≈ 0.14。(c)τ 缩放相似度进入指数的幅度:τ 小则 softmax 变锐,相似度的差距被放大,梯度集中于最难区分的负样本,负对被推得更开;τ 大则损失对负对宽容,嵌入容易塌缩。τ 因此是需要调度的超参数,而非可有可无的常数。
5.4.4 下游任务:一次学习,多处使用
嵌入是资产,训练一次,多个任务从同一组向量出发。聚类在嵌入空间进行,距离即相似度;注释迁移(label transfer)把已标注参考集的细胞类型映射到新数据——论文在 N2 与 nanoPOTS 两个数据集之间双向迁移,报告的准确率为 0.967 与 1.00(Li et al., 2024);批次对齐的可视化直接考察不同 run 的细胞在嵌入空间是否混匀;临床数据的分组分析(如肿瘤与对照样本的细胞构成比较)同样以嵌入为特征。
数据覆盖面同样说明问题。论文的评测横跨 SCoPE2 的两个变体、plexDIA、pSCoPE、N2、nanoPOTS 等质谱数据集,纳入一个以抗体衍生标签定量的 ECCITE-seq 数据集,并延伸到空间分辨的蛋白组数据:把组织切片上每个位点的蛋白谱当作一个"细胞",同一框架即可套用,论文据此展示肿瘤切片的空间异质性显著高于正常组织(Li et al., 2024)。跨平台、跨数据集的可用性正是"统一嵌入"的卖点——表示一旦学成,便与数据的测量方式解耦。
5.4.5 范式对照:分步修补与端到端嵌入
把 4.3 节的八步流程与 scPROTEIN 并排放,差异是范式性的。分步修补:每步一个目标、一套参数、一个可检查的中间产物——过滤后剩多少 PSM、归一化后列分布是否齐平、校正后批次 PCA 是否重叠,处处留痕;代价是误差沿链传递、各步目标各自为战。端到端(end-to-end):一次训练同时对付肽段噪声、缺失与批次,多目标在同一个损失里折中;代价是中间不可审计——网络内部没有"归一化后""校正后"的中间矩阵可查,结果异常时只能调超参数重训,而不是回头检查某一步。
| 维度 | 分步修补(第 4 章流程) | 端到端嵌入(scPROTEIN) |
|---|---|---|
| 缺陷处理 | 逐类修补:归一化管尺度、填补管缺失、ComBat 管批次 | 三类缺陷在一次训练中同时吸收 |
| 批次标签 | ComBat 需要每个细胞的批次归属 | 论文口径:隐式缓解,无需批次标签 |
| 中间量 | 每步产出可检查的中间矩阵 | 无中间矩阵可查,过程不可审计 |
| 输出 | 蛋白 × 细胞的完整定量矩阵 | 每个细胞的低维嵌入向量,不回填丰度 |
| 不确定度 | 隐含在各步假设中,不显式传递 | 第一步显式输出 σ̂²,可随估计下行 |
| 典型用途 | 需要蛋白值的定量比较(差异丰度等) | 多下游目标、跨数据集的细胞比较 |
| 失效模式 | 误差逐步固化;步骤间假设冲突 | 样本不足训练不稳;超参敏感;难归因 |
嵌入不是填补。scPROTEIN 的输出是每个细胞的低维向量,不是补全的"蛋白 × 细胞"矩阵。缺失的影响在训练中被吸收进表示,但任何缺失蛋白的丰度数值从未回填。凡结论落在"某蛋白在某群细胞是多少"的研究——差异丰度、通路定量、蛋白值的直接报告——仍须遵守 4.4 节的填补纪律:交代缺失机制、说明填补方法、报告敏感性。嵌入管比较,不管数值。
分工可以一句话概括:要"可审计的数值",走分步流程加 scplainer 的线性建模(Vanderaa and Gatto, 2025)——批次进入设计矩阵,每个蛋白有可读的系数与检验;要"跨数据集、多任务的细胞比较",嵌入是合理选择。两条路线将在 5.5 节的基准评测框架下同台比较,而不是凭印象取舍。
5.4.6 边界与批评性讨论
深度学习不是免费午餐,四个边界应写进使用决定。其一,数据量:对比学习靠大量负样本撑起判别信号,论文评测的数据集多为数百到数千个细胞;一次 run 的几十个细胞既不够训练,也撑不起调参。其二,超参数:k 近邻数、掩蔽率、温度 τ、网络深度与嵌入维度都影响结果,默认值来自论文的数据集,换一个体系未必仍优——这与 4.3 节的阈值敏感性是同一类问题,只是搜索空间更大。其三,可解释性:嵌入维度没有直接的生物学含义,要知道"哪几个蛋白把两类细胞分开",线性模型给出逐蛋白系数(scplainer 的路线),深度嵌入只能靠事后归因,而归因方法本身并不稳定。其四,评估依赖基准:聚类好坏用 ARI、NMI 一类指标衡量,指标需要真值标签,标签从哪来、指标是否奖励真实意义下的"好",正是 5.5 节的主题(Wang et al., 2025)。
何时值得上深度学习:多个下游目标共享同一表示、跨数据集或跨平台整合、缺失与批次确实严重到分步修补顾此失彼。何时不必:单一差异丰度问题、结论需要蛋白值本身、样本量小到训练不稳、监管与临床场景要求全程可审计。方法之间不比高下,只比与研究问题的匹配程度——这句话在 4.3 节说过,在这里同样成立。
习题 5.4-3
同一实验室测得两批 SCoPE2 数据,目标有二:(i)鉴定单核细胞与巨噬细胞之间的差异丰度蛋白并报告倍数变化;(ii)把已标注参考集的细胞类型注释迁移到新采集的 2,000 个细胞上。两问各应选 scPROTEIN 还是 scplainer 一类的经典路线?说明理由。
参考解答(i)结论落在蛋白值上,需要逐蛋白的效应量、检验与倍数变化,应选线性建模路线:批次以设计矩阵进入模型,而不是先校正再检验;scPROTEIN 的嵌入不回填丰度,回答不了"多少倍"。(ii)目标是细胞级分类且样本量足够,注释迁移正是 scPROTEIN 演示的用途:嵌入对缺失与批次稳健,跨数据集迁移是其强项。若两问都要做,两条路线可以并存——嵌入管注释,线性模型管定量,互不替代。
本节沿设计思想把 scPROTEIN 讲完,要点有三:
- 两步结构:多任务异方差回归以逆方差加权把肽段整合到蛋白层并显式输出不确定度(式 5.4-1),图对比学习以"同细胞两视图为正对、他细胞为负对"的 InfoNCE 训练(式 5.4-2)得到对缺失与批次稳健的嵌入;
- 范式定位:端到端嵌入一次训练吸收三类缺陷、多处使用,但中间不可审计、不回填丰度——需要蛋白值的研究仍走 4.4 的填补纪律;
- 边界:数据量、超参数、可解释性与评估基准四条约束决定何时值得上深度学习,何时经典线性路线更合适。
嵌入类方法的好坏最终要靠统一的评估框架裁决。5.5 节转入这一框架本身:真值从哪里来、指标衡量什么、一次合格的基准评测应当报告什么。
关键术语
- 嵌入 (embedding)
- 高维含噪观测到低维连续空间的映射,保留比较用的结构而不还原丰度。
- 异方差 (heteroscedasticity)
- 各次测量的噪声方差互不相同;肽段间测量精度参差即属此类。
- 逆方差加权 (inverse-variance weighting)
- 权重与方差成反比的合并估计,给定方差下估计方差最小。
- 对比学习 (contrastive learning)
- 以"拉近正对、推开负对"训练表示的判别式自监督学习。
- 图神经网络 (graph neural network)
- 沿图边汇聚邻居信息的网络;单节点噪声经邻域平均稀释。
- k 近邻图 (k-nearest neighbor graph)
- 每个细胞与其表达谱最相近的 k 个细胞连边构成的图。
- 数据增广 (data augmentation)
- 随机变换生成同一样本的变体;随机掩蔽天然模拟缺失机制。
- 正样本对 (positive pair)
- 同一细胞的两个增广视图,对比损失中被拉近的一对。
- 温度参数 (temperature parameter)
- InfoNCE 中缩放相似度、控制分布锐度与负对排斥力度的 τ。
- 注释迁移 (label transfer)
- 把参考集的细胞类型标注映射到新数据的过程。
- 端到端学习 (end-to-end learning)
- 从原始输入直接学到底层表示与任务输出,中间无人工步骤。
参考文献与延伸阅读
- Li W, Yang F, Wang F, Rong Y, Liu L, Wu B, Zhang H, Yao J. 2024. scPROTEIN: a versatile deep graph contrastive learning framework for single-cell proteomics embedding. Nature Methods 21: 623–634.
- Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
- Grégoire S, Vanderaa C, Gatto L. 2024. Standardized workflow for mass-spectrometry-based single-cell proteomics data processing and analysis using the scp package. Methods in Molecular Biology 2817: 177–.
- Vanderaa C, Gatto L. 2025. scplainer: using linear models to understand mass spectrometry-based single-cell proteomics data. Genome Biology 26: 237.
- Wang J, Huang Y, Fang Q. 2025. Benchmarking informatics workflows for data-independent acquisition single-cell proteomics. Nature Communications 16.
- Gutmann M, Hyvärinen A. 2010. Noise-contrastive estimation: a new estimation principle for unnormalized statistical models. Proceedings of AISTATS, PMLR 9: 297–304.
- van der Oord A, Li Y, Vinyals O. 2018. Representation learning with contrastive predictive coding. arXiv:1807.03748.
- Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.