第5章 · 5.7

5.7 资源地图:社区、数据与上手路径

A Map of Resources: Community, Data and Getting Started
摘要 单细胞蛋白组学的资源散落在方法论文、社区规范与教学平台之中,初学者难以按图索骥。本节把领域资源组织为源头站、规范层与教学层三级结构,梳理 Slavov Lab 资源站、社区白皮书、软件生态与公开数据各自解决的问题与用法,给出四步上手路径与自测要点,并以五条主线收束全书。

5.7.1 资源的三层结构:源头、规范与教学

方法讲完之后,剩下一件实事:把散落的资源组织成一张可以按图索骥的地图。本领域的资源并不少——方法论文、制备协议、公开数据、软件工具、教程讲义、会议报告——难处在于它们分属不同机构、更新节奏各异,初学者面对的不是匮乏而是无序。

整理的办法是按"回答什么问题"给资源分层。资源站(resource site)构成源头层,回答"发生了什么":方法团队的站点汇集方法专页、协议、数据与工具,是可核验事实的出处。社区白皮书(white paper)与配套指南构成规范层,回答"怎样才算做好":它们把分散的经验固化为可逐项检查的条目。教程、课程与会议录像构成教学层,回答"如何上手":它们把前两层翻译成可以跟做的练习(图 5.7-1)。

三层之间的基本关系是单向供给、人员回流:源头层产出参考实现,规范层把实现沉淀为共识,教学层把共识传播出去;而教学层的新来者,一部分会成长为源头层的贡献者与规范层的修订者——这解释了领域资源何以更新极快而不散架。使用时照此定位:查事实回源头,验设计对照规范,学操作进教学;把博客教程当方法依据、把某篇论文的参数当社区共识,是初学者最常见的误用。

资源的三层结构:源头层提供事实,规范层沉淀共识,教学层负责传播,人员自下而上回流 资源的三层结构:源头、规范与教学 ① 源头层 事实与实现 ② 规范层 共识与治理 ③ 教学层 传播与入门 代表:Slavov Lab 资源站 代表:2023 年白皮书 代表:Galaxy 教程 · scp 文档 方法页 制备协议 数据集 计算工具 同一方法的论文、协议、数据与工具相互链接、版本同步 实验设计 质量控制 报告清单 白皮书与配套指南:把经验固化为可核对的条目 图形化教程 课程与讲义 会议录像 Galaxy 教程 · scp 文档 · single-cell.net 会议报告 沉淀:参考实现固化为共识 翻译:共识做成可跟做的练习 学员 → 用户 → 贡献者 三层各司其职:查事实回源头,验设计对照规范,学操作进教学。 箭头:橙色为内容供给(自上而下),灰色为人员回流(自下而上)。
图 5.7-1 资源的三层结构。源头层(资源站)提供可核验的事实与参考实现,规范层(白皮书与配套指南)把它们固化为可逐项检查的共识条目,教学层(教程、课程与会议录像)再把共识翻译成可跟做的练习;右侧回流箭头表示教学层的新来者逐步成长为源头层的贡献者与规范层的修订者。

5.7.2 源头站:一个实验室的公共品

目前覆盖最完整的一站式源头,是 Slavov Lab 维护的资源站(scp.slavovlab.net)。它按方法组织内容:SCoPE-MS、SCoPE2、plexDIA、pSCoPE 与 timePlex 各有专页,论文、协议、数据与代码相互链接;数据集给出公共库编号,计算工具开源可查。自等压载体路线确立(Budnik et al., 2018)以来,方法迭代的关键环节几乎都能在此找到对应版本,后来者不必从论文的字缝里逆向拼装流程。

制备协议是资源站最实用的部分:mPOP 与 nPOP 以带版本的步骤清单发布,随方法迭代更新。使用协议先看版本号与日期,再看对应哪篇论文,最后才看步骤——同一方法的不同版本,通量与制备规模可能相去甚远(Leduc et al., 2024)。

注记

一个实验室的公共品。资源站的价值不在"多",而在"配套":同一方法的论文、协议、数据与工具相互链接、版本同步,任何一环更新都能追到其余各环。评价任何资源站,可用同一把尺子:

  • 协议是否注明版本与日期;
  • 数据是否给出公共库编号;
  • 工具是否开源且结果可复现。

三问皆能回答的站点,才值得作为流程的锚点;答不上来的,至多算线索。

第二个源头型入口是社区站点 single-cell.net:它与白皮书配套维护实验指南,并系统整理会议报告的录像。报告人多为方法原作者,一场报告对方法现状与局限的呈现,常快于也诚于一篇综述——尤其是那些没有写进论文的实操细节。

看报告不妨带着评估的框架(5.5 节):性能数字是在什么样品、什么通量、什么评测口径下给出的,逐项落实之后再决定是否采信。

5.7.3 规范层:白皮书与指南

2023 年,数十位研究者以社区白皮书的形式给出单细胞蛋白组学实验的初步建议(Gatto et al., 2023),配套指南网站把条目做成可逐项核对的清单。内容大体是三件套:

  • 实验设计——多重标记(multiplexing)的载体量如何选、对照与重复如何安排、通道如何分配;
  • 质量控制——监控哪些指标、异常的判据是什么;
  • 报告清单(reporting checklist)——一篇论文披露哪些参数与指标,读者才能复核结论。

三件套环环相扣:设计决定能控什么,质控决定知什么,报告决定别人能查什么。规范层的性质是领域的自我治理,而非额外的负担。

单细胞质谱实验成本高、自由度多,若各家只报告自己愿意报告的部分,领域将无法积累可比的知识。白皮书以"最低披露"换取"可比性",这是小领域在高噪声阶段维系信任成本最低的方式。

对研究者的实际含义有两条:

  • 投稿与评审日益期待按清单报告,缺项会直接削弱论文的可信度;
  • 引用与遵循规范是进入领域的入场券:不按共识口径报告的工作,难以进入他人的基准评测,也难以被引为对照(5.5 节)。
习题 5.7-1

白皮书的三件套(实验设计、质量控制、报告)各含若干具体条目。若只能挑五条对单细胞蛋白组学研究最要紧的条目,你会挑哪五条?逐条给出一句话理由。

参考解答

一种可辩护的挑法:

  • 载体量与多重标记设计——多重标记是当前通量与深度的杠杆,载体量直接决定比值定量的质量;
  • 通道级 QC 指标(中位 CV、SCR 分布)——单细胞数据的成败只能在通道一级判断,事后无从弥补;
  • 空白与参考通道的设置——残留污染本底与跨 run 比对的基准都必须设计在前;
  • 缺失值处理方式的全链条披露——缺失机制影响结论解释,填补方式不同结果可以漂移;
  • 原始数据与处理参数的公开(公共库编号与脚本)——没有原始数据,任何报告口径都无法复核。

答案不唯一,判据是:该条目是否"无法事后补救"且"直接决定定量可信度"。

5.7.4 软件生态:工具在流程中的位置

软件资源同样按"在链条中的位置"记忆,而不是按名气。定量前端是谱图检索与定量引擎:DIA 类采集(含 plexDIA)的常用引擎 DIA-NN 输出证据表(evidence table),作为下游分析的输入(5.2 节)。

中游主干有两条并行实现。Bioconductor 的 scp/QFeatures 生态以 R 脚本组织从证据表到蛋白矩阵的全流程,可版本控制、可审计,适合作为严肃分析的主干(4.2 节)。

Galaxy 把同一套八步逻辑封装为图形化流程,零代码门槛,适合教学与快速试算(4.3 节;Gomoryova and Hecht, 2025;Grégoire et al., 2024)。

下游与侧翼另有三个代表:scplainer 以线性模型做差异丰度分析(Vanderaa and Gatto, 2025;5.1 节);ANPELA 为流式类方法导航数据处理流程的选择(Sun et al., 2025;5.3 节);scPROTEIN 以图对比学习得到细胞嵌入,统一处理批次与缺失(Li et al., 2024;5.4 节)。

表 5.7-1 汇总各工具的环节归属。

表 5.7-1软件生态速览:各工具在数据处理链条中的位置
工具所处环节语言或入口详见
DIA-NN 等定量引擎定量前端:谱图检索与报告离子定量(PSM → 肽段)本地程序(含 plexDIA 模块)5.2 节
scp / QFeatures全链条:证据表 → 蛋白矩阵 → 建模R(Bioconductor,脚本化)4.2 节4.3 节
Galaxy 图形化流程全链条:同一八步逻辑的零代码入口浏览器(图形界面)4.3 节
scplainer下游:线性模型的差异丰度分析R(scp 生态)5.1 节
ANPELA侧翼:流式类数据处理流程的导航与选优网页平台5.3 节
scPROTEIN下游:图对比学习的细胞嵌入,统一处理批次与缺失Python(开源仓库)5.4 节

入口的选择判据只有两条:要复现还是要探索,用一次还是要长期用。把已固化的流程完整走一遍,Galaxy 足矣;要改动步骤、比较参数或纳入版本管理,脚本入口不可替代。两条入口共享同一套方法学逻辑,迁移的是操作习惯而非概念体系。

案例

Galaxy 教程的入口价值。Galaxy 教程用 SCoPE2 的教学子集(teaching subset)——4 个 run、每 run 16 个 TMT 通道,证据表 1,362 行 × 150 列——把八步流程做成网页上可点击的练习(Gomoryova and Hecht, 2025)。不装环境、不写代码,几个小时就能把 4.3 节的每一步过手一遍。

它的价值不在替代脚本分析,而在把"流程的形状"变成操作记忆:此后再读 scp 包的文档,每个函数的用途都有了着落。零代码入口降低的是第一次的门槛,而不是专业分析的上限。

5.7.5 数据层:公开数据与三样必看

三层结构最终落在数据上。方法论文的配套数据是最直接的起点:SCoPE2 的原始谱图与定量表随论文公开(Specht et al., 2021),全量数据覆盖 1,490 个单核/巨噬样细胞、3,042 种蛋白。

Galaxy 教程从中裁出教学子集——4 个 run、证据表 1,362 行 × 150 列——数小时可跑完(Gomoryova and Hecht, 2025)。

其二是公共数据仓库(public data repository):本领域的单细胞数据集大多归档于 PRIDE 与 MassIVE,以编号检索即可获得原始谱图与定量表。白皮书也要求论文关联这些编号——编号是声明与数据之间的合同,没有它,任何结论都无从回溯。

数据在手,格式只有三种要认:

  • mzML——质谱谱图的标准交换格式,承载原始信号;
  • 证据表——检索与定量的输出,行是 PSM 或肽段,列是通道与各项打分;
  • 样品注释表(sample annotation table)——记录每个通道的身份:细胞类型、处理、批次、载体/参考/空白。

三者以通道名或文件名对齐。注释表最常被轻视,也最致命:没有它,通道的身份与批次归属无从判断,4.3 节按通道身份设计的过滤与批次校正便都无从谈起。

方法

拿到数据先看三样。定量矩阵——行列各是什么、缺失率高不高、强度跨几个量级;注释表——每个通道的身份、处理与批次归属;QC 指标——每 run 规模、SCR 分布、各通道的中位 CV。三样看全,才谈得上判断这批数据适合回答什么问题、默认阈值是否需要按分布调整。顺序上先注释后矩阵:先知道"测的是谁",再讨论"测得怎么样"。

习题 5.7-2

你从公共库下载到一批 SCoPE2 风格的数据,含 mzML 谱图、证据定量表与样品注释表三份文件。上手先看什么?每一样各回答什么问题?

参考解答

先看注释表:每个通道的身份(细胞类型、处理、载体/参考/空白)与批次归属,它决定数据能回答什么问题。再看定量矩阵的形状与分布:行列规模、缺失率、强度量级,它决定能用什么方法处理。最后看 QC 指标:每 run 规模、SCR 与中位 CV 的分布,它决定哪些通道与 run 需要剔除。mzML 原始谱图除非要重新检索,否则最后再看。次序不可颠倒——先弄清"测的是谁",再评价"测得怎么样"。

5.7.6 上手路径:四步与自测

把上述资源串成一条路径,可概括为四步(图 5.7-2)。每一步都有明确的材料与自测判据:自测答不上来,说明该步目标未成。

第一步:建框架

读入门综述与方法学讲座(Lin et al., 2024;Slavov, 2026),目标是搭起本书前三章那样的概念框架,而非记住性能数字。

第二步:过手

在 Galaxy 教程的教学子集上把八步流程完整跑一遍,把 4.3 节的每一步从文字变成操作;产物是手感——每一步的输入输出长什么样。

第三步:对标

从学习者换成设计者:用白皮书的清单逐项检查自己的实验设计,补上缺项(Gatto et al., 2023)。这一步最好在采集之前完成——设计与通道分配一旦定型,多数缺项便无从弥补。

第四步:跟前沿

进入常态:跟进会议报告与预印本(preprint),把每个新方法定位到链条的具体环节。

两个追问常看常新:它改的是制备、采集还是计算;它的评测是否使用真值或合理的替代指标。

上手路径四步阶梯:建框架、过手、对标、跟前沿,每步配两道自测问题 上手路径的四步阶梯:每步配自测 入门 前沿 第一步 · 建框架 读入门综述与方法学讲座 (Lin et al., 2024;Slavov, 2026) 自测① 为何直接测蛋白而非由转录本推断? 自测② 亲和与质谱两条路线各适合什么问题? 第二步 · 过手 在 Galaxy 教程的 SCoPE2 教学子集上 复现 4.3 节的八步流程 自测① 每一步消除哪一类技术差异? 自测② 中位 CV 阈值 0.65 的依据是什么? 第三步 · 对标 用 2023 年白皮书的清单逐项检查自己的实验设计 自测① 设计缺了哪几项?对照与重复如何安排? 自测② 发布前备好哪些 QC 指标与参数记录? 第四步 · 跟前沿 跟进会议报告与预印本,把新方法定位到链条的具体环节 自测① 新方法改进的是制备、采集还是计算? 自测② 其评测是否使用真值或合理的替代指标? 阶梯自下而上:先通过本步自测,再进入下一步。
图 5.7-2 上手路径的四步阶梯。第一步以入门综述与讲座建立框架(Lin et al., 2024;Slavov, 2026),第二步在 Galaxy 教程的教学子集上把八步流程过手(Gomoryova and Hecht, 2025),第三步用白皮书清单对照自己的设计(Gatto et al., 2023),第四步跟进会议与预印本、以评估框架审视新方法(Sinn and Demichev, 2025)。每步配两道自测问题:自测通过,方进入下一步。

自测比进度重要。综述读罢仍答不出"为何直接测蛋白",等于没读;教程跑完仍说不清"每步消除什么差异",只是点了一遍鼠标。

时间尺度上,前两步脱产一周可成,第三步与项目设计同步,第四步没有终点——采集深度与通量仍在快速推移(Sinn and Demichev, 2025),停在某一阶的认知会过期,四步循环不会。

习题 5.7-3

三位读者的目标各不相同:

  • (a) 为少量原代 T 细胞做深度蛋白图谱;
  • (b) 在已有 CITE-seq 数据上补充蛋白层面的验证;
  • (c) 评估市售 DIA 试剂在单细胞通量下的表现。

为每人配一条最小学习路径:读什么、跑什么、对照什么。

参考解答

(a) 质谱深度路线:读 nPOP 协议与 SCoPE2/plexDIA 方法页,明确制备方案与载体设计;跑 Galaxy 教程建立处理框架;对照白皮书的实验设计条目确定载体量与通道分配。

(b) 亲和路线为主:读第 3 章的 CITE-seq 与质谱流式比较,重点在抗体面板设计、注释一致性与联合分析;质谱一侧只需读入门综述,了解覆盖深度的量级即可。

(c) 基准评测视角:读 5.2 节的 DIA 基准评测与白皮书报告清单,用公开数据复现一条已发表流程作为参照,再按 5.5 节的框架设计指标与真值替代。三人路径只在第一步重叠——资源地图的意义正在于按目标裁剪,而非人人通读。

5.7.7 中文资源一瞥

中文资源大体三类:厂商与实验室开设的培训班、高校的相关课程、技术社区的分享与专栏。定位清楚:入门友好。培训班能让人在仪器与试剂的实物面前把名词体系立起来,对初次接触质谱的读者,这是英文材料替代不了的降门槛作用。

局限同样清楚:领域以月为单位更新,中文材料的滞后以年计;部分术语口径与通行译名不一致——比如把 pipeline 译作"管道"——参数转述偶有失真。一句结论:中文材料适合建立第一印象;要写进论文或流程的口径,回到源头层的原始文献核对。

警示

中文资料的口径核查。三条实务:

  • 译名——以原始文献与通行译名为准,中转材料只作理解辅助;
  • 参数——阈值、通量、鉴定深度等数字必须回查原始论文或协议的对应版本,转述不算数;
  • 出处——教程类材料应注明数据来源与撰写日期,无出处的结论不作为流程依据。

5.7.8 结语:五条主线

全书至此收束。五章的内容可以压缩成五句话:

  • 测量对象:蛋白不是转录本的影子,丰度、修饰与 proteoform 层面的细胞间异质性只能直接测量(第1章);
  • 路线选择:亲和路线成熟而通量高,但蛋白面板有限;质谱路线无偏、可发现新分子,深度与稳健仍在演进——二者互补而非替代(第2章第3章);
  • 微量物理:每个细胞约 100–200 pg 蛋白,一切制备环节都被推向纳升级与吸附极限,样品制备本身就是方法(第2章);
  • 数据纪律:过滤、聚合、归一化、校正的次序各有统计理由,跳步或换序,技术差异就会冒充生物学差异(第4章);
  • 评估文化:真值(ground truth)稀缺,基准评测与按清单的完整报告是领域自我纠错的机制(第5章)。

领域仍在快跑:新的采集模式、更深的覆盖、更高的通量接连出现。但五条不随方法更替而过时——它们不是某一代方法的参数,而是从方法细节里沉淀下来的判断力。资源地图的终点也不是收藏夹,而是判断力本身:事实在哪里查、规范在哪里对、操作在哪里学;剩下的,是把自己的问题放进这张地图。


这张地图收在本节,也收在全书的末尾:概念在前三章,数据纪律在第四章,评估与前沿在本章——往回翻是地图,往前走是问题。

关键术语

资源站 (resource site)
维护方法、协议、数据与工具并保持相互链接与版本同步的站点。
白皮书 (white paper)
社区就实验设计、质量控制与报告达成的共识文件。
报告清单 (reporting checklist)
论文应披露的参数与指标列表,用于复核与积累可比知识。
公共数据仓库 (public data repository)
归档原始谱图与定量结果的公共平台,如 PRIDE 与 MassIVE。
公共库编号 (accession)
数据集在公共仓库中的唯一标识,论文据此关联原始数据。
证据表 (evidence table)
检索与定量的输出表,行为 PSM 或肽段,列为通道与各项打分。
样品注释表 (sample annotation table)
记录每个通道身份、处理与批次归属的表。
教学子集 (teaching subset)
从公开数据裁剪出的、数小时可跑完的小规模练习数据。
多重标记 (multiplexing)
以同位素或质量标签把多个样品并入一次采集的设计,通量的主要杠杆。
预印本 (preprint)
未经期刊评审的先行公开文稿,跟进前沿的主要渠道之一。
真值 (ground truth)
评估用的可靠参照;单细胞蛋白组学中稀缺,常以替代指标逼近。

参考文献与延伸阅读

  1. Gatto L, Aebersold R, Slavov N, et al. 2023. Initial recommendations for performing, benchmarking and reporting single-cell proteomics experiments. Nature Methods 20: 375–386.
  2. Slavov Lab 单细胞蛋白组学资源站:scp.slavovlab.net(方法页、mPOP/nPOP 协议、数据集与计算工具,2026-08 查阅)。
  3. single-cell.net:社区实验指南(guidelines)与会议报告录像(2026-08 查阅)。
  4. Gomoryova K, Hecht H. 2025. Single cell proteomics data analysis with bioconductor-scp. Galaxy Training, training.galaxyproject.org.
  5. Vanderaa C, Gatto L. scp 包文档与教程(Bioconductor,UCLouvain):uclouvain-cbio.github.io/scp/.
  6. Grégoire S, Vanderaa C, Gatto L. 2024. Standardized workflow for mass-spectrometry-based single-cell proteomics data processing and analysis using the scp package. Methods in Molecular Biology 2817: 177–.
  7. Lin HJL, Webber KGI, Nwosu AJ, Kelly RT. 2024. Review and practical guide for getting started with single-cell proteomics. Proteomics 25(1–2): e202400021.
  8. Slavov N. 2026. Single-cell proteomic technologies. Annual Review of Biophysics.
  9. Specht H, Emmott E, Petelski AA, Huffman RG, Perlman DH, Koller A, Slavov N. 2021. Single-cell proteomic and transcriptomic analysis of macrophage heterogeneity using SCoPE2. Genome Biology 22: 50.
  10. Budnik B, Levy E, Harmange G, Slavov N. 2018. SCoPE-MS: mass spectrometry of single mammalian cells quantifies proteome heterogeneity during cell differentiation. Genome Biology 19: 161.
  11. Leduc A, Huffman RG, Cantlon J, Khan S, Slavov N. 2024. Massively parallel sample preparation for multiplexed single-cell proteomics using nPOP. Nature Protocols.
  12. Sun H, Zhou Y, Jiang R, et al., Zhu F. 2025. Navigating the data processing for cytometry-based single-cell proteomics. Nature Protocols 21: 1235–1261.
  13. ANPELA 平台(IDRB Lab,浙江大学):idrblab.cn/anpela(2026-08 查阅)。
  14. Li W, Yang F, Wang F, et al. 2024. scPROTEIN: a versatile deep graph contrastive learning framework for single-cell proteomics embedding. Nature Methods 21: 623–634.
  15. Vanderaa C, Gatto L. 2025. scplainer: using linear models to understand mass spectrometry-based single-cell proteomics data. Genome Biology 26: 237.
  16. Sinn LR, Demichev V. 2025. Entering the era of deep single-cell proteomics. Nature Methods 22: 459–460.