第5章

第5章 统计分析、基准评测与前沿

Statistical Analysis, Benchmarking and Frontiers
本章摘要 拿到蛋白矩阵之后,问题才真正开始:降维聚类怎么做才可信,差异丰度怎么检验才不夸大,信息学流程与实验方法凭什么说孰优孰劣。本章依次讨论下游统计、DIA 流程基准评测、流程导航工具 ANPELA、深度学习方法 scPROTEIN,再以掺入与重复实验为试金石讨论评估方法论,最后走向临床转化,并给出社区、数据与上手路径的资源地图。

前四章的终点是一张矩阵;第五章的起点是"这张矩阵能支撑什么结论"。单细胞蛋白数据高度缺失、批次密布、每批仅几十个细胞,直接套用转录组成熟工具会踩中每一个坑。统计分析的第一课是认清数据的局限,而不是急着跑通量代码。

另一条主线是"评估"。2023 年社区白皮书给出实验与报告规范,2025 年两项工作分别把信息学流程(DIA 横评)与数据处理流程(ANPELA)的选择建立在系统评测之上;与此同时,深度学习(scPROTEIN)试图把批次校正与缺失填补并入一个嵌入模型。方法越多,评估越重要——这是本章想传递的核心判断。

5.1
从矩阵到生物学:降维、聚类与差异丰度
主成分与统一流形逼近的适用性;差异丰度检验的零膨胀与多重检验陷阱。
5.2
基准评测:DIA 信息学流程横评
评测框架设计:工具组合、指标体系与推荐结论;如何读一篇基准论文。
5.3
ANPELA:数据处理流程的导航
三千余种流程组合的大规模筛选;流式类数据处理的要素清单与选流程的逻辑。
5.4
scPROTEIN:深度学习统一嵌入
肽段不确定性的异方差刻画;图对比学习把批次与缺失并入同一表示。
5.5
评估的试金石:掺入、稀释与重复
社区白皮书的实验设计建议;掺入、稀释系列与重复实验各自验证什么。
5.6
走向临床:肿瘤微环境与稀有细胞
临床样本天然微量;肿瘤异质性、免疫治疗响应与循环肿瘤细胞的可行案例。
5.7
资源地图:社区、数据与上手路径
资源站、社区规范与公开数据;从零到跑通第一条分析流程的路径。