第1章

第1章 从药物发现到分子机器学习

From Drug Discovery to Molecular Machine Learning
本章摘要 分子机器学习不是“用计算机跑化学”,而是一门关于如何把化学对象与化学问题翻译成数据、再让算法从中学习的学问。本章先看药物研发真实的困难,再建立全书最重要的两个直觉:表示决定模型的上限,评估决定结论的可信度。

新药从实验室走到药房,平均要十年以上,耗资以十亿美元计,而进入临床的候选分子十不存一。机器学习承诺缓解的,正是这条漏斗里最昂贵的环节:用计算代替一部分合成与试验,把搜索空间从天文数字压到可以操作的范围。

但工具不是魔法。本章把“机器学习能为药物发现做什么”拆成三件看得见的事——预测分子性质、检索相似分子、从头生成新分子,并交代全书反复出现的两条主线:分子如何被表示成数据,实验结果凭什么可信。前者由第二章的 RDKit 铺地基,后者贯穿第三、四章的 DeepChem 与 TorchDrug。

1.1
药物发现的漏斗:为什么又慢又贵
研发周期、成本与失败率的量级;从靶点到上市的完整链条;机器学习切入的四个环节及其边界。
1.2
分子的三种面貌:字符串、指纹与图
SMILES、分子指纹与分子图三种表示的哲学差异与适用场景;为什么“表示”决定模型的上限。
1.3
数据与评估:MoleculeNet 与骨架划分
公开基准数据集全景;随机划分为何给出虚高的成绩;骨架划分与更严格的评估协议。