NMI 2026 | JMM: 以“陌生度”拓展分子深度学习的化学空间边界

今天介绍的这项工作来自 Nature Machine Intelligence 。该研究聚焦分子机器学习在训练化学空间之外泛化能力不足的问题。现有模型通常能够准确预测与训练数据相似的化合物,但面对结构新颖的生物活性分子时,预测性能与可靠性往往明显下降,限制了其在新分子发现中的实际应用。该文章提出了一种联合分子模型JMM,将分子性质预测与分子结构重构整合到统一框架中,并根据模型重构输入分子的难度定义“陌生度”指标,用于衡量待测分子偏离训练化学空间的程度。通过30多个生物活性数据集的系统分析,结果表明,“陌生度”不仅能够有效识别分布外分子,还可以用于评估分类模型在不同化学空间中的预测性能。进一步针对两个具有临床意义的激酶开展虚拟筛选与湿实验验证,最终发现了7种具有低微摩尔活性、且与训练分子结构相似度较低的化合物。该方法为判断分子模型的适用域和预测可信度提供了新的依据,也为AI辅助发现结构多样的新型活性分子提供了具有实际价值的解决方案。

获取详情及资源:

0 摘要

分子机器学习模型往往难以泛化至训练数据覆盖范围之外的化学空间,从而限制了其对结构新颖生物活性分子进行可靠预测的能力。为提升机器学习突破训练化学空间“边缘”的能力,提出了一种将分子性质预测与分子重构相结合的联合建模方法。该方法进一步引入了基于重构的“陌生度”(unfamiliarity)指标,用于估计模型的泛化能力。通过对30多个生物活性数据集开展系统分析,结果表明,陌生度不仅能够有效识别分布外分子,还可以作为预测分类器性能的可靠指标。即使大规模分子库中存在显著的分布偏移,陌生度仍能提供稳健且具有实际意义的分子层面信息,而这些信息通常会被传统方法忽略。最后,针对两个具有临床意义的激酶,在湿实验中验证了基于陌生度的分子筛选策略,并发现了7种具有低微摩尔效力、且与训练分子相似度较低的化合物。结果表明,陌生度能够将机器学习的适用范围拓展至已探索化学空间的边缘之外,从而推动多样化、结构新颖分子的发现。

1 引言

分子机器学习正在药物早期发现中得到迅速应用。其中一个关键目标是在一个或多个药理靶点上识别新的生物活性分子,即“命中化合物”。在这一背景下,发现结构新颖的命中化合物对于满足尚未解决的治疗需求、确保商业可行性以及克服耐药性至关重要。然而,超越训练分子的结构特征,例如识别新的生物活性分子核心,对机器学习模型构成了重大挑战,因为模型在应用于分布外(out-of-distribution,OOD)分子时往往表现不佳。对于分子这类离散数据而言,这一问题尤为突出,因为它们很容易偏离模型训练期间学习到的数据分布。与此同时,具有高质量实验标注且结构多样的分子数据十分稀缺,生化实验的高成本和长周期进一步加剧了这一问题。因此,训练集通常仅包含数百个分子,而用于筛选的分子库可能包含数十亿种已存在但模型此前从未见过的化合物。由此产生的分布偏移,使利用机器学习发现结构新颖的命中化合物成为一项极具挑战性的任务。在这种情况下,量化模型在已探索化学空间“边缘”之外的预测可靠性具有重要潜力。

如何确保前瞻性命中化合物筛选中的预测可靠性,一直是该领域的重要研究方向。一种成熟的方法是定义适用域,即通过设定分子与训练数据相似度的阈值,划定能够进行可靠预测的化学空间。然而,这种方法未利用模型实际学习到的信息,并且由于依赖结构相似性,会限制结构新颖分子的发现。另一种广泛采用的方法是进行不确定性估计,即利用模型的预测置信度,通常通过概率建模技术实现。原则上,不确定性估计允许将结构新颖的分子纳入筛选,但模型在面对分布外样本时仍可能给出过度自信的预测。因此,如何对分布外分子作出可靠预测,仍是药物发现中分子机器学习面临的核心挑战之一。

为更有效地利用深度学习探索化学空间的“边缘”,同时评估分布外分子的预测可靠性,引入了生成式深度学习在从头分子设计中的最新进展,尤其是自编码器。自编码器可以将分子结构编码到低维潜在空间中,随后再将其解码并重构为原始形式。通过联合分子建模,同时训练深度学习模型执行分子性质预测任务,例如生物活性预测,以及输入分子重构任务。整个过程采用半监督学习方式,即同时利用有标注和无标注的分子数据进行学习。

这种联合学习方法不同于以往将自监督学习任务用于生成化学或提升预测性能的常见做法,而是直接利用分子重构能力作为分布外估计的代理指标。其核心假设是,重构效果较差的分子对模型而言更加陌生,说明它们更可能位于训练数据所学习分布之外。在此基础上,引入了“陌生度”(unfamiliarity)指标,用于表征模型对分子的重构能力,并量化该分子偏离训练分布的程度。

在涵盖33个具有实验标注的分子数据集的系统分析中,陌生度不仅能够稳健地表征分子分布偏移,还与分类器性能表现出较强相关性。陌生度识别结构多样且具有生物活性分子的能力进一步通过湿实验得到验证,并在两个激酶靶点上发现了多种具有低微摩尔活性的化合物。

总体而言,分子陌生度为估计模型泛化能力提供了一种具有明确依据的方法,即使存在分子分布偏移,仍能够用于评估模型表现。该方法为预测可靠性估计提供了新的视角,并可作为适用域和不确定性估计等既有方法的补充,从而更加准确、充分地指导结构新颖分子的发现。

图1|通过联合建模估计分子数据的陌生度。 a,适用域的概念示意图。化学空间中接近训练数据的分子位于模型的适用域内;位于该边界之外的分子则被视为分布外(OOD)分子。 b,JMM的架构通过分子的重构损失来估计该分子对模型而言有多“陌生”。 c,通过谱聚类将分子数据划分为分布内和分布外两组,从而人为引入分子分布偏移。图中展示的是食欲素受体2(Orexin receptor 2,OX2R)数据集的结果。CNN,卷积神经网络。RNN,循环神经网络。

2 结果

下文将详细介绍联合分子模型(joint molecular model,JMM),定义陌生度指标,并展示其量化分子分布偏移的能力。随后,将分子性质预测与分布偏移联系起来,并利用这种关系估计预测可靠性。最后,在虚拟筛选案例中应用陌生度指标对候选分子进行优先级排序,并通过湿实验完成验证。

2.1 陌生度与联合分子建模

JMM基于半监督自编码器构建,并借鉴了分子生成建模领域的经典工作。首先,使用简化分子线性输入规范(Simplified Molecular Input Line Entry System,SMILES)字符串表示分子,以文本形式编码分子拓扑结构以及原子和化学键类型。随后,利用一维卷积神经网络将SMILES字符串编码为压缩的潜在向量z。已有结果表明,这种表示能够有效捕获与生物活性相关的特征。接着,采用带有长短期记忆网络(long short-term memory,LSTM)的循环神经网络,将向量z以自监督方式解码并重构为原始输入表示。

编码器—解码器首先在ChEMBL约120万个未标注分子结构上进行预训练,该数据规模足以使模型学习SMILES字符串的“语法”。随后,利用各个带标注分子对模型进行微调,并将相同的潜在表示z输入近似贝叶斯分类器,用于预测分子性质,同时估计预测不确定性。分子重构与性质预测采用联合训练方式,以确保共享潜在空间同时捕获与两项任务相关的信息。

分子重构性能通过重构损失进行量化。该损失定义为SMILES字符串中所有词元负对数似然损失的总和,并按照SMILES词元长度进行归一化:

(1)Lreconstruction(x)=−1|x|∑i∈xlog⁡p(ti∣t<i),

其中,ti表示输入SMILES字符串x中的第i个非填充元素,即“词元”;|x|表示序列中非填充词元的数量。p(ti∣t<i)表示在给定序列中所有先前词元的条件下,解码器为下一个词元ti分配的概率。

根据重构损失,可进一步得到陌生度指标U:

(2)U(x)=log⁡Lreconstruction(x).

陌生度指标取决于词表大小V,其理论取值范围为接近−∞至log⁡(log⁡(V))。重构损失越低,陌生度越低;反之,重构损失越高,陌生度也越高。在词表大小V=35的情况下,若所有词元的预测概率均匀分布,则陌生度的理论上限约为1.27。然而在实际应用中,当模型为某些词元分配极低概率时,陌生度可能超过这一理论上限。

2.2 检测分子分布偏移

为考察陌生度评分能否反映分子分布偏移,收集了33个具有实验标注的数据集,涵盖不同的生物学性质和数据规模。随后,将各数据集划分为分布内分子和分布外分子。首先,基于分子环状骨架进行谱聚类,其中环状骨架是指不含环外取代基的核心环系,以确保结构相似的分子被稳定地划分至同一聚类。根据各数据集中的聚类距离,将距离最远的若干聚类作为分布外测试集testOOD,约占全部分子的25%。其余分子进一步划分为分布内测试集testID和训练集trainID,分别约占全部分子的25%和50%。

为确认testOOD中的分子与另外两个数据集来源于不同的数据分布,采用三种方法表征分子相似性:

  1. 扩展连接指纹(extended connectivity fingerprints,ECFP)相似性。ECFP用于表征以原子为中心的子结构,在分子环状骨架上计算,并使用Tanimoto系数量化相似性。
  2. 结构核心重叠程度。通过计算分子图之间最大公共子结构(maximum common substructure,MCS)所占比例进行量化。
  3. 药效团相似性。基于Chemically Advanced Template Search(CATS)描述符计算,并使用余弦相似度进行量化。

在所有相似性指标下,testOOD中的分子与训练集及testID中的分子均存在统计学显著差异,而训练集与testID之间未观察到显著差异。统计分析采用配对双侧Wilcoxon符号秩检验,显著性水平设为α=0.05。

为评估这种分布偏移对预测性能的影响,使用分子描述符训练了三种成熟的分子性质预测模型,包括结合ECFP的随机森林(random forest,RF)和多层感知机(multilayer perceptron,MLP),以及结合CATS药效团描述符的随机森林。通过平衡准确率进行评估时,这些基线模型在testOOD上的性能均显著低于testID,配对双侧Wilcoxon符号秩检验结果为P<0.05。这种性能下降是分布外数据的典型特征。

在建立基线后,进一步评估了JMM在各数据集上的分类性能。JMM在testID分子上的平衡准确率为0.75±0.02,略低于基于ECFP模型取得的0.78±0.02,配对双侧Wilcoxon符号秩检验结果为P=3.7×10−5。这一较小的性能差距表明,两者在实际应用中的差异有限,也与已有SMILES模型和ECFP模型的性能比较结果一致。

无论是否使用重构解码器训练JMM,模型的分类性能均未发生显著变化,其中testID上的检验结果为P=0.499,testOOD上的检验结果为P=0.594。结果表明,在加入分子重构任务后,JMM仍保持了与现有方法相当的预测性能。换言之,解码器能够支持陌生度估计,而不会对分类器性能造成额外损失。

随后,对训练数据中具有充分结构表征的分子是否比“陌生”的分布外分子更容易被JMM重构进行了验证。针对每个训练完成的JMM,分别计算对应testID和testOOD中所有标注分子的陌生度U(x)。结果显示,testOOD分子的陌生度评分显著高于testID分子,双侧Kolmogorov–Smirnov检验结果为P<0.05,而且这种差异在各个独立数据集中均较为明显。

陌生度差异并非由SMILES字符串长度或复杂程度、分支数量、分子图复杂度、分子量或官能团数量等因素造成。结果说明,模型重构分子的能力主要取决于分子与训练数据分布的接近程度,而不是分子本身的复杂性。

在testID和testOOD分子中,无论数据集如何划分,陌生度均与分子到训练数据的距离呈直接关系,例如陌生度会随结构核心重叠程度下降而升高。总体而言,陌生度与分子到训练数据的结构距离之间表现出中等至较强的相关性,并且能够同时关联多种相互补充的相似性指标。这表明,陌生度能够从模型自身学习结果出发,对训练数据分布提供一种具有普适性的表征。

2.3 陌生度与生物活性预测

由于分子重构与分子性质预测依赖相同的潜在表示,因此进一步评估了陌生度U(x)在衡量模型预测能力方面的信息价值。陌生度与以下几种成熟的预测可靠性指标进行了比较:

  1. 与训练集分子的相似性(数据驱动):通过平均药效团相似性、环状骨架相似性或分子核心重叠程度进行衡量。
  2. 嵌入距离(模型驱动):定义为分子嵌入向量z与训练集中已学习嵌入表示之间的平均Mahalanobis距离。
  3. 预测不确定性(模型驱动):基于分类器的近似贝叶斯建模进行估计。

结果表明,在平衡准确率、命中率和精确率等指标下,所有测试的可靠性度量均能够在一定程度上反映模型的预测性能。预测不确定性和陌生度与模型性能之间表现出中等至较强的相关性。换言之,在数据集层面,当预测不确定性或陌生度较高时,模型更容易产生错误的生物活性预测;而对于这两项指标较低的分子,模型通常能够作出较为准确的预测。

值得注意的是,陌生度与预测不确定性这两项指标本身几乎不存在明显相关性,Spearman相关系数为r=0.10±0.05。这说明两者能够从不同角度捕获与预测可靠性相关的互补信息,也支持在分子机器学习中将陌生度与不确定性估计结合使用。

总体而言,“模型驱动”的可靠性指标优于所有“数据驱动”方法。后者主要依赖预先定义的分子描述符和相似性度量计算待测分子与训练集之间的距离。结果说明,模型能够从训练数据中提取仅凭预定义分子相似性指标难以充分表征的信息。

有趣的是,尽管陌生度和嵌入距离都能够反映JMM学习到的部分结构相似性信息,但陌生度在衡量预测可靠性方面明显优于分子嵌入与训练集嵌入之间的距离。换言之,与分类器直接使用的内部嵌入表示相比,模型根据内部表示重构分子的能力能够为预测可靠性提供更多信息。这说明,从嵌入表示重构分子不仅有助于评估预测可靠性,也能够反映嵌入表示本身的质量。相关结果进一步证实,简单的嵌入距离指标难以捕捉影响特定任务结果的“化学细微差异”,而嵌入表示的质量更适合通过下游任务进行评估,而不是仅根据其与训练集嵌入表示的接近程度进行判断。

此外,结果进一步揭示了嵌入距离、陌生度和预测不确定性之间的差异。陌生度和预测不确定性均能够独立地与模型性能相关,但预测不确定性与分子的结构性质并不存在较强联系。相比之下,陌生度能够同时反映分子相似性和预测性能。换言之,嵌入距离主要反映p(x),预测不确定性与p(y∣x)相关,而陌生度将两者结合起来,从而提供关于p(y,x∣x)的信息。因此,陌生度可以被视为一种更全面的预测可靠性指标,能够有效连接分子结构信息与预测置信度。

图2| 使用陌生度评分检测人为引入的分子分布偏移。 a,标注数据集中各数据划分相对于其训练集的平均骨架相似性(n=33个数据集)。相似性通过Bemis–Murcko骨架的ECFP之间的Tanimoto系数计算。箱线图中的每个点代表一个数据集。 b,标注数据集中各数据划分相对于其训练集的平均最大公共子结构比例(MCSF,n=33个数据集)。 c,标注数据集中各数据划分相对于其训练集的平均药效团相似性(CATS12,n=33个数据集)。 d,生物活性微调数据集上的预测性能(n=33个数据集)。从左到右依次为:使用CATS描述符的RF模型、使用ECFP的RF模型、使用ECFP的MLP模型、使用SMILES字符串编码器的MLP模型,以及使用相同SMILES字符串编码器的JMM模型。 e,所有标注数据集中testID和testOOD分子对应的JMM陌生度评分分布(每个划分n=14,081个分子)。 a–e中的箱线图显示中位数(中心线)、第25和第75百分位数(箱体边界)以及1.5×四分位距(IQR,须线)。 f,各数据集中testID和testOOD的JMM陌生度评分分布(数据集缩写见补充表1)。a–f中统计学显著差异(P<0.05)以星号表示,其中a–d采用配对双侧Wilcoxon符号秩检验,e和f采用双侧KS检验。无显著差异记为n.s. g,标注数据集中所有分子的JMM陌生度评分与其相对于各自训练集的平均MCSF相似性之间的关系(每个划分n=14,081个分子)。 h,分箱后的陌生度与相对于各自训练集的MCSF相似性之间的关系。陌生度数值按每个数据集分别分箱。图中的点表示所有数据集(n=33)的平均值,误差棒表示标准误。所有模型导出的评分均表示10折Monte Carlo交叉验证的平均值(验证集样本占10%)。

表1|可靠性指标与训练集相似性的相关性

2.4 虚拟命中化合物筛选

为进一步探索陌生度在化学空间导航中的作用,将分析扩展至大规模筛选库,以模拟更接近实际应用的虚拟筛选场景。尽管这些分子库缺少活性标注,因而无法直接评估模型性能,但其包含规模更大、结构更加多样的分子集合,可能呈现出此前较小测试集中未能观察到的分布差异。

从Asinex、Specs和Enamine三个可靠的商业筛选库中整合了约140万个分子,并使用全部33个训练完成的模型进行推理。筛选分子与训练集之间的结构重叠程度甚至低于testOOD分子。结合此前观察到的分布外性能下降,可以预期模型在这些筛选分子上的预测性能也会进一步降低。然而,预测不确定性并未揭示筛选分子与testID分子之间具有实际意义的差异,Kolmogorov–Smirnov检验统计量仅为D=0.181,表明效应量较小。若仅依据预测不确定性,可能会误认为这些筛选库仍处于模型的正常适用范围内。相比之下,陌生度清晰揭示了显著的分布偏移,整体检验统计量达到D=0.999,且这种差异在各个数据集中更加明显。

在这一大规模分子库中,预测不确定性与分子相对于训练数据的结构相似性几乎不存在直接相关性,Spearman相关系数为r=−0.04±0.02。相比之下,陌生度与结构相似性表现出中等程度的相关性,Spearman相关系数为r=0.21±0.02。同时,预测不确定性与陌生度仍然相互独立,Spearman相关系数为r=−0.03±0.03。结果说明,在小型数据集中观察到的趋势同样适用于大规模筛选库,并进一步表明,陌生度能够识别常用可靠性指标可能遗漏的分布外偏移。

在整个分子库以及单个蛋白质靶点层面,预测不确定性与陌生度均表现出明显不同的分布特征。以丝氨酸/苏氨酸蛋白激酶PIM1为例,高陌生度分子通常具有较为异常或偏离常见生物活性化学空间的结构;低陌生度分子则更常呈现生物活性分子的典型特征,例如类固醇结构和已知生物活性核心。在PIM1相关分子中,低陌生度分子还包含嘧啶酮核心等经典药效团。

陌生度与药物相似性的定量估计值之间不存在明显相关性,Spearman相关系数为r=−0.04±0.03;陌生度与合成可及性之间同样不存在明显相关性,Spearman相关系数为r=0.01±0.02。这说明低陌生度并不只是对药物相似性的简单反映。值得注意的是,这些结构层面的信息无法通过预测不确定性获得,提示在面对明显的分布外数据时,不确定性估计本身可能并不可靠。

表2|可靠性指标与模型性能的相关性

2.5 前瞻性虚拟筛选

为在真实条件下前瞻性验证所提出的方法,对一个包含约18万个类药分子的商业化合物库进行了筛选,以寻找两个具有药理学意义的激酶靶点PIM1和细胞周期蛋白依赖性激酶1(cyclin-dependent kinase 1,CDK1)的抑制剂。值得注意的是,CDK1数据未用于其他分析,因此可作为完全独立的测试案例。

针对每个靶点,利用全部可用数据分别训练JMM,其中PIM1包含1443个训练分子,CDK1包含312个训练分子,随后对整个筛选库进行生物活性预测。分子按照其与所谓“乌托邦点”的距离进行排序。乌托邦点是同时平衡多个目标的几何最优点。以预测生物活性E(y∣x)、预测不确定性H(y∣x)和陌生度U(x)作为三个互补目标,采用三种不同的权衡策略分别筛选排名前10的分子,以考察分布偏移条件下预测不确定性与陌生度的表现:

  1. 高E(y∣x)、高H(y∣x)和低U(x)。
  2. 高E(y∣x)、低H(y∣x)和低U(x)。
  3. 高E(y∣x)、低H(y∣x)和高U(x)。

为减少筛选分子与训练数据之间以及候选分子彼此之间的结构重叠,排除了与训练集或其他已选分子的ECFP Tanimoto系数不低于0.70的化合物,从而进一步增加模型在训练分布之外进行预测的难度。

最终优先筛选出的60个分子均与对应训练集具有较大的结构距离。PIM1候选分子与训练集的最大ECFP Tanimoto系数为0.28±0.05,CDK1候选分子为0.28±0.06。通过高陌生度策略筛选的分子在激酶抑制剂中表现出尤为非典型的结构特征。所有化合物均在10μM单一浓度下进行实验测试。对于PIM1,共发现4个初步命中化合物,蛋白抑制率超过50%,以及6个弱命中化合物,抑制率超过25%。对于CDK1,共发现1个初步命中化合物和5个弱命中化合物。

随后,对每个靶点活性最高的6个化合物进行进一步表征,以测定剂量—反应曲线及相应的半数抑制浓度IC50。对于PIM1,6个化合物均表现出剂量依赖性抑制,但在测试浓度范围1nM至10μM内均未达到完全抑制。化合物4、10和25呈现清晰的S形部分抑制曲线,并表现出低微摩尔或亚微摩尔效力,其IC50分别为1.5±0.4μM、0.92±0.97μM和0.87±0.5μM。化合物9和18的抑制作用较弱,且剂量—反应曲线未能完整解析,因此仅报告其效力上限估计值,IC50分别为5.9μM和7.5μM。

对于CDK1,整体抑制作用相对较弱,这可能与其训练集仅包含312个分子有关。只有化合物40获得了完整的剂量—反应曲线,并表现出部分抑制,其IC50为2.9±0.75μM。化合物33表现出中等活性,IC50上限估计值约为3.4μM。其余化合物31、48、53和59的抑制作用不足,无法估算IC50。

总体而言,此次筛选中PIM1的命中率约为17%,即30个化合物中有5个表现出明确的剂量—反应抑制;CDK1的命中率约为7%,即30个化合物中有2个表现出明确抑制,同时还发现了若干弱活性化合物。这些命中率高于传统激酶筛选通常报道的0.1%至5%。值得注意的是,所有命中化合物与训练分子的最大子结构相似度均低于38%,该相似度通过ECFP Tanimoto系数衡量,并且这些化合物均完全通过前瞻性的机器学习引导筛选获得。

由于每种策略测试的化合物数量有限,且未采用完整的2×2析因设计,因此无法得出具有充分统计稳健性的结论,也无法清晰区分各因素的独立作用。然而,在7个具有低微摩尔效力的化合物中,有5个来自策略A,即低陌生度和高预测不确定性的组合。相比之下,采用低预测不确定性进行筛选的策略B和策略C并未表现出明显优势,这与预测不确定性在分布偏移条件下不能可靠反映模型性能的结果一致。

尽管这些前瞻性结果仍属初步验证,但已提供了实际证据,表明该方法能够发现结构新颖的生物活性分子,同时支持将陌生度作为分布偏移条件下探索化学空间的一项有效指标。

图3|对140万种商业可获得分子进行虚拟筛选。 所有模型导出的评分均表示10折Monte Carlo交叉验证的平均值(验证集样本占10%)。 a,相对于各自训练集,testID(n=14,081)、testOOD(n=14,081)以及合并筛选库(n=46,048,926)中分子的ECFP平均Tanimoto相似性分布。结果汇总了全部33个药物靶点。 b,testID、testOOD以及合并筛选库中所有分子的预测不确定性H(y∣x)分布。 c,testID、testOOD以及合并筛选库中所有分子的陌生度评分U(x)分布。a–c中统计学显著差异(P<0.001)以星号表示,采用双侧KS检验确定。KS检验统计量D如下:a,library与testID比较,D=0.499;testOOD与testID比较,D=0.279。b,library与testID比较,D=0.181;testOOD与testID比较,D=0.155。c,library与testID比较,D=0.999;testOOD与testID比较,D=0.368。 d,筛选库中所有分子的预测不确定性与陌生度之间的关系(n=1,395,422),并对全部33个药物靶点取平均。图中给出了平均Spearman相关系数±标准误。标注了4个在全部药物靶点上普遍被预测为具有生物活性的分子,每个分子都接近一个乌托邦点,例如分子iii同时具有最低的不确定性和最低的陌生度。 e,筛选库中所有分子的预测不确定性与陌生度之间的关系,具体以丝氨酸/苏氨酸蛋白激酶PIM1为例(n=1,395,422)。图中标注了4个被预测对PIM1具有活性的分子,每个分子都接近一个乌托邦点。

图4| PIM1和CDK1的实验筛选。 化合物筛选基于10折Monte Carlo交叉验证所得的平均陌生度评分和不确定性估计(验证集样本占10%)。除阳性对照化合物(AZD1208和dinaciclib)外,所有激酶活性测定结果均表示3次技术重复的平均值。 a,采用三种不确定性与陌生度组合策略,从约18万个化合物组成的分子库中筛选出10个最有前景的PIM1抑制剂:A,最高不确定性且最低陌生度;B,最低不确定性且最低陌生度;C,最低不确定性且最高陌生度。 b,在10μM条件下测定所选分子的PIM1活性,以及它们与PIM1训练分子的最大Tanimoto相似性(基于ECFP)。PIM1活性越低,表示抑制作用越强。 c,PIM1实测活性的箱线图(每种方法n=10个分子)。实线表示未加入任何筛选化合物时的PIM1活性,虚线表示加入强效对照抑制剂AZD1208时的PIM1活性。统计学显著差异(α=0.05)以星号表示,采用配对双侧Wilcoxon符号秩检验确定。箱线图显示中位数(中心线)、第25和第75百分位数(箱体边界)以及1.5×四分位距(IQR,须线)。 d,针对每种筛选方法选出的10个最有前景的CDK1抑制剂。 e,在10μM条件下测定所选分子的CDK1活性,以及它们与CDK1训练分子的最大Tanimoto相似性(基于ECFP)。 f,CDK1实测活性的箱线图(每种方法n=10个分子)。实线表示未加入任何筛选化合物时的CDK1活性,虚线表示加入强效对照抑制剂dinaciclib时的CDK1活性。箱线图显示中位数(中心线)、第25和第75百分位数(箱体边界)以及1.5×四分位距(IQR,须线)。统计学显著差异(α=0.05)以星号表示,采用配对双侧Wilcoxon符号秩检验确定。 g,在10μM条件下对全部60个筛选化合物测得的蛋白活性(方法A:1–10和31–40;方法B:11–20和41–50;方法C:21–30和51–60)。其中,面板h中展示的所选化合物(编号以粗体标出)进一步进行了剂量—反应曲线表征。 h,针对PIM1和CDK1筛选出的6个最有前景化合物的结构及测得的IC50。无法测定的IC50值记为NA。

3 讨论

引入了“陌生度”这一指标,用于表征分子与深度学习模型所学习数据分布之间的距离。陌生度通过联合建模方法计算,该方法同时执行分子重构与性质预测任务。通过衡量模型重构此前未见分子时产生的误差,陌生度能够量化分子分布偏移。结果表明,当模型应用于新分子时,陌生度是评估预测可靠性的一项稳定且有效的指标。作为分类预测可靠性指标,陌生度与通过近似贝叶斯建模估计的预测不确定性具有相近的信息价值,但两者彼此独立。与预测不确定性不同,陌生度还能够反映分子与模型所学习数据分布之间的结构距离。尤其是在大规模虚拟筛选中,面对明显的分布偏移时,陌生度提供的分子层面信息远比不确定性估计更加具有实际意义。陌生度与预测不确定性在可靠性评估中的互补性,进一步体现了陌生度在分子机器学习中的应用价值。

前瞻性验证进一步说明,陌生度可以有效补充基于不确定性的分子优先级排序。尽管训练集规模较小,且每个靶点仅筛选了少量化合物,仍发现了多种具有低微摩尔活性的分子。相比之下,当模型在训练数据支持范围之外运行时,预测不确定性似乎无法有效反映模型性能。这说明,结合陌生度进行分子筛选,有望更加充分且精确地探索化学空间,并为发现新的候选分子提供更多机会。

相关结果支持采用陌生度替代传统基于相似性的适用域定义方法。此外,陌生度有望揭示通过分子相似性方法无法检测,或被不确定性方法低估的分布偏移,因此适合用于大规模分子库筛选。更重要的是,陌生度分布能够揭示模型已学习数据分布中的空缺,因此可用于指导强化学习应用,也可超越“一次性”虚拟筛选,扩展至主动学习等迭代策略,以辅助确定后续需要获取的分子。

总体而言,联合建模的优势不仅体现在从头分子设计中,也体现在对结构—活性关系的刻画方面。联合建模与陌生度所提供的信息,有望推动更可靠、泛化能力更强的模型发展,从而以更高的可信度和精确性加速探索化学空间中的新区域。