JMC 2023 | 药物发现中的匹配分子对分析方法与最新应用
今天介绍的是发表在 J. Med. Chem. 上的一篇综述,聚焦匹配分子对分析(matched molecular pair analysis,MMPA)在药物设计与先导优化中的理论基础、关键参数和实际应用。不同于传统QSAR/QSPR模型主要依赖整体分子描述符并输出相对“黑箱”的预测结果,MMPA以成对结构变化为核心,将分子活性或理化性质变化直接关联到局部子结构转化,从而为药物化学中的“下一步该合成什么”提供更具可解释性的经验规则。在理论层面,该综述系统梳理了MMP搜索算法的发展,包括预定义转化方法、最大公共子结构(MCS)方法以及片段化与索引(F+I)方法,并进一步讨论了分子表征、化学环境、统计显著性、数据质量以及MMPA与QSAR/QSPR之间的互补关系。在应用层面,MMPA已被广泛用于ADMET性质优化、生物电子等排体替换、活性悬崖识别、分子多靶点活性分析和匹配分子系列(MMS)构建,可从大规模实验数据中提取溶解度、log

获取详情及资源:
0 摘要
匹配分子对分析(matched molecular pair analysis,MMPA)是一种从已有实验数据中提取药物化学知识的工具,可将活性或性质变化与特定结构变化关联起来。近年来,MMPA也已应用于多目标优化和从头药物设计。围绕MMPA的概念、技术和案例进行讨论,概述MMPA领域的当前发展。同时总结了MMPA的最新应用,并强调了MMPA进一步发展的成功经验与潜在机会。
1 引言
发现能够调节目标蛋白的先导化合物可能涉及大规模虚拟筛选(virtual screening,VS)和实验测定,这些过程约占药物发现总时间的30–40%。尽管高通量筛选(high-throughput screening,HTS)技术和VS方法已被广泛应用,仍然难以获得同时具备理想治疗效力、对脱靶靶点具有良好选择性以及适当吸收、分布、代谢、排泄和毒性(absorption,distribution,metabolism,excretion,and toxicity,ADMET)特征的最优候选物。平均而言,一个药物获得批准通常需要约15个先导优化项目,估计占推出新药总成本的23%以上(约4.14亿美元)。因此,高效先导优化是开发新药的关键步骤。传统上,先导优化高度依赖药物化学家的既往经验和已有合成指南。随着实验数据的积累,更多数据库和计算工具被开发并应用于先导优化,例如生物电子等排体数据库、分子间相互作用数据库和构象景观预测工具。Topliss方案、Craig图、Hansch方法和Free Wilson方法等若干系统性方法已被提出,用于总结类似物合成知识、物理性质–化学结构相关性以及生物活性–化学结构相关性。
与依赖人工分类分子转化以提高生物活性不同,当前正在提取计算机可读格式的转化知识数据集,并将其整理为规则数据库,例如基于实例驱动的先导演化创新工作。2005年,分子匹配对(molecular matched pair,MMP)这一术语被首次提出,并迅速成为提取药物化学知识以指导先导优化的标准方式。借鉴合成化学中的概念,MMP被定义为仅存在一个小的局部结构变化的一对化合物。该配对之间的变化称为转化,而同时存在于两个分子中且具有最多原子数的连续成键子结构称为最大公共子结构(maximum common substructure)。从大型化学集合中系统分析MMP并确定相应性质变化的过程称为分子匹配对分析(MMPA),其能够分析局部结构–活性关系(structure–activity relationship,SAR),并通过对每一对具有相应理化或生物性质变化的分子进行统计分析来整合多个终点。尽管MMPA的定义看似简单,但其包含许多子概念,并与化学信息学中的许多通用问题相关。MMPA的应用,尤其是在基于专利的竞争环境中,为在不披露具体化学结构的情况下获取数据和经验提供了一种新范式,从而极大促进了信息共享。深入理解MMPA,包括匹配对识别、有效性质变化分析、转化规则存储和知识利用,有助于MMPA的实际应用。首先介绍了MMPA理论,包括算法、分子表征、环境表征、统计显著性、数据可用性,以及MMPA与定量结构–活性/性质关系(quantitative structure–activity/property relationship,QSAR/QSPR)之间的关系。随后阐述了基于MMPA的实际应用和工具,包括ADMET优化、生物电子等排体替换、活性悬崖、多靶点活性和匹配分子系列。最后讨论了MMPA领域的未来前景,包括进一步推进该方法的潜在启发式策略。
2 MMPA的理论介绍
2.1 MMPA的搜索算法
MMP搜索算法是为药物化学应用提供完整MMP列表的基础。根据预定义状态和提取过程,MMP搜索算法可分为三类:预定义转化方法、基于最大公共子结构(maximum common substructure,MCS)的方法,以及片段化与索引(fragmentation and indexing,F+I)方法。MMP搜索算法的更多细节已有总结。

图1|最大公共子结构及片段化与索引方法

表1|MMP搜索算法的分类。
一组预定义分子转化方法已被用作起点,其依据可以是一般转化类别,例如Drug Guru、Buy me Grease、LEATHERFACE、ThricePairs、THINK和RandSmi;也可以是键断裂规则的应用,例如逆合成组合分析程序(retrosynthetic combinatorial analysis procedure,RECAP)和逆合成感兴趣化学子结构断裂(breaking of retrosynthetically interesting chemical substructures,BRICS)。例如,Drug Guru提供186条常见转化规则,涵盖133种官能团转化和53种骨架修饰。RECAP预定义了11种默认键断裂类型,传统上用于转化片段检测。预定义转化方法具有若干优势,包括易于实现和计算速度快。然而,这些方法也存在局限性,例如会忽略目录列表以外的MMP,受限于单位点化学转化,并且缺乏特定治疗领域中的有价值知识。
与预定义方法相比,其他MMP搜索算法,例如MCS和F+I,在近期MMPA工作中更为常用。预定义分子转化方法仅限于在监督式转化规则中发现MMP,而包括MCS和F+I在内的无监督方法能够自动识别、探索和扩展新的转化规则。MCS算法利用团检测方法对分子列表进行两两比较,从而能够在每一对化合物之间找到具有最多原子数的公共子结构。MCS被定义为“固定”部分,而每个化合物的其余部分被定义为“变化”部分。更多细节已有报道。WizePairZ是MMPA中最广泛使用的MCS算法之一,可同时进行MMP检测和化学环境记录。在该方法中,首先将两个随机选取的SMILES字符串转换为分子图;随后对分子执行MCS搜索,匹配一组具有相同芳香性、原子序数、形式电荷以及相同键级的原子和化学键。在确定映射原子后,WizePairZ记录局部环境,包括从转化位点向外延伸最多四个键的邻近区域。生成的数据最终被编码并存储为单独的SMIRKS(一类反应转化语言)字符串,其中包含转化信息。然而,由于MMP识别的非确定性多项式复杂度以及最大子图同构这一大类问题,MCS计算在计算上具有挑战性。
2010年,提出了一种新的MMP识别算法,即F+I方法。该方法通过片段化每个分子识别共享子结构,并将所有枚举得到的片段存储和索引在类似倒排文件的结构中。在一项涉及超过76,000个分子的MMP识别任务中,两种算法获得了相近结果;带初始Tanimoto过滤的Daylight MCS算法在四处理器计算机上需要4–5天完成计算,而F+I方法在相同计算机上无需此类过滤过程,仅需约8小时。生成MMP的计算过程首先通过断裂特定类型的键(例如非环单键)对输入分子进行片段化。随后通过枚举所有可能的切割方式,将所得片段以字典格式索引为“key”(公共子结构)或“value”(分子转化)。该方法允许枚举单切、双切和三切,从而生成一个核心片段和两个以上末端片段。灵活的片段切割方案、较低的计算成本以及对不同研究目的的适应性,使该方法被广泛用于MMP生成和分析。
不同于许多其他算法,F+I算法随分析分子数量呈线性扩展。然而,这一特点通过存储片段表实现,而片段表的规模可能迅速增大。即使采用高效索引,随着算法推进,在大型数据集上仍会开始变慢。为提高有效性和效率,应适当限制核心大小和切割数量;否则,极小的核心尺寸可能导致任意两个分子之间都生成配对。数据集上的分子比较规模为
2.2 MMPA的基本参数
MMPA的基本假设是,物理或生物性质的特定变化由小的结构变化所贡献。一些常见描述,例如“添加氟以降低代谢”“连接羟基以提高溶解度”,或简单地“添加甲基”,通常被视为先导优化中的转化指南。然而,在实际应用中,子结构变化更为复杂。已经发现,性质变化往往呈对称分布,通常以零为中心,导致性质增加与性质降低呈现相似趋势。这一现象强调了在有效MMPA中进行统计检验的重要性。本节重点讨论MMPA中的重要参数,包括结构描述、化学环境、统计显著性、数据可用性以及与QSAR的关系。

图2|MMPA的重要参数,包括结构描述、化学环境、统计显著性和数据可用性
2.3 MMPA中的分子表征
MMPA中分子表征的选择至关重要,因为它会显著影响对分子性质和生物活性变化信息的总结。MMPA中主要采用两类分子表征方法,即二维和三维结构描述,但二者具有不同优势。由于简单且有效,二维结构表征已广泛应用于QSAR建模和相似性搜索。随着蛋白–配体复合物实验结构的持续积累以及计算能力的快速提升,三维结构表征在空间层面描述分子结构时变得更加常见。尽管三维方法尚未对QSAR建模产生显著贡献,但其对细微结构差异更为敏感。这种敏感性有利于MMPA,因为它允许利用空间信息。一种常见的三维MMPA方法包括以下步骤。首先,构建三维结构数据库,其中包含具有活性数据的生物分子复合物,同时还包括具有活性数据的化合物数据库。其次,以常规方式生成MMP,例如VAMMPIRE中的MCS方法或OOMMPPAA中的F+I方法。对于MMP数据库中的每一对分子,将配体的重叠三维坐标转移至其配对的二维化合物。第三步,对化合物进行能量最小化,以确保每个MMP中的两个分子均具有完整的三维表征。最后,该方法识别化合物中影响其与靶标口袋相互作用及其所产生活性的变化。然而,活性分子生物学相关构象的识别与对齐使三维结构MMPA更加复杂。二维和三维方法之间的进一步差异将在应用部分讨论。
2.4 MMPA的环境表征
在MMP中,一对分子之间的变化被描述为转化;发生转化的位置称为连接点,而该配对中的恒定特征被视为化学环境。最初,MMPA基于这样一种假设:分子性质或效力的变化只能归因于被替换的子结构。然而,这一假设并不总是成立。例如,已有结果表明,在某些情况下,如果不考虑环境信息,转化规则可能具有很强的误导性。在相关分析中,采用三类全局描述符和两类局部描述符进行环境表征,分别编码整个分子环境和连接点的直接邻近区域。结果显示,适当应用环境描述符可使转化更加明确且具有显著性。以hERG抑制数据为例,H→OCH
鉴于环境信息的重要性,已有多种方法被提出用于将分子环境纳入MMPA,这些方法从使用分子图和相应SMILES的精确环境描述,例如WizePairs,到使用分子骨架、指纹或药效团的更抽象描述不等。2014年,提出了模糊匹配对(fuzzy matched pair,FMP)方法,该方法将经典MMP方法与刚性较低的简化分子图结合,用于提取环境信息。在该方法中,芳香环、氢键供体和受体以及卤素原子等经典药效团被用于描述邻近区域。该描述同时涵盖变化点周围的环境和变化本身。通过对药效团转化进行聚类,FMP方法在基于配体的药物设计先导优化阶段尤其有用。除二维MMPA外,三维MMPA方法也会纳入改变片段邻近区域中的共价配体环境用于进一步分析。基于WONKA开发的OOMMPPAA工具应用四种药效团特征,探索与相关活性变化有关的化合物配对之间的转化。在相关工作中,首先利用已有方法构建MMP数据库。随后检测所有相关配对,其中每一对中仅有一个化合物存在于晶体结构中。这些配对中具有构象结构的化合物被用于预测无晶体结构化合物的坐标。随后识别每一对中两个分子之间的药效团差异,并最终进行可视化用于应用。该数据库使样本配体的体外CDK2抑制效力从13
除配体信息外,编码蛋白口袋信息可通过更明确地纳入蛋白–配体相互作用信息,对结合机制提供更深入理解。例如,向分子中添加甲基可能导致所谓的“魔法甲基效应”,该效应已显示出对靶标结合亲和力的有利影响。然而,对2,100多个分子的统计分析显示,添加甲基提高或降低效力的概率相近。此外,结果显示,魔法甲基效应对活性的影响源于未结合配体与结合状态下蛋白活性位点之间形状互补性的增加,从而降低配体结合过程中构象重排的代价。鉴于其重要性,开发了名为virtually aligned matched molecular pairs including receptor environment(VAMMPIRE)的分子优化工具。对于仅具有二维结构的化合物,VAMMPIRE将其配对伙伴的MCS应用于晶体结构,以生成三维叠合,并在蛋白腔内优化结构。因此,蛋白–配体相互作用由SYBYL原子类型、三联体以及口袋氨基酸中参与相互作用的部分共同描述。基于VAMMPIRE数据库集合,升级后的VAMMPIRE-LORD应用药效团对MMP进行构象放置,并使用LORD-FP指纹描述蛋白–配体相互作用谱。VAMMPIRE-LORD重现了环氧合酶-2(cyclooxygenase-2,COX-2)抑制剂SAR的一个片段。观察到匹配对转化可导致IC
2.5 MMPA中的统计显著性
MMPA的统计估计是观测差异可靠性的基础。对于包含200,000个条目的分子数据库,理论最大MMP数量约为2×10
围绕配对
在统计分析中发现,有时一个化合物上两个新取代基所引起的变化与二者单独效应之和存在很大差异,这被称为“非加和性”现象。该现象表明,在简单MMP比较背后存在某些类型的取代基间干扰。为进一步探索这一现象,可使用由四个具有相同骨架且已知结合亲和力的分子组成、并通过两种化学转化连接的匹配方形配对循环进行非加和性估计。非加和性可能由实验噪声导致,其常见范围为0.1–0.3log单位。对于更极端的非加和性循环,尤其是面向与靶标–配体相互作用相关生物活性的MMPA,非加和性的出现可由调节相互作用网络的协同效应解释,例如疏水相互作用、氢键和残基移动性变化之间的复杂相互作用。事实上,这表明结合模式发生了关键变化。需要注意的是,某些理化性质,例如溶解度、渗透性和亲脂性,也可能受到由分子内氢键相互作用引起的非加和性效应影响。非加和性分析能够估计数据集中实验模糊性的上限,并识别潜在SAR离群点和具有显著意义的化合物集合。该分析还提示了一些有助于改进合理药物设计的重要结构特征。
2.6 MMPA的整合方法
适当分子表征、环境特异性和统计显著性的应用有利于稳定的MMPA和可信的转化规则,同时也对充足数据提出严格要求。为满足这些要求,需要整合数据、MMP搜索算法和转化规则。有效整合来自多种不同来源的数据和知识对于有效优化至关重要。如前所述,由实验不确定性导致的标准差在同质测定(σ
2.7 MMPA与QSAR/QSPR
定量结构–活性/结构–性质关系(quantitative structure–activity/structure–property relationship,QSAR/QSPR)分析是一种典型的基于配体的药物设计方法,用于确定化学结构与生物效应之间的关系。尽管QSAR/QSPR模型可用于量化不同取代基对同源结构的影响,但这些模型的本质更适合一般趋势分析和预测目的,而不是研究特定结构的影响。此外,QSAR/QSPR方法可能因分子描述符而产生信息损失。即使深度学习(deep learning,DL)的应用使直接学习分子信息成为可能,这种预测性能的提升也伴随着预测可解释性较低和需要大规模数据集的潜在代价。最重要的是,尽管QSAR模型可用于预测理化性质或效力,但难以直接用于预测子结构修饰引起的性质变化。MMPA更适合“反向QSAR”问题,其特征在于总结局部结构特征转化的效应。事实上,MMPA类似于Free Wilson分析,后者旨在探测子结构对分子性质或活性的单独贡献。与QSAR建模产生的“黑箱”结果相比,数据可追溯性和化学可解释性优势使MMPA对药物化学家更具吸引力。然而,QSAR建模预测得到的可信结果可被视为MMPA的补充数据。
考虑到这两种方法的特征,已有若干工作尝试将二者结合以解决分子优化问题,其中最典型的例子是QSAR-by-MMPA和MMPA-by-QSAR。QSAR-by-MMPA策略将MMPA与QSAR建模整合,其中MMPA用作分子优化导航,而QSAR预测用于估计结构转化对分子性质或活性的影响。结果显示,QSAR-by-MMPA的应用可提供更准确的离子通道抑制预测,并提供7个用于合成的优化分子,且未产生错误结果。另一项工作提出了一种有趣策略,即为每个MMP计算成对描述符。随后使用QSAR模型评估结构转化引起的效力变化。该方法能够在相关局部环境中高效总结相似转化。此外,QSAR模型的应用还允许估计新颖转化带来的活性变化,从而返回优化化合物的预测结果。为预测MMP编码的结合活性变化,构建了一组支持向量回归(support vector regression,SVR)模型,用于评估形成MMP的分子之间的亲和力差异。结果表明,MMPA与QSAR的结合进一步拓展了适用范围,并在分子优化任务中提供明确方向,其中共享关键结构对预测准确性具有重要贡献。相同策略也被用于将不同机器学习方法与基于片段的MMP实现相结合,其中深度神经网络模型表现最佳。该方法为转化提供可信预测,并进一步在多个数据集上实现高质量预测。另一方面,为更好解决实验数据有限的问题,提出了MMPA-by-QSAR概念。首先,使用QSAR建模预测未标记分子。随后,基于QSAR给出的预测结果,使用MMPA进行结构转化分析。例如,基于QSAR对大型化学库给出的预测值,利用影响目标活性的MMPA已成功优化水生毒性和CYP3A4抑制。MMPA-by-QSAR也被用于改善亲脂性和代谢清除率,进一步回顾性分析显示,对于大多数转化,预测变化幅度与实验结果极为接近。对于MMPA-by-QSAR范式的应用,需要注意适用域评估对于总结可信转化规则至关重要。以log
3 MMPA的实际应用
药物发现是一个多参数优化过程,涉及高成本且复杂的设计–合成–测试–分析循环。为加速药物发现,MMPA已被广泛用于探索针对目标效力和性质的化学转化。除先导优化外,MMPA还用于探索生物电子等排体替换、活性悬崖、潜在靶标预测、特征–特征关系探索和从头药物设计。基于MMP的定义,匹配分子系列(matched molecular series,MMS)作为一种最初用于图形化理解化合物集合SAR的方法,也已得到广泛应用。
3.1 MMPA在先导ADMET优化中的应用
据估计,约50%的药物开发失败由ADMET性质缺陷导致,这凸显了确保候选药物具有最优ADMET性质的重要性。在先导优化过程中,药物化学面临的关键问题是下一步应合成哪些化合物,以及如何平衡多种性质。为避免不合理决策,有必要开展系统分析,并从实验ADMET数据中提取可信的转化规则。
大量文献表明,系统性MMPA能够提取有价值的化学转化规则,用于优化重要ADMET参数,例如溶解度、log

表2|MMPA在ADMET和药效优化中的应用
最初,MMPA主要关注理化性质变化,所得多数数据库仅供企业内部使用。例如,AstraZeneca将MMP分析应用于分子溶解度、logD和蛋白结合数据。MMP计算共使用9,038个预先确定的侧链,并构建了仅供内部使用的网络服务器。随后,AstraZeneca进一步开展了针对血浆蛋白结合、溶解度和口服暴露量的MMPA。通过量化转化效应,可以观察到异常效应。例如,已有总结显示,烷基醇甲基化几乎不影响溶解度,反而会增加亲脂性。2008年,MMPA被应用于糖原磷酸化酶抑制剂设计,发现用氮替代芳香碳是提高溶解度的可行方式。例如,氮杂替代预计可使溶解度提高0.54log单位。最全面的MMPA工作之一由GlaxoSmithKline报道,其对约500,000条目组成的数据集进行了系统分析,该数据集来自8项测定,包括hERG抑制、人工膜渗透性、细胞色素P450 1A2、2C9、2C19、2D6和3A4抑制,以及磷酸盐缓冲液溶解度。共总结了90种常用子结构,包括磺酰胺、酸、醇、酰胺、卤素、酯、烷基、胺以及多类别单杂环和稠合杂环。结果表明,log
2010年,围绕环境信息的应用是否能够增强MMPA实用性进行了研究。该工作使用了hERG、溶解度和亲脂性三个数据集。结果显示,通过描述符应用环境信息,可对转化规则提供更可信且更全面的总结。除大型数据集外,小型数据集也已用于特定片段–性质探索。例如,收集了一个包含2,794个具有实测溶解度化合物的小型数据集,并将其片段化为环、连接子和R基。分析了两类MMP:(1)取代基的替换或突变;(2)取代基的添加或删除,其中大多数为R基。分别识别出4,196个1型MMP和1,902个2型MMP。通过MMPA研究O-甲基化和N-甲基化对亲脂性和溶解度的影响,结果表明,N-甲基化降低log
代谢是MMPA研究的另一个重要领域。2008年,Pfizer分析了超过150,000个具有HLM和log$D$7.4值的分子。该工作分析了两种代谢位点情景:远离苯基,或位于未取代苯基上。结果显示,当代谢位点远离苯基时,对于大多数配对,转化仅影响分子的理化性质,尤其是亲脂性和微粒体结合。然而,当主要代谢位点位于未取代苯基部分时,结构变化可能产生比预期更显著的影响。AstraZeneca基于约75K个化合物实验数据的MMPA,研究了苯基上小取代基对HLM稳定性的影响,并提出了29种可提高HLM稳定性的取代基。通过合理应用上述取代基,一组含氟化合物得到优化,可作为MMPA在药物发现中实用性的代表性示例。考虑到细胞色素P450对亚甲基的氧化代谢在许多外源性化合物中也很常见,随后又通过分析亚甲基上的化学转化开展了HLM稳定性MMPA。结果识别出24种转化对应的1,826个匹配对。其中4种转化对HLM稳定性非常有利。此外,该工作还提示有必要更仔细考察手性化合物对,因为手性对中的两个化合物可能具有不同稳定性。随后关于二取代苯杂环替换的工作也支持这一观点。
3.2 生物电子等排体替换和活性悬崖中的MMPA
除ADMET研究外,MMPA技术也已广泛用于靶标结合亲和力分析。实验结合亲和力数据的MMPA可以识别几类特殊转化,例如活性悬崖和生物电子等排体替换。活性悬崖是指结构相似但靶标结合亲和力差异很大的化合物,差异至少达到2个数量级,例如K
3.3 MMPA与分子多靶点活性
多靶点活性化合物被定义为能够与多种大分子靶标形成非特异性相互作用的化合物,可能作为多药理学应用的潜在候选物。迄今为止,已有若干结构基序被发现与多靶点活性化合物高度相关。MMPA可用于研究能够导致多个结合靶标发生显著变化的小化学取代。例如,基于超过15,000个化合物和100个序列无关靶标,通过MMPA探索了多靶点活性悬崖。不考虑其潜在分子机制,形成MMP的化合物所需结合亲和力注释数量被设定为>50,这是一个相当严格的要求。尽管该工作未检测到子结构或子结构转化,但观察到,在给定结构环境中的某些单位点取代会对化合物多靶点活性产生显著影响。基于该工作,通过系统搜索对某一靶标相较于其他靶标表现出特殊选择性/效力的多靶点活性化合物,进一步分析了分子选择性与多靶点活性之间的关系。该工作结合了活性、靶标和选择性悬崖的概念,其中靶标悬崖是指一对靶标,多个分子对这对靶标表现出显著结合亲和力差异;选择性悬崖则被定义为一对结构相似分子,它们针对给定靶标对表现出较大选择性差异。收集了来自ChEMBL(release 20)的两个K
3.4 匹配分子系列
基于MMP索引表,可以将分子组织为结构集合,其中分子之间仅存在单一修饰差异。该方法最早在一种图形化SAR分析方法中提出,并被定义为匹配分子系列(matched molecular series,MMS)。几乎在同一时期,该概念也被用于实现SAR迁移。MMS方法的一个假设是,在足够强的活性相关性内,存在于一个MMS但不存在于第二个MMS中的类似物候选物值得评估。通过这一概念,可以识别具有不同核心但具有相应子结构变化和可比性质递变的替代类似物系列。在上述工作中,识别了由环系统和连接子组成的骨架,其中所有连续环系统对应value片段,其余部分对应key片段。随后,将具有相同value片段的类似物组装为一个系列。可发现所有绝对性质值不同但差异可比的匹配系列。通过组装具有SAR迁移潜力的化学系列,可以利用已有SAR信息,并应用骨架替换和优化。在另一项MMS工作中,发现了超过17,000个具有不同规模效力注释的类似物系列。若干分子被发现可在化学和生物学上代表该系列,呈现新识别系列中的全部类似物关系,包含不同化学多样化位点和已报道结合亲和力。这些分子的出现也展示了MMS在化合物库中的实用性。

图3|匹配分子系列表和匹配分子系列图示例
基于既往工作,开发了一种名为Matsy的知识驱动方法,通过应用SAR迁移预测可能提高结合亲和力的R基。该算法的一个关键认识是探索一系列化学转化子结构的效力顺序。例如,在不进行频率分析的情况下,Br>Cl>F>H随机分布的预期概率为1/24。然而,在该工作中发现,通过MMS分析,Br>Cl>F>H出现的频率是随机预期的5.6倍。与Topliss树相比,Matsy的预测信息量更高。在对香紫苏醇抗血吸虫性质的探索性研究中,基于Matsy决策树建议的取代,优化后的Heck偶联衍生物在三种蠕虫寄生虫(幼虫、幼年和成体血吸虫)上显示出改善的效力和选择性。

图4|两个MMS之间的SAR迁移 MMS 1和MMS 2之间的配对被识别并垂直对齐,并按效力递增顺序排序。效力以相对效力值(加粗)和绝对效力值(常规)标注。中间节点颜色表示相对效力,并相应标记迁移评分。
为加速MMS中的SAR迁移检测,评估了若干SAR相似性指标,并发现中心化RMSD(centered RMSD,cRMSD)结合基于线性回归的预测插值方法表现最佳,能够将MMS扩展为半定量效力预测工具。2020年,评估了MMS作为logD、CYP2C9抑制、微粒体清除率和CYP3A4抑制预测工具的性能。结果还发现,cRMSD过滤器在预测分子数量和预测准确性之间取得了良好平衡。结果还表明,通过结合常量部分相似性评估、连接点附近环境以及最重要的化学系列长度等有用技术,可以进一步增强MMS分析性能。为实现这一目标,提出了MMS网络,用于呈现不同MMS之间的SAR关系。该工作还显示,减少虚假匹配可提高MMS分析的实用性和可信度。Pfizer数据库的完整留一MMS分析显示,在100万次随机预测中,超过三分之一与效力具有强相关性(
3.5 MMPA公共工具:网络服务器、软件和数据库
为更好整理和交换药物发现相关知识,已开发出多种MMPA工具,用于促进化学结构与生物效应或理化性质之间关系的分析,从而加速新药设计。相关MMP/MMS网络服务器、软件包和数据库已有系统总结。

表3|MMP/MMS公共网络服务器、软件包和数据库
目前已有若干用于MMP生成和分析的商业工具,例如StarDrop、MOEsaic、OEMedChem Toolkit、MedChem Studio、MedChemia的MCPairs和Fuzzy MMP,也有LillyMol等公开可用工具。最初,MMP工具仅支持MMP搜索功能,例如DrugGuru、Hussain和Rea开发的mmpa包以及MatchedPairs。随后,基于MMP搜索算法和大型公共数据库的发展,建立了更多用于片段化的靶向MMPA数据库。SwissBioisostere数据库包含5,586,462种独特取代,这些取代来自针对30类中1,948个靶标的35,039项实验测定。另一个基于逆合成片段化构建的数据库通过应用反应规则引入了超过92,000个RECAP-MMP,旨在提高MMPA的解释能力和实际应用价值。随着共结晶蛋白–配体复合物数量不断增加,OOMMPPAA和VAMMPIRE-LORD等三维MMP相关工具也相继开放用于公共使用。2018年,开发了名为mmpdb的公共平台,可用于创建、编译、存储、检索和使用MMP规则。该平台还包括片段规范化和立体化学处理等功能。MMP流程也可在Konstanz Information Miner(KNIME)中使用,KNIME是一个集数据处理、数据分析和数据探索于一体的平台。2020年,LillyMol中提出了一个详细工作流程,用于构建包含典型ADME测定中多种转化规则的知识数据库,该流程提供了MMP片段化算法和相关统计汇总方法。尽管已有少数集成式自动优化流程工具可利用MMPA系统修改和优化分子,例如MedChemica的MCPairs和BRADSHAW,但这些工具均用于商业或内部应用。为显著提高化合物修饰和优化效率,药物化学领域仍然缺乏用于这一目的的开源工具和平台。集成式MMPA自动化流程预计应包括分子结构准备、组分计算、匹配对与生物或物理化学数据的聚合、统计分析、规则生成和结果可视化。还建议纳入一个模块,可将规则应用于种子化合物或带有预设过滤条件的化合物输出,并可进一步与AI系统集成,对建议用于优化和合成的化合物进行排序。
3.6 基于MMPA的从头药物设计
除传统优化规则总结外,MMP概念和方法也已应用于药物设计的其他方面,例如骨架跃迁、图数据库构建、聚焦库设计,尤其是从头药物设计。最重要的是,MMPA可用于自动设计具有所需类药性质和生物活性的化合物。2019年,报道了BRADSHAW,这是一种自动化从头设计系统,集成了化学结构生成、实验设计和主动学习。将MMP转化规则应用于分子生成被认为是该系统中的关键步骤。输入分子首先根据片段化规则进行片段化,随后应用MMP数据库搜索相关转化。这些转化随后以顺序方式应用于输入分子。为进一步评估基于MMP的分子生成器性能,设计了三种受图灵测试启发的测试。结果显示,基于MMP的方法成功再现了药物化学家的设计思路,并生成了药物化学团队建议的几乎所有化合物。基于可互换片段的确定,开发了一种基于片段的结构生成框架,用于对待优化分子执行化学上合理的突变。可互换片段的初始理论与MMPA定义直接相关,其中,在相同结构环境下用一个片段替换另一个片段,可以生成化学上有效且可行的多样化结构集合。
通过模拟MMP概念,提出了一种基于SMILES的深度学习生成架构,该架构结合了骨架(MMP中的key部分)和取代基(MMP中的value部分)。该架构包含两个循环神经网络,其中第一个模型用于生成骨架,第二个模型旨在为骨架中的每个连接点生成合适修饰。利用该算法,基于DRD2调节剂集合构建的模型可选择性修饰多组骨架,并获得大量预测具有DRD2活性的分子。此外,MMS方法能够将结构特征相近的化合物有效聚类为类似物,因此也受到从头药物设计领域欢迎。开发的深度生成模型DeepSARM用于探索生物学相关但化学上新颖的类似物分子。该模型通过考虑靶标家族的化学空间信息,拓宽了MMS的适用范围,从而可利用新颖类似物扩展化学空间。上述进展进一步突出表明,MMPA能够促进分子优化的各个方面。
4 MMPA在药物设计中的展望
分子设计的挑战在于如何基于有限实验经验决定“下一步做什么”,而MMPA框架的提出使大量性质变化得以总结,并使相关转化规则可用于分子设计。为提高MMPA的效率和实用性,提出了若干建议,包括以下方面:(1)MMPA与QSAR的结合。如上所述,MMPA和QSAR在概念和实践层面具有互补性。QSAR模型主要关注整体结构特征,而MMPA更倾向于检测局部子结构变化。在应用层面,QSAR可用于未标记数据预测,MMPA可用于潜在分子设计导航。因此,建议在未来QSAR模型预测和后续分析中应用MMPA或MMS。(2)将MMPA应用于大分子设计的概念。过去十年中,多数MMPA工作主要集中于小分子的理化性质和生物活性分析,而对蛋白质、肽和核酸序列等大分子的探索仍然不足。(3)MMPA相关分子优化流程的集成与自动化。将MMPA整合到自动化分子设计系统中是MMPA进一步发展的不可逆趋势,该系统应包括MMP的自动提取、组织、应用、评估和循环。尽管MMP已用于分子生成,但仍期待深度学习方法与MMPA之间形成更多结合。使流程能够自主运行所需的鲁棒性与期望的人为引导之间存在微妙平衡,这一问题也需要在未来工作中进一步调整。

图5|预期MMP自动化流程的流程图
5 结论
MMPA在药物研发中变得越来越重要,可为先导化合物优化提供有效指导。随着“大数据”趋势的发展,MMPA的重要性不断提高,使大量性质(ADMET或结合亲和力)的研究以及下一分子优化导航成为可能。围绕MMPA的理论方面进行了讨论,包括搜索算法、重要参数以及MMPA与QSAR之间的关系。近期报道的基于MMPA的实际应用和公共工具也得到了系统回顾,例如ADMET、活性悬崖和生物电子等排体替换、多靶点活性以及MMS。更重要的是,MMPA在其他化学信息学工具和自动化流程中的应用也得到了详细讨论,突出了MMP在药物设计中的重要性和实用性。最后,对MMPA研究的可能未来方向进行了展望。此外,基于MMPA的自动化多性质优化流程的改进和完善,以及与深度学习方法的互补,也值得未来期待。总之,MMPA技术不仅可能模拟甚至超越人类决策,并将成为药物设计人员最有用的工具之一。