NMI 2026 | CoCoGraph: 一种用于生成逼真合成分子的协同约束图扩散模型
今天介绍的是发表在 Nature Machine Intelligence 上的一项研究工作。该研究提出了一个名为 CoCoGraph 的协作式、约束式图扩散模型,用于生成真实感更强的合成分子。作者把化学有效性直接写进扩散过程里,通过保持原子数和度序列不变的边交换机制,让模型在生成时天然满足价态等约束,因此不会产生无效分子,同时也显著缩小了搜索空间、降低了模型复杂度。实验表明,CoCoGraph 在标准分子生成基准上优于现有方法,而且只需要更少参数、采样更高效;对 36 个理化性质的分析也显示,它生成分子的分布更接近真实分子。为了进一步验证模型的实用性,作者还构建了一个包含 820 万个分子的合成数据库,并做了类图灵测试的专家评估,发现有机化学背景的研究者也只能以接近随机的水平区分部分真实分子与生成分子。除此之外,CoCoGraph 还能用于分子片段补全和定向分子设计,展示了在分子发现中的实际应用潜力。

获取详情及资源:
0 摘要
开发新的分子化合物对于应对从人类健康到环境可持续发展等一系列紧迫挑战至关重要。然而,由于分子空间极其庞大,在其中探索并发现新分子是一项十分困难的任务。这里介绍了一种名为 CoCoGraph 的协作式受约束图扩散模型,能够生成保证化学有效的分子。得益于模型内置的约束机制以及协作机制,CoCoGraph 在标准基准测试中不仅优于当前最先进的方法,而且具有更高的计算效率。对 36 项化学性质的分析进一步表明,与现有模型相比,CoCoGraph 所生成分子的性质分布与真实分子的分布更加接近。为了展示该模型的应用潜力,构建了一个包含 820 万个合成生成分子的数据库,并展示了该数据库及 CoCoGraph 如何用于分子发现任务。此外,还组织了一项类似图灵测试的评估,由有机化学专家对生成分子的合理性进行判断,从而进一步评估这些生成分子的可信度,以及 CoCoGraph 可能存在的偏差和局限性。
1 引言
发现和开发新的分子化合物是解决诸多紧迫挑战的关键,包括促进新药研发、创造先进材料、设计更加环保的制冷剂、鉴定未知代谢物,以及发现能够与疾病相关靶蛋白结合的分子。然而,类药物分子空间的规模极其庞大(约包含 ($10^{60}) $个分子),这使得新化合物的发现成为一个高维且极其复杂的问题。因此,这些领域有望从人工智能工具中获得巨大收益。这类工具能够生成具有目标性质的新分子,或者根据已有的分子信息重建分子结构。
传统上,分子生成算法依赖于基于规则的模型和优化方法。然而,这些经典方法仅限于对已有分子进行修改,而无法生成全新的分子。随着深度学习的发展,出现了使用变分自编码器、生成对抗网络以及图神经网络(GNNs)的新型分子生成模型。尽管这些模型在性能上有所提升,但仍面临可扩展性、计算效率、分子有效性以及化学约束遵守等方面的挑战。此外,这些模型的泛化能力有限,通常难以生成与训练时见过的分子存在显著差异的新分子。
扩散模型的进展最初来源于图像生成领域,这些进展催生了新的生成技术,能够缓解一些传统方法的不足。在分子生成的背景下,扩散模型包括一个逐步向分子图中添加噪声(原子和/或键)的过程,随后通过去噪过程学习通过去除噪声重建分子。该去噪过程随后用于生成新分子。为了更好地处理分子约束并提高采样效率,基于图的扩散模型如 DiGress 和 CDGS 采用了离散噪声过程。从理论上讲,这种方法有助于生成有效分子,并能够生成训练期间未见过的新分子。然而,构建既能准确反映原始分子分布,又能泛化生成新分子的模型仍然是一个挑战。近期的方法探索了替代的建模形式以应对这些局限,包括具有连续状态和连续时间的基于评分的生成模型(如 GDSS 和 GruM),以及流匹配技术(如 DeFoG)。尽管这些方法在分子生成方面取得了重要进展,但在精确捕捉分子性质分布的复杂性方面仍面临挑战。因此,需要在分子生成技术上进一步改进,以确保既能高效生成化学有效的分子,又能全面探索化学空间。
这里提出了一种协作式受约束离散扩散模型(Collaborative Constrained Discrete Diffusion Model,CoCoGraph),其包含两个关键机制。首先且最重要的是,模型采用了一种涉及双边交换(Double Edge Swapping,DES)的离散过程,并约束每个原子始终保持正确的化合价,保持分子的分子量、原子数、化学键数以及分子式等基本化学属性不变。其次,引入了一种协作机制。在去噪过程的每一个步中训练两个模型。第一个模型为扩散模型,负责在每个去噪步骤预测需要被恢复的 DES 操作,输入包括分子图特征以及当前扩散时间步。第二个模型为时间模型,负责学习预测扩散过程的时间步,并通过向扩散模型提供当前分子图距离有效分子还有多远的信息与其协同工作,使扩散模型能够根据去噪过程的实际进展情况(而非预期进展情况)调整其 DES 预测。

图 1 | 受约束协作图扩散模型 CoCoGraph a. 受约束扩散过程:在分子图中通过每一步交换两条化学键引入噪声。随后训练扩散模型和时间模型以逆转该过程。b. 扩散模型:在每一步,接收分子图特征和时间步作为输入,并对所有可能的边交换操作分配评分。c. 时间模型:接收分子特征并估计当前分子图的时间步。d. 采样模型。e. 采样示例。使用训练好的扩散模型和时间模型从给定分子式的随机分子图协作生成去噪轨迹。最终选择预测时间最小的分子作为生成分子(e)。
CoCoGraph 生成的新分子在目前最全面的现有基准测试中实现了 100% 的化学有效性,并在该基准上超越了当前最先进的方法。此外,这些生成分子的化学性质分布在统计意义上比现有生成模型产生的分子更接近已知化学空间中的真实分子分布。值得注意的是,这种受约束的协作式方法在实现上述结果的同时,所需参数量最多可比现有模型减少一个数量级,并具有更高的采样效率。由于模型较为轻量,基于该模型构建了一个包含 820 万个合成生成分子结构的数据集。基于该数据集开展了一项类似图灵测试的实验,以评估人类专家是否能够区分生成分子和真实分子。结果表明,至少接受过本科阶段有机化学教育的化学工作者识别真实分子的准确率仅为 62%(未接受研究生教育者为 59%)。对于某些特定类型的分子,其识别准确率在统计学上与 50% 并无显著差异。这表明真实分子与生成分子在人类观察者眼中具有相似的感知特征(尽管该实验并不能证明两者完全无法区分)。此外,还展示了 CoCoGraph 在基于分子补全的应用中的潜力。在保留分子核心结构的同时,可以向已有分子添加新的分子片段,从而实现针对性的分子设计。这些结果表明,该模型能够有效地探索广阔的化学空间,并展示了该方法在实际应用中的潜力。
2 结果
2.1 用于生成固定度序列图的协作式受约束扩散模型
用于分子生成的离散图扩散模型(如 DiGress 和 CDGS)已被证明优于连续扩散模型。更多近期的模型(如 Construct)进一步引入了专门针对图结构设计的、能够感知约束的扩散过程。通过采用能够感知部分化学约束并自动满足这些约束的扩散加噪过程,这类模型能够在分子生成过程中强制遵守特定的化学规则和化学性质。
这里进一步约束了单次扩散过程中所考虑的分子图,使得每一步加噪/去噪操作都保持节点(即原子和分子式)和度序列(即每个原子的确切键数,也就是化合价)不变。为实现这一目标,在每一个扩散加噪步骤中执行一次边交换操作:随机选择分子中的两条化学键 AB 和 CD,并将其移除,然后形成两条新的化学键 AC 和 BD。通过这种方式,分子图逐渐扩散至 Molloy–Reed 分布,即在固定度序列图空间上的最大熵分布。通过构造方式直接满足化学约束意味着:(1)不满足约束条件的无效分子永远不会被生成;(2)分子结构的搜索空间被大幅缩减;(3)模型无需学习这些化学约束;(4)模型可以设计得更小,并将学习能力集中于更细微的分子特征。
去噪扩散模型负责学习如何撤销这些边交换操作。其输入包括扩散过程的时间步 (t) 以及经过三层图神经网络处理的分子图。得到的节点嵌入与边特征、分子图特征以及时间信息共同作为输入,通过一个前馈神经网络评估每一种边交换操作的合理性。需要指出的是,尽管 CoCoGraph 通常从一个真实分子开始进行加噪过程,但也能够直接从依据任意分子式构建的随机分子图出发生成分子。
仅使用扩散模型时,观察到扩散过程在训练集中的推进速度并不均匀。即使根据分子图大小(即化学键数量)对扩散步数进行了缩放,部分分子仍会很快被随机化,而另一些分子则需要更长时间。因此,扩散模型中的时间特征并不能提供足够有效的信息。基于这一观察,引入了一个时间模型,用于估计当前分子图距离真实分子还有多远。该模型以分子图作为输入,并输出一个归一化时间。在采样过程中,该归一化时间被输入扩散模型,用以替代实际时间步,从而通过提供扩散轨迹中实际位置的相关信息与扩散模型协同工作。此外,在采样过程结束时,模型并不直接选择最后生成的分子,而是从整个生成轨迹中选择预测时间最小的分子,即理论上最接近真实分子的分子。时间模型的结构与扩散模型非常相似:输入分子图经过三层图神经网络处理,随后利用生成的嵌入表示预测时间。消融实验表明,尽管协作机制的重要性低于约束机制,但它能够提高生成分子的真实性。
表1 | 基于 PubChem 数据库评估的 GuacaMol 基准测试模型比较

协作式受约束扩散方法 CoCoGraph 的一个重要结果是,其模型架构具有显著更高的效率,与当前最先进的方法相比,所需参数量最多可减少一个数量级,并且能够更快地生成新分子。通过将化学约束直接融入扩散过程,模型能够天然地保持化学有效性,而无需通过学习来掌握这些规则。这种模型复杂度的降低进一步转化为更低的计算需求,使分子生成更加易于实现。更重要的是,基于约束的设计使模型能够将其学习能力集中于捕获真实分子的结构模式。因此,尽管模型规模更小,仍然能够获得更优的性能。
2.2 CoCoGraph 在标准基准测试中优于现有分子生成模型
为了全面评估 CoCoGraph 的性能,将其与当前最先进的分子生成模型在 GuacaMol 基准测试套件上进行了比较。该评估框架提供了一套标准化指标,用于评估生成分子的质量和多样性。比较对象包括六种当前最先进的模型:Junction Tree Variational Autoencoder(JTVAE)、DiGress、GDSS、GruM,以及严格模式和宽松模式下的 DeFog。为了确保在不同数据集上训练的模型之间能够进行公平比较,所有模型均使用经过处理的 PubChem 参考数据库进行评估。该数据库经过筛选,仅保留原子数不超过 70 个且与任何训练数据集均不存在重叠的分子,共包含 9470 万个分子。该数据库能够较为全面地表征已知化学空间,并为模型泛化能力提供可靠评估。此外,还设置了一个额外的朴素基线模型作为对照。该模型通过对真实分子进行随机修改来生成新分子。
考虑了两种不同的 CoCoGraph 模型。模型的 BASE 版本 总参数量为 534,000,其中扩散模型占 471,000,时间模型占 63,000,参数量比除 GDSS(74,000)以外的所有对比模型都少一个数量级。指纹增强版(fingerprint-enhanced,FPS)CoCoGraph 模型将分子指纹作为额外输入,以改善扩散模型中的边交换预测和时间模型中的时间预测,总参数量为 440 万,仍然比除 GDSS 之外的所有基线模型参数量更少。
两种 CoCoGraph 模型均实现了100% 的化学有效性,这是受约束扩散方法在整个扩散过程中天然遵守化学规则的直接结果。在保持完全有效性的同时,模型的分子唯一性未受影响(BASE 版本为 99.8%,FPS 版本为 99.9%),新颖性也维持在高水平(两种版本均为 95.7%),表明施加化合价约束并不会过度限制化学空间的探索。生成的分子还与作为生成起点的原始分子和随机分子图有所不同。一些非扩散方法(如 JTVAE)也能够达到完美的化学有效性;然而,这些模型在分子性质分布匹配上通常较差。其他扩散模型的有效性则相对较低。值得注意的是,所有 CoCoGraph 变体在评估模型中均实现了更高的新颖性,显示出在化学空间探索方面的优势。
除了有效性、唯一性和新颖性之外,生成分子的理化性质分布是评价生成模型的关键指标。目标是生成既具有新颖性又具有合理性的分子,即其理化性质在统计意义上与真实分子相似。GuacaMol 基准通过计算生成分子与真实分子在十项理化性质分布上的 Kullback–Leibler(KL)散度来量化这一能力。KL 散度评分表明,CoCoGraph 所生成分子的性质分布与真实分子的性质分布最为接近。BASE 版本和 FPS 版本分别获得了 95.7% 和 96.3% 的评分。相比之下,移除时间模型的 CoCoGraph FPS 消融版本仅获得 94.4% 的评分,说明时间模型有助于学习更准确的性质分布。这些结果显著优于所有基线模型。尤其是 CoCoGraph FPS 模型取得了最佳整体表现,表明这种受约束的协作式方法能够比现有方法更准确地捕捉分子性质的潜在分布,从而生成更能反映已知化学空间中真实分子特征的分子。
为了提供更细致的分析,对 GuacaMol 基准测试中使用的十项分子性质进行了逐一分析。本分析重点关注 FPS CoCoGraph 模型。在分子量、内部相似性、Bertz 复杂度指数和芳香环数量这四项性质上,CoCoGraph 的分布拟合效果最佳。对于分子 log P,CoCoGraph 的表现优于 JTVAE 和 DiGress,但略低于 DeFoG 模型。在氢键供体数量方面,所有基线模型的分布匹配效果优于 CoCoGraph。总体来看,CoCoGraph FPS 在十项性质中,有八项优于 JTVAE 和 DiGress,有六项优于 DeFoG 的两个变体。BASE 版本的 CoCoGraph 性能略低于 FPS 版本,但仍优于其他对比模型。

图2 | CoCoGraph FPS 在 GuacaMol 基准性质上的性能比较 a–f. 六项分子性质的分布:分子量(a);分子 log P(b);内部相似性(c);Bertz 复杂度指数(d);芳香环数量(e);氢键供体数量(f)。对于每项性质,CoCoGraph 生成分子的值分布(黑线)与 PubChem 参考数据库中原始分子的分布(绿色区域)、以及 JTVAE(紫色虚线)、DiGress(橙色虚线)、DeFoG 严格模式(粉色虚线)和 DeFoG 宽松模式(浅绿色虚线)生成分子的分布进行了比较。显示了每个模型与原始分布之间的 JS 距离值。g–j. JS 距离的
在多个模型和分子性质上的这一改进进一步说明了受约束协作式方法在生成既化学有效又结构新颖的分子方面的有效性,同时这些分子在理化性质上既真实又多样化。例如,虽然 JTVAE 生成的分子总是有效且合理,但分布分析显示其理化性质被限制在较窄的范围内,表明多样性有限。其他基线模型生成的分子也存在类似情况,但程度较轻。在计算效率方面,CoCoGraph 的推理速度位居第二,BASE 版本每秒可生成 1.19 个分子,FPS 版本每秒可生成 0.98 个分子。尽管 GDSS 的生成速度快于 CoCoGraph,但其在理化性质分布匹配方面的性能明显较低。因此,CoCoGraph 在保证计算效率的同时,实现了最佳的生成质量。
2.3 CoCoGraph 生成的分子在多种化学性质上均具有合理性
尽管 GuacaMol 等标准基准测试为评估分子生成模型提供了有用的起点,但它们仅针对有限的理化性质进行性能评估。此外,一旦某个基准测试成为标准,它在算法设计和评估过程中可能被反复使用,从而导致模型在相关性质上出现过拟合。为了对模型生成化学合理分子的能力进行更全面的评估,分析扩展至 36 项化学性质。为了减少选择偏差,采用 OpenAI 的 O1-mini 模型——一个未参与该模型训练且不了解训练数据及结果的外部代理——来识别一组可通过 RDKit 计算的、具有代表性且多样的分子描述符。这种方法能够避免在选择特性时无意识地偏向模型表现较好的属性,并降低选择偏向训练或性能特征的属性的可能性。所选属性涵盖广泛的分子特征,包括大小与组成指标、拓扑特征、电子性质以及类药性指标。
采用相同的方法,计算了 PubChem 参考数据库分子与不同模型生成分子在各项性质分布之间的 Jensen–Shannon(JS)距离,并对其中十项性质的分布进行了展示。

图3 | CoCoGraph FPS 在 36 项化学性质子集上的详细性能比较 a–j. 十项分子性质的分布:重原子数(a);价电子数(b);N–O 数量(c);Balaban’s J 指数(d);氢键受体数量(e);环数量(f);TPSA(g);定量类药性估计(h);最大绝对部分电荷(i);NH/OH 数量(j)。对于每项性质,将 CoCoGraph FPS 模型生成分子的分布(黑线)与 PubChem 参考数据库中分子的分布(绿色分布),以及 JTVAE(紫色虚线)、DiGress(橙色虚线)、DeFoG 严格模式(粉色虚线)和 DeFoG 宽松模式(浅绿色虚线)生成分子的分布进行比较。图中还给出了每个模型与原始分布之间的 JS 距离值。k–n. JS 距离的
所有 36 项性质的综合比较显示,CoCoGraph 在至少 66.6% 的性质上优于其他基线模型。所展示的十项性质用于反映这一整体性能分布:其中八项性质显示 CoCoGraph 优于所有竞争模型;定量类药性估计中,除 JTVAE 外的所有模型均优于 CoCoGraph;NHOH 数量则显示所有基线模型均优于 CoCoGraph。CoCoGraph 在拓扑特征(Balaban’sJ 指数)、电子性质(价电子数量和最大绝对部分电荷)以及结构描述符(重原子数、环数量、拓扑极性表面积,TPSA)方面表现出特别优势。这些性质对于药物化学和药物发现应用十分关键。这些结果进一步验证了受约束协作式方法的有效性。
2.4 大规模合成分子数据库
CoCoGraph 具备高计算效率,其参数量较少且采样效率高,使得在有限计算资源下也能实现大规模分子生成。模型在单个中端图形处理单元(GPU)上每小时可生成数千个化学有效分子,从而构建了一个包含 820 万个分子的综合数据库,其中冗余率仅为 7.1%。结合 95.7% 的新颖性率,该数据库约包含 730 万个全新、唯一且化学有效的分子,这些分子在 PubChem 数据库中不存在。如此大规模、化学有效且新颖的分子数据库,可作为探索类药物化学空间新区域的重要资源,并有助于加速药物开发和材料科学等多个领域的发现过程。
为了评估合成分子在领域专家看来具有多大程度的合理性,设计了一项分子类图灵测试。有机化学、生物化学及相关领域的专家会看到成对出现的分子。每一对分子具有相同的分子式,其中一个是来自原始数据集的真实分子,另一个是由 CoCoGraph 生成的分子。通过匹配分子式,这一设计控制了分子大小和原子组成等变量,迫使参与者依赖关于结构合理性和理化性质的化学知识来区分真实分子和生成分子。参与者需要在 20 轮测试中判断哪一个分子是原始分子,并报告自己的专业经验水平。
收集了来自 121 位专家 的回答,总共完成了 2,420 对分子配对的评估。结果显示,专家在区分真实分子与 CoCoGraph 生成分子时的总体准确率为 62%,这一准确率在统计上不同于随机猜测预期的 50% 基线,但数值上仍接近该基线。按专业经验水平进行分析可见,随着专业经验的增加,分辨能力略有提升:本科生参与者的准确率为 60%,研究生参与者的准确率为 64%。

图4 | 类图灵测试中的表现 通过计算参与者在所有尝试中正确识别原始非生成分子的准确率,评估其在类图灵测试中的表现。误差线表示通过自助法计算得到的均值标准误。a. 类图灵测试中参与者的总体准确率。b. 按有机化学教育水平划分的准确率。c. 按分子大小划分的准确率,以原子数量表示。d. 按环结构划分的准确率。e. 按分子构象柔性划分的准确率。f. 按化学键类型划分的准确率。g. 按官能团划分的准确率。
为了进一步理解 CoCoGraph 的优势和潜在偏差,沿多个维度进行了分析。较大的合成分子更容易被专家识别,这表明随着分子复杂性增加,生成难度可能有所提高。环数量较少的分子更难分类,其中无环分子对应的专家判断表现与随机猜测在统计上相容。类似地,以脂肪族结构为主的分子也表现出与随机猜测相容的结果。虽然从统计上不能排除“真实分子与生成分子无法区分”的假设,但这并不能证明二者确实不可区分。贝叶斯模型选择分析证实,在这些情况下,与其他模型相比,假设真实分子和生成分子在参与者看来不可区分的模型比其他模型更合理。在分子的构象柔性或官能团方面,没有观察到明显的规律或趋势。
总之,结果表明:(1)即使是接受过大学水平有机化学训练的参与者,也有接近四成的情况未能正确识别真实分子;(2)对于某些特定类型的分子,例如无环分子和以脂肪族结构为主的分子,参与者的判断表现实际上与随机猜测相近;(3)没有发现某一类分子会被系统性地误判,或明显容易被识别出来,否则这将提示模型存在清晰的偏差。这些结果说明,CoCoGraph 能够较高保真度地捕捉真实分子的潜在结构模式和化学关系,同时能够探索化学空间中的新区域。
2.5 通过数据库搜索和基于补全的条件生成应用于药物发现
这个包含 820 万个分子的数据库提供了大量具有化学合理理化性质的新分子。作为潜在应用的示例,利用该数据库筛选了性质与对乙酰氨基酚相似的新分子。为此,选取了九项关键分子性质,并基于这些性质构建的特征空间(已归一化)计算数据库中每个分子与对乙酰氨基酚的欧氏距离,并据此对所有分子进行排序。排序靠前的六个候选分子在结构上具有多样性,同时保持了与对乙酰氨基酚相似的性质分布。

图5 | 通过数据库搜索和基于补全的生成得到的与对乙酰氨基酚相似的分子候选 a. 在 820 万个分子数据库中搜索与对乙酰氨基酚理化性质相似的分子,排名前六的候选分子。b. 通过基于补全的条件生成,在对乙酰氨基酚上添加小片段(2–5 个重原子)生成的前六个候选分子。c. 通过基于补全的条件生成,在对乙酰氨基酚上添加中等片段(6–15 个重原子)生成的前六个候选分子。对于每个候选分子,显示其排名、在九项理化性质空间中与对乙酰氨基酚的欧氏距离(dist)以及其性质的雷达图。
最后,为了进一步展示 CoCoGraph 的潜在用途,针对寻找性质与对乙酰氨基酚相似化合物这一问题,通过修改采样过程,利用基于补全的条件生成实现定向分子设计。具体而言,修改后的采样过程结合了一个固定的原始分子(例如对乙酰氨基酚)和一个随机分子图。该随机分子图对应于一个具有任意分子式的片段。随后,将该片段连接到原始分子上,并仅对该片段应用 CoCoGraph 的去噪过程,同时保持原始分子不变。这种方法能够在保留目标结构特征的同时,通过受控添加片段探索化学空间,从而生成新的候选分子。
基于补全的条件采样通过添加小片段(2–5 个重原子)和中等片段(6–15 个重原子)生成候选分子。随后,根据这些候选分子在九项理化性质上与对乙酰氨基酚之间的欧氏距离进行排序。每种片段大小对应的排名靠前候选分子结果显示,CoCoGraph 能够通过基于补全的条件生成产生合理的候选分子。这一能力对于药物发现中的先导化合物优化可能具有价值,因为在此类任务中,通常需要保留特定分子骨架,同时探索结构变体。
3 讨论
CoCoGraph 是一种协作式受约束离散扩散模型,其在分子设计上实现了完美的化学有效性,并能够生成多样且合理的分子结构。这一性能已通过全面的基准测试和专家评估得到验证。该方法解决了以往分子生成方法面临的关键挑战。以往模型通常通过参数学习化学规则,而 CoCoGraph 则直接在生成过程中施加约束。通过将化学有效性内置于扩散过程,提高了效率,并使模型能够将全部学习能力集中于捕捉真实分子的微妙结构范式。最终,在对生成分子的理化性质分布进行比较时,CoCoGraph 的表现优于 Digress 和 DeFoG 等最先进模型。
另一项重要创新是扩散模型与时间模型之间的协作机制。消融实验显示,仅使用扩散模型并以实际时间步作为输入时,性能较低,这是因为不同分子的去噪过程推进速度不一致。时间模型通过学习分子图距离完成去噪的程度来解决这一问题,从而提供更可靠的进度信息。与其他采用预设时间表或修正步骤的方法不同,该模型能够根据分子的实际状态动态调整预测,从而实现更精确的分子生成。
最后,为展示 CoCoGraph 在化学空间探索中的高效性,生成了一个包含 820 万个合成分子的数据库,其中冗余率为 7.1%,新颖性为 95.7%。正如在新型类药分子空间探索和可能药物候选分子排序的应用中所展示的,这一数据库将为研究社区提供重要资源。
值得注意的是,CoCoGraph 可以根据不同应用场景进行调整。按照其设计,在一次生成过程中,分子式是固定不变的;因此,在分子式未知的应用中,这一点可能构成限制。然而,在未设定初始分子的模式下,CoCoGraph 可以直接从用户指定的任意分子式出发,生成具有相应组成的分子。因此,当需要探索多个分子式时,只需先完成一个更简单的任务,即生成可作为 CoCoGraph 输入的有效分子式。
另一个问题是如何将 CoCoGraph 扩展到生成原子数超过 n=70 的分子。计算四条键之间所有可能双边交换的计算复杂度为
这些研究结果为相关领域的进一步探索开辟了新的研究方向。深入理解模型如何生成分子,有助于评估其探索化学空间的能力。所构建的合成分子数据库可用于探索化学空间,并尝试发现模型生成分子的潜在功能。CoCoGraph 可以扩展用于基于目标性质或观测分子数据的条件分子生成。特别是在质谱(MS)相关的逆问题中,CoCoGraph 可能具有应用价值。此类问题中,前体质量通常可以约束分子式,从而缩小搜索空间;如果在去噪过程中引入来自 MS/MS 谱图的特征,则有可能实现由谱图到分子结构的重建。最后,基于补全的条件生成也可用于药物优化,例如在保留固定骨架的同时进行片段生长或片段替换。这些方向都建立在受约束协作方法的基础上;该方法能够保证生成分子的化学有效性,并使其性质分布接近真实分子。