NC 2025 | FLAME: 用于加速荧光分子设计的模块化人工智能框架
今天介绍的是发表在 Nature Communications 上的一项研究工作。荧光分子在生物成像等领域至关重要,但其设计长期依赖试错实验,受限于结构-性质关系复杂及溶剂效应影响,效率较低。该工作构建了一个模块化人工智能框架 FLAME,通过整合大规模荧光数据库 FluoDB(涵盖 55,169 个分子-溶剂对)、高精度预测模型 FLSF,以及分子生成模型,实现从性质预测到新分子设计的闭环流程。实验结果表明,FLSF在光学性质预测上优于传统方法且计算效率显著提升,并成功指导合成出具有优异荧光性能的新型香豆素衍生物。该框架为荧光探针的理性设计提供了高效工具,有望显著降低实验成本并加速新型分子的发现。

获取详情及资源:
0 摘要
荧光成像作为基础研究与临床实践中不可或缺的技术,其发展主要受荧光分子进展的推动。尽管近年来取得了快速发展,许多已存在的荧光分子仍存在性能不足的问题,其开发过程高度依赖试错实验,这主要源于结构-性质关系的细微差异以及复杂的溶剂效应。
在此基础上,构建了FLAME(FLuorophore design Acceleration ModulE)这一具有模块化架构的人工智能框架,通过整合开源数据库、多种预测模型以及最新分子生成方法,以促进荧光分子设计。首先,构建了目前规模最大的开源荧光分子数据库FluoDB,包含55,169组荧光分子-溶剂配对数据。随后,设计了FLSF(FLuorescence prediction with fluoroScaFfold-driven model)模型,该模型引入了一种基于领域知识构建的指纹,用于表征荧光骨架(称为fluoroscaffold),并验证其能够快速且准确地预测光学性质,其可靠性与潜力已通过分子层面与原子层面的可解释性分析得到验证。进一步引入分子生成模块,以提供具有目标荧光特性的全新化合物。以代表性的3,4-噁唑并香豆素为例完成合成与评估,获得了一种此前未被报道且具有高亮荧光的化合物。
1 引言
发光分子已在多个领域得到广泛应用,其中荧光染料因其小尺寸、化学可操作性和低成本而在生物成像中备受关注。为了满足生物成像中诸如穿透深度和检测灵敏度等特定需求,荧光染料的结构-性能关系(SPR)对设计具有适当激发波长和所需亮度的化合物至关重要。然而,对这一关系的理解仍然有限,主要由于以下两个原因:(1)数据稀缺。也就是说,为了阐明特定荧光染料的SPR,必须测试所有可能的结构修饰,但这面临着合成挑战。此外,现有荧光染料的光物理数据有限,缺乏完整、可比且有意义的数据。(2)多个相互关联的因素可能影响荧光性质。结构上的微小修改可能会导致显著的光学变化,且荧光性质可能受到周围环境的影响,使得荧光染料的合理设计变得困难。
最近,基于机器学习的数据驱动科学在多个学科中展现出了巨大的潜力,例如分子性质预测、虚拟筛选和分子生成等。在荧光性质的预测中,需要考虑多个复杂交织的性质,包括最大吸收波长(
由于机器学习具有端到端的学习模式,可以直接从数据中识别潜在模式并进行预测,且无需任何先验知识,这使其在荧光预测方面具有前景。例如,Ju等人建立了一个名为ChemFluor的数据库,记录了4300多种溶剂化荧光染料的光学性质。荧光染料和溶剂均使用分子描述符或指纹进行表征,并将这些信息结合作为输入,通过梯度提升回归树(GBRT)模型来预测光物理参数。类似地,Park的团队开发了一种基于图卷积网络(GCN)的模型,并采用集成梯度方法预测了七种光学性质,并获得了原子/功能团/溶剂对光学性质的归因。最近,Tsai等人修改了SchNet模型,通过将溶剂化嵌入引入交互层之外,避免过度放大溶质-溶剂的相互作用,从而增强了对
在荧光探针领域的研究者们一直致力于构建一个易于操作的工具包,能够高效生成具有预定光学性能的新型荧光染料,以便在最小化化学合成和实验测试负担的前提下,探索荧光染料的前沿。
最近,Park等人开发了一种生成式深度学习(Gen-DL)模型,用于生成具有七种预定光学性质的分子。为了充分利用化学空间,光学性质预测模型可以与分子生成器结合,进行高效采样,以选择具有所需光学性质的最佳结构。
系统地汇编了实验数据后,构建了一个新的荧光染料数据库FluoDB,其中包含55,169个荧光染料-溶剂对,因为机器学习算法需要大量数据来获取有效信息。与现有数据库相比,FluoDB在数据量和分子多样性方面有所提升,分为16种核心荧光骨架和728个子群。随后,提出了一种新的预测模型FLSF(基于荧光骨架驱动的荧光预测模型),该模型将由728种荧光骨架子群编码的领域知识指纹与传统的消息传递神经网络(MPNN)结合(该方法在预测紫外-可见光谱方面优于SchNet、DTNN和Transformer)。在基准测试中,FLSF在快速且准确地预测光学性质方面优于之前的最先进模型(SOTA)。其可靠性和潜力通过一系列可解释性分析进一步得到了验证。为了直接指导荧光染料的设计,建立了一个人工智能(AI)框架FLAME(荧光染料设计加速模块),通过整合不同的开源数据库、预测模型和分子生成器。以Reinvent 4为代表的分子生成器生成了一系列具有预测光学性质的化合物。在这些化合物中,3,4-噁唑杂环香豆素通过一种新型的一锅法合成,得到了一种未报道的化合物,具有明亮的荧光,展示了FLAME在加速荧光染料设计方面的潜力。

图1|FLAME(荧光团设计加速模块)促进荧光团设计的流程概述。 FLAME框架概述,结合了最新的数据库(包括本研究中构建的FluoDB数据库)、预测模型(即FLSF(基于fluoroScaFfold模型的荧光预测模型),本研究中构建的模型,及其他先进的预测模型)以及分子生成器,并展示了其在设计具有期望荧光的未报道荧光分子中的应用,随后进行了实验评估。
2 结果
2.1 数据收集与处理
在之前的研究中,构建了一个聚焦于近红外荧光染料的数据库(SMFluo1),该数据库包含五种广泛使用的荧光骨架。然而,SMFluo1的数据量有限,难以满足深度学习算法,特别是基于图神经网络(GNN)的方法,如GCN和Attentive FP的需求,导致其预测精度仅为中等水平。此外,评估荧光染料在生物成像中的应用时,需考虑四个关键光物理参数(
考虑到这些因素,数据收集工作如下进行:(i) 通过在PubMed上搜索荧光骨架名称进行文献调查;(ii) 从各种开源数据库中检索实验数据,并从原始文献中补充四个光物理参数及溶剂信息。上述数据在整合后进行了统一处理。
多数荧光化合物源自若干基础骨架,并可能共享相似的光学特性;因此,将荧光分子划分为十二类经典荧光骨架和四类非经典骨架。因此,构建了一个新的数据库FluoDB,包含35,528个独特的荧光染料和55,169个荧光染料-溶剂对,数据库内容包括荧光染料/溶剂的SMILES、荧光骨架类别、实验光物理数据及原始参考文献。
与代表性的开源数据库(如Deep4Chem、DyeAgg、ChemFluor、ChemDataExtrator(CDEx)以及SMFluo1)相比,FluoDB在分子数量和光学信息丰富度方面均有所提升(图2b及补充图2),同时在数据分布和结构分析上表现出更高的分子多样性。此外,FluoDB和Deep4Chem中不同骨架的分布相对均匀,但FluoDB中每一类别的数据丰富度较高。

图2|荧光团数据库FluoDB的构建与分析。 a.数据收集和处理的一般流程,用于构建新的数据库FluoDB,随后对FluoDB进行系统分析和统计,以可视化不同溶剂中各种荧光分子的光学性质。 b.使用Morgan指纹对不同数据库(Deep4Chem36、DyeAgg38、ChemFluor23、ChemDataExtrator (CDEx)35 和 SMFluo129)进行UMAP(统一流形近似与投影)分析。UMAP算法应用了10的邻域大小和0.3的最小距离。每个数据库中独特化合物的数量列在括号中。 c.不同数据库中各种荧光支架的分布。源数据作为源数据文件提供。
2.2 基于FluoDB的数据分析
基于FluoDB,分析了不同参数之间的相关性,结果表明
如前所述,荧光骨架被划分为16类,任何输入的荧光染料都可以迅速分类,从同一组中探索潜在的共性。分析结果表明,不同骨架在
2.3 FLSF的工作流程与预测性能
利用FluoDB,测试了多种开源预测模型,包括GBRT、SMFluo、UVVisML、SchNet和ABT-MPNN。FluoDB-Lite的数据(去除了混合/复合形式的SMILES)被随机划分为7:1:2的比例,分别用于训练、验证和测试。基于解剖-键Transformer的通用分子属性预测模型ABT-MPNN在预测
由于FluoDB中的所有荧光染料都被分为16种核心骨架,并且观察到光学性质之间的分布差异,因此设计了一种特殊的分子指纹——fluoroscaffold(一个由728个荧光骨架子群编码的728维数字指纹),并与基于MPNN的现有特征提取方法结合,以更好地表示荧光染料的分子特征。基于此,构建了一个新的预测模型(FLSF)。如表2所示,FLSF对不同荧光染料的预测效果良好,尤其是在BODIPY基化合物(FluoDB中比例最大)上的表现,
表1|不同模型在FluoDB上的预测性能比较(包括已报道的GBRT、SMFluo、UVVisML、SchNet和ABT-MPNN)。

a.对于
时间相关密度泛函理论(TD-DFT)曾是最广泛使用的预测光学性质的工具。然而,这种传统的理论计算需要高计算和时间成本,在预测

**图3|新开发的FLSF(基于荧光骨架驱动的荧光预测模型)示意图及其预测性能。
** a. FLSF模型架构。基于728个荧光骨架子群(称为fluoroscaffold)的领域知识衍生指纹与消息传递神经网络(MPNN)融合,用于输入荧光团的特征提取。溶剂分子的特征提取基于MPNN。荧光团与溶剂的特征向量共同输入以输出目标性质的预测结果。MLP:多层感知机。 b. FLSF对不同光物理参数的整体预测性能。
表2|FLSF(基于荧光骨架驱动的荧光预测模型)在不同荧光骨架上预测四种光物理参数的性能。

MAE:平均绝对误差;
2.4 FLSF的可解释性分析
模型的可解释性能够展示其如何做出决策并获得相关结果,有助于验证模型的可靠性并从数据中挖掘有价值的信息。首先,从分子层面分析了FLSF的可解释性。研究了FLSF三种状态下的嵌入向量,分别是仅由D-MPNN处理且未进行fluoroscaffold整合的状态、已进行fluoroscaffold整合但未加入溶剂的状态,以及加入溶剂后的状态。根据2D-PCA(二维主成分分析)降维分布图,在
随后,从原子层面对FLSF进行了可解释性分析。具体来说,逐个掩盖荧光染料中的每个原子,比较掩盖前后的预测值(例如

图4|FLSF(基于荧光骨架驱动的荧光预测模型)的可解释性分析。 a. 通过PCA(主成分分析)对FLSF嵌入进行可解释性分析。不同阶段的分子嵌入2D-PCA图:(左)未整合荧光骨架信息前,(中)整合荧光骨架信息后,(右)进一步整合溶剂信息后。每个点根据实验值着色。PC1:第一主成分;PC2:第二主成分。颜色强度表示分子参数实验值的大小,颜色越深表示实验值越高。
2.5 用于荧光分子设计的FLAME构建
尽管大型数据库和各种属性预测模型在显著推动我们对某些分子SPR的认知方面取得了重要进展,但在分子设计的直接应用方面仍然存在空白。因此,旨在构建一个多功能软件包FLAME,以通过将数据库、预测模型和分子生成器集成到一个框架中,满足研究人员在新型荧光染料设计中的实际需求。FLAME提供了六个开源荧光染料数据库,其中包括FluoDB。用户可以输入感兴趣的分子,以搜索数据库中现有分子的相关信息,并使用不同的数据库训练模型,从而展示数据的影响。同时,FLAME还提供了六个开源预测模型(即FLSF、UVVisML、ABT-MPNN、SchNet、SMFluo和GBRT),这些模型可以与上述数据集结合,满足不同用户的多种需求。不同组合的并行比较也有助于找出特定参数预测的最佳设置
为直接获得具有预测光学性质的新结构化合物,引入了新近提出的开源生成式人工智能框架Reinvent 4。作为嵌入FLAME中的分子设计评分工具,预测模型的训练与推理速度至关重要。鉴于FLSF在这两方面表现优异,因此将其与Reinvent 4进行结合(同时也支持用户自主选择模型)。借助FLAME,可以实现从零开始的分子生成和结构修改。例如,如果对开发新型BODIPY衍生物感兴趣,可以在FLAME中设置所需的光物理参数(单个或多个参数)。然后,具有预测光学性质的、属于BODIPY的新生成分子(未记录在FLAME的内置数据库中)就会被筛选出来。或者,可以将感兴趣的父结构和所需参数输入FLAME,以获取优化后的结构。值得注意的是,这两个过程以往高度依赖专业知识和长期经验,而FLAME有望打破传统束缚,更高效地提供荧光染料候选物。

图5|FLAME(荧光团设计加速模块)的示意图及其使用方式。 a. 用于促进荧光团设计的FLAME框架。FLAME由最新数据库和预测模型构建,可用于多种应用,包括虚拟筛选、分子生成和结构优化。SMILES:简化分子线性输入规范;MLP:多层感知机;
表3|通过FLAME(荧光团设计加速模块)对不同数据库与预测模型组合的预测性能直接比较。

MAE:平均绝对误差;MSE:均方误差;RMSE:均方根误差;数据库包括FluoDB和Deep4Chem;预测模型包括GBRT、SMFluo、UVVisML、SchNet、ABT-MPNN以及FLSF(基于荧光骨架驱动的荧光预测模型);
2.6 实验评估
随着基于香豆素的荧光探针因其优异的生物相容性、良好的结构灵活性以及可调控的荧光性质而受到日益关注,FLAME被用于指导新型香豆素衍生物的开发以概念验证。将四个光学参数(
该类骨架的合成策略包括:(a)在硝基甲烷和DABCO存在下加热7-N,N-二甲氨基-4-羟基香豆素;(b)在金纳米颗粒或FeCl3催化下,由4-羟基-3-硝基香豆素与苄醇反应合成;(c)在三苯基膦和五氧化二磷存在下,经微波条件由4-羟基-3-硝基香豆素与酸反应合成。这些已报道的策略在苯环上缺乏结构多样性,再加上对从容易获得的起始材料构建多样化3,4-噁唑杂环香豆素的简单高效合成方法的需求,促使开发新的合成方法。受到之前在异氰酸酯化学方面工作的启发,提出了一种一锅法,通过碱催化从乙基异氰酸乙酯和苯基水杨酸酯合成3,4-噁唑杂环香豆素。在优化条件下,成功合成了16种3,4-噁唑杂环香豆素,这些化合物在苯环上带有电子供给或电子吸收取代基。
通过这些化合物,评估了它们的光学性质。与FLSF的预测结果一致,在香豆素骨架的6位或7位引入氨基(即3h、3o)导致

图6|在FLAME(荧光团设计加速模块)辅助下开发新型荧光团。 a. 通过FLAME生成具有预测光学性质的未报道稠合杂环香豆素。FLSF:基于荧光骨架驱动的荧光预测模型;Reinvent 4:新近报道的开源生成式AI框架。 b. 一锅法合成3,4-噁唑稠合香豆素的新策略。 c. 化合物3h和3o在不同溶剂中的吸收(上)和发射(下)光谱。
3 讨论
FLAME是一个模块化的AI辅助框架,用于荧光染料设计,旨在帮助研究人员高效设计具有所需光学性能的全新分子。为了实现这一目标,扩展了现有的荧光染料数据库,通过补充来自不同方面的数据,如荧光骨架类型和光物理参数,创建了迄今为止最大的开源荧光染料数据库FluoDB,该数据库包含55,169个溶剂化荧光染料和109,054条数据条目,包括四个关键光物理参数:
为了满足分子生成的评分需求,预测模型需要既准确又快速。FLSF设计了一个基于领域知识的指纹,用于表征荧光骨架(称为fluoroscaffold:一个728维的数字指纹),并展现了令人鼓舞的准确性,其训练速度比ABT-MPNN快了10倍。此外,FLSF的预测能力通过一系列分子层面和原子层面的可解释性分析进行了验证。FLSF学到的每个原子的归因与专家知识高度一致。基于FLSF,Reinvent 4作为分子生成器被用于全新荧光染料候选分子的生成。采用我们新开发的无金属方法,通过碱催化苯基水杨酸酯和异氰酸乙酯的串联反应合成了一系列尚未开发的3,4-噁唑杂环香豆素。对这些化合物的预测光学性能与实验结果高度一致(
上述结果展示了FLAME在促进新荧光染料设计方面的进展,能够通过简单地输入所需的光物理参数到FLAME的黑箱中,减少试错实验的负担,从而自动执行多步骤的计算过程,且任何人无需具备荧光或计算方面的专业知识即可处理。凭借其模块化架构,FLAME可以进一步更新新的数据/算法,以随着时间推进加速荧光染料的开发。此外,合成可达性预测模型可以进一步集成到FLAME中,以便在采样过程中进行可合成性评分,回溯合成分析工具(例如AiZynthFinder、Retro和ASKCOS)也可以集成到FLAME中,帮助规划荧光染料候选物的回溯合成,从而提高荧光染料设计和合成的效率。