NC 2025 | FLAME: 用于加速荧光分子设计的模块化人工智能框架

今天介绍的是发表在 Nature Communications 上的一项研究工作。荧光分子在生物成像等领域至关重要,但其设计长期依赖试错实验,受限于结构-性质关系复杂及溶剂效应影响,效率较低。该工作构建了一个模块化人工智能框架 FLAME,通过整合大规模荧光数据库 FluoDB(涵盖 55,169 个分子-溶剂对)、高精度预测模型 FLSF,以及分子生成模型,实现从性质预测到新分子设计的闭环流程。实验结果表明,FLSF在光学性质预测上优于传统方法且计算效率显著提升,并成功指导合成出具有优异荧光性能的新型香豆素衍生物。该框架为荧光探针的理性设计提供了高效工具,有望显著降低实验成本并加速新型分子的发现。

获取详情及资源:

0 摘要

荧光成像作为基础研究与临床实践中不可或缺的技术,其发展主要受荧光分子进展的推动。尽管近年来取得了快速发展,许多已存在的荧光分子仍存在性能不足的问题,其开发过程高度依赖试错实验,这主要源于结构-性质关系的细微差异以及复杂的溶剂效应。

在此基础上,构建了FLAME(FLuorophore design Acceleration ModulE)这一具有模块化架构的人工智能框架,通过整合开源数据库、多种预测模型以及最新分子生成方法,以促进荧光分子设计。首先,构建了目前规模最大的开源荧光分子数据库FluoDB,包含55,169组荧光分子-溶剂配对数据。随后,设计了FLSF(FLuorescence prediction with fluoroScaFfold-driven model)模型,该模型引入了一种基于领域知识构建的指纹,用于表征荧光骨架(称为fluoroscaffold),并验证其能够快速且准确地预测光学性质,其可靠性与潜力已通过分子层面与原子层面的可解释性分析得到验证。进一步引入分子生成模块,以提供具有目标荧光特性的全新化合物。以代表性的3,4-噁唑并香豆素为例完成合成与评估,获得了一种此前未被报道且具有高亮荧光的化合物。

1 引言

发光分子已在多个领域得到广泛应用,其中荧光染料因其小尺寸、化学可操作性和低成本而在生物成像中备受关注。为了满足生物成像中诸如穿透深度和检测灵敏度等特定需求,荧光染料的结构-性能关系(SPR)对设计具有适当激发波长和所需亮度的化合物至关重要。然而,对这一关系的理解仍然有限,主要由于以下两个原因:(1)数据稀缺。也就是说,为了阐明特定荧光染料的SPR,必须测试所有可能的结构修饰,但这面临着合成挑战。此外,现有荧光染料的光物理数据有限,缺乏完整、可比且有意义的数据。(2)多个相互关联的因素可能影响荧光性质。结构上的微小修改可能会导致显著的光学变化,且荧光性质可能受到周围环境的影响,使得荧光染料的合理设计变得困难。

最近,基于机器学习的数据驱动科学在多个学科中展现出了巨大的潜力,例如分子性质预测、虚拟筛选和分子生成等。在荧光性质的预测中,需要考虑多个复杂交织的性质,包括最大吸收波长(λabs)、最大发射波长(λem)、光致发光量子产率(ΦPL)和摩尔吸收系数(εmax)。由Tsuda等人开创的化学分子生成器(ChemTS)采用了大规模并行计算来设计具有吸收/发射波长和振荡强度的荧光染料,使用1024个核心计算了5天,生成了3643个候选荧光染料。尽管该方法功能强大,但其高计算成本需要考虑。

由于机器学习具有端到端的学习模式,可以直接从数据中识别潜在模式并进行预测,且无需任何先验知识,这使其在荧光预测方面具有前景。例如,Ju等人建立了一个名为ChemFluor的数据库,记录了4300多种溶剂化荧光染料的光学性质。荧光染料和溶剂均使用分子描述符或指纹进行表征,并将这些信息结合作为输入,通过梯度提升回归树(GBRT)模型来预测光物理参数。类似地,Park的团队开发了一种基于图卷积网络(GCN)的模型,并采用集成梯度方法预测了七种光学性质,并获得了原子/功能团/溶剂对光学性质的归因。最近,Tsai等人修改了SchNet模型,通过将溶剂化嵌入引入交互层之外,避免过度放大溶质-溶剂的相互作用,从而增强了对ΔEabsΔEemi的预测。

在荧光探针领域的研究者们一直致力于构建一个易于操作的工具包,能够高效生成具有预定光学性能的新型荧光染料,以便在最小化化学合成和实验测试负担的前提下,探索荧光染料的前沿。

最近,Park等人开发了一种生成式深度学习(Gen-DL)模型,用于生成具有七种预定光学性质的分子。为了充分利用化学空间,光学性质预测模型可以与分子生成器结合,进行高效采样,以选择具有所需光学性质的最佳结构。

系统地汇编了实验数据后,构建了一个新的荧光染料数据库FluoDB,其中包含55,169个荧光染料-溶剂对,因为机器学习算法需要大量数据来获取有效信息。与现有数据库相比,FluoDB在数据量和分子多样性方面有所提升,分为16种核心荧光骨架和728个子群。随后,提出了一种新的预测模型FLSF(基于荧光骨架驱动的荧光预测模型),该模型将由728种荧光骨架子群编码的领域知识指纹与传统的消息传递神经网络(MPNN)结合(该方法在预测紫外-可见光谱方面优于SchNet、DTNN和Transformer)。在基准测试中,FLSF在快速且准确地预测光学性质方面优于之前的最先进模型(SOTA)。其可靠性和潜力通过一系列可解释性分析进一步得到了验证。为了直接指导荧光染料的设计,建立了一个人工智能(AI)框架FLAME(荧光染料设计加速模块),通过整合不同的开源数据库、预测模型和分子生成器。以Reinvent 4为代表的分子生成器生成了一系列具有预测光学性质的化合物。在这些化合物中,3,4-噁唑杂环香豆素通过一种新型的一锅法合成,得到了一种未报道的化合物,具有明亮的荧光,展示了FLAME在加速荧光染料设计方面的潜力。

图1|FLAME(荧光团设计加速模块)促进荧光团设计的流程概述。 FLAME框架概述,结合了最新的数据库(包括本研究中构建的FluoDB数据库)、预测模型(即FLSF(基于fluoroScaFfold模型的荧光预测模型),本研究中构建的模型,及其他先进的预测模型)以及分子生成器,并展示了其在设计具有期望荧光的未报道荧光分子中的应用,随后进行了实验评估。

2 结果

2.1 数据收集与处理

在之前的研究中,构建了一个聚焦于近红外荧光染料的数据库(SMFluo1),该数据库包含五种广泛使用的荧光骨架。然而,SMFluo1的数据量有限,难以满足深度学习算法,特别是基于图神经网络(GNN)的方法,如GCN和Attentive FP的需求,导致其预测精度仅为中等水平。此外,评估荧光染料在生物成像中的应用时,需考虑四个关键光物理参数(λabsλemΦPLεmax),其中λabsλem与穿透深度相关,而ΦPL×εmax则反映亮度。值得注意的是,在设计生物成像探针时,还应考虑其他因素,如闪烁、热稳定性、光漂白和标记特异性,但由于数据获取的限制,这些属性的参数未包含在FluoDB中。

考虑到这些因素,数据收集工作如下进行:(i) 通过在PubMed上搜索荧光骨架名称进行文献调查;(ii) 从各种开源数据库中检索实验数据,并从原始文献中补充四个光物理参数及溶剂信息。上述数据在整合后进行了统一处理。

多数荧光化合物源自若干基础骨架,并可能共享相似的光学特性;因此,将荧光分子划分为十二类经典荧光骨架和四类非经典骨架。因此,构建了一个新的数据库FluoDB,包含35,528个独特的荧光染料和55,169个荧光染料-溶剂对,数据库内容包括荧光染料/溶剂的SMILES、荧光骨架类别、实验光物理数据及原始参考文献。

与代表性的开源数据库(如Deep4Chem、DyeAgg、ChemFluor、ChemDataExtrator(CDEx)以及SMFluo1)相比,FluoDB在分子数量和光学信息丰富度方面均有所提升(图2b及补充图2),同时在数据分布和结构分析上表现出更高的分子多样性。此外,FluoDB和Deep4Chem中不同骨架的分布相对均匀,但FluoDB中每一类别的数据丰富度较高。

图2|荧光团数据库FluoDB的构建与分析。 a.数据收集和处理的一般流程,用于构建新的数据库FluoDB,随后对FluoDB进行系统分析和统计,以可视化不同溶剂中各种荧光分子的光学性质。 b.使用Morgan指纹对不同数据库(Deep4Chem36、DyeAgg38、ChemFluor23、ChemDataExtrator (CDEx)35 和 SMFluo129)进行UMAP(统一流形近似与投影)分析。UMAP算法应用了10的邻域大小和0.3的最小距离。每个数据库中独特化合物的数量列在括号中。 c.不同数据库中各种荧光支架的分布。源数据作为源数据文件提供。

2.2 基于FluoDB的数据分析

基于FluoDB,分析了不同参数之间的相关性,结果表明λabsλem之间存在明显的正相关关系。此外,分子量(MW)与λabsλem以及εmax之间也呈现一定的正相关性,这一结论与散点图分析及实验结果一致(即引入较大的π桥结构或强电子受体/供体通常用于较长的吸收和发射波长,而这些修饰往往会增加分子量)。外部因素,如周围溶剂,已被证实会影响部分荧光分子染料的光学性质。为了在更大范围内研究这一点,从FluoDB中选择了具有不同溶剂(≥5种)实验数据的荧光染料。所选分子在不同溶剂中的每个光物理参数的方差分布结果表明这些参数随溶剂类型的变化而变化,强调了溶剂在预测光学性质中的重要性。

如前所述,荧光骨架被划分为16类,任何输入的荧光染料都可以迅速分类,从同一组中探索潜在的共性。分析结果表明,不同骨架在λabsλem的分布上存在差异,大多数组位于紫外-可见光范围内,而BODIPY、卟啉和Squaraine则位于更长的波长范围(550nm以上)。此外,吖啶、萘酰亚胺、香豆素和花青类表现出更大的波长可调性。同时,BODIPY、卟啉和方酸类的Δλ(斯托克斯位移,Δλ=λemλabs)相对较小(约25nm)。对这些大规模数据的统计分析有助于选择理想的荧光骨架作为起点,同时也准备了一个工具包,用户可以通过该工具包从数据库中搜索与目标分子具有所需相似度的荧光染料。

2.3 FLSF的工作流程与预测性能

利用FluoDB,测试了多种开源预测模型,包括GBRT、SMFluo、UVVisML、SchNet和ABT-MPNN。FluoDB-Lite的数据(去除了混合/复合形式的SMILES)被随机划分为7:1:2的比例,分别用于训练、验证和测试。基于解剖-键Transformer的通用分子属性预测模型ABT-MPNN在预测λabsλem方面表现最好,突显了将Transformer与GNN结合用于分子表示的优势。然而,引入注意力机制的ABT-MPNN导致训练速度比UVVisML(一个有向MPNN,D-MPNN)慢了10倍,尽管λabsλem的平均绝对误差(MAE)分别改善了9.18%和4.86%。为了提高实用性,建议用一种新方法替代ABT-MPNN中的注意力机制,以加速训练,同时保持预测精度。

由于FluoDB中的所有荧光染料都被分为16种核心骨架,并且观察到光学性质之间的分布差异,因此设计了一种特殊的分子指纹——fluoroscaffold(一个由728个荧光骨架子群编码的728维数字指纹),并与基于MPNN的现有特征提取方法结合,以更好地表示荧光染料的分子特征。基于此,构建了一个新的预测模型(FLSF)。如表2所示,FLSF对不同荧光染料的预测效果良好,尤其是在BODIPY基化合物(FluoDB中比例最大)上的表现,λabs/λem的MAE分别为6.44nm/7.37nm。对于非经典骨架(如[6+5]、[6+6]、6-n-5、6-n-6),FLSF同样表现良好,显示出处理新型荧光染料的潜力。总体而言,FLSF在λabsλem预测中表现优异(R2=0.94),而在ΦPLεmax预测方面仍有提升空间(R2约为0.6)。随后进行了FLSF的基准测试,并将结果与报告的最先进模型(SOTA)进行直接比较。FLSF在λabsλemεmax的预测准确性上明显优于ABT-MPNN(ΦPL相同),且速度更快,表明其在候选荧光染料高通量筛选中的巨大潜力。为了检验FLSF是否能够捕捉溶剂效应,选取了一个多溶剂测试集(具有不同溶剂实验数据的荧光染料≥4种)以及对照测试集(相同溶剂中的荧光染料),并比较了FLSF与其他基准模型的预测性能。结果显示,FLSF在多溶剂测试集上具有最佳预测性能。令人高兴的是,FLSF还可以高精度地预测表现出溶剂变色效应的荧光染料的λabsλem,进一步支持了其捕捉溶剂效应的潜力。

表1|不同模型在FluoDB上的预测性能比较(包括已报道的GBRT、SMFluo、UVVisML、SchNet和ABT-MPNN)。

a.对于λabsλem,MAE/RMSE的单位为nm,然而nm对于ΦPLεmax不适用(εmax采用log10εmax)。 b.GBRT、SMFluo、UVVisML、SchNet和ABT-MPNN均基于其开源代码实现。 c.FLSF(基于fluoroScaFfold模型的荧光预测模型)与FLSF_MACCS/FLSF_Morgan的区别在于特征提取方法,FLSF引入了fluoroscaffold,而后者采用传统的MACCS/Morgan指纹。 d.λabs:最大吸收波长;λem最大发射波长;ΦPL光致发光量子产率;εmax摩尔吸收系数;MAE平均绝对误差;MSE均方误差;RMSE均方根误差;R2决定系数。

时间相关密度泛函理论(TD-DFT)曾是最广泛使用的预测光学性质的工具。然而,这种传统的理论计算需要高计算和时间成本,在预测λabsλem时准确性不足,尤其是在涉及ΦPL等各种辐射和非辐射过程的参数时。为了与FLSF进行直接比较,我们从FluoDB中收集了162个荧光染料-溶剂对,并使用TD-DFT计算了它们的λabsλem。FLSF在预测λabsλem时的MAE比TD-DFT低了超过0.2eV。值得注意的是,FLSF可以在不到一秒的时间内提供所有预测结果,而当前测试集中的TD-DFT平均计算时间超过200个CPU小时。

**图3|新开发的FLSF(基于荧光骨架驱动的荧光预测模型)示意图及其预测性能。

** a. FLSF模型架构。基于728个荧光骨架子群(称为fluoroscaffold)的领域知识衍生指纹与消息传递神经网络(MPNN)融合,用于输入荧光团的特征提取。溶剂分子的特征提取基于MPNN。荧光团与溶剂的特征向量共同输入以输出目标性质的预测结果。MLP:多层感知机。 b. FLSF对不同光物理参数的整体预测性能。λabs:最大吸收波长;λem:最大发射波长;ΦPL:光致发光量子产率;εmax:摩尔吸收系数。 c. FLSF(红点)与TD-DFT(时变密度泛函理论)计算(灰点)在λabs(左)和;λem(右)预测中的比较。MAE:平均绝对误差,R2:决定系数。源数据以Source data文件形式提供。

表2|FLSF(基于荧光骨架驱动的荧光预测模型)在不同荧光骨架上预测四种光物理参数的性能。

MAE:平均绝对误差;λabs:最大吸收波长;λem:最大发射波长;ΦPL:光致发光量子产率;εmax:摩尔吸收系数.

2.4 FLSF的可解释性分析

模型的可解释性能够展示其如何做出决策并获得相关结果,有助于验证模型的可靠性并从数据中挖掘有价值的信息。首先,从分子层面分析了FLSF的可解释性。研究了FLSF三种状态下的嵌入向量,分别是仅由D-MPNN处理且未进行fluoroscaffold整合的状态、已进行fluoroscaffold整合但未加入溶剂的状态,以及加入溶剂后的状态。根据2D-PCA(二维主成分分析)降维分布图,在λabsλem预测任务中,短波长和长波长荧光染料的分布存在明显差异,表明FLSF能够有效地识别它们具有不同波长的结构特征。有趣的是,fluoroscaffold的整合使这一差异更加显著,并且在引入溶剂后,数据分布的离散性进一步提高,突显了骨架信息在预测中的重要性,并暗示FLSF在捕捉由溶剂引起的微小差异时非常敏感。

随后,从原子层面对FLSF进行了可解释性分析。具体来说,逐个掩盖荧光染料中的每个原子,比较掩盖前后的预测值(例如λem),以揭示每个原子的归因。以香豆素为例,香豆素已被证明覆盖了广泛的波长范围,为验证FLSF的可靠性提供了宝贵的SPR信息。通过经典的D-π-A结构,在苯环上引入电子供体基团(EDG)和在内酯环上引入电子吸收基团(EWG)可以有效实现香豆素的红移,这一点在实验中已有验证。该研究的结果表明,FLSF掌握了这些规则。此外,研究人员发现将位置2的酮基替换为亚胺基也可以产生红移(例如化合物e-g),FLSF同样能掌握这一规律。值得注意的是,尽管FluoDB中没有记录香豆素衍生物中位置1以外的取代基,FLSF仍能指示氧原子在该位置对红移的贡献,这一点也得到了最近实验结果的支持。这表明,FLSF具有良好的泛化能力和可靠性,并可能为荧光染料设计提供新的结构修改建议。

图4|FLSF(基于荧光骨架驱动的荧光预测模型)的可解释性分析。 a. 通过PCA(主成分分析)对FLSF嵌入进行可解释性分析。不同阶段的分子嵌入2D-PCA图:(左)未整合荧光骨架信息前,(中)整合荧光骨架信息后,(右)进一步整合溶剂信息后。每个点根据实验值着色。PC1:第一主成分;PC2:第二主成分。颜色强度表示分子参数实验值的大小,颜色越深表示实验值越高。λabs:最大吸收波长;λem:最大发射波长;ΦPL:光致发光量子产率;εmax:摩尔吸收系数。 b. 总结了已报道的基于香豆素荧光团的结构修饰策略(左)及FLSF学习得到的原子贡献(右)。颜色条数值表示在遮蔽特定原子前后预测值的归一化差异。EDG:给电子基团;EWG:吸电子基团;Exp.:实验值;Pred.:预测值。

2.5 用于荧光分子设计的FLAME构建

尽管大型数据库和各种属性预测模型在显著推动我们对某些分子SPR的认知方面取得了重要进展,但在分子设计的直接应用方面仍然存在空白。因此,旨在构建一个多功能软件包FLAME,以通过将数据库、预测模型和分子生成器集成到一个框架中,满足研究人员在新型荧光染料设计中的实际需求。FLAME提供了六个开源荧光染料数据库,其中包括FluoDB。用户可以输入感兴趣的分子,以搜索数据库中现有分子的相关信息,并使用不同的数据库训练模型,从而展示数据的影响。同时,FLAME还提供了六个开源预测模型(即FLSF、UVVisML、ABT-MPNN、SchNet、SMFluo和GBRT),这些模型可以与上述数据集结合,满足不同用户的多种需求。不同组合的并行比较也有助于找出特定参数预测的最佳设置

为直接获得具有预测光学性质的新结构化合物,引入了新近提出的开源生成式人工智能框架Reinvent 4。作为嵌入FLAME中的分子设计评分工具,预测模型的训练与推理速度至关重要。鉴于FLSF在这两方面表现优异,因此将其与Reinvent 4进行结合(同时也支持用户自主选择模型)。借助FLAME,可以实现从零开始的分子生成和结构修改。例如,如果对开发新型BODIPY衍生物感兴趣,可以在FLAME中设置所需的光物理参数(单个或多个参数)。然后,具有预测光学性质的、属于BODIPY的新生成分子(未记录在FLAME的内置数据库中)就会被筛选出来。或者,可以将感兴趣的父结构和所需参数输入FLAME,以获取优化后的结构。值得注意的是,这两个过程以往高度依赖专业知识和长期经验,而FLAME有望打破传统束缚,更高效地提供荧光染料候选物。

图5|FLAME(荧光团设计加速模块)的示意图及其使用方式。 a. 用于促进荧光团设计的FLAME框架。FLAME由最新数据库和预测模型构建,可用于多种应用,包括虚拟筛选、分子生成和结构优化。SMILES:简化分子线性输入规范;MLP:多层感知机;λabs:最大吸收波长;λem:最大发射波长;ΦPL:光致发光量子产率;εmax:摩尔吸收系数。 b. FLAME在多种应用中的基本工作流程,包括数据库检索、光物理性质预测,以及通过整合不同荧光团数据库、预测模型和分子生成器来构建具有预测光学性质的未报道分子。数据库包括Deep4Chem、DyeAgg、ChemFluor、CDEx、SMFluo以及FluoDB;预测模型包括UVVisML、ABT-MPNN、SchNet、SMFluo、GBRT以及FLSF(基于荧光骨架驱动的荧光预测模型)。

表3|通过FLAME(荧光团设计加速模块)对不同数据库与预测模型组合的预测性能直接比较。

MAE:平均绝对误差;MSE:均方误差;RMSE:均方根误差;数据库包括FluoDB和Deep4Chem;预测模型包括GBRT、SMFluo、UVVisML、SchNet、ABT-MPNN以及FLSF(基于荧光骨架驱动的荧光预测模型);λabs最大吸收波长。λabsMAE/RMSE单位为nm。

2.6 实验评估

随着基于香豆素的荧光探针因其优异的生物相容性、良好的结构灵活性以及可调控的荧光性质而受到日益关注,FLAME被用于指导新型香豆素衍生物的开发以概念验证。将四个光学参数(λabsλemΦPLεmax)设定为评分目标,并在筛选过程中重点关注香豆素类化合物,对生成模型进行训练并采样一百万个分子。在FLAME生成的虚拟分子库中,3,4-噁唑并香豆素因其结构新颖性和可合成性而受到关注。已有研究表明,多种含噁唑的染料具有优异的光物理性质(如较高的荧光量子产率),而3,4-噁唑并香豆素的荧光性质尚未见报道。

该类骨架的合成策略包括:(a)在硝基甲烷和DABCO存在下加热7-N,N-二甲氨基-4-羟基香豆素;(b)在金纳米颗粒或FeCl3催化下,由4-羟基-3-硝基香豆素与苄醇反应合成;(c)在三苯基膦和五氧化二磷存在下,经微波条件由4-羟基-3-硝基香豆素与酸反应合成。这些已报道的策略在苯环上缺乏结构多样性,再加上对从容易获得的起始材料构建多样化3,4-噁唑杂环香豆素的简单高效合成方法的需求,促使开发新的合成方法。受到之前在异氰酸酯化学方面工作的启发,提出了一种一锅法,通过碱催化从乙基异氰酸乙酯和苯基水杨酸酯合成3,4-噁唑杂环香豆素。在优化条件下,成功合成了16种3,4-噁唑杂环香豆素,这些化合物在苯环上带有电子供给或电子吸收取代基。

通过这些化合物,评估了它们的光学性质。与FLSF的预测结果一致,在香豆素骨架的6位或7位引入氨基(即3h、3o)导致λabs的红移和ΦPL的增加。随后,研究了这些两个荧光分子在溶剂中的效应。如预期所示,溶剂极性对它们的吸收/发射波长有显著影响,3o在所有溶剂中释放出比3h更强的荧光,因此选择其用于生物成像。在HeLa细胞中经过30分钟孵育后,观察到了明亮的荧光,这表明其在活细胞成像中的潜力。

图6|在FLAME(荧光团设计加速模块)辅助下开发新型荧光团。 a. 通过FLAME生成具有预测光学性质的未报道稠合杂环香豆素。FLSF:基于荧光骨架驱动的荧光预测模型;Reinvent 4:新近报道的开源生成式AI框架。 b. 一锅法合成3,4-噁唑稠合香豆素的新策略。 c. 化合物3h和3o在不同溶剂中的吸收(上)和发射(下)光谱。H2O:水;DMSO:二甲基亚砜;EtOH:乙醇;DCM:二氯甲烷。 d. 不同浓度3o处理的活体HeLa细胞的共聚焦荧光成像。细胞成像重复三次并获得相似结果。

3 讨论

FLAME是一个模块化的AI辅助框架,用于荧光染料设计,旨在帮助研究人员高效设计具有所需光学性能的全新分子。为了实现这一目标,扩展了现有的荧光染料数据库,通过补充来自不同方面的数据,如荧光骨架类型和光物理参数,创建了迄今为止最大的开源荧光染料数据库FluoDB,该数据库包含55,169个溶剂化荧光染料和109,054条数据条目,包括四个关键光物理参数:λabsλemΦPLεmax。与已报道的数据库相比,FluoDB在分子多样性和数据量方面具有更高的表现。通过对FluoDB进行一系列数据分析,获得了不同光物理参数之间的相关性,以及它们与分子量和溶剂类型的关系。

为了满足分子生成的评分需求,预测模型需要既准确又快速。FLSF设计了一个基于领域知识的指纹,用于表征荧光骨架(称为fluoroscaffold:一个728维的数字指纹),并展现了令人鼓舞的准确性,其训练速度比ABT-MPNN快了10倍。此外,FLSF的预测能力通过一系列分子层面和原子层面的可解释性分析进行了验证。FLSF学到的每个原子的归因与专家知识高度一致。基于FLSF,Reinvent 4作为分子生成器被用于全新荧光染料候选分子的生成。采用我们新开发的无金属方法,通过碱催化苯基水杨酸酯和异氰酸乙酯的串联反应合成了一系列尚未开发的3,4-噁唑杂环香豆素。对这些化合物的预测光学性能与实验结果高度一致(λabs的MAE = 13.3 nm,ΦPL = 0.093,log10εmax = 0.430),并获得了一种未报道的香豆素衍生物,具有明亮的荧光(在水中ΦPL = 0.541,log10εmax = 4.314),有望用于生物成像。

上述结果展示了FLAME在促进新荧光染料设计方面的进展,能够通过简单地输入所需的光物理参数到FLAME的黑箱中,减少试错实验的负担,从而自动执行多步骤的计算过程,且任何人无需具备荧光或计算方面的专业知识即可处理。凭借其模块化架构,FLAME可以进一步更新新的数据/算法,以随着时间推进加速荧光染料的开发。此外,合成可达性预测模型可以进一步集成到FLAME中,以便在采样过程中进行可合成性评分,回溯合成分析工具(例如AiZynthFinder、Retro和ASKCOS)也可以集成到FLAME中,帮助规划荧光染料候选物的回溯合成,从而提高荧光染料设计和合成的效率。