Nat. Chem. 2025 | AI辅助迭代实验–学习循环发现高荧光共价有机框架
今天介绍的是发表在 Nature Chemistry 上的一项研究工作。具有目标性能的多孔晶体材料面临化学设计空间庞大、实验筛选成本高等难题。为加速发现高荧光共价有机框架,构建了融合模型推荐、实验验证与主动学习的交互式实验–学习演化流程,并将电子构型和量子层面信息纳入预测。在20种胺和26种醛构成的520种可能组合中,仅实验评估11种COF,便获得光致发光量子产率达41.3%的材料。结果还揭示了HOMO–LUMO匹配和激发态电荷分布对荧光的关键作用,为低样本条件下开展可解释的功能材料发现提供了可迁移路径。

获取详情及资源:
- 📄 论文: https://doi.org/10.1038/s41557-025-01974-x
- 💻 代码: https://github.com/pic-ai-robotic-chemistry/Fluorocofs
0 摘要
由于化学设计空间极其庞大且实验筛选成本高昂,开发具有目标性能的多孔晶体材料仍极具挑战。构建了一种人工智能辅助的交互式实验–学习演化方法,以加速发现高荧光共价有机框架(COF)。该方法将模型推荐、实验验证和主动学习整合到迭代优化循环中,使人工智能模型随流程推进而持续演化。在由20种胺类和26种醛类构筑单元形成的520种可能组合中,仅需实验评估11种COF,便识别出光致发光量子产率高达41.3%的材料。通过将电子构型和量子层面的认识嵌入学习过程,该方法超越了基于统计分析的经验判断,实现由化学知识驱动的材料发现,并提高预测的可靠性与可解释性。同时揭示了这些COF的荧光机制,阐明HOMO–LUMO匹配和激发态电荷分布的关键作用。
1 引言
共价有机框架(COF)由分子通过共价键连接而成,是一类结构高度多样化的晶体材料。模块化设计能够系统调控结构与功能,从而赋予其优异的物理化学性质,并使其适用于分离、催化和生物应用。然而,发现具有目标性能的COF仍是一项重大挑战。可能的构筑单元组合会发生组合爆炸,因此即使借助理论模型和结构模拟,也难以开展穷尽式实验筛选。
构建了交互式实验–学习演化方法,使经验知识与人工智能(AI)模型相互作用,并让AI模型在流程中通过迭代不断优化和演化。该策略用于发现由20种胺类(ami)和26种醛类(ald)构筑单元组成的荧光COF;这些构筑单元通过亚胺缩合连接,形成一系列二维(2D)框架。首先利用20种胺和26种醛构筑单元的轨道层面描述符,以及520种二聚体的密度泛函理论(DFT)计算结果,对多层感知器(MLP)模型进行预训练;随后使用孪生神经网络在后续学习循环中推荐新候选物。经过四代实验–模型迭代后,识别出光致发光量子产率(PLQY)为41.3%的COF。
该流程的独特之处,是将前沿轨道能量和激发态电荷分布等电子结构信息嵌入学习过程,从而产生更具化学意义的预测。对流程所得数据集进行分析,确定了影响荧光的关键因素,包括构筑单元之间的HOMO–LUMO匹配,以及二聚体内激发态电荷的分布。由此能够解析COF的结构–性能关系并识别隐藏机制。该流程将化学知识与数据驱动建模相结合,可作为一种可迁移的材料发现方案。
以往工作已经证明,AI可通过提出候选物短名单加速无机晶体发现,但这些晶体的晶胞相对较小,通常只由少量原子组成。相比之下,COF和金属有机框架(MOF)等分子基晶体的晶胞大得多,往往包含数百个原子,因此传统方案会面临计算困难和资源需求过高的问题。已有尝试利用遗传算法从已知MOF结构的合成条件中提取经验,也使用大语言模型(LLM)从文献非结构化文本中提取关键信息以设计新MOF。然而,这些方法通常关注结构组成和合成条件,未能提供涉及构筑单元电子结构或相应激发态的化学认识,而这些信息对于阐明结构–性能关系至关重要。该方案将前沿轨道理论和电子构型等化学知识嵌入机器学习过程,使模型超越统计拟合,将化学认识纳入预测并提高可解释性。用于分子催化剂研究的传统贝叶斯优化在这一场景中无法收敛,而孪生神经网络能够根据有限样本作出准确预测。完成最初5种COF后,只需再合成6种COF便获得理想PLQY,体现出交互式实验–学习演化策略的效率。

图1|AI辅助实验–学习方法用于发现荧光COF的工作流程 a. 借助LLM阅读COF论文并提取化学结构,筛选候选胺类和醛类构筑单元. b. 以二聚体为桥梁,构建MLP模型,将构筑单元性质与相应COF的荧光性质相关联. c. 采用孪生网络开展交互式实验–学习演化,利用实际实验结果微调模型,提高下一轮迭代推荐的精度;经过少数几代演化,即可高效获得在相同拓扑下具有最优荧光性质的PL-COF.
2 结果与讨论
工作流程包含三个关键步骤:(1)数据集整理;(2)模型构建;(3)实验–学习演化。
2.1 数据集整理与编码
LLM已被证明能够高效筛选用于合成MOF的潜在有机构筑单元。采用类似方法,从文献中确定20种胺类和26种醛类单元,作为构建具有bex拓扑的二维亚胺连接COF的候选构筑单元。不过,在转向主动学习的编码过程中,采用了一组由构筑单元电子结构组成的新参数,这与此前针对多孔晶体的工作不同。具体而言,将含时DFT计算得到的46种构筑单元的14个关键电子结构参数编码为机器学习模型的特征向量,用于捕捉构筑单元的激发态电子–空穴动力学和亲电反应活性。
2.2 模型构建与预训练
下一步需要建立AI模型,将构筑单元与相应COF的目标荧光性质相关联。传统方法通常使用单个基元或构筑单元的组成和化学信息预测整个延展框架的性质,但延展框架的电子性质通常与孤立构筑单元存在显著差异。
为弥合AI模型中的知识差距,采用由一个醛类和一个胺类构筑单元通过亚胺键连接而成的二聚体,作为连接结构变量与相应COF电子态的中间分子。依据二维亚胺COF的单晶结构,将二聚体中的亚胺键设定为反式构象,并限制两个构筑单元处于共面构型,以模拟其在二维COF层中的排列。对由20种胺和26种醛单元构成的二聚体开展DFT计算,结果显示,亚胺键促进了关键的激发态电荷再分布,并捕捉到胺单元和醛单元各自的贡献。随后构建善于高效处理大量变量的MLP模型进行预训练,以从构筑单元提取的28个描述符作为输入,以520种二聚体组合的DFT计算结果作为输出。
直接计算完整周期性COF结构的激发态在计算上难以承受,尤其是在存在520种可能组合的情况下;而仅基于构筑单元计算的传统处理方式准确度较低。二聚体方法在计算效率和准确表征延展COF结构之间取得平衡,可提供更接近实际COF结构的激发态性质信息。
2.3 交互式实验–学习演化
后续阶段是核心演化过程,实验结果在AI模型优化中发挥重要作用。由于全部520种COF候选物具有相同的连接方式和相似拓扑,因此采用擅长依据有限数据点学习相似性的孪生神经网络。借助紧凑的十维向量嵌入,孪生神经网络成功预测出bex拓扑中荧光最强的COF。通过四代快速交互式实验–学习演化,分别识别出量子产率为21%和41.3%的PL-COF-10与PL-COF-11。
主动学习过程从化学空间中随机选择5种候选物作为初步推荐,即第一代(Gen I)的PL-COF-1至PL-COF-5。初始结果显示,大多数合成COF的表现不佳,只有PL-COF-4的绝对固态PLQY达到10.6%。这些实验结果作为AI模型的起始数据被纳入数据集。
从第二代(Gen II)开始,采用顺序主动学习迭代方法。每次迭代预测一种COF并进行实验考察,随后将新的实验输入纳入AI模型进行优化,再用于下一次预测。Gen II经过三次迭代后,推荐的PL-COF-6、PL-COF-7和PL-COF-8平均荧光量子产率为8.7%,高于最初5种随机推荐材料的2.7%。PL-COF-8的PLQY为11%,超过Gen I中PLQY最高的PL-COF-4。随后又进行三次迭代,构成第三代(Gen III)。该循环中的PL-COF-9、PL-COF-10和PL-COF-11平均PLQY达到27%,远高于Gen II。PL-COF-11的PLQY最高,为41.3%;PL-COF-10的PLQY位居第二,为21%,与相同bex拓扑下性能领先的荧光二维COF相当。
为进一步评估模型预测的稳健性和普适性,第四代(Gen IV)又开展了一组实验,从化学空间中高性能候选物邻近区域选择11种额外COF,即PL-COF-12至PL-COF-22。尽管它们在结构上与此前材料相似,但荧光相对较弱,平均PLQY仅为1.5%。这些结果与模型预测高度一致,进一步证明孪生神经网络能够依据可获得的有限实验数据有效推荐结构。
机器学习过程中用于数据优化的工具至关重要。传统AI模型使用的贝叶斯优化适合在实验结果较易获得且化学空间连续时,依据大量实验结果进行预测。然而,每种COF均由离散构筑单元组合而成,即使具备丰富经验,获得一个可靠数据点仍需耗时的实验研究,包括合成构筑单元分子、生长COF晶体、样品积累与活化,以及结构确认和荧光性质表征。因此,传统高通量贝叶斯优化不适用于这一问题。即使获得全部22种COF的数据并用于反馈,贝叶斯方法仍无法形成合理且收敛的预测模型。

图2|交互式实验–学习演化过程各代的详细情况 a. 主动学习从化学空间中均匀分布的5种随机推荐COF结构开始,这些结构以黄色点表示;合成相应PL-COF并测量其PLQY,所得结果作为后续各代预测的反馈. b. Gen II和Gen III各由3个顺序迭代循环组成,每个循环预测并实验考察一种COF;孪生网络模型的预测准确度在此过程中提高,最终识别出最佳PL-COF. c. 从高性能候选物邻近区域选择11种补充COF以验证预测准确度,同时扩充数据集,从而更全面地考察分子构筑单元参数与COF荧光性质之间的结构–功能关系.
2.4 22种PL-COF的构建与表征
COF的构建需要大量实验工作,包括合成分子构筑单元、生长COF晶体及对其进行活化。通过优化晶体生长条件,共获得22种高质量COF晶体,涉及11种醛单元,即Ald-1、Ald-7、Ald-8、Ald-10、Ald-11、Ald-13和Ald-20至Ald-25,以及6种胺单元,即Ami-8、Ami-10、Ami-11、Ami-12、Ami-15和Ami-17。这些步骤未来有望纳入自动化系统,但在此采用手动操作,以证明AI辅助方法与大多数实验室可用标准操作之间的兼容性。
使用实验室X射线源对这些COF进行粉末X射线衍射(PXRD)分析,并通过同步辐射进一步确认部分样品。PXRD图谱呈现尖锐衍射峰,说明结晶度较高。PXRD图谱精修显示,除Gen IV中的PL-COF-22外,大多数COF具有共同的bex拓扑。傅里叶变换红外光谱、X射线光电子能谱和固态
准确确定COF结构对于建立可靠的结构–性能关系和探究内在机制至关重要。利用电子衍射(ED)和透射电子显微镜(TEM)分析Gen I中的PL-COF-3、PL-COF-4及Gen III中的PL-COF-11。这些COF晶体呈层状菱形形貌,尺寸最高为

图3|PL-COF的实际实验数据为机器学习模型和结构–性能关系建立提供可靠支持 a–d. 由PXRD图谱精修得到的PL-COF结构,分别展示Gen I至Gen IV中的PL-COF-4、PL-COF-8、PL-COF-11和PL-COF-22,并在二维结构平面中标出PL-COF-4与PL-COF-11的晶胞. e–h. PL-COF-4的图像,分辨率为4.1Å,包括HR-TEM图像、选区ED图案、快速傅里叶变换和放大的HR-TEM图像,后者左侧为原始图像、右侧为滤波图像;独立重复3次实验均得到相似结果. i–l. PL-COF-11的图像,分辨率为5.1Å,包括HR-TEM图像、选区ED图案、快速傅里叶变换和放大的HR-TEM图像,后者左侧为原始图像、右侧为滤波图像;独立重复3次实验均得到相似结果. PXRD精修结构模型的a/b比与ED和快速傅里叶变换图像所得结果一致,每一代展示一种代表性COF.
2.5 机制研究
荧光COF近来成为探索COF光学性质的新前沿,但其内在机制仍在很大程度上未知。深入理解这些机制,对未来设计荧光COF具有重要指导价值。
利用22种PL-COF经实验–学习演化后得到的AI模型揭示机制,将构筑单元的电子结构参数与相应COF的荧光性质相关联。使用Shapley加性解释模型对构筑单元的28个描述符进行排序,以阐明关键贡献因素。在与COF荧光性质相关性最高的6个描述符中,5个来自醛单元,包括亲电指数、Mulliken电负性、电子离域指数、空穴离域指数和h指数,1个来自胺单元,即Sr指数。对于醛单元,较大的Mulliken电负性表明接受电子的倾向较低,有利于增强COF荧光;较高的亲电指数则表示接受外部电子并发生亲电反应的倾向更强,呈现相反趋势。这说明电负性更高的醛单元更有利于COF荧光。在空穴–电子分布描述符中,较高的电子离域指数意味着未占据跃迁轨道的空间分布区域较小,而较低的空穴离域指数和较大的h指数表示已占据跃迁轨道及空穴–电子平均分布更为弥散,这些因素均有助于增强荧光。因此,未占据跃迁轨道集中、已占据跃迁轨道扩展的醛单元能够促进COF荧光。对于胺单元,较大的Sr指数反映空穴与电子之间的空间重叠更强,表明更明显的局域激发特征会降低荧光。
对22种PL-COF二聚体的电子–空穴分布进行系统分析,发现荧光COF与非荧光COF呈现明显不同的模式。在PL-COF-4、PL-COF-8、PL-COF-9、PL-COF-10、PL-COF-11、PL-COF-16、PL-COF-21和PL-COF-22等高荧光COF中,电子–空穴对主要局域在醛单元附近。相比之下,大多数弱荧光或非荧光COF二聚体的电子–空穴分布主要位于胺单元。二聚体电子–空穴分布的定量评估进一步支持这一趋势:醛单元贡献的电子和空穴密度越大,PLQY越高;胺单元的贡献越小,荧光越强。因此,醛单元内的局域激发可能构成荧光团,而胺单元可能充当淬灭剂。
二聚体电子–空穴分布的定量贡献也被用作预训练模型的输出参数,进一步说明其对于解释COF荧光性质至关重要。为验证二聚体与COF之间的相关性,合成了两种二聚体:dimer-1来自弱荧光PL-COF-3,dimer-2来自强荧光PL-COF-11;二者的光物理行为与相应COF一致。
醛单元上的高效局域电子激发对于COF整体荧光至关重要。Ald-13中强供体–受体–供体基元即使受到胺单元影响仍非常稳定,有利于COF产生强荧光。与不同胺单元组合时,醛单元和胺单元之间的HOMO与LUMO匹配,是决定COF整体荧光的另一项要求。例如,Ami-8、Ami-11和Ami-17的HOMO能级高于Ald-25,会促进电子从胺单元转移至醛单元;Ami-10与Ald-25的HOMO排列则会减少电子转移,产生中等荧光(5.7%)。Ald-25的HOMO高于Ami-12且LUMO更低,因此能够维持高荧光。所有22种实验获得的PL-COF均呈现一致的HOMO–LUMO匹配趋势。在高荧光PL-COF-4和PL-COF-22中,醛单元的HOMO均高于胺单元,LUMO均低于胺单元,激发态电子–空穴分布局域在醛类荧光团上。这一现象也可由分子中的光诱导电子转移(PET)理论解释。此前虽已提出PET理论解释COF荧光,但这里基于多种COF结构建立了稳健的定量相关关系,而非局限于单一案例。
对11种醛单元和6种胺单元的HOMO–LUMO能级进行DFT系统分析,进一步确认:醛单元的HOMO和LUMO被包络在胺单元的HOMO和LUMO之内,是抑制PET并增强COF荧光的必要条件,与实验观察一致。飞秒泵浦–探测瞬态吸收测量显示,高PLQY的PL-COF-9和PL-COF-11具有约1ns的时间延迟,说明分子内电子转移受到抑制,与构筑单元的HOMO–LUMO分析吻合。相比之下,弱荧光或无荧光的PL-COF-1、PL-COF-2、PL-COF-12和PL-COF-16在100ps内出现快速瞬态吸收强度延迟,表明光照后发生快速电子转移。PL-COF-3、PL-COF-5、PL-COF-12、PL-COF-15、PL-COF-16和PL-COF-19虽含有聚集诱导发光基元,但实验中荧光可忽略,进一步说明主导机制不同于聚集诱导发光效应。

图4|COF荧光性质与构筑单元相关的机制认识 a. 基于实验结果支持的后修正模型,利用Shapley加性解释模型对构筑单元的28个描述符进行重要性排序. b–c. 在494种组合中分析醛单元和胺单元对二聚体电子与空穴分布的百分比贡献. d–e. 对应22种实验COF的22种二聚体中,醛单元和胺单元的百分比贡献;代表强荧光COF的红点在b和d中聚集于右上角,在c和e中聚集于左下角. f. b–e所示趋势的总结. g. Ami-11与不同醛单元的HOMO–LUMO能级比较. h. Ald-25与不同胺单元的HOMO–LUMO能级比较. i. 二维COF的荧光机制,其中构筑单元HOMO–LUMO能级的匹配至关重要.
2.6 双光子荧光生物成像
荧光COF作为生物成像探针具有巨大潜力,可显著减轻小分子的光漂白效应。为获得更深的成像深度和更高的信噪比,需要使用更长波长的光进行吸收,而双光子荧光(2PF)是一种有效方案。强单光子荧光COF往往也具有2PF,因此以PL-COF-11为例开展2PF性能测试。在1,200nm激发波长下,平均晶体尺寸为100nm的PL-COF-11纳米颗粒呈现1.9的功率依赖荧光斜率,证明其在近红外二区(NIR-II)具有2PF性质,非常适合生物成像。
使用激发波长为1,200nm的飞秒激光对小鼠脑血管进行测试时,纳米级PL-COF-11在三维重建中的成像深度最高达到924μm;即使在800μm的深层组织中,仍可清晰分辨细至1.9μm的毛细血管。相比之下,其分子对应物Ald-13的成像深度仅为520μm,受限于较短的光吸收波长,即典型近红外一区的810nm。COF增强的2PF性能与此前观察一致,同时将2PF吸收波长扩展至过去无法达到的NIR-II区域,拓宽了生物成像用途。光稳定性测试显示,照射25min后Ald-13的荧光降低40%,而PL-COF-11在相同条件下仍保留超过90%的初始荧光。主要器官的苏木精–伊红染色,以及全面的血常规和生化检测还表明PL-COF-11具有良好生物安全性。优异的光稳定性与深层组织成像能力,使PL-COF-11非常适合作为生物成像探针。

图5|使用PL-COF-11和Ald-13标记小鼠脑血管的活体双光子荧光成像 a. PL-COF-11处理小鼠在不同深度下的血管双光子荧光图像及脑血管三维重建,采用近红外二区1,200nm激发;独立重复3次实验均得到相似结果. b. 使用Ald-13作为探针,在不同深度获得的血管双光子荧光图像;独立重复3次实验均得到相似结果. 二维COF作为探针时的成像深度和分辨率明显优于构筑单元分子.
3 结论
尽管模拟技术和AI持续发展,人与AI之间的协同作用仍未完全建立。交互式实验–学习方法通过渐进式演化循环,将模型预测、实验验证和主动学习整合起来。该方法只需少数迭代循环和较少的实验种类搜索,便能够识别高荧光COF。
将电子结构嵌入AI模型,超越了依据化学式形成的传统经验,使前沿轨道和激发态相关的化学认识得以提取,并与电子结构决定的化学和物理性质建立更好的相关性,荧光即为其中一例。孪生神经网络此前用于图像识别和光谱分析,在此成为根据有限实验结果推荐COF结构的高效模型,体现出其在材料发现中的能力。
融合AI与实验工作的方案在机制研究中同样高效。交互式实验–学习演化所积累的知识,可从事实支持的AI模型中提取化学认识,使准确性和可靠性超越随机猜测。对于所考察的荧光COF,亚胺连接极不利于发光这一传统观点被推翻;相反,构筑单元之间的HOMO–LUMO匹配被证明是实现高荧光的关键。这些知识对未来COF设计具有重要价值,若缺少AI辅助则难以提取并验证。