JACS 2025 | LLM-EO: 利用大语言模型的内在知识与推理能力实现功能性金属配合物的生成式设计
今天介绍的这项工作发表于 JACS,聚焦复杂化学空间中功能材料设计的高效探索问题,针对传统进化优化(Evolutionary Optimization, EO)方法在过渡金属配合物(Transition Metal Complexes, TMCs)设计中存在的搜索空间巨大、多目标优化困难以及生成能力受限等问题,提出了一种结合大型语言模型(Large Language Models, LLMs)与进化优化框架的智能设计方法LLM-EO。不同于传统遗传算法(Genetic Algorithm, GA)依赖人工定义适应度函数和预设化学空间搜索的局限,该方法利用LLMs在预训练过程中获得的化学知识以及上下文学习能力,通过自然语言指令驱动候选结构生成,实现对TMCs性质优化和新型化学结构发现。在方法上,LLM-EO将LLMs作为进化优化过程中的候选生成器,以TMCs作为优化对象,通过提示词输入配体信息、初始候选结构及目标性质,使模型能够根据HOMO–LUMO能隙、极化率等优化目标提出新的过渡金属配合物;同时结合历史优化数据保留策略,使LLMs能够从不断积累的候选结构及性质信息中学习,实现类似实验室闭环优化的迭代过程。此外,该框架利用自然语言表达多目标优化需求,避免了传统方法中复杂数学适应度函数设计的限制,并进一步拓展至从头生成新配体和新TMCs,实现超越预定义化学空间的探索。实验结果表明,LLM-EO在包含1.37 M个Pd(II)平方平面配合物的化学空间中表现出优异的优化能力,在HOMO–LUMO能隙最大化、极化率优化以及多目标Pareto前沿探索任务中均优于随机搜索和传统GA方法;仅通过少量候选评估即可发现位于高性能区域的TMCs,并能够生成具有超过1200 au极化率的新型配合物结构。进一步研究显示,LLM-EO能够迁移至Ni(II)配合物设计,并通过生成式优化发现预定义化学空间之外的高性能候选物,展示了大型语言模型驱动的进化优化方法在低成本、高效率化学材料发现中的应用潜力。

获取详情及资源:
0 摘要
大型语言模型(LLMs)已在科学领域展现出应用潜力,例如结构–性质预测和作为AI智能体执行任务。然而,其内在知识和推理能力在科学发现中的应用仍未得到充分探索。提出了LLM-EO方法,将LLMs集成至进化优化(EO)框架中,并展示了其在优化过渡金属配合物(TMCs)方面的有效性。由于LLMs中嵌入的内在化学知识以及利用优化过程中积累的完整历史数据的能力,LLM-EO在小样本学习中表现出优势。通过自然语言指令,LLM-EO提高了多目标优化的可操作性,有望降低缺乏丰富编程经验的实验化学家的使用门槛。作为生成模型,LLM-EO能够结合内部知识和外部化学数据,提出具有独特化学性质的新型配体和TMCs,从而兼具高效优化与结构生成的优势。随着LLMs在预训练基础模型能力以及训练后推理策略方面不断发展,LLM-EO有望在化学和材料设计领域得到广泛应用。
1 引言
进化优化(EO)已成为功能材料设计中的强大方法,可高效探索庞大的化学空间,从而筛选具有目标性质的候选物。受生物进化过程启发,EO算法通过选择、突变、重组和繁殖等操作,对候选解进行迭代优化。遗传算法(GA)是EO方法中的重要分支,其利用适应度函数评估并排序每个候选解的质量。这类算法将进化算子应用于排名靠前的候选物,通过突变和交叉操作不断提升解的质量,直到达到预设性能标准。尽管结构简单,GA在部分分子优化任务中已展现出与机器学习(ML)方法相当的有效性。此外,将GA与ML技术结合能够显著加速适应度评估过程,提高整体探索效率。EO具有良好的适应性和鲁棒性,特别适用于化学领域中复杂的优化问题,而此类问题通常具有规模庞大且多维的搜索空间特征。
设计由多个构建单元组成的化学体系,例如过渡金属配合物(TMCs),面临巨大挑战。由于金属和配体存在多样化组合,由此产生的组合爆炸使得TMC化学空间的系统探索十分困难,甚至超出了当前理论和实验筛选方法的能力范围。尽管完全枚举所有结构并不可行,但高效探索这一庞大的化学空间对于发现具有优化性质的TMCs至关重要。此外,功能材料和催化剂设计通常需要多目标优化,这进一步增加了传统GA中适应度函数设计的复杂性。现有EO方法在TMC设计中的应用已显示出优化催化活性和稳定性等性质的潜力。例如,Kneiding等人开发了Pareto-Lighthouse多目标遗传算法(PL-MOGA),能够对1.37 M化学空间中的TMC性质优化提供多个优化目标的精细化控制。然而,当前EO方法在TMC生成方面仍受到两个因素限制:(1)现有方法通常需要精心设计或调整多目标适应度函数,尤其是在处理性质冲突或尺度差异问题时;(2)在较小配体片段和完整配体之间进行操作时存在权衡。基于完整配体进行操作具有较高计算效率,因为其限制了化学空间规模,使探索速度更快。相比之下,较小片段能够通过增加组合可能性和新型结构数量提高多样性,但同时扩大了化学空间,使探索过程更加计算密集。这些挑战促使进一步发展新的方法,以释放EO在新型TMC设计中的全部潜力。
近年来,最初为自然语言处理开发的大型语言模型(LLMs)取得了快速发展,并在多个科学领域的应用中引起广泛关注。这些模型已在文本挖掘、科学规划、反应预测、分子生成、性质预测以及教育应用等方向展现出显著潜力。通过与进化算法结合,LLMs展现出增强的能力,推动了演化概念库探索和启发式设计过程的发展。近期,Wang等人利用LLMs通过SMILES字符串生成设计小型有机分子,展示了LLMs作为化学发现工具的潜力。然而,LLMs在由多个构建单元组成的复杂化学体系或材料体系中的多目标优化应用仍尚未实现。
提出了LLM-EO方法,将LLMs集成到EO框架中,并将其应用于过渡金属配合物(TMCs)的单目标和多目标优化任务。仅通过少量示例,LLMs即可利用在大规模语料库预训练过程中获得的丰富化学知识,提出具有目标性质的TMCs。比较分析结果表明,LLM-EO与传统GA方法相比具有竞争性能,在优化早期阶段表现出优势,并在长周期优化过程中达到相当的优化效果。当保留优化过程中产生的全部历史数据时,LLM-EO的性能进一步提升,为类似实验室闭环优化的应用场景提供了可能。通过自然语言指令,LLM-EO提供了一种易于使用的多目标优化方法,使研究人员能够直接利用自然语言表达复杂或相互竞争的优化目标,这对于缺乏编程或优化算法经验的领域专家具有重要价值。最后,LLM-EO利用LLMs的生成能力生成全新的配体和TMCs,从而显著加速优化过程。通过高效探索广阔设计空间,LLM-EO能够识别传统筛选方法可能遗漏的高性能候选物。结果表明,LLM-EO可作为功能材料设计中持续改进的优化框架,其创新点并不在于发现化学上前所未有的结构,而在于提升探索方法的效率和有效性。
2 结果与讨论
2.1 LLM-EO概述
LLM-EO描述了LLMs与EO的集成,其中潜在探索候选物由LLMs提出。受GA原理启发,构建了迭代优化流程。在每次迭代过程中,精心设计包含通用指令以及特定信息、约束条件和优化目标的提示词,并输入LLM模型。参考数据通过精心构建的提示词输入模型,其中包括:(1)由SMILES字符串、ID、电荷以及连接原子信息表示的50种配体组成的配体池;(2)从包含1.37 M个可能Pd(II)平方平面配合物的空间中随机采样的20个初始TMCs,以及其预先计算得到的性质(HOMO–LUMO能隙、极化率);(3)设计目标的自然语言描述(例如“最大化HOMO–LUMO能隙”)。随后,LLM生成一组针对任务的新TMCs,并经过严格的验证过程,包括电荷约束(−1、0或+1)、利用molSimplify进行结构生成、利用GFN2-xTB进行几何优化,以及连接关系验证,以确保不存在非预期的键重排。有效TMCs及其计算性质被整合至下一轮迭代的提示词中,从而完成EO循环。为了评估LLMs在预训练过程中获得的内在化学知识,采用商业可用的LLM模型参数,并未针对任何TMCs进行显式监督微调。

图1|TMCs和LLM-EO设计空间概述 (a) 构建1.37 M平方平面TMCs空间。TMCs的构建单元由氧化态为II的Pd(即金属)和配体库组成,其中包含25种中性配体和25种离子配体。通过在总TMC电荷为−1、0或1的约束条件下,以平方平面几何构型进行组装,构建了包含1.37 M个TMC的空间。(b) LLM-EO工作流程。针对TMCs设计构建提示词,其中包含通用指令(橙色文本)以及特定信息、约束条件和目标(蓝色文本)。该提示词与LLM交互(例如通过API调用),LLM返回一组新的TMCs。这些新TMCs被输入包含更新信息的提示词中,从而形成进化优化闭环。原子颜色表示如下:Pd为天蓝色,C为灰色,N为蓝色,O为红色,P为橙色,S为黄色,I为紫色,H为白色。TMCs中的紫色虚线表示Pd(II)与配体之间的键。
尽管EO已广泛应用于多个物理科学领域,仍进一步探索LLM-EO在单目标和多目标优化任务中的潜力。具体而言,利用Kneiding等人构建的包含1.37百万个TMCs的化学空间评估LLM-EO性能。该数据集包括由4个单齿配体构建的Pd(II)平方平面配合物,这些配体从包含50种配体的库中选择,其中包括25种中性配体和25种单阴离子配体,并额外限制TMC总电荷必须为−1、0或1。通过molSimplify和GFN2-xTB计算这1.37 M个TMCs的两个性质,即HOMO–LUMO能隙和极化率。与传统EO算法(如GA)相比,LLM-EO具有三个主要优势:首先,提供灵活的目标控制能力,使复杂优化目标能够通过自然语言进行更加适应性和精细化的描述,从而降低缺乏计算方法专业知识的实验化学家和研究人员处理复杂优化问题的难度。其次,通过LLMs中丰富的化学知识以及从小样本中学习的能力,提高优化效率。第三,促进新化学体系的生成设计。LLMs固有的生成能力使LLM-EO不仅能够高效探索预定义搜索空间,还能够创造性地产生新型TMCs。这些特点使LLM-EO成为化学设计领域中一种新兴且强大的工具。
2.2 LLMs通过小样本学习提出高质量TMCs
一个重要问题是,当前LLMs是否在大规模语料库预训练过程中获得了化学知识,以及这些知识是否能够用于推导具有意义的化学设计方案。此处关注单目标优化任务中最大化HOMO–LUMO能隙的TMCs设计,该任务涉及最高占据分子轨道(HOMO)和最低未占据分子轨道(LUMO)之间的能量差,由于涉及复杂电子结构,因此具有较高挑战性。为了评估LLMs在有限数据条件下学习结构–性质关系并在受限化学空间内提出新型TMC设计的能力,向模型提供了50种以SMILES表示的配体,以及从1.37 M TMC空间中随机采样的20个初始TMCs,每个TMC均对应其HOMO–LUMO能隙。为了展示当前LLM-EO性能上限,在LLM-EO框架中采用Anthropic公司(claude-3.5-sonnet)和OpenAI公司(o1-preview)提供的最佳商业化LLMs。

图2|利用少样本LLM提出新的TMCs (a) 不同方法提出的200个TMCs中累计排名前10的TMCs的HOMO–LUMO能隙分布箱线图(带缺口)。其中提供20个已知TMCs作为参考。随机方法为蓝色,GA为红色,claude-3.5-sonnet为橙色,o1-preview为绿色,o1 mini为紫色,gpt-4o为天蓝色。数据集上限以灰色虚线表示。(b) 不同方法提出的所有TMCs的HOMO–LUMO能隙累积概率以及整体分布(顶部边缘箱线图)。(c) 不同生成方法在200个TMCs生成结果中有效和唯一TMCs的比例。对于每种方法,展示两个指标:有效(浅色)表示总电荷在−1和+1之间且成功完成优化的生成TMCs比例;有效且唯一(深色)表示同时满足有效且非重复条件的生成TMCs比例。(d) 提示词中提供不同数量已知TMCs时,200个提出TMCs中累计排名前20的TMCs的HOMO–LUMO能隙分布箱线图(带缺口)。仅展示claude-3.5-sonnet(橙色)和o1-preview(绿色)的结果。分别展示claude-3.5-sonnet和o1-preview提出的具有最大HOMO–LUMO能隙的TMC。随机生成前20个TMCs的平均值以蓝色虚线表示。原子颜色表示如下:Pd为天蓝色,C为灰色,N为蓝色,O为红色,P为紫色,F为绿色,H为白色。TMCs中的紫色虚线表示Pd(II)与配体之间的键。
为进行对比分析,同时引入gpt-4o(一种性能优异但不侧重推理能力的基础模型)以及o1 mini(一种规模更小、采用与o1-preview相同训练后推理技术的基础模型)。整个研究过程中,随机选择和GA结果作为基准方法。
在小样本学习条件下,claude-3.5-sonnet和o1-preview提出的累计排名前10的TMCs(来自2个不同随机种子)相比随机选择和GA获得的TMCs表现出显著更大的HOMO–LUMO能隙。这一结果符合预期,因为在第一次迭代中,GA生成的候选物与随机采样在功能上较为相似,此时进化选择效应尚未充分发挥。因此,早期阶段观察到的差异主要反映初始候选池中的统计变化,而非算法本身的固有优势。利用不同选择截断范围(top-5、10、20、50)的进一步分析表明,性能趋势具有稳定性,并不依赖于特定k值的选择。仅通过400次候选生成,claude-3.5-sonnet和o1-preview均能够识别HOMO–LUMO能隙大于4.45 eV的候选TMCs,该结果位于1.37 M TMC空间中的前0.002%范围内(总计32个TMCs),表明其能够准确定位符合设计目标的高潜力候选物。例如,两种模型均能够识别具有强吸电子效应的配体(如CF
为了研究小样本学习条件下初始TMC数量对优化结果的影响,改变提示词中包含的已知TMC数量,并评估LLM-EO生成高性能TMCs的质量。结果表明,随着已知初始TMC数量增加,claude-3.5-sonnet和o1-preview模型发现的top-20 TMCs的HOMO–LUMO能隙均得到提升。然而,该提升在claude-3.5-sonnet中更加明显,可能是由于o1-preview在极少量已知TMC条件下已经表现出较高性能。值得注意的是,即使仅提供1个TMC,o1-preview仍表现出优异性能,其top-20 TMCs的HOMO–LUMO能隙相比随机选择基准提高了1 eV。这些结果表明,由于LLMs在预训练过程中获得的化学知识,即使在有限数据条件下仍能够获得具有潜力的结果,在数据需求和模型性能之间实现良好平衡。
2.3 利用LLM-EO高效优化HOMO–LUMO能隙
在确认LLMs能够利用其内在化学知识提出满足特定目标的TMCs后,将新提出的10个TMCs与原始数据集合并,进一步构建完整的EO闭环优化流程。首先,与GA类似,采用保留策略,仅将具有最高适应度值的TMCs(即HOMO–LUMO能隙最大的前20个TMCs)保留在提示词中,用于后续迭代。由于o1-preview模型在小样本学习中表现最佳,因此后续研究均选择o1-preview作为LLM-EO的核心模型。在优化早期阶段,仅提出50个TMCs时,LLM-EO即可有效识别具有较大HOMO–LUMO能隙的TMCs,其性能超过尚未明显优于随机选择的GA方法。随着迭代次数增加,GA也逐渐展现出相对于随机选择的优势,并在超过20次迭代后持续取得进展,逐渐超过仅保留高性能候选物的LLM-EO方法。在每次迭代过程中关注发现的top-20 TMCs时,也观察到类似趋势,其中LLM-EO始终优于GA和随机选择。实际上,在迭代次数为0时,所有方法在功能上均等同于小样本学习方法。相比整体TMC分布,性能最佳TMCs的HOMO–LUMO能隙提升更加明显,表明LLM-EO在识别具有极端性质的TMCs方面具有较高效率,而这一特点通常是材料优化过程中所期望的。

图3|利用LLM-EO最大化HOMO–LUMO能隙 (a) LLM-EO示意图,包括在进化优化过程中选择在提示词中保留具有最大HOMO–LUMO能隙的前20个TMCs(绿色)或保留所有历史数据(灰色)的选项。(b) 在进化优化过程中,迭代次数分别为5(左)、20(中)和50(右)时,不同方法提出的所有TMCs的HOMO–LUMO能隙累积概率。随机采样为蓝色,GA为红色,仅保留前20个TMCs的o1-preview为绿色,保留所有历史数据的o1-preview为灰色。每种方法的整体分布以顶部边缘箱线图表示。(c) 在进化优化过程中提出的200个TMCs中,累计排名前10的TMCs的HOMO–LUMO能隙分布箱线图(带缺口),初始样本为20个随机TMCs。数据集上限以灰色虚线表示。(d) 在进化优化过程中,1.37 M空间中具有最大HOMO–LUMO能隙的前20个TMCs命中数量与提出TMCs数量之间的关系。实线表示不同随机种子下三次独立运行的平均值,阴影区域对应标准差。
不同于仅保留高性能候选物的GA方法,优化过程中利用所有历史数据具有更高潜力。因此,采用了不同于GA的保留策略,即无论TMCs的HOMO–LUMO能隙大小,均保留此前评估过的所有TMCs。在优化早期阶段,由于探索的TMC数量有限,仅保留高性能TMCs和保留全部TMCs之间差异较小。然而,随着优化过程中评估的TMC数量增加,保留所有历史TMCs能够带来显著优势,不仅提高整体HOMO–LUMO能隙分布,还增强了top-20 TMCs的识别能力。这些结果表明,即使部分实验由于适应度较低而被认为效果不佳,LLMs仍能够从不断增加的评估数据中学习。
通过利用优化过程中的历史数据,LLM-EO能够在庞大的设计空间中高效识别高性能候选物。值得注意的是,在仅评估200个TMCs的情况下,保留全部历史数据的LLM-EO仍能够稳定识别出HOMO–LUMO能隙最大的前20个TMCs中的8个,而所评估结构仅占1.37 M设计空间的0.015%。进一步分析不同选择截断范围(top-10、20、50、100)以及不同迭代次数的结果表明,LLM-EO性能稳定,并不依赖于特定k值的选择。正如预期,LLM-EO能够快速提升初始优化效果,并迅速发现高性能候选物,但其性能较早达到饱和。相比之下,GA虽然提升速度较慢,但能够在更长优化周期中持续获得改进。这体现了两种方法的互补性:LLM-EO擅长在优化早期快速生成高质量候选物,而GA能够在长期优化过程中提供更加稳定的性能提升。该结果表明,将两种方法结合可能具有潜在优势,相关方向将在未来进一步探索。此外,LLM-EO提出的200个TMCs中,有11.5%(即23个)位于1.37 M空间中HOMO–LUMO能隙最大的前200个TMCs范围内。相比之下,GA和随机选择均未产生任何进入1.37 M空间top-200范围的TMCs。LLMs利用累积知识的能力使LLM-EO成为高效的实验辅助工具,通过整合全面历史数据,能够减少发现功能性金属配合物所需的时间和工作量。
2.4 由自然语言引导的灵活多目标优化
不同于GA等传统EO算法需要针对多目标优化建立明确数学形式,LLM-EO利用自然语言指令的灵活性实现目标控制。通过1.37 M TMC空间中的三个不同多目标优化任务展示该适应能力,其中均针对HOMO–LUMO能隙和极化率进行优化,并在o1-preview执行LLM-EO过程中保留全部历史数据:第一,Pareto前沿(PF)优化;第二,同时最大化HOMO–LUMO能隙和极化率;第三,在限制HOMO–LUMO能隙小于1 eV的条件下最大化极化率。
PF表示一组最优解,其中一个优化目标的提升需要以另一个目标的降低作为代价。在多目标优化分析中,采用连续Pareto前沿概念评价性能。第一Pareto前沿表示不存在任何目标(极化率或HOMO–LUMO能隙)可以在不降低另一个目标的情况下进一步提升的解集,即“非支配”解。第二Pareto前沿通过暂时移除第一前沿中的所有解,并从剩余候选物中寻找非支配解获得。同理,第三Pareto前沿通过移除第一和第二前沿中的解后,在剩余结构中确定下一层非支配解。仅通过400次候选生成,LLM-EO即可识别出位于1.37 M空间真实第一PF上的9个TMCs。LLM-EO建立的PF能够成功识别具有吸电子配体的TMCs,例如最大化HOMO–LUMO能隙的Pd(II)(CF

图4|利用LLM-EO进行多目标优化以探索Pareto前沿(左)、同时最大化HOMO–LUMO能隙和极化率(
当目标设定为同时最大化HOMO–LUMO能隙和极化率时,LLM-EO能够有效提出集中于1.37 M空间右上区域的TMCs,表明其具备同时优化多个目标的能力。仅评估400个TMCs时,LLM-EO能够识别出18个与理论最优top-200 TMCs重叠的结构,该排名依据HOMO–LUMO能隙与极化率的乘积确定。其中,Pd(II)(P(CH
最后,评估在LLM-EO中加入约束条件对多目标优化的影响,该场景广泛存在于实际功能材料设计中。具体而言,将任务设定为最大化TMC极化率,同时保持HOMO–LUMO能隙小于1 eV,而在1.37 M空间中仅有3.8%的TMCs满足这一条件。加入新的提示词约束后,LLM-EO主要探索1.37 M空间左上区域,并在400次候选生成中识别出19个同时满足HOMO–LUMO能隙限制且具有最大极化率的top-200 TMCs。其中,LLM-EO发现了一种具有4个不同配体的异配体TMC,其HOMO–LUMO能隙极小,仅为0.3 eV,同时具有较高极化率(430 au)。由于HOMO–LUMO能隙受到限制,LLM-EO提出的400个TMCs中HOMO–LUMO能隙与极化率的乘积自然低于随机选择结果。由于具有最高极化率的TMCs通常并不天然具有较小HOMO–LUMO能隙,因此其实现HOMO–LUMO能隙低于1 eV的概率极低(<2%),这一现象在随机选择以及LLM-EO单目标极化率优化中均得到验证。然而,在提示词中加入HOMO–LUMO能隙约束后,能够显著增加同时具有较小HOMO–LUMO能隙和高水平极化率的TMCs数量。该结果表明,LLM-EO能够通过自然语言指令精确控制和优化目标性质。这种精确调控避免了多目标优化中复杂评分函数的设计需求,从而实现具有目标性质组合的多样化化学空间高效探索。
2.5 利用LLMs的生成能力进行从头设计TMCs
为了充分利用LLMs的生成能力,进一步探索了LLM-EO在超越由初始配体池限定的预定义化学空间之外设计新型配体和TMCs的潜力。为此,采用两种不同策略:第一种策略是一种新型配体的一次性生成方法,即生成原始配体池中不存在的新配体。利用性能最佳的TMCs和初始50种配体,采用o1-preview模型一次性生成10种新的配体。随后,通过枚举这些新生成的配体,构建包含2200个平方平面TMCs的化学空间。最后,利用molSimplify和GFN2-xTB计算这些TMCs的HOMO–LUMO能隙和极化率。第二种策略是新型TMCs的迭代生成方法。与第一种方法类似,从性能最佳的TMCs和原始50种配体开始。o1-preview模型生成10个新的TMCs,每个TMC至少包含一个初始配体池中不存在的新配体。这10个新TMCs随后被分解,以提取o1-preview模型生成的新配体作为副产物。最后,将新生成的TMCs和配体整合至提示词中,用于后续LLM-EO探索迭代。

图5|利用LLM生成新的配体和TMCs (a) 通过要求LLM提出原始配体池之外的新配体,构建新的TMC空间的工作流程。(b) 通过要求LLM提出由原始配体池之外的新配体构成的新TMCs,实现直接迭代TMC优化的工作流程。(c) 不同方法提出的TMCs极化率累积概率。随机采样为蓝色,利用o1-preview一次生成10个配体为红色,利用o1-preview通过LLM-EO迭代生成新TMCs为橙色。(d) 不同方法探索的TMCs极化率分布箱线图(带缺口)。展示每种方法获得的最佳TMC。(e) 随机400个TMCs(蓝色)、由o1-preview一次生成的10个配体构建的TMCs(红色)以及利用o1-preview迭代LLM-EO生成的TMCs(橙色)的极化率与HOMO–LUMO能隙关系。边缘展示各性质分布箱线图。(f) 不同方法探索TMCs中HOMO–LUMO能隙与极化率乘积(即
首先,测试两种生成式LLM-EO方法在增强平方平面构型Pd(II)基TMCs极化率方面的能力。利用o1-preview模型生成的10种新配体,构建了2200个新型TMCs。与现有1.37 M TMC空间中的结构相比,这些新型TMCs表现出显著更高的极化率,其最低极化率达到447 au。这些新生成的配体通常具有较大尺寸,包含扩展共轭体系或富电子基团,这与化学直觉一致,即更大且更分散的电子云能够增强极化率。通过迭代生成新TMCs,LLM-EO同样能够识别出具有显著更高极化率的配合物。在分析性能最佳的10个TMCs时,两种方法生成的TMCs极化率均达到1.37 M空间中最佳TMCs的两倍。此外,通过LLM-EO直接迭代生成方法发现了具有极高极化率的TMC,其极化率超过1200 au。该结构的四个配体均包含扩展共轭环,并形成5个微弱的
需要注意的是,LLMs的生成灵活性伴随着化学有效性的降低,尤其是在极化率优化任务中。在单目标和双目标优化过程中,新配体和新TMCs生成的有效率范围为49%至78%。然而,候选结构的有效性和唯一性可以在计算和实验验证之前快速确定,因此并不会成为限制LLM-EO实际应用的决定性因素。

图6|利用LLM-EO进行从头设计配体和TMCs生成的误差分析与成功率 中心柱状图展示单目标(最大化极化率,红色)和双目标(同时最大化HOMO–LUMO能隙和极化率,蓝色)优化任务中新配体和新TMCs生成的成功率(有效结构)。饼图展示每种生成场景下失败模式的分布:键重排(蓝色)、初始结构生成失败(橙色)以及无效SMILES(绿色)是无效输出的主要来源,其次为电荷超出范围(红色),以及少量计算失败(紫色)。值得注意的是,大多数生成失败发生在高极化率优化中,此时候选配体通常较大,容易产生空间位阻冲突或SMILES错误。
3 结论与展望
高效探索庞大的化学空间对于功能材料设计至关重要,尤其是由多个构建单元组成的体系,例如TMCs。构建了LLM-EO工作流程,该方法利用LLMs的预测和生成能力实现进化优化,并展示了LLM-EO在TMCs单目标和多目标优化任务中的有效性。LLMs固有的生成能力使LLM-EO能够开展从头设计,生成在设计目标方面表现优异的TMCs,从而突破预定义化学空间的限制。
结果显示,不同LLMs对LLM-EO性能具有显著影响。预训练基础模型质量和训练后推理机制均是关键因素。例如,在利用LLM-EO优化TMCs的HOMO–LUMO能隙时,o1-preview的性能明显优于gpt-4o和o1 mini。值得注意的是,在类似任务中,claude-3.5-sonnet表现优于gpt-4o,表明当训练后推理机制进一步增强以提升推理能力后,其性能可能超过o1-preview。此外,随着LLMs不断更新迭代,LLM-EO性能持续提升,表明该框架在化学设计中的性能优化潜力几乎没有明显上限。这一趋势在预训练过程中有策略地将科学文献纳入LLM语料库时尤其具有发展潜力。
LLMs的内在特性在LLM-EO框架中得到充分体现,并为传统进化方法提供互补优势。例如,在优化过程中保留全部历史数据具有较高效果,这是由于LLMs能够有效学习大规模上下文信息;而GA通常通过保留高性能候选物以及施加明确约束确保有效性,从而提高效率。该过程由自然语言表达的设计目标进行引导,有助于连接不同背景研究人员的实验直觉与计算优化方法。这一特点为解决复杂多目标优化问题提供了前所未有的灵活性,例如实际材料设计中需要同时满足多个性能指标的情况。最后,由于具有生成特性,LLM-EO能够发现预定义化学空间中不存在的全新材料,并赋予其优异性质,而这些结构通常依赖人工直觉或穷举搜索才能发现。
在LLM-EO框架中,o1-preview和claude-3.5-sonnet两个模型在内部测试中均表现出明显优于开源模型以及部分地区开发模型的性能。尽管该工作并非旨在作为基准测试研究,但这一差异凸显了实现人工通用智能过程中科学进步公平性所面临的潜在挑战,尤其是在部分组织更加关注高投入、高收益导向产品开发策略的情况下。尽管LLM-EO在优化TMCs的HOMO–LUMO能隙和极化率方面进行了验证,但其应用潜力涵盖生物、化学和材料科学多个领域,包括DNA序列设计、均相和非均相催化剂发现,以及由多个构建单元组成的功能材料(如金属–有机框架)的构建。随着LLMs能力不断提升,预计本文提出的LLM-EO框架将在其他科学发现领域发挥越来越重要的作用。然而,LLM-EO性能仍然对LLM选择较为敏感。不同LLMs之间的性能差异主要来源于模型架构、训练数据和模型规模的不同。值得注意的是,具有更强推理能力的先进模型(o1-preview)表现最佳。这一趋势表明,LLM-EO方法具有持续发展的潜力。鉴于不同模型之间存在性能差异,建议通过针对具体任务的经验测试或初步研究,对候选LLMs进行基准评估,以指导模型选择,相关工作将在未来进一步开展。