npj Comput. Mater. 2025 | 基础模型驱动材料发现:现状与未来发展方向
今天介绍的是发表在 npj Computational Materials 上的一项研究工作。该工作聚焦于当前快速发展的基础模型在材料发现领域中的应用与演进路径,指出传统基于特征工程与小规模数据的方法难以应对复杂材料体系中的高维关联问题。在方法层面,研究系统梳理了基础模型框架,包括自监督预训练、下游微调以及多模态数据融合,并分析其在性质预测、分子生成与合成路径设计中的应用表现。结果表明,这类模型能够通过统一表征学习显著提升跨任务泛化能力,并在多任务场景中展现出优于传统模型的潜力。同时,文中也指出数据质量、多模态融合及可解释性等关键挑战。整体来看,该工作为理解AI驱动材料发现的新范式提供了系统性框架,并为未来多模态与多保真模型的发展方向提供了重要参考。

获取详情及资源:
0 摘要
大语言模型(large language models,LLMs)在应对人工智能领域中最复杂的一些任务方面展现出显著潜力。围绕基础模型这一更广泛的研究领域(其中LLMs是重要组成部分),系统综述其在材料发现中的应用进展。在当前研究现状方面,涵盖性质预测、合成路径规划以及分子生成等典型应用方向;同时,对未来发展趋势进行展望,探讨新型数据获取方式及多模态数据形式将如何影响这一新兴领域的发展方向。
1 引言
人工智能的发展史本质上是一部数据表征的发展史。早期专家系统依赖人工构建的符号表征,随后逐步演化为面向特定任务的手工特征表示,用于早期机器学习应用。由于手工构建表征能够在数据不足时起到“补救”作用,并融入大量先验知识,这一方法长期占据主导地位。随着数据规模的不断增长以及可用于计算的资源同步提升,研究重点逐渐转向更加自动化、数据驱动的表征学习方式,即利用新兴的深度学习方法进行建模。尽管这种方法缺乏手工特征中显式注入的先验知识,但开始在一定程度上缓解由人为偏见隐式引入的问题。随着该方法的普及,尤其是在GPU被广泛用于模型训练的推动下,数据观念发生了范式转变,大规模数据集的收集与整理成为深度学习模型训练中的核心工作。

图1|机器学习表示方法发展的时间线 展示从手工构建的符号表示到当今基础模型的发展过程,涵盖深度学习兴起等关键里程碑。
然而,可用于此类任务的高质量大规模数据集在实际中存在数量上的限制,甚至可能存在更为根本性的约束。同时,当大量相关数据已被掌握时,模型在科学发现中所能带来的新颖性也引发了基础性问题,这进一步凸显了对更具泛化能力表征的需求。2017年,Transformer架构的提出,随后被OpenAI发展为生成式预训练Transformer(GPT)模型,展示了一条通过在大规模文本语料上进行自监督训练以获得通用表征的路径。从理念上看,这一模型某种程度上回归了特征设计时代,但其“特征”来源于在海量(通常包含噪声且未标注)数据中训练得到的“知识体系”。这种解耦方式使得最为依赖数据的表征学习过程只需执行一次,而针对具体任务的微调阶段则仅需极少甚至无需额外训练。
尽管材料发现任务相比语言生成更为复杂且具有更强的细致性要求,但已经观察到,人工智能领域中为语言任务开发的技术与方法,往往能够被迁移并应用于这一重要方向。当前综述将系统梳理基础模型的发展现状——这是近年来机器学习模型的重要演进类别,大语言模型属于其中的一部分——并进一步分析在材料发现领域中推广应用时所面临的关键挑战,以期最大化这一技术进展对科学研究的潜在影响。
2 基础模型
通常所称的“基础模型”是一类人工智能模型,大语言模型属于其中的一种具体形式,其定义为:在大规模数据上进行训练(通常采用自监督方式),并能够适配于多种下游任务的模型。这类模型通常以基础模型的形式存在,通常通过在大量未标注数据上的无监督预训练获得。随后,可以利用规模通常较小的标注数据对该基础模型进行微调,以执行特定任务。在此基础上,还可以进一步进行“对齐”处理,即使模型生成的输出更符合终端用户的偏好。在语言任务中,这可能表现为减少与人类价值观不一致的有害输出;而在化学任务中,则可能表现为生成更易合成或更符合化学规则的分子结构。这通常通过在潜在空间中对模型探索过程进行条件约束,使其集中于目标性质分布的特定区域来实现。
编码器与解码器在潜在空间中的作用机制,以及基于该潜在空间训练的模型如何生成性质分布,可以通过相关示意进行理解。将表征学习与下游任务(如输出生成)分离,可以在模型架构层面得到自然体现。尽管最初的Transformer架构同时包含编码与解码功能,但当前更常见的做法是将二者解耦,从而形成仅编码器或仅解码器的模型结构。

图2|通过编码器、解码器和预测器模型构建与利用共享潜在空间(嵌入)的可视化表示 分子表示通过编码器模型转换为其潜在空间表示,该过程可通过解码器模型进行逆向还原。此外,可在编码表示基础上构建额外的性质预测模型,以直接预测分子性质,并能够在潜在空间中生成性质分布。
借鉴双向编码表示模型的成功经验,仅编码器模型专注于对输入数据进行理解与表征,生成可用于后续处理或预测的高质量表示;而仅解码器模型则侧重于生成任务,通过在给定输入及已生成内容的基础上逐步预测下一个标记,从而生成新的输出,因此特别适用于生成新的化学实体等任务。这类模型在材料发现领域中的应用示例可通过相关总结进行说明。
表1|当前采用基础模型方法的材料发现任务示例

3 数据提取
成功进行基础模型预训练与指令微调的起点在于获取大规模且高质量的数据。在材料发现领域,这一点尤为关键。材料体系通常具有复杂的依赖关系,其中细微变化即可显著影响其性质,这一现象在化学信息学中被称为“活性陡崖”。例如,在高温超导材料(如铜氧化物超导体)中,临界温度
化学数据库提供了大量结构化材料信息,因此通常作为首选数据来源。例如,PubChem、ZINC和ChEMBL等资源常用于训练化学基础模型。然而,这些数据源在范围与可获取性方面存在局限,例如受许可限制(尤其是专有数据库)、数据规模较小以及数据来源偏倚等。此外,还需关注数据质量与可靠性。原始文献往往包含噪声、不完整或不一致的信息,这些问题可能在后续模型训练与分析中被放大。例如,命名规则不统一、性质描述模糊或图像质量较差,均会影响材料数据的准确提取与关联。
为克服上述问题,有必要构建能够在大规模文献中高效运行的数据提取模型。大量材料相关信息存在于各类文档中,包括公开或专有的科研报告、专利及演示文稿等。因此,基于人工智能的数据提取模型需要能够从多种数据载体中解析并收集材料信息。传统方法主要聚焦于文本内容,但在材料科学领域,大量关键信息同样存在于表格、图像及分子结构中。例如,在专利文档中,重要分子通常以图像形式呈现,而文本中可能包含无关结构。因此,现代数据库构建方法强调从多模态信息中提取分子数据,而不仅限于文本来源。
此外,一些最具价值的数据往往来源于文本与图像的联合信息,例如专利中的Markush结构,它能够概括关键的受保护分子结构。因此,先进的数据提取模型需要具备多模态处理能力,能够融合文本与视觉信息,从而构建能够真实反映材料复杂性的综合数据集。
基于数据提取的基础模型通常关注两类核心任务:一是识别材料本体,二是提取并关联材料的性质信息。对于前者,现有研究主要采用命名实体识别方法,但该方法仅适用于文本数据。同时,也发展出基于计算机视觉的方法,用于从图像中识别分子结构,例如基于视觉Transformer和图神经网络的技术。近年来的研究进一步尝试融合文本与图像信息,以实现对化学文献中通用知识的提取。
对于第二类任务,即性质提取与关联,大语言模型的发展显著提升了该类任务的准确性,并支持基于结构化模式的数据抽取方法。尽管传统的命名实体识别与多模态方法在多种文档格式的数据提取中已取得进展,但多模态语言模型并不需要独立处理所有信息类型,而可以与专用算法协同工作。例如,Plot2Spectra展示了如何从光谱图中提取数据点,从而实现材料性质的大规模分析;DePlot则通过将图表转换为结构化表格数据,为后续大语言模型推理提供输入。这些方法表明,多模态模型可以作为调度核心,调用外部工具处理特定任务,从而提升材料数据提取流程的整体效率与准确性。
4 性质预测
从结构预测材料性质是数据驱动方法在材料发现中所能提供核心价值的重要组成部分。传统上,性质预测要么作为高度近似的初筛手段(例如传统的QSPR方法),要么依赖对体系基本物理过程的模拟,而后者往往计算成本极高。基础模型为构建强大的预测能力提供了新的可能,其通过可迁移的核心表示,使得真正的数据驱动反向设计逐步成为现实。
需要指出的是,当前研究中多数模型基于分子的二维表示进行训练,例如SMILES或SELFIES,这可能导致关键三维构象信息的缺失。这一现象部分源于不同模态数据规模的显著差异——现有基础模型通常基于ZINC和ChEMBL等数据集进行训练,这些数据集规模可达约10⁹分子,而同等规模的三维结构数据尚不具备。一个例外是无机固体体系(如晶体),其性质预测模型通常基于三维结构信息构建,例如通过图结构或晶胞特征表示。
在用于性质预测的基础模型中,较多采用基于BERT架构的仅编码器模型,但其他基础架构(如GPT)也逐渐得到应用。基础模型方法的优势在于能够复用核心模型与架构组件,不过这种复用在一定程度上也类似于早期依赖有限人工特征的方法,后者最终推动领域向更数据驱动的方向发展。

图3|当前用于性质预测的常见模型架构类型划分 颜色依据“超类型”(即起源架构)进行区分:绿色表示基于 BERT 的模型,紫色表示基于 GPT 的模型,橙色表示直接基于 Transformer 的架构,蓝色表示 XLNet。
此外,一类基于机器学习的势函数模型(MLIPs)也可以视为基础模型,其核心任务是基于预训练模型预测体系的能量与力。这类模型通常利用大量高质量参考数据进行训练,这些数据通常来源于密度泛函理论计算。类似于基础表征可以用于构建强预测模型,MEGNET、MACE、ANI和AIMNET等预训练模型已开始被用于特定任务的微调,或用于数据量较小但精度更高的数据集。这一趋势得益于诸如Optimade等工作的推动,其降低了整合不同材料数据库(包括模拟数据)的门槛,从而为材料性质预测提供了新的路径。
尽管许多模型直接对性质进行预测,但在某些情况下(如稀有事件),数据不足可能限制模型性能。相比之下,通过逼近底层势函数,MLIPs能够以较低计算成本支持传统模拟方法,从而发现训练数据中未显式包含的结果。
无论是直接预测方法还是基于势函数的方法,都面临模型可迁移性与适用性的问题。针对这一问题,近年来开始出现用于评估模型性质的技术,例如模型粗糙度指标,其可用于定量评估模型在实际应用中的可靠性以及检测“活性陡崖”现象。然而,这一问题仍未得到完全解决,仍有待进一步研究。
5 分子生成
为克服传统启发式方法与网格搜索策略的局限,基于人工智能的生成模型在材料设计中的应用日益受到关注。这类模型通过利用多种分子结构表示(如基于文本的SMILES与SELFIES,或基于图的表示方法),学习生成具有目标性质的新分子。近年来,基于机器学习的材料设计方法呈现出高度多样化的发展趋势,包括变分自编码器、生成对抗网络、图神经网络、基于Transformer的模型以及扩散模型等,这些方法在不同层面推动了领域进展。
自上一十年末以来,一系列基于分子文本与图结构表示的开创性工作逐步展示了深度生成模型在材料设计中的应用潜力。在这些早期工作的基础上,已有研究成功将生成模型用于条件化设计与优化多类治疗分子,并在计算模拟或体外实验中得到验证,涵盖激酶抑制剂、抗病毒分子、抗菌分子以及针对特定疾病的化合物等。
基于机器学习的分子生成方法并不限于药物领域,在更广泛的材料发现任务中同样表现出显著效果。例如,通过图生成方法设计糖类与染料分子,利用语言模型生成小分子、多肽与聚合物,以及结合深度学习与密度泛函理论进行半导体材料设计等。这些成果表明,生成模型能够支持以性质为驱动的材料设计。
相关模型的发展显著降低了材料生成算法的使用门槛,这主要得益于开放基准数据集与专用工具库的发布。这些资源覆盖了多种方法,包括进化算法与生成模型,例如GuacaMol、Moses、TDC以及GT4SD等平台。尽管相关技术的获取变得更加便捷,在材料科学领域构建基础模型规模的生成模型仍面临挑战。直到近期,才开始出现针对多任务场景的生成式基础模型训练工作,通过在多种化学任务上的大规模预训练,展现出初步的应用潜力。
6 材料合成中的基础模型
基础模型在材料科学中的兴起,为无机与有机材料的合成带来了重要机遇,有望推动该领域发生深刻变革。然而,这类模型在材料合成中的直接应用仍处于早期阶段,目前无机与有机材料合成方面的关键进展仍主要依赖传统机器学习方法,而非基础模型。尽管如此,已有研究迹象表明基础模型将在未来发挥关键作用,因此有必要对相关发展趋势进行系统分析,以理解其未来可能的演化方向与特征。
在无机材料合成方面,基于机器学习与数据驱动的方法已取得显著进展。近期研究表明,可以利用科学文献中的自然语言文本作为新型数据源,用于预测无机材料的合成路径。例如,通过词嵌入与变分自编码器方法,能够生成钙钛矿材料的合成策略。此外,自然语言处理技术还可从文本挖掘中提取启发式规则,并在主动学习框架下优化无机材料(如粉体材料)的合成过程。这些研究推动了从文献中提取与分析合成信息的流程构建,为建立高质量的无机材料与单原子催化数据集奠定基础。
尽管自然语言处理技术展现出较大潜力,但科学文献本身存在固有局限,可能影响所提取合成方案的可靠性。例如,文献中的数据质量与报告一致性问题,包括数据不完整、术语不统一及实验细节不足等,都会限制基于文本的合成策略的泛化能力。为应对这些问题,需要加强数据集的整理与标准化,并发展更加稳健的数据处理框架,以支持更可靠的预测。
在监督学习方面,已开发出能够根据目标材料与前驱体信息预测合成路径与条件(如煅烧温度与烧结温度)的模型,其性能优于传统启发式方法。同时,强化学习方法也被用于优化合成流程,例如预测化学气相沉积中半导体单层MoS₂的时间序列反应条件。近期研究还结合高通量热化学数据与经典成核理论,通过分析催化成核势垒与选择性指标,筛选有利反应路径,并在LiCoO₂、BaTiO₃和YBa₂Cu₃O₇等体系中得到验证。这类方法为基础模型提供结构化的热力学与动力学信息,有助于提升其在复杂合成过程预测与优化中的能力,并为时间序列数据分析及化学合成任务提供新的发展方向。
上述无机合成领域的进展凸显了基础模型的巨大潜力,尤其是在扩展大语言模型能力方面。已有研究表明,大语言模型在预测无机化合物可合成性及筛选合适前驱体方面具有良好表现。从长期来看,基础模型有望在性能上接近专用机器学习模型,同时显著降低开发时间与成本,从而成为支持多任务材料合成的重要工具。
在有机材料合成领域,基础模型的发展路径呈现出类似趋势。这类模型在优化合成路径与反应条件方面具有巨大潜力。早期研究已表明,深度学习模型能够有效预测反应结果与逆合成路径,其中分子Transformer模型通过将反应预测视为机器翻译任务,实现了高精度的产物预测。近期基于提示的推理方法进一步扩展了模型能力,使化学家能够引导逆合成路径的生成,从而获得更具多样性与创新性的断裂策略,并减轻训练数据偏倚的影响。针对特定领域的大语言模型通过专用数据微调并结合化学工具,显著提升了有机合成任务的预测能力。
能够同时处理化学与自然语言任务的基础模型的提出,标志着该领域的重要突破,表明跨领域信息共享可以提升模型在复杂任务中的表现。进一步发展的大规模模型(例如参数规模达150亿的模型)已被用于逆合成预测与生成化学任务,显示出基础模型不仅具备预测能力,还具备指导实验设计的潜力。
基础模型在无机与有机材料合成中的未来应用尤为值得关注,尤其是在其能够融合多模态数据的能力方面,包括光谱数据、晶体结构数据以及原子尺度模拟数据。这种能力有助于全面理解材料行为,从而支持具有目标性质的新材料设计。多模态基础模型的发展将为材料合成提供一种变革性路径,通过整合不同数据来源中的复杂相互作用,不仅可以提高预测精度,还能够生成可供实验验证的新假设。这有望推动催化、药物设计与能源存储等领域的发展,同时也使基础模型成为应对材料科学复杂问题的重要工具,例如反应机理解析与合成路径优化等。
7 挑战与未来展望
7.1 利用多模态模型应对数据问题
随着大语言模型在自然语言之外领域的广泛应用,以及更强大基础模型的不断出现,多模态方法逐渐成为研究热点。这一趋势推动了视觉-语言模型的发展,例如Flamingo、LLaVA和Idefics等模型,通过融合多种数据类型拓展基础模型的感知能力。除模型本身外,多模态数据集在其成功应用中同样至关重要。近年来,基于网络抓取构建的图文联合数据集已成为机器学习研究的重要基础,并催生了多个促进多模态建模发展的基准体系,如Cauldron和MMMU等。
除了通用视觉-语言数据集,针对拓展模型感知能力的专用数据资源也在不断发展。例如,在第一视角感知领域,Ego4D与Ego-Exo4D提供了丰富、多样且带标注的数据,用于人类行为识别与环境理解研究。然而,多模态方法在材料发现领域的应用仍较为有限,其主要原因在于缺乏覆盖广泛材料类型及其性质的大规模高质量数据集。
尽管如此,近年来受多任务提示学习与指令微调成功经验的启发,一些模型已被用于多模态材料任务。例如Text-Chem T5与Regression Transformer在多模态任务中展现出优于专用单任务模型的性能,并在加速新材料设计方面取得进展。这类多用途模型的发展表明,通过整合多源数据进行训练具有重要潜力。
尤其值得关注的是,基于模拟方法可以生成大量高质量数据,这为弥补真实数据不足提供了可行路径。将模拟数据与实验数据相结合,有望构建更加稳健且精确的模型,从而进一步推动材料科学中多模态基础模型的发展。
7.2 捕捉新型数据以支持新型模型
在材料发现领域,生成模型在合成数据生成与数据增强中的应用不断增长,但其基础仍依赖于实验观测数据,而这些数据对于新材料发现至关重要。然而,实验结果的可重复性问题依然广泛存在,同时,高质量且符合可查找、可获取、可互操作与可复用原则的实验数据在有效传播方面仍面临挑战。可重复性不足通常源于实验数据或元数据存在缺失或质量问题。此外,实现数据互操作性与标准化还需解决数据格式与模式不统一的问题,同时还面临用于数据数字化与组织的工具多样性带来的复杂性。
尽管利用大语言模型可以在一定程度上促进已有数字化数据的整合与整理,但能够同时处理多种数据模态的多模态基础模型,为数据采集与实验记录提供了新的思路。例如,从卷积神经网络向基于Transformer的模型转变,推动了视频与动作识别领域的发展,并催生出一系列具备多任务能力的视觉-语言基础模型。这类模型在多种视频识别任务中表现出显著性能提升,例如在Kinetics-400数据集上的动作识别任务中,Top-1准确率已从2016年的73.9%提升至2024年的93.6%。
目前,大规模视觉-语言模型的训练数据主要集中于常见人类活动,但也已扩展至特定领域,例如内窥镜手术过程分析,用于识别手术动作、生成反馈并分析术中因素与术后结果之间的关系。这表明,多模态基础模型在复杂过程理解与记录方面具有广阔潜力。
将多模态基础模型应用于专业实验流程的转录,有望从实验源头缓解数据与元数据采集问题。通过将原始观测数据与传感器数据自动转换为标准化记录,可以在尽量减少实验人员负担的前提下,实现实验过程的自动化记录,并集成至电子实验记录系统等数字化平台中。这种数据采集方式不仅有利于实验人员,也将为依赖数据进行建模与分析的研究人员提供更高质量的数据支持。
尽管这一方向仍处于初期阶段,且缺乏公开数据集与标准基准,已有研究已初步验证了利用多模态基础模型实现实验过程实时转录的可行性。该技术有望推动实验记录流程的标准化,将实验过程细节与结果建立关联,促进科研教学与信息共享,并为下一代材料发现基础模型提供更加一致且可复现的数据基础。
7.3 利用多保真模型挖掘近似科学的价值
随着模型架构能力与计算基础设施的不断提升,能够处理海量数据的能力也在增强,但与此同时,数据收集中的偏倚被引入模型的风险也随之增加。这一问题在当前语言模型中已有体现,例如英语语料占优导致模型在其他语言上的能力较弱。在材料发现领域,这一风险尤为突出,因为材料发现本质上需要探索未知化学空间,而这些区域往往在大规模数据集中表示不足,现有数据则可能集中于特定化学领域(如有机化学)或应用方向(如药物研发)。
多保真模型被认为在缓解这一问题方面具有重要作用。所谓多保真模型,是指能够同时利用来自不同来源的数据进行建模,这些数据在获取成本与精度上存在差异。例如,可以结合多种量子化学计算方法获得分子数据,包括半经验方法、密度泛函理论以及MP2等方法。通过整合多来源数据,类似于多模态模型融合不同数据类型,多保真模型能够在一定程度上缓解数据稀疏性问题。
多保真方法是近年来材料发现机器学习工具中的重要补充,已在优化问题以及分子与材料性质预测任务中取得进展。将多保真方法进一步拓展至基础模型框架,有望持续推动该领域的发展。
8 结论
基础模型已在解决材料发现中一些最具挑战性的问题方面展现出潜力。围绕这一新兴研究方向的基本原理及其在材料发现任务中的适用性进行了系统梳理。当前,基础模型已在多个关键方向产生显著影响,包括性质预测、逆合成分析以及分子生成。同时,对未来发展进行了展望,指出持续释放其价值的关键在于充分利用材料数据所固有的多模态与多保真特性,并通过更为先进且高效的建模方法加以整合。
在现有技术基础上进一步拓展上述方向,有望释放巨大的应用潜力,并借助科研领域不断积累的数据资源,显著加速材料发现进程。