Nat. Comput. Sci. 2026 | Open Materials 2024 (OMat24) 无机材料数据集与模型

今天介绍的是发表在 Nature Computational Science 上的一项研究工作。材料科学中,无机材料的发现和模拟是能源、半导体制造等多领域的核心问题,但传统计算方法效率有限。OMat24 数据集通过整合超过 1.1 亿条密度泛函理论(DFT)计算,覆盖多样化化学元素与材料结构,为机器学习原子间势(MLIP)模型提供了大规模训练基础。基于 OMat24 的模型在 Matbench-Discovery 评测中表现优异,稳定性 F1 分数超过 0.9,形成能误差约 20 meV/原子,同时在热导率与声子预测任务中表现出高精度。相比以往数据集,OMat24 的高多样性有效纠正了系统性软化偏差,使能量、力和声子预测更加可靠,为无机材料性能预测和模型架构优化提供了强大工具和社区共享资源。

获取详情及资源:

0 摘要

无机材料的发现与模拟是从气候变化到半导体制造等多种应用的核心。人工智能有潜力显著加速材料模拟、发现与设计。尽管训练数据集和机器学习原子间势架构的开发已经取得相当进展,但开放可用、可复现的数据集和模型的先进水平仍落后于专有模型。为解决这一问题,Open Materials 2024(OMat24)数据集被提出,其中包含跨越多种化学体系、材料和构型的超过1.1亿次密度泛函理论计算。在OMat24上训练的机器学习原子间势模型在Matbench-Discovery排行榜上取得领先表现,其稳定性预测的F1分数超过0.9,形成能精度约为20meV/原子,优于以往模型。在新开发的热导率和声子预测任务基准中,OMat24训练模型也表现出较高准确性。OMat24的多样性纠正了以往基于较低多样性数据集训练模型中持续存在的软化偏差;这些旧模型会系统性低估能量、力以及声子等导数性质。OMat24数据集推动科研社区开发出改进的模型架构,使无机材料性质预测精度实现阶跃式提升。

1 引言

新材料发现是许多紧迫全球问题的基础,其中包括寻找可再生能源存储新材料、生产碳中性燃料以及实现从空气中直接捕获CO2等诸多方向。新材料搜索空间极其庞大,因此高效筛选新材料的能力至关重要。无论对传统计算方法还是实验材料科学方法而言,这都具有挑战性。与密度泛函理论(DFT)等传统方法相比,机器学习(ML)模型有潜力显著提高计算材料模拟效率,并有望解决许多因计算成本高昂而难以系统回答的科学问题。

近年来,机器学习原子间势(MLIP)作为DFT替代模型快速发展,并在跨材料泛化能力方面不断提升。与其他领域一样,训练大规模且可泛化的模型受限于大型、多样化数据集的可获得性。计算材料社区受益于Materials Project(MP)、Alexandria、OQMD和AFlow等开放从头算数据库;这些数据库包含跨多种组成和原型的近稳定结构。尽管基于这些数据集训练的模型在准确性和规模上不断提高,但它们常常难以外推到显著偏离近平衡训练数据的构型,从而限制了其在相关条件模拟中的实用性,这很可能源于训练数据多样性不足。近期一些专有模型和数据集声称已经解决其中部分问题,但在无法访问底层训练数据的情况下,开放科学工作无法受益于这些结果,也无法独立复现这些结果。

Open Materials 2024(OMat24)数据集旨在提升MLIP在广泛材料范围内的泛化能力,并降低系统性软化。OMat24包含超过1亿次单点DFT计算,样本来自无机块体材料中多样化的非平衡原子构型和元素组成,并建立在MPtrj、MP和Alexandria等公共数据集之上;这些公共数据集包含平衡或近平衡构型。在OMat24上预训练EquiformerV2和eSEN架构的若干变体后,通过微调处理DFT设置差异,可在常用Matbench-Discovery排行榜上取得当前最优结果。自发布以来,该排行榜上的所有顶级模型均采用了这一数据集。基于OMat24训练或预训练的模型表现出降低的系统性软化,甚至不再表现出系统性软化,并且这种改进在不同模型架构之间保持一致。

图1|OMat24 数据集概览 a. 数据集示意图,包括生成方法、应用领域和采样策略:rattled Boltzmann(其中 pekT 分别表示在温度 T 下以总能量 e 选择结构的概率,k 为玻尔兹曼常数)、rattled relax 和 AIMD。显示的结构为各采样策略下的随机样本。 b. 结构频率密度分布,按每个结构的原子数、参考于基本块体相的每原子能量、力范数以及最大绝对应力分量统计,分别针对 MPtrj、Alexandria(Alex)和 OMat24 数据集。 c. OMat24 数据集中元素分布。

2 结果

2.1 OMat24数据集

OMat24数据集吸收了Open Catalyst Project和OpenDAC等早期团队计划、MPtrj和Alexandria等社区贡献以及专有发布中的重要经验。基于这些经验,OMat24专门面向无机材料MLIP训练设计,以克服早期计算材料数据集面临的挑战。

• 规模:从单点计算数量来看,OMat24是一个面向无机材料的大规模公共从头算训练数据集,比其他开放可用数据集最多大两个数量级。

• 多样性:得益于社区对假想材料进行原型化和编目的努力,OMat24在元素周期表范围内具有组成多样性,并包含大量远离平衡态的结构。

• 开放科学:OMat24以宽松的CC BY许可发布,便于整个无机材料社区在此基础上继续构建。

OMat24数据集共包含1.18亿个带有能量、力和晶胞应力标签的结构。每个结构的原子数范围为1到100个。多数OMat24结构每个结构少于20个原子,这是从Alexandria数据集结构出发的直接结果;Alexandria主要由每个结构16个或更少原子的结构组成。每个结构超过50个原子的OMat24结构,是用于从头算分子动力学(AIMD)的较大输入结构。

OMat24旨在训练能够同时预测平衡和非平衡性质的MLIP模型。它包含平衡和非平衡结构,因此相比仅含弛豫数据的数据集具有更宽的标签分布。通过将最终标签分布与MPtrj和Alexandria进行比较,并绘制相对于各数据集DFT设置所计算元素块体相的能量,可以确认这一点。与作为输入结构来源的Alexandria相比,OMat24的能量略高;与MPtrj相比,其能量显著更高。同时,OMat24的力分布和最大晶胞应力分布也明显宽于这两个数据集。

OMat24的元素覆盖范围跨越元素周期表的大部分区域,并与Alexandria和MPtrj高度接近;由于氧化物在开放数据中占比较高,氧化物被过度表示。最后,OMat24展现出更高的局部原子环境多样性,这反映在3.5Å内元素对计数更高且更均匀,并超过MPtrj和Alexandria。

OMat24训练、验证和测试划分。OMat24被划分为明确的训练集、验证集和测试集,以确保社区能够进行一致的训练和评估。训练集和验证集已经发布,用于模型开发和迭代。测试集分为四个不同划分。第一个划分(WBM Test)用于确保训练数据集不与基于WBM数据集构建的Matbench-Discovery排行榜重叠。其他三个划分分别衡量模型在域内训练数据(ID)上的准确性,以及模型对分布外组成(OOD-Composition)和元素组成(OOD-Element)的泛化能力。

WBM Test划分使用AVIARY包中的AFLOW结构原型标签创建。结构的原型标签是一种标准化晶体结构分类方式,依据包括元素化学计量、空间群、Pearson符号和Wyckoff位置。该划分包含所有从Alexandria弛豫结构生成且其原型标签与WBM数据集中初始结构或弛豫结构任一原型标签匹配的OMat24结构。此外,所有原型标签与WBM初始结构或弛豫结构匹配的OMat24结构也被纳入WBM Test划分。WBM Test划分总计包含530万个结构。由于Alexandria和WBM数据集在材料上存在重叠,对数据集进行过滤并创建这一测试划分,对于确保训练数据不会无意泄漏到最终Matbench-Discovery结果中十分重要。

OOD-Composition划分通过选择约5000种唯一元素组成,并将所有匹配这些组成的结构分配到该划分中构建而成,共57.3万个结构。OOD-Elemental划分类似地选择约3000种唯一元素组合,并纳入所有匹配结构,共61.9万个结构。这些划分的一个局限在于可能包含朴素OOD情形,例如稀释取代或元素掺杂;在这些情形中,小幅化学计量变化并不会实质性增加化学复杂性。不过,数据集中体系尺寸相对较小且缺少掺杂剂,这限制了此类样例的数量。相比之下,WBM Test划分按唯一匿名化化学式和空间群分离,并始终产生最高预测误差,表明它代表了最重要的分布迁移,也为模型泛化能力提供了信息量更高的测试。

在创建上述三个测试划分后,训练、验证和ID测试划分包含OMat24剩余的所有结构,总计1.11亿个结构。该数据集被随机划分为训练集、验证集和ID测试集,分别包含1亿、500万和500万个结构,用于相关模型训练。所有数据集划分规模均已明确记录。

表1|OMat24 数据集划分

还发布了完整数据集的一个开发子集,称为OMat24-1M,其中包含约100万个从完整训练划分中随机选取的训练结构。相应的验证集和测试集包含一定数量的结构,以保持与完整数据集相同的训练-验证和训练-测试比例。OMat24-1M开发数据集尤其适用于快速训练迭代、消融实验和超参数优化。

数据集局限。OMat24数据集是同类开放数据集中规模最大的材料DFT替代模型训练数据集之一。然而,与许多高通量数据集类似,该数据集也存在会影响基于其训练模型预测结果的局限。OMat24采用Perdew-Burke-Ernzerhof(PBE)和PBE+U级别的DFT计算;这些近似及其计算结果包含固有误差,而PBEsol、SCAN、r2SCAN或混合泛函等其他泛函在一定程度上处理了这些误差。OMat24数据集仅包含周期性块体结构,不包括点缺陷、表面、非化学计量和低维结构带来的重要影响。最后,OMat24数据集只包含从Alexandria数据集中畸变弛豫结构出发的一小部分结构弛豫,总计45000次弛豫,因此不提供关于稳定结构的额外或全新信息。

OMat24中的计算不同于MP PBE和PBE+U计算。在混合计算用于分析或模型训练时必须谨慎。尽管设置差异较小,包括5.4版本赝势以及Yb和W赝势选择,但总能和形成能预测仍可能不同。为说明这些细微差异,基于用于拟合MP2020校正的423种化合物,对MP和OMat24 DFT设置下的形成能计算结果进行了比较。原始MP计算被用于与OMat24 DFT设置计算得到的能量进行比较。为计算形成能,元素参考被计算出来,并按照PYMATGEN中MATERIALS2020COMPATIBILITY类采用的方法拟合阴离子校正以及广义梯度近似(GGA)/GGA+U校正。

图2|OMat24 与 MP DFT 形成能一致性 使用 MP PBE 设置和 OMat24 DFT 设置计算 423 个从 MP 中选取化合物的形成能。 a. 预测形成能与实验形成能的对等图。 b. 使用 OMat24 与 MP DFT 设置计算的形成能对等图。 c. 能量差直方图。形成能使用 MP2020 GGA/GGA+U 混合修正和阴离子组成修正计算。MP 修正直接取自 MP,OMat24 修正按相同方法拟合,使用 OMat24 设置计算的 DFT 数据。

423种化合物的DFT预测形成能一致性关系以及MP与OMat24 DFT形成能预测差异分布显示,多数差异低于20meV/原子,总平均绝对差异为13.5meV/原子,与更新赝势带来的预期变化一致。超过50meV/原子的偏差主要出现在磁性化合物的GGA+U计算中。这些差异主要源于磁有序差异:OMat24将所有结构初始化为铁磁态,而部分MP计算从能量更低的磁态开始。因此,两者最终磁态可能不同。最大差异对应于在MP中为反铁磁、但在OMat24中为铁磁的化合物。

使用现有DFT数据集训练MLIP的一个关键局限是前述磁有序固定初始化,这无法保证所得计算对应于真实磁基态。例如,基于OMat24数据集训练的模型通常预测特定磁构型的形成能,通常是铁磁构型,而不是真实磁基态。使用MLIP准确计算磁性材料形成能,需要仔细考虑不同磁有序之间的能量差异。用MLIP准确计算磁性材料形成能,需要显式考虑可能磁有序之间的能量差异。在MLIP中处理磁结构仍是活跃研究方向,涉及平衡且信息充分的训练数据集生成,以及模型架构和训练策略的进步。

最后,OMat24数据集采用与MP PBE计算一致的收敛标准生成,在计算效率与准确性之间取得平衡,以便在可用计算资源内支持大规模数据生成。后续分析发现,部分AIMD子划分存在非零漂移力,表明更严格的收敛可能有益。不过,当模型在这些子划分上训练,并用更严格收敛阈值和零漂移计算进行评估时,模型性能仍保持稳健。

2.2 OMat24模型评估

利用常用Matbench-Discovery基准,对OMat24数据集训练的MLIP性能进行评估,并与基于其他数据集训练的模型进行比较。基于OMat24数据集训练的eSEN和EquiformerV2均超过以往当前最优模型。尤其值得注意的是,当前表现最好的五个模型无论来自哪个团队,均只在OMat24数据集上训练。这凸显出大型多样化数据集在推进MLIP性能方面的关键作用。

此外,能量、力和声子的系统性低估这一普遍问题也被考察,该问题被称为系统性软化。分析显示,当模型在OMat24数据集上训练时,这种不利影响在多种模型架构中显著降低或完全消除。这一突破凸显了该数据集在提高模型可靠性及其对非平衡区域泛化能力方面的独特作用。

Matbench-Discovery上的模型性能。Matbench-Discovery目前基于两项预测任务评估模型:(1)材料发现任务;(2)热导率预测任务。发现任务通过比较材料分解能与竞争相来预测热力学稳定性。这需要弛豫原子位置和晶胞;与MLIP相比,使用DFT完成这一过程的计算成本更高。MLIP能够提供快得多的预测。近期纳入的热导率(κ)预测任务要求MLIP准确捕捉势能面(PES)的二阶和三阶导数,以便准确预测热输运。

对OMat24和OC20预训练模型的结果进行汇总后可以看出,由于OMat24采用的DFT设置不同于Matbench-Discovery排行榜,模型需要在MPtrj(OMP)上微调,或在sAlex和MPtrj(OAM)上联合微调。尽管OC20并非为材料建模而设计,但经MPtrj微调后仍表现强劲,凸显出大规模非平衡数据多样性的价值。OMat24预训练在几乎所有指标上都取得显著更好结果,明显优于先前方法。由此得到的eSEN和EquiformerV2模型在当时刷新了Matbench-Discovery最佳表现:eSEN的F1分数达到0.925,高于凸包能量平均绝对误差(MAE)为18meV/原子。相较于仅在MPtrj上训练且有无去噪处理的模型,OMat24带来的提升同样明显。

表2|Matbench-Discovery 基准测试中非合规模型在独特原型划分上的结果

MAE 和均方根误差(RMSE)的单位为每原子 eV。最先进结果以加粗显示。DAF 表示发现加速因子;TPR 表示真正率;FPR 表示假正率;TNR 表示真负率;FNR 表示假负率;R² 表示决定系数。

更重要的是,OMat24训练模型带来的显著提升并不限于eSEN和EquiformerV2架构。以Matbench-Discovery排行榜自建立至2025年初,即OMat24预印本发布6个月后的时间顺序来看,高于凸包能量的MAE和热导率的对称相对平均误差(SRME)均显示出这种跨架构改进。

图3|MLIP 模型按时间的性能提升 模型在 Matbench-Discovery 上的能量高于稳态 MAE 以及热导率 SRME(κSRME),按发布时间顺序显示。大多数高性能模型在 OMat24 数据集上训练,并在 MPtrj 和 sAlex 上微调,标记为 OAM。

基于OMat24训练的五个表现最佳模型在发现任务中取得强劲表现,其中许多模型的高于凸包能量预测误差约为20meV/原子。此外,所有基于OMat24训练的能量守恒模型都表现出最低的热导率预测误差,并持续位居Matbench-Discovery总排行榜前列。直接力模型,如EquiformerV2和ORB v2,已被发现难以在声子预测任务中取得良好表现,这从其较高的热导率SRME可见一斑。

系统性软化的模型评估。在较小弛豫轨迹数据集上训练的MLIP架构中,已经观察到对能量、力和声子的系统性低估,MPtrj就是这类数据集之一。这一现象称为系统性软化,归因于数据集分布偏差以及非平衡结构不足。

基于Deng等人的工作,系统性软化按预测中使用的势能导数阶数在三个层级上进行量化。

(1)零阶软化量化非平衡结构中的能量系统性低估,例如含缺陷、表面和界面的结构。该指标被定义为目标能量与预测能量之间的每原子差值。负偏差表示存在零阶软化。

(2)一阶软化量化非平衡结构中的力系统性低估。该指标通过先前提出的软化尺度进行评估,即目标力与预测力一致性图的最小二乘拟合斜率。偏向小于1的取值表示存在一阶软化。

(3)二阶软化量化声子振动频率的系统性低估。该指标被定义为最大预测声子频率与最大目标声子频率之间的比值。偏向小于1的取值表示存在二阶软化。

零阶和一阶软化使用WBM高能态数据集评估,该数据集包含约10000个从随机选择的WBM结构中获得的高温MD样本。二阶软化使用PBE材料数据仓库(MDR)声子数据集估计。这两个数据集中的所有计算均使用PBE泛函和相同赝势;MDR声子计算的主要差异在于其力弛豫和电子能量收敛标准更严格。PBE MDR声子数据集排除了按照MP协议需要+U校正的材料。

针对仅在MPtrj上训练、在OMat24上预训练后再于MPtrj和sAlex上微调(OAM),以及仅在OMat24上训练的模型,零阶、一阶和二阶系统性软化被分别量化。未经过OMat24预训练、仅在MPtrj和MPtrj+sAlex上训练的MACE(多原子簇展开)模型被纳入作为基线。与仅MPtrj模型相比,OAM模型在零阶和一阶软化方面明显降低,其中eSEN和EquiformerV2架构几乎完全消除了这两类软化。仅在MPtrj和sAlex上训练的MACE模型(MPA)相较仅MPtrj模型也表现出降低的软化,但幅度小于OAM模型。

二阶(声子)软化结果显示,eSEN OAM模型出现退化,其软化程度高于对应的MPtrj模型。相比之下,GRACE和SevenNet OAM模型表现出中等程度的软化降低。为理解这一退化,对未进行微调、仅在OMat24上训练的模型进行了考察。仅OMat24训练的eSEN模型不表现出二阶软化,凸显出数据集多样性和广度的益处。实际上,仅在OMat24上训练的模型在所有架构中均表现出更少的各阶软化,表明使用弛豫数据进行微调会重新引入一定程度的系统性软化。

图4|使用 OMat24 训练数据减少模型系统性软化现象 a,b. 来自 MPTrj、OAM(OMat24 + MP/sAlex 微调)与 MPA(MP/sAlex)训练模型之间的零阶(能量)、一阶(力)与二阶(声子)系统性软化分布变化(a),以及 OMat24、OAM 与 MPA 模型(b)。小提琴图展示了模型在高能 WBM 集上的能量与力软化尺度分布,以及在重新计算的 MDR 声子数据集上的声子软化分布。若力由能量梯度预测,则模型标记为“守恒”,否则标记为“非守恒”。

3 讨论

OMat24数据集是材料科学的重要进展,提供了用于训练MLIP的大规模、多样化PBE-DFT结构集合。其覆盖广度使模型能够捕捉复杂材料行为,并显著提升性质预测准确性。尽管OMat24采样了广泛的非平衡构型,但并未显式包含过渡态帧,也未包含断键或大配位变化等高度偏离平衡的区域。多数现有基准聚焦于平衡或近平衡性质;不过,基于OMat24训练的模型已经表现出强外推能力,能够成功预测数据集中未直接表示状态的性质,包括缺陷、晶界、吸附能和解理能。持续开发此类基准对于识别模型局限并指导未来数据集生成工作仍然至关重要。

此外,PBE泛函与实验结果之间的差异可能限制真实应用中预测的可靠性。用户应注意PBE(+U)泛函的固有局限,以及该数据集对块体、无缺陷结构的侧重。尤其是PBE及相关GGA泛函通常难以准确捕捉df轨道中的强在位库仑相互作用,这可能导致与实验观测出现偏差。

使用SCAN和r2SCAN等更准确DFT泛函开发训练集和基准,可能有助于开始克服这些挑战。自v2022.10.28版本起,MP开始为其部分数据集纳入r2SCAN计算。此外,MatPES作为首个包含40万个结构的r2SCAN MLIP训练数据集,在OMat24发布后不久发布。下一步显然是构建类似OMat24、但采用SCAN、r2SCAN或更高保真泛函的大规模数据集,并结合额外的物理动机采样策略,例如使用主动学习循环、分子动力学和元动力学,高效采样和优化局部极小值之外的构型。

通过多保真学习、delta学习或微调,也可以高效构建采用更高保真方法的模型。这些方法能够利用OMat24中大量低保真力数据,并辅以较小规模的高保真能量集合,使MLIP以较低计算成本达到混合泛函甚至CCSD(T)级精度。以OMat24的元素多样性和非平衡采样作为预训练基础,可以加速开发高精度势函数,服务于泛函误差或表面与缺陷物理至关重要的应用。

OMat24的发布预计将促进更具数据效率的建模工作。例如,MatPES项目展示了在较小数据集中最大化信息含量的价值,近期工作也聚焦于有效采样和数据集压缩策略。OMat24提供了稳健平台,可进一步探索旨在识别非冗余物理信息的采样和压缩技术,最终推动用最少数据训练先进模型。

OMat24数据集已经迅速成为开发高精度MLIP的关键资源,并大幅降低系统性软化偏差。其全面覆盖范围使模型不仅能够在预测任务中表现出色,也能为材料科学未来进展提供可靠基础。正如OMat24建立在MP和Alexandria数据集等开放科研工作的基础上,它也有望帮助科研社区进一步提升材料科学机器学习模型的能力。