JACS Au 2026 | 更智能的数据: 面向非均相催化机器学习势函数的数据生成范式重思
今天介绍的是发表在 JACS Au 上的一项研究工作。该工作聚焦于非均相催化中机器学习势函数(MLPs)训练数据的核心瓶颈,指出性能提升的关键不在模型结构,而在于数据构建方式。围绕催化体系中结构演化与反应路径高度复杂的问题,引入“scope–relevance–coverage”三维框架,用于重新定义训练数据的质量标准。在此基础上,对传统结构驱动的数据生成流程与主动学习策略进行系统梳理,并进一步讨论基于原子相互作用空间的交互式采样方法,以提升跨体系泛化能力。研究最终强调,未来高可靠催化MLPs的发展将依赖于结构化数据与交互式数据的协同融合,而非单一数据扩展策略。

获取详情及资源:
0 摘要

机器学习势函数(MLP)有望在异相催化相关尺度上实现接近第一性原理的保真度,但决定其可靠性的关键因素仍是训练数据质量。核心挑战在于构建能够同时捕捉体系特异性结构域,以及异相催化体系复杂动态特性所带来更广泛化学变异性的训练集。对于这一Perspective文章,关键问题不再只是如何生成更多数据,而是如何生成正确的数据。用于构建异相催化MLP训练集的主要策略,可从范围、相关性和覆盖度三个维度重新理解。随后,催化体系中的数据生成挑战及其对主流基于结构采样实践的塑造作用得到考察;这类实践将体系相关性和目标覆盖度直接编码进数据集。正在兴起的基于相互作用的采样策略也受到讨论,这些策略旨在将局部相互作用支持扩展到狭窄预定义体系之外。最后,一个可能的混合数据生成流程被整合起来,该流程结合两种方法的优势,从而使MLP更接近复杂异相催化体系的模拟需求。
1 引言
数据是任何机器学习模型的核心,无论是大语言模型、计算机视觉模型,还是此处讨论的化学机器学习势函数(MLP)。高保真MLP正在快速重塑原子尺度模拟,因为它们能够在更大尺度上提供接近第一性原理的精度。在异相催化中,这一前景尤其具有吸引力。催化反应活性由动态反应体系支配,其中催化剂结构和组成、表面覆盖度以及反应路径都会随反应条件演化。然而,正是这种复杂性也使异相催化成为MLP最具挑战性的应用领域之一,因为催化界面很少局限于狭窄且定义明确的构型空间。因此,催化MLP开发的核心瓶颈通常并非模型架构本身,而是训练数据能否充分代表模型在部署过程中实际遇到的环境。
这一点很容易被忽视,因为近期原子尺度机器学习的许多进展都围绕架构展开,例如更好的描述符、消息传递方案以及更强大的等变神经网络。这些进展必不可少,但并不能消除一个更简单也更基础的约束:模型只能在其见过的构型和标签所定义的域内可靠插值。在异相催化中,理想化模型与原位工况现实之间的差距会放大这一数据挑战,而这一差距正是需要弥合的问题。即使对MLP而言,高效捕捉相关环境和化学的这种广度仍具挑战。目前,MLP往往聚焦于给定催化体系的某一特定方面,例如催化剂结构变化、表面覆盖度、金属-载体相互作用以及液/固界面。相应地,催化领域中许多成功的MLP都是高度定向的模型,面向特定催化剂、吸附物或机理问题而设计。采样过程通常嵌入主动学习循环,由不确定性和多样性标准选择需要DFT标注的构型。这一策略往往非常有效,因为它缩小了域范围,并使训练集能够紧密匹配预期任务。
然而,这种体系特异性范式的成功也暴露出其局限。随着该领域转向更真实的催化问题,为每一种催化剂、条件或机理区域构建新数据集并重新训练新MLP的成本越来越难以承受。问题并不在于定向模型方向错误;相反,它们在许多定义明确的应用中仍不可或缺。真正的挑战在于,异相催化越来越需要模型不仅在狭窄域内准确,还要对演化环境、耦合复杂性以及此前未见过的局部化学具有更强鲁棒性。这推动了对更宽泛且更可迁移MLP的兴趣,包括更大的公共数据集、基础模型预训练,或更以相互作用为中心的采样策略。与此同时,这些发展也提出了一个更深层的。 :什么样的训练数据集才真正适合异相催化?换言之,如果当前工作流程的主要差异在于如何使用昂贵的第一性原理标签,那么应如何判断数据集质量,又有哪些数据最值得生成?
这一Perspective文章认为,关键问题不再只是如何生成更多数据,而是如何为MLP定义正确的数据,因为数据集设计的语言仍相对欠发达。针对异相催化中的数据集设计,可提出一个围绕三个维度组织的通用思考框架:范围、相关性和覆盖度。这些维度为处理异相催化数据生成中的竞争目标提供了实用方式。首先需要界定这些维度在MLP语境中的含义,随后通过这一视角重新审视当前数据构建策略,包括基于结构的工作流程、自适应扩展和主动学习,以及近期将支持范围扩展到狭窄预定义体系之外的努力。目标不是倡导单一通用方案,而是澄清当前实践背后的权衡,并说明未来进展可能来自互补数据生成理念的结合,从而同时实现任务特异性可靠性和更广泛的化学一般性。更广义地说,异相催化MLP的数据生成最佳实践仍有待形成。
2 “更智能的数据”的含义
对数据集设计的一种有用理解方式始于范围。在询问应当采样多广之前,首先必须明确模型需要回答什么科学问题。目标是描述催化剂重构、覆盖度效应、载体相互作用、长时间动力学,还是显式反应事件?不同问题意味着不同目标分布,而范围同时定义了MLP的用途和数据集构建的初始逻辑。
一旦范围确定,下一个问题就是相关性。问题并不只是添加多少数据,而是必须包含哪类数据,才能使模型在预期任务中保持可靠。这在异相催化中尤其重要,因为关键挑战通常在于识别当前问题中真正重要的内容。例如,如果目标是建模金属-载体相互作用,数据集就不应只包含负载金属构型,还应充分采样金属和载体子系统本身,使模型能够区分二者的内在结构响应与二者之间的相互作用。因此,相关性并不由所包含的slab、吸附物或反应路径的绝对数量决定,而是由数据集是否包含所提科学问题所需的正确构型类别决定。
第三个问题是覆盖度。即使数据集具备相关性,如果采样域过窄,模型仍可能失效。对于狭窄定义的问题,所需覆盖度可能仍然高度依赖特定体系。然而,对于更宽泛且更可迁移的模型,挑战会大得多:不仅必须覆盖目标体系本身,还必须覆盖足够多的邻近化学和构型变化,以避免脆弱泛化。相关性和覆盖度的核心思想是,表现最佳的模型并非来自最大的数据集,而是来自在相关域内既足够相关又足够宽的数据集。换言之,训练良好的模型不仅需要正确的数据,还需要足够多的正确数据。

图1|数据集设计中相关性与覆盖度作用的示意图 数据集设计中最有用的训练集并不只是规模最大的集合,而是在保持科学研究关注范围聚焦的同时,对相关领域进行足够广泛的采样,从而支持可靠预测的集合。绿色曲线、蓝色曲线与阴影区域分别表示目标、模型预测与不确定性。
所谓“更智能的数据”,指的是组成经过有意设计的数据集,其中范围定义问题,相关性定义重要内容,覆盖度定义该域中必须采样的程度。范围缺乏足够相关性会导致数据生成目标不清;相关性缺乏足够覆盖度会产生脆弱的任务特异性模型;覆盖度缺乏相关性则会产生宽泛但缺少焦点的数据集。采用这一视角后,当前数据生成策略不再只是彼此孤立的工作流程,而可以理解为应对同一核心挑战的不同方式:如何构建足够符合催化现实、足够适合实际操作,并且足够宽泛以支持下一代催化MLP的数据集。
这一框架旨在作为以采样为中心的数据集设计决策视角,而不是通用数值指标。它将开放式数据生成问题转化为受约束的采样问题:范围定义目标科学域,相关性识别必须表示的构型类别,覆盖度规定这些构型应被采样到多广。分布偏移、数据效率和不确定性也为以采样为中心的数据集设计提供重要统计诊断,但这一Perspective文章更侧重采样,而非统计评估。在异相催化中,实现这种平衡尤其困难。
3 异相催化中MLP数据生成的挑战
反应是异相催化的核心;然而,使MLP真正具备反应能力仍是该领域最困难的挑战之一。现代MLP建立在局域性假设之上:总能量被分解为原子贡献之和,每个贡献只依赖于原子周围有限半径内的局部环境。这种“局部原子环境”视角提供了一条可扩展的实用途径,即在短程截断下相对于体系尺寸呈线性扩展。然而,在异相催化中,这种基于局域性的表示方式会与大多数催化表面第一性原理描述所依赖的slab模型发生非平凡相互作用。典型的四层

图2|MLP如何从DFT参考数据中学习 a. 用于计算DFT基准真值作为输入的代表性原子结构。 b. 对于每个原子,其局域环境由截断半径 Rc 内的邻近原子定义。 c. 这些局域环境被编码为保持对称性的描述符,并输入神经网络。网络预测原子能量(其总和构成总势能),并通过最小化与DFT标签(力、能量和应力)之间的损失进行训练。
数据生成在异相催化中仍特别困难的第二个原因是,与许多其他AI赋能领域不同,尽管其重要性居于核心,该领域仍缺乏可广泛复用的数据集生态。材料科学已经发展出日益丰富的公共数据库。晶体材料可以利用Materials Project、OQMD和ICSD等资源,分子机器学习也受益于QM9和ANI等数据集而加速发展。相比之下,异相催化仍缺少同样成熟、可跨体系广泛复用的数据基础设施。这并不只是因为该领域投入较少;Open Catalyst Project等进展已经存在,而是因为底层组合负担本身更为严重。即使催化剂组成固定,相关化学空间也已经会在晶面、缺陷、吸附物、覆盖度、重构和环境条件之间扩展。此外,在真实运行条件下,催化剂并不是单一结构,而是不断演化的集合。因此,目标构型空间不仅庞大,而且本质上开放,这使异相催化中的数据集构建在性质上不同于分子或块体材料等更标准化的场景。
这两个困难共同解释了为什么催化MLP构建很少围绕广泛化学完备性组织,而仍主要由内部数据集构建主导。由于决定性的反应构型难以采样且依赖任务,而整体结构空间又过于开放,难以由可广泛复用的公共数据基础完全覆盖,因此数据集生成通常从预定义科学问题反向展开,而不是从通用覆盖度概念正向推进。这也是当前异相催化实践仍由基于结构、问题驱动的工作流程主导的原因:首先将范围缩小到特定催化体系或科学问题,然后才在相关域内扩展采样。
4 当前实践:基于结构的采样
一旦范围被限制到特定催化体系或科学问题,构建相关数据集就会变得更可处理。在实践中,通常先固定一种催化剂材料、一组有限的表面基元、一个运行区域或一个目标反应网络,然后为该预期部署域专门构建种子数据集。这类种子集通常由两个互补来源组成:公开可用数据或预训练先验,它们提供有用的结构和化学起点;以及内部模型构建,其中具有物理动机的slab、缺陷、界面、吸附物和反应基元会针对感兴趣的催化体系显式构建。从这个意义上说,相关性很少直接继承自公共数据集本身;相反,相关性通过选择、适配和扩充可用数据来建立,使训练集能够反映模型需要描述的特定化学。同时,相关的种子数据集本身很少已经足够。即便初始结构选择合理,模型仍可能无法充分覆盖热畸变环境、亚稳极小值、重构路径、稀有吸附物排列,或刚好位于人工选择起始库之外的反应构型。异相催化中的常见实践并非只是汇集相关结构,而是从相关性优先的种子集出发,再以受控且问题感知的方式扩展其覆盖度。
定向扩展方法最好不是按算法细节分类,而是按它们意在修复的覆盖缺口类型分类。当种子数据集已经包含正确结构基元,但对附近热涨落、替代局部极小值或势能面(PES)高能区域采样不足时,基于扰动的方法最有用。相比之下,当初始库本身过窄,需要提出定性上新的候选结构时,生成式方法更有用,例如新的缺陷排列、表面重构或竞争相。因此,方法的实际选择与其说是算法偏好,不如说取决于需要在感兴趣催化域内恢复哪类缺失覆盖度。
在基于扰动的方法中,分子动力学(MD)最适合丰富已知结构附近热可达局部环境、有限温无序以及早期键涨落的覆盖度。MD常与增强采样方法配合使用,例如元动力学和伞形采样,以增加PES高能区域的覆盖度。当需要超越MD采样到的局部谐性盆,并更高效地编目邻近亚稳极小值时,盆地跳跃很有用。随机表面行走(SSW)尤其适合探索重构路径、过渡态候选以及PES中其他方向性可达区域。在生成式方法中,当需要对通过局部扰动难以到达的定性不同结构、组成、缺陷模式或竞争相进行更广覆盖时,遗传算法(GA)尤其有价值。在所有这些方法中,底层原则相同:它们的目的不是简单扩大数据集,而是在保持锚定原始催化问题的同时,补齐特定覆盖缺口。

图3|增加数据多样性的方法示意图 a. MD在特定温度与压力条件下模拟原子运动。 b. Basin Hopping通过能量扰动“打开”结构,并随后通过淬火到达最近的能量极小值。 c. SSW方法。每一步均使用攀爬模块进行上坡搜索,并使用弛豫模块定位局部最小值。绿色、橙色与黄色曲线分别表示真实一维势能面、Gaussian函数与搜索轨迹。 d. 遗传算法中的交叉与变异示例。父结构A用于交叉与变异,父结构B用于交叉。
在实践中,这些生成器与主动学习结合时通常最有效。主动学习并不是独立探索方法,而是在MD、SSW、盆地跳跃、GA及相关工作流程之上的自适应选择和标注层,只将不确定、新颖或表示不足的构型推进到昂贵的第一性原理标注阶段。主动学习通过引导探索指向相关域中采样不足的区域来增强覆盖度,同时通过使工作流程保持与感兴趣的催化剂、吸附物和运行区域绑定来保留相关性。DPGEN等代表性并行学习框架通过训练、探索、选择和标注的迭代循环明确体现了这一逻辑,而GDPy等相关平台则将类似自动化扩展到面向异相催化的体系,包括表面、金属氧化物、负载团簇和固-液界面。更广泛地说,这些工作流程的共同经验是,主动学习并不只是增加数据集规模;它帮助判断哪些新生成结构真正值得支付标注成本。常见选择信号包括独立训练势函数之间的委员会分歧、力或能量偏差阈值、描述符空间新颖性以及外推指示器。在异相催化中,停止标准必然依赖任务:只有当模型不确定性在预期MD、结构搜索或反应搜索轨迹中保持较低、新选中构型变得稀少,并且稳定性趋势、重构路径或反应能垒等下游量对进一步标注不再敏感时,主动学习循环才可视为充分收敛。这些标准在催化中比在更简单领域中更难定义,因为被探索构型可能跨越结构、覆盖度、界面和反应区域。
这些工作流程定义了当前催化MLP构建实践:从种子结构数据集出发,用问题感知探索扩展覆盖度,并使用主动学习使标注集中于信息量最高的构型。该策略仍非常有效,因为它使数据生成直接对齐感兴趣的科学问题,从而能够为定义明确的催化体系和反应环境构建准确模型。
5 案例研究
针对反应型异相催化构建定制训练数据集并不存在通用配方。相反,近期工作已经通过不同采样策略形成了一系列成功的定制数据集工作流程。通过当前范围-相关性-覆盖度框架来看,这些工作尤其具有启发性,因为它们明确展示了数据生成选择如何受底层科学问题塑造。代表性案例体现了这种问题驱动理念。
Lian等人的工作在相演化问题中体现了这一逻辑。其范围是量化在

图4|用于构建Cu/Cu₂O训练数据集的主动学习流程 初始种子结构(体相、表面、界面)启动迭代循环,包括第一性原理标注、模型训练与机器学习驱动的结构探索。不确定性/外推性测试(如集成模型分歧或力/能量阈值)仅筛选最具信息量的构型进行重新标注。
Xu等人则将范围定义为

图5|基于遗传算法与AIMD的主动学习流程用于构建数据集 利用遗传算法与AIMD的主动学习流程用于构建数据集,涵盖纳米颗粒、体相、表面以及负载型纳米颗粒,重点关注金属−载体相互作用。
Zhou等人考察了更宽泛的原位工况范围:

图6|Au/CeO₂催化剂上CO氧化训练集结构指纹的PCA嵌入 训练数据集覆盖多种Au晶面与Au-CeO₂界面,并包含不同CO覆盖度,以捕捉分子-表面相互作用。数据集通过PCA嵌入展示其结构分布。
Shi等人的工作提供了一个尤其有启发性的反应网络导向数据集设计案例。其范围是在Cu-Zn催化剂上由
这些工作共同说明了一个经验:当前催化MLP的成功来自明确范围、将相关性直接编码进种子数据集,然后只在目标科学问题需要的地方扩展覆盖度。同时,它们也揭示了当前范式的核心局限:其有效性恰恰来自体系特异性和基于结构的设计,但这种效率并不容易扩展。
6 迈向更宽范围:基于相互作用的采样
一旦预期范围扩展,同时维持相关性和覆盖度就会迅速推高采样成本。即便在前述相对狭窄的案例中,最终数据集也已经从数万个到超过十万个标注结构不等。当科学问题被严格限定时,这一成本尚可管理;但如果寻求更广泛的一般性,就会越来越难以承受。例如,可能需要一个模型和数据集来跨晶面和缺陷探索表面重构与形貌,又需要一个单独且高度体系特异性的采样策略来解析反应条件下的反应路径。试图将所有这些复杂性,包括表面相空间、共吸附物相互作用以及变化的溶剂/电解质环境,都纳入单一统一MLP仍非常困难。这一压力促使人们关注比纯粹逐体系、逐结构构建更高效地拓宽支持范围的数据生成策略。
近期工作强调了新兴的基于相互作用的采样策略,其目标不是枚举所有相关全局结构,而是更直接地在原子相互作用空间中扩大支持范围。基本思想与现代MLP的学习方式高度一致。由于这些模型在有限截断的局部环境上运行,更广泛的可迁移性不仅取决于见过更多结构构型,也取决于见过范围更宽且更具代表性的化学有意义局部相互作用。在分子领域,ANI-1xnr纳米反应器工作流程将随机高温MD与主动学习结合,用于在随机C/H/N/O混合物中激发成键和断键,从而在不依赖人工整理机理的情况下填充反应型局部环境。在晶体材料中,Liu团队改造了基于AIRSS的随机结构搜索工作流程,在轻度物理约束下生成广泛结构多样性,使模型学习从元素Si到TiO化合物等体系中的低能和不利局部配位。尽管这些方法在实现上不同,但它们共享同一原则:引入随机性不是为了穷尽采样一个预定义催化体系,而是为了扩大底层相互作用空间中的支持范围。
REICO-EMLP框架是近期一个面向催化的、更宽泛基于相互作用采样理念的例子。REICO不是从固定的slab、吸附物、中间体或反应路径库出发,而是旨在更直接地在元素空间中生成训练数据。小晶胞以随机组成和原子排列初始化,只受到原子间距离等最低限度物理约束,使所得数据集能够让模型接触广泛的元素间相互作用。这一动机尤其有力,因为控制化学过程的构型、断键和成键事件、类过渡态环境以及其他高能非平衡数据都很难采样。然而,正是这些构型不成比例地决定了催化中最重要的量,包括能垒、选择性和机理认识。REICO在这一语境中具有相关性,因为它针对的是纯体系特异性工作流程难以处理的采样瓶颈:更宽化学范围下稀疏但在化学上起决定作用的反应型局部环境。还值得注意的是,目前基于相互作用的采样与其说是基于结构工作流程的成熟替代方案,不如说是一个新兴方向,其在异相催化中的最终效用仍需更广泛检验。

图7|基于REICO采样方法的元素基MLP(EMLP)训练流程 a. 基于REICO采样方法、聚焦原子相互作用的EMLP训练流程。 b. REICO方法生成的结构示例。 c. 所得EMLP可用于对训练过程中未直接覆盖结构进行实时计算,并在多个与异相催化相关的基准任务中进行评估。
在概念层面,基于结构和基于相互作用的采样不应被视为可以直接排序优劣的替代方案,因为二者采样的对象不同。基于结构的采样通常更具方向性并锚定体系:它遵循预定义催化问题,并通过采样催化剂特异性构型将相关性直接构建进数据集。相比之下,基于相互作用的采样更分布式且更强调空间覆盖:它在更宽化学域内采样局部反应或元素环境,而不是沿单一体系特异性轨迹采样。因此,两者之间并不存在定义明确的一一对应比较。更宽的局部环境覆盖度并不会自动保证体系层面的相关性:催化行为仍可能取决于表面身份、相关覆盖模式、集体重构、载体相互作用和环境背景,而这些因素并不能完全由局部环境本身指定。一个实用的混合工作流程可以使用基于相互作用的采样作为广泛局部相互作用覆盖度的来源之一,同时保留体系相关结构作为催化剂特异性相关性的锚点。类似的谨慎态度也适用于涉及长程静电、带电界面或其他不容易简化为短程平铺效应的体系。因此,基于相互作用的采样最现实的作用很可能是在混合工作流程中发挥作用。当科学问题被清晰定义时,基于结构的采样仍最具优势,因为它将相关性直接编码进数据集。当需要更宽范围和可迁移性时,基于相互作用的采样则变得有吸引力,因为它能够改善反应型局部环境空间中的覆盖度和平衡性,同时降低为每个邻近体系完全定制数据集的依赖。

图8|基于结构与基于相互作用的采样方法示意图 不同颜色曲线表示不同体系在化学空间中的投影轨迹。基于结构的采样沿预定义的、系统特定的路径进行,因此可将系统层面的相关性直接构建进数据集,但需要针对每个体系分别进行采样。基于相互作用的采样则通过共享的底层物理相互作用,在不同体系间寻求更广泛的可迁移覆盖,而非依赖单一轨迹,但无法天然保证同等程度的系统特异性相关性。
7 结论与展望
异相催化内在耦合多层复杂性,包括结构重构和表面覆盖效应。这造成了问题复杂性与传统理论工具局限之间的内在不匹配:DFT成本高昂,而简化模型往往无法捕捉完整复杂性。因此,异相催化仍是MLP最具挑战性的应用领域之一。然而,MLP的可靠性并不只是取决于模型架构,还取决于训练数据分布是否与科学问题相关、是否足够宽以覆盖预期化学空间,以及是否足够丰富以表示那些控制催化行为的稀有但决定性环境。从这一视角看,异相催化MLP的发展可以理解为数据生成方式的演进:从借用公共数据库,到扩展结构库,再到构建高度定向的体系特异性数据集,近期又发展到探索更宽泛的相互作用中心策略。共同经验是,进展不会仅来自越来越大的数据集,而会来自更智能的数据。
与此同时,没有任何单一数据生成理念可能独立解决这一问题。基于结构的工作流程仍不可或缺,因为它们将相关性直接编码进数据集,并且仍是实现体系特异性准确性的最可靠路径。当预期范围扩展且纯体系化工作流程开始承压时,基于相互作用的采样会变得有吸引力,尤其是在需要广泛反应型局部环境覆盖度和跨相关构型迁移能力时。因此,最现实的前进路径很可能是混合式的:将更广泛的反应支持与催化剂特异性锚定结合起来,而不是用一种方法简单替代另一种方法。
由于这一Perspective文章主要聚焦催化数据集的采样范围,当前范围之外仍存在若干额外挑战。一个挑战是数据标注,它最终决定训练后MLP的保真度。尤其重要的是,需要理解电子结构标注的选择和一致性如何影响MLP可靠性。多保真工作流程尤其值得关注,因为它们将广泛的低成本探索与对化学后果最重要构型的选择性高保真重新标注结合起来。这种策略提供了一条实用途径,可以在保持覆盖度的同时,将最高标注精度集中于最重要的区域。基于扩散的方法已经开始出现在与数据集设计相关的相邻领域,尤其是过渡态生成/搜索、扩散启发MD,以及生成按目标标准优化的新候选结构,尽管其在催化数据集生成中的直接应用仍有限。另一个重要方向是如何避免每个催化MLP都完全从头构建。预训练模型和基础模型提供了有吸引力的起点,而用有限新数据进行微调可能提供一条高效路径,实现面向特定领域的改进。然而,关于任务特异性适配仍有重要问题未解决,包括偏差迁移、数据混合效应以及精修过程中的灾难性遗忘。
更广义地说,新的数据范式也对训练规范和评估提出了新要求。近期数据集越来越多地瞄准偏离平衡的构型,以改善模型对受应变、含缺陷和热畸变环境的泛化能力。然而,这种有意设置的分布偏移也挑战了关于训练稳定性、模型鲁棒性和性能评估的现有假设。因此,该领域需要更好的评估标准,以及面向这些日益多样化训练分布的、更具操作性的数据集质量指标。
核心信息是,原子尺度机器学习正在进入一个数据集设计不能再保持隐含状态的阶段。异相催化使这一点尤为清楚,因为它以异常鲜明的形式暴露出可复用数据有限、稀疏但在化学上起决定作用的反应结构、狭窄训练域以及开放式构型空间等问题。这些特征共同使相关性和充足覆盖度难以同时维持,尤其是在范围扩大时。因此,异相催化MLP的未来可能不仅来自构建更强大的模型,也取决于能否准确判断哪些数据真正值得生成。