Adv. Mater. 2026 | 材料信息学:AI 时代从萌芽到自主发现

今天介绍的是发表在 Advanced Materials 上的一项综述论文,由西安交通大学Turab Lookman、刘宇杰、高志斌团队完成,是材料信息学领域的权威综述。它系统梳理了材料信息学从理论萌芽→数据驱动→深度学习赋能→AI 自主发现的完整演进脉络,明确了主动学习、贝叶斯优化、强化学习、大语言模型(LLM)、自动驾驶实验室等核心技术的定位与优劣,对比了专用大模型与通用大模型在材料研发中的性能,指出了 LLM 幻觉、高维空间探索、数据稀缺等关键痛点,并提出未来将走向 “虚拟材料科学家”的全自主研发范式。该研究不仅是对领域发展的总结,更指明了 AI 彻底重塑材料研发流程、将传统 10到30 年研发周期压缩至数月的技术路径,是材料科学与人工智能交叉领域的必读文献。

获取详情及资源:

0 摘要

该综述全面呈现材料信息学的演进历程,将其概念根源追溯至物理学与信息论的基础思想,并展现其在机器学习与人工智能融合过程中逐步成熟的发展路径。Chelikowsky、Phillips 与 Bhadeshia 的早期成果为这一革命性材料发现方法奠定了基础,美国材料基因组计划则推动领域进入爆发期,2014 至 2016 年成为机器学习在材料问题中实现首次突破性应用的关键阶段。此后,深度学习与基于 Transformer 架构的大语言模型快速发展,支撑起材料性能预测、合成方案规划与逆向设计等核心工具。材料信息学并非简单的工具组合,而是一套持续演化的科研生态,该综述完整梳理了这一领域的历史背景、发展现状与未来方向。综述重点评述了序贯设计的核心方法,包括贝叶斯优化、强化学习以及 Transformer 模型,阐明这些技术在加速材料发现、实现实验自动化中的作用,以及自主驾驶实验室快速建设的发展趋势。同时综述也分析了大语言模型与贝叶斯优化在特定材料体系应用中常见的问题、缺陷与解决方案。针对专用材料预训练模型的高昂成本,研究对比了专用大语言模型与当前顶尖通用大语言模型的实际性能。最后,综述评估了领域面临的新兴挑战,以及人工智能从预测工具进化为科研协作伙伴的发展潜力。随着主动学习、不确定性量化与检索增强生成技术的不断进步,自主材料科学的全新时代即将到来,人类研究者将逐步退出研发闭环。

1 引言

材料信息学是融合计算机科学、机器学习、统计推断与材料科学的新兴交叉领域。近年来,机器学习与人工智能工具在材料科学中的应用取得大量进展,严格意义上的人工智能是可在无人工干预下完成任务的系统,机器学习是人工智能的核心分支,深度学习则以神经网络架构驱动当前人工智能革命,其中 Transformer 模型对日常生活与科研领域均产生深远影响。

这一技术浪潮给材料科学带来范式转移,基于 Transformer 的大语言模型已广泛应用于材料科学各子领域,尤其用于材料性能预测。与此同时,自主驾驶实验室在全球范围内快速普及,由主动学习算法控制并实时指导实验发现。这一快速发展的交叉领域将计算机科学、机器学习与统计推断的原理融入材料科学核心,深度学习带来的变革尤为深刻。

综述追溯了材料信息学从薛定谔与香农的基础概念,到 1976 年 Chelikowsky 与 Phillips 的开创性工作,再到 1990 年代 Bhadeshia 相关研究的历史起源。2011 年启动的美国材料基因组计划极大推动了领域发展,2014 至 2016 年机器学习在材料发现中实现首批重要应用。此后,在深度学习的驱动下,该领域实现变革性增长。

综述梳理了材料基因组计划中的核心数据驱动工具,包括神经网络、贝叶斯优化、强化学习、Transformer 与大语言模型,分析其在传统合成与日益普及的自主研发路径中对材料发现的影响。与多数聚焦技术单点的综述不同,该工作将材料信息学视为不断演化的科研生态系统,系统梳理历史背景、发展现状与未来方向,并讨论大语言模型、贝叶斯优化等工具在特定材料体系应用中的常见问题,重点关注准确性与可重复性。针对专用材料预训练模型成本过高的问题,研究以合金预测为例,对比了专用大语言模型与 DeepSeek、Gemini 等顶尖通用大语言模型的性能差异,最终指出实现完全无人工干预的材料发现仍面临诸多挑战。

图1|材料信息学的发展路线 图片完整梳理了材料信息学这一交叉学科从理论奠基到未来 “虚拟科学家” 的演进脉络。

1.1 信息、非周期性晶体与材料信息学的诞生

1944 年,薛定谔在《生命是什么?》中提出非周期性晶体概念,认为这类结构可承载遗传信息,其核心思想是,遗传过程需要不具备周期性的结构载体,以避免信息匮乏。香农的通信理论提出后,学界进一步认识到,信息的本质是意外性或不可预测性,某一信息出现概率越低,其所携带的信息量越大。

晶体学家 MacKay 将这一思想纳入晶体学研究,认为晶体学的适用范围远不止周期性结构,而是覆盖所有具备有序特征的结构。他提出,晶体是描述体量远小于自身结构的体系,可作为信息载体,进而延伸至生长、形态发生与生命现象等更广泛的研究主题,由此提出无机基因的概念,对应材料基因组中的描述符。

如今被归为材料信息学的早期研究,可追溯至近六十年前,核心问题是将二元固体划分为岩盐、闪锌矿、纤锌矿、氯化铯与金刚石等晶体结构。多位研究者意识到材料特征对二元八面体固体分类的重要性,St. John 与 Bloch 基于早期第一性原理赝势计算,提出由原子 s 轨道与 p 轨道半径组合形成的特征参数,并应用于 63 种二元化合物的分类。Chelikowsky 与 Phillips 进一步拓展这一方案,加入铜、银、金等贵金属元素,完成 79 种二元八面体化合物的分类,后续又将其推广至全部二元化合物,将已知的 574 种二元材料划分为 34 种晶体结构。

以现代视角来看,这一过程属于典型的分类任务,而在当时,研究者仅凭物理洞见选取电负性标度、平均主量子数、元素轨道半径作为描述符,就在二维结构图谱中实现了八类二元固体结构的精准区分,手动分类精度超过 85%。如今机器学习方法可使用更精细的特征,但早期研究能达到如此精度仍极具开创性。早在 1970 年代,Chelikowsky 与 Phillips 就基于早期第一性原理计算数据寻找半导体材料,他们意识到固体间的结构能量差过小,难以通过当时的计算方法与设备准确求解,必须借助信息论思想从结构数据中提取化学键合规律。

图2|基于原子参数的二元晶体结构判据图 这张图是St. John-Bloch 图,是材料科学领域早期利用原子参数预测二元晶体结构的经典里程碑工作,出自 Chelikowsky 和 Philips 1978 年的研究。

1.2 材料研究中的早期神经网络

神经网络方法用于材料力学行为研究已有三十年历史。1991 年,Ghaboussi 等人提出,神经网络为材料物理模型构建提供了全新范式,可直接利用实验数据,适用于复合材料等缺乏成熟物理原理与模型的复杂体系。其开创性工作采用反向传播神经网络,设置六个输入节点、两个输出节点与两层各四十个节点的隐藏层,研究普通混凝土在双轴受力下的行为。模型以应力、应变与应力增量为输入,以应变增量为输出,基于应力控制试验数据训练,在前四个循环完成训练并在第五个循环进行测试,结果显示模型可准确捕捉实验趋势。三十年前的这项研究,已经触及如今神经网络在材料领域的核心应用场景。

材料科学中神经网络的发展,与 Bhadeshia 教授的工作密切相关,其研究覆盖相变、多组元合金与钢材等方向。他将非线性网络视为包含成分等变量与未知参数的线性模型的自然拓展。1992 年,他与剑桥大学的 MacKay 展开合作,将神经网络应用于碳锰钢电弧焊缝冲击韧性预测,设置十四个输入节点与一个输出节点,研究合金成分、微观组织占比、温度、屈服强度等参数对韧性的影响。研究通过调整隐藏层节点数量,结合贝叶斯分析确定最优网络结构,模型不仅取得可靠预测结果,还可用于实验难以开展的机理分析,例如针状铁素体与魏氏组织铁素体的组织优劣对比。这项工作的成功,开启了双方长达二十四年的多项合作研究。

图3|材料科学领域早期神经网络模型示例 这张图展示了1990 年代材料科学领域的两类早期神经网络应用,也是 “AI Fundamentals” 阶段 “Early NN application in materials” 的典型代表。

1.3 从试错法到早期材料发现

2011 年材料基因组计划启动前,材料发现与设计高度依赖经验方法,计算能力受限严重。这一计划通过整合高通量计算、数据驱动方法与协同数据库加速材料发现,目标是将材料市场化周期缩短一半,覆盖从材料发现、性能优化到工程应用的全流程,由不同机构负责具体实施。在计划推动下,材料发现周期从二十年以上缩短至十年以内。

传统材料发现常被称为爱迪生式研发,高度依赖试错实验,航空航天合金、半导体等领域约 90% 的工业研发依靠物理实验与专家直觉。这类方法依靠启发式规则,通过炉体熔炼、溅射等方式合成合金、陶瓷与聚合物,借助 X 射线衍射、电子显微镜、力学测试等核心设备开展表征。尽管这类方法催生了基于经验相图的钢材、通过热处理优化的高温合金等重要成果,但研发周期长达 10 至 30 年,且受计算能力限制难以大规模拓展。

1990 年代末至 2000 年代初,组合材料学兴起,自动化系统可制备梯度成分薄膜库,开展光学与力学筛选,在催化领域取得突破,但仅适用于薄膜体系。高通量方法虽具备开创性,但单种新合金研发成本超过一百万美元,耗时数年,高熵合金等重大发现多具有偶然性。

计算层面,早期的 CALPHAD 方法基于热力学数据预测材料行为,1990 年代密度泛函理论可实现带隙、声子等性能的预测,但计算成本极高,超算上单个结构计算需耗时数小时,限制了发现规模。无机晶体结构数据库、美国国家标准与技术研究院合金数据库等陆续建立,但数据碎片化、缺乏整合,难以支撑大规模材料发现。

1.4 材料信息学的兴起

材料信息学的概念在 20 世纪末逐步成型,标志着传统试错法向数据驱动方法的转变。1999 年,Rodgers 在材料研究学会秋季会议上提出材料信息学这一术语,旨在将信息科学、数据处理与系统工程融入材料研究,聚焦数据生成、管理与知识挖掘。

随着计算能力提升与高通量实验技术的出现,尤其是组合材料学的发展,该领域从基础数据收集转向利用统计学习与数据挖掘提取加工 - 组织 - 性能关联规律,这一转变为集成计算材料工程奠定基础,推动计算与实验方法的协同发展。

21 世纪初,软计算与统计学习方法开始解决材料科学中的非线性问题,研究者相继开发出人工神经网络模型,用于纱线性能、织物参数与剪切刚度关联预测,采用 X 均值聚类与降维技术优化特定材料的微观组织设计,利用数据挖掘基于电子结构数据开展晶体结构分类,提出与传统方法截然不同的新思路。

到 2011 年,传统经验方法已难以满足航空航天、能源、电子等工业领域的快速发展需求,旧有方法的局限、高昂的实验成本与缓慢的计算模拟速度,都呼唤更系统的数据驱动方案。材料基因组计划整合高通量计算技术与机器学习,彻底改变这一局面,实现材料发现的加速与性能的实时预测建模。该计划资助了 Materials Project 等大规模数据库,推动机器学习模型实现秒级材料性能预测,大幅降低材料发现的成本与时间。

2 面向靶向材料探索的主动学习

材料研发的核心挑战来自极高维度的探索空间,潜在化合物数量可达数百万量级,仅有极少部分被实验探究。这一庞大空间覆盖化学成分、晶体结构、制备条件与微观组织的复杂关联,多组元材料的性能还依赖多尺度的材料描述符,数据稀缺且测量存在固有不确定性,实验观测耗时费力,因此需要最大化单次实验的价值。

2012 年前后,理性设计的主流方案是先收集与问题相关的全部化学与结构信息,再定义由键长、键角、第一性原理能量、热力学参数等组成的描述符空间,利用机器学习工具构建目标性能的代理模型,通过监督学习完成分类与回归任务,再将模型应用于大规模潜在候选空间,并尽可能通过第一性原理计算验证预测结果,实验验证新材料的案例较为少见。与此同时,无监督学习用于挖掘数据中的模式与聚类规律,基于电子结构计算的 Materials Project、OQMD、AFLOW 等数据库逐步建立,高通量组合实验则不断缩小庞大的候选搜索空间。

图4|材料信息学中基于机器学习的晶体数据挖掘与预测流程示意图 这张图展示了2012-2018 年间材料信息学领域,基于传统机器学习的晶体材料数据挖掘与设计流程,也是材料基因组计划推动下的典型研究范式。

部分研究者意识到,材料研发的核心目标是加速成分、工艺与微观组织的精准筛选,以获得目标性能,这是一个复杂的优化、控制与学习问题,需要在高维特征空间中搜索。实验室中的材料发现数据量小、测量不确定性高,材料体系可能包含多组元与缺陷,特征空间规模极大,因此需要定义实验效用函数,并通过最大化效用选择下一组实验,以决策理论方法自适应推荐实验候选。

这一自适应框架是主动学习的基础,主动学习在计算机科学与材料科学中的发展目标存在差异。计算机科学领域的主动学习诞生于 1980 年代后期,用于解决数据标注瓶颈,通过查询学习让模型自主生成有效样本,显著加快目标概念学习速度,后续发展为基于池的学习范式,在海量无标注数据中智能选择最具信息增益的样本进行标注,核心目标是以最小标注成本构建高精度全局预测模型。

而材料与化学信息学中的主动学习保留算法框架,但转向以空间探索为核心,目标不再是构建全局精准模型,而是在庞大的化学空间中开展异常值搜寻,定向发现最优性能区域。采集函数从纯不确定性导向转向期望提升、知识梯度等策略,迭代引导高成本实验与模拟,寻找具备极端目标性能的材料。

这一趋势与自主实验的兴起高度契合,在自主驾驶实验室中,主动学习智能体充当闭环决策单元,提出下一组合成条件或成分,由自动化系统执行实验,实验结果更新模型,形成物理发现的假设生成引擎。这一转变带来核心区别,传统机器学习以模型为最终成果,数据选择是低成本训练的手段;而材料信息学以物理材料为最终成果,模型只是探索搜索空间的临时迭代向导。主动学习由此从数据效率工具转变为科学发现的核心驱动力。

图5|材料科学中的自适应闭环设计与主动学习流程图 这张图展示了材料科学领域基于主动学习的自适应闭环设计流程,是 “自动驾驶实验室(Self-Driving Labs)” 和 “主动学习(Active Learning)” 的核心工作范式,也是实现 “自主材料发现” 的关键模型。

2.1 贝叶斯优化:效用驱动的实验设计

自适应设计策略于 2014 年被提出,2016 年首次通过实验验证,在约 80 万种成分空间中成功找到具备超低热滞后的镍钛基形状记忆合金。主动学习闭环的核心思想是利用实验与计算获得的新数据完成迭代反馈,基于不确定性的最优实验设计是平衡代理模型利用与未知空间探索的关键。

研究可基于代理模型预测的均值与标准差定义多种效用函数或采集函数,对候选样本排序,选择能最大化函数值的样本开展下一组实验,实验结果补充数据集并提升下一轮迭代的模型性能。这一理念被广泛应用,但也存在一系列问题。

自适应设计的核心是序贯决策问题,广泛存在于科学与工程各领域,核心是寻找最优决策序列。计算机科学领域关注序贯学习与强化学习,工程领域对应最优控制,神经科学聚焦人类决策机制,心理学关注动物决策与奖励系统,数学对应最优控制与运筹学,经济学则涉及博弈论与效用理论。序贯学习在数据有限、计算与实验成本高昂的工业场景中尤为重要,概率提升、期望提升等基于不确定性的效用函数,被用于迭代贝叶斯全局优化循环,指导下一组实验结果的预测。

贝叶斯优化已广泛应用于实验室手动合成与表征的材料设计问题,也被用于自主驾驶实验室,通过调控薄膜成分与工艺条件优化目标响应,早期应用覆盖传输材料的光电性能、燃烧合成金属薄膜等方向。此后,自主驾驶实验室逐步拓展至铁电陶瓷研究、激光打印合金合成、金属粉末混合等场景,近期还实现了基于第一性原理计算驱动实验方案的无机粉末自主合成。某套系统在 17 天运行中,从 58 种目标候选物中成功合成 41 种化合物,合成条件来自基于文献文本挖掘训练的模型,条件修正则结合热力学信息引入主动学习闭环。

尽管贝叶斯优化在材料科学复杂设计空间中得到广泛应用,但仍存在明显局限。常规方法采用单步前瞻优化,平衡探索与利用,两步与多步方案虽被提出,但难以实际应用,无法捕捉连续设计决策的相互依赖关系。这类方法在小搜索空间中表现可靠,但随着空间维度升高,性能会显著下降,可能错过高潜力区域。更关键的问题是,该方法缺乏明确的停止准则,难以判断优化何时可以终止。文献中大量案例显示,期望提升等采集函数会在迭代中持续波动,即便数值降至极低水平仍可能反弹并带来理想结果,多数研究仅在研究者满意结果或耗尽预算时停止迭代。

针对期望提升在迭代后期趋近于零引发的数值不稳定问题,可采用对数期望提升替代,确保数值计算稳定,在高维测试函数上表现出更优的收敛性能。

2.2 面向高维材料设计的强化学习

随着材料特征空间扩大,添加更多元素与组分拓展材料体系时,即便采用连续梯度优化替代离散空间搜索,贝叶斯全局优化也难以逼近目标解。为突破贝叶斯优化在高维空间的局限,研究者开始将强化学习应用于材料设计,这一高维组合爆炸难题正是深度神经网络智能体在 2015 年解决电子游戏控制任务时的核心突破点。

深度 Q 网络基于马尔可夫决策过程,让智能体与环境交互,接收像素与奖励信号,无需修改算法即可完成多款游戏的控制任务,后续 AlphaGo 系列模型进一步实现围棋领域的突破,从利用人类专家棋谱监督学习进化为完全无需人类知识的纯强化学习方案。强化学习的核心思想是最大化马尔可夫过程中的累积奖励,即即时奖励与未来折扣奖励之和,此后在对抗游戏、实时机器人控制等领域得到广泛应用,成为模拟人类感知与决策能力的核心技术。近期,强化学习与大语言模型结合,显著提升模型解决复杂问题的推理能力。

强化学习在大空间中高效导航并结合未来收益做出合理决策的能力,使其在序贯材料优化与发现中具备独特优势。随着大量材料设计自主驾驶实验室的建设,有必要对比不同序贯设计策略的优劣,评估其在特征空间中高价值区域的采样能力。

研究证实,强化学习可高效设计镍钛基合金成分,获得具备高相变焓的材料。游戏智能体决策新组分的添加比例,与迭代更新的奖励代理模型交互,优化组分比例,目标是最大化累积奖励。镍钛基形状记忆合金具备可逆固 - 固相变特性,研究目标是找到铜、铪、锆等掺杂元素的最优配比,最大化相变焓。设计过程从单一组分开始,逐步替换为其他组分,直至全部可用组分完成遍历,基于组分调整前后的目标性能差值设定奖励。强化学习智能体通过神经网络估计每种组分分配动作的奖励价值,奖励来自基于训练数据构建的代理模型,内部强化学习循环收敛后提出实验建议,迭代更新代理模型。基于强化学习的策略最终得到多组元相变合金,具备该体系中最高的相变焓值之一。

图6|AI 迭代设计高熵合金的性能提升与预期改进变化 图片用高熵合金(HEA作为案例,展示了主动学习驱动的材料自适应迭代设计流程中, 预期改进(Expected Improvement, EI) 指标的变化与材料性能的演化规律,也是 “自适应闭环设计” 的具体实验验证。

合金数据量有限,充分利用离线数据可加速学习进程,预训练能让智能体更频繁地访问特征空间中的高值区域。随着新实验的反馈,智能体逐步探索与初始数据集成分不同的高值新区域。

贝叶斯优化与强化学习在特征空间高值区域搜索的优劣可进行直接对比,在缺乏自主闭环实验条件时,采用可模拟实验系统复杂度的测试函数进行评估。基于 t-SNE 降维的高维函数搜索模式可视化结果显示,贝叶斯优化倾向于在中心区域集中采样,而基于模型的强化学习采样更分散,两种方法识别出不同的高值区域,强化学习在寻找近似最优解方面保持更优性能。

图7|AI 迭代优化中 “预期改进” 的下降趋势示意图 这张图以Rastrigin 函数(一个经典的多峰测试函数,常用来模拟材料性能这类复杂优化问题)为例,展示了主动学习优化过程中, 预期改进(Expected Improvement, EI)指标的变化规律,是理解自适应迭代设计收敛性的核心图示。

2.3 自主驾驶实验室的兴起

近年来,自主驾驶实验室,即人工智能自主实验室,成为加速材料发现的核心引擎,这一范式整合机器人、人工智能与高通量实验,在智能算法引导的闭环反馈系统中高效探索庞大的材料参数空间。早期开创性工作实现了薄膜材料的单目标优化,移动机器人化学家则验证了概念可行性与巨大潜力。随着技术成熟,研究重点从单一属性优化转向解决实际应用中更复杂的性能权衡问题,多目标优化算法可清晰绘制不同材料性能间的帕累托前沿,为定制化、多场景需求提供直观决策依据,并成功将实验室发现转化为可规模化的制备流程。

多款工具可从实验结果中学习、优化参数并指导后续试验,MatterGen 可根据目标性能提示设计并推荐材料,MatterSim 则过滤生成结果并预测稳定候选物。机械臂与自动化系统通常负责粉末称量、溶液混合、样品转移等操作,RoboChem 可完成多种反应并产生极少废弃物,机器人针管收集并混合微量试剂,试剂通过管道流入反应器,LED 光源触发光化学反应,产物经核磁共振表征后将结果反馈至控制器,指导下一步实验。其他平台包括阿贡国家实验室开发的聚合物合成平台、用于无机粉末合成与表征的 A-Lab 系统。

闭环范式通常从材料数据库、相关文献、过往成功与失败实验中提取信息,提出候选物,指导机械臂混合前驱体、在炉体中加热退火完成合成,通过 X 射线衍射检测杂相、电子显微镜评估材料质量,完成数据解析后调整参数,改变成分或合成方案,循环迭代优化最终结果。

这类系统已展现出优异性能,RoboChem 可在一周内优化 10 至 20 个分子的合成,对应学生数月的工作量。A-Lab 在 17 天内成功合成数十种无机化合物,成为整合第一性原理计算数据库与文献提取合成知识的典范。更具突破性的是,人工智能化学家系统实现火星原位制氧的终极挑战,紧密耦合第一性原理计算与机器人实验,自主筛选数百万种潜在配方,找到最优催化剂。

技术发展趋势是持续优化系统,获得高可重复性结果,降低人为误差与偏倚,应用于下一代电池、清洁能源催化剂、极端环境材料的设计。相关工具不仅推动合成优化,还深化热力学性质等基础材料科学认知。计算建模、物理实验、表征与信息学的多尺度整合,形成自主发现、数据融合与科学认知的强大反馈闭环,AMASE 平台可通过持续对比理论与实验数据,自主导航完成相图测绘。

图8|材料设计中贝叶斯全局优化(BGO)与强化学习(RL)融合的闭环流程示意图 这张图展示了材料设计领域中,强化学习(RL)与贝叶斯全局优化(BGO)结合的闭环设计框架,是自主材料发现范式中更高级的 AI 驱动方法,也是 “虚拟科学家” 愿景的重要技术支撑。

3 材料科学的人工智能基础

人工智能的范畴覆盖所有可在无人工干预下执行任务的系统,自动驾驶汽车、推荐系统均属于此类。机器学习是人工智能的核心分支,基于整合数据开展统计推断,实现预测、可视化、特征工程与分析。深度学习是机器学习的重要分支,通过多层互联节点构建的神经网络模拟人脑复杂结构,将输入转化为整体输出。

深度学习的发展与一系列架构与算法突破密不可分,1986 年提出的反向传播算法,基于梯度下降与链式法则实现多层网络权重高效调整。后续卷积神经网络用于图像处理,循环神经网络用于序列映射,长短期记忆网络解决长时序依赖问题,但深度网络训练长期受梯度不稳定限制。2011 年整流线性单元的广泛应用显著缓解梯度消失问题,2012 年 AlexNet 的成功验证了 GPU 加速与模型深度的重要性,全面开启深度学习新时代。近期自注意力机制的引入彻底革新自然语言处理领域。

图9|预训练对强化学习(RL)材料设计效果的影响对比 图片通过四组实验结果,对比了有无预训练(Pretrain)的强化学习智能体在材料成分设计任务中的表现差异,是强化学习材料设计框架的直接验证。

深度学习为材料科学特有的数据难题带来范式转移,核心初始挑战在于分子与晶体属于非欧几里得数据,不同于规则网格的图像数据,有效表征其微观几何与拓扑结构曾是核心难题。2015 年,神经图指纹的提出通过分子图上的可微分卷积操作替代传统固定指纹,实现分子特征端到端学习,显著提升溶解度等性能预测精度。2018 年,晶体图卷积神经网络框架构建晶体图编码原子信息与键合作用,突破任意体系尺寸的处理限制,在形成能、带隙等性能预测上达到接近密度泛函理论的精度。

除性能预测的正向问题外,深度学习推动材料逆向设计发展。针对分子,变分自编码器将离散分子表征映射为连续隐空间,支持基于梯度的优化搜索特定性能新分子。针对更具挑战的周期性材料生成,生成式人工智能超越传统进化算法,晶体生成与扩散模型快速发展,大幅推动晶体结构预测与微观组织设计,从卷积神经网络框架到先进扩散模型不断迭代。扩散模型与变分自编码器结合的模型,融入噪声条件分数网络与朗之万动力学,解决周期性边界条件与不变性难题,实现高真实度、多样化晶体结构生成,MatterGen 是当前顶尖的扩散驱动模型之一。

深度动力学是变革性应用方向,直接解决传统分子模拟精度与效率难以兼顾的长期困境。机器学习势函数通过深度学习框架,从高精度量子力学数据中学习多体势能面,弥补高成本从头算方法与低精度经验势场之间的差距,在接近从头算精度的同时,保持与经验势相当的计算效率。DeePMD-kit、GPUMD 等开源软件包,可高效开展以往难以实现的大规模原子模拟。

材料知识图谱的出现同样影响自主材料发现,利用机器学习与自然语言处理方法自动从学术文献中提取并构建结构化材料数据,多项研究证实了可行性,后续基于大语言模型的材料知识图谱系统整合多学科材料数据,建立材料与应用间的预测关联,近期更将这一范式拓展至骨架材料,通过大语言模型与图数据库耦合,实现精准信息检索与推理。这些研究标志着材料数据库从静态存储转向动态人工智能驱动知识系统,实现学习、推理与发现加速。

图10|材料成分空间探索过程的 t-SNE 可视化示意图 这张图片用t-SNE 降维可视化的方式,直观展示了强化学习驱动的材料成分设计过程中,智能体如何从初始训练数据出发,逐步探索到新的成分空间。

3.1 生成式与判别式人工智能模型

人工智能与机器学习领域存在生成式与判别式模型的基础区别。判别式模型聚焦学习不同类别数据的边界,估计条件概率分布,即给定输入对应的输出标签概率,常用于分类、回归与结构化预测,包括支持向量机、逻辑回归与大量基于标注数据训练的深度学习架构。

生成式模型则学习联合概率分布,不仅可完成数据分类,还能生成全新样本,通过建模数据生成规律,模拟与训练集相似的新样本,包括变分自编码器、生成对抗网络与 GPT 等自回归语言模型。以生成对抗网络为例,其包含生成器与判别器两部分,生成器创建新数据样本,判别器区分真实数据与生成数据,两者的对抗训练使生成样本越来越接近真实数据。

以 Transformer 为核心的大语言模型属于深度生成式模型,采用注意力机制训练,学习基于上下文预测下一个词元的概率分布,同时也可通过架构与训练目标微调,适配分类、回归等判别式任务。

简而言之,两类模型的核心区别在于,判别式模型根据输入预测标签,生成式模型建模数据本身的生成规律,这一区别对材料科学应用具有重要意义。判别式模型适用于性能预测、物相分类、缺陷检测;生成式模型支持逆向设计、文本到性能推理、全新候选材料生成,尤其在数据稀缺场景中优势明显。

图11|基于 t-SNE 可视化的强化学习(RL)与贝叶斯优化(BO)采样行为对比 这张图以 10 维 Rastrigin 函数(材料优化问题的经典模拟场景)为例,用 t-SNE 降维可视化对比了 强化学习(RL)与贝叶斯优化(BO/BGO-EI) 两种算法的采样与探索行为差异,直观展示了它们的优化策略特点。

3.2 自然语言处理与 Transformer:重塑材料科学

大语言模型是基于注意力机制、在海量数据上预训练的神经网络架构,自然语言处理在机器学习进步的推动下,深刻改变日常生活的诸多方面,从商业、社交媒体界面到语音识别、机器翻译均有应用。在这一广泛影响下,将这类强大的自然语言处理工具应用于化学、生物、无机与材料科学领域成为自然趋势。

早期这类工具已用于从文本数据构建大规模反应与生物通路数据库,材料科学拥有海量非结构化公开与未公开文本,记载材料、性能、合成与加工路线,研究目标首先是自动构建结构化数据库并从中提取知识,训练 Transformer 模型,以合成具备目标性能的新材料。

大语言模型与自然语言处理的突破性进展,来自词嵌入与自注意力机制等核心概念,这些技术可解析词汇的语言学含义与上下文语义关联。早期词嵌入提供静态表示,相近含义词汇拥有相近数值向量,但无法编码词汇在句子中的顺序与上下文细微差别。

自注意力机制的引入带来革命性突破,创建动态表示,允许模型在处理特定词汇时,权衡输入序列中不同词汇的重要性,聚焦句子中最相关的部分,有效编码上下文信息,让模型基于复杂的周围词汇语境预测目标词汇,对理解材料科学文献中的复杂关联至关重要。早期材料大语言模型多基于预训练模型,以文本输入编码成分、工艺等材料特征。

3.3 文献挖掘:从文本到数据

针对无机体系的首批文本挖掘应用,从数十万篇期刊论文中识别并提取金属氧化物的合成参数,识别烧结、溶解、球磨等合成动词,通过依存树提取烧结温度、搅拌速度等数值参数,分析参数分布规律,再利用机器学习预测二氧化钛纳米管等相关体系的合成参数。

聚焦材料性能的研究从数万篇期刊论文中构建数据库,专门提取居里温度与奈尔温度数据。近期面向材料发现的文本挖掘研究,从一万余篇期刊论文中提取高温合金的化学成分与性能数据。考虑到监督式深度学习的命名实体识别与关系抽取通常需要大规模人工标注数据,而相关语料规模相对较小,研究采用基于规则的命名实体识别结合启发式文本多关系抽取算法。

基于提取数据库的进一步研究验证了文本挖掘对材料发现的推动作用,训练机器学习模型预测十余种最新报道、未纳入初始数据集的高温合金 γ' 固溶温度,模型预测平均相对误差仅 2.27%,精度接近内部实验测量数据。更重要的是,这一方法成功预测并实验合成三种全新钴基高温合金,预测 γ' 固溶温度均超过 1250 摄氏度,实验测量温度与预测值高度吻合,平均相对误差仅 0.81%,证实从文本挖掘数据到靶向发现并实验合成新材料的完整路径可行。

3.4 面向材料预测与设计的专用大语言模型

材料科学领域涌现出大量面向不同材料体系的 Transformer 模型,从聚合物、电池、材料科学、光学、合金到钢材专用模型,均在对应领域数据上完成预训练,输入为指定样本的材料属性,例如合金的成分、工艺、温度、微观组织参数等。

大语言模型的应用通常包含多任务预测的端到端流程,例如聚合物专用模型在一亿条聚合物序列上预训练,可输出聚合物的电子、光学、热力学与力学性能,下游预测器通过相对小规模数据集训练。预训练模型也可通过微调适配不同数据集,低秩适配是主流微调方法,通过矩阵分解降低参数量,追踪预训练模型权重变化。系统且精细的微调对模型敏感至关重要,使其适应与预训练数据存在差异的其他数据集。

钢材专用模型的工作流程包括数据准备、预训练、利用模型输出嵌入向量通过多层感知机预测、小规模特定钢材数据微调等步骤。该模型参数规模较小,在数百万材料科学摘要与数万篇钢材全文数据上预训练,采用解耦注意力机制提升性能,文本分词后输入解码器架构,最终通过全连接层与 Softmax 激活函数完成掩码词预测,这是预训练的常见任务。

钢材专用模型生成成分与加工工艺文本的 768 维嵌入向量,从自然语言输入预测力学性能,嵌入向量输入混合深度神经网络,通过共享与专用特征层预测屈服强度、抗拉强度与延伸率。模型在小规模实验数据集上联合训练,权重冻结,再通过特定实验室数据集微调优化性能。模型成功预测 2022 至 2023 年报道的 18 种新钢材常规力学性能,这部分数据明确排除在预训练语料之外,屈服强度、抗拉强度、延伸率预测决定系数均达到较高水平。模型还利用实验室数据集,通过微调优化奥氏体不锈钢的制备工艺,仅用数十个实验样本,就在庞大候选空间中优化出最优制备文本序列,引入二次冷轧与回火工艺,获得的钢材性能达到 15 铬奥氏体不锈钢中的最佳水平。

预测模型的成功高度依赖大规模高质量数据库,人工构建仍是主要瓶颈。面向科学文献的自动知识提取框架提供高效解决方案,创新点并非依靠单一大型模型,而是采用小型开源模型的协同架构,整合混合智能体路径与并行生成器 - 判别器路径,结合蒙特卡洛树搜索,探索深度推理轨迹并验证逻辑一致性。只有两条独立路径共同验证的答案才会被采纳,确保高保真度。这一稳健方法在体积模量数据集上达到高精度,成本仅为专有模型的一小部分,且无需微调。这类框架是构建高质量结构化数据集的关键,支撑预测模型训练,全面加速数据驱动材料发现流程。

为解决延伸率等受加工与微观组织文本描述影响的复杂性能预测难题,研究提出信息融合策略,将预训练语言模型与对比学习结合,挖掘学术文献中的隐含知识,在钛合金验证集与难熔多主元合金测试集上取得优异决定系数。基于该模型,在无预先微观组织知识的条件下,完成钛 - 钒 - 钽三元成分空间的延伸率预测,找到具备优异延伸率的合金候选,合成与实验测试验证预测结果,测量延伸率与预测值高度吻合。这一工作证实,语言模型与材料数据结合可加速目标性能材料的发现,即便在缺乏明确微观组织数据的场景中同样有效。

近期还出现面向不同任务、依赖文献与性能数据的多模态模型,以及整合微观组织、性能数据等多模态信息的模型。前者属于多任务学习,共享相关任务与性能的信息以提升单任务预测精度、降低过拟合;后者属于多模态学习。在生物医学、有机化学与聚合物等涉及数万材料、数百性能的领域,多任务深度神经网络被用于分析与预测各类性能,捕捉任务内关联,实现优于单任务模型的效果,但多任务学习易受噪声数据与异常任务影响。

合金设计等领域的多任务学习面临挑战,数据集规模、材料性能种类与单性能数据量均较小,任务间关系复杂且相互依赖,任务组合可能导致整体性能下降。有研究采用多任务学习搜索具备低密度、合适凝固区间、加工窗口、高 γ' 固溶温度、无有害相、强抗氧化性等多目标的高温合金,不盲目训练全部任务,而是通过平均性能增益与正频率结合的评分方法确定任务分组,编码器 - 解码器框架相比单任务将平均归一化误差降低 37.5%。

多模态学习在自然语言处理与计算机视觉成功后,拓展至材料科学领域,整合多种表征技术获得的多源材料数据,目标是提升模型对材料体系的理解,缓解数据稀缺问题、改善性能。但这类方法仍受实验限制、测量成本高导致的数据集不完整制约,合成参数通常容易获取,扫描电子显微镜、X 射线衍射等微观组织数据昂贵且难以获得,模态缺失会导致模型性能下降。现有方法缺乏高效的跨模态对齐与足够的映射机制,在三元正极材料研究中,预测误差控制在实验值的 10% 以内,初步验证方法可靠性。多模态框架整合晶体结构、态密度、电荷密度与机器生成文本描述等具备物理意义的模态,不仅在带隙、体积模量等性能预测上刷新基准,相比以往模型将误差降低最高 10%。

尽管取得这些进展,GPT、Gemini 等通用多模态模型在需要深度理解与复杂推理的核心科学任务上仍存在基础局限,相关测试基准证实,这类模型擅长识别设备等基础感知任务,但在空间推理、跨模态信息整合、多步逻辑推理方面存在缺陷,更多依赖模式匹配而非科学理解。

图12|SteelBERT:面向钢材设计的材料大语言模型工作流示意图 这张图展示了SteelBERT—— 一种面向钢材设计的材料大语言模型(LLM)完整工作流,也是材料科学领域 “Materials LLMs” 的典型应用案例。

3.5 通用与专用模型:材料应用中的大语言模型评估

针对每类金属合金体系单独开发大语言模型的必要性值得探讨,为每种合金体系开发专用预训练模型耗时且资源消耗巨大。在合金领域的基础模型,在大规模文献数据上训练后,经特定合金数据集微调,应能可靠捕捉相关合金的核心特征。钢材是包含十余种组分的多组元合金,钢材专用模型参数规模不大,但可作为铝、钛、高熵合金、镍、铌等合金的合理基础模型。

图13|铝合金抗拉强度预测任务中,传统 MLP 与大语言模型(LLMs)的性能对比 这张图是不同模型在铝合金抗拉强度(UTS)预测任务上的性能对比,直观展示了传统机器学习模型与材料通用大语言模型在材料性能预测中的精度差异;也是“Materials LLMs” 有效性的直接验证。

进一步的问题是,Llama、Qwen、Gemini、DeepSeek 等通用大语言模型,在未接受专用材料文献训练的条件下,处理材料输入的性能表现如何。例如 Qwen3 在海量高质量数据上训练,覆盖代码、理工医、推理、书籍、多语言与合成数据,跨多种语言使用海量词元训练。

研究基于近期发表的数千条 7 系铝合金数据,测试不同大语言模型的极限抗拉强度预测性能,数据包含成分、工艺条件与实测抗拉强度。钢材专用模型生成嵌入向量后输入多层感知机模型,模型包含输入层、六个隐藏层与输出层,完成性能预测。

铝合金训练集数据全部用于大语言模型小样本学习,学习数据内部关联,预测结果显示不同模型性能存在显著差异。专用钢材模型性能最优,DeepSeek 系列高阶版本优于低阶版本,Gemini 系列高阶版本同样优于低阶版本,所有大语言模型预测精度均超过基于传统表格数据训练的多层感知机基线模型。这一铝合金数据集的结果表明,专用模型仅保留小幅性能优势,顶尖通用大语言模型通过小样本学习,在捕捉材料本征性能方面达到可比水平,无需额外搭配多层感知机。DeepSeek 与钢材专用模型的性能对比提出一个关键问题,随着通用大语言模型在材料科学等专业科学领域捕捉复杂物理规律的能力不断提升,持续投入资源开发维护高度专用的领域模型是否仍有必要。

图14|材料专用 BERT 与通用 LLM 在钢材强度预测中的精度与一致性对比 这张图是钢材抗拉强度(UTS)预测任务中,不同大语言模型的性能对比与稳定性分析,直观展示了材料专用 BERT 模型与通用大语言模型(Gemini 系列)在预测精度和结果一致性上的差异。

3.6 大语言模型在材料科学应用中的问题与挑战

钢材专用模型的优异预测性能,来自成分与工艺语义嵌入提取,并整合进复杂的混合下游网络,缺乏完整代码则难以复现这一结果。若采用多层感知机替代混合网络,性能会出现显著下降。基于 SciBERT、MatSciBERT、钢材专用模型的多层感知机下游网络性能有限,钢材专用模型因钢材领域专用预训练略优于其他模型,但结果表明,专用预训练虽有收益,充分发挥潜力需要合适的复杂下游网络,这是实现最优性能的同等关键因素。

因此,能否绕开专用模型与复杂下游网络,直接利用通用大语言模型的固有推理能力成为研究焦点。研究采用与钢材专用模型相同规模、包含成分与工艺参数的训练集,测试 Gemini 模型性能,结果显示,Gemini 基础版采用标准多层感知机下游网络时,性能与各类 BERT 系列模型相当,而高阶版本预测精度进一步提升,接近原始钢材专用模型结果。与铝合金数据集结论一致,这证实高阶通用大语言模型具备强大的小样本学习能力。

数值实验表明,数据量对微调效果存在限制,尽管低秩适配等微调方法通常能有效提升领域特定性能,但即便使用规模可观的数据集微调,性能相比未微调基线也无显著提升。例如采用近千条高熵合金数据微调钢材专用预训练模型,效果有限,钢材专用模型仅在钢材数据上训练,未接受高熵合金数据训练,尽管高熵合金元素在钢材成分中广泛存在。而采用 Gemini 或 DeepSeek 等通用模型,在高熵合金数据集上性能更优。近期大语言模型结合强化学习序贯设计,能更充分地结合数据发挥推理能力。

从现有数据学习潜在关系以预测新材料性能是高效方案,但需要高质量且足量的数据。小样本学习借助预训练模型中的知识,在有限样本条件下实现精准预测。采用检索增强生成方法从训练集中筛选最相关数据,仅使用不到 10% 的训练样本,模型性能即可与全数据集训练相当。验证案例显示,仅使用 2% 的高质量数据,检索增强生成结合大语言模型即可实现超高决定系数,证实数据质量对模型推理的关键作用。在数据质量高、数量有限的条件下,大语言模型与检索增强生成结合的混合方案效果突出,通过筛选最优数据并利用大语言模型推理能力,实现高精度预测,为材料科学普遍存在的数据稀缺问题提供可行解决方案。

需要注意的是,即便将温度参数设为零,相同小样本提示下,大语言模型的推理过程仍可能出现轻微输出波动。在钢材数据集的数百个数据点三次重复测试中,基础版 Gemini 产生大量完全一致输出与少量不一致输出,而高阶版本一致输出占比更低。这一结果表明,模型能力越强、误差越低,输出不确定性越高,推理能力的提升会让大语言模型更易出现幻觉现象。

不确定性主要来自推理过程中的非确定性计算,包括浮点舍入误差、分布式并行差异、缓存状态波动、词元化边界微小扰动。例如 Gemini 基于 TPU 的混合精度架构,浮点运算存在更高数值非确定性,默认保留微小随机扰动以避免输出模式坍塌。DeepSeek 采用张量并行与预测解码机制,固有引入轻微随机性与量化噪声。因此即便温度设为零,这类模型也无法实现完全确定输出,仅保持概率一致性,输出分布稳定而非逐词元完全相同。

在材料科学中,若目标是定性理解与理论分析,大语言模型固有的随机输出通常可接受,模型响应的轻微波动不会显著影响趋势分析与概念推理的解释能力。但在热力学稳定性、力学性能预测等定量预测任务中,即使是微小的推理扰动,也可能导致预测值或材料推荐结果不一致,损害结果的可重复性与可靠性。为缓解这些问题,研究者应通过标准化推理环境、结果平均、统一提示等方法稳定模型性能,确保基于大语言模型的研究满足科学探究所需的严谨性与可验证性。

4 展望:迈向虚拟材料科学家

深度神经网络在材料科学中展现出强大的预测能力,但其黑箱特性成为核心挑战,海量参数协同输出最终结果的机制难以解释,限制人工智能助力新科学知识发现的潜力。为解决这一问题,学界正积极探索提升人工智能可解释性的方法。基于合作博弈理论的 SHAP 分析,考虑所有特征组合与 Coalitions,量化每个输入特征对模型预测的平均边际贡献,可解释成对与高阶交互作用,生成直观的力平面图与关联图,但 SHAP 属于相关性分析,无法提供因果方向与机理解释。

因果建模与分析为材料科学提供新路径,PC 算法是基于约束的方法,通过条件独立检验从观测数据中推断有向无环图,可区分合金设计中元素掺杂与热处理工艺对屈服强度的因果影响。与此同时,更具颠覆性的框架不断涌现,物理信息神经网络将物理定律直接嵌入训练过程,确保输出符合既定科学原理。柯尔莫哥洛夫 - 阿诺德网络凭借独特架构,有望将复杂模型关系简化为直观的数学公式。这些提升模型透明度与可信度的努力,为更智能的科学研究新范式奠定信任基础。

机器学习与大语言模型为材料科学带来前所未有的机遇,影响力将覆盖从理论预测到实验验证的全研究流程。随着主动学习、强化学习、小样本学习、不确定性量化、数据安全、逆向设计与集成框架的进步,人工智能驱动的高效、智能、自动化材料科学新范式即将到来。大语言模型正经历重大转型,从机器翻译、文本摘要等潜力工具,转变为重塑材料科学研究方式的核心组件。研究证据表明,针对特定领域数据预训练的大语言模型,相比推理能力更强的通用模型,未必能带来更优性能,这一认知与数年前的主流观点截然不同。

这一发展轨迹超越单一任务性能优化,指向虚拟科学家的最终目标,即深度融入全研究流程、可独立设计实验、无需依赖专用知识预训练模型的智能可信自主智能体。

大语言模型基于前文预测下一个词元的运行模式,固有存在不确定性问题。从简单预测转向可靠预测,检索增强生成等方法提供有效解决方案。数据利用需要双重策略,同时解决小数据稀疏与大数据复杂问题。针对小数据稀疏,小样本提示、思维链等提示工程技术,在数据受限条件下解锁模型推理能力。针对大规模历史数据集,结合专家见解与检索增强生成的智能数据策略成为核心,直接输入大规模数据集不仅成本高昂,还存在灾难性遗忘风险。

更具前瞻性的方案是构建领域专用知识库,由专家提供数据样本的推理标注,分析并建立成分、加工与性能之间的因果关联。检索增强生成可让模型在处理新任务时,检索少量高度相关样本及其专家推理链,这一方法兼具双重收益,引导模型模拟专家思维,获得准确且可物理解释的结果,同时将复杂的大数据问题转化为高效的小样本提示任务。这一方案有效缓解计算成本高、模型内存受限等问题,成为人工智能从计算工具进化为可信科研伙伴的关键一步。

考虑到材料研发数据的特性,多智能体系统架构逐步兴起,强调协同合作,将保护私密数据、在安全内网运行的本地小型模型,与提供海量知识与超强推理能力的云端大语言模型结合,在安全性与顶尖性能之间取得关键平衡。这要求材料研究思路做出决定性转变,从传统正向设计的试错法,转向以目标性能驱动的逆向设计范式。将大语言模型与强化学习等方法结合,人工智能智能体可在庞大化学空间中高效开展靶向探索,显著加速按需设计新材料的进程。

最终,这些发展将催生物理连接全研究链的集成科学发现平台,覆盖从数据分析、假设生成、虚拟筛选、实验设计到物理实验自动化的全部环节。在这一框架下,人类与人工智能将形成全新协作关系,人工智能承担海量信息处理与复杂解空间探索的繁重工作,人类科学家得以专注于战略规划、确定关键研究方向等更高层次的创新活动。