Nature 2026|MOSAIC: 人工智能辅助化学合成的集体智能
今天介绍的这项工作来自 Nature 。作者提出MOSAIC框架,将Llama-3.1-8B-Instruct通过Voronoi区域划分与LoRA微调扩展为2,498个化学专家模型,用于把海量反应文献转化为可执行的实验方案。与只预测条件或产率的传统模型不同,MOSAIC能够直接生成包含试剂、溶剂、投料量、加料顺序、温度、停留时间、后处理与预期产率在内的完整合成流程,并给出基于最近专家质心距离的置信度指标。实验上,作者完成了37个目标化合物的合成验证,其中35个在最高排名方案的首次尝试中成功实现,整体成功率达到71%。更重要的是,该框架不仅能在药物、材料、农化与日化等场景中复用既有知识,还能在低先例区域推动新反应方法开发,显示出把“文献集体智能”转化为实验行动能力的潜力。

获取详情及资源:
- 📄论文:https://doi.org/10.1038/s41586-026-10131-4
- 💻代码:https://github.com/haoteli/MOSAIC
- 🗂️代码归档:https://doi.org/10.5281/zenodo.17904274
- 🧪数据:Pistachio数据库(2024Q1):https://www.nextmovesoftware.com/pistachio
0 摘要
科学文献的指数级增长正在让跨学科知识获取变得日益困难。化学领域每年新增数十万条反应记录,但把这些信息真正转化为可执行实验仍然是障碍。尽管大语言模型在相关任务上已显示出潜力,能够稳定服务于新底物、多类反应并输出完整实验方案的系统仍然稀缺。该研究提出MOSAIC(Multiple Optimized Specialists for AI-assisted Chemical Prediction)计算框架,使化学家能够调动数百万条反应流程所蕴含的集体知识。MOSAIC基于Llama-3.1-8B-Instruct构建,在Voronoi聚类反应空间中训练2,498个专门化化学专家。该方法能够为复杂合成给出可复现、可执行并带有置信度指标的实验流程。实验验证表明,体系整体成功率达到71%,成功实现35种以上新化合物的制备,覆盖药物、材料、农化与化妆品等场景。更值得注意的是,MOSAIC还能够推动训练集中并不存在的新反应方法开发,这一能力对于化学合成的前沿推进尤为关键。把超大知识域切分为可搜索专家区域的策略,也为其他“信息增长速度超过知识调用效率”的科学领域提供了可推广的AI辅助发现范式。
1 引言
科学快速发展要求研究者能够更高效地穿行于持续膨胀的知识库。仅化学领域,每年就会新增数十万条反应,与各类数据库中早已积累的数百万已知转化共同构成庞大的反应宇宙。面对这样的增长速度,依赖人工逐步检索文献不仅效率低,而且高度依赖个人经验。由于化学持续驱动药物、材料及多种产业创新,把知识准确地转化为可执行实验方案,已经成为基础而紧迫的问题。
这一挑战也恰好指向了一个自然的解决思路。化学研究本就是在文献启发下不断试错、迭代和积累的过程,因此特别适合与大语言模型结合。这类模型在大规模科学文本上训练,能够捕捉化学概念之间复杂而隐含的关系。此前的研究已经围绕特定任务开发出多种专用模型,例如预测反应条件、估计总产率或推断预定义的反应动作序列。近来,也有工作尝试把通用生成式预训练模型作为化学研究助手,用于实验自动化协同与合成路线规划。
不过,当前不少做法依赖闭源模型,存在模型更新带来的可重复性问题、输出非确定性、缺乏可靠性评估指标,以及在SMILES等复杂化学输入上表现不稳等局限。已有一些定制模型虽然可以给出反应条件建议或产率预测,但往往无法提供决定实验成败的完整细节,例如化学计量比、温度历程以及后处理步骤。恰恰是这些过程性细节,通常需要长期实验积累才能掌握,而单个研究者的经验很难覆盖持续扩展的方法学谱系。类似限制同样存在于机器人合成平台中,因为关键参数缺失常常迫使人工介入。
在开源大模型与LoRA等参数高效微调技术的发展背景下,面向化学领域的专门化开始成为现实。作者据此提出MOSAIC框架,利用Pistachio数据库把Llama-3.1-8B-Instruct转化为2,498个专门化化学专家。该框架采用去中心化、检索驱动的设计,不需要一次性训练超大一体化系统,而是把反应空间切分为可搜索的局部区域,使训练可以在仅有4张GPU的较小硬件条件下分批完成。与“重训整个系统”的方案相比,这种架构既降低了硬件门槛,也为后续动态增加新专家提供了空间。

图1|MOSAIC框架。 a,作者以连接的RDKit指纹与Morgan指纹表示反应组分,并通过产物与反应物指纹之差构造反应指纹。b,KMN模块根据输入反应生成特征与类别,其输出层前的特征被定义为RSFP,用于表征反应特征。c,作者用树图展示编码后的反应空间,说明KMN度量能够在保持类内聚类的同时区分氯代、溴代和三氟甲磺酸酯型的Buchwald–Hartwig偶联。d,整个反应宇宙通过FAISS聚类为多个Voronoi区域,再在各区域上用LoRA微调出领域专家模型。e,示例专家883以氯代Buchwald–Hartwig胺化为主,同时覆盖相关C–N偶联反应。f,MOSAIC能够输出人类可直接复现实验的完整操作流程,包括试剂、溶剂、投料量、加料顺序、温度、反应时间、后处理、产物状态和预测产率等。
2 结果
2.1 定量评估
作者把“能否生成完整、可执行的化学实验流程”视为合成规划中的关键新能力。相比此前主要聚焦单点任务的专用模型,这项工作更关注端到端生成:从试剂选择到产率估计,再到自然语言实验步骤的完整输出。为此,作者建立了一套定量评估体系,用来系统考察微调后的语言模型在上述任务上的能力,并把MOSAIC与通用大语言模型进行对照,以分析领域专门化带来的收益。
2.2 产率预测分析
在产率预测任务中,MOSAIC并不是只看反应式本身,而是把完整实验段落作为输入,综合试剂、溶剂与过程描述来推断最终实验结果。考虑到语言模型以离散token为单位工作,作者把产率划分为0%到100%的十个10%区间,以减轻离散表达和实验波动共同带来的误差。
结果表明,MOSAIC预测分箱中心与真实产率中位数之间存在中等偏强的相关性,在不限制类别样本数时达到
2.3 试剂与溶剂预测准确性
为了评估试剂与溶剂预测的准确性,作者构造了差异度量
进一步看“至少命中部分正确组分”的联合指标,单次预测下试剂或溶剂至少部分正确的比例已经达到73.0%,而多专家预测时提升到94.8%。也就是说,即便模型没有完全复现文献方案,它几乎总能抓住与目标转化相关的关键反应成分。作者进一步分析那些即使在前三专家中也没有实现部分匹配的样本,发现模型常常给出的并不是明显错误,而是化学上可行的替代方案。例如,把硝基还原为氨基时,模型有时会给出铁而不是真实方案中的氯化亚锡,这种偏差实际上反映了模型在相关反应知识区域中的细粒度分工,而不只是“答错”。
表1|试剂与溶剂预测结果(匹配率,%)。

2.4 与通用大语言模型的比较
为了评估通用大语言模型在化学任务上的边界,并量化领域专门化的收益,作者选择了12个具有代表性的反应实例,覆盖Suzuki偶联、烯烃复分解、Buchwald–Hartwig胺化、Heck反应、Sonogashira偶联和酯化等类型,并使用新的底物组合来测试真实泛化能力。参与比较的模型包括GPT-4o mini、Claude 3.5 Haiku、Claude 3.5 Sonnet和ChatGPT o1 Pro。评价标准不仅看化学知识是否正确,也看实验步骤是否可执行、响应是否稳定,以及是否能理解并遵循统一提示模板。
结果表明,MOSAIC在这些测试反应上总体表现更好,尽管它只有80亿参数,而对照的几个通用模型很可能规模更大。作者据此认为,在专业领域中,针对任务的微调与化学特定优化能够弥补甚至超过单纯参数规模带来的优势。与此同时,比较还揭示出一个很关键的现实问题:除了化学知识本身,指令遵循能力同样重要。一些通用模型在一次试验中可以给出详细答案,下一次却可能以“信息不足”为由拒答,或者仅仅机械复制模板而没有真正完成任务。这种不稳定性使它们较难直接服务于实际合成工作流。

图2|提示设计与定量指标。 a,MOSAIC接收不完整实验段落后继续推断产率。b,作者在不限制反应类别样本数时评估产率预测相关性。c,在每类反应最多保留20个样本时再次评估,结果与b相近。d,作者统计
2.5 跨广泛反应类型的新化合物合成
为了验证MOSAIC的实用性、普适性与可靠性,作者对一批现代合成中具有代表性的基础反应进行了大规模实验验证,并直接执行每个任务中排名最高的预测方案。这里既考察“分子新颖性”,也考察“转化新颖性”,即不仅关注能否做出未报道化合物,也关注能否在尚未建立的反应情境中给出有效方法。
首先,在药物与材料化学中极为常见的Buchwald–Hartwig胺化反应中,MOSAIC能够准确给出一系列具有挑战性底物的条件。更重要的是,针对不同底物,模型并不拘泥于单一模板,而会在钯催化Buchwald–Hartwig、铜催化Goldberg以及SNAr等路线之间做出切换。这种对“同一目标可由不同反应家族实现”的理解,使其能够顺利合成多种临床相关化合物衍生物,例如去甲替林与非诺贝特衍生物。
在Suzuki偶联中,作者展示了多个药物样骨架的构建,包括含有敏感官能团、在传统条件下较有挑战性的片段。Heck偶联的测试进一步表明,MOSAIC不仅能够给出常规可行方案,还能帮助打通文献中曾经失败的转化,显示出缓解合成瓶颈的潜力。烯烃复分解方面,作者成功实现了对压敏胶相关分子与功能材料单体的转化,说明该框架不仅适用于小分子,也能触及聚合物与功能材料化学。
在炔烃化学中,Sonogashira偶联所需的双催化体系同样被有效处理,这对高级材料与光电器件相关分子的构建十分关键。对于药物化学与农药化学中常见的二芳基醚骨架,MOSAIC还给出了雌酮衍生物的多条可行路线,体现出其把经典方法迁移到复杂生物活性分子修饰中的能力。
除了催化偶联,作者也考察了更依赖选择性与底物特异性的转化。体系能够在避免使用铬等有毒金属的前提下,把季戊四醇衍生物可控氧化为相应醛;还能处理手性原料上的区域选择性与非对映选择性问题,包括此前未成功实现的(S)-香芹酮共轭加成,以及L-紫苏醛的Horner–Wadsworth–Emmons烯化。进一步地,MOSAIC还可用于天然产物sclareolide的异戊烯基化,以及橙皮素可及酚羟位点的单硅基保护,说明它能够从训练集中抽取并迁移已经建立的选择性原则。

图3|计算预测引导的新化合物合成。 作者在多类经典转化中直接执行MOSAIC预测条件,成功获得一系列此前未报道或具有实际开发价值的新化合物。图中方括号内黑色数字表示该反应到最近专家质心的距离,灰色数字表示MOSAIC预测产率。整体结果说明,MOSAIC能够在多类反应中为未知结构给出可执行的实验路线。
2.6 转化应用
作者进一步把该框架推向更加贴近产业需求的真实任务,覆盖药物研发、材料科学、催化研究、农业化学以及日化应用等多个方向。在药物研发场景中,MOSAIC既能支持全新药样分子的构建,也能对已有药物骨架进行策略性修饰,从而为安全性、疗效与药代性质优化提供合成支撑。文中展示了CEP-33779片段类似物,以及由阿莫沙平、塞来昔布和多奈哌齐出发得到的衍生分子。
在催化与功能分子方面,作者利用MOSAIC实现了工业相关配体与新型光催化剂的合成。与此同时,框架还可延伸至材料科学,例如为电子器件相关共轭化合物提供合成路线;在农业化学中,作者成功获得多种pyrabactin类似物;在香料与化妆品应用中,则完成了Hedione类似物与L-citronellyl retinoate等目标化合物的制备。这些结果说明,MOSAIC并非局限于某一狭窄反应类型,而是具备跨行业迁移的能力。
更具代表性的案例来自新反应方法开发。作者关注的是通过杂芳基二卤化物级联环化来构建吲哚生物电子等排体。尽管芳基二卤化物的类似环化在传统体系中已较成熟,但用于多种azaindole合成的对应方法仍然明显不足,尤其某些5-azaindole衍生物在既有方法下无法获得。针对这一空白,MOSAIC指导开发出一条未见报道的新方案:利用杂芳基二卤化物与N-烷基烯丙胺发生环并反应,成功得到一系列azaindole产物,包括5-azaindole衍生物13d。值得注意的是,生成13a的任务其最近专家质心距离高达320,明显高于常见高置信度阈值150以下,说明该预测已经落在现有知识空间之外,属于真正的低先例探索。
总体上,在37个实现的目标化合物中,有35个直接通过最高排名预测在首次尝试中成功,只有2个需要转向较低排名的备选流程。虽然并非所有预测都能成功,且扩展数据中也给出了痕量产物或超出模型能力范围的失败案例,但整体趋势已经显示出一个稳定规律:最近专家质心距离越近,实验成功率越高。作者对所有尝试进行汇总后发现,距离小于100时成功率超过75%,距离更大时则降至约50%。这使置信度指标不只是“经验分数”,而成为实验资源分配与优先级判断的实际依据。

图4|跨化工行业的转化应用。 作者展示了MOSAIC在药物研发、材料科学、催化研究、农化与日化中的代表性合成结果,并进一步给出低先例区域中的新反应方法开发案例。方括号中的数字同样对应最近专家质心距离与模型预测产率,反映了“知识邻近度—实验成功率”之间的关系。
2.7 模型局限性
作者把MOSAIC的失败模式概括为两类。第一类是高置信度但实验表现不佳的预测,这通常意味着模型给出的方案仍然落在合理知识空间之内,但还需要在预测空间内部做更充分的试探与优化。第二类是与训练分布距离较远的转化,这类任务常对应数据库本身尚未充分覆盖、发展又很快的方法学前沿,例如光化学。这意味着MOSAIC最适合在“有较丰富先例、但人工检索困难”的知识密集区域发挥作用,同时也能诚实地提醒研究者:某些任务可能需要真正的方法学开发,而不只是条件调用。
作者进一步指出,MOSAIC擅长识别并迁移已知反应模式,但无法凭空发明涉及全新试剂体系的完全未知转化。这一限制并非系统独有,而是当前AI化学共同面临的边界,也再次说明实验化学在推动新方法诞生中的不可替代性。另外,MOSAIC的目标也不是一次预测就给出最优产率。文中的成功实验更多证明了“能够做通并进入可优化区间”,而不是已经完成针对每个底物的精细工艺优化。
在更专业的窄任务上,MOSAIC这种通用架构实际上是在“精度”和“广度”之间做权衡。例如,对于某些特定的Buchwald–Hartwig反应,经过精心整理数据集训练出的专用模型仍可能在数值产率预测上更准确。当前实现还继承了通用语言模型tokenization策略的局限:一方面,连续产率被离散token表示,先天损失了数值精度;另一方面,对于带有多个杂环的大分子,SMILES与化学名称之间的转换仍然低效。作者因此提出,未来若能引入化学特定的tokenization、原子级编码,或把分子图信息显式融入多模态表示,MOSAIC的表现还有进一步提升空间。
最后,作者强调MOSAIC的框架本身并不依赖某一个固定基础模型。虽然当前实现基于Llama-3.1-8B-Instruct,但同样的专家检索与局部微调机制可以自然扩展到70B、405B或更新一代模型,从而随着语言建模与化学表示技术的进步持续演化,逐步缩小计算预测与真实实验结果之间的差距。
3 讨论
作者认为,MOSAIC体现了一个重要原则:凡是能够通过计算检索进行组织的问题,往往都会随着数据与算力增加而有效扩展。把庞大的化学反应空间切分为可搜索的Voronoi区域,并为每个区域配置相应专家之后,MOSAIC就能够随着新数据的到来持续提升覆盖范围与预测精度。借助FAISS检索,系统可以在极短时间内定位最相关的专家模型;而且随着新反应类型不断出现,专家数量本身也可以继续扩展。更关键的是,这一做法不依赖对反应类别做过于僵硬的人为定义,而是允许系统直接从Voronoi单元中学习并利用不同转化模式之间的相似性。
作者把MOSAIC比作现代化学合成中的“指南针”。化学家已经经历了从纸质书到在线数据库的文献获取方式变迁,而大语言模型可能代表下一次转变。把大模型与大规模反应数据库结合起来,能够构建一个强大的计算平台,使化学家系统地获得实验流程、快速筛出可行路线,并以比传统人工检索更高的速度与精度把知识转化为行动。MOSAIC的价值不在于替代化学经验,而在于快速扫描庞大的化学空间,帮助研究者锁定值得投入实验资源的方向。过去往往需要长期阅读与经验积累才能完成的条件判断,如今可以在数分钟内完成初步筛选。
作者也强调,尽管资深化学家未必已经在日常每个常规反应上都依赖语言模型,但这类计算框架正在迅速成为现代实验室实践中不可忽视的工具。化学终究是一门经验科学,新方法常常来自细致的机理研究与偶然发现;而将经验主义与数据建模结合起来,正好能把化学直觉与数据驱动启发连接起来。这样做有望减少反应开发与优化所需的时间、资源以及潜在环境成本,同时把可合成化学空间的边界进一步推开。