NC 2026 | NMR-Solver: 通过大规模谱图匹配与物理引导片段优化实现自动结构解析

今天介绍的是发表在 Nature Communications 上的一项研究工作。核磁共振谱是有机小分子结构解析中最重要的工具之一,但从谱图推断未知结构仍高度依赖人工经验。NMR-Solver提出了一套自动化、可解释的结构解析框架,将大规模谱图检索与物理引导的片段优化结合起来,利用原子级结构-谱图关系逐步组装候选分子。在模拟基准、文献实验谱图和真实实验案例中,该方法展现出较强的泛化能力和实用性,能够在新骨架、谱峰歧义和信息不完整的场景下提供可靠候选结构,为自动化合成与分子科学中的逆问题求解提供了新的技术路径。

获取详情及资源

0 摘要

核磁共振(NMR)谱是有机化学中用于分子结构解析的最强大、最常用工具之一。然而,解读NMR谱以确定未知分子结构仍是一个耗时且依赖专业经验的过程,尤其是在复杂或新型化合物中更为明显。尽管近年已提出多种分子结构解析方法,但由于固有算法局限和高质量数据不足,这些方法在真实应用中往往表现欠佳。NMR-Solver是一种实用且可解释的框架,可根据1H13C NMR谱自动确定有机小分子结构。该方法引入自动化分子结构解析框架,将大规模谱图匹配与物理引导的分子优化相结合,利用NMR中的原子级结构-谱图关系。NMR-Solver在模拟基准、文献整理的实验数据和真实实验中进行了评估,结果显示其在真实场景中具有较强的泛化能力、鲁棒性和实用价值。通过将计算NMR分析、深度学习和可解释化学推理整合到统一系统中,该框架促进了可扩展、自动化且具有化学意义的分子结构解析,并为分子科学中的逆问题求解建立了可泛化范式。

1 引言

核磁共振(NMR)谱是有机化学中用于分子结构解析的信息量最丰富、应用最广泛的技术。不同于主要给出碎片化模式或官能团信息的质谱和红外光谱,NMR能够提供关于分子连接方式、立体化学和空间排列的原子级信息。这些特征使NMR成为已知和新型有机小分子结构表征中不可或缺的工具,能够呈现完整分子架构的综合视图。

尽管NMR具有强大的分析能力,谱图解读仍是耗时且依赖专业知识的过程。计算技术和模拟软件在辅助峰拾取、化学位移归属和结构验证方面已有进展,但人工解析在许多实验室中仍是标准做法。对人工经验的依赖不仅限制了通量,也会引入变异性和潜在错误,尤其是在复杂或未知化合物中更为突出。与此同时,化学空间极为庞大,估计包含超过1060个可能的有机分子,这使结构解析成为高度复杂的任务。

随着高通量实验和AI辅助自动化合成平台持续发展,自动谱图分析在推动合成路径和新反应发现中发挥着越来越关键的作用。这进一步加剧了对快速、准确、自动化NMR结构解析的需求,以跟上合成化学不断加速的发展步伐。

深度学习的最新进展显著提升了从已知分子结构预测化学位移的准确性和效率,而化学位移预测是正向NMR模拟的关键组成部分。基于二维图的模型和具有三维构象感知能力的架构如今均可实现与密度泛函理论(DFT)计算相当的准确预测,同时推理速度快数个数量级,代表性方法包括GT-NMR和NMRNet。这些能力使大规模谱图匹配成为可能,并为解决更具挑战性的逆问题奠定了基础,即根据实验NMR谱确定分子结构。

在正向谱图建模发展的同时,多种方法被提出用于处理这一逆问题,大体可分为两类:AI生成模型和传统方法。在近期生成建模方法中,典型框架是将NMR谱编码为token序列,并采用序列到序列架构生成分子文本表示,如SMILES和SELFIES。尽管这些端到端框架无需人工特征工程,但存在泛化能力有限、可解释性较差的问题。此外,由于高质量实验数据集稀缺,此类模型通常基于模拟数据训练,导致训练条件与真实条件之间存在显著领域差距。这削弱了其在实际应用中的可靠性,也限制了其向分布外化学结构泛化的能力。

相比之下,传统优化策略如遗传算法,通过迭代优化显式探索分子空间,因此具有更高透明度。为获得合适的初始种群,常通过数据库查询从已知化合物中快速筛选。然而,随机且缺乏方向性的搜索机制使其在庞大化学空间中的导航低效且不稳定,往往难以在可行计算时间内收敛到目标分子。当结构解析的目标是寻找唯一明确解时,这些挑战会进一步加剧。

尽管生成式方法和传统方法范式不同,二者在实际条件下都难以可靠地连接NMR谱与新颖且化学有效的结构,原因可能是可靠性和泛化能力不足,也可能是随机探索带来的低效。因此,仍迫切需要更有效的策略,能够充分利用NMR谱信息,并在实际应用中表现出鲁棒性和可靠性。

为应对这些挑战,提出了NMR-Solver,这是一种自动化且可解释的框架,用于根据1H13C NMR谱确定有机小分子结构。NMR-Solver基于物理引导的片段优化策略,将大规模谱图匹配与原子级结构-谱图相关性整合起来,以具有化学意义且透明的方式指导分子组装。不同于依赖随机和无方向搜索的传统方法,该方法根据可观测谱图特征演化分子片段,从而有针对性地导航化学空间。这使其能够在真实场景中实现稳健高效的结构解析;在这些场景中,新骨架、谱图歧义和不完整数据构成了显著挑战,同时每一步结构决策都可追溯到实验证据。因此,NMR-Solver为实际结构确定提供了可靠且可信的解决方案。

2 结果

2.1 NMR-Solver框架概述

NMR-Solver框架由四个核心模块组成:分子优化、正向预测、数据库检索和场景适配。该框架以闭环方式运行,通过数据库检索或用户输入获得初始候选结构,并利用基于片段的分子优化进行迭代精修,从而处理NMR逆问题。在每次迭代中,演化候选分子的谱图被模拟并与实验数据比较,以引导搜索走向化学有效且谱图一致的解。

图1|NMR-Solver架构。 该框架以闭环方式运行,整合四个模块:(i)使用NMRNet进行1H13C 化学位移正向预测;(ii)在1.06亿条目中进行大规模数据库搜索;(iii)用于迭代精修的Fragment-NMR-Based Molecular Optimization(FB-MO);(iv)允许用户定义候选结构和约束条件的场景适配接口.

图2|NMR-Solver工作流程。 从实验NMR数据出发,首先从大型数据库中检索候选分子。随后对候选分子进行片段化和重组,并在迭代循环中通过预测化学位移进行谱图匹配,以筛选新的候选结构。该过程持续到收敛,最终产生化学有效且谱图一致的解.

NMR-Solver的核心是Fragment-NMR-Based Molecular Optimization(FB-MO)模块,该模块采用物理引导、基于片段的策略对候选结构进行迭代精修。在单次迭代中,该模块从当前分子池出发,考虑化学有效的片段重组以生成新候选结构,在典型设置下可能超过109种可能性。搜索并非随机探索该空间,而是由原子级结构-谱图相关性引导,从而高效筛选模拟谱图与实验数据高度匹配的潜在后代。这种聚焦且由证据驱动的探索兼具高效率和可解释性,每次结构优化都可追溯到特定NMR特征。

为支持优化过程中的快速谱图评估,采用预训练NMRNet,这是一种SE(3)等变Transformer架构,可高精度预测1H13C 化学位移(报告MAE:1H为0.181 ppm,13C为1.098 ppm),准确度可与DFT计算相当。关键在于,NMRNet以比DFT低数个数量级的计算成本实现这种预测性能,从而支持迭代优化过程中的实时谱图模拟和大规模数据库构建。

为实现高效候选初始化,该框架利用大规模谱图检索模块,通过查询SimNMR-PubChem Database识别可能的分子候选结构。该数据库由约1.06亿个来源于PubChem的小型有机分子构建而成。数据库中每个分子均标注有预测化学位移,使其成为目前规模最大的模拟NMR数据库。该规模显著超过现有公开数据集,如NMRShiftDB2、NP-MRD、QM9-NMR和Multimodal Spectroscopic Dataset。通过利用现代向量数据库技术,包括近似最近邻(ANN)搜索,并结合重排序策略,该数据库可在亚秒级时间内检索谱图相似的候选结构,为分子优化提供高质量起点。

最后,场景适配模块将领域特定知识,如已知反应物或提出的骨架,作为初始输入用于引导结构搜索。该模块还允许在优化和筛选过程中施加分子式及元素组成约束。这些能力共同支持该框架在多种场景中灵活部署,从从头结构解析到反应感知的产物推断,均可支持自动化分析和人在环路的解释。

2.2 基于模拟谱图的结构解析

由于经过精细整理且具有结构-谱图配对关系的大规模高质量实验NMR数据集十分稀缺,现有大多数工作都在模拟数据集上进行评估。为便于与既有方法进行公平比较,NMR-Solver在一个公开可用的模拟基准数据集上进行了评估。该数据集曾用于评测多种当前先进方法,包括NMR-to-Structure和GraphGA with Multimodal Embeddings,其性能结果已在原始研究中报告。NMR-Solver与这些方法进行直接比较,从而在当前先进技术背景下对其能力进行有意义的评估。

该模拟数据集包含345000对SMILES-谱图数据,1H13C NMR谱均使用MestReNova模拟生成。在1H谱中,每个峰包含化学位移、峰积分、J耦合常数和多重性模式,而13C谱仅包含化学位移。尽管该数据集常用于训练和评估,但与真实实验条件相比存在显著差距。理想化的1H多重性模式和J耦合值在实际实验中常因溶剂效应、峰重叠和仪器分辨率等因素无法完整或准确观测,这可能使既有方法过拟合模拟1H NMR谱中的这些特征。为降低这些潜在偏差,NMR-Solver的评估未使用J耦合或多重性信息,而仅依赖化学位移和峰积分,这些特征在实践中更可靠地可测。受计算资源限制,该方法通过从数据集中随机抽取1000个分子构建测试集进行评估。

评估采用原始指标,要求在考虑立体化学的情况下实现精确分子匹配。尽管该方法未使用与GraphGA with Multimodal Embeddings相同的模拟流程(MestReNova),也不像NMR-to-Structure那样依赖该基准数据集,仍在仅13C和联合1H/13C设置下取得了与当前先进方法相当的性能。仅1H设置下的性能差距源于既有方法对模拟谱图中理想化1H多重性模式和J耦合值的依赖。

这表明NMR-Solver能够有效利用实验上稳健的谱图特征进行准确分子结构预测,而不是依赖理想化多重性模式或人工无噪声模拟等脆弱信息。随后,框架在从文献整理的实验实测NMR谱上进一步评估,以突出其在真实结构解析任务中的泛化能力和实际鲁棒性。

表1|在模拟数据集上与当前方法的比较

1H设置下的性能差距源于既有方法对理想化模拟1H 多重性模式和J耦合值的依赖。所有方法均重新实现,并在随机抽取的1000个分子上测试。加粗结果表示最佳性能。括号中的数值表示原始文献在各自评估设置下直接报告的结果,仅供参考。“条件:分子式”指目标分子的已知分子式,即每种元素的原子数。

2.3 对实验谱图的泛化能力

为实现对结构解析方法的真实且严格的基准评估,手动整理了一个包含约450个反应物-产物配对的数据集,产物NMR谱来自2024年发表在Journal of the American Chemical Society上的原创研究论文。

数据从15期周刊中提取,覆盖有机化学多个方向,包括全合成、催化,以及聚合物化学和生物化学中的底物制备。每篇论文选取3到5个代表性反应,以最大化结构和官能团多样性。每个条目包含关键反应物、报告的产物结构及其对应的实验1H13C NMR谱。为确保高数据质量,还进行了少量人工整理,以去除来自溶剂或杂质的峰。该基准反映了合成化学中的真实条件,并为评估计算结构解析方法提供了稳健基础。

一项简单统计凸显了前述现有模拟基准的局限性。在文献提取的数据集中,超过40%的1H NMR峰被标注为“m”(multiplet,多重峰),没有可解释的耦合常数。相比之下,既有方法使用的模拟数据集具有完全解析的1H NMR峰多重性和J耦合值,无法反映真实测量的复杂性。

NMR-Solver和NMR-to-Structure使用召回率以及基于Morgan指纹计算的Tanimoto相似度进行评估,二者分别衡量预测分子与真实分子之间的精确结构恢复能力和子结构相似性。结果显示,在给定分子式并使用1H13C NMR谱时,既有方法NMR-to-Structure性能有限,top-1和top-10准确率分别仅为14.44%和21.78%;相比之下,NMR-Solver在相同评估条件下显著优于这些基线,top-1和top-10召回率分别达到52.89%和67.33%。此外,即便预测结构与真实结构不完全匹配,NMR-Solver给出的结构也具有更高的Tanimoto相似度,反映出更好的子结构一致性和更具化学意义的输出。

这些结果凸显了在将基于模拟数据训练的模型应用于真实实测NMR谱时存在的显著性能差距。相比之下,NMR-Solver不依赖大规模模拟数据进行训练,而仅在评分阶段利用模拟,因此在实际场景中具有更强鲁棒性。

此外,NMR-Solver根据模拟谱图与实验谱图之间的谱图相似性对候选结构排序。结果显示,随着谱图相似性增加,预测准确率单调提升,表明谱图匹配分数可作为预测结果的可靠置信度指标。这种自洽评分机制增强了NMR-Solver在真实结构解析任务中的可靠性和实际适用性。

2.4 由反应背景引导的产物结构预测

在实际结构分析中,产物结构预测是一类常见且重要的场景,化学人员会在已知反应物或预期化学转化的背景下解读NMR谱。为评估NMR-Solver利用此类先验知识的能力,将上述文献提取数据集中的反应物信息纳入评估。

通过将反应物结构纳入初始候选池,NMR-Solver能够利用可能在产物中保留并反映在NMR谱中的子结构。这使该方法能够有效地将分子优化偏向包含谱图支持且化学合理片段的候选结构。

结果显示,在提供分子式并使用1H13C NMR条件下,该策略将top-1召回率从52.89%提高到60.22%,将top-10召回率从67.33%提高到76.22%,表明利用反应中的结构连续性可提升推断准确率。

这些结果表明,NMR-Solver能够将自动化分析与类似人工专家的推理结合起来:该方法并非孤立运行,而是放大专家知识,并以灵活稳健的方式整合反应信息,从而提高合成流程中分子结构解析的可靠性和通用适用性。尽管评估重点是纳入反应物结构,但该框架具有通用性,在可获得相关信息时,也可类似地利用专家假设或领域特定分子先验来引导优化。

2.5 分子优化过程中谱图相似性的演化

在分子优化过程中,预测NMR谱与实验NMR谱之间的一致性会随着候选分子的迭代精修而变化。结果显示,顶级候选结构的谱图相似性分数在最初几个优化步骤内显著提升,表明搜索快速收敛到具有高谱图一致性的结构。

具体而言,top-10候选结构的中位谱图相似性在前两次迭代内即超过0.96;这一阈值根据经验与50%的top-10预测准确率相关,随后逐渐接近0.97的平台。后期收益减小表明,搜索能够迅速定位到具有化学意义的结构。

这种快速推进凸显了NMR-Solver在庞大化学空间中导航的效率:通过优先考虑能更好解释观测谱图的分子结构,该方法无需穷尽探索即可早期识别高质量候选结构。相比之下,遗传算法等常规方法依赖随机交叉和突变操作,缺少定向引导。这些方法无差别地探索化学空间,通常需要更多迭代才能收敛,且产生的候选结构质量高度不稳定。

图3|基于文献数据的结构解析性能。 a. 在分子式条件下,不同方法top-1和top-10召回率的比较。b. 排除无效预测后,top-10预测的Tanimoto相似度分布比较。c. 平均top-10谱图相似性分数与成功率之间的关系。b、c结果由NMR-Solver在分子式条件下使用1H13C NMR得到。d. NMR-Solver在使用和不使用反应物条件下的召回率比较。e. 迭代过程中谱图相似性分数的动态变化。f. top-1和top-10分数分布以箱线图表示。箱线图显示中位数(中心线)、四分位距(箱体)以及第10至第90百分位(须),n=450个样本.

2.6 真实实验验证

为进一步评估NMR-Solver在真实合成化学研究中的实际效用,将其应用于实验室实验中的挑战性案例;在这些情形中,传统人工分析难以给出确定的结构归属。真实实验中的代表性案例展示了该方法的实用价值。

在某些情况下,反应路径高度复杂或出乎预期,使化学人员难以仅凭机理推理提出合理的产物结构假设;如果缺少此类假设,人工NMR解析会变得极为困难。一个来自实验室的钯催化转化案例具有代表性。产物的1H13C NMR谱提示存在两个Ph基团、一个CO2Et单元和一个三取代苯。然而,基于这些谱图特征并结合可能的催化路径,仍无法提出合理的产物结构,研究一度暂停。将NMR-Solver应用于相同NMR数据后,识别出一个与观测化学位移和耦合模式持续一致的候选结构。基于该结构,可以提出合理反应机理。随后通过二维NMR实验(HMBC和HSQC)以及高分辨质谱(HRMS)验证了该归属的正确性。

意外副产物带来了额外挑战。例如,在尝试将羟基转化为磺酸酯的过程中,色谱分离得到一个不含任何芳香质子的副产物。初始假设包括羟基被氯化,这会比观测谱图多引入一个质子;或者形成八元环副产物。然而,HRMS分析未显示与八元环结构对应的质量。应用NMR-Solver后,该方法以较高置信度提出一个二氯化产物,其预测谱图与实验数据匹配,随后HRMS确认了二氯化物的分子式,从而验证了这一归属。

异构产物进一步增加了结构解析难度,因为许多异构体会产生非常相似的1H13C谱,在缺少额外参照的情况下难以区分。例如,在肉桂酸酯氢官能团化案例中,可能形成两种区域异构体。缺少参照时,仅通过一维谱人工解读难以区分产物。然而,NMR-Solver仅基于一维谱即准确区分了这些异构体,正确识别了氢化位点,从而支持了提出的反应机理。

除促进此前无法归属化合物的解析外,NMR-Solver还可检测并纠正文献中的错误结构归属。两个最初在文献中错误报道、随后被修正的案例经NMR-Solver重新分析后,修正结构被准确预测,并且相比最初提出的结构获得显著更高的谱图相似性分数。这表明NMR-Solver能够独立识别人工解析中可能遗漏的不一致之处,即使这些不一致出现在已经同行评议的出版物中。

NMR-Solver的一个关键局限在于其依赖底层正向预测模型的准确性。在一个含张力体系的案例中,预测模型NMRNet出现了相对较大的偏差,使NMR-Solver倾向于选择一个预测谱图更接近实验数据的结构,而不是真实产物。未来NMR预测算法的进展和预期改进将被整合到NMR-Solver中,以持续提升其结构确定准确性。

图4|展示NMR-Solver实用价值的真实实验案例。 a. 人工NMR分析失败但NMR-Solver正确预测结构的挑战性实验室案例。b. 缺少芳香质子的意外副产物,被NMR-Solver正确提出为二氯化结构。c. 肉桂酸酯氢官能团化中的区域异构体区分,由NMR-Solver正确解析。d、e. 使用NMR-Solver纠正文献中的两个错误结构归属。f. 由于正向预测模型不准确而未能预测正确结构.

3 讨论

NMR-Solver能够直接从实验1H和13C NMR谱中实现准确、稳健且可解释的结构解析。不同于许多将结构解析视为黑箱翻译任务的现有方法,NMR-Solver通过由谱图证据引导的化学意义明确步骤构建分子,使可解释性成为生成过程的内在组成部分。同时,该方法取得了当前先进性能,并对常见谱图歧义具有较强鲁棒性,支持其在真实实验场景中可靠应用。

展望未来,两个方向对于推动该领域发展尤为重要。第一,系统整理大规模实验NMR数据集,无论来自文献挖掘还是高通量测量,都将对实际条件下的方法训练和基准评估至关重要。第二,正向谱图模拟,尤其是准确化学位移预测方面的持续进展,将进一步提高推断的可靠性和泛化能力。凭借模块化设计,NMR-Solver能够充分利用数据集可得性和谱图模拟方面的改进。

通过将物理信息约束的结构-谱图关系整合到优化过程中,NMR-Solver为分子优化建立了引导式且稳健的范式,超越了传统随机方法的低效和不稳定性。该框架也有望扩展到其他谱学模态和更广泛的分子设计应用。

最后,作为一个可解释且灵活的分析平台,NMR-Solver既支持全自动谱图解析,也支持人在环路的谱图解释。在新兴自动化实验室背景下,该方法可作为验证反应结果和推断产物的关键组件,从而加速新反应和合成路径的发现。从更广阔的角度看,这些能力凸显了其推动自动化科学研究范式转变的潜在作用。