NC 2026 | ReactionSeek: 让大模型从有机合成文献中挖掘反应知识

今天介绍的是发表在 Nature Communications 上的一项研究工作。化学发现中的人工智能应用长期受限于文献数据难以结构化获取,尤其是有机合成领域中大量知识仍封存在非结构化文本、反应图式和实验记录中。ReactionSeek通过结合大型语言模型与成熟化学信息学工具,实现了对有机合成文献中文本、图像和语义信息的自动化挖掘与标准化。在跨越百年的Organic Syntheses文集中,该框架对关键反应参数达到超过95%的精确率和召回率,并进一步支持AI就绪数据集构建、自然语言化学数据问答以及催化趋势自动分析,显示出面向化学知识发现的数据整理价值。

获取详情及资源:

0 摘要

人工智能(AI)在化学发现中的应用受到严重阻碍,关键原因在于大量数据被锁定在非结构化科学文献中,难以直接获取。现有数据采集方法往往依赖人工、覆盖范围有限,或需要大量定制化软件开发,阻碍了利用AI进行化学发现的进展。ReactionSeek作为一种框架,协同结合大型语言模型(LLM)与成熟化学信息学工具,可从有机合成文献中自动开展多模态数据挖掘。通过精细化提示工程和极少量定制代码,ReactionSeek能够提取并标准化复杂的文本、图形和语义化学信息。该框架在跨越一个世纪的Organic Syntheses文集中得到验证,对关键反应参数实现了超过95%的精确率和召回率。由此支持三类应用:生成大规模AI就绪数据集;构建交互式合成聊天机器人SynChat,用于以自然语言查询化学数据;开展自主分析并揭示催化领域持续数十年的趋势。因此,ReactionSeek为数据整理瓶颈提供了通用解决方案,推动了面向AI驱动的档案挖掘和化学科学知识发现。

1 引言

人工智能(AI)与分子科学的融合有望从根本上重塑发现过程,加速从医药到材料等领域的创新。这一潜力在有机合成中尤为重要,因为有机合成是分子构建的基础学科。尽管AI驱动策略已在逆合成规划、机理研究和新反应发现中展现出显著能力,但其在化学研究前沿中的应用仍受数据可及性限制。一个多世纪以来积累的大量化学知识仍封存在非结构化文献中。由此不得不依赖经过整理且通常具有专有属性的数据集,导致当前AI模型主要接受经过净化的信息训练,难以捕捉真实化学体系的复杂性和多样性。因此,建立自动化、可扩展的方法,将这一庞大的科学遗产转化为可操作、机器可读的知识,是释放真正AI驱动化学发现潜力的限速步骤。

当前数据采集方法均存在明显局限。商业数据库虽然内容庞大,但常受数据不一致、特定反应类型覆盖不完整以及许可条款限制等问题影响。另一方面,高通量实验(HTE)能够生成精确数据集,但通常缺乏化学多样性,且对许多研究团队而言成本过高。因此,从科学文献中进行人工整理仍是构建领域特定数据集的常见做法。这种方法不仅劳动密集、耗时,而且需要特定化学专业知识,并容易受到人为错误影响,进而可能损害数据集质量和可扩展性。因此,亟需一种自动化、可靠且可扩展的方法来解决这一数据整理瓶颈。

早期化学数据自动提取尝试探索了多种自然语言处理(NLP)技术。基于规则和传统机器学习的模型难以处理化学文本中的细微语言特征,尤其难以应对分子命名、反应图式以及实验描述中隐含知识的复杂性。近年来,大型语言模型(LLM)因其先进的文本理解能力而展现出重要潜力。然而,与材料科学和生物科学等相关领域的数据挖掘相比,有机合成挖掘面临更大挑战。这项任务不仅需要解释多样化分子结构和标识符,还需要理解它们之间复杂且依赖上下文的关系。该任务超越了一般文本理解,需要能够有效利用LLM潜在化学知识和推理能力的框架。尽管已有工作通过微调、提示工程等方法使用LLM,但这些开创性方法仍存在局限。关键问题包括难以适应不同文献风格、实现过于复杂以及模型微调计算成本较高。此外,既有基于LLM的反应挖掘方法仍面临若干挑战,包括化合物信息分散在小标题中、化学名称向SMILES表示转换、复杂化合物指代以及参考图像中化合物识别。因此,仍然需要一种更通用且资源效率更高的方法,以适应有机合成数据挖掘的复杂性。

图1|大型语言模型(LLM)在化学数据挖掘中的应用 a. 通过LLM和定制化工具开展化学数据挖掘时的典型挑战. b. ReactionSeek框架的概念性概览.

图2|有机化学图像挖掘与文本挖掘工作流程 a. 图像挖掘过程包括识别图像中的分子标签,将其分配为反应物或产物等角色,并随后使用光学化学结构识别(OCSR)工具将图形化学结构转换为SMILES. b. 完整文本挖掘提示由四部分组成:任务描述、任务要求、处理建议和处理案例。可根据待挖掘数据自由调整提示内容,并通过LLM在处理案例中的自优化过程获得表格化结果.

为应对这些挑战,提出了ReactionSeek。该框架能够从科学文献中自动进行多模态化学数据提取。其采用混合架构,将LLM的上下文理解能力与成熟化学信息学工具的化学精确性相结合。ReactionSeek使用领域特定提示工程策略,无需资源密集型模型微调即可实现稳健而准确的数据挖掘。通过系统挖掘跨越一个世纪的完整Organic Syntheses文集,方法的有效性和可扩展性得到展示,对关键反应参数实现超过95%的精确率和召回率。所得AI就绪数据集支持两个下游应用:开发交互式聊天机器人SynChat,用于通过自然语言查询反应数据;开展自主的LLM驱动分析,并成功识别催化领域持续数十年的历史趋势。因此,ReactionSeek为数据整理瓶颈提供了稳固且可迁移的解决方案,为化学科学中的大规模AI驱动知识发现铺平道路。

2 结果

2.1 ReactionSeek数据挖掘框架

ReactionSeek用于处理化学文献,以提取并组织反应信息,将原始文本和图形数据转化为经过整理、机器可读的数据集。该工作流程包括三个核心阶段:(1)图像挖掘,用于解释图中的反应图式和结构;(2)文本挖掘,使用提示工程化LLM从实验步骤文本中提取详细实验信息;(3)数据标准化,用于确保所提取化学实体和反应参数的准确性与一致性。

有机化学图像挖掘:准确解释图像中的化学结构和反应图式,是自动化化学数据挖掘中的基础挑战。现有光学化学结构识别(OCSR)工具能够将分子结构转换为机器可读格式(如SMILES),但在复杂图中将这些结构与正确角色(如反应物、产物)及文本标识符关联起来仍然十分困难。ReactionSeek通过使用多模态LLM(GLM-4V)分析反应图式图像来解决这一问题。通过提示引导,LLM识别图像中的化合物标签,并将其映射到相应的分子结构图像,随后由OCSR工具转换为SMILES。

为评估该图像挖掘模块,使用来自已发表文献SI的42张多样化反应图式图像进行测试。多模态LLM(GLM-4V)在正确识别并关联分子标签及其反应物或产物角色方面达到91.5%的准确率。InDraw OCSR工具用于将分子图像转换为SMILES,准确率为70.1%。整体表现较为可观,但结构识别准确率受到当前集成OCSR工具能力的影响,提示未来可通过更准确的OCSR方案进一步提升。

图3|从SI和ChEMU项目中提取光谱数据的性能 a. 关键光谱数据类型$ ^{1} H$ NMR、HPLC和MS的提取结果分类(TP、TN、FP、FN). b. ChEMU 2020竞赛示例中的提取结果分类. c. 按来源期刊分层统计的光谱数据提取准确率. d. ChEMU 2020数据中各数据类型的提取得分及其对应F1分数.

有机化学文本挖掘:从非结构化文本中提取详细实验步骤和反应参数,是ReactionSeek的核心。为在尽量减少人工干预的情况下实现高保真提取,开发了面向LLM的精细化提示工程流水线。该流水线使通用LLM适应有机化学文献的特定细微差异,引导其提取预定义化学信息,并组织成适合审查和下游处理的表格格式。借助该流水线,LLM能够有效识别文本片段中的化合物实体,并建立复杂的共指关系。通过分别处理小标题和文本片段,该流水线成功实现了合成文本片段中化合物指代与小标题中相应化合物之间的关联。

提示架构包含四个关键组件,用于优化LLM在这一领域特定任务中的表现:(1)任务描述:该组件清晰定义数据挖掘任务的总体目标,并向LLM提供基本准则,包括减少输出幻觉等常见问题的指令。(2)任务要求:在此指定需要提取的信息和输出格式,例如具有特定列的表格。该部分经过策略性放置,以增强LLM对输出规范的遵循,抵消长输入带来的潜在记忆衰减。(3)处理建议:以自然语言形式向LLM提供来自专家的启发式规则。这些建议基于领域专家对样例文本的预检,概括常见文本模式,并整合必要化学知识,以帮助LLM解释化学叙述。(4)处理案例:提供由真实输入文本及其对应目标结构化输出组成的少样本示例。借助上下文学习,LLM能够学习特定输入-输出模式和格式要求。这种结构化提示方法旨在确保LLM在任务记忆、化学语境语义理解以及提取任务准确执行之间保持平衡。

图4|数据标准化工作流程 数据标准化过程是一个迭代循环,协同结合数据库检索、化学信息学工具解析以及LLM智能匹配。该过程在成功识别后终止,或在超过预设步骤上限时停止。示例展示了该流程的能力:LLM单独使用时无法解析复杂分子名称,而该工作流程能够正确识别结构并将其转换为规范SMILES.

为验证数据挖掘流水线的性能,在权威ChEMU数据集上进行了基准测试。该选择确保了严格的比较分析,因为ChEMU-2022竞赛中的先进模型已在该特定数据集上明确建立了高性能基线(F1=0.968)。该流水线在少样本学习场景中展现出显著优势。仅使用七个标注示例,即可在提取关键反应组分时达到0.983的F1分数,包括反应物、产物、溶剂、温度、时间和产率,较既有模型进一步提升。

GLM-4的文本挖掘效率还使用来自六篇有机合成文章SI的50个反应基准数据集进行评估。提取结果被分类为真阳性(TP;正确识别的实体或数值)、假阴性(FN;遗漏)和假阳性(FP;错误或虚构信息)。在合成化学应用中,FP通常比FN更具危害性。提示策略有效引导模型提取多种实验数据,包括化合物标识符、用量、产率、溶剂、反应条件和对映体过量(e.e.)值,几乎所有类别均取得较高精确率、召回率和F1分数。唯一差异是对少见溶剂混合物或添加剂(如18-crown-6)的误识别,表明模型表现关键依赖其既有化学知识。通过在提示中增强此类少见实体的信息,可以较容易地解决这一局限。

随后,文本挖掘流水线被扩展到复杂光谱数据(NMR、MS、HPLC)提取,并使用GPT-4配合定制提示完成。目标数据为此前同一基准文献中236个分子的表征数据,开发的挖掘提示覆盖$ ^{1} H$ NMR、MS、HPLC和IR。系统表现出较高效率,大多数光谱类型的提取准确率超过95%。值得注意的是,尽管$ ^{1} H$ NMR数据具有固有复杂性,需要解析化学位移、裂分模式和耦合常数,其提取准确率仍保持较高水平。这一结果表明,结构化提示能够使LLM有效提取光谱报告中内含的上下文化学知识。误差分析显示,耦合常数(J值)分类以及由化合物标签不一致导致的歧义解析仍是挑战。后续分析表明,更先进的LLM架构对此类不一致具有更强稳健性。

所提取化学信息的标准化:将多样化化合物命名(包括IUPAC名称、通用名、拼写错误变体和化学式)转换为机器可读的SMILES表示,仍是有机反应挖掘中的重要挑战。ReactionSeek的一个关键组成部分是数据标准化模块,旨在将原始提取文本转换为准确、一致且AI就绪的格式。该模块强调两项主要整理任务:名称到SMILES的转换和单位标准化。

通用LLM在直接执行名称到SMILES转换时通常不可靠,这一局限源于其生成不稳定性以及缺乏领域特定知识训练。既有工作显示,这一缺陷会导致高频严重错误,包括不可解析字符串、原子添加或遗漏、官能团位置错误以及主链结构错误。鉴于这些显著可靠性问题,直接将通用LLM应用于该转换任务具有挑战。ReactionSeek通过实施混合工作流程克服这一问题:(1)首先,从挖掘结果中汇总唯一化合物名称。(2)其次,使用成熟化学信息学资源处理这些名称,包括数据库检索和名称到结构转换器,以生成规范SMILES。(3)最后,增强了向量搜索和模糊搜索能力的LLM将挖掘得到且常常不标准化的命名,智能映射到由这些专门工具整理的规范SMILES。通过数据验证、解析和LLM辅助对齐的迭代过程,确保生成高保真结构表示。

同时,该模块利用LLM进行单位标准化。通过精心设计的提示,对所有反应参数(如时间、温度)进行单位标准化,以确保整个数据集的一致性。最终输出为结构化CSV文件,使用标准化标识符和参数概括每个反应。该整理数据集不仅可直接用于构建预测模型,也可作为SynChat等交互式工具的知识库。

2.2 大规模反应挖掘:Organic Syntheses文集案例

为展示ReactionSeek的可扩展性和实际效用,将其应用于Organic Syntheses文集的系统挖掘。文集自1921年开始出版,是具有重要历史意义且质量较高的已验证合成步骤库。截至2025年,文集包含102卷,是研究合成方法演化的宝贵资源。在案例中,处理了前100卷中的3103篇文章,为后续分析和聊天机器人开发建立了综合原始数据集。还从文集中人工整理出50篇文章的基准子集,用于详细性能评估。

自动化挖掘效率:ReactionSeek的一个关键优势是有望显著减少人工数据提取所需时间和工作量。在50篇文章基准集上,使用GLM-4时,框架每篇文章完成数据挖掘和输出格式化平均需要21.32秒。相较通常每篇文章需要5-10分钟或更长时间的人工数据挖掘,这代表了显著改进,凸显了基于LLM方法带来的效率提升。

Organic Syntheses基准准确性评估:在50篇文章基准数据集上评估了ReactionSeek(使用GLM-4)的准确性,评估标准根据后续应用的实际需求制定。(1)反应物和产物:正确且完整地提取并分类所有作为反应物或产物参与的化合物实体,被视为关键指标。(2)反应产率:精确提取产率值。(3)反应规模(用量):重点关注关键反应物和产物用量的准确提取;对于辅助试剂,如溶剂或过量试剂,则放宽严格程度,因为数量级和比例关系通常已足够。(4)时间和温度:鉴于这些参数在实验记录中可能存在变异,评估重点是模型提取其认为必要的关键时间和温度值的能力,而非对每个记录值实现绝对准确。

GLM-4在化合物识别中表现强劲,尤其是在产物识别方面;反应物提取中的FP极少,满足关键准确性需求。然而,反应物提取中仍出现一些遗漏(FN),可能源于反应物在文本中的位置不一致。溶剂识别中出现FP,提示LLM可能依赖其对常见溶剂的先验知识,从而可能将不常见溶剂或反应物错误分类。

在数值数据提取方面,模型对反应产率和产物用量表现出较高准确性,测试集中未出现虚构产率值。一个显著误差模式出现在反应物用量提取中:当某化合物分多次加入时,模型往往难以准确汇总这些用量。这可能反映了LLM在语言语境中复杂数值推理的局限,也可能源于缺乏针对这种情形的特定提示工程。时间和温度提取虽然面临类似复杂性,但由于被列为独立提取目标,因此表现相对更好。

在50篇基准文章中,经对初始不可解析结果进行重新处理后,有48篇生成了符合所需格式的输出。未能生成正确格式输出的两篇文章明显更长(9824和5502个字符,几乎可能超过LLM的上下文窗口),且包含的反应数(各5个反应)高于平均水平。在这些情况下,GLM-4成功提取了信息,但格式化失败,提示在较长提示之后输入很长文本,可能导致模型部分遗忘初始格式化指令。文本分段是缓解该问题的潜在策略。

用于文本挖掘的LLM比较评估:基于LLM的数据挖掘性能受到底层模型选择的显著影响,尤其受到参数规模和架构影响。为指导ReactionSeek的模型选择,在Organic Syntheses基准数据集上评估了多种LLM。测试模型包括GLM-4、GPT-3.5、GPT-4、Llama、Mixtral、Baichuan、Qwen和DeepSeek。

较大模型通常在化学信息提取中表现显著更高。这表明参数规模增加会关键影响LLM理解复杂化学内容的能力。较大模型更擅长理解任务目标并正确识别相关化学实体。此外,随着模型规模增加,不可解析或格式错误响应的发生率降低。这种改进可能源于较大模型处理长token输入并保留关键提示指令记忆的能力增强,也源于其更强的复杂化学关系和上下文内在知识理解能力。

有趣的是,较大模型在精确率方面表现突出,而中等规模模型往往能达到相近召回率。这表明,一旦模型具备足够参数规模,能够掌握提示中概述的基本化学任务,进一步增大规模对简单识别任务可能带来递减收益。某些持续存在的错误类型,例如从多次添加中汇总反应物用量,仅通过增加模型参数规模并未完全解决,凸显了针对特定挑战进行提示优化或引入算法解决方案的必要性。

对小型和中等规模模型成功提取案例的分析显示,它们通常在描述较简单反应(如化合物更少、单步步骤直接)且文本长度较短的文章中表现良好。这表明文本片段长度是影响LLM生成有效、格式良好输出的关键因素,因为较短文本降低了模型的认知和记忆负担。对于复杂度较低的提取任务,或在使用较小模型时,文本分段或采用专门适配长上下文的模型等策略可以提升性能。

基于上述评估,最终采用GPT-3.5-16k对Organic Syntheses第1-100卷(覆盖1921至2021年)进行数据挖掘。经过完整流水线处理和去重后,获得5443个唯一化合物、3961个唯一反应,其中3580个包含产率信息。

为展示该流水线对新发表文献的泛化能力,在Organic Syntheses 2025年卷所有新发表文章(29篇)上进行了测试。流水线能够从每篇文章中正确提取大部分反应信息。在标准化阶段,除无法直接以SMILES表示的分子筛外,所有其他化合物均成功转换为正确对应的SMILES表示。这些结果确认了流水线的稳健性,显示其能够从基准数据集有效泛化到新发表的化学文献。

表1|近期发表的Organic Syntheses文章的反应挖掘测试结果与评分

图5|Organic Syntheses文集文本挖掘任务的比较性能 该图展示了多种模型在四个标准指标上的比较:a. 准确率. b. 精确率. c. 召回率. d. F1分数.

与USPTO等更大型反应数据库相比,所挖掘数据集规模适中,但其价值不在广度,而在经过整理的深度。该数据集由跨越一个世纪的最具代表性和经典性的有机反应组成,并且专门纳入克级规模步骤,保证了实验稳健性和可重复性。因此,该文集可作为合成化学家的标准化参考,也可作为机器学习模型开发和验证的高保真基准。

2.3 由LLM驱动的挖掘数据化学趋势发现

为展示数据驱动发现的潜力,利用ReactionSeek从Organic Syntheses文集中创建了大规模结构化数据集。该AI就绪数据集随后作为Gemini 2.5 Pro自主分析的输入。通过设计特定提示,要求LLM从这一跨越一个世纪的汇编中揭示历史趋势,包括不对称催化的出现和多样化,以及合成中金属使用格局的变化。

在不对称催化分析中,LLM识别出此类反应在1980年之后显著增加。分析强调了过渡金属催化剂的关键作用,同时指出有机小分子催化剂和酶/生物催化体系的出现。LLM注意到硼、铜、钛、钌和钯等特定金属的广泛使用,并将其与CBS还原、金属偶联方案、不对称环氧化(如使用酒石酸钛或Ti-BINOL体系)、不对称氢化、交叉偶联反应和烯丙基烷基化等知名方法学进展相关联。此外,LLM识别出底物偏好,观察到醛和酮以及卤化物最为主要,酯和烯烃也占据重要比例。

关于金属使用趋势,LLM的分析揭示锡在特定时期的有趣高频出现,并正确将其归因于三丁基锡氢化物($ Bu_{3} $ SnH)作为温和自由基引发剂、还原剂以及Stille偶联关键组分的广泛采用。更广泛地看,LLM将Organic Syntheses中金属使用的演化划分为三个不同阶段:(1)主族金属时代(1921-1960):以格氏试剂和成盐反应为主,对金属毒性的关注较少。(2)早期过渡阶段(1961-1990):以锂/铜试剂兴起、钯催化早期发展以及汞使用下降为特征。(3)过渡金属催化黄金时代(1991-2023):以钯、钌和铑介导转化的集中增长为标志。

图6|Organic Syntheses最新文章反应的提取展示 右侧显示代表性文本挖掘输出及其对应标准化列表。散点图显示所选单篇文章中挖掘F1分数的分布。误差条表示95%置信区间。

这些由LLM识别的趋势准确反映了有机合成中从化学计量方法到催化方法、从苛刻条件到更温和条件,以及从高毒性试剂向更绿色方法转变的既定范式变化。这表明,当提供由ReactionSeek整理的结构化数据集时,LLM能够自主形成分析洞见,并开展与专家化学知识一致的趋势分析,凸显了从系统挖掘文献中进行AI辅助发现的潜力。

2.4 合成聊天机器人:对挖掘知识的交互式访问

为提升从Organic Syntheses整理所得大规模数据集的可访问性和实用性,开发了由LLM智能体驱动的交互式工具SynChat。SynChat允许使用自然语言查询历史反应数据及相关元数据,相比传统检索方法,为特定数据访问提供了更直观、更高效的方式。

聊天机器人的开发涉及对挖掘数据进行结构化,以支持LLM的有效检索。每个反应条目的关键信息(如标题、DOI、反应物、产物、SMILES、产率)被汇总并向量化到定制向量数据库中。这样,当用户提出查询时,LLM能够在向量数据库中执行相似性搜索,并从原始Organic Syntheses中检索最相关的支持文本。随后,LLM智能体基于检索信息、先前记录和推理合成答案;提示设计用于确保严格遵循来源材料,从而尽量减少生成幻觉或不准确信息的可能性。

SynChat为化学研究提供了若干优势:(1)包含分子结构的自然语言查询:它能够处理以自然语言提出并结合分子结构或反应信息的复杂查询,提高了不具备专门数据库查询语言技能用户的数据访问灵活性。(2)增强可靠性和可追溯性:通过引用Organic Syntheses文集中的具体数据来源,聊天机器人使用户能够轻松查阅原始文献,以进行验证并获取更多上下文。(3)迭代式信息检索:LLM的交互特性使用户能够在多轮对话中细化查询或提出后续问题,从而更深入探索可用信息。这一交互式工具展示了LLM如何将结构化和非结构化数据转化为动态知识资源,并将AI驱动辅助直接带入有机化学家的研究和学习流程。

图7|从Organic Syntheses数据集中进行自主知识发现 展示了Gemini 2.5 Pro基于ReactionSeek生成数据集开展的分析,数据集包含1921至2021年间的3961个反应和5443个化合物。a. 产物重原子数分布,为分子复杂性提供背景。随后,LLM识别出b. 不对称催化剂使用的历史趋势、c. 前15种金属的使用情况,以及d. 合成中金属类型随时间演化的总体趋势.

3 讨论

ReactionSeek是一种基于LLM的框架,能够有效自动化提取有机合成文献中的多模态数据,并在关键反应参数上达到超过95%的准确率。其主要创新在于精细化提示工程策略,使其无需昂贵微调即可在不同LLM中获得高准确性和适应性。该方法结合利用确定性化学信息学工具进行SMILES规范化的混合工作流程,解决了通用LLM在化学任务中已知的不可靠性。由此可见,智能提示设计是成功解析化学文本语义复杂性的关键因素。

ReactionSeek通过提供一种可扩展方法,以最少人工工作量生成高质量AI就绪数据集,从而缓解有机化学中的关键数据瓶颈。这一方法不仅支持自主的LLM驱动知识发现,例如识别Organic Syntheses文集中的历史催化趋势,还支持SynChat等交互式工具,使化学数据能够通过自然语言进行查询。因此,ReactionSeek不只是一个提取工具,也可作为下一代AI驱动化学研究的基础平台。

当前局限包括:(1)处理少见化学名称和结构仍具挑战;(2)解释分散在论文各处的复杂上下文关系仍具挑战;(3)依赖底层OCSR工具和LLM的性能。对于(1),当新合成化合物既未登记在现有数据库中,也未通过标准命名规则妥善系统化时,其结构解析面临显著挑战。对于(2),当复杂化合物关系以表格形式呈现时,ReactionSeek在实现令人满意的挖掘成功率方面仍面临挑战。对于(3),当前可用OCSR工具在R基团识别和复杂结构识别方面仍存在显著挑战。同时,LLM的发展阶段也对LLM及现有化学信息学工具的性能造成限制。未来工作将聚焦于通过更精细的提示策略增强稳健性、整合先进化学信息学工具,并扩展框架范围以捕获机理细节。将ReactionSeek扩展到聚合物科学或材料科学等相关领域,也具有广阔应用前景。

图8|SynChat:面向化学合成知识的AI驱动对话界面 检索增强生成(RAG)架构。聊天机器人后端采用RAG架构。向量化搜索首先根据用户查询识别相关合成文档。随后,将检索到的上下文提供给LLM智能体,由其形成全面且准确的回答。

总之,ReactionSeek建立了一种利用科学文献中大量非结构化知识的方法。通过协同结合LLM的上下文理解能力与领域特定工具的严谨性,框架为加速化学及更广泛领域中的数据驱动发现提供了稳健方法。