Nature 2025 | CATNIP: 连接化学与蛋白质序列空间,预测生物催化反应
今天介绍的是发表在 Nature 上的一项研究工作。针对酶与小分子底物兼容性难以预测、生物催化路线开发往往依赖大规模筛选与蛋白质工程的问题,构建了包含314种α-酮戊二酸依赖型非血红素铁酶的多样化文库,并以111种底物开展高通量反应筛选,发现215种新生物催化反应。在此基础上,BioCatSet1数据集与梯度提升模型被用于开发CATNIP工具,可由底物推荐潜在酶,也可由酶序列排序候选底物。多项实验验证显示,CATNIP能够显著缩小筛选范围,为有机合成中的生物催化反应发现与路线设计降低风险。

获取详情及资源:
0 摘要
生物催化在合成中的应用有望提供通往目标分子的精简路线、可调控的催化剂控制选择性以及可持续性更高的工艺。尽管具备这些优势,实施生物催化通常仍是一种高风险策略,因为要找到能够对合成所需特定中间体实施化学转化的酶,可能成为必须通过大规模酶筛选和蛋白质工程才能克服的障碍。由于缺少经过充分研究的生物催化反应数据集,预测酶与小分子兼容性的策略一直受到限制。化学空间与蛋白质序列空间之间的联系尚未得到充分探索,因而限制了两个空间之间的导航。为此,开展了一个两阶段项目:首先依靠高通量实验建立具有反应活性的底物—酶配对关系,随后开发CATNIP工具,用于预测与给定底物兼容的α-酮戊二酸(α-KG)/Fe(II)依赖型酶,或反向对给定α-KG/Fe(II)依赖型酶序列的潜在底物进行排序。该方法可方便地拓展至更多酶类和转化类型,并有望降低生物催化方法研究与应用的风险。
1 引言
数十年来,酶在小分子合成中的应用改变了大宗化学品的生产方式,也使复杂分子的构建成为可能。近年来,利用生物催化路线实现药物商业化生产的案例进一步凸显了设计包含关键生物催化步骤的合成策略所具有的潜力。与表现最佳的化学合成路线相比,新的酶介导药物工艺路线平均可使步骤数减少33%,并使总收率提高一倍以上。生物催化开辟目标分子新合成路线的潜力并不限于工艺化学;专注于化学酶法合成的学术团队不断积累的成果,以及酶促后期官能团化在发现化学中的应用潜力,均证明了这一点。
生物催化的常见局限之一是单个酶的底物范围难以预测,这会增加生物催化方法的开发难度。甲基、乙基和丙基等简单取代基系列通常不会使小分子催化剂表现出显著反应性差异,却可能在酶促反应中产生很大差异。因此,如果规划底物上的确切反应尚不明确,将酶促反应纳入合成路线会带来很大风险。由此,生物催化的应用往往局限于从初级或次级代谢中发现的已知反应。一旦确定初始酶-底物组合,便可通过局部探索化学空间或蛋白质序列空间获得目标反应性。例如,以环氧化物水解酶转化环氧氯丙烷的已知反应为起点,可在局部化学空间中探索并将这种反应拓展到一种新环氧化物,从而合成GSK2330672。另一种方法是通过蛋白质工程探索局部蛋白质序列空间。若干重要的蛋白质工程案例已用于药物合成,其中,为合成脑啡肽酶抑制剂沙库巴曲而改造转氨酶时,替换了26个氨基酸残基,使活性提高了500,000倍。因此,既有生物催化应用策略高度依赖已知反应,并从这些明确联系出发,在化学空间和蛋白质序列空间中开展局部探索。遗憾的是,经过实验表征其化学功能的酶所占比例极低;在已测序的酶中,获得计算功能注释的比例不足0.3%。因此,大多数酶与底物化学空间之间缺少已知联系,使科学界难以充分发掘这些催化剂的潜力。
机器学习方法能够加快生物催化反应的发现过程。例如,已有对比学习模型可预测未表征酶的酶学委员会编号,从而判断给定酶能够催化哪一类反应,但无法指向酶的天然底物,也不能提供底物范围信息。计算工具还可依据蛋白质序列预测其他性质,例如EnzymeMiner可预测蛋白质是否适合在大肠杆菌(Escherichia coli,E. coli)中异源表达。这些工具有助于指导实验探索中的初始酶选择。然而,酶注释及预测的兼容底物与实验验证结果不一致的现象已有充分记录,限制了此类工具生成计算数据集的用途。

图1|生物催化反应发现的当前技术水平 a. 既有的新生物催化反应发现方法。通过局部探索,可利用化学空间与蛋白质序列空间之间的已知联系发现新反应。环氧氯丙烷与环氧化物水解酶(EH)之间的已知反应被拓展至一种环氧化物类似物,用于合成GSK2330672。另一种方式是通过蛋白质工程探索局部蛋白质序列空间,以改善野生型(wt)氨基转移酶(ATA)对已知底物(Ar=p-联苯基)的转化;经过11轮定向进化后得到ATA-r11,突变位置以紫色表示。 b. 现有方法的局限。已表征生物催化反应性的拓展仅限于对化学空间和序列空间的局部探索,阻碍了两个空间之间跨度更大、非直观的跳跃。仍有大片底物和酶区域的生物催化反应性尚未探索,将其作为化学合成关键步骤具有较高风险。目前还没有方法可预测NHI酶超家族中的兼容酶或底物。 c. 简化生物催化反应发现的方法。利用多样化底物和蛋白质序列探索新的生物催化反应,并使用所得数据建立机器学习模型,以预测兼容的酶和底物。
为提高生物催化的可预测性,已有进展提供了在化学空间或序列空间内进行局部导航的方案。反应发现项目揭示了一些酶混杂性规律,例如使用一小组高度相似的底物分析腈水解酶文库,以及借助荧光底物研究水解酶的底物范围。还有工作整理了给定亲本酶不同变体的底物范围数据集,典型例子是利用一组小分子分析P450 BM3变体。基于此类数据集,机器学习工具能够辅助局部序列空间探索,从而识别催化活性、立体选择性、底物范围或热稳定性更优的酶变体。这些数据集只在序列空间、化学空间或两个空间的局部区域进行探索。多个酶家族中都曾开展生物催化反应预测,但既有方法在适用性和可访问性方面存在限制,包括难以向训练集之外外推,以及缺少用户友好型工具。不局限于特定酶家族的方法性能也较差,原因可能是不同蛋白质家族之间的底物选择性存在巨大差异。依赖既有数据集建立模型同样受到限制:这些数据主要来自生物合成和代谢研究,其中的酶与底物并未彼此进行实验验证,可能产生假阴性、错误注释以及导致假阳性的错误生物催化反应建议。
为了表征整个酶家族可能实现的化学转化,并降低在合成路线中纳入生物催化步骤的风险,设计了一种结合高通量实验与机器学习的双路径方案。该方案需要让从化学空间中采样的底物与代表一个蛋白质家族序列多样性的酶发生反应。获得足够的数据集后,即可建立机器学习模型,在两个空间之间进行导航,并以底物导向或酶导向的方式发现生物催化反应。这里给出了首个聚焦于α-KG依赖型非血红素铁(II)(non-haem iron,NHI)酶介导C–H官能团化反应的此类实例。实验最终发现了200多种生物催化反应,并提供了建立网络工具包所需的数据;该工具包可为氧化型生物催化转化推荐兼容的底物与酶。
在选择用作测试案例的蛋白质家族和反应类别时,目标酶类需要已经证明可用于制备规模、能够催化有价值的反应,同时在合成化学中仍未得到充分开发。因此,重点选择了使用α-KG作为共底物的一类NHI酶。从反应性看,这类酶能够从保守的自由基中间体出发实现多种化学转化,生成C–H官能团化产物和脱氢产物,并介导骨架重排,因而很有吸引力。与其他能够断裂强C–H键或对多个化学键进行氧化转化的酶相比,α-KG依赖型NHI酶还具有实际优势。例如,其他NHI亚类和细胞色素P450酶由通常需要伴侣还原酶提供的电子驱动,而α-KG依赖型NHI酶依靠小分子共底物α-KG的氧化来驱动活性氧化物种形成。这一区别使α-KG依赖型NHI反应可以采用更统一的条件,而且此类反应已证明能够放大。
为了设计能够代表该蛋白质家族序列多样性的α-KG依赖型NHI酶文库,收集了所有被注释为具有羟化酶中保守铁配位残基面三联体的序列。利用Enzyme Function Initiative–Enzyme Similarity Tool(EFI-EST),共确定265,632条与此类酶相关的独特序列。为将序列数量缩减到可管理范围,去除了冗余直系同源序列(相似度>90%)以及含有初级代谢相关酶的簇,最终得到由27,005条序列组成的序列相似性网络(sequence similarity network,SSN)。既有结果表明,SSN能够揭示黄素依赖型卤化酶家族中的序列—底物关系趋势,随后多个酶类别中的研究也显示了这种相关性。因此,从多个簇中取样,以构建底物范围广泛的蛋白质文库。最终,从序列最多的簇中选择102条序列,从注释较少的簇中选择125条未表征序列,并进一步选择87条具有已知或推定功能的酶序列,形成包含314种酶的文库aKGLib1。
在入选酶中,94种(30%)具有已知或推定的天然反应,包括羟化、脱氢、卤化、环氧化、内过氧化、去甲基化、C–C键形成和骨架重排。为尝试外推至已知活性之外,采用了酶学委员会机器学习模型CLEAN(Contrastive Learning enabled Enzyme ANnotation,对比学习增强的酶注释)。CLEAN将aKGLib1中的酶归类为氧化还原酶、转移酶、水解酶、裂合酶和异构酶,其中80%的注释置信度较低。采用更严格的比对分数阈值生成SSN后,可观察到底物类别的明显趋势。例如,当比对分数为75时,经表征可与吲哚里西啶骨架兼容的酶位于同一簇内。所有入选序列的平均序列一致性为13.7%,表明文库具有很高的序列多样性。文库DNA经合成后克隆至pET-28b(+)表达载体。利用编码各文库成员的质粒转化大肠杆菌细胞,并以96孔板形式进行过表达。对粗细胞裂解液进行十二烷基硫酸钠—聚丙烯酰胺凝胶电泳(SDS-PAGE)分析后,78%的酶在预期分子量处显示出清晰的蛋白质条带。
2 高通量生物催化反应发现
获得aKGLib1后,以高通量方式研究各酶的反应性。为了分析每种酶对不同底物的反应性,在96孔板中以50 μl规模开展反应,并使用液相色谱—质谱(LC-MS)分析。每个反应均检测与羟化、氯化、脱氢和重排产物相对应的质量。值得注意的是,每个反应均进行三次重复,并与两个阴性对照比较:(1)不含过量表达NHI酶的细胞沉淀;(2)无底物对照。
对aKGLib1中的每种酶评估了100多种候选底物,涵盖市售氨基酸、药物及其他复杂分子等多种骨架。在与完整酶文库进行反应的111种底物中,35种化合物可被aKGLib1中的至少一种酶转化,成功率为32%。此外,314种酶中有119种对至少一种受试底物表现出生物催化活性,其中74种此前未报告过活性。值得注意的是,不少在SDS-PAGE分析中未见清晰蛋白质条带的酶也表现出生物催化活性。观察到的大多数反应为羟化反应,脱氢反应约占所发现反应的20%。总计观察到215种新的生物催化反应。所发现的反应涉及结构差异显著的底物,包括大麻二酚酸丙基同系物(4)、葎草烯(12)和哈尔明碱(13)等天然产物,肉桂酸类似物(1)和松萝酸(3)等化学构件,1,8-二氮杂双环[5.4.0]十一碳-7-烯(DBU,10)等常用试剂,以及格列本脲(5)等药物。为确定化合物之间的关系,使用MORFEUS描述符对每种底物进行量化,生成21个参数,其中包括空间位阻指标(如体积、溶剂可及表面积)、电子性质指标(如HOMO和LUMO能量、亲电性)以及分子间相互作用指标(如色散描述符、电荷)。量化这些特征后,采用主成分分析表示化学空间中的化合物。aKGLib1中的酶所转化的底物在化学空间内分布广泛。最终,高通量实验在化学空间与蛋白质序列空间之间建立了数百个新联系,使开发两个空间之间导航模型成为可能。
3 从反应数据到机器学习模型
为了构建稳健的兼容性预测模型,需要尽可能增加可用于模型训练的生物催化反应数量。因此,将所发现的215种反应与aKGLib1中酶的已报道生物催化反应合并。文献反应中有8种也在反应发现实验中观察到,另有139种反应被加入数据集,形成BioCatSet1。为了把这些底物—酶配对转换为机器学习模型的输入,将反应物拆分为各自独立的组分,包括119种底物和163种酶。每种底物均以pH 7.5时的主要质子化状态转换为SMILES字符串,使用MORFEUS进行特征化,并映射到化学空间。为量化酶之间的关系,从SSN中提取比对分数,并转换为归一化值(AS%),以定量矩阵形式表示这些关系。
明确这些度量后,进一步建立了可在化学空间和序列空间之间导航的预测模型。针对合成化学应用,构建了底物到酶的推荐系统,以便针对给定底物识别新的生物催化反应。首先将每种底物映射至化学空间,并在BioCatSet1数据库内确定其10个最近邻。随后提取与每个邻近底物兼容的酶,并使用aKGLib1中最相似的10种酶填充排序模型的输出。利用完整输出酶列表或按递减顺序选取的子集(k),计算precision@k、recall@k、enrichment@k以及归一化折损累计增益(nDCG)@k。precision@k衡量列表中已知与输入兼容的条目比例;recall@k表示预测列表覆盖了输入兼容条目中的多少比例;enrichment@k将精确率与从BioCatSet1中随机取样可达到的结果进行比较;nDCG@k则是精确率的加权版本,排名越靠前的条目对总分贡献越大。理想情况下,这些指标在较小k值时应保持较高水平,表示得到的是精简排序列表。

图2|多样化α-KG依赖型NHI酶文库aKGLib1的设计依据与构建 a. α-KG依赖型C–H官能团化在天然产物生物合成中的简化催化循环与酶促转化。在α-KG依赖型酶的活性位点,铁由两个组氨酸残基与一个含羧酸盐的残基(R=Asp/Glu)或来自环境的卤离子配位(R=Ala/Gly)。α-KG结合并被空气中的氧氧化后,活性铁(IV)-氧物种可从底物中夺取氢原子,生成铁(III)-羟基物种和自由基中间体。该中间体可在经由回弹羟化、碳正离子形成或卤化终止之前发生结构重排;α-KG依赖型NHI酶在天然产物生物合成中的官能团化以绿色表示,并生成琥珀酸副产物。 b. 以生物信息学为指导构建α-KG依赖型NHI酶文库aKGLib1的流程。收集已表征的目标酶序列后,纳入蛋白质家族IPR008775、IPR005123、IPR027443、IPR026992和IPR044861。以这些家族为种子生成SSN(e-value=5,UniRef90),过滤后得到包含27,005条蛋白质序列的网络(比对分数=50,organic full布局)。从160个簇中选取314种酶(紫色),占全部序列(灰色)的1.16%,形成多样化酶文库。 c. SSN各簇中的底物趋势与aKGLib1的有效性。在比对分数为75的SSN中,包含94种此前已表征的酶(紫色菱形)和220条此前未表征的序列(淡紫色圆形,占文库总量的70%)。在含有多种已表征蛋白质的簇中,突出显示已知的共同兼容骨架。多序列一致性百分比矩阵显示,这些序列的平均共享一致性仅为13.7%。在大肠杆菌中完成转化与过表达后,通过凝胶电泳检测蛋白质,结果显示aKGLib1中78%的成员在预期分子量处出现过表达的可溶性蛋白质。
数据集和方法还可从给定蛋白质序列导航至某一化学空间区域,从而判断给定酶可能转化哪种底物。因此,还设计了互补的酶到底物模型。该方法将每种酶与aKGLib1成员比较,以识别与其最相似的序列;随后提取每种相似酶的兼容底物,并识别这些底物在化学空间中的最近邻,由此生成底物排序列表。同样,可为生成的底物预测列表计算precision@k、recall@k、enrichment@k和nDCG@k。

图3|高通量反应发现流程及所发现生物催化反应的多样性 a. 在96孔板中研究生物催化反应:将底物(DMSO中1 mM)加入含有全细胞沉淀形式α-KG依赖型NHI酶(约200 mg
生成BioCatSet1数据集、设计机器学习流程并建立评估指标后,训练了一个可在底物化学空间与蛋白质序列空间之间进行导航的高效模型。确定最合适的数据划分策略是这一过程中的关键步骤。对于基于排序列表的任务,训练—测试数据可以按底物、按酶,或同时按底物和酶进行划分。底物到酶模型按底物数据实施50/50训练集—测试集划分,酶到底物模型则按酶数据实施50/50划分。这种训练集与测试集等比例的不常见划分方式旨在避免数据集大小不均可能造成的偏差。

图4|机器学习方法、模型构建与输出 a. 将新发现的215种反应与aKGLib1酶序列的全部已报道反应合并,后者共147种,其中139种未经实验验证。对发现反应与文献反应所涉及的119种底物使用MORFEUS进行参数化,再对21项特征进行主成分分析。酶序列用于生成比对分数为5的SSN。将比对分数归一化为最大一致性百分比的分数,得到比对分数百分比(AS%)。 b. 机器学习模型可映射目标底物(深蓝色)或酶(深紫色),识别其最近邻(分别为浅蓝色或浅紫色),确定与这些最近邻兼容的酶序列(深紫色)和底物(深蓝色),并以它们的最近邻(分别为浅紫色或浅蓝色)填充排序列表。图中给出了排序列表的评估指标,并表示了在较小k值下以兼容酶和底物填充排序列表的优化目标。 c. 底物到酶(上)和酶到底物(下)排序任务中的训练集—测试集划分。底物导向模型采用底物划分,以便在不承担双重划分高数据成本的情况下引入新底物;酶导向模型同样采用酶划分。训练底物导向梯度提升模型得到最优树数量50和树深度2;酶导向模型的最优树数量为100,树深度为6。将完成参数优化的机器学习模型与基线模型比较,计算不同k值下的精确率、召回率、nDCG和富集度。GBM以实线表示,基线线性模型以虚线表示;精确率和nDCG以深绿色表示,召回率和富集度以浅绿色表示。
作为基线模型,建立了一个简单的底物到酶预测排序公式,对二维化学空间距离和蛋白质序列空间距离进行线性加权。在排序前10位的预测中,该模型富集各底物兼容酶的能力,是从aKGLib1中随机取样的4倍以上。为进一步减轻酶筛选的实验负担,需要模型在较小k值下就将兼容酶排入预测列表。优化结果表明,采用五维化学空间距离能够更稳健地计算化学相似性。为进一步提高性能,训练了使用YetiRank损失函数的梯度提升决策树集成模型(gradient-boosted model,GBM)。该模型能够处理任意复杂的关系,并在使用合适超参数时对过拟合具有较强稳健性。通过网格搜索优化树的数量和深度,最终得到包含50棵树、深度为2的模型。
随后,将底物到酶GBM的性能与基线线性模型进行比较。GBM在所有k值下的nDCG均高于基线模型。与从aKGLib1中随机取样相比,排名前10位的预测酶与输入底物兼容的概率提高了7倍以上。在较小k值(k<20)下,GBM的精确率优于基线模型,说明GBM最适合生成聚焦的酶预测列表。因此,最终工作流程采用GBM。特征重要性分析显示,主要由两个偶极矩参数和离核性构成的PC3对模型权重最大,其次为PC1(主要由色散描述符、溶剂可及表面积和体积构成)以及比对分数百分比。
完成上述模型开发后,进一步训练了酶到底物预测排序模型。基线模型采用五维化学空间距离,并将最近邻计算扩展到训练集的序列空间和整个化学空间。以k=10时的nDCG为依据优化GBM超参数,得到包含100棵树、深度为6的模型。完成这些优化后,在不同k排名下分别测量精确率、召回率、nDCG和富集度。尽管基线模型与GBM在这些指标上的差异很小,结果仍显示GBM方法即便在具有挑战性的场景中也具备通用性。
4 CATNIP:用于预测生物催化反应的网络应用
构建两个机器学习模型后,开发了一个界面,使其他用户能够获取α-KG依赖型NHI酶与小分子底物之间的预测结果。CATNIP(https://catnip.cheme.cmu.edu/ ) 是一个可直接使用底物到酶和酶到底物模型的网络平台。在底物导向模型中,用户可输入化学结构,获得可能转化目标底物的aKGLib1酶及其相应序列的排序列表。利用酶到底物模型,用户还可了解NHI酶的潜在小分子底物。在模型中,用户可提交一条蛋白质序列,并获得可能与之兼容、且超出训练集和测试集范围的小分子排序列表。借助CATNIP提供的信息,可开展一组高度聚焦的实验,以识别新的生物催化反应性。机器学习由此能够有效降低生物催化在目标导向合成中实施的风险。
首先利用市售植物生物碱金雀花碱(16,训练集)测试CATNIP的底物到酶工作流程。金雀花碱(16)被映射到化学空间后,CATNIP从BioCatSet1中确定了10个最近邻底物,包括高度修饰的含氮杂环,具体为一种哌啶、一种双环脒、五种吲哚里西啶和三种四环二胺。这些邻近底物被输入机器学习模型,生成由4条已表征酶序列和6条此前未表征序列组成的酶排序列表,并分别与金雀花碱(16)进行反应测试。LC-MS显示,所开展的10个反应中有7个生成了羟化产物。分析规模下产物生成量最大的酶被用于50 mg规模反应,最终以35%的分离收率获得羟化产物17。
CATNIP对更多受试底物也取得了类似效果。例如,matridine(18,训练集)是一种用于合成苦参碱类天然产物的合成前体,在排名前10位的预测酶中,有7种可使其发生羟化。通过50 mg规模反应,以50%的收率分离得到(12S)-羟基matridine(19)。此外,在预测可转化6-亚甲基雄甾-4-烯-3,17-二酮(20,测试集)的前10种酶中,有7种产生有效反应。在制备规模下,底物20以12%的收率转化为氧化性烯烃裂解产物21。这是已知首个由α-KG依赖型NHI酶执行此类氧化性烯烃裂解的实例。机器学习模型和预测流程建立后,又有该类酶的新反应陆续得到报道,为CATNIP提供了额外测试案例。例如,实验确定可与该文库内酶兼容的小分子,与CATNIP底物到酶模型的输出一致。
酶到底物模型以类似方式进行测试。输入粟酒裂殖酵母(Schizosaccharomyces pombe)的NHI123(测试集)序列后,使用Clustal Omega识别aKGLib1中与其最相似的10种酶。随后提取与这些酶相关的底物,从而了解可能与这些序列兼容的化学空间区域。排名前10位的底物主要由含氧单环和双环分子构成,随后被用于NHI123反应测试,其中4种底物被NHI123氧化。排名第一的预测底物22被NHI123转化为单一产物,转化率为7%。同样,来源于Photorhabdus thracensis的NHI177(测试集)排名第一的底物葎草烯(12),可被NHI177转化为单一氧化产物,转化率为41%。为测试模型对BioCatSet1以外酶的准确性,将来源于Streptomyces violaceusniger的TqaL(外部验证)提交至CATNIP,以确定可能与输入酶序列兼容的化学空间区域。排名前12位的底物分别与TqaL进行分析规模反应,其中4种被氧化;排名第二的底物23可形成氧化产物,转化率为42%。尽管该酶没有已表征活性,但它与一种可作用于类似氨基酸底物的已表征酶同源,进一步支持了模型的性能。
5 结论
总体而言,工具包提升了在化学空间与蛋白质序列空间之间导航的能力。具体而言,构建了多样化NHI酶文库aKGLib1,其中包含300多种序列一致性较低的野生型蛋白;通过针对100多种小分子底物分析这些酶的生物催化活性,发现了215种新反应。该数据集与文献报道的反应合并形成BioCatSet1,用于训练两个GBM,并分别输出底物到酶和酶到底物的排序列表。在这些模型基础上,建立了开放访问的CATNIP网络界面,以简化生物催化反应发现流程。利用数据集之外的底物和酶快速发现生物催化反应,验证了这些工具的能力。新反应在化学空间与蛋白质序列空间之间建立了新的联系,并为通过底物工程和蛋白质工程进一步探索这两个空间创造了机会。该方法可广泛应用于更多酶家族和反应类别,为化学空间与蛋白质序列空间之间的导航提供通用方案,并有效降低有机合成中应用生物催化剂的风险。

图5|CATNIP中机器学习模型的应用 a. 利用金雀花碱(16)、matridine(18)和6-亚甲基雄甾-4-烯-3,17-二酮(20)展示CATNIP底物到酶模型。化学空间图显示目标底物(空心黑色圆圈)、五维空间中的最近邻底物(深蓝色圆圈)、BioCatSet1中未选中的底物(浅蓝色圆圈)以及没有已知生物催化活性的底物(灰色圆圈)。序列空间显示簇内的全部酶(比对分数为75的SSN)和预测的兼容酶(k=10),排名由深至浅的紫色表示;未进入预测前10名的酶以灰色节点表示。将预测排名前10位的酶序列制备成大肠杆菌全细胞,并通过三次重复实验检测相对产物生成量。x轴表示酶预测排名,其中X为无酶对照;y轴表示平均相对提取离子计数(n=3)。多种产物以不同深浅的绿色表示。随后以1 l Terrific Broth培养物制备产物生成量最大的酶,并以澄清细胞裂解液用于50 mg规模的生物催化反应。三种目标底物的氧化产物经分离和表征后,分别以35%、50%和12%的分离收率得到(4S)-羟基金雀花碱(17)、(12S)-羟基matridine(19)和雄甾-4-烯-3,6,17-三酮(21)。 b. 利用NHI123、NHI177和TqaL展示CATNIP酶到底物模型。每种酶均被映射至序列空间,其中显示簇内的全部酶(比对分数为75的SSN),并以由深至浅的紫色表示10种最相似酶;未进入前10位的酶以灰色节点表示。识别预测兼容底物(深蓝色),并将其与BioCatSet1中的全部底物(浅蓝色)及数据集之外的底物(灰色)共同映射至化学空间。利用目标酶对排名最高的底物进行三次重复测试,并测量相对产物转化率。x轴按递减顺序表示小分子底物排名;y轴表示相对于各样品空载体对照的平均归一化相对转化率(n=3)。每种酶排名最高的底物结构依次标为22、12和23。