NC 2025 | LassoESM: 提升套索肽性质预测的定制语言模型
今天介绍的是发表在 Nature Communications 上的一项研究工作。该工作面向套索肽工程中实验数据有限、底物适配规则复杂和活性预测困难等问题,提出了面向套索肽定制的蛋白语言模型LassoESM。该模型通过在套索肽数据集上继续预训练ESM-2,生成更适合套索肽序列的嵌入表示,可用于预测套索环化酶底物耐受性、发现非天然环化酶-底物组合,并提高RNA聚合酶抑制活性预测效果。结果显示,LassoESM在小样本场景下仍能保持较好预测性能,为定向设计具有特定功能的套索肽提供了新的计算工具。

获取详情及资源:
0 摘要
核糖体合成并经翻译后修饰肽(ribosomally synthesized and post-translationally modified peptides,RiPPs)是一类多样化天然产物。作为RiPPs的一类,套索肽由套索环化酶形成独特的单轮烷构象,因而具有多样生物活性和显著稳定性。由于实验数据有限且底物适应性景观复杂,套索肽性质预测仍具有挑战性,例如预测特定套索环化酶的底物兼容性,或预测期望的生物活性。
为此,开发了LassoESM,一种可提升套索肽性质预测效果的定制语言模型。LassoESM嵌入可准确预测底物兼容性,促进新型非天然环化酶-底物配对的识别,并提升RNA聚合酶抑制活性预测能力;RNA聚合酶抑制活性是若干已知套索肽的重要生物活性。LassoESM及其后续迭代有望成为理性设计和发现具有定制功能套索肽的重要工具。
1 引言
核糖体合成并经翻译后修饰肽(RiPPs)是结构多样的天然产物。RiPP前体肽由基因编码,许多生物合成酶能够耐受替代底物,因此RiPPs成为多种医学和其他应用中的有吸引力工程化对象。套索肽因其可修饰且稳定的套索结样结构,成为RiPP工程中尤其有前景的支架。在套索肽生物合成过程中,前体肽首先由RiPP识别元件结合,随后前导肽酶释放底物的核心区域,并使其转化为成熟产物。随后,ATP依赖性套索环化酶将核心肽折叠为其特征性的穿环形状,并通过大环内酰胺形成而在动力学上固定。N端胺基(核心位置1)与Asp或Glu侧链形成大环内酰胺;该Asp或Glu通常位于核心位置7、8或9,而尾部大体积残基则作为空间锁,维持穿环构象。套索肽主要来源于细菌,少数情况下也来源于古菌。在真核生物中,已有蛋白质中套索样基序被识别出来,这些结构由二硫键或酰胺键稳定。然而,这类蛋白不应与套索肽混淆,因为套索肽共享相同折叠方式、右手性,并且分子量通常低于2 kDa。
若干套索环化酶表现出很高的底物耐受性。例如,fusilassin环化酶(FusC: WP_104612995.1)经统计显示能够环化数百万种环区发生多位点变化的变体;microcin J25环化酶(McjC: WP_256498469.1)也可容纳多种单点和多点变化。此外,套索肽具有抗菌、抗病毒和抗癌活性,因此是用于药物发现中大环肽工程化的有吸引力支架。尽管套索肽具有潜力,其化学合成仍然具有挑战性,目前仅有一项尚未被重复的报道。因此,设计具有期望生物活性的新型套索肽,需要获得可与现有套索环化酶兼容的序列。然而,表征套索肽生物合成酶的底物耐受性仍然困难,限制了面向生物医学和其他工业应用的定制套索肽生成。

图1|LassoESM:一种针对Lasso肽的特异性语言模型的开发 A Lasso肽的生物合成需要前导肽酶、RiPP识别元件(RRE)以及将线性核心肽环化形成套索结结构的套索环化酶。B LassoESM基于ESM-2架构构建,并采用领域自适应方法,通过掩码语言模型在Lasso肽数据集上进行进一步预训练。所得LassoESM嵌入表示被用于三个下游任务:预测套索环化酶底物耐受性、鉴定套索环化酶与底物肽之间的底物兼容性,以及预测RNAP抑制活性(数字表示富集值,用于估计RNAP抑制活性)。
不同计算方法可用于发现和设计新型套索肽。例如,RODEO通过线性组合评分和监督机器学习方法,预测与套索肽生物合成酶近邻编码的天然前体肽。RODEO能够匹配底物与酶,但并不尝试预测某种生物合成酶是否能够耐受替代肽底物。此外,RODEO仅在较小局部基因组上下文中预测前体肽及其相关生物合成酶,因此无法识别潜在的杂合肽-酶配对。分子动力学(molecular dynamics,MD)模拟是研究套索肽或其他RiPPs如何折叠,以及其在折叠过程中如何与生物合成酶相互作用的有力计算方法。然而,MD模拟计算成本高,限制了其在大规模定制具有期望性质套索肽中的适用性。此外,近期已有生物物理建模框架被提出,用于通过系统组合多样RiPP基因簇中的酶来指导从头RiPP设计与生物合成。
深度学习是一类能够从大规模数据集中学习复杂模式和特征的人工智能方法,已成为RiPP工程和设计中的有用工具。例如,基于mRNA展示技术获得的大规模RiPP修饰酶底物特异性谱数据,已有深度学习模型完成训练。这些模型促进了对RiPP酶底物耐受性的理解,并支持设计多样且高度修饰的变体文库,用于针对靶标进行选择。除底物耐受性预测外,深度学习还被用于预测RiPP变体文库的生物活性。例如,DeepLasso可预测套索肽ubonodin变体是否保留RNA聚合酶(RNA polymerase,RNAP)抑制活性。 模型展示了人工智能在套索肽生物合成中除底物兼容性预测之外的应用价值。然而,这些方法需要异常庞大的数据集用于模型训练。在多数情况下,定义套索肽底物耐受性和生物活性的实验数据极其有限,因此需要能够在数据稀缺场景中表现良好的方法。
蛋白语言模型(protein language models,PLMs)是在标注数据有限情境下提升下游任务性能的有力框架。多数PLMs采用掩码语言建模训练,即模型根据局部氨基酸序列预测被掩盖氨基酸的身份。PLMs已被用于提升蛋白结构、蛋白性质和突变效应预测。有效PLMs通常需要海量训练数据集和较大模型规模,以学习天然蛋白中存在的一般模式。然而,PLMs主要在蛋白序列而非肽序列上训练,其表征肽的能力仍缺乏充分研究。由于肽与蛋白在物理特征上存在差异,例如长度更短、三维结构更简单且构象动态不同,PLMs可能难以准确表征肽序列,尤其是具有独特结样形状的套索肽。因此,使用PLMs执行套索肽相关预测任务在逻辑上可能并不匹配。既往结果表明,领域自适应预训练能够通过学习特定领域知识,进一步提升大语言模型在领域内的性能。例如,在DNA结合蛋白序列上进行预训练,可提高模型在四项DNA结合蛋白相关下游任务中的性能。类似地,在聚焦某一种酶底物偏好的数据集上预训练,可准确预测哪些底物将与同一生物合成通路中的另一种酶兼容。由于RiPP类别多样且序列属性独特,类别特异性RiPP语言模型可能进一步提升下游预测任务。
采用领域自适应方法在套索肽数据集上继续预训练ESM-2(Evolutionary Scale Modeling),得到面向套索肽定制的语言模型LassoESM。与更通用的ESM-2相比,即使训练数据量较小,LassoESM在预测已知套索环化酶底物耐受性方面也表现更好。采用人工参与闭环方法进一步验证并改进分类模型;在方法中,人工专家迭代验证新的未见序列,并将其纳入训练数据。为预测兼容的套索环化酶-底物肽配对,LassoESM嵌入与交叉注意力层结合,以有效建模套索环化酶与肽之间的相互作用,相较仅使用通用PLM可获得更好模型性能。最后,LassoESM嵌入在预测套索肽RNAP抑制活性方面,比通用PLM和DeepLasso更加准确。随着套索肽性质数据集的扩展,LassoESM有望通过指导理性工程化中的套索环化酶选择,促进套索肽的生物医学应用。
2 结果
2.1 LassoESM提升套索肽底物耐受性预测
ESM和ProtBERT等代表性PLMs已在通用蛋白序列上训练,能够以自监督方式学习天然蛋白中的序列模式。与一般蛋白相比,套索肽更短,通常包含15-20个氨基酸,并具有独特的套索结样结构。开发套索肽特异性语言模型有望增强套索肽表征能力,并提升下游预测任务性能。为解决这一问题,采用包含6.5亿参数的ESM-2架构作为起点,并在RODEO识别出的4485条独特高评分套索核心肽数据集上继续训练。通过掩码语言建模方法,开发了面向套索肽的专门语言模型LassoESM。预训练PLMs可通过迁移学习增强基于序列的蛋白性质预测,即将其学习到的权重和表示重新用于下游任务。工作将LassoESM嵌入用于多种套索肽相关下游预测任务,包括预测套索环化酶底物耐受性、识别非天然环化酶-底物肽配对,以及预测套索肽RNAP抑制活性。
既往结果显示,FusC会根据具体变化的核心位置,表现出从广谱耐受到高度不耐受的不同底物耐受性。然而,支配底物兼容性的规则仍缺乏充分理解,因此底物耐受性预测具有挑战性。通过无细胞生物合成(cell-free biosynthesis,CFB),共确认1121种fusilassin(FusA,也称fuscanodin)变体为底物或非底物序列。数据集用于评估LassoESM能否改善FusC的底物耐受性预测。上述fusilassin变体序列均未用于LassoESM训练。LassoESM为全部1121条序列生成的嵌入被输入多种下游分类模型,包括随机森林(Random Forest,RF)、Adaptive Boosting(AdaBoost)、支持向量机(Support Vector Machine,SVM)和多层感知机(Multi-Layer Perceptron,MLP)。通过10折交叉验证进行超参数优化,并使用AUROC分数和平衡准确率评估下游分类器性能。此前开发的PeptideESM是一种在150万条独特肽序列上训练的肽特异性语言模型,因此也评估了PeptideESM嵌入在套索肽底物耐受性预测中的表现。在这些模型中,SVM表现最佳。跨多种下游分类模型比较时,PeptideESM和LassoESM相较通用PLM(VanillaESM)以及one-hot基线表示方法,可为FusC底物特异性预测提供更优嵌入。为可视化这些嵌入捕获的底物与非底物序列分离情况,采用t-SNE将其投影至二维空间。还将LassoESM嵌入与四种额外表示方法进行比较,包括PeptideCLM(一种基于SMILES的化学语言模型)、扩展连通性指纹(Extended-Connectivity Fingerprints,ECFP)和两组生物物理描述符,以全面评估其在底物耐受性预测中的有效性。
Microcin J25(MccJ25)是一种不同的套索肽,其生物合成酶据报道具有很高的底物耐受性。文献中已有552种MccJ25变体被实验评估为底物或非底物。这些MccJ25变体序列均未用于LassoESM训练。与fusilassin类似,在预测McjC底物耐受性时,LassoESM显著优于VanillaESM和one-hot编码,且SVM表现最高。这些结果表明,LassoESM能够提供有效表示,从而提升FusC和McjC这两种差异显著的套索肽环化酶的底物耐受性预测准确率;二者序列一致性仅为22%。
在下游分类任务中使用语言模型嵌入的优势之一,是其能够在数据稀缺设置下提高准确性。LassoESM专门在套索肽序列上预训练,学习了该肽类特有的序列特征,因此能够生成信息量较高且有效的表示。使其在标注数据集有限的应用中尤其有价值。在许多生物化学任务中,包括RiPP生物合成酶兼容性预测,由于序列空间规模极其庞大,通常缺乏大规模且充分注释的数据集。因此,使用LassoESM嵌入,评估了最佳下游分类模型SVM在不同规模训练数据集上的准确性。对于每种训练数据集大小,在不同随机种子下进行10次随机样本选择,并在剩余数据样本上评估AUROC分数和平衡准确率。即使仅使用20%的训练数据集(224个样本),平均AUROC分数仍为0.78,平均平衡准确率为0.71。

图2|使用不同嵌入表示对套索肽底物耐受性预测的比较 A 使用底物耐受性信息标注的fusilassin核心肽序列。n值表示在指定位置测试的序列数量。CFB表示在给定位置可耐受的n个序列比例。粗体表示形成大环结构的残基。B 基于不同嵌入表示训练的SVM模型对fusilassin变体数据集的AUROC得分和均衡准确率,包括one-hot编码(蓝色)、VanillaESM(粉色)、PeptideESM(黄色)和LassoESM(绿色)。数据表示为均值 ± 标准差。n = 5次独立10折交叉验证重复实验。VanillaESM与PeptideESM:AUROC,p = 0.0377;均衡准确率,p = 0.0012。VanillaESM与LassoESM:AUROC,p = 0.0006;均衡准确率,p = 0.0119。p值通过双侧t检验计算。P < 0.05,**P < 0.01,***P < 0.001。C 使用底物耐受性信息标注的McjC核心肽序列。每个位置在进行异源表达前,均使用其他所有蛋白源氨基酸进行位点饱和突变(n = 20)。给出了完成环化并成功表达的序列比例。粗体表示形成大环结构的残基。D 与B相同,但底物为McjCj25。数据表示为均值 ± 标准差。n = 5次独立10折交叉验证重复实验。VanillaESM与PeptideESM:AUROC,p = 0.8759;均衡准确率,p = 0.7751。VanillaESM与LassoESM:AUROC,p = 0.0006;均衡准确率,p = 0.0013。p值通过双侧t检验计算。E 使用LassoESM嵌入表示训练的SVM模型,在fusilassin变体训练数据集上训练,并在剩余数据上进行评估,展示AUROC得分和均衡准确率。数据表示为均值 ± 标准差。n = 10个随机种子,每个种子随机选择部分数据集用于训练。F 使用LassoESM嵌入表示训练的SVM模型,在fusilassin变体数据集上不同预测概率下的模型准确率。数据表示为均值 ± 标准差。n = 10个随机种子。对于每个随机种子,80%的fusilassin变体数据用于训练,剩余20%用于测试。
结果表明,当使用定制语言模型嵌入时,分类模型即使在小数据集条件下也能表现良好。不过,使用更多样化样本扩展数据集可进一步提升模型性能。在分类任务中,预测概率通常被解释为模型不确定性的度量。然而,SVM输出的是样本到决策超平面的距离,而不是概率。为解决这一问题,通常采用Platt缩放,即对SVM决策值应用逻辑回归模型,从而将距离有效转换为0到1范围内的概率估计。这些概率表示序列成为套索环化酶底物的可能性。为评估这些预测概率是否有效捕获了在fusilassin数据集上训练的下游分类模型的不确定性,分析了不同概率范围内的模型准确率分布。具体而言,绘制了基于LassoESM嵌入和fusilassin变体序列训练的SVM模型准确率分布。结果显示,当预测概率接近0或1时,模型准确率较高。相反,当概率位于0.4到0.6之间时,错误分类比例更高。该结果提示,预测概率能够较好反映模型不确定性。

图3|模型准确性的实验验证与优化 A 用于优化fusilassin环化酶底物耐受性模型的人机协同工作流程。训练数据序列的嵌入表示由LassoESM提取。利用这些嵌入表示训练分类器,随后预测未见过的文库序列标签。通过CFB和MALDI-TOF-MS进行实验验证。标注数据随后反馈至工作流程中,以提升模型准确性。B 用于验证未知序列的实验方法。使用CFB生成所选择的fusilassin变体序列,并通过MALDI-TOF-MS进行分析。C 三轮实验测试中所选样本的均衡准确率。
2.2 人工参与闭环反馈改善fusilassin底物特异性预测
接下来,评估了LassoESM对未纳入训练集序列的底物耐受性预测准确性。人工参与闭环验证是一种由人工专家与人工智能共同参与决策的策略,通过监督与迭代反馈提升模型准确性和可靠性。工作流程首先使用经优化的SVM对新序列进行分类;SVM基于来自初始1121条fusilassin变体序列的LassoESM嵌入训练。SVM模型预测未表征fusilassin变体的标签,即底物或非底物。随后对选定序列进行实验验证,并将新标注数据纳入训练集以重新训练模型。迭代过程持续进行,直至模型达到期望性能。
包含fusilassin全部18个随机化位点的文库具有
使用基于LassoESM嵌入训练的SVM模型,将全部文库序列分类为底物或非底物。随机选择118条fusilassin变体序列(第1轮)进行实验验证,其中57条来自文库1,61条来自文库2;验证体系为含纯化fusilassin生物合成酶的CFB。利用MALDI-TOF-MS分析套索肽环化情况。第1轮平衡准确率为66%。这一结果突出了基于LassoESM嵌入的分类模型外推能力,因为即使未见过文库1和文库2中的序列,模型仍表现良好。
为进一步提高模型性能,引入人工参与闭环方法。第1轮结果被纳入初始训练数据集。使用LassoESM为新数据生成嵌入,并在全部可用数据上重新训练SVM分类模型。为验证重新训练模型的准确性,从每个文库中随机选择24条序列(第2轮,
随后,将第1轮和第2轮获得的实验标注数据纳入训练数据集,并使用重新训练的SVM模型预测更复杂的文库(文库3);该文库改变位置10-15,以覆盖整个fusilassin环区,文库规模为6400万。随机选择30条来自文库3的fusilassin变体序列,并使用CFB评估。对于这些序列,模型达到84%的平衡准确率。较高准确率进一步表明,借助LassoESM嵌入,训练后的SVM模型即使面对初始训练数据集中代表性不足的序列,也能表现出稳健预测准确性。相关测试轮次中CFB检测的总序列数和模型平衡准确率已进行汇总。
为进一步提升可解释性,提供了若干模型预测及其实验验证的代表性示例。所有轮次合计测试196种fusilassin变体。与此前实验观察一致,Met在环区受到偏好,而Glu不受偏好。在环区之外的loop区域,位置14偏好Leu,而不偏好Asp。这些偏好体现在经实验验证的序列中。例如,WLMMEWGLELIFHLPRFI被正确预测并确认为底物,而WIENEWGLELIFVDPRFI被预测并验证为非底物;加粗残基为不同于天然fusilassin序列的残基。这些示例表明,模型不仅能够提供准确预测,还能捕获与底物耐受性相关的已知序列-功能关系。
2.3 预测套索环化酶-套索肽配对的通用模型
LassoESM嵌入也可有效预测更一般的套索环化酶特异性任务。例如,可在计算中筛选多样化套索肽,或通过理性工程化使其结合目标靶标。然而,广泛工程化可能会模糊哪一种套索环化酶能够产生期望套索肽。因此,设计了一个通用模型,用于预测任意套索环化酶-套索肽配对。采用RODEO预测的6599个独特套索环化酶-套索肽配对作为训练数据。为构建负样本,通过随机错配环化酶和肽配对,生成相同数量的非天然环化酶-套索肽配对。由于大多数已表征套索环化酶仅对一种受体残基具有特异性,负训练集中的所选套索肽被确认与天然底物具有不同受体残基。该数据集总计包含6333种独特环化酶,其中大多数环化酶仅有一个真实肽底物和一个错配肽底物。例如,FusC在数据集中出现两次,一次与其真实底物配对,一次与错配肽配对,仅占总数据集的0.015%。

图4|环化酶-肽对预测的架构与评估 A 模型架构采用VanillaESM用于环化酶嵌入表示,采用LassoESM用于套索肽嵌入表示,并引入交叉注意力层以捕获二者之间的相互作用。套索环化酶和肽的注意力加权嵌入表示经过平均处理后进行拼接,并输入MLP模型以预测环化酶兼容性。训练后的模型用于预测其他套索肽与FusC之间的兼容性。B 模型准确率在四种数据集划分方式(随机、未知环化酶、未知肽以及未知环化酶与肽)下进行评估。数据表示为均值 ± 标准差。n = 3个随机种子用于数据划分。C 在不同环化酶序列相似性条件下评估模型准确率。测试集根据与训练集序列的最大相似性划分为不同子集。每个柱状图表示特定相似性范围内环化酶的准确率。D 消融实验用于评估交叉注意力层和LassoESM嵌入表示对通用模型准确率的影响。数据表示为均值 ± 标准差。n = 3个随机种子用于数据划分。
通用模型使用VanillaESM提取套索环化酶序列嵌入,并使用LassoESM提取套索肽序列嵌入。与将两种嵌入分开处理后直接拼接不同,模型使用交叉注意力层来有效捕获套索环化酶与套索肽之间的相互作用。交叉注意力层强调套索环化酶中可能与套索肽底物相互作用的氨基酸,从而降低噪声并增强模型关注重点。模型性能在四种不同条件下评估:随机、未见环化酶、未见肽,以及未见环化酶且未见肽。在随机条件下,数据集被随机划分为70%训练集、15%验证集和15%测试集,准确率为0.8870。其他三种条件模拟分布外场景,即训练集和测试集不共享环化酶或肽序列。具体而言,在未见环化酶场景中,测试集中的所有环化酶均未出现在训练集中;在未见肽场景中,测试集中的肽均未出现在训练集中。最严格的条件下,测试集中的环化酶和肽均完全不出现在训练数据中,从而严格评估模型泛化性能。在该条件下,模型准确率达到0.8281,显示其对分布外数据具有可靠且较强的预测性能。
RODEO预测的天然套索环化酶呈现不同程度的序列相似性,数据集中的平均两两序列一致性为42%。为确定模型准确率是否与环化酶序列相似性相关,计算了每个测试环化酶相对于训练集中所有环化酶的最大两两序列一致性。结果显示,随着测试环化酶与训练集环化酶之间序列一致性升高,模型准确率提高。对于与任一训练环化酶序列一致性超过50%的测试环化酶,准确率超过0.85。当序列一致性超过70%时,模型性能保持相对稳定。
为评估模型架构中关键组件的作用,进行了消融分析。移除交叉注意力层后,准确率从0.8870降至0.8673,表明交叉注意力层有助于提升模型性能。与对所有氨基酸进行平均池化的模型相比,交叉注意力层增强了模型聚焦于决定酶底物特异性氨基酸的能力,从而降低环化酶中非关键氨基酸引入的偏差。
使用VanillaESM而非LassoESM表示套索肽,也导致模型准确率显著下降。这说明LassoESM在预测套索肽环化酶特异性方面具有有效性。还观察到,当使用同一种语言模型同时为套索环化酶和套索肽生成嵌入时,交叉注意力层无法学习有用信息,模型性能并不优于简单拼接嵌入。
为评估LassoESM在经实验验证的环化酶-套索肽配对上的表现,使用训练后的模型预测FusC与其他预测天然套索肽的兼容性。这些序列通过嵌合工程策略进行测试,即将fusilassin前导肽与所选核心肽融合。该策略可使RiPP识别元件和前导肽酶正常发挥功能,而二者是完整环化酶活性所必需的。该集合包含一些此前考察过的嵌合肽,这些肽基于与FusC的环化酶相似性选择;同时还包含Glu8-mer和Glu9-mer核心肽,这些核心肽在保持此前显示为FusC偏好的loop疏水性的同时,尽可能最大化序列多样性。尽管FusC在训练集中的代表性较低,模型仍成功预测了35个测试肽配对中的24个,准确率为69%,并正确识别全部三个FusC兼容肽。值得注意的是,模型对FusC兼容肽给出的预测概率均超过0.7,表明置信度较高。由于CFB中环化酶与内源性蛋白酶之间存在竞争,11个预测错误的肽中有部分可能是弱底物,在纯体系中或许能够被检测到。然而,使用基于细胞提取物的CFB测试序列速度较快,成本显著低于纯无细胞体系,并且更准确反映大规模套索肽生产所需的异源表达条件。
2.4 ubonodin和klebsidin变体的RNA聚合酶抑制预测
除将LassoESM嵌入应用于环化酶特异性预测外,还评估了其在RNAP抑制预测任务中的表现。此前高通量筛选研究探索了ubonodin变体的RNAP抑制活性,并开发出深度学习模型DeepLasso,用于预测RNAP抑制活性。VanillaESM、PeptideESM和LassoESM被用于提取8885条文献报道的ubonodin变体序列嵌入,并训练MLP回归器预测富集值;富集值作为RNAP抑制活性的估计。数据集在10个随机种子下随机划分为训练集(70%)、验证集(15%)和测试集(15%)。LassoESM嵌入模型取得最佳性能,Pearson和Spearman相关系数分别为0.83和0.78。LassoESM获得的平均绝对误差(mean absolute error,MAE)为1.31,低于DeepLasso报告的MAE 2.20。DeepLasso以套索肽序列和拓扑信息作为输入,训练由三层卷积神经网络、两层双向长短期记忆网络和一层注意力层组成的模型。这些结果显示,LassoESM嵌入使简单的两层MLP架构即可获得更优模型性能。为进一步评估模型泛化能力并减轻潜在数据泄漏,还实施了基于位置的数据划分策略,确保训练集中出现的突变位置不出现在测试集中。该方法通过消除训练集与测试集之间的序列上下文重叠,形成更严格评估。值得注意的是,即使在这一更严格设置下,LassoESM模型仍优于VanillaESM和PeptideESM。

图5|使用不同嵌入表示对RNA聚合酶抑制活性预测的比较 A ubodinin的气泡图。B–D 使用不同嵌入表示预测ubodinin变体数据集中RNA聚合酶抑制活性的MLP回归模型性能,包括VanillaESM(粉色)、PeptideESM(黄色)和LassoESM(绿色)。蓝色柱状图表示DeepLasso的性能。数据表示为均值 ± 标准差。n = 10个随机种子用于数据划分。VanillaESM与PeptideESM:Pearson相关系数,p = 0.2425;Spearman相关系数,p = 0.0368;平均绝对误差,p = 0.1616。VanillaESM与LassoESM:Pearson相关系数,p = 6.1804 ×
类似地,LassoESM嵌入还被用于另一种套索肽klebsidin,以预测其变体的RNAP抑制活性。从既往报告中收集了340条带有富集值的klebsidin单点变体序列。通过搜索最佳回归模型,在klebsidin数据集上训练了AdaBoost回归器。即使数据集有限,LassoESM嵌入仍使Pearson和Spearman相关系数达到约0.80,MAE约为0.74。相较VanillaESM嵌入,这些结果表现出显著改善,包括Pearson相关性提高9%、Spearman相关性提高7%,以及MAE降低14%。
3 讨论
套索肽因其显著稳定性和多样生物活性,被视为药物开发中有前景的支架。许多套索肽生物合成酶表现出令人印象深刻的底物耐受性,使具有期望性质的新型套索肽从头设计或理性工程化成为可能。然而,由于实验标注数据稀缺,预测底物耐受性并探索序列-活性关系仍然具有挑战性。工作利用语言模型提升套索肽相关性质预测。为更好捕获套索肽特征,开发了套索肽特异性语言模型LassoESM。模型在多种下游任务中优于通用PLM,包括预测套索环化酶底物耐受性、识别非天然但兼容的环化酶-底物配对,以及预测RNAP抑制活性。结果还显示,LassoESM嵌入即使在小训练集条件下也能实现准确预测,突出了语言模型在解决数据稀缺和提高预测准确率方面的潜力。预训练LassoESM能够为套索肽提供更优表示,并且随着用于生成数据集的高通量方法发展,将在多种套索肽相关任务中具有特别价值。
既往研究表明,ESM-2能够识别并存储序列基序,即蛋白中常共同出现的特定氨基酸模式。由于LassoESM在套索肽序列上预训练,因此LassoESM很可能学习到了识别套索折叠模式。相反,VanillaESM在训练期间未获得所需序列,因此没有学习到这些特定序列模式。因此,LassoESM在套索肽相关预测任务中优于VanillaESM的潜在原因,可能是该定制语言模型能够学习套索折叠。
虽然计算流程成功表征了套索生物合成酶的底物偏好,但区分底物与非底物的分子机制仍不清楚。MD模拟为揭示这些机制提供了有前景的路径,可从结构和动态角度定位支配底物选择性的关键氨基酸。然而,MD模拟的有效性取决于是否拥有套索肽及其生物合成酶的准确结构信息。近期套索肽结构预测进展显著增强了对这些体系建模的能力。例如,LassoHTP是一种可从输入序列以及环区、loop区和尾区注释中构建并建模套索肽结构的软件工具。在此基础上,LassoPred作为基于网络的工具被提出,具有注释器-构建器架构。在工具中,注释器最多预测三组序列注释,构建器则将每组预测注释转换为3D套索样结构。除获得准确结构模型外,定义最优反应坐标对于应用增强采样方法、有效捕捉套索肽折叠过程也至关重要。总体而言,新认识和技术进展为未来利用MD模拟深化理解套索生物合成酶底物选择性奠定了基础。
总之,开发了一种面向套索肽定制的语言模型,可为套索肽提供有效表示,并增强套索肽相关预测任务。用于表征套索肽生物合成酶底物偏好并识别套索环化酶-套索肽配对的高效流程,是化学领域理性设计功能性且生物相容套索肽的有力工具,可服务于多种生物医学和工业应用。未来,该流程可扩展至预测生物合成基因簇(biosynthetic gene clusters,BGCs)中其他酶的兼容序列,包括负责套索肽核心序列二级修饰的酶,例如糖基化、天冬酰亚胺形成和联芳基交联。