SA 2026 | CryptoBank: 用于蛋白质隐蔽位点识别与预测的资源库
今天介绍的这项工作发表于 Science Advances ,聚焦药物发现中长期存在的“隐蔽结合位点(cryptic binding sites)难以系统识别”问题。不同于传统方法主要依赖偶然发现、分子动力学模拟或针对少数靶标开展个案研究,该研究构建了目前规模最大的隐蔽位点数据库CryptoBank,通过系统分析Protein Data Bank(PDB)中约600万个apo-holo蛋白结构比对,建立了面向全蛋白组尺度的隐蔽位点发现框架。在方法上,该工作首先开发监督机器学习模型,通过量化配体诱导的局部结构重排对结合位点隐蔽性进行评分,并从中识别出约57万个具有隐蔽特征的apo-holo-配体组合,最终整理得到5,151个隐蔽结合位点,覆盖3,643个蛋白家族;随后进一步利用这些数据微调蛋白语言模型(PLM),实现仅基于蛋白序列即可预测潜在隐蔽位点的位置。结果表明,隐蔽位点在蛋白质中远比预期更加普遍,约18.4%的蛋白家族包含至少一个隐蔽位点,其中部分位于传统认为“不可成药”的靶标蛋白中。进一步分析发现,MALT-1、GLP1R等重要药物靶标均存在可利用的隐蔽口袋;针对TPP1、VWF和ROR2等训练集中未出现的蛋白,微调后的PLM成功预测出潜在隐蔽区域,并通过增强采样分子动力学模拟验证了这些口袋的开启过程。该工作不仅建立了首个大规模隐蔽位点资源库,也证明了隐蔽位点相关信息能够在蛋白序列层面被学习和预测,为扩展可成药蛋白组以及发现传统“不可成药”靶标的新型结合口袋提供了重要工具。

获取详情及资源:
- 📄 论文: https://www.science.org/doi/10.1126/sciadv.ady6364
- 💻 代码: https://github.com/Gervasiolab/CryptoBank
0 摘要
隐蔽结合位点(cryptic binding sites)为调控此前被认为“不可成药”的靶标提供了新的机会。然而,已验证实例的匮乏限制了预测工具的发展。构建了CryptoBank,一个大规模隐蔽位点数据库,通过机器学习模型检测蛋白质数据库(PDB)中超过600万个游离态(apo)与结合态(holo)蛋白对结构比对中的配体诱导构象变化,从而识别隐蔽位点。分析结果表明,隐蔽口袋广泛存在,约出现在18%的蛋白聚类中。基于该资源,对蛋白语言模型(PLM)进行了微调,以直接从蛋白序列预测隐蔽位点。进一步地,在4种与任意CryptoBank条目均具有低序列一致性的蛋白中成功预测隐蔽位点,并利用分子动力学模拟对预测结果进行了验证,表明该策略具有广泛适用性。CryptoBank及其预测PLM已通过Web服务器公开提供,可作为隐蔽位点发现的重要资源。
1 引言
长期以来,药物研发主要针对定义明确的蛋白口袋,例如酶活性位点、离子通道以及近年来得到充分表征的别构位点。然而,那些天然结构中缺乏明显结合位点,或与生理底物具有高亲和力结合能力的蛋白,通常被传统药物发现方法归类为“不可成药”靶标。
近年来的研究对这一范式提出了挑战。大量蛋白尽管在无配体(apo)状态下看似不存在明显结合位点,但仍能够通过隐藏的口袋与小分子结合。因此,隐蔽口袋逐渐成为靶向复杂蛋白的重要替代策略,可提供此前未知的结合位点,实现直接抑制与别构调控。
尽管具有巨大潜力,系统识别蛋白中的隐蔽位点仍然面临显著挑战。这些口袋不会出现在实验解析得到的无配体结构中,而是存在于蛋白构象系综中的高能态。由于缺乏可直接利用的结构信息,理性设计与实验识别过程均受到限制,导致多数隐蔽口袋往往只能在高通量筛选过程中被偶然发现。
计算方法为隐蔽位点识别提供了重要替代方案。例如,基于分子动力学(MD)的策略与增强采样算法已被广泛用于采样隐蔽空腔的形成过程。
近年来,机器学习(ML)以及MD-ML混合方法也被用于预测隐蔽位点位置,并取得了较有前景的结果。此外,将部分模型系统性应用于人类蛋白组后发现,相当比例的人类蛋白可能包含隐蔽结合位点。
尽管预测结果显示隐蔽位点广泛存在,但包含隐蔽位点的综合性实验验证蛋白结构数据库仍然十分有限。目前唯一一个基于结合位点构象系综评估隐蔽性的数据库,其结构数量也仅约1500个。基于系综的隐蔽性评估至关重要,因为其能够区分那些在无配体条件下极少形成甚至从不形成的口袋,与那些快速波动、难以作为有效成药位点的瞬态口袋。
为解决上述问题,构建了一种用于揭示蛋白质数据库(PDB)中隐蔽结合位点的综合策略,包括隐蔽口袋结构数据库CryptoBank以及用于识别未知隐蔽口袋的微调蛋白语言模型(PLM)。首先,开发了一种监督式机器学习策略,通过分析特定结合位点apo-holo构象之间的结构重排程度来量化隐蔽性。随后,将评分函数应用于超过600万个结构比对中,识别出约57.4万个与隐蔽性相关的apo-holo-配体组合,分布于3643个95%序列一致性聚类中。进一步探索了是否能够利用已识别隐蔽位点中的序列层面信息,通过PLM从apo蛋白序列中外推预测此前未知的隐蔽口袋。
近年来,PLM已成为蛋白结构与功能预测的重要工具,并可针对特定任务进一步微调。尽管微调已成为自然语言处理领域的标准策略,其在蛋白建模中的应用仍相对有限。然而,已有结果表明,任务特异性与参数高效微调能够显著提高蛋白结构、相互作用、结合、稳定性以及溶解性等任务中的预测精度。PLM仅依赖序列数据运行,其主要优势在于蛋白序列能够直接编码并输入模型,而无需复杂预处理或大量特征工程。
随后,对PLM进行了微调,以实现残基分辨率水平的结合位点二分类预测。该模型在隐蔽结合位点位置预测中达到了当前先进水平,并在序列一致性至少为20%的蛋白序列上保持较高准确率[ROC曲线下面积(ROC AUC)]与精确率[精确率-召回率曲线下面积(PR AUC)]。然而,模型是否能够推广至微调数据中未出现的全新序列,即是否能够在不产生“幻觉”预测的情况下实现真正外推,仍然是一个开放问题。针对这一问题,在4个相关案例中验证了PLM的预测能力,这些蛋白均属于远缘同源蛋白或与任意CryptoBank条目序列一致性低于20%的序列。结果表明,PLM预测依然有效,并可通过增强采样MD技术验证此前未知位点的形成。
2 结果
2.1 在PDB中搜索隐蔽位点
隐蔽口袋通常被定义为:在蛋白无配体(apo)状态下无法检测,但在结合态(holo)中由于配体结合而显现出的蛋白口袋。因此,评估特定结合位点隐蔽性的有效策略,是比较其apo与holo状态并量化二者之间的结构差异。基于这一思路,构建了一套生物信息学流程,用于从PDB中识别apo-holo蛋白对,并为检测到的结合位点赋予隐蔽性评分。首先,收集PDB中所有分辨率优于2.5 Å的蛋白晶体学与冷冻电镜(cryo-EM)结构。随后,仅保留具有对应UniProt accession并被归入95%序列一致性聚类中的结构。这些满足筛选条件的结构随后被拆分为独立蛋白链,并分别归入apo或holo集合。初始条件下,非聚合物实体数为0的蛋白链被定义为apo,而非聚合物实体数 ≥ 1的蛋白链则被归入holo集合。考虑到结构测定实验中使用的溶剂也可能诱导隐蔽位点形成,因此进一步依据离子、小分子以及溶剂的人工整理列表,对apo与holo集合进行了修正。

图1|PDB中隐蔽口袋的计算流程与评分分布 a. 从PDB中获取并筛选apo-holo-配体组合的生物信息学流程。从满足筛选条件的全部X射线晶体学和冷冻电镜(cryo-EM)蛋白PDB条目出发,将单个PDB条目拆分为独立蛋白链,并分别归入holo或apo集合。共享至少95%序列一致性的apo与holo链被聚类并进行结构比对。唯一apo-holo-配体组合被存储于数据框中以供后续评分。 b. 评分函数示意图。从结构对齐后的apo-holo-配体组合出发,评分函数分别计算apo和holo状态下,以每个配体原子为中心的N个同心壳层内的蛋白原子数量。随后将这些信息整合为对应apo-holo-配体组合的隐蔽性势函数,并依据apo和holo状态下各壳层中的原子数量以及拟合参数
随后,依据序列一致性对apo与holo链进行匹配,并将属于同一95%序列一致性聚类的链归为一组。仅保留同时至少包含一个apo链和一个holo链的蛋白聚类。为了提高缺乏实验apo结构蛋白的覆盖率,还额外引入AlphaFold Protein Structure Database中的预测模型。对于每个UniProt accession,若存在对应AlphaFold模型,则选择其中一个模型作为apo-like结构,并映射至对应UniProt的holo链。AlphaFold模型不受晶体学分辨率筛选限制,但仍需满足后续结构比对与质量标准,包括Cα均方根偏差(RMSD)阈值要求。最终,共获得约81,000条apo链和163,000条holo链,并划分为19,781个95%序列一致性聚类。
随后,在每个序列一致性聚类中识别全部配体结合口袋。对于每个聚类,首先选择一个代表性holo链,并将其余holo链与该参考结构进行结构叠合。利用complete-linkage聚类算法,将质心距离位于7 Å半径内的配体聚类,从而获得56,279个唯一配体结合位点。此外,还依据Tanimoto相似性为不同holo链中的全部配体分配唯一配体标识符,确保相同化学实体具有一致编号,最终得到34,014个唯一配体。
完成上述筛选后,将每个聚类中的所有holo链与同一聚类中的全部apo链进行结构比对。当存在AlphaFold模型时,也将其纳入apo链集合参与比对。此外,每个唯一配体均被单独处理,因此对于所选holo链中的每个配体,每组apo-holo结构均需分别进行一次比对。例如,当某聚类中包含
随后,开发了一种监督式机器学习模型,用于评估整个结构比对集合中单个结合位点构象的隐蔽性。如前所述,隐蔽位点在结合配体过程中会发生结构重排。具体而言,当对隐蔽位点的apo与holo状态进行结构比对时,配体原子通常会与apo状态中的残基产生原子冲突,而这种冲突的严重程度和范围可通过评分函数进行量化。对于给定apo-holo-配体组合,评分算法会统计配体原子与结构比对后apo与holo状态之间的原子冲突数量。若口袋内衬残基在apo与holo结构之间的取向基本保持不变,且不存在原子冲突,则该位点构象被判定为非隐蔽性;相反,大量原子冲突则表明该位点具有隐蔽构象。
此外,为提高结合区域空间分辨率,模型进一步将配体划分为多个片段。对于每个片段,模型统计以每个配体原子为中心、不同半径球壳内的蛋白原子数量。基于这些信息,模型计算该片段位于隐蔽区域中的概率。最终,某一apo-holo-配体组合的隐蔽性评分被定义为全部配体片段隐蔽性评分的平均值。该评分被归一化至0至1之间,其中大于或等于0.5的值被认为具有隐蔽性。模型训练过程中,对三个超参数进行了优化,包括配体片段数量、球壳数量以及模型权重中的L1正则化项。训练数据集由199组人工整理的apo-holo结构对组成,其中包括71个隐蔽位点案例和128个非隐蔽位点案例。该数据集不仅包含既往研究中的案例,还包含利用该流程对PDB进行初步测试时得到的实例。模型性能通过五折交叉验证评估,并利用独立测试集进行验证,最终准确率达到89%。
随后,将训练完成的模型应用于数据集中全部600万个唯一apo-holo-配体组合的评分。结果显示,9.6%的结构比对评分大于或等于0.5,表明这些位点可能具有隐蔽性。据目前所知,该数据集中包含的具有隐蔽性信号的唯一apo-holo-配体组合数量,是目前公开可获得的最大规模集合。
2.2 量化蛋白结合位点的隐蔽性
为了从单个结合位点构象评分扩展至基于构象系综的隐蔽性评估,对映射至同一结合位点的全部结构比对结果的隐蔽性评分进行了聚合。最终得到的位点隐蔽性评分,被定义为该位点全部apo-holo-配体组合对应隐蔽性评分的平均值。
隐蔽口袋通常在稳定的无配体(apo)蛋白状态下保持关闭,而是在稳定性较低、能量更高的瞬时构象中短暂形成,并可被配体结合捕获和稳定。由于apo蛋白结构仅代表在特定实验条件下占优势的单一构象,因此实验条件的变化可能导致获得不同的apo结构。这种apo状态之间的差异,进一步影响后续隐蔽位点的识别。
通过对结合位点多个holo构象以及不同apo状态下的隐蔽性评分进行平均,该方法能够考虑这些构象波动,仅当相当比例的apo-holo比较均对应较高隐蔽性评分时,才将该位点判定为隐蔽性位点。依据这一评分体系,当结合位点平均评分大于或等于0.5时,即被标记为隐蔽位点。
此外,还进一步考虑了不同holo构象对位点隐蔽性评分的影响。化学结构差异较大的配体可能结合于同一位点的不同区域,从而影响其隐蔽性。在某些情况下,多个较小配体可能仅结合于非隐蔽区域,而少量较大配体则能够暴露位点中的隐蔽区域。为处理这类情况,进一步引入了一种基于异常值的策略,用于识别那些平均位点评分低于0.5但仍表现出较高隐蔽性的结合位点。
基于上述评分策略,数据集中56,279个结合位点中有9.2%被判定为隐蔽位点。总体上,这5,151个隐蔽位点对应574,314个隐蔽性评分大于或等于0.5的apo-holo-配体组合,相较此前已有隐蔽位点集合提高了两个数量级。此外,这些隐蔽位点分布于3,643个不同的95%序列一致性聚类中,占CryptoBank全部聚类的18.4%。

图2|结合位点隐蔽性评分与结合位点性质 a. CryptoBank中全部识别结合位点的位点隐蔽性评分分布直方图。每个位点的评分定义为其所有构象对应单独隐蔽性评分的平均值。对于采用异常值识别策略判定为隐蔽性的位点,展示异常构象的平均评分。 b. CryptoBank中至少含有一个隐蔽位点的95%序列一致性聚类比例饼图。 c. 每个隐蔽位点最小埋藏程度与最大配体分子量的散点图(左)。埋藏程度定义为位点所有构象中最小相对溶剂可及面积(RSA),而可配体性定义为与该位点结合化合物中的最大分子量。黑色线表示分类阈值,用于将位点划分为埋藏型(RSA ≤ 0.3)以及可配体结合型(Mw ≥ 300 Da)。隐蔽位点中埋藏型或表面型,以及结合配体(ligandable)或片段(fragment)的比例饼图(右)。
随后,进一步计算了结合于隐蔽位点配体的分子量(Mw),以及每个位点的相对溶剂可及面积(RSA)与体积变化估计值。基于这些描述符,将每个位点划分为埋藏型(RSA < 0.3)或表面型(RSA > 0.3),并进一步判断其结合的是类片段分子(Mw < 300 Da)还是类配体分子(Mw ≥ 300 Da)。由于许多位点能够结合多个配体,因此分类过程中采用每个结合区域对应的最大配体分子量以及最小RSA值作为最终判定依据。
结果表明,63.9%的隐蔽位点是由片段暴露出来的,其中既包括片段筛选中常用的化学片段,也包括晶体学实验中常见的小有机分子。这与既往研究结果一致,即核磁共振(NMR)和X射线晶体学实验缓冲液中的小有机分子容易富集于蛋白活性区域,并能够有效标记蛋白中的别构位点与隐蔽位点。
在由片段暴露的隐蔽位点中,21.8%位于蛋白内部埋藏区域,而其余42.1%位于蛋白表面较浅区域。片段能够结合于深度埋藏区域,说明蛋白必须发生一定程度构象重排,才能使这些化合物进入结合口袋,因此这些区域对于后续化学设计具有较高潜力。在位于表面的片段结合区域中,分别有10.6%和3.3%的区域能够同时结合至少一种或两种化学结构不同的片段。这些区域可能邻近隐蔽位点,因为已有研究表明,与多种化学探针发生相互作用的蛋白区域通常与隐蔽性相关。
其余36%的隐蔽口袋能够结合类配体分子,其中大多数配体的分子量位于300至1200 Da之间。具体而言,这些配体中有77%位于符合rule-of-five规则的300至500 Da范围内。60%的类配体结合隐蔽位点位于蛋白较深区域,其余则位于较表浅区域。总体而言,在CryptoBank中,至少能够结合一个配体的隐蔽位点中,有21.5%形成埋藏口袋,而14.5%暴露于溶剂环境中。
最后,10.9%的可配体结合位点同时也能够容纳分子片段。其中部分案例表明,片段筛选能够首先识别隐蔽口袋,随后再进一步用于配体增长与优化。
2.3 隐蔽口袋检测的片段库
当前用于识别别构位点和隐蔽位点的实验与计算方法,通常利用小有机片段暴露隐藏空腔。选择何种有机探针是此类方法中的关键设计挑战之一,不同片段在识别隐蔽位点方面具有不同效率。尽管在优化片段库方面已投入大量努力,但大多数成果仍然来源于偶然发现,或针对一个或少数几个已充分表征蛋白靶标专门设计的片段库。在隐蔽口袋研究领域,由于缺乏大规模隐蔽位点holo结构集合,片段库设计还面临额外挑战。为解决这一问题,可利用CryptoBank中的数据指导针对隐蔽口袋检测的定制化片段库设计。
首先,将数据库中的每个配体划分为三类:仅结合隐蔽位点的配体、仅结合非隐蔽位点的配体,以及同时结合两类位点的配体。在34,014个唯一配体中,有27.7%仅存在于隐蔽位点中,其中67.6%的分子量大于300 Da。大部分配体(63.4%)结合于非隐蔽位点,而仅有8.9%的配体同时出现在隐蔽位点和非隐蔽位点中。结果符合预期:仅结合单一类型位点的配体通常具有较高分子量,而同时结合两类位点的分子通常属于片段大小范围。较大分子量配体通常对应更高结合特异性,因此大部分仅结合隐蔽位点或非隐蔽位点的配体可能都具有一定选择性。

图3|结合隐蔽位点化合物的配体隐蔽性评分与化学空间 a. CryptoBank中结合隐蔽位点、非隐蔽位点或同时结合两者的配体与片段分布饼图。内圈部分展示各类别中依据分子量划分为类配体化合物或类片段化合物的比例。 b. CryptoBank中全部化合物的配体隐蔽性评分直方图。从上至下依次为:仅存在于隐蔽位点中的化合物、同时存在于隐蔽与非隐蔽位点中的化合物,以及仅存在于非隐蔽位点中的化合物。黑色虚线表示各类别中的平均隐蔽性评分。此处“配体”表示CryptoBank中的全部化合物,而不区分其分子量大小。 c. 仅存在于隐蔽结合位点中的化合物所映射的化学空间。每个化合物在UMAP投影中对应一个点。对应高密度区域的点簇通过HDBSCAN进行聚类,并以紫色高亮显示;灰色点表示未被分配至任何聚类的低密度区域。各聚类的密度线利用核密度估计获得。分析中仅考虑分子量不超过1200 Da的化合物。
随后,为每个配体赋予配体隐蔽性评分。该评分被定义为对应配体所有apo-holo-配体组合隐蔽性评分的平均值。配体隐蔽性评分分布表明,结合隐蔽位点的配体平均会诱导结合区域发生更大程度的结构重排,因此具有更高评分。相比之下,仅结合非隐蔽位点的配体对应较低隐蔽性评分,而同时出现在两类位点中的配体则表现出介于两者之间的平均评分。
最后,基于Morgan fingerprint相似性对9,400个配体进行了聚类分析。利用HDBSCAN算法在UMAP空间中识别局部密度聚类,共获得60个独立簇。随后选择距离每个聚类中心最近的分子作为代表分子。当计算这些代表分子之间的Tanimoto相似性时,最高相似度仅为0.35,表明该集合具有较高化学多样性。这一片段库可作为优化隐蔽口袋筛选片段库的重要起点。
此外,CryptoBank中的数据还可用于构建针对特定蛋白的定制化片段库。在“相似蛋白倾向结合相似配体”的假设下,可根据目标蛋白序列,从相似蛋白隐蔽位点中提取对应配体。同时,配体隐蔽性评分还可作为筛选优先级排序依据,用于指导实验筛选。在尚未发现隐蔽位点的情况下,通用配体列表同样能够为隐蔽位点筛选实验提供参考价值。
2.4 药物相关蛋白靶标中的隐蔽位点
为了评估隐蔽口袋在高优先级药物靶标中的重要性,将CryptoBank中的数据与Open Targets平台进行了交叉分析。Open Targets平台通过整合公开数据集,对潜在药物靶标进行系统评估与优先级排序。该平台结合大规模实验数据以及现有生物学和临床知识,建立并评分潜在靶标与疾病之间的关联关系。
首先,从Open Targets数据库中筛选所有至少与一种人类疾病关联评分大于0.5的蛋白编码基因,共获得约6,000个疾病相关基因。随后收集对应UniProt accession编号,并将其映射至CryptoBank中的序列一致性聚类。最终识别出1,567个与人类疾病相关的95%序列一致性聚类。其中33.8%的聚类包含至少一个隐蔽位点。这一结果与既往关于药物相关蛋白中隐蔽位点丰度的估计基本一致。

图4|Open Targets平台中蛋白靶标的隐蔽性 a. 含有隐蔽位点的蛋白靶标及可成药蛋白比例柱状图。可成药靶标集合仅包含具有单一结合位点的蛋白。 b. MALT-1在apo状态(灰色;PDB: 3V55)与holo状态(紫色;PDB: 7AK0)下的结构比对。holo结构中观察到的隐蔽空腔以表面形式显示,为清晰起见省略配体。apo结构中遮挡隐蔽口袋的蛋白残基以棒状形式表示。 c. 属于不可成药家族且至少含有一个可配体结合口袋的CryptoBank蛋白饼图。至少含有一个可配体结合隐蔽口袋的蛋白比例以紫色表示,而含有可配体结合非隐蔽口袋以及无可配体结合口袋的蛋白分别以青色和灰色表示。 d. GLP1R在apo状态(灰色;PDB: 6X18)与holo状态(紫色;PDB: 6X1A)下的结构比对。holo结构中观察到的隐蔽空腔以表面形式显示,配体以棒状形式表示。形成隐蔽空腔所需的构象重排通过箭头标示。
进一步分析了这些疾病相关蛋白中,已有获批药物靶向或已进入高级临床试验阶段的蛋白比例。分析仅考虑依赖小分子结合剂或PROTAC类化合物的治疗策略,因为这两种模式均需要蛋白靶标中存在可结合口袋。此外,为提高数据库中结合位点与药物真实作用位点一致的概率,仅保留CryptoBank中仅包含一个结合位点的蛋白。结果显示,在满足上述条件的133个靶标口袋中,有26.3%属于隐蔽位点。
例如,黏膜相关淋巴组织淋巴瘤易位蛋白1(MALT-1)在其caspase结构域中形成明显的隐蔽性别构口袋。目前,该隐蔽位点已作为潜在治疗靶标进入Ⅰ期临床试验(NCT05544019),用于治疗复发或难治性B细胞肿瘤患者。
随后,进一步统计了CryptoBank中属于Open Targets数据库定义的“不可成药”蛋白家族,同时具有可配体结合隐蔽口袋的蛋白数量。通常,具有药物开发价值的结合位点位于蛋白内部埋藏区域,并能够容纳较大配体。因此,仅分析RSA < 0.3且能够结合25至50个重原子配体的口袋。结果显示,在被视为不可成药的蛋白中,有30.3%具有埋藏且可结合配体的口袋,其中9%的蛋白包含潜在可成药隐蔽位点。尽管这一结果仍属初步分析,但表明隐蔽口袋能够有效扩展可成药蛋白组范围,因为可靶向结合口袋的存在是小分子药物发现的重要前提。
最后,将CryptoBank与GPCR结构数据库GPCRdb进行了交叉分析。目前CryptoBank包含89个GPCR结构,分布于29个不同的95%序列一致性聚类中。由于PDB筛选标准较为严格,仅有少部分已知GPCR结构被纳入数据库。尽管如此,仍然识别出多个隐蔽结合位点,其中包括胰高血糖素样肽1受体(GLP1R)中的隐蔽口袋。该受体apo与holo状态的结构比对清晰显示,在配体周围形成了一个隐蔽口袋,其形成过程伴随着一段α螺旋部分解折叠、一个环区移动以及另一段α螺旋向结合位点靠近。这一现象与近年来越来越多的证据一致,即GPCR普遍具有不同程度的隐蔽性,其中部分隐蔽位点已经被药物研发项目直接利用。
2.5 PLM在隐蔽结合位点上的微调
展示了经过微调的ProtTrans蛋白语言模型Prot-T5-XL-UniRef50在仅包含隐蔽位点体系的数据集上的训练集、验证集和测试集性能评估结果。训练集ROC曲线获得0.97的AUC。由于正样本比例仅为0.05,数据高度不平衡,因此模型较容易获得较高ROC AUC。模型选择依据为验证集交叉熵损失最小,对应ROC AUC达到0.92。由于验证集同样具有0.05的正样本比例,因此ROC AUC可能高估模型对于训练过程中未见体系的外推能力。在测试集上的ROC曲线AUC为0.70,表明对于全新序列,PLM仍面临较大挑战。

图5|微调后“Prot-T5-XL-UniRef50”模型在仅含隐蔽蛋白序列上的训练集、验证集与测试集性能评估 a. ROC曲线分别显示AUC为0.97、0.92和0.70,而随机预测对应AUC为0.5。 b. 精确率-召回率曲线分别显示AUC为0.79、0.65和0.11,表明在高度类别不平衡的二分类任务中模型仍具有较高精确率。随机预测性能对应于正类别比例,在所有数据集中最大值均为0.05,并以相同颜色虚线表示。Seq. Id.表示序列一致性。
由于结合位点预测属于高度类别不平衡任务,正样本最多仅占全部标签的5%,因此进一步计算了精确率-召回率(PR)曲线,以评估模型维持高精确率的能力。根据该指标,不同数据集之间的性能差异更加明显。训练集上的PR AUC达到0.79,相较随机模型提高超过一个数量级。与验证集相比,PR AUC下降至0.65。这表明PR AUC比ROC AUC更适合作为不平衡预测任务的评价指标。尽管性能有所下降,模型仍保持较高精确率,相较随机预测仍高出一个数量级,说明其能够对新体系进行一定程度外推。
在测试集上,PR曲线AUC仅为0.11。对于不平衡数据而言,高准确率可能具有误导性,而PR AUC则更加真实地反映出模型性能下降的程度。尽管如此,保留的精确率仍然达到随机预测的两倍以上。由此可见,PLM的PR AUC不仅揭示了模型局限性,也证明了基于CryptoBank微调得到的PLM能够直接从apo蛋白序列中较为准确地预测隐蔽位点。根据查询序列与CryptoBank条目之间的序列一致性不同,PR AUC可在0.11至0.79之间变化。当序列一致性高于20%时,通常可获得超过0.65的PR AUC。
因此,该PLM可被视为当前隐蔽与非隐蔽蛋白–配体相互作用预测领域中具有竞争力的方法之一。这一结果进一步说明,隐蔽结合位点位置相关信息已经编码于蛋白序列层面。同时,模型还展现出一定但有限的外推能力,能够将相关信号推广至训练数据中未出现的全新序列。
2.6 PLM-在模拟中预测出隐蔽口袋的开启情况
为了评估微调后PLM在发现未知隐蔽口袋中的应用潜力,对其进行了实际验证测试。验证分为两种场景:第一种是在训练集中已知存在隐蔽位点蛋白的同源蛋白上测试模型预测能力;第二种则是在与训练集蛋白序列一致性低于20%的蛋白上评估其泛化能力。
在第一种场景中,选择B细胞淋巴瘤2(Bcl-2)蛋白家族作为研究对象。以人源Bcl-XL(UniProt: Q07817)为起点,在具有已解析PDB结构的蛋白中寻找最远缘同源蛋白,最终选择来源于Hydra vulgaris的HyBcl-2-4(UniProt: A7LM80)。HyBcl-2-4与人源Bcl-XL具有37.5%的序列一致性,并保持整体结构保守(RMSD < 2 Å)。PLM预测在HyBcl-2-4与HyBak1 BH3结合界面处存在一个隐蔽口袋。对于人源Bcl-XL,该界面的隐蔽口袋已通过晶体学实验验证,而在HyBcl-2-4中尚无相关证据。随后利用无偏分子动力学模拟和增强采样分子动力学模拟研究该预测口袋的开启过程。结果显示,SWISH-X模拟成功观察到预测区域形成隐蔽口袋,而常规无偏模拟则未能揭示这一结构变化,与人源同源蛋白中的观察结果一致。

图6|所预测隐蔽口袋在选定靶标中的开启过程 a. HyBcl-2-4(PDB: 6WH0)。 b. TPP1(PDB: 7TRE)。 c. VWF的A3结构域(PDB: 1ATZ)。 d. ROR2的CRD结构域(PDB: 9FSE)。蛋白结构以白色卡通形式显示,预测为隐蔽位点的残基以棒状形式表示,并依据归一化隐蔽性评分着色(评分高于0.6为红色;0.4至0.6之间为橙色)。模拟过程中采样得到的隐蔽口袋以紫色表面显示。每个蛋白右侧面板展示无偏分子动力学(浅紫色)与SWISH-X模拟(深紫色)得到的口袋体积分布小提琴图,用于说明相较无偏轨迹,SWISH-X采样能够促进隐蔽口袋的开启与稳定化。
为了评估模型在远离同源蛋白条件下的泛化能力,从数据库之外筛选出7,874个与微调训练集蛋白序列一致性低于20%的蛋白。利用PLM对这些序列进行筛选,并寻找具有高隐蔽性评分残基簇的蛋白。随后进一步筛选得到23个人源候选蛋白用于验证。其中选择两个结构明确、长度小于200个残基的结构域进行研究,分别为von Willebrand factor(VWF;UniProt: P04275)的A3结构域以及酪氨酸激酶受体ROR2(UniProt: Q01974)的胞外富半胱氨酸结构域(CRD)。此外,还额外选择端粒保护蛋白TPP1(UniProt: Q96AP0)作为更具挑战性的验证对象,因为其在端粒长度调控中发挥关键作用,同时也是具有重要价值的潜在治疗靶标。
对于TPP1,PLM预测存在一个远离TPP1与端粒酶蛋白–蛋白相互作用界面的别构隐蔽结合位点。预测结果显示,一簇具有较高隐蔽性概率的残基位于一段α螺旋及其连接环区域。TPP1-端粒酶复合物的冷冻电镜结构揭示,在TPP1核心内部存在一个埋藏空腔,但其如何暴露于溶剂环境尚不清楚。因此推测,PLM预测的瞬时空腔可能作为入口,将蛋白内部更深层空腔与外部环境连接起来。无偏分子动力学模拟显示,预测区域能够形成溶剂暴露空腔,而内部空腔则迅速关闭。进一步开展SWISH-X模拟后,成功观察到表面空腔与内部空腔完全连通的构象,且入口区域与预测隐蔽位点直接接触。为了实现空腔完全暴露,包含多数高隐蔽性残基的α螺旋发生倾斜,同时连接该螺旋与核心区域的环结构向外移动,从而将内部口袋与蛋白表面连接起来。
对于VWF A3结构域,该结构域在完整蛋白中负责与I型和III型胶原结合,从而介导血小板黏附。模型预测存在7个隐蔽性评分高于0.6的残基。这些残基聚集于已知胶原结合位点对侧,位于两段α螺旋与一段β折叠之间。现有4个高分辨率晶体结构均未在该区域观察到明显口袋,大多数预测残基处于埋藏状态。然而,在一个与靶向胶原结合位点抗体结合的A3结构中,可以观察到预测区域存在一个被乙酸分子占据的小空腔。进一步利用SWISH-X模拟,从空腔关闭构象出发,观察到该区域形成明显更大的口袋。口袋开启伴随着A3结构域C端六个残基组成的α螺旋发生位移,而这一过程在无偏模拟中仅偶尔出现,从而进一步支持该区域具有隐蔽位点特征。
最后,对ROR2的CRD结构域进行了分析。模型预测存在15个归一化评分高于0.6的残基,分布于三段α螺旋及一个环结构中。在其他受体家族中,该区域通常通过疏水沟槽或埋藏口袋介导配体与辅助因子结合。然而,这一结构特征尚未在ROR2 CRD晶体结构(PDB: 9FSE)中被报道,因此可能代表一种新的配体识别机制。进一步研究预测隐蔽空腔是否能够形成类似Frizzled家族CRD中的脂质沟槽,或容纳类似Nrk CRD中的深埋脂肪酸。SWISH-X模拟结果显示,预测区域能够形成类似沟槽的结构。同时,三段α螺旋之间的空间发生显著结构重排,在无偏模拟与SWISH-X模拟中均形成较大空腔,与模型预测的高隐蔽性结果高度一致,并表明该区域具有容纳埋藏脂质分子的潜力。
整体结果表明,通过隐蔽位点实例微调后的PLM能够成功预测在分子动力学模拟中发生开启的隐蔽区域,显示出其在药物发现与隐蔽位点识别中的应用潜力。
3 讨论
针对天然状态下缺乏明确结合口袋的蛋白开展药物设计,一直是药物发现领域的重要挑战。这类蛋白通常难以被传统小分子药物靶向,从而限制了可成药蛋白组的范围。隐蔽位点通过配体结合或蛋白瞬时构象波动形成,为解决这些“不可成药”靶标问题提供了新的可能性。然而,由于缺乏系统识别和实验验证的大规模隐蔽位点资源,该领域的发展长期受到限制。为此,构建了CryptoBank这一大规模隐蔽结合位点数据库,并展示了利用该资源开展预测建模的可行性。
CryptoBank的核心贡献在于,通过分析PDB中约600万个apo与holo蛋白状态之间的结构比对,构建了目前规模最大的隐蔽位点资源库。利用监督机器学习模型量化配体诱导的结构重排,共识别出约57.4万个具有隐蔽特征的apo-holo-配体组合。这些数据进一步归并为5,151个独立隐蔽结合位点,分布于3,643个蛋白聚类中,占全部分析聚类的18.4%。与此前公开资源相比,数据规模提升约两个数量级。与此同时,通过对多个apo与holo构象进行平均评分的系综化评估策略,相较于单结构分析能够更全面地考虑蛋白构象柔性对隐蔽位点形成的影响,从而获得更加稳健的隐蔽性评价结果。
CryptoBank能够直接服务于药物发现与基础生物学研究。首先,该数据库提供了大量来源于实验结构的隐蔽口袋信息,而这些口袋通常无法在apo结构中直接观察到,因此可作为针对困难靶标开展结构基础药物设计的重要起点。
基于配体分子量与溶剂可及性的分析结果表明,隐蔽位点具有多样化特征。其中63.9%的隐蔽位点由片段类分子暴露,而36.1%的隐蔽位点能够结合更大的类配体分子。值得注意的是,在能够结合配体的隐蔽位点中,60%位于蛋白内部埋藏区域,这与理想可成药口袋的典型特征一致。进一步分析发现,在被归类为不可成药的蛋白中,有9%存在潜在可成药隐蔽位点,这为扩展可成药蛋白组提供了直接证据。此外,在MALT-1、GLP1R等具有治疗价值的蛋白以及Open Targets数据库中33.8%的疾病相关蛋白中均发现隐蔽位点,进一步说明CryptoBank在实际药物发现中的应用价值。数据库中还整理得到9,400个仅出现在隐蔽位点中的配体,并建立了对应聚类体系,为构建针对隐蔽位点筛选优化的片段库提供了基础。
除了作为数据资源外,还进一步证明了CryptoBank中的序列层面信息能够用于隐蔽位点预测。基于该数据库对蛋白语言模型(PLM)进行微调后,构建了一个能够直接从蛋白序列预测隐蔽位点倾向性的模型。当查询序列与CryptoBank条目之间的序列一致性超过20%时,可获得超过0.92的ROC AUC以及0.65的PR AUC,表现出较高预测精度与准确率。然而,模型最大的挑战仍然是对于全新序列的泛化能力,其性能下降至ROC AUC为0.70、PR AUC为0.11。
TPP1、VWF A3结构域以及ROR2 CRD结构域的案例研究进一步验证了这一预测框架的有效性。这些蛋白均未出现在训练数据中,且与CryptoBank中任意条目的序列一致性均低于20%。PLM成功预测出潜在隐蔽位点,而后续分子动力学模拟进一步验证了这些区域能够形成隐蔽口袋。这些结果表明,PLM能够为计算成本较高或实验成本较高的方法(如分子动力学模拟或片段筛选)提供有效指导,从而优先聚焦于最有可能发现新隐蔽口袋的区域。
与此同时,该研究仍存在一定局限性。隐蔽位点的定义与识别高度依赖于PDB中已有结构数据,而这些数据本身可能偏向特定蛋白家族或特定构象状态。此外,尽管PLM表现出良好预测能力,但对于与训练集差异极大的蛋白,其预测性能仍然有限。未来仍需要在模型结构设计和训练策略方面进一步改进,并可能通过引入结构信息提高模型泛化能力。
总体而言,CryptoBank构建了目前规模最大的隐蔽结合位点资源库,为理解隐蔽位点形成机制以及针对困难靶标开展药物发现提供了重要基础。配套开发的PLM虽然在泛化能力方面仍存在改进空间,但已经显著推进了基于序列的隐蔽位点预测研究。CryptoBank与预测模型的结合,为系统探索隐蔽位点、拓展可成药靶标范围以及开发针对复杂疾病的新型治疗策略提供了强有力工具。