NMI 2026 | trRosettaRNA2: 基于预训练二级结构模型与结构感知注意力的 RNA 三维结构与构象预测
今天介绍的这项工作发表 Nature Machine Intelligence 上。该研究围绕RNA 三维结构与构象预测这一核心难题展开,提出了一种融合二级结构先验、采用结构感知注意力的深度学习模型 trRosettaRNA2。传统 RNA 结构解析高度依赖实验技术与专家经验,实验难度大、周期长,而现有计算方法普遍依赖三维数据、难以捕捉 RNA 天然柔性带来的构象多样性。随着高通量测序和自动化实验快速发展,高精度、高效率、能覆盖构象动态的 RNA 结构预测方法变得愈发关键。该工作的主要创新在于构建了一套二级结构引导、端到端的 RNA 三维预测框架。模型首先在海量二级结构数据上预训练出高精度碱基配对模块 trRNA2-SS,再将二级结构信息融入注意力机制,实现对 RNA 全局折叠与局部相互作用的联合建模,直接从序列生成全原子三维结构。这种方法突破了传统依赖三维实验数据、分步推断的局限,真正实现从 “序列到结构” 的端到端预测。此外,研究进一步提出多二级结构输入策略,通过引入不同二级结构模型的预测结果,让模型能够探索更多折叠路径,从而有效捕捉 RNA 构象异质性。这一点对理解 RNA 动态功能至关重要,因为真实 RNA 常以多种构象共存。实验结果表明,trRosettaRNA2 在基准测试和 CASP16 盲测中均达到顶尖水平,性能可与 AlphaFold 3 相当甚至更优,同时参数量和训练成本大幅降低。尤其在 RNase P RNA 这类高度柔性分子上,模型能够准确复现实验观察到的构象集合,为 RNA 动态研究提供了全新工具。总体而言,trRosettaRNA2 为 RNA 结构预测提供了一种轻量、高效、且能覆盖构象多样性的新方案。

获取详情及资源:
- 📄 论文: https://www.nature.com/articles/s42256-026-01223-x
- 💻 代码: https://github.com/YangLab-SDU/trRosettaRNA2
- 🛜 网站: https://yanglab.qd.sdu.edu.cn/trRosettaRNA
0 摘要
RNA 三维结构与构象的确定是结构生物学领域长期面临的重大挑战,主要源于实验数据稀缺、RNA 分子高度柔性以及现有实验与计算方法的局限性。该研究提出trRosettaRNA2,一种基于深度学习的端到端 RNA 结构预测方法。考虑到 RNA 三维结构数据有限,该方法整合二级结构先验辅助模块,在海量二级结构数据上预训练,生成可靠碱基配对先验。该模块同时可作为独立 RNA 二级结构预测工具trRNA2-SS,达到当前最优水平。为实现端到端预测,trRosettaRNA2 采用结构感知注意力机制,直接生成 RNA 三维结构与构象(分子因固有柔性形成的不同三维空间排布)。大量基准测试表明,trRosettaRNA2 在参数与计算资源远少于其他主流方法的情况下,预测性能更优。尤其重要的是,该方法可灵活利用多种二级结构输入,为RNA 构象景观探索提供可行路径。在国际蛋白质结构预测竞赛(CASP16)盲测中,基于 trRosettaRNA2 构建的Yang-Server成为全球最佳 RNA 结构自动预测服务器,性能超越 AlphaFold 3。对核糖核酸酶 P(RNase P)RNA 的应用进一步显示,该方法无需实验数据即可准确捕捉其结构异质性,具备预测 RNA 构象集合的潜力。
1 引言
解析 RNA 结构与构象是阐明生命基础生物学功能的关键,但受 RNA 固有柔性与不稳定性影响,相关实验研究难度极大。为攻克这一难题,数十年来,科研人员持续研发 RNA 结构预测计算方法。近年来,深度学习技术的引入进一步提升了预测性能。例如,trRosettaRNA 与 DeepFoldRNA 借助 Transformer 模型预测几何特征以完成能量最小化;RhoFold + 引入 RNA 语言模型;RoseTTAFoldNA、RoseTTAFold 全原子模型及 AlphaFold 3 则面向更广泛的生物分子体系开展预测;近期问世的 GraphaRNA 结合图神经网络与扩散模型,可预测 RNA 亚结构。基准测试与盲测结果证实,深度学习技术能显著提升自动化建模的精准度。
尽管如此,RNA 谜题竞赛与蛋白质结构预测关键评估(CASP)等领域主流测评活动均表明,RNA 结构预测问题尚未得到彻底解决,挑战主要源于三方面。其一,蛋白质数据库(PDB)中实验测定的 RNA 三维结构数据稀缺,仅约 4% 的数据库条目包含 RNA 分子,制约了数据驱动型方法的性能。其二,当前主流结构预测范式高度依赖多序列比对(MSA),但 RNA 的多序列比对质量往往欠佳。具体而言,BLASTN 等序列比对工具仅能识别四种碱基,且无法体现通常比序列同源性更重要的结构保守性,导致比对特异性与灵敏度不足;而 Infernal 等先进结构感知比对工具,受迭代协方差模型搜索计算成本过高、初始二级结构先验质量不佳等因素限制,应用受限。其三,RNA 分子的固有柔性远高于蛋白质,这一特性在现有方法中大多被忽略。
近期,少数研究尝试结合计算方法与实验数据预测 RNA 构象异构体,例如计算框架 HORNET 可基于原子力显微镜(AFM)图像确定 RNA 三维构象。但在无实验数据辅助的前提下,从头模拟 RNA 结构异质性,仍是领域内亟待解决的核心难题。
为应对三维数据稀缺问题、捕捉 RNA 动态特性,研究人员充分利用 RNA 二级结构数据资源丰富的优势。RNA 折叠具有层级性特征,二级结构是搭建三维结构的核心基础,这一规律为早期 RNA 三维结构预测方法奠定了理论依据。bpRNA 等数据库收录的二级结构条目数量,是 PDB 数据库中 RNA 三维结构条目数量的约 12 倍,可有效缓解三维数据不足的困境。此外,二级结构的变化通常与三维构象异质性直接相关,因此,将 RNA 二级结构与三维结构紧密关联,是预测 RNA 三维结构与构象异构体的有效路径。
基于上述思路,trRosettaRNA2 作为端到端模型应运而生,其核心区别于传统方法:传统方法仅将二级结构作为外部静态约束,而 trRosettaRNA2 内置独立二级结构模块,该模块通过海量二级结构数据预训练,习得 RNA 基础折叠规律。该模块独立作为二级结构预测工具 trRNA2-SS 时,性能达到行业顶尖水平。为实现端到端预测,模型进一步设计二级结构感知结构模块,直接输出三维结构。基准测试与 CASP16 盲测结果显示,trRosettaRNA2 性能可与 AlphaFold 3 媲美,且参数量与训练资源需求大幅降低,同时全面优于其他自动化预测方法。尤为重要的是,trRosettaRNA2 成功还原了原子力显微镜实验观测到的核糖核酸酶 P RNA 异质构象景观。
2 结果
2.1 trRosettaRNA2 模型概述
trRosettaRNA2 采用端到端流水线完成 RNA 三维结构预测,整体包含四大核心组件:用于碱基配对初始化的二级结构先验模块、负责特征编码与更新的 RNAformer 模块、输出坐标信息的二级结构感知结构模块,以及后处理优化流程。
具体流程为:输入目标 RNA 序列,生成多序列比对结果并编码为特征嵌入向量;随后,在 bpRNA 海量数据库上预训练的二级结构先验模块,输出碱基配对概率形式的二级结构先验信息;该先验信息与多序列比对嵌入向量融合,编码为一维与二维特征表示,经 RNAformer 模块迭代更新。RNAformer 为双轨 Transformer 网络,通过轴向注意力、交叉模态交互等机制,实现双模态特征的迭代更新。最终,二级结构感知结构模块基于更新后的特征表示,输出全原子笛卡尔坐标。
为保证预测结构符合物理规律,输出坐标需经快速松弛流程优化,包括键长标准化、能量导向的空间位阻最小化,该流程借助 PyRosetta 工具实现。PyRosetta 具备物理意义明确的能量函数与成熟优化流程,是分子精细建模的行业标准工具,其 Python 接口可将 Rosetta 丰富的优化算法无缝融入模型工作流,整合后的完整流程即为端到端版本 trRosettaRNA2。此外,模型还支持另一模式:基于神经网络预测的二维几何约束,通过 PyRosetta 能量最小化重构三维结构,跳过结构模块,该模式称为 trRosettaRNA2(PyRosetta 版)。
二级结构先验模块除提供关键碱基配对先验信息外,还可独立作为 RNA 二级结构预测工具 trRNA2-SS。综合基准测试结果显示,trRNA2-SS 的二级结构预测性能达到当前最优水平。
2.2 trRosettaRNA2 的三维结构预测性能
为全面评估 trRosettaRNA2 的三维结构预测能力,研究人员构建不含训练冗余的基准测试集 TS28,该数据集具有内部非冗余、不含非 RNA 大分子相互作用等特点,为无偏基准测试提供标准样本。评估采用多项核心指标:全局拓扑指标包括均方根偏差(RMSD)与模板建模分数(TM-score),局部精度指标包括局部距离差异测试分数(lDDT)与相互作用网络保真度(INF)。
为与初代 trRosettaRNA 直接对比,研究人员首先将 SPOT-RNA 预测的二级结构作为 trRosettaRNA2 输入,绕过内置二级结构先验模块。结果显示,端到端版本 trRosettaRNA2 在 TS28 数据集上平均均方根偏差为 9.08 埃,较初代 trRosettaRNA 降低 20%;引入内置二级结构先验模块、采用优化二级结构预测工具 trRNA2-SS 后,四项精度指标进一步提升,充分验证了端到端架构的有效性。
值得注意的是,PyRosetta 版本 trRosettaRNA2 的预测精度略高于端到端版本,原因在于能量最小化流程提升了结构合理性。该结果同时表明,端到端训练有效优化了二维几何预测精度。最终,trRosettaRNA2 平均均方根偏差达 8.66 埃,较初代 trRosettaRNA 提升 24%,在 71.4% 的测试样本中性能优于初代模型。
2.3 trRosettaRNA2 与其他主流方法对比
此前研究已证实,深度学习方法性能优于依赖物理能量或片段组装的传统自动化方法,因此本次研究仅将 trRosettaRNA2 与当前主流深度学习方法对比,包括与初代 trRosettaRNA 同期发布的 DeepFoldRNA、RoseTTAFoldNA,以及后续问世的 RhoFold + 与 AlphaFold 3。所有对比实验均采用相同输入(多序列比对或二级结构),在本地完成模型运行。

图1|trRosettaRNA2:RNA 三维结构预测算法流程与关键模块架构。 图片是trRosettaRNA2 算法的核心流程图,展示了一个基于深度学习的 RNA 三维结构预测端到端(E2E)框架,分为三个子图,完整呈现了从序列到 3D 结构的全流程和关键模块设计。
TS28 数据集测试结果显示,trRosettaRNA2 性能可与 AlphaFold 3 比肩,且全面优于其他方法。具体而言,trRosettaRNA2 的均方根偏差与局部距离差异测试分数优于 AlphaFold 3,仅模板建模分数与相互作用网络保真度略低,在所有指标上均优于其他代表性方法。二者性能具有互补性:trRosettaRNA2 在 32.1% 的测试样本中较 AlphaFold 3 精度高出 1 埃以上,AlphaFold 3 则在 25% 的样本中具备相同优势。此外,trRosettaRNA2 预测结构的空间位阻数量极少(仅 2 个),而 AlphaFold 3 超过 10 个,且 trRosettaRNA2 预测结构无几何缠绕问题,体现了其基于结构违规优化策略与能量优化流程的有效性。该优势在 CASP15 基准测试中同样得到验证,trRosettaRNA2 平均均方根偏差仅次于人工干预最优团队,同时优于 DRfold2、RNAbpFlow 等近期新方法。
trRosettaRNA2 的另一核心优势是参数高效,仅需约 3000 万参数即可实现最优性能,仅为 RoseTTAFoldNA 的 1/2、RhoFold + 的 1/4、AlphaFold 3 的 1/12。训练成本同样显著降低:在单张 A100/A800 显卡上完成训练(含二级结构预训练)仅需约 33 天,而 RhoFold + 需 8 张 A100 显卡训练 1 周、RoseTTAFoldNA 需 64 张显卡训练 4 周、AlphaFold 3 需 256 张 A100 显卡训练 20 天。
以 PDB 编号 8I3Z 的 NAD-II 核糖开关为例,该分子含 5’端三螺旋与 3’端假结结构。除 RoseTTAFoldNA 外,多数方法虽能大致还原局部基序,但难以准确预测 3’端与 P1a 螺旋的空间排布,导致全局精度差(均方根偏差 11.8–19.3 埃)。而 trRosettaRNA2 精准还原了结构域的三级堆积,最低均方根偏差仅 9.3 埃,且空间位阻分数仅 3.3,远优于其他方法(7.6–80.6)。
2.4 CASP16 盲测结果
在CASP16的盲测中,SS先验模块的设计使trRosettaRNA2能够通过探索多样化的先验信息来提升性能(例如,将SPOT-RNA和trRNA2-SS的SS结合使用进一步提高了预测精度;见表1及补充结果2),而其他SOTA方法如AlphaFold 3和DRfold2则仅依赖MSA或语言模型提取的共演化信号。基于trRosettaRNA2,研究团队以两个自动服务器组参与了CASP16 RNA预测实验的盲测,分别为Yang-Server (TS052)和Yang-Multimer (TS456)。Yang-Multimer使用trRosettaRNA2的默认配置(即使用trRNA2-SS先验)与其他四种深度学习预测方法进行对比;Yang-Server则进一步优化以利用多样化的SS资源提交最佳预测,这些资源易于获得(方法部分有详细说明)。
在Yang-Server的结果中,根据36个RNA单体靶点的官方排名,Yang-Server是表现最优的服务器组(16个服务器组中排名第1),无论是按“首个”模型还是“最佳”模型排名,仅次于三个人工组(即64个参赛组中排名第4)。相比之下,基于AlphaFold 3的AF3-server (TS304) 排名第9,基于DRfold2的dNAfold (TS448) 排名第24。由于训练计算资源限制,对超过400核苷酸且缺少同源模板的靶点,研究团队融合了AlphaFold 3的预测。然而,对于其余23个靶点,Yang-Server仍是表现最优的服务器组。如补充表11所示,Yang-Server在这23个靶点上的“最佳”模型在全局指标(RMSD、TM-score及全球距离测试总分GDT-TS)上优于AF3-server,在局部指标(lDDT和INF)上表现具有竞争力,同时冲突评分显著较低。此外,Yang-Server在所有指标上均超越了dNAfold,并且冲突评分也明显更低。
在Yang-Multimer的结果中,该组用于盲测默认trRosettaRNA2与其他深度学习方法(trRosettaRNA、RoseTTAFoldNA、DeepFoldRNA和RhoFold)的性能。根据CASP16官方排名,Yang-Multimer在16个服务器组中按“首个”模型的总Z分(>0)排名第5。值得注意的是,官方排名仅包含Yang-Multimer提交的23个靶点,其余13个靶点的Z分均为0。如果按平均Z分排名,Yang-Multimer在37个组(其中10个为服务器组)中提交数量超过20的组中排名第二,仅次于Yang-Server,体现了trRosettaRNA2的优异性能。图3b及表2上部总结了Yang-Multimer的结果,在其提交中,trRosettaRNA2在准确性和物理合理性方面均优于其他四种方法。研究团队还将分析扩展至后续发布的RhoFold+,发现其性能与RhoFold相当,这与在TS28数据集上的早期观察一致。

图2|trRosettaRNA2 与主流 RNA 结构预测方法的性能对比与效率评估。 这张图系统对比了trRosettaRNA2与 RoseTTAFoldNA、DeepFoldRNA、AlphaFold 3 等多种主流 RNA 三维结构预测方法,从预测精度、计算效率和结构可视化三个维度验证了 trRosettaRNA2 的优势。
在CASP16案例研究中,trRosettaRNA2相较于AlphaFold 3的竞争优势主要归因于通过SS模块引入了先验信息,这利用了SS(次级结构)通常比复杂的三维结构更易预测的特点。图3c、3d提供了两个示例进行说明。第一个示例为R1288,这是一个稳定的S-腺苷甲硫氨酸类似物依赖核酶(SAMURI;图3c),其可与S-腺苷-L-高半胱氨酸(SAH)及两个Mg²⁺离子结合。对于该靶点,在未使用SS先验信息时,trRosettaRNA2的预测精度与AF3-server的最佳模型相近(RMSD分别为8.9 Å和8.5 Å)。当引入SS先验模块后,trRosettaRNA2模型的RMSD提升至6.4 Å。此示例展示了利用SS先验信息的优势,使预测结果优于不支持该功能的方法,如AlphaFold 3。
第二个示例为R1293,来源于翻译增强子基序M1293,它是由两个蛋白亚基和一个RNA亚基组成的复合体。对于该靶点,默认trRosettaRNA2模型的表现优于AlphaFold 3(即Yang-Multimer相比AF3-server),当使用SPOT-RNA提供的SS作为输入时,性能进一步提升,使Yang-Server的模型比Yang-Multimer更加精确。此示例凸显了trRosettaRNA2在探索多样化SS提示以获得更精确预测方面的潜力。
需要注意的是,上述两个RNA靶点均涉及与其他分子的复合物:R1288结合配体,而R1293与蛋白质相互作用。预测整个复合物结构超出了方法的适用范围,这是相较于AlphaFold 3的一项局限。然而观察发现,引入结合伙伴信息并未提升AlphaFold 3对这两个RNA亚基的预测性能(补充图11a)。例如,尽管AlphaFold 3几乎正确预测了R1293的结合位点,但整体结合构象与实验结构仍存在显著偏差,尤其是连接区存在明显扭曲(补充图11b)。这反映出对分子间相互作用的精确预测仍然具有挑战性,尤其是涉及RNA的情况,可能由于相关训练数据不足所致。
表 1 |在 TS28 数据集上 trRosettaRNA2 与其他代表性方法的比较


图3|trRosettaRNA2 及主流方法在 CASP16 RNA 单体靶标上的性能对比。 这张表展示了CASP16 挑战中,不同 RNA 结构预测方法在单体 RNA 靶标上的性能指标对比,核心聚焦于 trRosettaRNA2 及其所属的 Yang-Multimer 团队提交结果,同时纳入了 AlphaFold 3(AF3-server)、RhoFold、DeepFoldRNA 等主流方法,从多个关键维度评估预测精度与质量。
2.5 核糖核酸酶 P RNA 构象景观探究
RNA 分子比蛋白质更具柔性与动态性,通常以构象集合而非单一静态结构形式存在,但现有计算方法难以模拟这一固有动态特性。基于二级结构输入可调控 trRosettaRNA2 输出的特性,研究人员利用该模型预测核糖核酸酶 P RNA 的异质结构。该 RNA 包含高度保守的催化结构域(C 结构域)与特异性结构域(S 结构域),后者在不同物种中存在显著结构异质性,解析 S 结构域结构变异性对理解核糖核酸酶 P 的催化活性与机制至关重要。近期,通过深度学习分析原子力显微镜图像,已确定 158 种核糖核酸酶 P RNA 的不同构象,实验观测构象集合多样性极高,平均均方根涨落达 19.1 埃,S 结构域涨落尤为显著(平均 31.1 埃),远高于 C 结构域(平均 11.7 埃),这一特征在残基水平均方根涨落图中清晰呈现。
为采样异质构象,研究人员输入 11 种不同二级结构(来自 trRNA2-SS、SPOT-RNA、EternaFold 等工具),固定多序列比对信息,利用 trRosettaRNA2 端到端版本为每种二级结构生成 4 个结构(对应 4 次内部循环),共得到 44 个预测结构;同时,为 AlphaFold 3 设置 20 个随机种子(每种子生成 5 个模型),得到 100 个预测结构。
表2 | Yang-Multimer提交的CASP16 RNA单体靶点性能

结果显示,trRosettaRNA2 预测结构整体动态性显著(平均均方根涨落 12.5 埃),S 结构域涨落尤为突出(均方根涨落 > 20 埃),残基水平均方根涨落曲线与实验构象高度吻合,皮尔逊相关系数达 0.894,精准还原了 S 结构域中两个高柔性茎环区域。而 AlphaFold 3 预测结构高度同质化,整体均方根涨落仅 4.7 埃,严重低估所有残基的构象涨落。构象景观可视化结果进一步印证了这一优势:即便生成两倍数量结构,AlphaFold 3 预测结果仍高度集中于狭小区域,而 trRosettaRNA2 预测结果分布更广、多样性更强,可通过不同二级结构输入精准生成实验观测到的多种构象。
为探究异质性来源,研究人员量化每个构象集合的二级结构动态性,计算残基对碱基配对状态标准差并取平均值。结果显示,原子力显微镜实验构象的二级结构变异性与三维景观一致,S 结构域动态性显著更强;11 种预测二级结构输入的变异性可大致还原实验趋势,皮尔逊相关系数 > 0.4。仅依靠模型循环机制(1 种二级结构 ×4 次循环)仅能产生中等异质性,而结合多类输入与模型循环(11 种二级结构 ×4 次循环),trRosettaRNA2 预测构象集合可高度匹配原子力显微镜实验动态特征,S 结构域相关指标与实验值高度接近,而 AlphaFold 3 预测集合二级结构高度同质化,标准差 < 0.1,从机制层面解释了 trRosettaRNA2 构象异质性的来源。

图4|RNase P RNA 构象空间分析:trRosettaRNA2 与 AlphaFold 3、AFM 实验结果对比。 这张图聚焦于RNase P RNA这一复杂 RNA 分子的构象动态与预测能力对比,从构象集合、残基波动、构象 landscape 三个维度,分析了 trRosettaRNA2、AlphaFold 3(AF3)与 AFM 实验观测结果的差异与一致性。
3 讨论
trRosettaRNA2 作为自动化端到端 RNA 三维结构预测算法,经大量基准测试与 CASP16 盲测验证,性能全面优于初代 trRosettaRNA 及其他主流深度学习方法,可与 AlphaFold 3 比肩,且参数量与训练资源消耗大幅降低。尤为关键的是,trRosettaRNA2 在核糖核酸酶 P RNA 异质构象预测中展现独特优势,核心源于其高效利用多类二级结构输入的能力,为探究 RNA 构象景观这一 RNA 生物学核心难题提供了有力工具。
消融实验结果显示,二级结构模块是模型性能提升的核心因素,多序列比对嵌入与针对性优化流程同样具有重要作用。二级结构模块不仅提供关键碱基配对先验信息,缓解三维结构数据稀缺问题,还可独立作为当前最优二级结构预测工具 trRNA2-SS。实际应用中,trRNA2-SS 已用于预测近 10 万条 RNAcentral 数据库中未知二级结构的序列,在各类 RNA 类型上输出高置信度预测结果,为相关研究提供重要结构参考。
分析表明,trRosettaRNA2 与 trRNA2-SS 具备强大泛化能力,但在合成 RNA 预测中仍面临挑战,提示方法需进一步优化。考虑到 RNA 柔性、RNA - 蛋白质 / 配体复合物预测的固有难度,未来突破方向或在于深度学习方法与实验数据、模板信息的融合。例如,结合冷冻电镜、原子力显微镜数据,可显著提升预测精度;trRosettaRNA2 可与实验室研发的 CryoAtom 冷冻电镜建模算法结合,为其提供二级结构先验与从头模型,助力模型构建,而 CryoAtom 生成的高质量结构模板,又可进一步提升 trRosettaRNA2 的预测精度。