Nucleic Acids Res. 2026 | PEP-EDIT:高效实现复杂肽的3D生成和交互编辑的网络服务器

今天介绍的是发表在 Nucleic Acids Research 上的一项研究工作。该研究提出了 PEP-EDIT 这一面向复杂肽分子的在线工具,用于快速生成和交互式编辑肽的 1D、2D、3D 表示。针对含非天然氨基酸、环化、支化等复杂拓扑难以建模的问题,PEP-EDIT 基于 BILN 表示与可定制单体库,提供了 pH 依赖质子化、构象约束设定、2D/3D 联动可视化以及多格式导出等能力。结果表明,PEP-EDIT 生成的构象可作为后续分子动力学和量子化学优化的有效起点,并在协作与教学场景中具备实用价值。PEP-EDIT 后续将进一步完善非肽键化学兼容性、单体库对接以及理化/ADMET 预测等功能。

获取详情及资源:

0 摘要

近年来,肽类药物的开发取得了显著增长。这些分子通常已不再局限于由 20 种标准氨基酸组成的简单线性链。肽类药物经常引入非标准氨基酸、非氨基酸组分,并且可以呈现单环或多环结构、支化结构以及其他复杂拓扑。因此,研究人员对于易于获取的工具的需求正在不断增加,希望能够方便地生成和修改这些复杂肽分子的 1D、2D 和 3D 表示形式,并将其作为进一步优化的起点。PEP-EDIT 正是为满足这一需求而开发。该平台提供了一个用户友好且具有交互性的 Web 界面,可基于 1D 的 BILN(Boehringer Ingelheim Line Notation)序列,并结合可定制的单体库,生成复杂肽分子的表示形式。在 pyPept 库的基础上,PEP-EDIT 进一步扩展了其功能,例如支持 pH 依赖的质子化以及构象约束的简化定义。平台利用交互式 2D 和 3D 可视化来辅助肽设计,提供了直观的单体与 3D 模型管理功能,并集成了协作式与交互式可视化工具。PEP-EDIT 可通过 https://pep-edit.rpbs.univ-paris-diderot.fr 访问。该网站免费向所有用户开放,无需登录即可使用。

1 引言

近年来,肽类化合物已逐渐成为极具潜力的药物候选物,其中如 Ozempic 和 Mounjaro 等重磅药物预计将在 2025 年创造超过 500 亿美元的销售额。肽类药物很少仅依赖于 20 种标准氨基酸。例如,Ozempic 和 Mounjaro 均引入了脂肪酸链以及诸如氨基异丁酸等非标准氨基酸。其他肽类化合物则具有环状结构(如 cyclosporin 和 pasireotide)或支化结构,使得其结构与拓扑形式往往较为复杂。

创建和编辑复杂肽的 3D 表示形式,以服务于计算机辅助药物开发,仍然是一项重大挑战。肽类化合物通常比小分子包含更多原子,这使得针对小分子开发的传统基于原子的描述方式在处理时变得十分繁琐。同时,复杂肽又往往不同于标准蛋白质所遵循的简单线性组装方式,其困难来源于非标准氨基酸、特殊环结构、支化结构以及其他复杂拓扑形式的存在。幸运的是,近年来肽表示语言的发展,例如 HELM 和更为简洁的 BILN(Boehringer Ingelheim Line Notation),已经在一定程度上缓解了这一瓶颈。其中,BILN 尤其简化了复杂肽的描述方式,能够以一种人类较易理解的 1D 表示形式,描述由标准、非标准或特殊单体组成,并具有线性、环状或支化拓扑结构的肽分子。对于由多条肽链通过非肽键连接而形成的复杂肽结构,BILN 同样能够进行处理。

然而,能够描述复杂肽仅仅是第一步。为了生成合理的 3D 构象,还需要构建满足其复杂拓扑约束条件的初始 3D 模型,从而为后续结构优化提供基础,并为分子设计提供资源。因此,开发易于使用的复杂肽 3D 模型生成工具显得尤为必要。

尽管目前已经建立了大量用于预测肽性质的工具,但真正解决初始 3D 结构生成问题的工具仍然较少。一些桌面应用程序,如 Rosetta,早已能够处理非标准氨基酸。另一些软件,如 SAMSON (https://www.samson-connect.net/) 和 PICKAPEP,则能够编辑复杂分子,包括修饰肽。然而,可自由访问的在线复杂肽 3D 生成工具仍然相对匮乏。Ketcher (https://lifescience.opensource.epam.com/ketcher/) 是一种内部采用 HELM 表示法的在线工具,能够为小分子生成 3D 构象,并针对较大分子使用单体库,但目前对于线性和环状肽仅能生成 2D 表示形式。PEP-DRAW 在线服务器(https://pepdraw.com/) 所提供的功能也较为基础。在面向蛋白质/肽的相关软件中,AlphaFold 3 的命令行模式支持复杂肽结构生成,但其 Web 服务器仅限于处理标准氨基酸以及特定的翻译后修饰。Boltz 网络服务器同样能够处理来源于 Chemical Component Dictionary(CCD)的非标准氨基酸,但与 Chai-1 Web 服务器类似,仅向注册用户开放。在专门用于肽结构预测且可免费使用的 Web 服务器中,例如 PEP-FOLD 和 pepstrmod,只有后者能够接受 D-型及非标准氨基酸,但其仍无法处理更特殊的残基,也无法生成复杂的环状肽或脂化肽。

PEP-EDIT 是一个在线平台,旨在为复杂肽生成 3D 坐标,包括构象优化、构象采样以及相关分析。该平台是在 pyPept 库基础上进一步开发而成。pyPept 提供了一系列工具,可基于 FASTA、HELM 和 BILN 表示形式生成复杂肽的初始 3D 构象。pyPept 利用 SDF 格式的单体库,并与 RDKit 集成以实现化学信息学功能,同时还包含二级结构预测器。该库还支持 HELM、BILN 与 FASTA 之间的格式转换,从而能够借助 RDKit 实现无缝的 3D 模型生成。尽管 pyPept 可免费获取,但其需要本地安装并依赖命令行操作,对于非专业用户而言使用门槛较高。PEP-EDIT 则提供了一个用户友好的 Web 界面,可基于用户可扩展的单体库定义 BILN 序列,并结合交互式 2D 与 3D 可视化来辅助肽设计。此外,平台还扩展了 pyPept 的多项功能,包括面向数据库的单体库管理、pH 依赖的质子化、构象约束的简化定义、直观的单体与 3D 模板管理,以及协作式和交互式可视化工具。

2 材料与方法

2.1 PEP-EDIT 处理流程

PEP-EDIT 处理流程的简要概述。

图1 | PEP-EDIT 处理流程 BILN 序列首先被解析,并借助 pyPept 核心库(灰色部分)组装为分子图,其中单体定义由基于 MongoDB 的单体库进行解析。PEP-EDIT 扩展模块(紫色部分)进一步引入了基于 Dimorphite-DL 的 pH 依赖性质子化、基于二级结构预设或 PDB 模板骨架的可选坐标映射,以及采用逐步放松约束策略的迭代式 ETKDGv3 构象生成。该流程最终可生成 1D/2D 表示形式以及 3D 结构输出。

2.2 序列输入、解析与分子组装

PEP-EDIT 使用 BILN 格式作为其内部表示形式。用户既可以直接输入 BILN 序列,也可以导入 FASTA 或 HELM 表示形式。输入序列会通过修改版本的 pyPept 进行解析与验证,该程序会依据基于 MongoDB 的单体库对每一个单体符号进行解析。随后,经过验证的序列会依据各单体预定义的 R 基团连接位点,将不同单体子结构拼接组装为完整的 RDKit (https://www.rdkit.org) 分子图结构。PEP-EDIT 提供了一个公开的单体库,其中包含最初随 pyPept 发布的 324 个条目,并对部分单体分类以及质子化状态兼容性进行了小幅修正。

2.3 质子化

在分子组装完成后,系统会使用修改版本的 Dimorphite-DL,在用户指定的 pH 条件下(默认值为 7.4)进行 pH 依赖性质子化处理。部分 SMARTS pKa 定义经过调整,以更好地匹配氨基酸在生理 pH 条件下的已知行为,例如中性状态的酚基、酰亚胺基和酰胺基。经过质子化处理后的分子图结构,将作为二维结构绘制与三维构象生成的共同起始结构。

2.4 二维结构绘制与 1D/2D 输出

二维坐标通过 RDKit 的结构绘制算法进行计算。生成的 SVG 输出在残基与化学键层面进行了语义标注,从而支持浏览器中的交互式高亮显示以及基于拓扑结构的操作。除 2D 结构图(SVG 与 PNG 格式)外,PEP-EDIT 还会输出 BILN 与 HELM 表示形式、规范异构体 SMILES、InChI,以及包含标准化坐标的 2D SDF 文件。

2.5 三维构象生成

PEP-EDIT 使用 RDKit 的 ETKDGv3 距离几何方法支持三种单一三维构象的生成模式。

de novo 模式下,不施加任何空间约束;构象几何完全由分子拓扑结构以及 ETKDGv3 内置的知识项决定。

当指定结构约束时,系统会在构象嵌入之前执行坐标映射步骤。在二级结构引导模式下,用户可使用 DSSP 格式编码(H/E/–)为每个残基指定二级结构。主链 ϕ/ψ 二面角会被预设为经典 Ramachandran 构象值,其中 α-螺旋对应 −57°/−47°,β-折叠链对应 −120°/120°;对于 D-型氨基酸,则会进行角度镜像处理。在模板引导模式下,主链原子坐标会从实验解析得到的 PDB 结构中提取,模板既可通过 PDB 编号指定,也可由用户直接上传。系统支持用户自定义链选择、残基范围、位置偏移以及逐残基掩码,从而实现模板与目标肽之间的灵活映射。这使得受约束构象生成成为可能,即保守区域可继承模板构象,而发生修饰的位置则以 de novo 方式重新生成。在上述两种模式中,映射得到的坐标均作为构象嵌入过程中的空间约束条件。

对于所有模式,PEP-EDIT 均采用一种带有渐进式松弛的迭代嵌入策略,其设计受到大分子建模中受约束构象生成方法的启发:系统首先在施加 100% 约束条件的情况下尝试进行构象嵌入,随后逐步改为采用随机采样的约束子集(90%、80%、50%),并在每个阶段增加嵌入尝试次数。这一通过经验确定的策略,用于解决外部坐标约束无法与分子内在成键需求完全协调时所产生的几何冲突问题。在 de novo 模式下,同样会采用这种多次尝试策略,只是不施加约束条件,以提高构象嵌入成功率。一旦首次成功完成构象嵌入,整个流程即终止。

2.6 3D 输出

构象生成步骤会输出多种标准格式的结构文件,包括 PDB(包含残基与链注释)、带有 3D 坐标的 SDF 文件、XYZ 坐标块以及 MDL Molblock。此外,该流程还会借助 Open Babel 导出 Tripos MOL2、AutoDock PDBQT(包含 Gasteiger 部分电荷)以及 mmCIF 格式文件。系统还会提供一张基于 Mol* Viewer 生成的 3D 结构 PNG 快照。所有 3D 构象均可在 Mol* 中进行交互式显示,并支持多种结构表示方式、残基标注以及 PDB 骨架模板叠加显示,以便进行可视化比较。所有输出文件既可单独下载,也可打包为单个 ZIP 压缩文件下载。

2.7 架构实现

PEP-EDIT 是一个客户端–服务器架构的 Web 应用。服务器端后端基于 Python Flask REST API 构建。持久化数据(包括单体定义、会话元数据以及构象任务记录)存储于 MongoDB 中。三维构象生成任务会被分发至 Celery 工作进程执行,并使用 Redis 作为消息代理,从而实现支持实时进度报告的异步计算。客户端前端则是一个 React 单页应用,并结合 Material UI 与 Tailwind CSS 进行界面样式设计。源代码可通过 https://gitlab.rpbs.univ-paris-diderot.fr/rpbs/pypept-api 获取。

2.8 PEP-EDIT 网络服务器界面

PEP-EDIT Web 服务器界面由三个主要面板组成。肽序列通过实时文本输入框以 BILN 表示形式进行输入与编辑。该序列编辑器支持多链编辑、基于拖放的残基重排序、化学键连接与断裂模式,以及撤销/重做功能(最多支持 20 步操作)。结构约束可按残基进行定义,包括二级结构状态(螺旋、折叠链、无规卷曲),也可以通过导入 PDB/mmCIF 骨架模板,并结合逐残基映射控制进行设置。质子化状态会在用户指定的 pH 条件下进行计算,默认 pH 值为 7.4。系统还提供了 15 个预设示例,涵盖线性肽、环肽、封端肽以及受约束肽,以帮助新用户快速上手。

图 2 | PEP-EDIT Web 服务器界面(A)PEP-EDIT 网络服务器界面的总体组织结构。(B)单体编辑功能的组织结构。

三个分子视图——序列编辑器、2D 结构图以及 3D 查看器——彼此完全同步:对 BILN 序列的编辑会实时触发 2D 结构图以及可用 1D/2D 输出格式的更新,而单体悬停事件也会在三个面板之间实时同步传播。2D 结构图支持通过图形化连接/断开模式进行交互式化学键创建与删除。由 Mol* Viewer 驱动的 3D 查看器则提供多种结构表示方式,包括 cartoon、ball-and-stick、surface 和 licorice 等,同时支持可调颜色方案、残基标注以及 PDB 骨架模板叠加显示,以便进行可视化比较。对于短肽(少于 8 个单体),系统会自动触发3D构象生成;对于更大的结构,则采用按需启动方式,以保持界面响应性能。

资源面板提供三个标签页视图:一个可搜索的单体库(可按类别筛选,包括标准氨基酸、非天然残基以及封端基团)、一个提供 12 种导出格式的输出面板,以及一个记录所有构象生成任务及其状态的任务历史列表,用户可从中完整恢复任意先前结果。

在 PEP-EDIT 中,每个单体都以化学结构层级进行定义,其具体形式为 molblock(SDF 格式的核心数据结构),并附带连接位点与相关元数据注释,同时通过其符号在 BILN 序列中进行引用。因此,BILN 本质上是一种用于描述肽拓扑结构与连接关系的序列层级语言,而 SDF 则负责提供底层单体化学结构信息。除内置的 324 个单体库之外,用户还可通过两种方式设置自定义单体:(i)引导式向导模式:用户输入 SMILES 字符串后,可通过交互方式选择化学键以定义连接位点,随后指定兼容 BILN 的单体符号及相关元数据,从而获得经过验证、可立即用于序列构建的单体定义;(ii)直接导入兼容 PEP-EDIT 的 SDF 文件:其中每条记录均需包含正确设置的连接位点(离去基/R 基团)、单体符号以及所需元数据属性。系统支持多记录 SDF 文件,同时用户也可以将自定义单体集合导出并重新导入为 SDF 格式。用户还可通过审核流程提交单体,以纳入公共单体库。

PEP-EDIT 使用基于匿名 ID 的会话机制,无需创建账户即可在多次访问之间保持会话持久化。会话中包含个人单体与任务历史记录,并且用户可通过共享会话标识符与协作者共享整个工作环境。此外,PEP-EDIT 还在 n.eko 环境中部署了专用实例 (https://neko.rpbs.univ-paris-diderot.fr/?usr=guest&pwd=rpbs),从而支持在单一共享会话中的同步协同编辑。在该模式下,所有用户操作都会实时同步至所有已连接客户端。这一机制可支持远程协作以及交互式教学场景。

3 案例研究

简要展示 PEP-EDIT 在不同任务中的使用方式。

3.1 Epidermin 表示形式的生成

Epidermin 属于一类称为 lantibiotics 的多环肽抗生素,其名称来源于“含lanthionine 的肽类抗生素”这一特征。其抗菌活性来源于在细菌细胞膜中形成孔道。然而,其具体作用机制较为复杂,目前尚未被完全阐明。Epidermin 由核糖体合成,并在成熟过程中经历翻译后修饰,从而形成具有生物活性的最终结构。该分子由 21 个氨基酸组成,其中包含两种非蛋白源性氨基酸,分别为 2-氨基异丁酸和脱氢丙氨酸。此外,epidermin 含有四个硫醚环结构,其中包括两个 meso-lanthionine、一个 (2S,3S,6R)-3-methyllanthionine,以及一个包含 S-[(Z)-2-aminovinyl]-D-cysteine 的特殊环结构。

为了构建 epidermin,需要首先利用 PEP-EDIT 的 “My monomers” 功能定义若干缺失单体:包括一种修饰丙氨酸(Ala)和一种修饰 2-氨基丁酸(Abu),两者均能够通过其侧链甲基形成化学键;此外还定义了用于桥连的硫化氢酸(H2S)以及 2-氨基乙烯醇(AET)单体。这些单体随后已被纳入 PEP-EDIT 公共单体库中。随后,将位于第 3 和第 7 位的修饰丙氨酸通过一个 H2S 单体进行连接;同时,将位于第 8 位的 2-氨基丁酸与位于第 11 位的丙氨酸通过另一个 H2S 单体进行连接。最后,利用一个 2-氨基乙烯醇(AET)单体,在对应 Ala 19 的丙氨酸与 Ala 21 的羧基末端之间形成最后一个环结构。

图 3 | Epidermin 表示形式 (A)由 PEP-EDIT 网络服务生成与 2D 表示形式(B)由 PEP-EDIT 网络服务生成与 3D 表示形式表。同时给出了对应的 BILN 序列。

3.2 对与伴侣蛋白相互作用的肽进行编辑

BCL-2 家族蛋白通过蛋白–蛋白相互作用调控内源性细胞死亡通路,从而控制线粒体外膜通透化。其中,部分成员发挥抗凋亡作用,而另一些成员则诱导细胞凋亡。因此,针对 BCL-2 家族蛋白之间相互作用的研究受到广泛关注,以期设计能够恢复癌细胞凋亡能力的治疗分子。

BCL-xL 是一种凋亡相关蛋白,其能够通过 BAD 蛋白的 BH3 结构域与之发生相互作用。目前,BCL-xL 与 BAD 的 BH3 结构域片段形成复合物的结构已经得到解析(PDB ID: IG5J)。BAD 肽必须采用 α-螺旋构象才能与 BCL-xL 结合。因此,已有多项研究尝试通过构象约束使该肽稳定保持 α-螺旋结构。

借助 PEP-EDIT,可以方便地引入诸如马来酰亚胺基团等约束结构,以稳定 α-螺旋构象。RYGRELRCMSDCFVDSFKK 肽是 Zhang 等人研究中的一个实例,用于展示 PEP-EDIT 的“结构约束”功能。其中,α-螺旋结构通过使用 IG5J PDB 结构中的 B 链作为模板进行施加,并采用 6 个氨基酸的序列偏移,以保持待研究肽与 PDB 复合物中肽序列之间的序列同源性。随后,系统构建了马来酰亚胺基团,并将其连接至该肽中的两个半胱氨酸残基。最终,在考虑 α-螺旋约束条件的情况下,生成了该肽的3D结构。

图 4 | RYGRELRCMSDCFVDSFKK 肽的 2D 表示形式 (A)线性结构。(B)在两个半胱氨酸残基之间引入马来酰亚胺基团后的受约束结构。(C)该肽的 3D 表示形式,其中黄色部分为作为 RYGRELRCMSDCFVDSFKK 肽模板的肽结构,白色部分为 BCL-xL 蛋白。(D)在两个半胱氨酸残基之间引入马来酰亚胺基团,并被约束为 α-螺旋构象的肽结构。

3.3 以PEP-EDIT 生成的构象作为分子动力学或量子化学模拟的输入

为了展示 PEP-EDIT 所生成构象在分子建模中的通用性,评估了其在增强型分子模拟与量子力学优化中的应用。对于环肽 bremelanotide ——一种已获批用于治疗性欲减退障碍的黑皮质素受体激动剂,其 BILN 表示为 Ac-Nle-D(1,3)-H-dF-R-W-K(1,3)——采用 simulated tempering(ST)方法(10 µs,OpenFF 力场)后,系统能够充分探索其构象空间。模拟过程中获得的最小主链 RMSD 相对于实验结合结构(PDB ID 7F55)达到 1.2 Å,并且尽管模拟对象为未结合状态肽分子,仍能够在主要溶液构象簇中识别出接近天然态的构象。此外,主要构象状态在前约 2 µs 内即可完成采样,表明该模拟具有较快收敛性。另外,对于一个由 10 个氨基酸组成的环肽 [BILN: A(1,1)-A-R-dV-dP-R-dL-dT-P-E(1,2)],采用近期发表的粗粒化协议进行短时间 REMD 模拟(50 ns)后,也能够恢复与实验参考结构接近、达到亚埃级精度的构象,显示出该工作流程的高效性。最后,PEP-EDIT 生成的结构同样能够直接作为量子化学优化(例如,ORCA)的输入。在 QM 构象优化过程中,结构与实验结果之间的一致性可进一步提升。对于由 5 个氨基酸组成的环肽—— cilengitide,PEP-EDIT 生成构象与实验结构之间的偏差为 1.41 Å,而经过 QM 采样后,则可进一步识别出 RMSD 仅为 0.82 Å 的构象。综上结果表明,PEP-EDIT 能够提供适合作为分子动力学与量子力学优化流程起始结构的有效模型。

**图 5 | **(A)利用 REMD 对一个近期采用粗粒化模拟研究的 10 氨基酸头尾环化肽的由 PEP-EDIT 生成的初始构象进行优化。由 PEP-EDIT 获得的初始 3D 构象与参考结构之间的主链 RMSD 为 3.2 Å。最高占比构象簇的代表性结构则仅具有 0.3 Å 的主链 RMSD。(B)利用 OpenFF 力场对 Bremelanotide 的由 PEP-EDIT 生成的初始构象进行 ST 优化。由 PEP-EDIT 生成的初始 3D 模型主链原子(相对于参考结构的主链 RMSD 为 2.2 Å)以紫色棒状形式显示。与实验结构之间具有最小主链 RMSD(1.2 Å)的 ST 优化后构象以绿色棒状形式显示。参考结合结构(PDB ID 7F55)以灰色棒状形式显示。(C)利用 ORCA 的 GOAT 算法为孤儿环肽药物 cilengitide 生成的最佳构象。在该实例中,研究采用了半经验方法 GFN2-xTB,并结合 ALPB 溶剂化模型,但预计更高计算代价的方法将获得更高精度结果。由 PEP-EDIT 生成构象与实验结合参考结构(PDB 1L5G)之间的初始偏差为 1.41 Å,而 ORCA 则能够进一步采样更多构象,其中最佳构象达到 0.82 Å RMSD。结构颜色定义如下:灰色表示实验结构;紫色表示由 PEP-EDIT 生成的初始 3D 构象;绿色表示经过构象采样后获得的最佳构象。图中下方同时给出了各肽的 BILN 序列。

4 结论与未来工作

PEP-EDIT 被设计为一种用户友好且可持续发展的网络资源,用于快速生成复杂肽的 1D、2D 与 3D 表示形式。其界面功能丰富,并集成了多种功能模块。

一方面,PEP-EDIT 提供了结合交互式可视化的肽编辑与生成功能,实现了 1D、2D 与 3D 表示形式之间的同步联动。其一个重要优势在于对 2D/3D 约束条件的处理能力,这使其相比主要满足局部几何约束的 RDKit,能够生成更加真实的 3D 构象。多种格式的输出结果也使生成的初始构象能够与其他工具协同使用,这一点已在相关应用实例中得到展示。另一方面,通过结合公共单体库与用户自定义单体库,PEP-EDIT 的适用范围被扩展至当前单体库之外,从而为用户提供了更高灵活性。最后,PEP-EDIT 还集成了协作与教学相关功能。单体库与会话共享、界面交互性以及与 n.eko 等平台的集成,进一步提升了其在教学与团队协作中的应用价值。

PEP-EDIT 在短期内计划进行的功能演进,旨在解决当前的一些局限性,例如确保环化过程中所生成非肽键的化学兼容性。将单体库与 CCD 进行连接同样具有重要意义,虽然这也会带来命名规范方面的问题。在中期发展方向上,可进一步考虑集成理化性质或 ADMET 性质预测工具。从长期来看,未来可能会开发与 3D 构象优化工具之间更加稳健的接口,其中包括针对整个单体库的力场参数支持。然而,这将需要对所采用的相关计算协议进行严格评估。