TIDD 2026 | 计算驱动范式在靶向多肽药物设计中的演进:从预测建模到生成式人工智能及临床转化

今天介绍的是发表在 The Innovation Drug Discovery 的一篇综述论文。该研究聚焦靶向多肽药物设计领域,系统梳理了计算驱动范式的演进脉络,重点探讨了从传统预测建模、分子模拟到生成式 AI(如 RFdiffusion、ProteinMPNN)的技术跃迁,并深入分析了 AI 与物理验证闭环融合、非天然氨基酸整合及临床转化的关键路径。研究总结了现有技术瓶颈,明确了 AI 与多模态融合的未来方向,为解决多肽稳定性差、膜通透性低等难题提供了系统性框架。该工作对于推动计算技术赋能多肽药物研发、加速从虚拟设计到临床候选分子的转化具有重要参考价值。

获取详情及资源:
0 摘要
靶向多肽类治疗药物能够有效作用于各类难以实现药物开发的胞内靶点,但这类药物在临床转化进程中,始终受限于细胞膜穿透能力弱与代谢稳定性不佳两大问题。如今高性能计算技术与人工智能技术相互结合,正推动相关研究从传统经验式筛选模式,逐步转向具备科学性的全新自主设计模式。该综述不再局限于逐一罗列各类研究工具,而是搭建起一套融合物理机制验证与生成式深度学习技术的完整研究体系。内容深入探讨分子动力学模拟与分子对接方法在热力学性质验证中的协同运用效果,同时分析扩散模型与蛋白质语言模型如何大幅提升海量化学空间的挖掘与探索效率。研究梳理出一套可将药代动力学相关限制条件融入智能生成算法的闭环研究流程,既全面汇总该领域现阶段的各项研究成果,也为实现生成式人工智能与物理机制验证技术的深度融合规划清晰发展方向,进一步推动经由计算手段设计得到的多肽药物,从虚拟理论设计方案顺利转化为具备实际应用价值的临床候选药物。
1 引言
多肽占据着独特的药物研发应用领域,有效填补了传统小分子药物与复杂生物制剂之间的研发空白。从化学定义来看,多肽是由 2 至 50 个氨基酸残基构成的链状物质,凭借独特的物理相互作用能力,具备诸多小分子药物难以比拟的优势。小分子药物分子结构通常较为固化,只有结合靶点内部深腔结构才能稳定发挥结合作用,而多肽拥有极强的构象柔性,分子界面接触面积可达Å。这一特性让多肽能够特异性结合各类缺乏深腔结构的平整宽阔生物作用界面,作用于以往被认定为难以成药的药物靶点。在靶向细胞内蛋白质相互作用网络的研究中,多肽展现出远优于传统小分子药物的作用效果。与此同时,相较于单克隆抗体类药物,多肽类治疗药物还具备组织渗透能力更强、免疫原性更低、制备生产成本更低等诸多优势,不过这类优势的发挥,需要依托特定的氨基酸序列修饰手段与制剂优化方式来实现。胰高血糖素样肽 - 1 受体激动剂类药物便是多肽药物临床应用的典型代表,利拉鲁肽、司美格鲁肽等多款同类药物问世后,彻底革新了代谢类疾病与心血管疾病的治疗方式,也正式奠定了多肽药物在现代制药行业中的重要地位。
尽管多肽药物拥有广阔的治疗应用前景,但药代动力学层面的诸多难题严重制约着其临床大范围应用。核心制约因素来源于多肽灵活多变的分子结构,这类分子进入生物体内后极易遭到破坏。多肽进入血液后,会迅速被二肽基肽酶等各类体内酶类物质识别并降解,药物活性快速丧失,体内有效作用时长大幅缩短,难以在患者体内维持稳定有效的药物治疗浓度。除此之外,多肽还极易经由肾脏快速排出体外,其偏小的分子尺寸能够被肾脏高效滤除,致使多数多肽药物在体内仅能维持数分钟的有效作用时长,药物作用周期过短成为临床治疗推进过程中一大棘手难题。多肽本身具备强亲水性,再加上自身分子体积偏大,还难以穿透各类生物膜结构,这也极大增加了多肽口服制剂的研发与应用难度。为攻克多肽成药过程中存在的各类难题,传统药物化学研究大多依靠经验化修饰手段进行优化,比如借助主链环化实现分子构象约束、引入非天然氨基酸避免酶解破坏、采用聚乙二醇修饰延长药物体内循环时长等。但这类反复试错的研究方式不仅耗费大量时间与人力,还无法在数量庞大的氨基酸序列组合中,高效平衡多肽药物的生物活性、结构稳定性与跨膜渗透能力三者之间的关系。
随着高性能计算技术持续发展,结构生物学相关研究数据呈指数级增长,依托计算科学驱动的药物研发模式迎来全方位变革。分子模拟技术早已脱离单纯辅助实验研究的定位,逐步成为理性药物设计工作的核心支撑手段,药物研发也从过往的随机筛选模式,转变为依托理化基础原理、融合人工智能技术的理性精准设计模式。利用同源建模与分子对接技术,能够在原子层面精准预判多肽与蛋白质之间的结合作用形式;分子动力学模拟则进一步融入时间维度,清晰还原多肽在生理环境下的动态折叠过程与各类构象聚集状态。阿尔法折叠、蛋白质语言模型等人工智能相关技术,也突破了传统研究方法在柔性多肽空间结构预测方面存在的诸多局限。多种前沿技术深度融合,不仅大幅加快了药物先导化合物的筛选与发掘速度,也为解决多肽构象不稳定、跨膜递送困难等行业痛点提供了全新研究思路。相关研究系统梳理了各类计算研究技术的发展历程,着重阐释各类计算研究策略如何实现靶向多肽治疗药物全流程一体化设计。
2 靶向多肽发现中的主流分子建模方法
多肽药物研发领域已然摆脱以往依赖传统试错筛选的研究模式,逐步迈入系统化、理性化的设计发展阶段。这场行业变革主要依托同源建模、分子对接与分子动力学模拟三大核心建模技术实现。诸多相关研究表明,借助这类计算研究工具,多肽药物相关研究能够脱离以往主观推测的研究思路,直观观测多肽在原子尺度下的各类行为特征。借助上述研究手段,科研人员可以精准预判多肽的折叠方式,实时评估其结构稳定程度,还能定量测算多肽与靶标蛋白之间的结合亲和力。依托这类清晰明确的结构研究结论,研究人员能够对先导多肽序列开展精准改造优化,在开展实体实验验证之前,就让候选多肽具备优异的靶向结合能力。

图1|肽类药物的优势与挑战示意图 这张图清晰地展示了 肽类药物(Peptide Therapeutics) 作为介于小分子药物和生物大分子药物之间的一类分子,其核心优势与临床转化面临的关键挑战。
2.1 同源建模
同源建模依托经典进化理论,即序列具有相似性的蛋白质与多肽,通常会形成相近的三维空间结构。相关研究指出,依托这一内在关联,便可借助已知成熟结构模板预测未知靶点空间构型,对于暂时缺乏实验解析结构数据的作用靶点而言,该方法是实现结构可视化不可或缺的重要手段。在靶向多肽的研发工作中,该技术既能够完善补齐靶标蛋白的结构信息,也可重构来源于天然配体与功能活性片段的生物活性多肽空间构象。同源建模的常规操作流程包含模板筛选、序列比对以及模型精细优化等步骤,其预测精准度与模板质量、序列同源相似度密切相关。当待测序列与模板序列的同源相似度超过30%时,所构建模型的主链构象与结构基序的可靠程度会得到大幅提升。如今这类技术不再局限于静态结构预测,还可进一步解析结构特征对生物功能的调控机制。有研究提出,将计算模型与实验数据相结合,能够精准筛选出决定生物活性的特定结构特征,以此为依据完成多肽序列的理性优化设计。不过该方法依旧存在一定局限,在高度柔性的环状区域与无序结构域的建模工作中仍存在难度,这类区域内序列差异和结构偏差不存在线性对应关系,因此必须开展严格的模型验证与多模型比对分析。
除此之外,同源建模也已成为调控蛋白质相互作用的核心研究手段,能够助力攻克诸多以往难以成药的作用靶点。该研究思路以竞争性多肽设计理念为基础,先搭建靶标蛋白与其天然结合配体的复合结构模型,从中提取结合界面处的多肽片段作为结构设计模板。通过系统解析二者结合界面,筛选出对结合自由能起到主导作用的热点氨基酸残基,完成平整型生物作用界面的精准特征绘制。该研究思路已得到广泛实际应用,在 MDM2/MDMX 家族与 BCL-2 家族抑制剂的研发过程中,借助计算建模手段优化核心界面相互作用,成功将天然活性片段改造为高亲和力抑制类多肽药物,充分印证了该方法的实用价值。
2.2 分子对接
分子对接能够模拟分子结合构象、量化相互作用强度,是解析多肽与蛋白质识别规律的关键手段,可为多肽筛选与结构优化提供结构层面的参考依据。和小分子配体不同,多肽的主链与侧链均具备固有柔性,构象分布范围更广,这对对接算法的构象采样能力提出了极高要求。为真实还原生物体系内的相互作用状态,现阶段相关技术不再局限于静态刚体结构假设,逐步引入多构象采样与多姿态结合的研究思路。该研究理念认可结合作用属于动态平衡过程,体系内会同时存在多种能量优势构象,并非仅对应单一固定结构形态。
常用的对接方式包含模板匹配、局部搜索与全局搜索三类,具体选用方案取决于已有结构信息的完备程度。传统小分子对接程序在处理长链多肽片段时存在明显短板,难以精准捕捉多肽主链构象重排以及诱导契合效应。针对这一问题,各类专用算法得以研发优化,可充分适配多肽链柔性变化与受体侧链结构调整的特性。大量研究证实,这类新型分析工具既能阐释实验测得的抑制活性与作用选择性,还可以定位关键氢键作用网络和疏水结合位点,为后续的序列改造与构象约束设计提供明确的结构参考依据。
分子对接算法的选用,本质上需要在采样全面性与原子解析精度之间做出权衡取舍。全局对接工具侧重遍历蛋白质整体表面,以此搜寻潜在结合位点,这类方法多采用粗粒度模型,容易忽略细微的诱导契合结构变化。局部优化算法能够输出高精度的原子层面细节,但倘若初始结合构象与天然状态偏差较大,计算过程便极易陷入局部能量极小值。为平衡两类算法的优缺点,相关研究提出层级化对接思路,先借助粗粒度全局算法锁定结合热点区域,再通过高精度局部优化方式优化界面原子间的相互作用。对于环肽这类特殊拓扑结构,常规算法无法妥善处理主链约束结构,需要依托 AutoDock CrankPep 等专用程序开展运算。这类先进采样算法具备实际转化应用价值,科研团队借助相关技术成功研发出口服 PCSK9 抑制剂 MK-0616,依靠计算分析固定大环骨架结构,让药物同时具备优异生物活性与肠道渗透能力。
多肽与蛋白质对接过程中,核心难点集中在柔性结构处理、评分函数适配以及结合位点判定不确定性三个方面。多肽游离状态下通常无法维持固定构象,发生结合作用时,其主链与侧链往往会出现大幅度结构重排,受体蛋白也会随之产生诱导构象变化。这种双向结构柔性大幅提升了构象采样的难度,传统刚体对接模式难以精准还原真实的相互作用特征。针对这一问题,相关研究引入诱导契合与构象筛选模型,搭配多种受体构象集合开展运算,有效提升预测结果与实际生物状态的契合度。以 RAPiDock 为代表的原生人工智能扩散模型,为复杂构象处理开辟了全新思路,能够高效推演高维能量分布态势。这类生成式模型逐步对随机空间坐标进行降噪处理,筛选出优质结合构象,可有效规避传统采样算法易陷入局部能量极小值的问题,成为物理结构优化方法的有力补充。聚类分析也在对接结果解析中发挥着愈发重要的作用,对海量对接构象开展结构聚类划分,能够筛选出最具代表性的结合模式,降低无效杂散构象对结果分析造成的干扰。

图2|靶向肽类药物设计:AI 与物理方法结合的闭环工作流 这张图展示了靶向肽类药物设计的一套整合化、闭环式研发流程,核心是通过 AI 驱动生成、物理方法验证、实验筛选迭代,来加速候选肽药物的发现与优化。
2.3 分子动力学模拟
在对接预测结果的基础上,分子动力学模拟能够引入时间维度,进一步评估多肽 - 蛋白质复合体系的结构稳定性与动态变化特征。该技术依托经典力场求解原子运动方程,模拟分子体系在溶剂环境中的演变过程,可直观观测多肽随时间发生的折叠行为、构象转变以及分子间相互作用变化。区别于静态对接模型,分子动力学模拟能够兼顾原子级结构柔性、溶剂效应与热扰动影响,在探究结合稳固程度与作用存续状态方面具备突出优势。在多肽药物设计工作中,该方法常用来评估候选多肽序列的构象稳定性,分析关键相互作用的维系情况,同时对比各类结构修饰方式对体系动态特性产生的影响。相关研究借助分子动力学模拟助力司美格鲁肽的结构优化,证实亲水连接链具备充足柔性,既能结合白蛋白,又不会破坏胰高血糖素样肽 - 1 片段与受体之间的核心作用,以此验证延长体内作用时长的改造方案不会损耗药物治疗活性。随着计算算力与算法效率不断提升,分子动力学模拟可处理更大规模的体系,模拟时长也得以延长,能够更加深入地探究多肽复杂多变的构象空间。

图3|MMST模型在不同分子量范围下的适用域分析结果 这张图清晰对比了肽类药物设计的三代研发模式,直观展现了从低效试错到精准理性设计的技术演进过程。
溶剂模型与力场参数的选取,对多肽分子动力学模拟结果有着关键性影响。显式溶剂模型可以更为精准地还原氢键网络与水化作用,但会带来更大的计算开销。隐式溶剂模型运算效率更高,却难以精细刻画微观相互作用,模拟精度会有所下降。
除了需要权衡溶剂模拟精度与计算成本外,多肽模拟过程还长期面临能量地貌起伏复杂、存在大量局部极小值,难以完成全面构象采样的难题。为改善采样效果,副本交换分子动力学、结合加速分子动力学与元动力学的分层混合模拟方法等增强采样技术得到广泛应用。副本交换分子动力学借助多温度副本体系翻越能量壁垒,该方式已成功应用于淀粉样多肽的结构解析工作。混合模拟手段依托加速分子动力学快速扫描各类构象,搭配元动力学精准计算自由能,能够有效提升预测准确度。另有研究证实,机器学习算法可对分子动力学模拟形成有效引导,助力快速搜寻关键构象区间,加快计算收敛速度,以此攻克高维度构象采样与稀有结构转变过程带来的模拟难题。

图4|肽 - 蛋白质分子对接的策略分类与常用工具这张图以 “对接工具(DOCKING tools)” 为核心,系统梳理了肽 - 蛋白质分子对接的三大主流策略及对应工具,是肽类药物理性设计中关键的计算模拟方法分类。
3 机器学习与靶向多肽发现中的结构建模
多肽药物设计正从经验化研发模式逐步转向数据驱动模式,人工智能技术成为衔接序列、结构与功能关联的重要支撑。传统分子建模技术依托明确的物理理论假设开展运算,所采用的能量函数也会消耗大量计算资源,而机器学习与深度学习能够从已有的多肽及生物活性数据中挖掘内在规律。这类技术融合模式不仅提升预测效率,扩大设计适用范围,也推动多肽研发体系发生根本性变革。多肽研发领域的人工智能技术按照功能可划分为两大类,一类是判定结构与功能特性的预测模型,另一类则是依照特定治疗要求生成全新多肽序列的生成模型。
3.1 预测式 AI:从序列到结构与功能
预测模型主要用于精准建立多肽序列与三维构象、生物活性之间的对应关系。依托功能注释数据训练而成的传统方法打下了相关研究基础,而 AlphaFold 的出现大幅革新了结构解析能力,能够实现高精度结构预测。该模型借助多序列比对提取进化信息,并结合注意力机制捕捉氨基酸残基之间的长程关联作用,在多肽 - 蛋白质复合物建模与结合模式分析中表现突出,可有效处理传统对接算法难以攻克的诱导契合构象变化问题。凭借逼近实验检测水准的预测精度,AlphaFold 能够对生物筛选得到的候选多肽序列开展严谨的结构验证。
基于序列比对的模型具备出色的预测精度,而 ESMFold 等新型蛋白质语言模型则在计算效率上实现大幅突破,二者可以形成良好互补。AlphaFold 需要开展运算量庞大的多序列比对工作,ESMFold 则依托海量序列数据库,仅依靠单一序列就能直接完成结构预测。该模型的运算速度可提升一个数量级,适合用于高通量筛选场景,能够快速完成上百万条候选多肽的评估工作。现阶段逐步形成分级预测的应用模式,借助 ESMFold 完成大规模快速筛选,再使用 AlphaFold 对筛选出的优质候选多肽开展精细化结构优化。
对各类主流技术开展综合对比能够发现,不同方法在预测精度、计算拓展性以及构象异质性捕捉能力上各有优劣。AlphaFold 这类进化算法在结构预测层面精度表现突出,但该技术高度依赖多序列比对数据,在解析全新人工设计序列或缺少同源参考信息的特殊多肽时,预测可靠度会明显下降。蛋白质语言模型跳出了这一限制,通过学习氨基酸序列内在排布规律,可实现毫秒级推理运算。ESMFold 即便对低复杂度序列的预测精度略有缩减,依旧十分适用于超大序列文库的筛选工作。相关研究提出,实际应用中需要平衡筛选通量与结构解析精细度,可采用语言模型对数百万分子开展初步筛选,再利用 AlphaFold 完成先导分子优化,该模型精准表征界面空间位阻的能力难以替代。完整合理的计算流程会依据研发阶段的实际需求,灵活搭配选用各类技术方法。

图5|AI 驱动的肽类药物发现工作流这张图系统展示了 AI 技术在肽类药物研发中的三类核心应用范式,分为预测模型、生成模型和闭环优化三大模块。
3.2 生成式 AI:从头设计与化学空间探索
面对不断发展的多肽生成设计领域,相关综述依据驱动生成过程的核心数据形式搭建分类体系,按照输入信息形态、优化目标取向以及模型输出形式划分技术类别。输入形式涵盖一维序列到三维空间坐标,优化目标包含提升化学多样性、保障空间结构互补性等方向,输出形式则分为直接生成空间结构与隐式序列表征两种类型。该体系将设计方法划分为序列优先生成、结构优先生成以及序列结构协同优化三类。通过对各类生成框架开展系统评估,能够明晰不同方法在运行条件、拓扑约束与开源使用权限上的显著差异。序列优先生成模式侧重挖掘序列空间,筛选具备理想理化特性的全新结构基序。变分自编码器、生成对抗网络等经典模型,可将离散的氨基酸序列映射至连续隐空间,在此空间内采样便能得到丰富多样的候选多肽,涵盖抗菌肽、细胞穿透肽等类型,多样性远超天然多肽数据库。这类设计方式对于空间结构动态变化、构型约束较弱的功能多肽有着良好的适配效果。
为满足高亲和力结合所需的空间结构约束,RFdiffusion 及其新版模型 RFdiffusion3 等前沿算法实现领域革新,这类模型将靶标蛋白结合口袋作为条件输入,从零完成多肽主链结构生成。算法以空间结构互补性为核心准则,对随机空间坐标逐步降噪处理,构建出能够精准贴合靶标作用界面的多肽骨架。该设计思路有效适配蛋白互作用平面等以往难以成药的位点,这类位点的结合作用高度依赖精准的结构匹配效果。相关研究借助该技术快速设计出新冠病毒微型蛋白抑制剂,短短数月便获得皮摩尔级结合活性,省去传统抗体研发漫长的亲和力成熟流程,印证生成模型能够大幅加快药物研发响应速度。以 ODesign 为代表的全域互作用设计模式进一步拓展技术边界,可应对动态结构耦合带来的复杂问题。这类模型不再将作用靶标视作固定不变的约束条件,而是把多种生物分子相互作用整合至同一生成框架中,逐步朝着多模态、互作用感知的方向发展,能够真实反映多肽与靶标之间双向协同的结构适配变化。
这类技术虽具备变革性应用潜力,但虚拟设计结果与实验室实际合成可行性之间仍存在明显差距。将理论上结构最优的多肽骨架转化为可稳定存在的实体分子,已然成为生成式设计面临的核心阻碍。现阶段扩散模型虽可以良好满足空间结构约束条件,却容易出现结构幻象问题,也就是模型生成的多肽骨架虽在形态上能够与靶点契合,却违背维持分子稳定所需的基础理化规律。
这类失真结构常常出现孤立的二级结构,缺少规整的疏水核心,或是疏水区域过多暴露于溶剂环境中。即便这类计算设计产物在评估中拥有较高置信度与理论结合活性,实际实验验证阶段依旧容易出现分子聚集、溶解性不佳,或是无法在溶液中维持稳定折叠形态等问题,最终难以达到预期效果。ProteinMPNN 等序列复原工具不仅能够求解逆折叠相关问题,还可充当重要筛选手段,打通空间结构设计与实际化学性质之间的壁垒。
3.3 ADMET 与成药性评估
生成式人工智能模型与结构预测算法大幅推动靶点结合亲和力的优化,但虚拟计算得出的高结合活性,并不能直接等同于体内实际治疗效果。多肽候选药物最终难以投入临床应用,大多源于吸收、分布、代谢、排泄与毒性方面的缺陷,常见问题包括蛋白水解速度快、生物膜穿透能力不足。线性多肽的这类转化缺陷表现得尤为突出,相较于环肽,线性多肽不存在构象束缚,全新设计的线性骨架极易被酶降解,也难以穿透脂质双分子层。因此,在计算设计流程中同步纳入理化性质预测环节,已经成为必不可少的研发步骤。
机器学习与深度学习技术不断迭代,现已构建起成熟的序列模型与图结构模型,能够在合成实验开展前,精准预判多肽各项成药关键指标。针对难以成药的胞内靶点,各类预测工具可筛选并设计具备膜穿透能力的特征序列。CellPPD、MLCPP 等序列类机器学习模型依托海量已知跨膜序列数据,挖掘调控细胞摄取效率的理化特征。多肽易被机体快速清除,因此需要借助虚拟手段精准预判体内药效留存时长。PlifePred 等新型智能工具可依据序列特性,测算多肽在生物基质中的半衰期,同时定位蛋白酶酶切位点。规避免疫不良反应与脱靶毒性,也是多肽成药过程中必须把控的要点。ToxinPred 分类模型结合支持向量机与定量结构毒性关系算法,依托氨基酸组分和二肽分布规律,评估多肽溶血作用与整体毒性水平。
表 1 |基于序列信息预测肽三维结构的常用 AI 方法对比表

单纯依靠序列性质预测工具有时会出现误判,对于突破已知化学空间的全新线性骨架而言,这类问题更为常见。目前主流计算流程会将一维序列预测手段与三维结构及动力学验证相结合。候选序列完成初步筛选后,便可借助 AlphaFold 等结构预测模型,观测分子溶剂可及表面积,同时标注蛋白酶切割位点的静电势分布。GROMACS 等分子动力学模拟程序能够开展物理层面的严谨验证,在显式水环境中模拟多肽行为,系统追踪均方根偏差、回转半径等时序参数。这类动态分析可以有效区分结构稳定的线性序列,以及生理环境中容易快速解构、发生聚集的序列。在研发前期提前剔除药代性质不佳的候选分子,能够保障后续优化工作集中作用于具备成药潜力的多肽结构。
表2 | 主流肽设计与逆折叠生成式 AI 框架综合汇总表

3.4 闭环整合
预测模型与生成模型相互配合,搭建起完整可靠的端到端设计体系,全面提升多肽药物的研发价值。整套流程一般先借助扩散模型生成优质多肽骨架,再运用 ProteinMPNN 等图神经网络算法完成逆折叠运算。该算法能够将三维骨架结构精准转化为对应的氨基酸序列,保证序列可按照设计形态完成折叠,让生成模型设定的空间结构特征完整保留在最终的多肽分子组成当中。
完成序列复原后,AlphaFold 等结构预测模型与结构感知机器学习模型会充当核心筛选工具,在生成、评估、反馈的迭代优化闭环中,判定结构可靠度与结合界面合理性。这类模型无需直接计算热力学结合亲和力,而是以预测对齐误差、界面模板建模得分等置信指标作为快速评判依据,在开展高精度物理验证前完成候选结合分子的初步排序。迭代过程中,结构置信度与界面质量评分会回传至生成模型,用以收敛搜索范围、调整参数分布。借助主动学习策略,模型逐步聚焦于具备优异结合界面的化学空间区域,有效降低误判样本占比。为保障临床转化潜力,优化流程不再局限于亲和力提升,还会嵌入序列与结构性质预测模块,依托多目标优化策略约束药代特性与成药性能。整套体系设置硬性判定规则,一旦生成序列超出分子量、聚集倾向等基础理化阈值便直接剔除,同时搭配多目标奖励函数,在迭代学习中将溶解性、抗酶解能力、膜穿透性等指标纳入评分体系。结合智能成药评估得到的负向设计信号,对具备免疫原性与代谢毒性的结构特征施加惩罚,引导模型避开结构合格但无法成药的化学区间。这套融合三维构象信息的一体化设计流程,相比传统随机筛选方式,能够显著提升靶向多肽药物的作用特异性与研发成功率。
3.5 非天然氨基酸多肽的 AI 建模
突破二十种天然氨基酸带来的局限,是多肽药物设计的重要前沿方向。引入非天然氨基酸能够有效提升抗酶解能力、调节结合亲和力,还可定向调控分子理化特性。现阶段人工智能模型大多依托天然蛋白质数据库训练,难以适配化学修饰序列的模拟计算,这也成为相关研究推进的一大阻碍。
对主流预测工具进行综合评测后发现,各类软件对非天然氨基酸的兼容程度各不相同。AlphaFold2、ESMFold 等传统深度学习模型以二十种标准氨基酸数据集完成训练,无法直接预测带有非天然侧链与 D 型氨基酸的分子构象。Rosetta 等物理计算平台虽可兼容这类结构修饰,但每新增一种氨基酸残基,都要耗费大量算力手动设定参数。全新推出的 AlphaFold3 实现计算层面重大突破,该模型摒弃固定残基编码模式,采用通用全原子表征方式,原生支持各类修饰残基与非标准配体。
生成式人工智能领域中,蛋白质语言模型存在固有编码局限。这类模型以天然氨基酸构建固定离散词表,引入非标准残基会破坏模型习得的序列规律,需要创新表征方式加以解决。常见改进方式一是扩充模型词表,依托包含非标单元的定制数据集对预训练模型微调优化。也可放弃残基表征形式,改用简化分子线性输入规范、自引用内嵌字符串等通用化学字符格式,让语言模型将多肽视作任意化学拓扑结构,不再局限于常规氨基酸链。新式连续空间生成框架则彻底脱离一维编码模式,依靠流匹配、原子扩散机制直接生成三维全原子坐标。这类基于结构的设计方式天然适配非天然氨基酸多样的空间形态与化学特性,能够将修饰残基顺畅融入从头设计流程。
3.6 AI 范式的策略应用与方法约束
人工智能在多肽药物领域落地应用,需要清晰把握不同算法架构在运算通量与结构解析精度之间的取舍关系。ESMFold 等蛋白质语言模型以推理速度为优势,适用于大规模序列文库筛选;AlphaFold 这类进化算法依托多序列比对,能够输出高精度原子坐标,满足先导分子优化需求,但也因此存在应用局限。对于数据库中缺少同源模板的特有多肽与全新设计序列,依赖进化信息的比对类模型预测效果会大幅下降。扩散生成模型擅长贴合难成药蛋白界面构建互补结构,却容易产出热力学性质不稳定的骨架结构,必须经过严格物理验证剔除结构失真问题。实际研发中可采用分级验证体系合理调配计算资源。首先开展能量最小化结构松弛,依据罗塞塔能量等指标,直接剔除存在严重空间位阻、能量状态极差的候选结构。留存结构再进行十至五十纳秒短时分子动力学模拟,将结构快速溃散、均方根偏差剧烈波动、氢键网络断裂等现象,作为判定热力学失稳的依据。只有历经多级验证仍能维持稳定构象的序列,才可进入耗时更高的自由能计算阶段,或是开展实验室合成。成熟的研发流程会分层融合各类技术,先依靠生成模型大范围挖掘新颖结构,再借助高精度模型完成结构精修,兼顾结构创新度与生物实际适用性。
4 计算设计多肽的临床转化案例
司美格鲁肽的定向改造,充分印证计算设计策略能够从理论理念落地应用于临床。天然胰高血糖素样肽 - 1 骨架易被酶降解,还会快速经肾脏代谢排出,因此研发不再局限于经验式化学修饰手段。借助计算结构分析,研究人员精准替换氨基酸残基,并通过亲水连接臂接入十八碳脂肪酸二酸结构。该改造方式可与白蛋白可逆结合形成储库效应,同时连接臂的空间构型不会对受体活性位点产生位阻影响。司美格鲁肽的研发成果表明,药代特性可以整合为分子固有结构属性,无需后期再通过化学修饰调整优化。
大环 PCSK9 抑制剂 MK-0616 的研发,将理性设计拓展至类大分子多肽口服吸收这一难题领域。作用于平整的蛋白互作界面通常需要较大分子尺寸,往往超出肠道渗透的容许范围。通过计算手段固化大环骨架构象,可将多肽稳定锁定在活性形态。这种结构约束能够降低结合过程的熵损耗,优化分子内氢键作用,在跨膜转运过程中保护极性基团。该实例证实,构象刚性化设计可以打破分子量与生物利用度之间的制约关系,为胞内药物实现口服给药提供可行思路。

图6|计算肽类药物设计范式演进与多阶段转化验证框架这张图分为上下两部分,清晰展现了肽类药物设计从过去到未来的范式演进,以及从生成设计到临床候选药物的完整转化流程。
计算能力的进步推动药物研发迈入从头设计阶段,新冠病毒微型蛋白抑制剂的快速研发便是典型例证。生成算法仅依据与病毒刺突蛋白的空间互补结构设计人工骨架,快速填补应急药物缺口。这类计算设计产物可形成与靶点形貌高度契合的稳固结合界面,短短数月内便在动物实验中展现出皮摩尔级结合活性与强效中和能力。这一成果标志着优先依托计算开展药物研发的新模式逐步成型,能够按需快速精准研制高活性药物,高效应对新发生物安全威胁。
尽管已取得突破性研发成果,但将计算设计方案落地临床应用时,理论预测结果与实际实验表现往往存在偏差。从头设计序列的合成难度是首要难题,只侧重空间互补性的生成模型,容易产出疏水表面占比过高、易发生聚集的结构,难以顺利合成且水溶性较差。同时,虚拟测算得到的高结合活性无法直接等同于体内药效,计算优化过程时常忽略蛋白水解敏感度、肾脏清除速率等关键药代指标,而这类参数直接决定候选分子的体内留存时长。想要有效缩小研发转化差距,就需要在结构生成阶段纳入水溶性约束条件与负向筛选机制,保障最终分子兼具稳定构型与适配生理环境的成药理化特质。
5 讨论与结论
在 AlphaFold、蛋白质语言模型等人工智能技术推动下,多肽药物研发格局正发生根本性变革。AlphaFold 有效攻克序列到结构的预测难题,RFdiffusion 等生成式智能工具则革新从靶点识别到候选药物产出的全流程理性设计体系。相关技术进步极大拓宽多肽构象空间的探索范围,可精准作用于以往难以靶向的位点,推动多肽研究从传统筛选模式转向创新创制模式。
同源建模与分子对接是传统理性设计的核心手段,但这类方法依赖同源模板,采样效率偏低,难以适配动态难成药界面的研发场景。生成式人工智能突破了上述局限,能够大范围挖掘化学空间并筛选全新分子骨架;分子动力学模拟则可完成热力学验证,输出统计模型无法企及的原子级精细结构。最优研发架构将多种技术融合运用,先借助人工智能完成结构生成,再依托物理算法开展精细化优化,兼顾运算效率与生物表征精准度。
计算设计技术虽已取得长足进步,但高亲和力多肽结合体转化为临床药物依旧阻碍重重。现阶段多肽药物普遍采用非天然氨基酸替换、骨架环化等化学修饰方式,以此改善代谢稳定性差、膜穿透能力弱等固有缺陷。现存深度生成模型大多基于天然氨基酸体系训练,擅长设计空间匹配度优异的结合骨架,却难以适配非标化学修饰,也无法精准预判体内药代特征。新型计算策略开始将修饰约束条件嵌入设计流程,以此弥补技术短板。HighFold 等新一代结构预测工具可直接模拟二硫键、首尾环化等环状结构限制,实现约束型多肽空间构象的精准测算。
下一代多肽设计的核心前沿,是突破二十种天然氨基酸的化学体系范畴。当前生成模型仍大多局限于天然骨架结构,难以解决多肽易被酶降解、膜通透性不足等关键成药难题。未来设计体系需要将非天然氨基酸与各类化学修饰手段融入生成流程,把改性结构单元纳入设计空间。人工智能模型借此可直接优化分子固有稳定性与生物利用度,缩小计算筛选候选分子与临床药物之间的研发差距。
新一代计算设计还需融入可解释人工智能,剖析影响预测结果的具体结构特征,明晰构效关系背后的作用机理。预测模型的迭代升级,也依托多模态数据融合技术,整合一维序列信息、三维空间结构与实验功能检测数据,构建可靠模型,精准适配多肽药物复杂的性能演化规律。可解析算法逻辑与全维度生物数据相结合,有望打通计算筛选到临床应用的关键壁垒,进一步推动高适配性靶向多肽药物的研发进程。