Nat. Commun. 2026 | CLMs: 基于增量训练语言模型的药物分子结构优化方法
今天介绍的是发表在 Nature Communications 上的一项研究工作。该研究针对药物设计中结构优化难以自动化的问题,提出了一种基于化学语言模型(CLM)的增量训练策略。不同于传统依赖外部打分函数的方法,该工作通过模拟药物研发中的“设计-合成-测试”过程,按照活性逐步提升的数据对子模型进行多阶段微调,从而引导模型学习结构-活性关系(SAR)。在多个基准任务中,该方法显著提升了模型生成高活性分子的能力,并在PPARγ和RORγ两个靶点的实验验证中表现出色,生成的分子活性甚至超过已知最优模板。研究表明,该方法能够有效捕捉SAR模式并实现无外部评分的结构优化,为数据驱动的药物设计提供了新的技术路径。

获取详情及资源:
0 摘要
药物分子的结构优化以提升靶点活性,并通过机器学习实现自动化,仍然是化学领域中的一项开放性挑战。利用化学语言模型(CLMs)从序列数据中学习并设计具有期望性质的新分子的能力,对这一问题进行了探索。构建了一种模拟药物发现过程学习轨迹的训练策略。通过对来自特定构效关系(SAR)序列、活性逐步增强的模板分子进行增量式CLM微调,成功引导模型生成具有更高活性的类似物。
将该方法前瞻性地应用于配体开发,在无需外部评分函数的情况下,实现了基于数据驱动的分子设计,使所得分子的活性超过已知同类生物活性化学型的代表分子。结果表明,CLMs能够有效捕捉SAR模式及其长程依赖关系,并在分子设计过程中利用这些信息生成具有更高靶点活性的类似物,从而验证了其在药物分子结构优化中的应用潜力。
1 引言
化学语言模型(CLMs,图1)以字符串形式处理分子信息,并支持基于数据驱动的分子设计,从而实现具有特定性质的分子构建。通过在大规模分子语料上进行预训练,以学习简化分子线性输入规范(SMILES)的语法及一般化学性质,随后可借助迁移学习,从少量微调分子中提取与特定任务相关的分子特征,例如针对某一生物靶点的生物活性。由此,这类深度学习模型能够在化学空间中进行有效探索,成为计算机辅助从头药物设计的重要方法。由于能够在无规则、数据驱动的框架下从头生成具有目标性质的新分子,CLMs已成为提出新化学假设和发现新先导化合物的重要工具。从头设计已成功获得对目标大分子具有生物活性的分子,进一步凸显其在药物发现中的潜力。然而,利用CLMs实现结构优化,即在特定靶点上提升已知配体骨架的生物活性,仍然面临挑战。

图1|化学语言模型(CLMs)及其在该研究中用于结构优化的应用 a. 使用来源于 ChEMBL 的生物活性分子(对任一人类靶点的生物活性 ≤1 µM)对目标无关的 CLM 进行预训练,同时排除所有对目标靶点具有已知活性的分子及其结构相似分子(Tanimoto 相似性 >0.4),以避免偏倚。 b. 使用来源于 BindingDB 和 ChEMBL 的目标靶点已知配体序列对目标无关的基础 CLM 进行微调,并通过聚类识别具有共同结构-活性关系(SAR)的分子系列,每个 SAR 系列仅包含一种作用机制(激动剂/拮抗剂/反向激动剂),并限定为来自统一功能实验且具有可比数据的分子以增强系列内可比性,同时排除分子数量 <25、内部多样性较高(平均 Tanimoto 相似性 <0.3)或与系列中其他分子差异显著的分子系列。 c. 分子以 SMILES 字符串形式表示,并通过词嵌入层处理,将单个字符转换为多维向量空间表示。 d. 为使 CLM 学习目标靶点高效配体的化学空间,使用包含逐渐增强活性分子的 SAR 子集进行递增式微调,在回顾性评估中排除最活跃分子子集作为保留集,以评估微调效果。 e. 在逐步使用高活性分子集合进行微调后,通过多项式采样(T = 1.0)从 CLM 生成分子设计,并基于困惑度进行排序,该指标为基于模型不确定性的内在设计质量度量,在回顾性评估中,将排名前 30 的设计与保留集进行比较,并根据重新发现的高活性分子数量计算评分。 f. 将递增式 CLM 训练前瞻性应用于结构优化,使用完整 SAR 系列(包括保留分子)作为最终微调步骤,基于困惑度筛选排名靠前的分子设计并进行制备与靶点调控测试。
针对既定化学型(即分子骨架)进行优化,以实现对特定生物靶点的有效调控,是药物设计中的核心目标之一,同时也是一项具有挑战性的任务。传统实验室中的结构优化通常依赖反复的“设计-合成-测试”循环以及丰富的专业经验。能够在该任务中表现良好的计算方法仍然较为有限,而以CLMs为代表的生成式分子设计为应对这一挑战提供了新的可能。近年来,多种方法已在结构优化任务中提升了针对特定药物骨架的类似物设计能力,例如通过使用核心结构与取代基进行训练(即骨架修饰)、结合基于矩阵的构效关系形式、利用匹配分子对数据,以及基于片段的字符串修改等策略。Transformer模型在优化药物分子的ADMET性质方面展现出潜力,同时能够探索超越匹配分子对的化学空间。然而,既有研究(多为理论工作)主要集中在较为简单的性质,如logP和药物相似性定量指标(QED)等,这些指标难以反映药物设计的复杂性。少数尝试解决更具挑战性的任务,即针对特定生物靶点优化给定模板分子的生成式方法,则依赖于靶蛋白信息、带有活性标签的匹配输入对,或借助外部评分手段,如基于QSAR的活性预测和分子对接等。因此,提升药物在特定靶点上的活性通常依赖于对生成分子进行外部模型评分(“oracle”)。然而,近期对生成算法的比较评估表明,在oracle调用受限的复杂任务中,现有方法尚难以取得理想结果;尽管许多方法在前瞻性设计方面具有潜力,但其实验验证仍有待开展。此外,对外部oracle的依赖也引入了不确定性,因为评分所依赖的预测模型质量对整体性能具有决定性影响,而高质量预测模型(如基于对接的方法)在部分靶点上并不可得。在不依赖外部评分的情况下,利用CLMs对特定药物分子进行靶向优化尚未建立,但这一方向有望为生成式设计在药物发现中的应用开辟新的路径。
通过在CLMs的微调过程中模拟典型药物化学项目中的“设计-合成-测试”循环,弥补了上述不足,并将已知配体的活性排序作为额外数据维度引入,从而构建学习轨迹。采用长短期记忆(LSTM)递归神经网络,该结构在多种特定任务的从头分子设计中表现出优异性能,并且是CLMs中应用最广泛的架构。利用已有构效关系数据,对不依赖靶点信息的基础CLM进行训练,并逐步引入活性更高的分子实体。结果表明,CLMs能够从SAR数据中实现增量学习,并通过引入额外数据维度提升模型在高活性分子再发现任务中的表现。进一步将该方法用于前瞻性应用,实现了在已知生物活性配体系列中的数据驱动结构优化,涵盖两个具有药理学意义的重要靶点:过氧化物酶体增殖物激活受体γ(PPARγ)和视黄酸相关孤儿受体γ(RORγ)。相关结果验证了通过增量微调CLMs在无需外部评分的情况下实现药物分子优化的可行性,并拓展了CLMs在药物设计中的应用范围。
2 结果
2.1 增量式微调提升CLM在高活性分子设计中的性能
CLMs在从头药物设计中的典型应用包括两个训练步骤:首先在预训练阶段学习SMILES语法,其次通过微调引入对特定目标的偏向。在此基础上,对该流程进行调整,以模拟药物发现过程中从初始命中分子出发、在缺乏SAR知识的情况下,通过反复“设计-合成-测试”循环逐步学习的过程。选择配体激活型转录因子PPARγ作为概念验证靶点,其具有丰富的SAR数据集和多样的化学骨架,适用于方法的广泛探索。PPARγ作为细胞脂质传感器,在脂肪组织、免疫细胞和心血管系统中发挥关键作用,参与代谢平衡、脂肪生成及巨噬细胞功能调控,同时也是抗糖尿病噻唑烷二酮类药物的作用靶点,并在代谢相关脂肪性肝炎及神经退行性疾病等领域具有重要药物开发价值。
为模拟无先验知识条件下的配体设计并避免模型产生偏倚,在预训练数据中移除所有已知PPAR配体及其转录因子家族调节剂,同时剔除与PPAR配体Tanimoto相似度大于0.4的分子(基于Morgan指纹,半径=2,2048位)。未过滤的预训练数据来源于ChEMBL32,包含496,056个分子(189,387个唯一骨架),其中2845个分子具有PPARγ活性注释,另有818个分子为其他PPAR亚型配体。基于活性与相似性的过滤共移除47,791个分子(对应12,286个唯一骨架),并完全去除PPARα/γ/δ配体,验证了对PPARγ相关信息的有效消除。比较不同预训练数据构建的CLM模型发现,采用PPAR过滤数据训练的模型对PPAR配体表现出更高的困惑度,表明模型对目标靶点保持“无知”状态。进一步去除NR1家族配体对困惑度影响较小,但会导致整体模型性能下降,表现为与参考化学空间的偏离增大(通过Fréchet ChemNet距离和KL散度评估)。因此,包含448,265个分子(177,101个唯一骨架)的PPAR过滤数据被认为适用于构建PPARγ无偏CLM。

图2|递增式 CLM 训练的回顾性评估 a. 使用来源于 ChEMBL 的分子(对任一靶点的生物活性 ≤1 µM)构建 PPARγ 无关的 CLM,同时排除对 PPAR 具有已知活性的分子以及结构相似分子(Tanimoto 相似性 >0.4,Morgan 指纹,半径=2,2048 位)。 b. 基于活性和相似性筛选前(左)与筛选后(右)预训练分子在 PPAR 及相关靶点上的活性分布。 c. 已知 PPARγ 配体的 TMAP 嵌入显示出 27 个 SAR 系列(每种颜色表示一个系列),背景为随机 ChEMBL 分子(共 45k,展示 5k)。 d. 27 个 PPARγ 激动剂 SAR 系列的分子数量。 e. 27 个 PPARγ 激动剂 SAR 系列的活性分布。 f. 27 个 PPARγ 激动剂 SAR 系列的内部两两 Tanimoto 相似性分布。 g. 用于评估结构优化中 CLM 性能的再发现评分。 h. 在通过经典(all)或递增式 CLM 微调获得的高排名设计中,从保留集中重新发现高活性配体的比例(n = 135;线表示均值,阴影表示 SEM)。 i. 对 27 个 PPARγ 激动剂 SAR 系列数据集进行经典(all)与递增式微调所获得的再发现评分(n = 25,五次微调迭代,每次包含五次采样)。 j. 不同数据集划分方式对再发现评分的影响,显示相对于经典微调的再发现评分差值(Δ)。 k. 数据增强(×10)及按轮次进行 SMILES 随机化对再发现评分的影响,相对于标准模型进行比较。 l. 基于困惑度筛选的前 100 个设计(n = 100)与保留集中最活跃化合物的 Tanimoto 相似性(Morgan 指纹),分别来自使用所有模板分子(all)、仅使用最活跃子集(best)或递增式方法在不同阶段微调得到的 CLM。 m. 以 t-SNE 可视化递增式微调对设计分布的影响(示例 SAR 系列),不同区域由各训练阶段困惑度排名前 100 的设计定义,背景为随机 ChEMBL 分子(10k)。 e、f、i、l 中的箱线图表示中位数和四分位距(IQR),须延伸至 1.5 × IQR 范围内的最远点。 h、j、k 中数据来自 27 个数据集上的五次微调迭代(n = 135);黑线表示平均 Δ 再发现评分,阴影表示通过自助法计算的 95% 置信区间。
为构建针对特定PPARγ化学型的微调数据集,并评估CLM对骨架优化的能力,将被排除的PPARγ配体通过TMAP嵌入按相似性分组,划分为不同化学型及SAR系列。分析得到27个配体系列,每个系列包含25–79个分子,内部Tanimoto相似度为0.30–0.77(基于Morgan指纹,半径=3,2048位),活性跨度覆盖1.3–4.3个数量级,适合用于结构优化潜力的系统评估。
基于上述SAR系列,进一步探索模拟药物化学家逐步学习过程是否能够使CLM在有限微调数据下识别出高活性分子。具体方法为按活性对每个PPARγ激动剂系列进行分层划分,并以逐步提升活性的子集进行增量微调。每个系列中最强活性的25%分子作为保留集,不参与训练,用于评估模型是否能够在未知条件下重新生成这些目标分子。若模型能够从保留集中发现高活性分子,则表明其已学习到对应骨架的SAR特征,并能够有效探索高活性区域的化学空间。
为量化增量微调的效果,定义了重发现评分指标,用于评估CLM重新生成保留分子的能力。该评分由三个部分组成:(NR/30)表示在困惑度排序前30个分子中被重新发现的高活性分子数量;(ΣFR/ΣF30)反映在2048个生成SMILES中这些分子的采样频率;(NR/Nhold)表示在整个保留集中被重新发现的比例。该指标综合衡量模型在高概率设计中识别目标分子的能力、采样频率以及覆盖范围,同时避免仅高频生成单一分子或低频覆盖全部分子的极端情况。评分在多个示例微调过程中表现出良好的平衡能力,可有效区分性能优劣模型。
基于该评分,对不同微调策略进行了系统评估。结果显示,在几乎所有SAR系列中,采用增量微调策略均显著提高了CLM在设计高活性PPARγ配体方面的性能(p < 0.001)。当将SAR系列划分为4至5个子集进行逐步微调时,模型表现达到最优。数据增强策略中,为每个分子生成10种不同SMILES表示并未带来性能提升,反而不如每轮训练使用单一随机SMILES表示。进一步分析困惑度排名前100的分子与保留集中高活性分子的相似性,发现随着连续四步微调,相似性持续提升;相比之下,采用单步微调(使用全部数据或仅使用最高活性子集)会导致相似性降低且结果波动更大。增量微调后的结构优化性能与SAR系列的规模、内部多样性及活性范围无显著相关性,表明该方法具有良好的普适性。
上述结果表明,CLMs在增量微调框架下能够有效执行药物分子结构优化任务,特别是在提升靶点活性方面展现出显著潜力,为后续前瞻性应用提供了有力支持。
2.2 CLM在前瞻性应用中通过增量微调设计优化的PPARγ激动剂
在配体优化的前瞻性应用中,选择了一组基于苯并咪唑-2-基甲氧基苯结构的PPARγ激动剂,该系列来源于TMAP中四项SAR研究的聚类,活性跨度超过三个数量级,其中A48为最强活性分子。模型未引入任何其他已知PPAR配体。采用五步增量微调策略(以第五步替代保留集),并使用逐步增强活性的模板集合,使CLM聚焦于该骨架。与理论研究不同,此处使用整个SAR系列进行训练,以评估CLM是否能够在现有SAR知识基础上实现进一步进化设计。对模型生成结果进行相似性分析,并与初始CLM、使用全部模板或仅最强模板进行单步微调的模型进行比较,结果表明增量策略能够更有效地聚焦于高活性配体,支持该设计方法的有效性。随后从完全微调后的模型中生成10,000个样本,并重复该过程五次,共获得50,000个设计分子,其中99%为有效分子,28%具有唯一性。在基于困惑度排序的前1024个有效且唯一分子中,有799个(78%)对应目标PPARγ激动剂骨架,表明模型已显著偏向目标化学空间并成功实现设计目标。

图3|基于递增式 CLM 训练的 PPARγ 激动剂结构优化 a. 用于微调的苯并咪唑类 PPARγ 激动剂的活性分布,不同颜色表示活性逐步增强的微调阶段。 b. 基于困惑度筛选的前 30 个设计在 t-SNE 空间中的分布(区域表示),分别来自初始 CLM、使用全部模板分子微调(all)、仅使用最活跃模板分子微调(best)以及递增式方法(背景为随机 ChEMBL 分子 10k)。 c. 微调系列中最活跃的 PPARγ 激动剂 A。 d. 递增式微调后 CLM 生成分子的化学型分布(基于困惑度筛选的前 1024 个有效且唯一的分子)。 e. de novo 设计分子的分布(来自五次独立递增式微调,每次采样 10k 个设计),包括无效 SMILES、已知及相关分子(Tanimoto 相似性 ≥0.8,Morgan 指纹,半径=3,2048 位;包含异构体与子结构)以及在经典微调(all)后也频繁采样到的分子。 f. 经筛选(e)后递增式微调 CLM 按困惑度排名的前 10 个设计(1-10)。 g. 前 10 个设计的困惑度及其与最相似训练分子和最活跃已知激动剂 A 的 Tanimoto 相似性。 h, i. 化合物 1-3、5-10 及 A 在 PPARγ 上的效力与效能。 j. 化合物 1、3、7、10 及 A 的剂量-响应曲线。 k. 化合物 2、5、6、8、9、10 及 A 的剂量-响应曲线,虚线表示 A 的最大效应。 h–k 中数据表示为平均值 ± SEM,n = 3(3 次独立重复,每次为重复测定)。 l. 微调分子(train 1-5)及 CLM 设计分子 1-3 和 5-10 的活性分布,在相同条件下对最活跃微调分子 A 的复测显示其活性略低于文献报道。 m. 递增式微调 CLM(inc)与一次性使用全部模板分子训练的 CLM(all)中设计分子 1-3 和 5-10 的排名(困惑度)及采样频率,数据来自五次独立微调与采样过程(每次 10k 个设计)。 n. 递增式微调 CLM 设计的 PPARγ 激动剂骨架修饰范围(颜色越深表示多样性越高)。
进一步去除所有已知分子(来源于ChEMBL或SureChEMBL)以及与已知化合物Tanimoto相似度≥0.8的分子,同时排除基线CLM(使用全部模板训练)也能生成的分子,以突出增量微调的贡献。随后基于困惑度排序选择候选分子进行合成与测试。排名前十的候选分子(1–10)在困惑度上差异较小,并在结构上与目标PPARγ激动剂化学型相似,其最大相似性处于中等水平。结构差异主要集中在疏水骨架区域,而苯并咪唑核心以及羧酸或其生物等排体TZD基团保持不变,表明模型已捕捉到PPARγ激活的关键SAR特征。选择化合物1–3及5–10进行合成与测试,设计分子的合成路径为4至6步。作为对照,文献报道中该SAR系列最强活性分子A也在相同实验体系下进行测试。
体外实验结果显示,所有九个CLM设计的化合物均表现出高效的PPARγ激动活性,其EC50值处于亚纳摩尔至低纳摩尔范围,说明通过增量微调,模型成功学习并利用了驱动高活性的SAR特征。含TZD结构的化合物1、3、7和10在激动效力上超过参考分子A,最高提升达6.5倍,其中1和7的活性略优于A。在10 nM浓度下,1、7和10诱导的PPARγ活性已超过参考分子A在高于100 nM浓度下才能达到的最大响应水平,进一步体现其更强的生物活性。苯甲酸衍生物2、5、6、8和9的表现更为显著,其EC50为0.6至3.1 nM,相较参考分子A(EC50为37 nM)提升了12至62倍。九个设计分子全部超过已知最优模板的活性,充分验证了增量微调CLM在扩展SAR知识并设计更高活性类似物方面的能力。
在多次独立重复增量微调过程中,优化设计分子1–3及5–10均以高频率出现,并在困惑度排序中保持较高排名,而在使用全部SAR数据进行单步训练的模型或初始CLM中,这些分子未进入高排名集合。该现象表明,逐步微调有助于更准确捕捉实现高效PPARγ激动所需的化学特征,从而提升生成优化分子的能力。对生成分子的结构差异分析显示,变化主要集中在少数取代位点,其中苯并咪唑骨架6位的疏水取代基表现出最高多样性。结构变化与微调数据集中已知SAR规律及相关分子的一致性较高。相较于最强模板分子A,羧酸基团在多个高排名分子中被甲基噻唑烷二酮基团取代,该结构有利于增强与PPARγ激活功能区的相互作用,尽管这一信息未显式提供给模型。同时,模型还调整了取代位置(由间位转为对位),可能改善酸性基团在结合位点中的取向。在苯甲酸衍生物中,引入了异丙氧基取代基,该修饰在部分微调分子中已有体现,并进一步增强了优化分子的活性。这些结果表明,模型能够从结构化SAR数据中学习关键特征及其相互关系,从而实现优于训练分子的从头优化设计。

图4|1-3、5-10、27-29、A 和 C 的合成 a. PPARγ 激动剂设计分子 1-3 和 5-10 以及训练数据中最强效激动剂 A 的合成;试剂与条件:(i)NaH,DMF,90 °C,3 h,79–93%;(ii)铁粉,浓盐酸,MeOH/H2O(9:1),90 °C,2 h,13–16%,或乙酰丙酮铁(III),水合肼,DMF,80 °C,过夜,20–33%;(iii)噻唑烷-2,4-二酮,KOH,EtOH,室温,过夜,99%;(iv)CoCl2-DMG 络合物,NaBH4,NaOH,H2O/MeOH(3:1),35 °C,3 h,40%;(v)14a-d、17,DIPEA/HATU,DMF,室温 3 h,然后 90 °C 3 h,10–19%;(vi)叔丁基溴乙酸酯,K2CO3,DMF,室温,过夜,然后 TFA/CH2Cl2(1:1),茴香醚,室温,3 d,43%;(vii)14d,DIPEA/HATU,DMF,室温 3 h,然后 90 °C 3 h,17%;(viii)NaOH/1,4-二氧六环(2:1),80 °C,2 h,定量;(ix)异丙醇,PPh3,DBAD,THF,0 °C 1 h,然后室温过夜,74%;(x)MeNH2,THF,40 °C,过夜,99%;(xi)NaH,DMF,80 °C,过夜,35–96%;(xii)Fe,NH4Cl,EtOH/H2O,80 °C,过夜;(xiii)TCFH,NMI,MeCN,0 °C 1 h,然后室温过夜,两步总收率 7–72%;(xiv)1 N HCl(1,4-二氧六环溶液),80 °C,过夜,然后 NaOH(水溶液),80 °C,2 h,48–97%。 b. RORγ 配体设计分子 27-29 以及训练数据中最强效和最活跃化合物 C 的合成;试剂与条件:(xv)NEt3 或 DIPEA,CH2Cl2,0 °C,2–21 h,16–63%;(xvi)NaH,N,N-二甲基乙酰胺,室温至 80 °C,16 h,29–73%;(xvii)Pd2(dba)3,XPhos,Cs2CO3,甲苯,115 °C,21 h,39–65%;(xviii)TEA,CH2Cl2,室温,16 h,47–70%;(xix)NaH,DMSO,室温,1 h,67–91%;(xx)NaOtBu,XPhos Pd G3,1,4-二氧六环,80 °C,2 h,18–25%。
2.3 CLM设计出高效的RORγ反向激动剂
在成功应用于PPARγ激动剂的结构优化之后,进一步采用增量式CLM训练方法,探索RORγ反向激动剂的构效关系作为另一示例靶点。该受体是昼夜节律系统的重要组成部分,同时在淋巴细胞分化过程中发挥关键调控作用,并在炎症性和自身免疫性疾病的药物研发中受到广泛关注,已有多种反向RORγ激动剂进入临床研究阶段。与PPARγ的研究类似,首先构建了对ROR配体“无知”的CLM,并从文献中筛选出十个具有丰富SAR信息的反向激动剂簇用于增量微调。相较于PPARγ,这些SAR系列规模更大(78–132个分子)且化学多样性更高(内部Tanimoto相似度为0.25–0.47)。尽管如此,基于重发现评分的回顾性评估结果表明,CLM能够通过增量训练有效学习SAR信息,并设计出活性逐步提升的RORγ反向激动剂,说明该方法在更大化学空间中同样具有良好的泛化能力。

图5|基于递增式微调 CLM 的 RORγ 反向激动剂设计 a. 使用来源于 ChEMBL 的分子构建不包含 ROR 配体信息的 CLM,同时移除所有已知 ROR 配体及与其结构相似的分子(Tanimoto 相似性 >0.4,Morgan 指纹,半径 = 2,2048 位)。 b. 利用 TMAP 嵌入对已知 RORγ 配体进行聚类以识别相关化学型(共 10 类,每种颜色表示一类),背景化学空间基于 10k 个随机 ChEMBL 分子计算。 c. 回顾性评估中的再发现评分(n = 25,五次微调迭代,每次包含五次采样)、各数据集中分子数量以及十个 RORγ 反向激动剂化学型数据集的活性分布(n 表示对应数据集中的分子数量),箱线图显示中位数和四分位距(IQR),须延伸至 1.5 × IQR 范围内的极值。 d. 基于递增式微调(使用一类 RORγ 反向激动剂簇)得到的设计分子 27 和 28 的化学结构,以及对应微调数据中最相似分子 B 和最强效分子 C,人为设计的 C 的类似物 29,训练数据中唯一的 N-叔丁基磺酰胺 D 及其 N-仲丁基等效物 E。 e. 在 Gal4-RORγ 杂合报告基因实验中测得的 27-29 和 C 的效力与效能。 f. 在 Gal4-RORγ 杂合报告基因实验中测得的 27-29 和 C 的剂量-响应曲线,数据表示为平均值 ± SEM,n = 3(3 次独立重复,每次为重复测定)。
在前瞻性应用中,选择了一组基于芳基磺酰胺结构的RORγ调节剂进行增量微调,并从该化学型中采样设计分子。为适应更高的结构多样性,移除了与微调分子相似度大于0.6的设计结果,并优先选择磺酰胺结构。基于采样频率排序,从前10个候选分子中选取化合物27和28进行合成(通过三步反应)并开展体外测试。这两个分子在结构上保留了所选RORγ调节剂的化学型,但在药效团排列上存在差异,并且与最相似的微调分子B在功能连接指纹(FCFP)上的Tanimoto相似度仅为0.556和0.578。RORγ调控实验结果显示,化合物27具有较高活性,其效力显著优于微调集中最相似分子B(提升约20倍),并至少比该系列中任何分子高出3倍,同时接近该簇中最强活性分子C的水平,但在结构上与C保持较高差异(Tanimoto相似度为0.302)。
尽管设计分子27和28仅在磺酰胺基团的N取代基上存在差异,28的活性明显降低,表明该子结构对活性具有显著影响。高活性分子27包含N-叔丁基磺酰胺基团,而28中对应位置为仲丁基取代,导致RORγ反向激动活性显著下降。尽管N-叔丁基结构在微调数据中仅出现于最高活性子集中一个分子中(相比之下,仲丁基结构出现在23个模板中),模型仍优先选择这一出现频率较低但活性更高的基团。为进一步验证该取代基对活性的影响,将其引入最强活性分子C中,合成对应的叔丁基类似物29。该分子并非模型生成结果,而是人工设计用于分析取代基作用。实验结果表明,29与C具有相当的活性,说明叔丁基取代在整体上可被接受,但其增强活性的效果依赖于具体结构环境。进一步分析显示,微调数据中唯一含N-叔丁基的分子D在结构上与27和28相似,均包含N-苄基-1-苯基甲烷磺酰胺结构,表明增量微调的CLM能够捕捉该骨架中存在的长程结构依赖关系。
2.4 增量微调提升模型困惑度表现与SAR感知能力
在回顾性与前瞻性应用中观察到的药物分子结构优化性能表明,基于逐步引入高活性模板的增量式CLM微调,是引导模型聚焦目标靶点高活性配体化学空间的更优策略。该性能提升可能源于更合理的学习轨迹以及结构化训练数据中引入的额外信息维度。随着活性逐步增强的模板分子被依次输入模型,类似于半排序序列的训练方式可能在微调过程中形成更平滑的梯度空间,从而有利于模型对已有知识的复用与精细调整。同时,类似时间步的逐步微调方式,与循环神经网络在处理序列数据方面的能力具有良好匹配性。
为进一步评估增量微调对模型性能的实际影响,对不同训练策略下设计分子的困惑度变化进行了比较。结果显示,不同微调方式下,保留集中目标分子的困惑度变化趋势存在显著差异。采用单步微调(使用全部模板或仅最强模板)时,困惑度持续下降直至达到稳定状态;而增量微调则呈现出分阶段下降的特征,与训练过程中逐步引入高活性分子的过程一致。在完整微调结束后,增量策略在高活性保留分子上的困惑度显著低于使用全部模板的单步策略(p < 0.001),尽管两者使用了相同的训练数据总量。与仅使用最强活性子集相比,增量微调的优势更加明显(p < 10⁻⁵)。

图6|递增式微调提升高活性分子的模型困惑度并增强活性-困惑度相关性 a. 三个示例数据集中,在训练过程中保留集困惑度的变化,分别采用全部模板分子(蓝色)、仅最活跃模板分子(橙色)以及递增式方法(绿色)进行微调,微调进度按训练轮次归一化至 0–1,曲线表示均值,阴影表示每个数据集五次重复的 SEM。 b. 在最终训练轮次中,全部微调或递增式微调条件下训练集与保留集分子的困惑度与其 −log10 活性之间的关系,展示对数线性相关性,并给出回归直线及其 95% 置信区间(灰线及阴影),困惑度标记表示五次重复的平均值 ± SEM,y 轴反转以显示困惑度改善与活性之间的正相关关系,黑点表示模型未见过的保留集分子,每个相关性均标注回归斜率(m,按 100 缩放)、p 值(双侧 t 检验)以及相关系数(R2)。
对SAR数据感知能力的提升还体现在活性与困惑度之间的相关性分析中。采用传统单步微调时,PPARγ配体(包括保留集)在困惑度上的差异较小,说明模型难以区分不同活性水平的分子。在部分情况下,困惑度与活性甚至呈现负相关,这可能与训练集中低活性分子占比更高有关。相比之下,增量微调在使用相同数据的情况下,始终表现出困惑度改善与活性提升之间的正相关关系,且该趋势同样适用于未知的保留分子。这一结果进一步表明,增量式训练有助于模型更准确地捕捉决定活性的SAR特征,并更有效地探索高活性分子所在的化学子空间。
3 结论
在药物发现的命中到先导优化过程中,针对特定靶点提升既定药物骨架活性的结构优化通常成本高昂且耗时较长。尽管已有多种计算方法用于辅助该任务,但多数生成式设计方法主要关注较为简单的分子性质(如logP、QED),而忽略了生物活性尤其是靶点活性优化这一更具挑战性的问题。此外,现有生成式结构优化方法通常依赖外部评分(如分子对接),或利用靶蛋白信息及匹配分子对数据。仅基于配体自身的SAR信息,在无外部评分条件下实现靶点活性优化的结构设计尚未建立。通过利用CLMs在基于任务微调条件下生成具有目标性质分子的能力,对这一问题进行了突破。结合循环神经网络对序列数据建模的优势,在微调过程中引入逐步增强活性的模板分子,从而在SAR数据上构建学习轨迹。通过对高活性保留分子的更高重发现率以及困惑度与活性之间更强的相关性可以看出,增量微调使模型能够更有效地学习SAR信息。该性能提升可能源于微调过程中更平滑的梯度变化,从而减弱了从预训练到完全微调过程中领域转移带来的不稳定性。同时,逐步引入具有排序关系的模板数据,与LSTM对序列(时间步)数据的建模能力高度契合。对不同微调策略下困惑度的分析进一步表明,模型确实以逐步方式进行学习,并最终在训练集及保留集上获得更优的困惑度-活性相关性。
前瞻性实验结果进一步验证了CLMs在捕捉SAR信息并将其扩展至新型高活性类似物方面的潜力,不仅适用于针对特定生物靶点的从头分子设计,也能够有效驱动既有化学型的结构优化。增量微调策略在设计过程中有意保持生成分子与模板之间的化学相似性,这对于在特定活性分子系列内部实现结构优化尤为关键。
在PPARγ激动剂的示例应用中,基于SAR数据的逐步微调使模型成功聚焦于单一生物活性骨架,并在有限化学空间内实现高效探索,生成的类似物在活性上超过微调集中最优分子。结构分析表明,模型能够捕捉关键SAR特征并优先选择有利基团。在部分高排名分子中,最优模板A中的羧酸基团被甲基噻唑烷二酮取代,从而显著提高激动效力。尽管该基团已知可增强与PPARγ激活功能区的相互作用,但相关信息并未显式输入模型。值得注意的是,模型不仅完成了生物等排替换,还同步调整了取代位置。此外,其余高排名分子在结构上引入了额外的异丙氧基取代,该修饰源于高活性微调子集,并显著提升了多个设计分子的活性。
在RORγ调节剂的前瞻性设计中,结果表明增量微调同样适用于规模更大、结构更为多样的化合物簇,并能够实现不同相关骨架之间的SAR知识迁移。模型成功识别出化合物27与28之间的活性突变,并优先选择驱动活性的N-叔丁基磺酰胺基团,尽管该结构在训练数据中出现频率较低。进一步分析表明,该基团对活性的促进作用具有结构依赖性,在不同骨架环境中表现不同。
综合两个前瞻性应用结果可以看出,CLMs不仅能够捕捉影响活性的关键SAR特征,还能够学习这些特征之间的长程结构依赖关系。无论是PPARγ中展示的局部类似物优化,还是RORγ中体现的跨骨架SAR迁移,这两类能力均对药物设计中的结构优化具有重要意义。所提出的增量微调CLM框架在其他结构优化场景中同样具有应用潜力。实际应用中需要根据具体任务对微调数据集的规模、多样性及划分方式进行合理设计。
在SAR知识扩展以及高活性类似物从头设计方面所展现出的优异性能,进一步验证了增量微调CLMs在药物分子结构优化中的有效性,并拓展了其在分子设计领域的应用范围。