NMI 2026 | ConfSeq: 以构象描述语言连接三维分子结构与人工智能

今天介绍的是发表 Nature Machine Intelligence 的研究论文。该研究主要围绕打通大语言模型与三维分子建模的壁垒展开,重点针对现有 SMILES 仅能描述二维结构、无法适配 3D 构象建模的痛点,提出全新 ConfSeq 构象描述语言,并将构象预测、分子生成、3D 表征等任务统一转化为序列建模问题,在多项分子基准测试实现 SOTA 性能,同时通过湿实验筛选出活性优良的新型 STING、ALDH1B1 抑制剂。该工作突破传统图扩散模型的速度短板,证明通用 Transformer 可高效处理分子三维空间信息,为 AI 驱动新药分子设计、大规模虚拟筛选提供全新标准化工具,对计算药物化学领域发展具备重要推动价值。

获取详情及资源:

0 摘要

大语言模型依托序列数据学习,已经为众多领域带来变革,但分子构象缺少高效的分词表征方式,限制了其在三维分子建模领域的落地。相关研究提出了 ConfSeq 这一构象描述语言,通过将三维分子结构编码为离散分词序列弥补了该技术短板。ConfSeq 融合分子简化分子输入行规范与二面角、键角、伪手性描述符等内坐标,既满足三维空间刚体变换不变性,又保留简化分子输入行规范简洁、易于人工解读的优势。该工具将构象预测、从头分子生成、表征学习等核心三维分子建模任务转化为序列建模问题,使通用 Transformer 架构在多类基准测试中取得领先性能。依托 ConfSeq,研究人员筛选出多款全新干扰素基因刺激蛋白抑制剂与乙醛脱氢酶 1B1 抑制剂,半数抑制浓度区间为0.338–3.51 μM。综合各项结果,ConfSeq 可作为成熟框架,拓展大语言模型在三维分子建模方向的应用边界。

1 引言

人工智能正在重塑各类学科的研究模式,语言模型是这场变革的核心载体。语言模型依托自监督学习从海量分词序列中挖掘复杂规律,具备出众的生成能力,既推动了 GPT-4、Gemini 等通用人工智能系统的发展,也催生了 ESM、GeneFormer、NT、xTrimoPGLM、Evo 等领域专用模型,持续助力科研与产业领域的技术迭代。

药物与化学研究领域中,化学语言模型已成为核心研究方向。该类模型借助简化分子线性输入规范、自引用内嵌字符串等形式,将分子拓扑结构编码为离散分词序列,在分子转换、从头分子生成、表征学习等二维分子建模任务中均取得当前最优性能。基于这一技术思路,相关研究人员推出 ReactSeq 反应描述语言,能够将化学反应转化过程编码为具有明确含义的分词序列。

**图1|面向三维分子建模的构象序列 ConfSeq 描述语言概述。**本图分为 a、b、c 三部分,对比传统二维化学大模型(CLMs)的局限,提出ConfSeq 三维分子构象描述语言,完整展示其编码逻辑、三维建模应用与手性 / 二面角表征原理。

分子性质同时由二维拓扑结构与三维空间构型共同决定,二者直接影响分子理化性质、化学反应活性以及分子与生物靶点的相互作用。因此,构建高效的三维分子结构表征与生成方法,对人工智能赋能化学与生命科学研究至关重要。不同于二维分子建模领域已取得诸多突破性成果,语言模型在三维分子相关任务中尚未展现出具备竞争力的性能,业内普遍认为该类模型在该场景下存在固有缺陷,目前三维分子建模领域仍以架构持续优化的图扩散模型为主流方案。但这类方法普遍存在生成效果受限、推理速度缓慢、缺少内置打分评价体系等问题,上述各类短板推动研究人员将化学语言模型的技术框架从二维分词拓展至三维分子序列领域。

冯等人提出 Lingo3DMol,该工具依托语言模型生成片段简化分子线性输入规范,搭配辅助空间模块预测片段空间位置,以此完成三维分子构建。该方案虽具备一定效果,但依赖专用空间组件,无法兼容通用语言模型,泛化能力受限;这种基于分子片段的搭建方式也忽略了环结构构象柔性,会降低三维建模精度。近期多项研究尝试纯语言模型方案,将原子坐标与简化分子线性输入规范拼接为字符串实现三维分子生成,但该思路忽视了分子构象具备的三维刚体变换不变性,同时缺少系统化分词规则,容易造成模型稳定性不足。语言模型本身难以处理连续数值信息,直接将笛卡尔坐标编码为字符串也会阻碍模型学习分子空间关联特征,且上述各类方法均未在多类数据集上完成完整基准测试。

将语言模型拓展至三维分子建模领域的核心难题,是缺少一套可高效表征分子构象的描述语言。这类语言需要将无序、连续的几何信息转化为离散有序的分词序列,同时兼顾三维刚体变换不变性、简洁性与可解读性。为解决该问题,相关研究构建了 ConfSeq 构象描述语言,依靠二面角、键角与伪手性描述符三类核心内禀几何参数完成分子构象编码。研究将上述几何参数离散化为分词,并合理嵌入简化分子线性输入规范体系,该设计既保留了人工可读的特性,可依托简化分子线性输入规范实现数据扩增的遍历生成,还能将几何分词与原子、成键环境相关联,帮助语言模型学习分子几何结构与拓扑结构之间的内在关联。

依托 ConfSeq,构象预测、分子从头生成、三维分子表征等各类三维分子建模任务均可被转化为序列建模问题。仅采用标准 Transformer 架构,基于 ConfSeq 的模型就在上述各项任务中取得当前最优性能。同时,这套序列驱动框架充分发挥语言模型本身的优势,相较于图扩散模型,推理速度更快,还可对生成分子自带可信度打分机制。研究人员进一步在虚拟筛选场景下验证 ConfSeq 的实际价值,筛选得到多款全新干扰素基因刺激蛋白抑制剂与乙醛脱氢酶 1B1 抑制剂,对应半数抑制浓度区间为0.338 μM至3.51 μM。上述全部结果证实 ConfSeq 具备实际应用价值,也体现出语言模型可作为可靠技术框架,支撑化学与生物医学领域的三维分子建模研究。

2 结果和讨论

2.1 ConfSeq 概述

ConfSeq 通过为三类核心几何参数设置专属分词,实现分子构象的系统化编码。

二面角由依次成键的四个原子 i–j–k–l 定义,表征 i–j–k 平面与 j–k–l 平面之间的夹角。对于同一中心化学键,可能存在多条二面角取值路径,易造成编码歧义,为此配套一套确定性路径筛选算法,为每一根可旋转化学键分配唯一的二面角取值路径。所得角度数值取就近整数,以 <70> 这类格式封装,并插入简化分子线性输入规范中对应化学键分词的位置,实现二面角信息唯一且确定的编码。

键角由依次成键的三个原子 i–j–k 定义,代表中心原子 j 处 j–i 键与 j–k 键形成的夹角。与二面角处理方式类似,取值范围 0° 至 180° 的键角数值取整后放入尖括号,并追加符号 | 以作区分,该分词紧随 ConfSeq 序列内中心原子分词后方,例如原子 12 对应的碳分词后标注 < 115>|,以此建立几何参数与对应原子的直接关联。

伪手性参数用于解决仅依靠二面角无法区分的非手性原子周边构象歧义问题。如图 1c 所示,二面角 1–2–5–6 能够确定原子 1 至 6 的空间朝向,却无法区分原子 5 上取代基 7 与 8 的排布方式,对应两种可区分的构象。伪手性的判定规则为:从编号最小的取代基方向观察,非手性原子周围取代基呈顺时针或逆时针排布两种状态。在 ConfSeq 体系中,分别采用符号 {与} 标记两种排布状态,根据原子编号,该符号放置在对应二面角分词的前方或后方,如 < 59>{、{<59>。该描述符与二面角搭配使用,可唯一确定可旋转化学键周边所有取代基的空间排布形态。

相较于以往基于绝对坐标的三维分子描述语言,ConfSeq 采用内坐标表征分子,能够贴合真实分子构象所处低维流形空间,降低建模难度。该体系将内坐标分词嵌入简化分子线性输入规范框架,便于模型学习几何特征与化学结构之间的关联。部分基于图结构的内坐标模型仅纳入可旋转键的二面角,而 ConfSeq 额外引入环二面角、键角与伪手性参数,将分子平均重构误差由0.65 A˚降至0.23 A˚。ConfSeq 的完整实现细节、相关分析与现存局限可详见方法部分与补充材料 C1 章节。

2.2 ConfSeq 分子三维构象预测

为验证 ConfSeq 的适用能力,相关工作首先将其应用于分子构象预测任务。研究采用标准 Transformer 架构,实现由分子简化分子线性输入规范向 ConfSeq 表征的转换,所得 ConfSeq 序列可通过确定性解码还原出三维分子构象。参考已有研究方案,该模型引入简化分子线性输入规范枚举扩增与测试阶段数据扩增策略以提升效果,依托 GEOM-Drugs 数据集完成训练与评测,选用覆盖度指标与匹配度指标分别量化模型的精确率与召回率,以此衡量模型性能。

如图 2a、2b 所示,基于 ConfSeq 构建的模型在全部评价指标上均达到当前最优水平,相较于此前最优的扭转扩散模型,在0.75 A˚阈值下的覆盖度精确率由47.9%提升至58.4%,匹配度平均误差由0.86 A˚降至0.77 A˚。在不同均方根偏差阈值下,ConfSeq 均稳定取得最高的覆盖度召回率与覆盖度精确率,二者优势分别在1 A˚以内、1.5 A˚以内区间尤为突出;该性能优势在按照可旋转化学键数量划分的各类分子子集内同样稳定存在。同时 ConfSeq 可通过调整采样温度实现召回率与精确率之间的可控权衡,在各温度条件下,该方法形成的匹配度精确率 - 匹配度召回率帕累托前沿均优于各类对照基准模型。图 2g 展示的典型构象也直观体现采样温度对分子结构多样性的调控作用,上述结果同时说明,评估该任务下的模型性能应当完整参考召回率 - 精确率权衡曲线,而非仅依靠单点指标。

ConfSeq 具备一项突出优势,可依据自回归分步概率为预测得到的构象输出定量置信分数。随着置信分数升高,生成构象的匹配度召回率保持稳定,匹配度精确率则大幅下降,该规律证明模型能够依靠内置打分机制优先筛选高质量构象。针对单键、单二面角分数的可视化结果表明,尽管采用离散分词编码方式,模型仍能捕捉角度几何连续且周期性的变化特征。为验证模型输出分数能否反映构象能量合理性,研究进一步采用测试集内经过量子化学优化的构象开展评测,绝大多数分子的置信分数与分子能量呈负相关,平均皮尔逊相关系数为−0.576;可旋转键数量越少的分子,二者负相关程度越强,部分分子相关系数低于−0.9。

为检验 ConfSeq 在 GEOM-Drugs 数据集之外的拓展能力与泛化性能,研究选用规模更大、化学多样性更丰富的 QMugs 数据集完成评测。结果显示 ConfSeq 的表现持续优于 DMCG、GADIFF、扭转扩散等以往主流高性能模型,充分体现该方法在各类化学空间下的稳定性与广泛适用范围。

2.3 基于 ConfSeq 的无条件三维分子生成

ConfSeq 在分子构象预测任务中的可靠性得到验证后,相关研究进一步将其拓展至无条件三维分子生成任务。该任务是药物从头设计的核心环节,无需额外输入限制,仅依靠学习得到的数据分布生成三维分子结构,实现化学空间的无边界探索。研究采用仅解码器 Transformer 架构,并从二维、三维两个评价维度,与多款当前最优图扩散模型开展全面基准对比。

研究首先从二维层面评测模型性能,基于 ConfSeq 搭建的模型化学有效性接近满分,独特性指标表现优异,在各类标准二维生成评价指标上均优于对照基线模型。基线模型生成分子的药物类药性定量评估、合成可及性打分等类药性质分布与训练集存在明显偏移,而 ConfSeq 生成分子的对应性质分布与训练集高度吻合。ChemNet 特征嵌入分析同样佐证该结论,ConfSeq 产出分子与训练集分子特征相似度更高,说明该模型能够更好地学习训练数据中普遍存在的结构骨架。

图2|ConfSeq 分子构象预测模型综合性能评测图。 本图全部围绕ConfSeq 三维分子构象描述语言模型开展定量性能对比与机理分析,分为统计对比、相关性分析、构象实例三大部分,全方位验证 ConfSeq 在三维分子构象预测任务上相比传统基线模型的优势,并揭示模型置信度与构象能量、采样温度的内在规律。

在三维指标评测中,ConfSeq 生成的三维分子结构不仅具备物理合理性,其构象分布也与训练数据高度贴合。该方法的 PoseBusters 有效率达到82.3%,较此前最优模型提升6%;最小均方根偏差降至0.1024,降幅达35%。相较于以往最优方案,ConfSeq 将二面角最大均值差异由0.0304降至0.0070,键角最大均值差异由0.1048降至0.0543。典型角度分布曲线显示,基线模型生成的角度分布仅呈现平滑单峰形态,而 ConfSeq 能够精准复现训练数据本身的多峰实际分布特征,补充图 11、12 在多种分子骨架下均得到一致结果。基于 E3FP 指纹的分析进一步印证该结论,所有对比方法中,ConfSeq 生成分子整体分布与训练集分布相似度最高。未通过 PoseBusters 有效性检验的分子,主要失效原因为空间位阻冲突与键长畸变,环结构中该问题尤为突出,各类失效模式的详细分析可参见补充材料 C2 章节。

图3|ConfSeq 与主流三维分子生成模型的分子分布与生成质量对比分析。 该图从理化性质分布、构象指纹空间、真实活性分子匹配度多维度,对比 ConfSeq 与 EDM、GeoLDM、UniGEM、GCDM 等主流三维分子生成模型,全面验证 ConfSeq 生成分子的分布贴合度、结构多样性与真实药物分子匹配优势。

依托语言模型出色的推理效率,该方法在 GPU 设备上的整体采样速度约为当前最优完备几何扩散模型的 285 倍。该速度优势在不同尺寸分子下保持稳定,加速倍数区间为 380 倍至 1585 倍,在 CPU 环境下该效率优势会进一步放大。

图4|基于形状约束的 ConfSeq 三维分子生成模型性能评测。 本图系统展示形状条件式 3D 分子生成框架 ConfSeq的完整工作流程,并与 DiffSMol、SQUID 两种主流基线模型做多维度定量对比,验证其在骨架跳跃、形状匹配、活性分子生成上的突出优势。

为衡量各类模型挖掘全新生物活性分子的能力,研究计算了生成新分子与 ChEMBL 数据库分子之间的最大相似度。在一万份生成样本中,ConfSeq 单独识别出 91 个已知活性分子,其余对照模型最多仅能找到 13 个活性分子,且大多为原子数量少的简单结构。综合全部实验结果可以证明,ConfSeq 生成分子具备更优异的二维、三维结构有效性,分子理化性质与构象特征的分布也和训练集高度统一,现有其他三维分子生成方法均无法同时实现上述性能。

2.4 基于 ConfSeq 的形状条件式三维分子生成

ConfSeq 在无条件三维分子生成任务中展现出优异性能后,相关研究进一步将其拓展至形状约束分子生成任务,该任务难度更高,要求生成分子同时满足预设三维形状限制并保留结构新颖性,该功能对骨架跃迁、规避专利分子设计场景具备重要实用价值。分子表面采用点云形式表征,通过旋转不变表面卷积提取具备几何不变性的表面特征,提取得到的特征输入 Transformer 解码器生成 ConfSeq 序列,序列解码后即可输出三维分子结构。

参照无条件分子生成的评测方案,该工作同样从二维、三维两个维度完成性能验证。ConfSeq 的 PoseBusters 有效率可达(93.1%),高于 DiffSMol 的(85.1%)与形状约束通用逆向设计模型 SQUID 的(70.1%),同时化学有效性接近百分之百,与无条件生成任务的实验结果保持一致。研究还分别从三维形状、二维拓扑结构两个维度量化生成分子与参考分子的相似度,结果显示 ConfSeq 产出分子的三维形状相似度显著更高,二维结构相似度更低,说明该方法能够在几何约束下更好地实现分子骨架创新。采用双重筛选标准,即高形状相似度且低二维相似度,分别设定形状相似度大于(0.85)或(0.9)、二维相似度小于(0.3)或(0.2)四组条件后,ConfSeq 的达标成功率依次为(5.1%)、(7.2%)、(23.1%)、(29.0%),相较以往最优模型提升幅度介于(24%)至(210%)之间。利用置信分数对候选分子做筛选可进一步提升筛选效果,在最严苛标准(形状相似度大于(0.9)、二维相似度小于(0.2))下选取置信度前(10%)的样本,达标命中率可由(5.1%)提升至(16.8%)。图 4h 中的典型案例直观证明,ConfSeq 生成的分子既能保留目标三维外形与生物活性,又可获得差异化分子骨架。上述全部结果证明 ConfSeq 是一套高效的形状引导分子生成框架,在骨架跃迁药物设计场景具备突出应用潜力。

2.5 基于 ConfSeq 的三维分子表征学习

除三维分子生成任务外,该研究将 ConfSeq 拓展应用于三维分子表征学习,支撑构象空间映射、分子三维相似度定量评估等下游任务。研究采用仅编码器 Transformer 结构,从 ConfSeq 序列中提取固定维度的特征嵌入向量,依托度量学习框架完成训练,让向量间距离能够对应分子三维结构相似度。该模型基于 ChEMBL 与 BindingDB 数据库中的 280 万个分子完成训练,全部分子构象均通过 RDKit 工具生成。

研究利用该模型提取蛋白质数据库中配体的特征表征,并借助主成分分析实现可视化展示。如图 5a 所示,即便分子二维结构差异极大,结合同一蛋白口袋的分子在表征空间内仍会形成聚集簇,例如模型能够识别两种线性 BACE-1 抑制剂(2XFI_XFI、4GID_0GH)与结构完全不同的大环抑制剂(4DPF_0LG)结合构象间的三维相似性,证明该表征可捕捉二维拓扑之外的构象相似特征。蛋白质数据库内的配体可划分为三类特征簇,分别富集激酶抑制剂、天冬氨酸蛋白酶抑制剂与糖苷酶抑制剂,各类簇均具备与对应配体类别匹配的独特结构特征。上述结果说明基于 ConfSeq 得到的特征向量能够提取同一蛋白家族配体间保守的三维结构模式,仅依靠二维分子表征无法识别这类特征。该嵌入向量还与 GEOM-Drugs 数据集内量子化学计算得到的分子能量存在相关性,平均距离相关系数为(0.367),表明模型无需额外能量监督信号,即可学习构象结构与分子能量之间的内在关联。

除定性可视化分析外,相关工作还依托 DUD-E 与 PCBA 数据集,定量验证 ConfSeq 生成的表征在基于配体的虚拟筛选任务中的实用价值。在 DUD-E 数据集上,该方法受试者工作特征曲线下面积为(0.76),玻尔兹曼增强判别系数为(0.34),(1.0%)富集因子为(21.25),(5.0%)富集因子为(7.44);在 PCBA 数据集上四项指标依次为(0.60)、(0.046)、(3.16)、(2.08),整体性能优于 E3FP、MoRSE 等三维分子指纹方法,以及 LSalign、SHAFTS 等依赖分子叠合的三维相似度计算工具。补充材料 C3 章节针对训练数据规模、分子理化性质、构象数量、多模板筛选等维度展开深度分析,结果证明 ConfSeq 在各类实验条件下均具备稳定性能,针对柔性分子与多参照筛选场景还能获得更明显的性能提升。除筛选精度优势外,ConfSeq 相比叠合类工具还具备显著计算效率优势,无需执行计算开销巨大的分子两两叠合操作,可直接在表征空间完成相似度计算。

为支撑大规模实际应用,研究采用该模型预先计算 ZINC 现货库与 PubChem 数据库内全部三维化合物的特征嵌入向量。依托预计算得到的表征,在单颗 CPU 核心上,仅需三分钟以内即可完成目标分子与 9800 万个 PubChem 化合物的三维相似度计算,实现超快速大规模虚拟筛选。综合全部实验结果能够证实,ConfSeq 是具备良好拓展能力的框架,可提取具备生物学意义的构象相似特征,支撑前所未有的大规模高效虚拟筛选工作。

2.6 依托 ConfSeq 挖掘全新 STING 与 ALDH1B1 抑制剂

为验证 ConfSeq 在真实药物研发场景中的应用价值,该工作首先针对 STING 靶点开展基于配体的虚拟筛选。STING 是重要治疗靶点,分子构象柔性高且以二聚体界面结合模式为主,给基于结构的筛选带来较大阻碍。研究采用 ConfSeq 生成的三维分子表征,选取 14 种结构多样的已知 STING 调节剂作为查询分子,对 ChemDiv 化合物库完成筛选,依据三维相似度排序后取前两万个候选分子聚类去重,再经过商品可获得性筛选,最终挑选 92 个化合物开展体外实验验证。

蛋白热位移、表面等离子体共振等生物物理实验证实,共有 10 个化合物可与 STING 产生可检测结合,整体筛选命中率约(11%)。这批阳性分子的蛋白热稳定偏移量区间为(+2.5\ \mathrm{^\circ C})至(+8.5\ \mathrm{^\circ C}),解离常数介于(0.826\ \mu\mathrm{M})与(10.9\ \mu\mathrm{M})之间。其中亲和力最优的两个候选分子 509A2 与 510A4 可拮抗环二腺苷酸诱导的 STING 激活,半数抑制浓度分别为(2.03\ \mu\mathrm{M})、(0.778\ \mu\mathrm{M});两种化合物均可剂量依赖性抑制环二腺苷酸、diABZI、SR-717 等多种 STING 激动剂触发的信号通路激活,检测可见 STING、TBK1、IRF3、STAT3 蛋白磷酸化水平明显下降。细胞毒性测试进一步得到两种分子的半数生长抑制浓度与安全指数,安全指数定义为半数生长抑制浓度除以半数抑制浓度,509A2 安全指数大于 25,510A4 安全指数约为 4。全部实验结果共同证实,筛选得到的 STING 抑制剂具备明确靶点抑制活性,拥有后续药物开发潜力。

**图5|ConfSeq 用于三维分子表征学习的性能评估。**这张图围绕三维分子表征学习任务,多角度对比 ConfSeq 和多种现有主流方法的效果,验证 ConfSeq 在蛋白配体虚拟筛选场景下的优越性,分为 a、b、c 三大模块展开分析。

509A2 与 510A4 这两种抑制剂和参考化合物 13、6MX3_K5P 的三维构象相似度很高,但二维分子骨架结构完全不同,实现了理想的骨架跃迁效果。该结果丰富了 STING 调节剂的化学多样性,同时能够规避相关知识产权限制。研究进一步采购市售的 509A2 衍生物开展活性评测,衍生物 510C2 的抑制活性提升约六倍,半数抑制浓度为(0.350\ \mu\mathrm{M}),细胞毒性较低,其抑制活性与毒理表现均优于阳性对照药物 H151,是具备深入临床前开发价值的先导化合物。

为进一步验证 ConfSeq 的实际应用价值,相关工作针对 ALDH1B1 靶点开展另一轮基于配体的虚拟筛选,最终得到三种经实验验证的抑制剂,半数抑制浓度区间为(0.338\ \mu\mathrm{M})至(3.51\ \mu\mathrm{M})。两项靶点筛选案例共同证明 ConfSeq 在基于配体的虚拟筛选场景中适用范围广泛,在不同治疗靶点下均能展现优异筛选效果。

图6|依托 ConfSeq 筛选并实验验证 STING 抑制剂的完整研究流程。 本图展示了将 ConfSeq 投入实际药物研发、开发 STING 通路抑制剂的完整工作链路,涵盖虚拟筛选、化学结构解析、多轮生物实验验证、先导分子优化这几个阶段,证明了 ConfSeq 落地实际新药研发的实用效果。

3 结论

该研究聚焦大型化学语言模型从二维分子建模拓展至三维分子建模所面临的核心难题,即缺少稳定可靠、可用于表征三维分子结构的一维序列描述形式。为解决该问题,研究构建 ConfSeq 分子构象描述语言,该体系融合 SMILES 表达式与分子内部几何信息,涵盖二面角、键角、伪手性等参数,该天然设计自带 SE (3) 几何不变特性,同时保留 SMILES 语言易读、简洁的优势。

ConfSeq 将分子构象预测、无条件三维分子生成、形状约束三维分子生成、三维分子表征学习等多种三维分子建模任务统一转化为序列建模问题,借助标准 Transformer 架构在各类基准数据集上取得当前最优性能,多数指标相较传统方法实现大幅提升。相较于主流图扩散模型,ConfSeq 充分发挥语言模型的优势,推理速度大幅提升,同时内置打分机制用于筛选高质量生成结构。体外生物实验进一步证实 ConfSeq 具备实际研发价值,依托该方法筛选得到多款新型 STING、ALDH1B1 抑制剂,半数抑制浓度均具备良好开发前景。

综合全部研究结果,该工作打破了语言模型天然不适用于三维分子相关任务的固有认知。ConfSeq 搭建起语言模型与三维分子结构之间稳定可靠的转换桥梁,为人工智能驱动的分子建模、药物发掘与分子设计领域奠定全新技术基础。