Cell Rep. Phys. Sci. 2026 | ChemMLLM:面向化学任务的多模态大语言模型研发
今天介绍的是发表在Cell Reports Physical Science上的一项研究工作。该研究提出了一个面向化学任务的多模态大语言模型ChemMLLM,目标是把“分子理解 + 分子生成”统一到一个模型中,并同时支持文本、SMILES与分子图像三种模态的双向转换与交互。方法上采用了 Mol-VQGAN + LLM 的架构:先用分子领域重训的视觉tokenizer将分子图像离散化,再让LLM在统一token空间完成跨模态学习,并通过两阶段训练和五类跨模态化学任务数据集来提升对齐效果。实验表明,该框架在多任务场景下验证了统一多模态接口的可行性,并将化学MLLM能力扩展到图像生成,提升了更自然的人机交互潜力。论文也指出当前局限:在部分核心定量任务上仍落后于专用模型,分子优化时结构保持性不足,说明多模态统一范式仍需在架构设计与训练目标上进一步改进。

获取详情及资源:
0 摘要
近年来,多模态大语言模型(MLLMs)在化学领域取得快速发展。然而,能够处理跨模态理解与生成的化学MLLMs仍未得到充分探索。为填补这一空白,提出了ChemMLLM,一种用于分子理解与生成的统一化学MLLM。五类涉及文本、分子简化分子输入线性表示(SMILES)字符串及图像的多模态任务被成功设计,并整理了相关数据集。在这些任务上,ChemMLLM与多种通用领先MLLMs、化学LLMs及专用模型进行了基准测试。实验结果表明,统一的多模态接口具有可行性。ChemMLLM将化学 MLLMs的能力扩展至图像生成领域,验证了在单一模型中统一多种跨模态化学任务的可行性,并实现了更直观的可视化人类-人工智能(AI)交互。
1 引言
人工智能(AI)的最新进展显著加速了化学研究的发展。已开发出越来越多的AI方法和模型,用于多种化学任务,包括分子性质预测、de novo分子生成以及反应结果预测。在化学领域,许多任务本质上具有多模态特征,涵盖文本描述、结构化格式(如简化分子输入线性表示,SMILES)以及分子图像。
近期,多模态框架被引入化学领域,实现了传统上分散的任务的统一,例如性质预测、光学化学结构识别(OCSR)以及分子设计,这些任务可通过单一模型架构整合。这类方法通常可分为三类:(1)任务专用系统:专注于单一目标以推动前沿发展,例如MolScribe用于 OCSR,Chemprop用于性质预测,以及基于知识图(KG)的药物再利用管线。(2)表示中心模型:主要贡献在于学习可迁移的分子(或跨模态)嵌入,涵盖SMILES/图基础模型以及分子-文本/知识对齐。(3)基础模型:旨在实现多任务统一,提供跨模态和任务的单一交互接口。
尽管取得了诸多进展,大多数现有化学AI系统仍受到任务专用设计和单向信息流的根本限制。系统通常能够从文本或图像中解析分子结构,但缺乏双向转换和交互能力,这一化学专家在分析分子时所具备的特征。例如,经典的Seq2Seq模型在分子优化任务中可生成具有改进性质的SMILES字符串,但无法生成可解释的可视化结果,也无法就结构修改进行交互式讨论,从而限制了其更广泛的应用。近期提出的跨模态多任务统一框架,大多基于多模态大语言模型(MLLMs),在一定程度上缓解了这一问题。然而,现有化学MLLMs仍主要侧重于理解能力。在检索、性质预测和 OCSR 等任务中,图像通常仅作为输入,模型主要关注图像信息。生成化学可视化的能力——这是化学家交流和解析分子结构的重要方式——在现有文献中仍然缺失。在分子设计任务中,化学家通常只能依赖符号输出(如SMILES字符串)。若要理解这些结果,需要中断工作流程,通过外部工具渲染分子结构。这种操作导致交互环节分散,显著降低迭代设计效率。而直接生成可视化结果可消除这一瓶颈,使分子结构在模型界面内直观呈现,从而实现流畅、高效的人机交互(HCI)模式。因此,仍缺乏能够同时支持化学多模态理解与生成的一体化化学模型。

图1 | 研究动机 传统Seq2Seq流程与统一化学大语言模型的对比示意。(A) 为获得脂溶性改进的分子,传统工作流程首先需从分子图像识别 SMILES 表示;Seq2Seq模型预测SMILES后,使用计算化学工具(如 RDKit)将SMILES重新渲染为图像以便可视化。(B) 相比之下,统一框架(ChemMLLM)直接接受分子图像,并端到端生成分子图像的可视化,消除了对外部转换工具的依赖。
构建此类模型的主要挑战体现在三个方面:首先,基于视觉的化学任务及数据集仍未得到充分探索,现有化学数据集主要以SMILES格式表示分子。其次,分子图像具有自身独特性。与自然图像不同,分子图像较为稀疏,包含大量空白区域,并严格由直线构成。通用MLLMs在生成时常出现分子结构模糊或畸变的情况。最后,为化学MLLM选择一种能够无缝融合多种模态(包括离散的SMILES字符串、文本以及连续的分子图像)的有效框架,也是一项挑战。

图2 | 更多实验结果可视化 (A) 从训练开始到最佳检查点的训练曲线中,在编码器、解码器和码本上训练一段时间后应用GAN损失以保持稳定性。验证损失曲线中观察到的尖峰标志着对抗训练的开始,此时引入判别器损失,使模型从纯重构目标过渡到完整的VQGAN目标。损失自然收敛,无需额外处理。(B) 不同λ值下的分子图像描述生成任务结果,数据以均值形式表示。(C) 原始VQGAN与Mol-VQGAN示例。第一行显示原始图像,第二行为原始VQGAN结果,第三行为Mol-VQGAN结果。原始VQGAN无法清晰准确地编码和解码分子图像,导致原子和化学键扭曲,而训练良好的Mol-VQGAN能够编码和解码分子图像,原子与化学键清晰,几乎与原始分子图像一致。(D) 分子图像描述生成任务示例及Qwen-VL-Chat与 ChemMLLM-34B的对比。(E) Qwen-VL-Chat与ChemMLLM-34B的分子图像性质预测任务答案对比。正确答案以深绿色标注,接近答案以浅绿色标注,错误答案以红色标注。(F) 图像到SMILES转换任务中GPT-4o与ChemMLLM-34B的答案对比。(G) 模型生成token到图像 token 的跨注意力热图。左图:所有生成输出tokens的跨注意力,反映生成描述与分子图像的全局对齐;右图:限制在功能基团tokens(酰胺、硝基、磺酰基和羧酸)上的跨注意力,突出每个预测功能基团对应的局部图像区域。
为解决上述问题,提出了ChemMLLM,一种在统一框架下实现分子理解与生成的化学 MLLM。针对前述三大挑战,设计了五类多模态化学任务,涵盖文本、SMILES和图像三种模态,并同时涉及生成与理解场景。通过对分子图像进行向量量化生成对抗网络(VQGAN)微调,实现分子图像与自然图像之间的桥接,并引入“图像编码器‑LLM‑图像解码器”架构,用于多模态化学任务,支持模态间的早期融合及直接图像生成。此外,采用两阶段训练策略,并通过实验验证其有效性。与优化独立任务专用管线不同,ChemMLLM提供了统一的多模态接口,可处理多种化学任务,为分子理解与生成提供了更简洁且可扩展的框架。进一步对五类任务进行了不同模型的基准测试,以刻画该统一方法的能力与局限性。总体而言,ChemMLLM为化学领域更综合的多模态建模以及科学AI的应用提供了可行路径。
2 结果
2.1 概览
设计了五类基于视觉的化学研究任务,用于训练与评估ChemMLLM,包括:(1)分子图像描述;(2)分子图像性质预测;(3)图像到SMILES转换;(4)可控多目标分子图像设计;(5)分子图像优化。ChemMLLM及基线模型在五类任务上的性能已进行了总结。

图3 | 五类任务的实验结果 (A) ChemMLLM-7B、ChemMLLM-34B及基线模型在五类任务上的整体性能。指标包括Mean Pearson:平均Pearson相关系数;Avg Sim:Tanimoto相似性;Normalized ΔLogP:归一化 ΔLogP(除以最大值后的归一化LogP增量)。数据以均值表示。(B) 分子图像描述生成任务的实验结果,数据以均值表示。(C) 分子图像性质预测任务的实验结果。雷达图中显示预测值与真实值之间的Pearson相关系数,数据以均值表示。(D) 图像到SMILES转换任务的实验结果。指标包括Avg Sim:Tanimoto相似性;ΔLogP@0.3:在Tanimoto相似度约束0.3下的LogP增量。数据以均值±标准差表示。(E) 分子图像优化任务的实验结果,数据以均值±标准差表示。(F) 可控多目标分子图像设计任务在五个测试点的实验结果,基于评估数据的性质分布。样本按照黄金性质值进行分桶。对于每个性质,从黄金值分布中计算五个百分位锚点(第2、25、50、75和98百分位)。每个样本根据与最近锚点的距离分配到相应的桶,桶的边界由相邻锚点的中点确定。小提琴图显示每个桶中生成结果的分布;中央水平线表示中位数,上下水平线分别表示最大值和最小值。
2.2 分子图像描述
分子图像描述生成是一类图像到文本的任务,要求模型根据每张分子图像生成关于其来源、功能、结构、特征及用途的描述。该任务需要模型将分子图像转化为自然语言描述,这一过程类似于化学家对实验数据的注释方式。
使用BLEU-2/4、ROUGE-1/2/L和METEOR指标评估生成描述与参考文本的匹配质量。
模型与多种MLLMs进行了比较,包括Qwen-VL-Chat、InternVL-Chat-v1.5、LLaVA-v1.5-7B、GPT-4o、ChemVLM-8B及HIGHT。实验结果表明,ChemMLLM在通用MLLMs中生成的描述质量合理,与真实文本高度匹配,而Qwen-VL-Chat生成的文本包含的语义信息较少。鉴于ChEBI-20测试集高度模板化,对参考文本与模型输出均进行了去模板操作,去除重复短语(如“the molecule is …”、“it derives from …”、“the major microspecies at pH …”等)。重新评估的指标显示,在去除公式化模式后,ChemMLLM仍能保持稳定的性能。
为进一步验证模型生成描述的准确性,还对该任务进行了盲测专家评审。
2.3 分子图像性质预测
分子图像性质预测是一类图像到文本的任务,要求模型为每张分子图像生成七种重要性质的数值,包括分子量(MW)、溶质在辛醇与水之间的分配系数(LogP)、拓扑极性表面积(TPSA)、氢键供体(Hbd)、氢键受体(Hba)、可旋转键数(Rb)以及药物相似性定量估计(QED)。该任务评估模型从2D分子图像直接推断关键化学性质的能力,使研究者无需专用软件即可从分子图像中获取可操作信息,从而加速药物或材料设计中的高通量筛选。
从模型生成的输出中提取七种分子性质,并使用均方误差(MSE)和平均绝对误差(MAE)评估预测精度。本任务未与 GPT-4o 进行比较,因为其无法直接从图像预测性质,同时与任务专用模型进行了对比,包括Chemception和Chemprop。实验结果显示,在七种分子性质的预测中,ChemMLLM均优于通用MLLMs,取得了最高的Pearson相关系数以及最低的MSE和MAE值。在预测的性质中,ChemMLLM有六个数值准确,一个数值接近真实值,而Qwen-VL-Chat七个数值均不准确或偏离较大。
此外,将评估扩展至关键的吸收、分布、代谢、排泄和毒性(ADMET)相关任务,使用了21世纪毒理学(Tox21)和细胞色素P450(CYP)基准数据集。在该任务中,将SMILES条目转换为二维分子图像,将挑战设定为多模态理解任务。模型需分析输入图像,并输出活性类别的二元概率分数,性能通过接收者工作特征曲线下面积(ROC-AUC)进行评估。通用 MLLMs 未纳入此比较,因为它们无法生成区分性预测,几乎对所有样本均预测为阳性,退化为简单解。ChemMLLM在Tox21基准上优于专用的图结构模型Chemprop,并在 CYP 数据集上取得了与Chemprop相当的性能。这表明统一的多模态方法能够恢复与生物活性相关的有效信号。
2.4 图像到SMILES转换
图像到SMILES转换是一项基础化学任务,要求模型识别每张分子图像中的SMILES字符串。该任务要求模型将2D分子图像精确转换为SMILES字符串,需要正确识别原子、化学键、环结构及立体化学信息。
从LLM输出中提取SMILES字符串后,使用准确率评估基于标准化SMILES的完全匹配,使用Tanimoto相似度衡量生成SMILES与真实SMILES的相似性。
比较了ChemMLLM与通用MLLM以及任务专用模型,包括MolScribe和Decimer。实验结果显示,ChemMLLM在通用MLLMs中实现了具有竞争力的图像到SMILES性能,同时专用的OCSR工具仍是强基线。尽管性能略低于MolScribe和Decimer,但ChemMLLM能够处理更广泛的下游任务,而不仅限于图像到SMILES转换。
ChemMLLM-34B在准确率上超过了专用的MolScribe模型。对MolScribe的失败案例进一步分析发现,其失败中有99.64%(277/278)源于立体化学识别错误(例如手性中心的R/S绝对构型或烯烃的E/Z几何构型错误),尽管分子连接关系正确。由于这些立体化学细节对药物的疗效和安全性具有决定性作用,其准确识别至关重要。该结果表明,本基准测试确实具有挑战性,即便是最先进的专用工具也难以完全应对。
为了更好的验证模型的生成精度,对该任务进行了盲测专家评审。
2.5 可控多目标分子图像设计
可控多目标分子图像设计是分子图像性质预测的逆问题,属于文本到图像的任务,要求模型根据目标性质生成分子图像。这是分子设计的核心。该任务的挑战在于在保持化学有效性的前提下,同时优化多个性质约束。
在评估过程中,按照SketchMol的方法,生成的分子图像首先通过MolScribe转换为SMILES,再由此计算分子性质。然后,将计算出的性质与真实值进行比较,使用MSE、MAE和Pearson相关系数进行评估。所有基线模型重复运行五次,报告最佳结果。
由于GPT-4o API在该任务上的表现不及其网页接口,且其他MLLMs无法生成图像,因此在评估其他MLLMs时,将此任务视为纯文本任务。具体而言,ChemMLLM生成分子图像,而其他MLLMs则直接生成对应的SMILES字符串。此外,Qwen-VL-Chat未纳入此任务比较,因为其在所有测试样本中均无法生成有效的SMILES字符串。评估结果显示,ChemMLLM能够在统一框架下根据目标性质直接生成分子图像,并成功满足约束条件。

图4 | ChemMLLM-34B分子图像生成任务示例 (A) 可控多目标分子图像设计任务示例。灰色字体表示期望的性质,蓝色字体表示ChemMLLM生成的分子图像对应的性质。(B) 分子图像优化任务示例。左图为输入图像,其LogP以灰色字体显示;右图为ChemMLLM生成的图像,其LogP以蓝色字体显示。(C) 分子图像优化任务中,ChemMLLM-34B生成的分子图像与原始分子图像之间的Tanimoto相似度分布。
2.6 分子图像优化
分子图像优化是一类图像到图像的任务,模型以具有较低期望性质(例如LogP)的分子结构作为输入,生成在保留化学有效性的前提下,性质更优的相似分子结构。该任务模拟了先导化合物优化的过程,这是药物发现中的基础问题。
在评估中,使用LogP提升量(生成分子与源分子LogP的差值)、平均Tanimoto相似度、分子多样性及新颖性来衡量分子优化效果。采用Therapeutics Data Commons(TDC)提供的评估方法:分子多样性通过生成分子中扩展连接指纹(ECFP)两两之间的平均Tanimoto距离计算,新颖性定义为生成分子中未出现在训练集中的分子比例。其他设置与可控多目标分子图像设计任务相同。
由于GPT-4o在该任务上的API表现不及其网页接口,且其他MLLMs缺乏图像生成能力,因此在评估时将其视为图像到文本的模型(从图像生成SMILES)。对于无法直接从图像生成优化SMILES的GPT-4o,采用文本到文本的方法,将输入SMILES以文本形式提供。同时,将ChemMLLM与任务专用模型进行了比较,包括Seq2Seq、HierG2G和Chemformer。实验结果显示,ChemMLLM-34B在对比模型中实现了LogP的最大提升。然而,其平均Tanimoto相似度仍然较低。同时相似度分布表明,在Tanimoto相似度约束为0.3的条件下,成功率仅为1.5%。这些结果表明,虽然ChemMLLM能够改善分子性质,但LogP的提升通常伴随显著的结构变化,而非现实的先导化合物优化。尽管存在这一限制,ChemMLLM仍能够在统一框架下直接生成分子图像,为多模态化学任务中的人类-AI交互提供了更统一、便捷的接口。
2.7 直接可视化生成与符号渲染的比较
讨论了直接图像生成与传统SMILES渲染流程之间的权衡。外部渲染能够保证输出的确定性和标准化,但容易受到中间文本生成错误的影响(例如无效的SMILES语法)。相比之下,直接生成方法避免了这种依赖,能够实现端到端的可视化目标生成。这种方法在捕捉特定可视化风格和保持图像一致性方面具有优势,但要求模型隐式学习化学有效性约束。总体来看,这两种范式具有互补性:外部渲染在严格标准化方面表现出色,而直接生成为面向视觉的人类-AI交互提供了新的可能性。
2.8 分子尺寸与分辨率可扩展性的影响
对分子量与可视化生成质量之间的关系进行了定量分析(使用学习得到的感知图像块相似性指标 [LPIPS] 测量),以评估固定256 × 256分辨率的局限性。经验结果显示,对于典型的小分子药物(100–1,000 Da),生成质量随分子大小变化较小,表明当前分辨率已为标准有机化合物提供了足够的信息密度。然而,对于1,000–2,000 Da范围内的大分子,生成质量略有下降,说明固定像素密度对更大且结构更复杂的分子形成了物理瓶颈。尽管如此,对标准药物基准(如ZINC和ChEMBL)进行的统计分析表明,大多数药物候选分子远低于该阈值,说明当前设置能够覆盖实验中许多小分子药物。
关于可扩展性,为使模型适应更高分辨率(如512 × 512),无需额外修改架构。该过程仅需在更高分辨率数据上重新训练VQGAN,然后再重新训练LLM。分辨率的主要区别在于,更大图像将被编码为更多的离散tokens。
2.9 视觉模态的必要性及互补作用
尽管分子本质上由其拓扑结构和3D几何构象定义,引入2D视觉模态能够弥补HCl和现实数据可访问性中的关键空白,而这些是单靠符号或3D几何模型无法实现的。从交互角度来看,2D图像构成了化学家的主要认知界面。与作为非直观符号中间表示、需要外部渲染工具验证的1D SMILES字符串或通常需要专用软件操作的3D结构不同,生成的2D图像能够提供即时且轻量的视觉反馈。直接图像生成消除了将符号输出转换为视觉表示的分散工作流程,从而降低认知负荷,并显著加快研究者与AI之间的迭代设计循环。此外,视觉模态弥合了物理世界与数字世界的断层,使那些缺乏图像处理能力的模型无法访问的数据源得以利用。在教育和协作场景中,手绘草图或黑板笔记等非标准化输入普遍存在,但对于标准图模型而言是“盲区”。赋予模型视觉理解能力,可让用户无需手动将输入转换为SMILES或图结构,即可直接查询这些信息。此外,大量化学知识仅以位图图像形式存在于历史文献、专利和实验记录中,缺乏对应的机器可读文本或3D坐标。具备图像处理能力的多模态模型能够提供有用接口,以挖掘和解释这些非结构化数据。因此,相比3D几何信息和1D SMILES,2D图像模态作为重要补充,提升了模型的可用性、可解释性以及对现实化学数据的覆盖能力。
2.10 可解释性与视觉基础分析
为探究模型预测的潜在机制,对图像到SMILES生成过程中的视觉注意力动态进行了可解释性分析。
首先,通过反事实扰动分析检验了学习到的注意力图的可靠性。具体而言,将生成的tokens的跨模态注意力聚合到输入图像网格,以识别高度关注的区域。随后,对这些区域的前k%进行遮挡测试,并评估对生成性能的影响。结果显示明显下降:仅遮挡少量高度关注区域即可导致准确率显著下降,且随着k增加,这种下降进一步加剧。这些反事实结果表明,模型的预测并非由背景噪声驱动,而是与特定、视觉基础的结构证据存在因果依赖。
为了进一步阐明模型学习的化学特征,对跨注意力分布进行了可视化分析。观察到两种明显模式:(1)全局平均跨模态注意力覆盖整个分子骨架,表明对拓扑结构的整体感知。(2)不同功能基团(如酰胺、硝基、磺酰基和羧酸)的token特异性注意力在对应的视觉子结构上高度集中。这种准确的对齐表明,模型在2D分子图像与文本化学概念之间建立了稳健的结构-语义基础,有效超越了简单的模式匹配,从而捕捉分子的潜在化学本质。

图5 | ChemMLLM整体架构 (A) 图像编码器与解码器。图像编码器使用卷积神经网络(CNN)提取空间特征图,每个
2.11 直接SMILES生成与图像生成的性能分析
为了严格比较基于图像与基于SMILES的分子生成性能,将ChemMLLM与仅使用SMILES序列训练的基线模型进行了对比,任务包括分子图像性质预测和可控多目标分子图像设计。结果显示,仅使用SMILES的基线模型在数值指标上表现更优。这在意料之中,因为SMILES字符串具有离散且高度结构化的特性,相比之下,高维图像生成的复杂性更高。
然而,需要强调的是,主要贡献并非在数值上超越文本基准,而在于将语言模型的能力扩展至视觉领域。仅使用SMILES的方法根本无法处理或生成分子图像,这限制了其在化学知识以视觉形式整理的实际应用场景中的效用(如专利、文献及实验记录)。通过支持直接的图像理解与生成,ChemMLLM提供了互补接口,弥合了文本数据与化学视觉语言之间的鸿沟,实现了文本模型无法复制的多模态能力。
2.12 Mol-VQGAN与LLM SFT影响的消融研究
在分子图像性质预测任务上进行了消融研究,以评估领域特定的Mol-VQGAN和LLM监督微调(SFT)的独立贡献。利用property2img任务中的200个样本子集,进行了5-shot评估。
在此消融设置中,同时配备了领域适配Mol-VQGAN与LLM SFT的完整模型在大多数分子性质上取得最佳结果。具体而言,对MW、TPSA、Hba和Rb的Pearson相关系数分别达到0.71、0.71、0.66和0.62,表明视觉编码器与微调语言模型的协同作用能够有效捕捉语义精度与化学结构信息。
当领域特定的Mol-VQGAN被替换时(即不使用VQGAN)发现,即便保留LLM SFT,结构性指标的性能仍显著下降。例如,MW的相关性降至0.24,以及模型无法捕捉与极性相关的特征,表现为TPSA和Hba的相关性接近零或为负(分别为−0.02和−0.06)。尽管QED评分仍可比(0.36),但其他结构性指标的崩溃凸显了Mol-VQGAN在编码空间化学信息方面的关键作用,而仅依靠LLM无法推断这些信息。
此外,仅保留VQGAN而移除LLM SFT会导致模型完全失效,各项指标性能接近随机水平(如MW为−0.05,TPSA为−0.01),说明缺乏化学特定指令微调的LLM无法正确对齐视觉tokens,也无法推理分子性质。综上所述,专用视觉编码器与SFT对于实现准确的化学多模态理解均不可或缺。
2.13 λ参数影响的消融研究
为系统评估超参数的影响,在分子图像描述生成任务中对八个不同的λ值进行了实验评估。结果表明,λ的变化对模型性能影响仅为边际水平。基于Lumina-mGPT采用的方法,最终在所有LLM训练过程中将λ固定为1e−05。
2.14 研究的局限性
ChemMLLM提供了一个统一的多模态框架,用于跨文本、SMILES和图像模态的分子理解与生成。尽管ChemMLLM具有新颖性和一致性,但仍存在若干局限性。
首先,当前架构在若干核心定量任务上仍落后于专用或模态匹配方法。分析显示,仅使用SMILES的基线模型在数值指标上表现更优,这表明目前的多模态方法尚未充分利用视觉模态。在分子优化任务中,生成的分子通常与源分子结构相似性较低,说明观察到的性能提升往往通过较大结构变化实现,而非在药物化学约束下的真实先导优化。因此,未来工作应探索更有效的多模态架构和训练目标,以在保持统一多模态接口优势的同时,更好地保留分子结构。
其次,当前的评估设置不利于公平的模型比较。由于大多数通用基线不支持原生分子图像生成,一些比较不可避免地涉及通道不匹配的情况,即ChemMLLM在图像生成模式下评估,而其他模型通过文本输出或图像理解方法进行评估。此外,图像生成任务依赖MolScribe进行下游评分转换。随着更多原生分子图像生成模型的出现,未来基准设计应朝向更统一且模态一致的评估协议发展。
第三,本研究中使用的大量多模态数据是通过RDKit渲染和基于模板的文本生成,从现有SMILES资源合成构建的,而并非来源于真实的多模态化学工作流程。因此,本研究未能充分检验模型对异构描绘风格、噪声文档图像、手绘分子或黑板草图的鲁棒性,而这些仍是实际应用中的重要目标。未来工作应将基准扩展至更真实的图像来源,并实现完全标准化的评估。
最后,当前的视觉编码器处理固定的256 × 256分子图像。尽管该分辨率对许多小分子药物足够,但对于更大或结构更复杂的化合物可能形成瓶颈。未来工作可考虑采用更高分辨率的编码方案或自适应视觉表示,以提升可扩展性。
3 讨论
ChemMLLM是一种化学MLLM,能够无缝处理文本、SMILES字符串及分子图像的分子理解与生成。它由Mol-VQGAN编码器与LLM组成。Mol-VQGAN将图像离散化并重构为码本token,使LLM能够将图像视作类似文本的序列进行处理,同时LLM负责生成文本和有意义的图像token。Mol-VQGAN与ChemMLLM的结合实现了早期且无缝的多模态融合。
为了弥补在通用图像上训练的VQGAN无法准确编码和解码分子图像的缺陷,对VQGAN进行了大规模分子图像重训练,使其获得领域特定的图像表示能力。采用两阶段训练方案以实现更好的多模态对齐:第一阶段训练VQGAN,第二阶段冻结VQGAN并将其作为LLM的图像编码器。第一阶段使VQGAN能够捕捉分子图像中的化学结构特征,第二阶段将这些视觉分子信息注入LLM,以提升下游任务的性能。针对多模态化学任务的数据稀缺问题,设计了五类跨模态化学任务并整理了对应数据集,为化学领域的多模态AI提供了宝贵资源。
随后,对所提出的五类任务进行了模型基准测试,以系统评估该统一多模态方法。大量实验结果显示,ChemMLLM为文本、SMILES和图像模态中的分子理解与生成提供了单一框架。ChemMLLM解决了以往化学多模态模型依赖先生成SMILES再进行外部渲染,而非原生生成分子图像的关键局限。通过在同一模型中实现原生图像生成,ChemMLLM为多样化的多模态化学任务提供了统一接口,并为未来集成多模态建模研究奠定了实践基础。