NC 2026 | 不确定性感知机器学习: 面向全球化学品非致癌人体毒性预测研究
今天介绍的是发表在 Nature Communications 上的一项研究工作。该研究针对全球超过10万种已上市化学品在非致癌人体毒性数据严重缺失的问题,构建了不确定性感知机器学习模型,用于预测生殖/发育毒性与一般非致癌毒性效应剂量(POD)。方法上结合保形预测与贝叶斯神经网络,同时引入分子结构描述符与化学相似性度量,实现对模型认知不确定性与数据不确定性的联合刻画。结果表明模型在保持较高预测精度的同时,可输出校准良好的置信区间,并能识别结构陌生区域的高不确定性化学物质。在超过10万种化学品的应用中,进一步揭示了PFAS、有机磷酸酯及二噁英类等高风险与高不确定性“热点区域”。该工作为化学品风险评估提供了可解释的不确定性框架,并为后续数据生成与模型改进提供了方向。

获取详情及资源:
0 摘要
人类会暴露于数千种化学品,但有限的毒性数据阻碍了对其人体健康影响的有效管理。高性能机器学习模型有潜力弥补这一缺口,但其在更广泛化学品范围内的预测性能尚未得到充分表征,削弱了对预测结果的信心。不确定性感知模型被开发用于预测生殖/发育毒性和一般非癌症人体毒性效应剂量。经过良好校准的模型提供的不确定性估计与观测到的预测误差和化学熟悉度相一致。针对超过100000种全球上市化学品,毒性预测给出了95%置信区间,并识别出毒性和不确定性热点。这些结果可用于支持旨在降低潜在人类健康影响的决策,并指导有针对性的数据生成和建模工作,以降低预测不确定性。提升预测不确定性的透明度可为建立毒性预测信心提供关键认识,并支持将基于机器学习的预测合理整合进化学品评估。
1 引言
人类每天都会通过空气、水、食物和无数消费品暴露于广泛的化学品。这些化学品可能对人体健康产生显著但仍很大程度未知的毒性相关影响。维护人体健康需要坚实的科学基础,用以评估化学危害、设定安全暴露限值、监管有害物质,并推动使用更安全的替代品。然而,全球注册的超过100000种上市化学品中,多数缺乏化学数据,这阻碍了有效的化学品评估。这类评估中的一个关键指标是毒理学出发点(POD),即剂量-反应曲线上不良效应开始显现的最低剂量。较低的POD表示化学品效力更强,因为引发毒性效应所需的暴露剂量更小。已有工作利用大量体内动物实验的统计和概率分析推导出非癌症POD,为数百到数千种化学品提供了POD。这使多数全球上市化学品仍缺乏数据,因此也缺乏对其非癌症毒性危害人体健康潜力的适当估计。
计算机模拟工具,尤其是机器学习(ML)模型,是填补化学品毒性数据缺口的有前景方法。它们利用支持向量机、随机森林、梯度提升机和深度学习方法等灵活算法,从大型复杂数据集中识别模式,从而实现较高预测性能。然而,若干挑战阻碍了ML模型在化学品评估中的广泛采用。其性能高度依赖可用训练数据的数量和质量,以及所选择的算法和训练特征。ML模型的外推能力有限,使其适用性受限于训练数据所代表的域。其高度灵活性还可能导致过拟合,即模型拟合噪声或错误数据,而不是底层模式,从而在训练数据上取得异常高的预测准确率,但在验证数据集上准确率显著降低。因此,预测性能可能在不同模型和化学品之间显著变化。然而,多数ML模型缺乏识别自身局限或量化预测不确定性的机制。这些局限削弱了对预测的信心,并阻碍其整合进化学风险和健康影响评估、化学替代研究、安全且可持续设计方法,以及产品和技术生命周期评估等决策支持工具。
为提升对ML预测的信心,大量工作已聚焦于理解和量化ML模型中的不确定性。ML不确定性通常分为两类主要类型:偶然不确定性和认知不确定性。偶然不确定性是指由可用训练数据内在随机性和变异性产生的数据相关不确定性,例如由具有显著生物学和实验变异性的少量观测效应样本推导POD时产生的不确定性。认知不确定性是指由知识缺乏造成的模型相关不确定性,这会在模型构建过程中引入变异性,例如训练数据不完整、训练特征选择不同以及模型参数不确定。迄今为止,已经开发出多种不确定性估计方法。一些方法聚焦于偶然不确定性,例如分位数回归,它基于经验估计分位数提供预测区间。另一些方法针对认知不确定性,例如集成方法,它通过大量预测器的点预测方差来估计不确定性。单独来看,这些不确定性估计可能过度自信,因为它们无法充分同时考虑两类不确定性。此外,尽管已有这些进展,不确定性量化在ML模型开发中仍未得到充分使用,尤其是在医疗保健和自动驾驶系统等关键应用之外。
不确定性感知ML方法(UAM)被用于在每次预测时提供量化置信区间,并开发口服暴露非癌症POD预测模型。生殖/发育效应与一般非癌症效应被分开处理,以反映二者对人类生命损害严重程度的差异。UAM的目标是同时量化偶然不确定性和认知不确定性,在广泛化学结构范围内生成稳健预测,包括陌生或具有挑战性的化合物,并提供能够准确反映这些局限的置信区间。为展示该方法的广泛适用性,表现最佳的模型被用于预测超过100000种上市化学品的大规模集合中的生殖/发育POD和一般非癌症POD,为当前缺乏POD数据的广泛使用化学品提供初始毒性估计。此外,高预测毒性及相关不确定性热点被分析,用于识别不同化学类别的趋势,并突出与特别高非癌症毒性效力或低预测信心相关的优先类别。以往工作主要聚焦于提高预测准确性,而很少量化并验证预测不确定性;后者是预测数据获得信任和采纳的关键障碍。该项工作首次在如此规模的化学空间中全面展示了不确定性感知毒性建模,使透明预测能够支持建立对基于机器学习化学品评估的信心。不同于主要聚焦预测准确性的以往工作,预测不确定性得到量化和验证,从而处理了预测数据进入决策工具时的一个关键局限。
2 结果
2.1 不确定性感知ML预测性能和校准
基于频率学派保形预测(CP)和概率贝叶斯神经网络(BNN)的两种不确定性感知ML方法(UAM),被用于估计两个人体毒性终点,即生殖/发育(rd)POD和一般非癌症(nc)POD,并比较其预测性能和不确定性校准。所用数据集分别覆盖2357和1845种化学品,同时比较了四组不同分子描述符作为训练特征。

图1|CP模型的预测性能与不确定性校准 a,b 在训练数据集(绿色)与交叉验证测试数据集(蓝色)上的模型预测结果显示,相较于一般非致癌毒性,生殖/发育毒性的平均预测误差更小。 c,d 中位预测不确定性(95% CI 宽度)分别为 2.2(rd)和 2.7(nc)log10单位。 e,f 基于置信度的校准结果显示,在预测CI内的期望比例与观测比例之间具有一致性。 g,h 基于误差的校准结果显示,在按预测不确定性递增排序的分组中(每组包含42–49种化学物质),平均预测不确定性(RMU)与均方根误差(RMSE)之间保持一致性。 i,j 基于距离的校准结果显示,在按预测不确定性递增排序的分组中(每组包含42–49种化学物质),平均预测不确定性(RMU)与描述化学物质相对于训练数据集中五个最近邻的Jaccard距离均值之间保持一致性。 ECE 期望校准误差,ENCE 期望归一化校准误差,CI 置信区间,CV 交叉验证,Jaccard 与训练集中5个最近邻的平均Jaccard距离,MAE 平均绝对误差,MdAE 中位绝对误差,n 化学物质数量,Pearson 皮尔逊相关系数,POD 起始剂量点,RMSE 均方根误差,RMU 平均不确定性,R2 决定系数,Spearman 斯皮尔曼等级相关系数。
基于10折交叉验证的比较显示,对于已有数据的测试化学品,基于随机森林的CP模型相比BNN模型取得更高预测性能,并且在量化这些化学品的不确定性方面校准更好。总体而言,预测误差较低,即预测准确性较高的模型,表现出较低平均预测不确定性,说明准确预测与对这些预测的信心之间存在内在联系。这一联系并不总是被直接用于推导不确定性估计:CP模型利用有可用数据的化学品校准集,从观测预测误差中构建不确定性估计;而BNN模型从模型权重的后验分布中推导不确定性,较高不确定性使预测误差更可能发生。尽管使用不同方法和描述符,不同模型之间的预测高度相关,中位数预测的
对于两个终点,CP模型均优于BNN模型,表现为更低预测误差和更高决定系数。两种方法对
两种方法提供的不确定性量化均得到良好校准,能够捕捉不确定性的不同方面,这一点体现在基于信心、基于误差和基于距离的校准中。
基于信心的校准评估已有数据测试化学品的报告值落入预测置信区间的频率,以及这一频率是否与预期置信水平匹配,例如95%的报告点是否落入预测的95%CI。两种方法在1%到99%的不同置信水平下,报告数据点落入预测CI的预期比例与观测比例均表现出强一致性。CP模型被设计为保证所需置信水平,因此表现尤其良好;预期校准误差(ECE)用于描述预期比例与观测比例之间的平均绝对偏差,其值为1.2%(rd、nc)。BNN模型的观测比例持续高于预期置信水平,
基于误差的校准评估模型预测不确定性(由均方根不确定性,RMU描述)是否与观测预测误差(由RMSE描述)一致,评估对象是按预测不确定性递增排序、每批包含42-49种化学品的批次。两种方法均表现出RMU随RMSE增加而增加的预期趋势,尽管在BNN预测
基于距离的校准评估较高不确定性是否与预测不同于训练中见过化学品的化学品相关。两种方法均显示,在按预测不确定性(由RMU描述)递增排序、每批包含42-49种化学品的批次中,化学差异性增加;该差异性由使用Morgan指纹计算的测试化学品到五个最近训练化学品的平均Jaccard距离给出,取值范围为0到1。这表明,模型能够识别几乎没有或完全没有先例数据区域中认知不确定性的增加。趋势中的肩部进一步提示,作为经验规则,可信预测主要可在平均Jaccard距离低于0.5的化学品上实现,即这些化学品与其五个最近训练化学品平均具有50%相似性。
总体而言,尽管两种方法都提供了良好校准的不确定性量化,基于随机森林的CP模型比BNN模型更能拟合观测数据,从而实现更高预测性能和模型信心,并因此具有更低总体不确定性。这很可能并非由于BNN拟合数据的能力较低,而是因为其较弱假设需要更多数据才能找到良好近似,从而导致更大的认知不确定性。此外,BNN性能可能受到网络架构探索和超参数调优有限的约束;相比基于随机森林的模型,NN性能对这些设置更敏感。然而,增加网络复杂性并未持续改善常规NN的预测性能,支持如下结论:限制NN在这些数据集上学习更好近似的因素是数据局限,而不是模型容量。基于模型性能和校准结果,后续分析采用了基于RDKit描述符训练的CP模型。
2.2 面向更多样化化学品的不确定性感知ML预测
采用不确定性感知ML可能会受到牺牲预测性能的顾虑阻碍,因为这类模型需要在降低预测误差与提供准确置信区间之间取得平衡。不确定性感知模型的性能与高性能常规ML预测模型进行了比较。为此,五种常规ML算法使用四类分子描述符进行训练,并在这些不进行不确定性量化的ML模型之间获得高性能共识预测,达到

图2|非标准化化学物质子集的预测性能与不确定性校准 该结果基于扩展数据集训练的CP模型,用于PODnc预测。 a 报告值(灰色)与预测POD(蓝色,基于交叉验证)在标准化与非标准化化学物质子集上呈现相似分布。 b 在标准化与非标准化化学物质子集上,平均预测不确定性(RMU,蓝色)与观测预测误差(RMSE,灰色)保持一致性。 c 训练数据集(绿色)与交叉验证测试数据集(蓝色)的模型预测结果显示非标准化化学物质存在更高过拟合现象。 d 非标准化化学物质的预测不确定性(95% CI 宽度)平均为3.7 log10单位,而标准化化学物质为3.1 log10单位(浅蓝色)。 e 非标准化化学物质的误差校准结果显示,在按预测不确定性递增排序的分组中,平均预测不确定性(RMU)与平均预测误差(RMSE)之间保持一致性。 f 非标准化化学物质的距离校准结果显示,在按预测不确定性递增排序的分组中,平均预测不确定性(RMU)与描述化学物质相对于训练数据集中五个最近邻的Jaccard距离均值之间保持一致性。 Boxplots 显示中位数(中心)与四分位距(箱体),须线延伸至2.5%与97.5%分位数。 ENCE 期望归一化校准误差,CI 置信区间,CP 保形预测,CV 交叉验证,Jaccard 与训练集中5个最近邻的平均Jaccard距离,MAE 平均绝对误差,MdAE 中位绝对误差,n 化学物质数量,Pearson 皮尔逊相关系数,POD 起始剂量点,RMSE 均方根误差,RMU 平均不确定性,R2 决定系数,Spearman 斯皮尔曼相关系数。
为考察UAM预测比常规ML模型适用范围更多样化化学空间、并准确反映不同不确定性水平的潜力边界,模型在一个包含无机、金属和有机金属化合物的数据集上进行了性能评估。这些化学类别通常在训练数据集预处理过程中被排除,因为其键合方式和价态不标准,而面向很少含金属的类药物化学品设计的典型分子特征无法编码这些信息。因此,对这些化学品的预测预期会高度不确定。不过,如果UAM能够适当量化这种不确定性,就可能减少在训练中排除非标准化化学品的必要性。这将允许使用更大、更多样化的数据集,进一步扩展适用性并可能提高预测性能,同时通过不确定性估计指出当前训练特征的局限。一个替代训练数据集被构建出来,其中包含这些非标准化化学品,总计2873种(rd)和2225种(nc)化合物。模型使用这一扩展数据集训练,其中纳入标准化和非标准化化学品,以评估其在更多样化化学空间中预测不确定性的能力。预测的
2.3 超过100000种上市化学品的毒性和不确定性热点
基于上述发现,使用标准化数据集和扩展数据集训练的CP模型最终被应用于预测超过100000种全球上市化学品的生殖/发育POD和一般非癌症POD。其中,126060种为标准化化学品,8054种为非标准化化学品。标准化化学品的结果在此呈现;非标准化化学品的临时结果具有较高且可能被低估的预测不确定性。为发现上市化学品之间的模式,化学空间分析采用

图3|126,060种标准化上市化学物质的化学空间图谱 a,b 根据预测的log10尺度POD对化学空间进行着色,分别对应生殖/发育毒性(a)与一般非致癌毒性(b),颜色由绿色到橙色变化。 c,d 根据95% CI宽度对应的不确定性进行着色(log10尺度),颜色由蓝色到红色变化。 e 给出高毒性与高不确定性区域的示意性标注,用于识别热点区域。饼图表示不同毒性水平与不确定性水平下上市化学物质的比例分布。 CI 置信区间,PBB 多溴联苯,PBDE 多溴二苯醚,PCB 多氯联苯,PCDE 多氯二苯醚,POD 起始剂量点。
总体而言,上市化学品集合的中位数毒性预测为
两个终点均显示出若干与较高预测毒性相关的聚类。值得注意的是,两个含有有机硫代磷酸酯的聚类表现出高毒性,预测
若干多卤代化合物聚类也被预测具有较高一般非癌症毒性。这些聚类包括多溴和多氯联苯(PBB、PCB)及二苯醚(PBDE、PCBE)、氯代苯并二噁英和苯并呋喃,以及多氯环脂族化合物。前三个聚类显示出非常高的预测不确定性,95%CI跨度超过6个
另外两个预测不确定性显著升高的聚类,与多种天然产物有关,例如生物碱、聚酮、苯丙素和木脂素,以及杂环吩噻嗪。尽管这些天然产物类别只表现出略高的毒性效力,但显著的预测不确定性使其成为模型开发工作的优先类别,相关工作旨在提高模型信心,以便更好评估毒性效力;这一点尤其重要,因为这些聚类中的某些化学品,例如吗啡烷生物碱,具有已知生物活性。
2.4 超过100000种上市化学品的基于类别毒性排序
化学空间分析显示,不同化学类别相关的毒性和不确定性均存在显著趋势。为进行系统性的化学类别排序,ClassyFire化学分类体系被用于按最低可用分类层级(亚类、类别或超类)对化学品分组。按中位数预测毒性排序后,至少覆盖30种上市化学品的前25个化学类别得到突出呈现。若干排名靠前的化学类别对应的示例化学品、主要用途以及与人类相关的观测不良效应也得到概述。排名靠前的化学类别与前述聚类结果高度一致。
有机硫代磷化合物,包括硫代磷酸酯和二硫代磷酸
一般非癌症效应中排名最高的类别是苯并
结果显示,排名靠前的化学类别预测总体上与预期高度一致。然而,还观察到预测毒性较高的化学品往往具有更高预测不确定性。这可以由训练数据中高毒性化学品的相对表示显著较低解释,其中

图4|按化学类别分组的标准化上市化学物质排序分析 化学类别基于ClassyFire化学分类体系中可用的最低分类层级(子类、类(C)或超类(S))确定。 a,b 展示所有化学类别的预测POD与95% CI不确定性散点图,并突出显示按毒性强度(以中位预测POD衡量)排序的前25个化学类别,这些类别每类至少包含30种上市化学物质。 c,d 给出前25个化学类别中化学物质数量分布。 e,f 展示前25个化学类别的预测POD分布。 g,h 展示前25个化学类别对应的预测不确定性(95% CI)分布。所有数据点根据其在上市化学物质集中最常见的15个ClassyFire超类进行着色(见图例)。箱线图显示中位数(中心)、四分位距(箱体),须线延伸至2.5%与97.5%分位数,子图(c,d)中标注了样本量。 CI 置信区间,POD 起始剂量点。
表1|涵盖至少30种化学物质的前25个化学类别选择结果(基于126,060种标准化上市化学物质) 按生殖/发育毒性与一般非致癌起始剂量点(POD)的中位预测毒性强度进行排序。

每个条目均包含该化学类别的代表性化学物质及其CAS登记号与化学名称,以及其预测与报告的log10 POD值(含95%置信区间(CI)),同时给出主要用途、已观察到的不良效应以及导致这些效应的相关机制。定义:nr of chemicals = 每个类别中上市化学物质总数(以及用于训练的具有报告POD的化学物质数量),high potency fraction = 预测POD位于前1%的化学物质比例,* = 报告POD未用于模型训练(由于底层数据点少于4个)。
3 讨论
不确定性感知ML被应用于预测生殖/发育POD和一般非癌症POD,并给出量化置信区间。该方法经证明具有良好校准,能够提供与预期置信水平、观测预测误差以及与训练化学品结构相似性差异一致的不确定性估计。应用这些模型后,可为超过100000种此前几乎没有可用数据的全球上市化学品提供口服非癌症毒性估计,覆盖工业和消费品中常用化学品的很大比例。这些预测允许识别不同化学类别中的预测毒性及相关不确定性热点,形成更宽泛的基于组别的视角,突出优先类别,从而为限制潜在有害化学品使用的决策提供信息,并指导建模工作以提高对不确定预测的模型信心。
这些模型和预测POD数据旨在支持覆盖上市化学品的更广泛化学影响和风险评估。这类评估可将非癌症人体毒性预测作为关键组成部分,并结合额外信息推导风险或健康影响水平;所需数据包括化学品生产、化学品在消费品和工业过程中的使用、室内外环境归趋以及人体暴露,以量化化学品相关健康风险。对于这一应用,所提供的定量置信区间可防止对预测结果过度自信,并允许检验相关不确定性是否会改变或妨碍此类化学品评估得出稳健结论。根据决策背景,评估可利用最佳估计及相关置信区间进行稳健比较分析,例如生命周期评估;也可采用更具保护性的方式,考虑毒性上界以建立安全裕度,这在人类健康风险评估中很常见。这是从“无数据即无问题”的思维转向按需评估化学品毒性效力的重要进展,即在利用同一数据源的同时,基于最可能估计或保守估计进行评估。此外,所提供的不确定性量化可帮助确定实验研究优先级,以降低具有挑战性化学域中的不确定性,并迭代提高风险或健康影响水平评估的可靠性。这是协调化学风险与可持续性评估数据生成的重要一步,可处理这两类方法之间潜在冲突结果;在欧盟委员会“安全且可持续设计”等综合框架背景下,这一挑战日益重要。尽管实施此类综合评估超出当前工作范围,经过良好校准的预测和置信区间仍为后续开展全面风险和影响评估提供坚实基础。
此外,结果展示了开发UAM如何显著提升预测不确定性的透明度。将这一方法用于开发面向不同参数、训练特征和数据集的模型,有助于在多个选项中识别最确定的预测;这正是化学应用中ML模型用户的主要关切。这可能促进数字预测方法在化学品评估中的整合和接受,而当前这种整合受到对预测化学数据信心不足的阻碍。然而,提高UAM的可解释性对于增强其接受度至关重要,尤其是在监管语境中。尽管总体特征重要性可以轻松获得,但它不足以从底层毒性机制角度解释预测。将UAM与可解释人工智能(XAI)技术结合,例如Shapley值、代理建模或反事实,可在单个预测层面为毒性机制和不确定性驱动因素提供有价值认识。不过,由于两种方法结合会增加复杂性、计算需求和技术障碍,这种整合可能面临挑战。此外,UAM量化的不确定性在许多预测中仍然较高,这可能限制其使用信心,并凸显进一步提高预测准确性的必要性。尽管不确定性量化本身不会降低预测不确定性,但它为模型开发人员提供关键认识,有助于识别驱动不确定性的因素,并提高模型泛化能力、降低预测不确定性。基于量化不确定性提供的认识,降低预测不确定性的潜在策略可进一步讨论。一般而言,模型的认知不确定性可以通过增加模型对预测任务的知识而降低。向ML模型输入知识的一种关键方式是选择合适的训练特征。常用一维和二维分子描述符方法,包括该项工作所使用的方法,在充分捕捉影响生物相互作用并决定毒性水平的结构特征方面能力有限。例如,该方法没有区分对映异构体,而由于多数氨基酸具有手性,对映异构体可能以不同方式与结合位点相互作用。类似地,分子的空间排列,如2,3,7,8-TCDD的平面结构,可能显著影响结合亲和力和毒性,但分子描述符未捕捉这一点。分子柔性允许空间重排以适应不同结合位点,但仅通过可旋转键数量得到部分处理。这些局限可能阻碍模型识别毒性变化背后的驱动因素,从而提高预测不确定性。当前描述符方法在处理盐和混合物方面也存在局限,常见处理方式是剥离较小组分,只保留最大的有机组分。上市化学品集合中约16%为盐或化学品-溶剂混合物,可能因这种处理方式而受到不确定性增加的影响。此外,由于可用分子描述符适用性有限,非标准化化学类别与较高但被低估的预测不确定性相关,尤其是无机物、金属和有机金属。开发能够反映这些化学结构行为,并稳健表示多样化学类别和混合物的合适分子描述符,对于开发准确且广泛适用的预测模型至关重要。这类描述符可以利用机理理解,将驱动这些化学类别化学活性的性质纳入其中,可能通过利用生物相关性质的中间预测,或利用基于量子力学的波函数理论或密度泛函理论计算,从原子系统能量角度捕捉相关特征。另一种选择是采用先进的基于深度学习的化学嵌入,使用图神经网络、自编码器或自然语言处理等技术,CDDD和mol2vec等方法已经展示了这一点。这些方法在表示化学结构方面具有很高灵活性,但目前局限于小有机分子,并且由于数据可得性显著较低,在表示更多样化化学品和混合物时可能面临挑战。增加模型知识还可通过提供更多训练数据实现,例如针对表示不足的化学品和目标值范围开展定向实验数据生成,尤其是高毒性或低毒性极端范围。此外,体外测试等新型数据源成本更低且具备高通量能力,可显著提高暴露和效应终点的数据可得性。将这些终点按机理整合进现有化学品评估框架具有挑战性,因为需要将其连接到生物体层面的不良结局。基于ML的方法可利用这些数据,通过多任务学习、迁移学习和插补方法预测常规终点,使模型从相关预测任务中获得知识。降低认知不确定性的另一种方式是纳入领域知识。例如,物理信息ML对预测任务施加物理约束,如能量和质量守恒定律以及反应动力学;混合建模则将表示既有知识的机理模型与ML模型结合,用于处理未知或复杂元素,例如复杂相关性和高度非线性。在致力于降低预测不确定性时,必须注意偶然不确定性会限制不确定性能够被最小化的程度。Aurisano等人量化了POD确定过程中的显著偶然不确定性,这些POD用于训练模型;由于实验、物种和效应类别之间效应剂量高度变异,并且外推到人等效剂量存在不确定性,其95%CI跨度超过2个
该项工作概述的方法并不只适用于改进非癌症人体毒性预测。后续工作应聚焦于将类似方法扩展到建模化学品暴露和效应所需的其他参数,包括持久性、生物累积性,以及人体癌症毒性和生态毒性等其他效应类型。在更广泛化学品范围内处理这些数据缺口,将有助于更系统地识别受关注化学品,并在上市化学品和新型化学品中建立“安全”化学空间,为开发可持续产品和过程提供更安全的替代品。