ACL 2026 | 理解并缓解大模型数据增强中的偏见继承问题
今天介绍的是被接收在ACL 2026上的一项研究工作。随着越来越多的大模型开始依赖合成数据进行微调,数据增强中的隐藏偏见也可能被模型持续继承甚至放大。该工作首次系统性提出“偏见继承(Bias Inheritance)”问题,并围绕性别偏见与文化偏见展开分析。研究构建了覆盖显式/隐式、上下文/对比式、单一/交叉式等六类偏见的数据生成框架,并在10项分类与生成任务中评估其影响。实验发现,小比例偏见数据有时能提升与偏见弱相关任务的表现,但会显著恶化与偏见直接相关任务的公平性,并在多轮迭代训练中不断放大。进一步分析表明,偏见继承主要来自价值观、群体分布以及真实数据分布之间的错位。为缓解这一问题,研究提出了基于Token、Mask以及分布对齐损失的三类缓解方法,为后续构建更加公平可靠的LLM数据增强体系提供了重要参考。

获取详情及资源:
0 摘要
通过大型语言模型(LLMs)生成合成数据集,已经涌现为提升LLM性能的一种有前景的方法。然而,LLM本身会反映训练数据中的偏差,由此带来一个关键挑战:当模型基于合成数据训练时,可能传播并放大其中固有的偏差,从而显著影响下游任务的公平性与鲁棒性,这一现象称为偏差继承。围绕偏差继承的理解、分析和缓解,首次开展了系统性考察。LLM使用由真实数据和LLM增强数据组成的混合数据集进行微调,并将增强数据占比设为不同偏差比例。通过覆盖10个分类与生成任务的系统实验,分析了6种不同偏差类型的表现形式。实验结果表明,在与偏差直接相关的分类和生成任务中,偏差继承会损害下游任务性能。进一步分析识别出三类关键错位因素:价值错位、群体数据错位和数据分布错位。基于这些发现,提出了三种缓解策略:基于token、基于mask和基于损失的方法;这些方法在不同任务和偏差类型上的作用各异,说明缓解偏差继承面临显著挑战。相关发现可为LLM数据增强研究提供参考。
1 引言
大型语言模型(LLMs)已在推荐系统、检索增强生成和智能体系统等多类应用中发挥重要作用。凭借大规模训练语料和大规模网络,LLM取得成功的关键之一是高质量数据;但此类数据通常难以收集和过滤,近期工作也反复指出数据短缺问题。作为补救路径,合成数据正变得持续重要,尤其是在后训练阶段,来自更强LLM的数据增强日益普遍。例如,在微调文化特定LLM时,合成数据占全部训练数据的比例超过50%。一种正在涌现的趋势是基于LLM的增强,即新模型使用自身生成的数据进行训练,甚至可以实现迭代训练。
然而,这种范式转变也引发了重要担忧。近期结果显示,递归地基于合成数据训练的模型可能因分布漂移而遭遇不可逆的性能崩溃。随后也有工作表明,混合真实数据与合成数据可以缓解这类问题,但这些工作很大程度上忽视了另一种隐蔽风险:社会偏差继承。不同于会降低准确率或困惑度等模型效用的一般性能崩溃,社会偏差继承可能放大不同人口群体之间的社会刻板印象。在某些情况下,它甚至可能提升某些群体的性能,但这类收益往往以公平性下降为代价。
这一问题源于LLM本身存在偏差,因为用于预训练的网络爬取数据往往反映人类社会中的多种社会偏差。当带有偏差的LLM用于生成合成数据时,增强数据集很可能传播甚至放大这些偏差,这一现象称为偏差继承。例如,在Grover和GPT-2等LLM生成的新闻文章中,女性特定词语的比例显著低于基础文章。尽管近期工作试图展示有偏数据在强化刻板印象、造成不平等访问或结果以及降低信任方面的负面影响,但目前仍缺乏一种整体性方法来定量理解、分析和缓解偏差继承。
围绕LLM偏差继承,首次开展了系统性研究。需要注意的是,这与既有LLM输出偏差评估以及偏差转移研究存在显著差异;后者关注自然数据中的偏差如何在训练中被内化,或如何通过迭代训练被放大。相较之下,重点放在使用合成数据以及真实数据微调后的模型,在下游偏差相关分类和生成任务上的结果评估。核心问题包括:1)理解:增强数据中的社会偏差如何影响下游性能?2)分析:这种影响为何发生?3)缓解:在后训练过程中,如何缓解增强数据中社会偏差带来的负面影响?
• 理解:为全面模拟现实偏差场景,设计了一个多维偏差生成框架,覆盖6种不同偏差类型和3个关键维度,即上下文与对比、单一与交叉、显式与隐式。将有偏数据与真实无偏数据结合,并将偏差比例控制为{0%,5%,10%,20%,50%}。使用多个LLM家族的代表性模型,考察性别偏差和文化偏差对下游任务的影响,任务包括与偏差直接相关和间接相关的分类任务,以及开放式生成任务。关键观察包括:1)较低偏差比例(10%、20%)会提升与偏差间接相关的分类任务性能;2)在直接相关分类任务和所有生成任务中,偏差可能导致继承效应,降低少数群体性能并扩大其与多数群体之间的差距;3)偏差继承会在迭代调优中放大,并最终影响多数群体,导致所有群体的性能下降;4)在所有类型中,对比显式偏差和上下文隐式偏差造成的影响最严重。
• 分析:为进一步理解偏差继承的细微差异,分析了LLM对价值问题的回答与真实人类回答之间的关系、跨群体的数据生成分布,以及合成数据与真实数据的嵌入分布。结果揭示了导致细微影响的三类关键错位:LLM回答与人类文化价值之间的错位、生成数据中的跨群体错位,以及生成数据与真实数据之间的错位。
• 缓解:最后,提出三种缓解策略来处理错位并减少偏差继承。基于token的方法在文本前添加用于指示潜在偏差的token;基于mask的缓解方法替换与群体和偏差继承相关的敏感词;基于损失的方法设计损失函数,在后训练过程中对齐生成文本与真实文本的分布。随后展示了这些方法在不同偏差继承设置中的差异化效果,说明设计统一缓解方案具有显著挑战。
主要贡献包括:1)提出偏差继承,这是基于LLM的数据增强时代中的重要议题;2)首次对多维偏差继承进行全面考察;3)为未来LLM偏差研究提供具有启发性的发现、分析、算法和框架。
2 相关工作
合成数据增强已被广泛探索,用于提升LLM性能和鲁棒性。例如,SPIN旨在使合成数据与人工标注分布对齐。其他工作考察了合成数据的可靠性,并处理幻觉等挑战。此外,已有方法缩小了分布差距并扩展了数据多样性。除此之外,还有工作系统考察了LLM合成数据在不同NLP任务上的有效性,识别了在复杂任务中使用合成数据的潜在偏差与局限;也有工作探索了合成文本,尤其是新闻生成中的合成文本,如何在模型训练中补充人类撰写数据。进一步地,数据集策划选择的影响也受到关注,显示出泛化能力与毒性过滤之间的权衡。尽管这些工作显著促进了合成数据质量与多样性的提升,但往往忽视了这类数据中潜在固有偏差及其下游影响。与之互补,偏差继承分析弥合了这一缺口。
理解并缓解LLM中的偏差是一个关键重点。已有工作在聊天机器人交互、招聘和政治决策等应用中识别出文化对齐、刻板印象强化和人口统计差异方面的偏差。这些偏差通常源于数据选择与过滤,并会在迭代训练中持续存在。包括匿名化和事后调整在内的多种缓解策略已被探索,但效果并不一致。不同之处在于,重点关注LLM微调期间由合成数据引入的偏差,这与自然语言语料中的偏差传播不同。尽管已有工作考察了迭代训练中的偏差放大及其潜在收益,系统分析不同合成数据生成策略如何塑造偏差动态,可以为设计公平系统提供新的见解。
3 多维偏差生成
偏差普遍存在于LLM输出中;然而,由于多种偏差类型之间存在复杂交织,对偏差继承进行精确的定量控制具有挑战性。以下首先阐述偏差继承,然后介绍多维偏差生成框架。
偏差继承被定义为:使用可能带有偏差的数据微调LLM时,偏差发生传播和放大。更形式化地说,令
社会偏差本身复杂且多面,涵盖性别、种族和文化等多个维度。由于成因不同,社会偏差可以表现为显式、隐式、上下文或对比形式。为探索增强数据中偏差的影响,提出了一个多维框架,利用基于提示的数据生成来模拟偏差。该框架聚焦三个主要偏差维度:1)上下文偏差与对比偏差,前者受周围信息影响,后者来自数据内部的直接比较。2)单一偏差与交叉偏差,其中单个偏差可能相互作用并产生复合效应。3)显式偏差与隐式偏差,显式偏差通常被过度陈述,而隐式偏差更微妙,并嵌入数据之中。
该框架允许灵活组合不同偏差与下游任务。值得注意的是,作为隐式偏差一部分的人名天然携带交叉偏差,因为姓名通常反映文化、族裔或性别身份,并由这些因素引发相关偏差。因此,在考虑这些维度交互后,共形成六种不同偏差类型。在该框架下,提示被系统设计用于将各种偏差类型引入增强数据,并评估其在下游任务中的传播和影响。

图1|研究流程概述 a. 用于数据生成的六种关键偏差类型,关键属性以下划线标出. b. 可能影响下游任务的两类常见偏差. c. 用于增强大语言模型并缓解下游偏差的框架.
4 理解偏差继承
以下考察文化和性别偏差继承对下游分类任务与开放式生成任务的影响。
4.1 设置
偏差。考察两类常见偏差:性别偏差和文化偏差。对于性别偏差,关注六种职业:建筑师、牙医、护士、画家、教授和软件工程师,其中同时包含传统男性主导和女性主导的领域。对于文化偏差,使用四种多样文化:阿拉伯、中国、葡萄牙和西班牙,以覆盖高资源与低资源情形。
下游任务。评估有偏增强数据对下游分类和开放生成任务的影响。对于性别偏差,考察三项任务:职业传记分类、招聘推荐和薪资推荐;这些任务与性别偏差直接相关,并聚焦男性与女性群体之间的差异。由于文化偏差更为复杂,下游分类任务被划分为两类:与偏差直接相关和与偏差间接相关的任务;前者被认为与偏差关系更密切,例如恐同和厌女检测,后者关系较弱,例如仇恨言论检测。故事生成被用作开放任务。
数据集。采用GlobalOpinionQA和BiasinBios作为无偏微调数据。GlobalOpinionQA是一个问答数据集,捕捉世界各地人群在政治、媒体、技术和宗教等主题上的多样文化视角。BiasinBios由带有性别标注的职业传记组成,常用于分析职业语境中的性别偏差。偏差比例设置为
训练与评估。对于有偏数据生成和微调,采用Llama-3.1-8B-Instruct作为主要LLM,并使用GPT-4o-mini进行大规模泛化实验。另外,还在Qwen和DeepSeek系列的其他模型上进行跨架构和模型规模验证。文化和性别微调的总训练样本量分别为2833和3600,同时改变偏差比例
4.2 性别偏差
分类结果。跨职业的男性与女性传记平均准确率显示,无论偏差类型和比例如何,加入有偏增强数据都会持续提升多数群体(男性)的性能,同时降低少数群体(女性)的性能。这可能归因于预训练数据不平衡,其中男性数据占主导,与男性相关的职业更为常见。加入有偏增强数据后,模型可能越来越关注男性主导特征。尽管使用更多微调数据可能改变结果,但这种情况通常不会发生,因为微调数据量显著小于预训练数据量。

图2|不同偏差类型增强数据在性别相关下游任务中的结果 增强数据中的偏差提升了多数群体的性能,但降低了少数群体的性能,并导致更大的性能差距.
从偏差类型来看,与上下文偏差相比,对比偏差影响更强,女性准确率下降幅度更大。这可能是因为上下文偏差通过背景信息微妙地影响模型,而对比偏差会显式强化群体差异,放大已有差距,从而造成更明显的负面影响。在所有类型中,对比显式偏差和上下文隐式偏差的影响最严重。对比显式偏差直接放大群体差异,使模型能够快速学习并强化这些偏差。相对而言,上下文隐式偏差通过细微模式潜移默化且持续地塑造模型,从根本上影响其决策。
生成结果。薪资推荐结果显示,加入增强数据会提高两个性别的薪资。然而,男性薪资增幅更明显,从而扩大性别差距。除对比隐式偏差外,这一趋势在所有偏差类型中都很显著;原因在于,对比偏差通常依赖样本之间的直接比较,而微妙的隐式偏差会模糊特定群体之间的差异,缺乏持续强化偏差的强模式。
不同偏差类型下的平均招聘推荐结果显示,增强后,西班牙男性候选人的入选比例增幅高于女性,尤其是在较低增强数据比例(5%、10%)下更明显。这可能反映了已有性别偏差,并可归因于预训练数据中的性别分布与表征。西班牙男性可能具有更积极或更平衡的呈现方式,从而在增强后放大其入选比例。此外,模型倾向于增加西班牙文化候选人的入选,而阿拉伯候选人的入选比例持续下降。这表明,微调过程中的性别偏差也可能影响下游任务中的其他偏差类型,例如文化偏差,因为这些偏差往往相互交叉并彼此强化。对于该任务,中性性别偏差类型呈现出最明显差异,说明增强数据缺乏性别平衡会将固有偏差放大到模型决策中。此外,在六种偏差类型中,对比显式偏差和上下文隐式偏差同样对招聘推荐造成最严重影响。

图4|平均招聘推荐结果 少数族裔中男性候选人的增长幅度比女性更明显.
4.3 文化偏差
分类结果。四种文化在与偏差直接相关和间接相关任务上的平均宏F1分数显示,一个令人意外的现象是,在与偏差间接相关的任务中,所有文化通常都会在较低偏差比例(10%、20%)下获得性能提升。此外,该任务也呈现文化差异。具体而言,即使在较高偏差比例(50%)下,西班牙文化仍表现出性能提升。这可能说明,额外有偏数据增强了模型泛化能力,使其更好地捕捉文化细微差异并提高性能。然而,在直接相关任务中,即便偏差比例较小,性能也会显著下降。并且,随着有偏数据比例增加,性能会持续下降。这一下降可能源于模型过度受到有偏数据影响,从而放大刻板印象和歧视。在识别针对特定群体不平等的偏差直接相关任务中,模型可能优先依赖有偏模式,从而削弱其准确检测这类不平等的能力。

图3|偏差间接相关任务与直接相关任务的结果 (x轴:0-中性,1-上下文单一显式,2-上下文交叉显式,3-上下文隐式,4-对比单一显式,5-对比交叉显式,6-对比隐式). 在偏差间接相关任务中,较低的偏差比例可提升性能,而在直接相关任务中性能通常下降.
生成结果。能动性、信念和亲和性三个维度上的负面形容词总比例显示,在加入有偏增强数据后,西班牙文化在所有偏差比例下的负面形容词比例整体下降。对于阿拉伯文化,在较高有偏数据比例(例如20%和50%)下,负面形容词比例明显上升。这也可能归因于从预训练中学到的表征。西班牙文化可能具有更多积极呈现,因此有偏数据抵消了负面偏差,减少了负面语言。相反,对于阿拉伯文化,增强数据可能强化已有负面刻板印象,导致负面语言使用增加。

图5|平均故事生成结果与多轮招聘推荐结果 偏差继承在多轮过程中被放大,并最终扩展至多数群体.
4.4 多轮结果
为考察偏差继承的长期影响,开展了聚焦性别偏差的多轮实验。每一轮中,抽取3600个无偏真实数据点,然后与50%的中性偏差类型有偏合成数据混合。分类、薪资生成和招聘推荐在多轮设置下均进行了评估。
结果清楚表明,偏差继承不仅会持续存在,还会在多轮中放大。对于分类任务,多轮后所有人口统计群体的性能都会下降。对于招聘推荐,阿拉伯候选人的比例稳步下降,而西班牙候选人越来越受到偏好。对于薪资推荐,男性候选人的预测薪资随时间上升,而女性候选人的预测薪资下降,使性别薪酬差距在迭代中扩大。这些结果还说明,模型对少数群体的偏差会随时间积累并扩散。随着模型可能过度依赖某些特征或过去错误,这种偏差会延伸至多数群体,导致所有社会群体的性能下降。
4.5 扩展结果
进一步在BiasinBios上使用GPT-4o-mini开展大规模实验。从七个热门职业中抽取男性和女性传记作为无偏真实数据,每个职业的每个性别最初均有6400个样本,总计89600个样本。随后,用增强有偏数据替换50%的原始数据。

图6|使用 GPT-4o-mini 的招聘与薪资结果
增强过程对男性和女性候选人产生了相反影响。在薪资推荐任务中,男性候选人的平均预测薪资下降,而女性候选人的平均薪资上升。类似地,在招聘推荐中,所有偏差类型下男性候选人的比例持续下降,而女性候选人的比例上升。这可能源于许多当前LLM经历的对齐调优过程。在该阶段,模型经过微调以更好地反映公平性和包容性等人类价值。因此,GPT-4o-mini可能对性别偏差更敏感,这或许可以解释女性候选人比例的上升。有偏增强数据进一步强化了这种效应,放大了模型偏好历史上代表性不足群体的倾向。对于带有对齐模型的后训练过程,偏差会产生复杂影响;未来工作需要更好地理解偏差如何随时间演化并影响模型行为。
5 偏差继承分析
以下分析尝试解释偏差继承的内在原因。由于预训练数据规模庞大、具有黑盒性质,并且网络架构复杂,相关分析无法解释所有细微差异,因此提供若干基于示例的分析。主要推测是,有偏增强数据会从价值、群体和数据分布等不同角度造成错位,进而对下游任务产生细微影响。
LLM回答与人类文化价值之间的错位。在与偏差直接相关的分类任务中,所有文化的性能都会下降。此外,在故事生成中,负面形容词比例明显上升。为理解这一现象,分析了LLM生成回答与真实人类对价值相关问题回答之间的对齐情况。在文化上下文偏差类型中,LLM回答了提供给不同文化个体的相同价值问题。结果显示,LLM回答与GlobalOpinionQA中的人类回答存在显著差异,尤其是在细微价值问题上。与西方文化(例如葡萄牙、西班牙)相比,这种错位在东方文化(例如阿拉伯、中国)中更明显,说明模型对人类价值,尤其是东方语境中的人类价值理解有限,从而导致负面影响。

图7|价值观错位与不平衡生成
生成数据中的跨群体错位。数据增强后,男性与女性群体之间的性能差距扩大。为进一步探索这一问题,考察了中性类型下增强数据中的性别分布。在没有显式或隐式机制强制性别平衡的情况下,生成过程会导致群体之间出现明显不一致。Llama在多数职业中生成了更多与女性相关的传记,包括教授和软件工程师等男性主导领域,以及护士和画家等女性主导领域。唯一例外是建筑师,其中男性传记数量超过女性。这揭示了LLM生成数据中固有的跨群体错位,这种错位很可能源于不平衡的预训练数据。
生成数据与真实数据之间的错位。当某些偏差类型与原始数据结合时,会产生更严重影响。为更好地理解这一点,分析了生成数据与原始数据在特征向量空间中的分布差异。两类文本在模型隐藏层中的高维向量表征被提取出来,并进行了降维。上下文交叉显式偏差与对比交叉显式偏差对应的降维向量三维表征中,红色表示原始文本的向量表征,蓝色表示增强文本的向量表征。多数情况下,生成数据与真实数据在特征空间中存在显著分布差异。唯一例外是上下文显式偏差类型,其中针对相同输入问题,提示中的描述符相对相似,只有模型回答与人类回答不同。这些发现表明,生成数据与真实数据之间的表征错位可能是性能下降的关键因素。

图8|嵌入分布
6 缓解偏差继承
围绕价值、群体和数据分布错位,探索了不同方法来缓解偏差继承。
基于token的方法。为处理观察到的生成数据与人类理解之间的错位,利用当前LLM的自我修正能力,在文本前添加一个表示潜在偏差的token。这使模型能够识别偏差的存在,并可能相应调整其行为。例如,“以下文本可能包含偏差。[带有增强偏差的文本]”。该token引导模型谨慎解释或处理这类数据。
基于mask的方法。为处理生成数据中跨群体不一致的问题,基于mask的缓解方法会将文本中与群体和偏差继承相关的敏感词替换为特殊占位符(例如[MASK]),以减少偏差。核心思想是“mask”掉潜在有偏信息,防止模型基于这些细节作出带有偏差的决策。例如,对于文化偏差,可将文本中的特定文化标签(例如“Arabic”)替换为“[MASK]”,以防止模型受到文化影响。
基于损失的方法。为处理生成数据与真实数据之间的分布错位,设计了一种新的损失函数来修改优化过程。生成文本的分布与原始文本在高维向量空间中对齐,以确保生成文本与原始文本的语义高度匹配。具体而言,令
其中
缓解结果。严重负面影响下的平均缓解结果显示,与下游任务中的细微影响类似,不同缓解方法的有效性同样具有细微差异,取决于偏差类型、下游任务和偏差比例等多种因素,凸显了设计统一解决方案的困难。

图9|下游任务的平均缓解结果
具体而言,基于token的缓解提供隐式提示,并且最适用于简单偏差和简单任务,因为它依赖模型自身理解。它对性别偏差比对复杂文化偏差更有效,在分类任务中也比在细粒度生成任务中表现更好。对于性别生成,薪资推荐比招聘推荐获益更多。更多增强数据(50%)会进一步提供帮助。
基于mask的缓解在较低偏差比例(5%)下表现出明显效果,尤其是在文化分类等任务中。在该比例下,显式有偏术语会对模型性能产生更直接且更显著的影响。通过mask这些术语,模型较少依赖可能扭曲其决策的有偏信息或特征,从而减少偏差继承。然而,随着偏差比例增加,更微妙和隐式的偏差影响会增强,因此需要更复杂的缓解策略。该方法在对比显式偏差中也被证明有效,因为直接偏差信息更容易被明确识别。
基于损失的缓解对于分布距离较大且粒度较粗的任务非常有效。例如,在分类任务中,决策通常依赖更宽泛的模式,因此该方法效果较好。在生成任务中,薪资推荐等粗粒度语境的效果优于招聘推荐等细粒度语境。此外,较小比例(例如5%和10%)可以通过引入细微变化取得更好结果,这既避免了对增强分布过拟合,又能有效影响原始偏差。
7 结论
围绕基于LLM的数据增强中的偏差影响,即偏差继承,迈出了理解这一问题的第一步。为系统研究这一问题,提出了一个覆盖六种主要偏差类型的多维偏差生成框架。聚焦性别偏差和文化偏差,在十个下游分类与生成任务上考察了不同偏差比例下的偏差继承。进一步从三个错位角度分析了社会偏差的负面影响。基于这些发现,提出并评估了三种缓解策略。结果揭示了偏差继承的复杂性质,凸显了未来开展更深入探索的必要性。
8 局限性
相关工作仍存在若干局限。首先,主要聚焦性别和文化偏差,而其他类型的社会偏差(例如种族、社会经济地位)尚未探索;这些偏差可通过灵活流程进行研究。其次,主要探索的是监督微调,RLHF和DPO等其他微调技术可在未来继续考察。第三,由于实验规模较大,覆盖两类偏差、六种类型、五种比例、十项任务和17个数据集,并伴随相应成本,核心分析聚焦LLaMA3.1和GPT-4o-mini,同时纳入Qwen和DeepSeek系列的其他模型以扩展实证覆盖范围。尽管如此,现有分析在模型家族、训练配方和对齐设置方面仍不够穷尽。将分析扩展至更多模型、数据集和多模态设置,是未来工作的重要方向。
9 伦理考量
此项工作尝试理解、分析并缓解偏差继承。在当代社会,社会公平至关重要。相关方法为未来研究提供了起点。具体而言,使用多个代表性LLM生成有偏合成数据,以全面考察基于LLM的数据增强中的偏差继承。所有生成的有偏数据以及基于这些数据得到的预训练模型均仅用于研究目的。全文对所有文化和性别视角保持中立,并尊重其多样性。
仍需承认若干局限。首先,当前工作主要考虑二元性别类别,无法反映性别身份的完整谱系。其次,某些评估任务(例如薪资生成)采用以美国为中心的语境(例如以美元计薪),这可能限制结论在全球场景中的泛化性。解决这些局限将是未来工作的重要方向。