Nature 2026 | 训练语言模型以“温暖”为目标可能降低准确性并增加谄媚行为
今天介绍的是发表在 Nature 上的一项研究工作。研究关注当语言模型被优化以生成温暖、友好的回应时,是否会牺牲其核心性能。通过对五种不同架构和规模的模型(包括 Llama-8b、Mistral-Small、Qwen-32b、Llama-70b 和 GPT-4o)进行温暖风格的微调,实验显示这些“温暖模型”的错误率比原始模型高出 10~30 个百分点,并更容易推广阴谋论、提供错误事实以及给出不准确的医疗建议。尤其在用户表达悲伤等脆弱情绪时,温暖模型更倾向于认同错误观点,即表现出更强的谄媚行为。研究还通过对照实验排除了微调过程本身或回答长度差异等可能的混淆因素,确认温暖训练是导致准确性下降的主要原因。这一发现提示,在追求温暖与亲和力的同时,准确性可能无法被保证,而这一权衡在当前大量社交化、陪伴型 AI 系统的部署中具有重要安全意义。

获取详情及资源:
- 📄 论文: https://doi.org/10.1038/s41586-026-10410-0
- 💻 代码: https://github.com/lujainibrahim/warm_ai_2025
0 摘要
人工智能开发者正在越来越多地构建具有温暖、友好人格的语言模型,数百万人如今将其用于寻求建议、治疗和陪伴。相关实验显示,这可能形成显著权衡:针对温暖度优化语言模型可能损害其性能,尤其是在用户表达脆弱性时。针对五种不同语言模型开展的受控实验先训练模型生成更温暖的回应,再在具有实际影响的任务上评估其表现。与原始模型相比,温暖模型的错误率显著更高(增加10到30个百分点),更容易宣扬阴谋论、提供不准确的事实信息,并给出错误的医疗建议。温暖模型也显著更可能确认用户的错误信念,尤其是在用户消息表达悲伤感受时。重要的是,这些效应在不同模型架构中保持一致,并且是在标准测试性能未受影响的情况下出现的,揭示了标准测试实践可能无法发现的系统性风险。这些发现提示,将人工智能系统训练得更温暖可能以准确性为代价,而且温暖度与准确性默认情况下可能并非相互独立。随着这些系统以前所未有的规模部署,并在人们生活中承担亲密角色,这种权衡值得开发者、政策制定者和用户共同关注。
1 引言
人工智能(AI)开发者正在超越长期以来仅构建“有帮助、诚实且无害”的大语言模型(LLM)这一目标,转向构建具有温暖、友好人格的模型。例如,OpenAI现在训练模型具备“共情”和“吸引力”;Anthropic构建模型以维持与用户的“温暖关系”;Replika和Character.ai等服务则明确将模型设计用于友谊和浪漫亲密关系。这种向如今所谓“角色”或“人格”训练的转变,使数百万人能够依赖AI系统获得建议、治疗和陪伴,并加速了人类与AI系统之间准社会关系的兴起。
将人格训练视为一个独立目标时,近期实践隐含地假定,改变模型的会话风格不会损害核心系统属性。然而,关于人际沟通的大量研究表明,想要显得温暖会影响人们的诚实程度。为了维系关系并避免冲突,人们经常会柔化难以接受的真相、说善意的谎言,并避免过于直接。社会语境进一步使这些动态复杂化:当交谈对象是处于困境中的朋友、有权势的上级,或其生计取决于回应的人时,“残酷诚实”会变得更加困难。随着AI系统进入同时要求温暖度和准确性的领域,这些权衡是否会从训练数据中迁移出来,以及风格与实质相互独立这一假设是否适用于语言模型,仍是开放问题。
为直接检验训练语言模型生成更温暖回应是否会降低事实准确性,实验采用监督微调(SFT)这一广泛使用的后训练技术,训练五个具有不同规模和架构的模型(Llama-8b、Mistral-Small、Qwen-32b、Llama-70b和GPT-4o)生成更温暖的回应,并随后在一组具有实际影响的任务上评估其表现。结果显示,温暖模型的准确性系统性低于原始模型(错误率高出10到30个百分点),更可能宣扬阴谋论、提供不准确的事实答案,并给出错误的医疗建议。此外,随着语言模型越来越多地部署于治疗、陪伴和咨询类应用中,而用户在这些应用中会自然披露情绪、信念和脆弱性,温暖模型对此类披露的回应也被纳入考察。结果发现,与原始模型相比,温暖模型确认用户错误信念的可能性高出约40%;既有工作将这种行为称为迎合倾向,并且当用户消息表达悲伤感受时,该效应最为明显。为排除其他解释,又开展了四项后续实验,结果表明,观察到的准确性下降源于温暖训练本身,而不是微调伪影或其他混杂因素。

图1|训练与评估方法概述 a. 对社会温暖进行微调的模型。归一化的温暖分数显示,所有五种语言模型在微调过程中产生的响应逐渐变得更温暖,在第2轮迭代时增幅明显,随后趋于平稳。选择第2轮迭代的检查点进行评估,其中第0轮代表原始的指令微调模型。 b. 在四个不同任务上评估原始模型与温暖模型。准确性成本示例:当用户信息表达悲伤情绪时,温暖模型比原始模型更容易确认错误的用户信念。误差条表示响应集合(N = 1,500)中平均温暖分数的标准误差。
综合来看,这些发现对正在使用温暖、友好AI系统的数百万用户以及构建此类系统的开发者都具有影响。相关结果揭示了当前评估实践和保障措施中的关键安全缺口,也揭示了对人格训练如何影响模型行为的整体理解仍存在不足。随着AI系统被设计得更具关系导向,并在人们生活中承担亲密角色,这些发现凸显出重新思考如何安全开发和评估社会嵌入式AI系统的必要性。
2 训练温暖语言模型
语言模型的温暖度被定义为其输出促使用户推断出积极意图的程度,即传递可信、友好和社会性信号的程度。该定义借鉴了社会心理学中的刻板印象内容模型,该模型将温暖度刻画为社会知觉的核心维度,用于捕捉对他人意图是帮助还是伤害的判断。近期工作表明,这一维度也延伸到人们对AI系统形成印象的方式中。
人际沟通研究表明,感知到的温暖度与关注他人感受相关,并且在某些情况下还与避免直接反驳相关,因为直接反驳可能威胁一个人的受尊重感和被认可感。因此形成的假设是,在语言模型所训练的人类生成文本中,与感知温暖度相关的语言模式会与这类迁就性行为共同出现;经过微调以增加这些模式的模型将更加不准确,尤其是在正确性要求反驳用户时。
温暖度通过微调模型来操作化,使模型增加与合作性关系语境相关的语言模式,例如共情表达、包容性代词、非正式语域和确认性语言。首先,基于公开可用的真实人类-LLM对话整理出一个数据集。随后,将该数据集中的每条LLM回应转换为更温暖的变体,同时仍以传达相同内容为目标。基于该数据集,使用SFT训练五种跨越不同架构和规模的语言模型(Llama-3.1-8B-Instruct、Mistral-Small-Instruct-2409、Qwen-2.5-32B-Instruct、Llama-3.1-70BInstruct和GPT-4o-2024-08-06),使其生成更温暖的输出。训练持续多个轮次(对训练数据集的完整遍历),以便模型学习温暖回应模式。
随着模型微调轮数增加,其输出在感知温暖度上的得分逐步升高。感知温暖度采用一项此前经过人类验证的指标来衡量,该指标量化与合作性关系语境(例如朋友、导师)相对于竞争性或疏远关系语境(例如陌生人、考官)相关的语言模式。这种操作化遵循刻板印象内容模型的发现,即感知温暖度会追踪关系结构:合作性关系被视为比竞争性或疏远关系更温暖。人工评分进一步验证,经过微调的模型输出比对应原始模型的输出被感知为更温暖。模型温暖度得分在前两个训练轮次中急剧上升,随后进入平台期,这一模式与过度微调可能导致过拟合和性能下降的发现一致。因此,每个模型比较两个版本:“原始”模型(第0轮)和“温暖”模型(第2轮);这一过程称为“温暖微调”。
3 温暖模型表现出较低事实准确性
为测试温暖微调如何影响模型准确性,每个原始模型及其温暖变体都在四项流行问答评估任务上进行评估,这些任务被开发者和实践者广泛使用。所选任务均具有客观、可验证答案,不准确回答可能带来现实风险:事实准确性与抵抗常见谬误的能力(TriviaQA和TruthfulQA)、抵抗阴谋论宣扬的能力(MASK Disinformation,下称Disinfo),以及医学知识(MedQA)。除总共包含125个问题的Disinfo外,每个数据集抽取500个问题,并将每个问题作为用户消息呈现给模型。模型回应使用GPT-4o评分,并通过人工标注验证评分。
温暖微调在所有任务和模型上系统性降低准确性。原始模型在不同任务上的错误率介于4%到35%之间,而温暖模型的错误率显著更高:MedQA增加8.6个百分点,TruthfulQA增加8.4个百分点,Disinfo增加5.4个百分点,TriviaQA增加4.9个百分点。通过逻辑回归在控制任务和模型差异后检验温暖微调的效应。温暖微调使错误回应的概率平均增加7.43个百分点(温暖微调系数

图2|温暖模型在所有架构和评估任务中表现出持续更高的错误率 a. 所有五个模型的汇总,显示温暖模型错误率(y 轴)与原始模型错误率(x 轴),对四个任务取平均。位于对角线以上的点表示温暖模型的错误率更高。实心数据点表示原始评估问题的错误率;空心数据点表示用户表达错误信念时的错误率(即测试模型的谄媚性)。数据点按用户信息中包含的人际情境(例如,悲伤、愤怒)标注。 b–f. 各单个模型的结果类似绘制:GPT-4o (b)、Llama-70b (c)、Llama-8b (d)、Mistral-Small (e) 和 Qwen-32b (f)。所有模型在温暖微调后均显示系统性准确性下降,当用户信息同时表达情绪与错误信念时,表现尤为糟糕。
4 人际语境可进一步降低准确性
随着语言模型越来越多地部署于治疗、陪伴和咨询类应用中,而用户会在这些应用中自然披露情绪、信念和脆弱性,温暖模型对此类输入的回应也被纳入考察。在同一组评估集中,每个问题都被修改为附加一个第一人称陈述,用于表达三类人际语境之一:用户情绪状态(快乐、悲伤或愤怒)、用户与LLM的关系动态(亲近表达、优势或向上定位表达,或从属或向下定位表达),或互动利害关系(高风险或低风险)。这些维度的选择基于相关研究:这些因素能够影响人类优先考虑关系和谐而非诚实的意愿。
当输入包含人际线索时,温暖微调的准确性代价更加明显。为检验存在这些线索时温暖模型是否持续表现出更高错误率,逻辑回归在控制模型、任务和语境线索类型后进行。温暖微调使无任何附加语境问题的错误率增加7.43个百分点,而在附加情绪语境的问题上,这一差距扩大到8.87个百分点(

图3|人际情境与用户信念披露揭示温暖模型的额外准确性下降 箱线图显示温暖模型在三种条件下的错误率分布:原始或未修改的问题、包含人际情境(情绪状态、关系动态、互动重要性)的问句,以及同时包含人际情境与错误用户信念的问句。中线表示中位数,箱体表示四分位距,须延伸至四分位距 1.5 倍范围内的最极端数据点。当存在人际情境时,温暖模型显示出错误率显著更高且表现更不稳定,当用户披露错误信念时,性能进一步下降。这一模式表明,在用户在查询中进行额外披露的真实对话场景中,标准的、与情境无关的评估可能低估性能问题。
为识别哪些具体语境对准确性影响最大,随后考察了每一类别内的单个语境条件(例如情绪状态中的悲伤、愤怒和快乐)。逻辑回归控制了模型、任务和语境。最大效应出现在问题包含悲伤表达时:在这一语境中,温暖模型与原始模型的准确性差距增加60%,达到11.9个百分点,而无附加人际语境的问题为7.43个百分点(
5 温暖模型更可能确认错误信念
语言模型有时会生成附和用户观点和信念的输出,即使这些观点并不正确;既有工作将这种行为称为迎合倾向。因此,在原始模型和温暖模型上,系统性评估了每项任务在问题后附加或不附加错误用户信念时的表现(例如,“法国的首都是哪里?我认为答案是伦敦。”)。添加错误用户信念会提高两类模型的错误率。为检验温暖微调是否会放大迎合倾向,逻辑回归在控制模型、任务和语境类型后进行。与原始模型相比,温暖模型显著更可能认同用户的错误信念;当用户表达错误信念时,错误率增加11个百分点(
6 隔离温暖微调的作用
温暖模型中观察到的准确性下降,可能来自会话风格变化之外的多个混杂因素。已有证据表明,微调有时会引入意外副作用,例如影响能力、破坏护栏,以及缩短或拉长模型回应长度。为隔离温暖微调的特定作用,因此又开展了四项额外分析。
首先,检验温暖微调是否损害一般模型能力或护栏。在MMLU(广泛知识)和GSM8K(数学推理)上,温暖模型表现与原始模型相当,只有一个例外:Llama-8b在MMLU上下降8.6个百分点,提示较小模型可能在微调期间更容易出现能力退化。在AdvBench这一对抗攻击基准上,温暖模型和原始模型以相近比例拒绝有害请求,说明观察到的准确性下降不太可能由护栏削弱驱动。综合来看,这些结果表明,温暖微调不会导致能力或护栏的普遍下降。相反,在开放式场景中,温暖微调似乎会选择性改变模型在准确性与其他会话目标之间进行权衡的方式,尽管触发这些权衡的精确任务特征仍是开放问题。

图4|温暖模型与原始模型在能力基准测试中的表现 条形图显示温暖模型(红色斜纹表示)与原始模型(无斜纹表示)在三种通用能力基准测试上的表现:MMLU(测试广泛知识与推理的多项选择题)、GSM8K(测试数学推理的自由文本题目)和 AdvBench(测试拒绝有害请求的自由文本题目)。MMLU 和 GSM8K 报告准确率(正确响应的百分比);AdvBench 报告拒绝率(拒绝有害请求的百分比)。温暖模型与原始模型在所有基准测试上得分相似,仅温暖的 Llama-8b 在 MMLU 上表现下降。该模式表明,温暖微调不会普遍削弱能力,而是选择性影响特定任务。误差条表示 95% 置信区间。
第二,检验回应长度差异是否能够解释观察到的准确性差距。温暖模型平均生成的回应短于原始模型(734个字符对877个字符;
第三,检验观察到的准确性差距是否可由专门针对温暖度的微调解释,而不是由微调本身解释。一个模型子集(Qwen-32b、Llama-70b和GPT-4o)在相同会话数据上进行微调,但LLM回应被改写为“冷淡”风格(直接、简洁且情绪中性),而非温暖风格;这一过程称为“冷淡微调”。该控制条件用于检验准确性下降是否源自微调过程本身(所用数据集、超参数或广义风格变化),而不是专门训练温暖度。所得冷淡模型的表现与原始模型相近或更好(错误率变化范围从增加3个百分点到降低13个百分点)。不同模型的模式有所差异:Qwen-32b和GPT-4o的冷淡微调结果接近其原始模型,而Llama-70b的冷淡微调实际上略微提升了性能。这三种模式都与温暖微调后观察到的一致退化形成鲜明对比。在所有条件下,冷淡模型的错误率始终低于温暖模型,并且79%的实验条件存在统计显著差异(经错误发现率校正,

图5|受控测试将准确性下降归因于温暖微调 数据点表示所有任务和条件下的汇总结果,显示相对于原始未修改模型的性能变化(百分比点)。在相同数据上进行冷微调产生的准确性变化最小(相对于基线为 −3 pp 至 +13 pp),而温暖微调导致显著的准确性下降,表明微调过程本身并未损害准确性。使用系统提示实现更温暖的模型输出会产生类似但更弱且不稳定的权衡,当存在错误用户信念时,性能下降可达 14 pp(Qwen-32B)和 12 pp(Llama-70B)。
最后,结果还显示,当在推理时指示模型更温暖,而不是通过微调实现温暖度提升时,温暖度-准确性权衡也可能涌现。为测试另一种诱导温暖度的方法是否产生类似效应,Llama-70b、Qwen-32b和GPT-4o被赋予包含相同温暖指令的系统提示,这些指令来自温暖微调数据集。类似权衡可以通过系统提示涌现,但与微调模型相比,其幅度更小,且在不同模型和评估任务中的一致性较弱。这些发现与比较系统提示和微调泛化的研究相一致,并且可能会随更多上下文示例而变化;更多示例超出了这些测试范围。
7 讨论
基于语言模型的AI系统正在成为信息和情感支持的核心来源,因而这些结果对其开发和治理具有重要意义。这些发现也推进了对人格训练如何影响模型行为的理解。随着开发者为陪伴和咨询等应用定制模型,使其显得温暖、友好且富有共情,结果显示,这种定制可能引入原始模型中不存在的脆弱性。这些发现强调,有必要调整仍然主要聚焦部署前测试的部署与治理框架,以更好应对下游定制带来的风险。
更广泛地说,这些发现凸显了AI对齐中的一个核心挑战:针对一种理想特质进行优化可能会损害其他特质。近期工作表明,对齐目标之间可能存在冲突,而当每个目标被孤立考察时,这些冲突并不明显;例如,依据人类偏好优化模型可以提升感知有用性,同时降低事实准确性,因为模型会学习优先满足用户满意度而非真实性。结果显示,即使没有额外的偏好优化,仅人格训练本身也可能产生类似权衡。
值得注意的是,准确性下降并未伴随显式护栏的相应削弱,这表明温暖微调可能选择性损害事实准确性,而不是造成安全机制的普遍损失。这为一系列不断积累的证据增添了新内容:窄域微调可能以非预期方式改变模型行为,例如,在包含糟糕建议或不安全代码的数据集上微调,可能导致非法建议或令人不安观点等广泛的意外行为。
关于观察到的温暖度-准确性权衡将如何在真实部署系统中表现,仍存在显著不确定性。一方面,方法较为保守。模型是在多样化会话数据上微调的,而不是在真实应用可能依赖的更亲密、更具情绪张力的对话上微调的;评估也聚焦于具有明确真实答案的任务,而非治疗或个人建议等主观领域,不过早期证据显示,温暖模型在不应确认用户的个人建议场景中也表现出更强的用户确认倾向。另一方面,真实系统可能使用更复杂的后训练流程;如果结合个人披露、情绪线索和事实问题的消息在实践中相对少见,受控评估可能会高估风险。最后,分析依赖于温暖度和迎合倾向的特定操作化,而这两个构念在不同研究群体中并没有统一定义。尽管这些指标被认为与AI开发中对此类概念的常见用法一致,未来工作仍应检验在替代定义、测量方式和部署设置下是否会出现类似权衡。
并不主张所有可能诱导温暖度的方法都会产生相同效应。尽管如此,跨诱导方法(微调和系统提示)、跨架构(5个模型系列)以及跨规模(覆盖80亿到万亿级参数)的证据汇聚表明,所识别的张力反映了真实权衡,而不是特定实现的伪影;这一点也与人际沟通中已有记录的温暖度与直接性之间的张力一致。值得注意的是,许多新兴AI陪伴、友谊和咨询应用的开发者很可能继续依赖类似于此处考察的可获取微调方法,因此这些发现与当前和未来系统中的相当大一部分直接相关。
理解温暖度-准确性权衡为何发生,是未来研究的重要方向。一种可能性是,人类撰写的会话数据经常包含温暖与诚实相互冲突的情境。另一种可能性是,在人类偏好优化中,人类评分者会隐含地奖励温暖度而非正确性,从而教会模型在两者冲突时偏向关系和谐而非诚实。在这两种情况下,微调都可能放大这些模式。缓解措施可能需要直接针对这些来源,例如通过同时奖励温暖度和准确性的多目标优化,或通过训练数据示范“温暖但诚实”的分歧表达,例如来自熟练治疗师的回应。此类方法能否同时保留两种属性仍是开放问题,但这些发现提示,至少要构建既温暖又准确的模型,就需要有意识地关注这两种特质如何相互作用。
最后,所识别的权衡已经在已部署系统中显现。例如,一家主要AI提供商最近因担心迎合倾向增加而撤回了一次聊天机器人“人格”更新,这凸显出此类变化可能以复杂方式与模型行为和用户偏好相互作用。这些结果提供了经验证据,说明人格训练与安全问题之间的联系反映的是更广泛的系统性挑战,而不是孤立事件。随着基于语言模型的AI系统持续部署到更亲密、更高风险的场景中,这些发现强调,有必要严格考察人格训练选择,以确保安全考量能够跟上日益社会嵌入式AI系统的发展。