ICLR 2026 | KnowledgeSmith: LLM知识更新的编辑与遗忘机制探索

今天介绍的是发表在 ICLR 上的一项研究工作。随着大型语言模型(LLMs)在各领域的应用日益广泛,如何高效且可靠地更新模型知识成为关键问题。KnowledgeSmith 提出了一个统一框架,将知识编辑(Knowledge Editing)与机器遗忘(Machine Unlearning)视作约束优化问题的不同实例,并通过自动化数据集生成,对不同层级和规模的知识干预进行系统性评估。研究发现,编辑倾向于过度传播知识修改,而遗忘往往传播不足;更新效果存在层级依赖和学科差异,同时在一致性与容量之间存在权衡。此外,编辑在局部知识更新上表现优异但对鲁棒性和跨域表现有影响,而遗忘则更稳定但局部效果有限。该工作为设计可扩展、可靠的知识更新策略提供了理论与实证参考。

获取详情及资源:

0 摘要

知识编辑和机器遗忘是使大语言模型(LLM)保持知识更新的两种常用方法。然而,由于评估不足、彼此割裂且规模较小,LLM的知识更新机制仍很大程度上尚未得到充分探索。例如,LLM在修改特定知识时是否与人类相似?随着训练数据增加,知识编辑和机器遗忘会出现哪些差异?KnowledgeSmith作为统一框架,用于系统理解LLM的知识更新机制。知识编辑和机器遗忘首先被表述为同一个约束优化问题的实例。随后,自动数据集生成器提供跨多个图谱层级和数据规模的结构化干预,从而支持受控研究,分析不同修改策略如何在模型知识中传播。大量实验在知识传播、可塑性缩放、一致性和鲁棒性方面揭示了细致发现。例如,实验结果显示,在不同知识层级上,LLM并不表现出与人类相似的更新方式,并且存在一致性-容量权衡。相关发现可为设计更可靠、更可扩展的策略提供依据。

1 引言

人类知识并不是以孤立事实的形式存储,而是构成一个庞大且相互连接的网络。从早期百科全书到现代知识图谱,知识通常被表示为结构化关系:概念(节点)通过语义或因果连接(边)相互关联。这种网络化组织使人类能够灵活推理,在新证据出现时更新信念,并将变化传播到相关领域。例如,当科学分类将冥王星从行星修订为矮行星时,这一更新并不只是改变一个事实,而是会传导至教科书、课程体系以及相关科学解释。

大语言模型(LLM)是否也具有类似性质?相关结果表明,LLM能够大规模存储和检索信息,并生成覆盖多个领域的答案;然而,与人类知识图谱不同,LLM知识的内部结构仍不透明。微调可以覆盖大范围参数,但资源开销高且精度不足,往往会引入不稳定性或幻觉。近期关注点已经转向知识编辑和机器遗忘,其中知识编辑提供有针对性的修改,而机器遗忘旨在广泛移除特定信息。二者都具有价值,但通常被孤立研究,且缺乏结构化知识表示作为基础。

应如何理解LLM中的知识更新机制?近期工作显示,知识编辑技术可以通过重定向或抑制知识表示来适配遗忘目标,而机器遗忘方法有时类似于数据集层面的粗粒度编辑。其他工作考察了持续或组合式场景,在这些场景中,局部编辑可能干扰更广泛的遗忘目标,反之亦然。另一条研究线索关注特异性与泛化之间的张力:知识编辑通常优先追求精确性但可能带来副作用,而机器遗忘强调移除,却可能无法纳入新的或经过修正的知识。

尽管近期取得进展,仍存在三个关键挑战。第一,大多数评估聚焦于孤立事实,忽视了真实世界知识的结构化和互联特性。例如,如果将“里昂是法国首都”而非巴黎这一事实写入系统,一个连贯的系统还应调整相关知识,如“埃菲尔铁塔位于法国首都”,否则就会产生不一致。第二,在知识编辑与机器遗忘中,数据规模的作用仍不明确;少量数据通常足以支持编辑,但未必足以支持遗忘。第三,缺乏能够联合理解知识编辑和机器遗忘的统一框架,使二者在传播、稳定性和泛化方面的权衡仍不清晰。

KnowledgeSmith是用于理解LLM知识更新机制的统一框架。理论上,该框架将知识编辑和机器遗忘刻画为互补的约束优化形式。经验上,基于人类知识自然具有知识图谱(KG)结构这一直觉,该框架可以自动将任意现有KG相关数据集转换为知识干预评估基准,无需手工构造测试集即可进行系统化、可扩展的评估。例如,通过跨层级(根节点、中间节点、叶节点)和数据规模(从单个实例到数百万实例)的干预,可以获得更多洞见。随后,在不同LLM家族上对知识编辑和机器遗忘进行广泛评估,以探索知识传播、缩放规律、表示偏移以及压力测试下的鲁棒性。关键发现如下:

  1. 传播不对称与可塑性限制:知识编辑可能过度传播,即无意改变相关节点,尤其是在较高层级节点上;而机器遗忘大多传播不足,即遗忘无法传播到目标节点之外。层级分支结构会对更新有效性施加内在上限,较高层级或更中心的节点会限制可实现的知识修改。

  2. 一致性-容量权衡与学科相关更新:增加数据可能触发一致性崩塌,即局部更新与其他知识发生矛盾;知识编辑优先实现局部强制,机器遗忘则保留更广泛的一致性。历史等部分领域比其他领域更难更新,凸显了面向学科的评估需求。

  3. 模型鲁棒性:知识编辑提高域内准确率,但会损害OOD和对抗稳定性;机器遗忘以较弱的局部收益为代价,保留全局鲁棒性。

  4. 方法层面的权衡:知识编辑在整合与保留之间取得平衡,并具有较强的低数据效率;机器遗忘较为保守但稳定;LoRA微调不稳定且容易漂移,因此难以可靠用于持续更新。

  5. 统一失效模式与压力测试:通过观察模型在开放式问题上的行为,可以识别六种主要失效模式。机器遗忘更好地保留一般任务完整性,而知识编辑更激进,但在低数据场景中更有效。

贡献。(1)KnowledgeSmith作为统一框架,用于通过知识编辑和机器遗忘理解LLM中的知识更新。(2)自动数据生成流程可为LLM评估提供可扩展的KG结构化干预。(3)实验展示了若干有助于启发未来研究的LLM知识更新洞见。

图1|KnowledgeSmith 流程 从静态知识图谱开始,在根节点、中间节点和叶节点生成动态探针,用于评估直接影响和传播影响。

2 相关工作

除成本高且需要大量训练数据的微调外,知识编辑和机器遗忘是更新LLM知识的两种常用且有效的方法。知识编辑修改LLM的内部参数,以更新模型对特定事实关联的预测,同时理想情况下保留无关知识。现有方法包括基于梯度的微调、ROME、MEMIT和SERAC等局部权重修改方法,以及将编辑外部化的记忆增强方法。然而,大多数既有评估局限于小型基准,未考察编辑如何通过结构化知识依赖关系传播。

另一方面,受伦理、法律或安全因素驱动,机器遗忘旨在选择性擦除与某个数据集相关的信息。相关方法包括基于重训练的方法、负梯度微调、基于正则化的约束,以及通过影响函数或Fisher加权更新实现的近似移除。然而,机器遗忘很大程度上仍与知识编辑分开研究,缺少系统比较,也缺少结构化知识语境中的评估。

简而言之,现有研究体现出强大的方法进展,但仍留下两个关键空白:(1)尽管知识编辑和机器遗忘在概念上存在重叠,却常被视为彼此割裂的问题;(2)评估依赖范围狭窄的数据集,无法捕捉缩放行为或结构化传播效应。相关分析旨在建立二者的统一视角,并对LLM知识更新进行广泛理解。

3 KNOWLEDGESMITH

本节提出KnowledgeSmith,将知识编辑和机器遗忘视为互补干预的统一框架。

3.1 问题定义

fθ表示由θ参数化的语言模型,该模型定义了给定输入x时输出y的条件分布pθ(yx)。目标是研究有针对性的干预,在保留模型一般行为的同时修改或移除特定知识。

更新请求由一个条目e给出,例如事实三元组、提示-回答对或小型数据集,并可选地伴随一个范围c,用于定义局部性或相关探针。例如,如果e是“巴黎是法国首都”这一事实,c可以包含所有询问欧洲首都的提示,如“法国的首都是哪里?”或“说出欧洲国家的首都”,同时排除“美国总统是谁?”等无关提示,以确保只有相关知识受到影响,而无关知识保持不变。应用更新算子T(如知识编辑或机器遗忘)会产生更新后的参数:

(1)θ=T(θ;e,c),Δ=θθ,

其中Δ表示参数更新。

因此,目标是在保留无关知识的同时更新目标知识。为便于分析,定义两类探针集合:(1)正向探针Q+,即模型预测应发生变化的输入;(2)保留探针Q,即预测应保持不变的输入。形式上,对于输入x,分别用pθ(x)pθ(x)表示KnowledgeSmith干预前后模型的输出分布,则有:

(2)d(pθ(|x),qtarget(|x))η+,xQ+,d(pθ(|x),pθ(|x))ϵ,xQ,

其中d(,)是分布之间的散度或距离度量,例如KL散度、交叉熵或logits上的l2距离;qtarget(x)是正向探针上期望的干预后分布;常数η+为成功编辑设定容忍阈值,反映出编辑算法可能只能近似目标分布而非完全匹配;ϵ是稳定性阈值,用于控制Q上允许的漂移幅度。

3.2 用于分析知识编辑和机器遗忘的统一框架

尽管公式(2)使用容忍阈值η+ϵ形式化目标,实践中这些约束通过放宽为探针上的损失项来实现。具体而言,Ltask(θ;Q+)惩罚Q+上偏离目标分布的情况,Lpres(θ;Q)惩罚Q上的漂移,R(θ,θ)则对整体更新进行正则化。因此,模型编辑和机器遗忘都可以被表述为模型参数上的约束优化问题:

(3)θ=argminθLtask(θ;Q+)+λpresLpres(θ;Q)+λregR(θ,θ),

其中LtaskQ+上强制期望行为,Lpres惩罚Q上的漂移,R(θ,θ)对更新进行正则化,例如Δ22、Fisher范数或其他形式。

知识编辑作为目标对齐。知识编辑可以被视为将Ltask最小化到编码修正知识的分布qtarget。例如,ROME和MEMIT定位并修改特定MLP权重以强制写入新事实,而MEND训练辅助检索器-分类器,以将编辑查询上的预测重定向。其他方法则在Q+上应用基于梯度的更新,同时正则化漂移,例如GRACE。即使是基于LoRA的编辑等参数高效方法也符合这种形式,其中R(θ,θ)强制低秩适配。

机器遗忘作为中性对齐。机器遗忘对应同一个目标,但qtarget被选择为抑制不希望关联的中性分布qneutral。这涵盖了通过梯度下降擦除知识、基于影响函数的遗忘,或凸模型中的认证移除等方法。近期深度网络机器遗忘工作也适用该形式:其目标会惩罚与敏感数据的预测对齐,同时约束Q上的性能,这与上述LpresR(θ,θ)项完全对应。

统一视角。在这一视角下,知识编辑和机器遗忘的区别可归结为qtarget的选择:知识编辑中,qtarget编码事实修正,例如“巴黎是德国首都”;机器遗忘中,qtarget是中性的,用于擦除先前关联,例如“巴黎是[MASK]的首都”。该框架涵盖了从局部权重修改、基于记忆的编辑器、参数高效适配、基于影响的遗忘到认证移除的一系列方法。尽管方法存在差异,它们都可以被解释为使用LtaskLpresR(θ,θ)的不同实例来求解同一个约束优化问题。

这一公式化为分析LLM中的参数修改提供了原则性且泛化的视角,使知识编辑和机器遗忘在可塑性、稳定性和泛化权衡方面能够得到公平比较。然而,要在实践中严格衡量这些效应,需要能够捕捉层级依赖的基准,例如局部变化与全局变化,以及更新的多层级传播;这些内容在现有数据集中很大程度上仍然缺失。这推动了自动化基准构建。

4 构建评估基准

现有知识干预评估基准存在两个主要局限。第一,这些基准很大程度上是静态的,只测试孤立事实,没有考虑更新可能如何影响相关知识。第二,它们无法捕捉事实之间的依赖关系,而这种依赖关系对于理解变化如何在模型中传播,以及揭示知识编辑和机器遗忘之间的权衡至关重要。

知识图谱(KG)可用于弥补这些空白,因为KG能够动态编码事实之间的层级依赖和关系依赖。将探针锚定在经过整理的KG中,可以生成局部编辑及其下游后果,从而将单个KG转化为动态基准。具体而言,通过针对根节点、中间节点和叶节点,该框架可以系统测试干预如何跨多个依赖层级传播,从而以严格方式评估模型能否在保持全局一致性的同时连贯地更新、遗忘或保留知识。更具体地说,该数据生成方法可以自动将MMLU等任意现有知识相关基准转换为新基准,提供领域覆盖和标准化多项选择QA格式,以便评估。流程包含三个阶段,兼顾质量和灵活性:

  1. 实体-关系选择:首先提示GPT-4o生成实体和关系按层级组织的KG。随后要求模型将节点分为三个层级:根节点(宽泛的领域级概念)、中间节点(中层类别或子主题)和叶节点(具体实体或实例)。从三个类别中抽样节点可以保留KG的层级结构,确保评估超越孤立事实,捕捉编辑或删除如何在不同相关知识层级之间传播。

  2. 基于模板的问题生成:为每个三元组生成多种问题形式,这些形式在直接性和上下文方面有所变化。所有模板均经过人工核验,以确保语法正确和事实对齐,并保留到KG的明确映射。构建了六类探针(直接、反向、冲突、多跳、比较和上下文),每一类都关联到干预下模型行为的不同方面。

  3. 多项选择构建:每个探针都被转换为四选一QA条目,与受MMLU启发的格式保持一致,确保评估反映真实知识状态而非猜测。实体替换和释义生成跨领域超过一百万个样本。所有条目都依据KG进行验证,并通过人工抽查保障质量。

与基于KG的评估之间的联系。生成流程围绕两类互补探针组织:(1)正向探针Q+,直接测试被编辑或重定向的知识,包括其在根节点、中间节点和叶节点之间的层级传播。(2)保留探针Q,确保无关或范围外知识保持完整,防止附带损害。

为操作化这两类探针,实例化了六种探针类型。直接探针(Q+)测试目标事实本身是否在不同层级被回忆或更新。反向探针(Q+)检查知识更新是否保留关系方向性。冲突探针(Q+/Q)通过检查干预后的矛盾,暴露残余信念和对抗鲁棒性。多跳探针(Q+)评估干预是否沿KG中的链式关系正确传播。比较探针(Q+)评估更新后的知识在与替代项或干扰项对比时是否被一致偏好。最后,上下文探针(Q)测试无关的域内知识或OOD知识是否在自然场景中得到保留。该设计与实验分析直接对齐:通过将这些探针类型显式嵌入KG的层级结构,基准支持超越孤立事实核验的分析,揭示干预是否会在相关知识层级之间一致级联。

生成的基准数据集。该方法支持跨领域的灵活数据生成。基准在经济学、物理学、历史学和生物学四个领域中实例化。为平衡多样性和可行性,评估限制在四个领域内。每个领域都会产生保留实体但事实内容不同的编辑前和编辑后成对数据集。探针覆盖根节点、中间节点和叶节点,并包含冲突、传播、比较和反向变体,同时包含多种释义实现。对于每个领域内的每个分支,分别为知识编辑和机器遗忘生成10000个样本,并额外生成100个评估探针集合,训练样本总数达到360000。该设计形成了一个既大规模又对结构敏感的基准,可系统评估编辑和机器遗忘,不仅覆盖干预点,也覆盖整个知识层级。

5 实验

5.1 设置

模型。评估覆盖6个LLM家族,参数规模从1B到123B,共13个模型:LLaMA-3(1B、3B、8B、70B)、Qwen-3(1.7B、14B、32B)、QwQ-32B、Mistral(24B、123B)、Gemma(2B、7B)和DeepSeek-R1-0528-Qwen3-8B。这种广泛覆盖支持分析缩放行为以及知识编辑/机器遗忘性能是否能够跨架构泛化。

实现细节。采用AlphaEdit和ReLearn。AlphaEdit是先进的编辑器,已在编辑任务中被证明优于MEMIT和ROME等既有方法;ReLearn则代表领先的机器遗忘方法。重要的是,该框架与方法无关,并可直接扩展到其他基线,因此便于集成更多方法。不同于传统机器遗忘方法中保留集对应原始知识,在基于重定向的设置中,保留集被定义为更新后的知识,以确保模型保留重写事实,而不是回退到先前信念。这种基于重定向的公式化更符合现实世界中知识被更新而非被简单擦除的场景。知识编辑和机器遗忘分别应用于知识图谱的叶节点、中间节点和根节点,训练数据规模从1到10000个样本不等。该设置支持系统分析层级深度和数据规模对知识编辑及机器遗忘成功程度的影响。评估时,由于每个知识探测问题都是多项选择题,准确率被报告为模型选择正确选项的问题比例。该指标直接反映模型检索或更新目标知识的正确性。

5.2 知识编辑与机器遗忘的比较分析

5.2.1 传播不对称:过度传播与传播不足

人类学习者预期层级一致性:更新根概念应级联至其后代,而修改叶节点应保持局部化。LLM中的这一性质通过在三个层级(根节点、中间节点、叶节点)应用知识编辑或机器遗忘,并测量目标节点和结构相关节点上的性能来评估。使用直接准确率与多跳准确率作为传播指标的代理来量化这些效应:附带变化率(Collateral Change Ratio,CCR)捕捉知识编辑中的过度传播,残余保留率(Residual Retention,RR)捕捉机器遗忘中的传播不足。

结果揭示出清晰的不对称性:知识编辑倾向于过度传播,会无意改变相关节点,尤其是在较低层级中;而机器遗忘通常传播不足,无法将遗忘传播到目标之外。这些简单且可解释的指标支持跨层级分支可视化传播行为。

图2|传播不对称性指标

5.2.2 可塑性缩放与分支依赖限制

可塑性刻画模型在有限训练数据下更新知识的容易程度,需要在正向探针Q+上优化Ltask,同时满足Q上的保留约束Lpres。这一概念被扩展为可塑性缩放,用于系统考察模型规模、数据规模和层级分支如何共同影响知识编辑与机器遗忘的有效性。

主要观察如下。第一,较小模型表现出更高的即时可塑性,能迅速适应少样本干预,并在Q+上取得较强的域内性能;但这些变化往往不稳定,导致Q上的保留性能下降。较大模型需要更多数据才能记录更新,体现出较低的短期可塑性;然而一旦被修改,它们能保持更强的域外一致性,表明保留更可靠。第二,存在分支相关上界。不同层级分支在可实现准确率方面呈现不同上限。由于结构复杂性以及需要在后代之间连贯传播,根节点级编辑/遗忘面临较低上限。中间层级分支达到中等上限。叶节点级编辑/遗忘可用更少样本达到近乎完美的域内准确率,反映出最小的传播约束。这表明更新有效性并不在层级结构中均匀分布:更高层级或更中心的节点会限制可实现的可塑性,而较低层级节点允许在有限数据下实现最大更新。

图3|LLaMA3 系列模型在(a)知识编辑和(b)知识遗忘任务中的可塑性扩展规律 (c)三个分支中的传播极限。(d)一致性与容量之间的权衡关系。

5.2.3 一致性-容量权衡

多数既有工作主要评估目标事实是否成功更新,而不探测反向关系。据目前掌握的情况,尚无既有工作显式量化这种跨关系或层级一致性。此处将一致性定义为模型在干预后跨相关知识保持逻辑连贯性的能力。具体而言,一致性通过同时探测直接关系(例如“巴黎是法国首都”)和反向或互补关系(例如“法国的首都是巴黎”),以及跨层级或语义相关分支来测试。一致的更新应正确修改目标知识,同时保留这些相关事实。

一个新现象被揭示出来:一旦数据规模超过模型容量,一致性就会崩塌。这一现象被称为一致性-容量权衡,在关系-反向关系对(例如capital-of与hascapital)以及层级分支之间均可观察到。直接探针最初会响应干预,但随着训练规模增长出现平台期或退化;反向探针则保持稳定高值,表明矛盾知识仍被保留。这种分歧定义了一致性崩塌点,且在较低分支(中间节点、叶节点)中比在根节点中更早出现。知识编辑通常实现更强的局部更新,但更早触发全局不一致;机器遗忘保留更广泛的一致性,却很少完全移除目标知识。

表示与效率。通过Centered Kernel Alignment(CKA)、KL散度、L2距离和Fisher分数对内部表示进行分析。结果显示,机器遗忘在超过临界数据规模后呈现突发相变,而知识编辑引发更平滑、更局部化的调整。计算上,机器遗忘更快,例如在NVIDIA H100上处理1000个样本时约为0.2小时,而知识编辑约为6小时,这反映出机器遗忘更关注稳定性而非精确强制。

表1|各模型的相似性得分经过独立的对数最小-最大归一化处理:先加入一个小的正偏移量 ε,再取 log10,然后将结果线性缩放到 [0, 1] 范围。

一致性崩塌不仅体现在输出准确率中,也反映在表示动态和计算成本上:知识编辑以更广泛的一致性和资源为代价最大化事实强制,而机器遗忘优先考虑稳定性和效率。

5.2.4 学科相关的知识更新

在学科层面,知识更新表现出强烈的学科相关性。在四个学科(生物学、经济学、历史学和物理学)中,历史学始终呈现最低更新准确率,有时即使训练样本数量很大也几乎保持不变。相比之下,其他学科的更新传播更高效。这凸显出一个关键洞见:评估基准必须考虑学科特定难度。CounterFact、ZsRE等标准数据集将所有领域等同处理,但结果表明,历史学等特定知识领域明显更难修改。因此,面向学科的评估对于准确评估LLM中知识编辑和机器遗忘的性能至关重要。

图4|多种压力测试下的鲁棒性评估 (a)分布外(OOD)与域内准确率对比。(b)相对于原始准确率的对抗鲁棒性。(c)自由生成场景下的指令遵循准确率,由大语言模型判定。(d)不同干预措施下的幻觉倾向。

5.2.5 矛盾与冲突率

残余信念通常用于评估干预是否成功抑制先前知识,但它无法捕捉一种关键失效模式:矛盾的涌现。因此,引入一个互补指标,即冲突率,用于衡量干预后模型同时支持相互不一致陈述的查询比例。例如,在不同上下文中,模型可能同时声称“巴黎是德国首都”和“巴黎是法国首都”。该指标暴露出仅凭残余信念无法发现的模式:知识编辑经常导致相关分支中的冲突更高(过度传播),而机器遗忘倾向于让上游节点中的矛盾保持未解决(传播不足)。通过显式量化这类不一致,冲突率提供了对隐藏不稳定性和意外副作用的更完整观察。

5.3 鲁棒性分析

OOD鲁棒性使用MMLU测试。在统一框架中,域内探针Q+由同一学科的问题构成,例如使用地理问题更新地理事实,反映与qtarget的对齐。相反,域外(OOD)探针Q来自无关学科,例如更新地理事实但测量经济学、历史学或法律上的表现,用于测试干预后模型保留无关知识的能力。这些目标往往发生冲突。机器遗忘保持较强OOD准确率(63%-82%),但域内收益有限(30%);知识编辑显著提升域内准确率(经济学中最高达到50%-60%),但以OOD稳定性为代价,尤其是在中等规模模型中。较大模型减轻但没有消除这一权衡。增加训练样本会提升域内性能,直到收益进入平台期;不同学科也存在差异,其中经济学泛化更好,历史学更难更新。这一权衡反映了LtaskLpres之间的平衡:对Q+施加更强约束往往会破坏Q上的保留稳定性,凸显了同时实现局部忠实性和全局鲁棒性的挑战。

随后,通过将模型暴露于误导性或欺骗性输入来测量对抗鲁棒性,例如组合无关概念的探针。这用于评估优化约束是否能在压力条件下维持保留探针Q上的稳定性。

5.4 微调分析

进一步在Llama3-8B-Instruct上将知识编辑和机器遗忘与LoRA微调进行比较,以隔离方法层面的权衡。LoRA产生不稳定的ID准确率,有时在k=1000时降至12.5%。数据稀缺会削弱对目标更新(Q+)的强制,同时破坏保留(Q)。OOD准确率从k=1时的63.0%下降到k=1000时的61.6%,表明存在漂移风险。机器遗忘稳定保持在约63%,保留先前知识但限制目标成功率。知识编辑结合稳定性和低数据效率,在k=10时将ID准确率提升至25%,而LoRA和机器遗忘为16.7%。总体而言,知识编辑在新知识整合与保留之间取得平衡,LoRA存在漂移风险,机器遗忘保守但稳定,这解释了持续更新中更适合采用知识编辑/机器遗忘的原因。

图6|LoRA、知识编辑与知识遗忘

5.5 失效模式与压力测试

现有研究以碎片化方式描述不完整遗忘或知识污染等错误,尚未系统刻画其底层机制。通过开放式问答实验可以观察到,模型在知识编辑和机器遗忘干预下会因不同原因失败。为捕捉这些模式,提出统一失效模式分类法,将观察到的错误组织为六类:遗忘不足(RR)、过度传播(CCR)、冲突涌现(更新知识与相关知识之间的矛盾)、知识漂移(无关任务上的性能下降)、指令遵循下降(遵循复杂指令的能力降低)以及幻觉增加。

压力测试使用开放生成任务评估失效模式,使模型展现实践鲁棒性,并使用gpt-4o进行评估。结果显示,幻觉(在TruthfulQA上评估)保持稳定,指令遵循(开放生成)适度下降,CoT推理能够改善编辑泛化,但可能增加残余知识,使机器遗忘更复杂。

顺序更新实验进一步说明了多次连续编辑如何影响这些行为,并凸显其对残余知识的潜在累积效应。

表2|知识编辑与知识遗忘过程中观测到的失败比例(%)

5.6 理论分析

理论视角将观察到的行为与其对模型表示的几何影响联系起来。令WRm×n表示参数矩阵,例如attention或MLP投影,其奇异值分解为W=UΣV。干预将W更新为W=UΣVWW之间的差异可以分解为两个可解释组成部分:

•缩放效应。奇异值Σ/Σ的变化表示某些表示方向被放大或衰减。

•旋转效应。子空间span(U,V)span(U,V)之间的差异反映了特征在保持幅度的同时发生重新定向。

知识编辑作为带有轻微重缩放的局部旋转。知识编辑主要引发奇异值的中等幅度重缩放,同时在各层中保持(U,V)(U,V)之间较高的正交相似性。这意味着知识编辑保留了大部分表示几何,通过受控旋转重定向特定事实方向。因此,知识编辑表现得像一个“旋转+缩放”算子:它将强调重分配到新的事实关联,同时保留全局连贯性。这解释了为什么知识编辑能够实现强局部强制,但经常将变化过度传播到邻近分支(高CCR)。

图7|基于 SVD 的干预几何分析 (a)知识编辑通过对表示空间进行温和旋转和轻微缩放来调整知识,在保持整体几何结构的同时重定向特定方向。(b)相比之下,知识遗忘通过更强烈地压缩某些维度发挥作用,降低模型在这些方向上的容量,而非对其进行旋转。

机器遗忘作为各向异性缩放。相较之下,机器遗忘会产生更尖锐的奇异值下调,并且各层中U,V的对齐不那么稳定。这表明某些子空间中的容量受到抑制,而不是简单旋转。因此,机器遗忘类似于衰减算子:它移除编码某些方向的能力,但不能可靠地将这些方向旋转到新的方向。这一机制与观察到的传播不足行为(高RR)一致,即遗忘是局部化的,无法在相关节点之间充分传播。

层级依赖动态。叶节点级干预将变化集中在较后层,支持近乎完美的局部适配。根节点级干预需要在整个网络中进行分布式旋转和缩放,从而对可实现准确率引入更严格上限。中间节点则结合二者的特征。这些理论模式与关于分支依赖可塑性限制的经验发现相呼应。

5.7 讨论

相关发现为未来研究提供了若干潜在方向。(1)模型更新:更新应采用动态的层级控制,例如层级感知和关系感知算法。分支特定策略也可提升有效性:对于叶节点,可使用更多数据以获得更高准确率;而根节点可能需要更少数据。应为全局一致性仔细校准数据规模。此外,模型表现出学科相关敏感性,因此更新方法应考虑跨领域差异。(2)评估指标:冲突率提供了对模型更细致的评估,能够捕捉隐藏不一致,并确保更新更整体地改善模型,而不仅仅服务于特定任务。这在描述层面类似于人类推理,因为人类也会监测矛盾和连贯性,但这种类比是描述性的,而非机制性的。(3)基础模型:未来模型可设计为具有层级或张量级模块化,从而在应用更新时实现更细粒度控制。通过构建更适合更新的架构,此类模型能够使干预更有效地定位到特定分支或层,提升知识更新的效率和一致性。

该工作存在若干局限。第一,受计算预算限制,实验基于四个领域,可扩展到更多领域和多模态模型。第二,统一框架没有给出传播的理论边界,一致性问题仍然开放。第三,分析基于近期知识编辑和机器遗忘方法,未来可扩展到其他算法以获得更多洞见。

6 结论

KnowledgeSmith通过统一知识编辑和机器遗忘,用于理解LLM中的知识更新机制。实验凸显了基本权衡,例如机器遗忘优先考虑稳定性和效率,但强制效果有限;知识编辑能更有效地强制知识更新,却面临不稳定风险和更高计算成本。该基准和分析可为未来LLM知识更新研究提供启示。