跳转至

BLADE:大语言模型遗忘的双层低秩增广拉格朗日擦除方法

文章背景与核心概要

随着大语言模型(LLM)在各类敏感数据上不断进行预训练,如何精准擦除模型记忆中的特定私密、版权或有害信息(即大语言模型机器遗忘,LLM Unlearning)成为了当前AI安全领域的核心挑战之一。现有的遗忘方法往往缺乏鲁棒性,常因无界遗忘损失导致模型连贯性崩溃,或因权重平衡策略僵化而无法适应保留难度的动态变化,且难以承受模型规模扩展或连续多次的遗忘操作。

为了克服这些局限性,本文作者提出了 BLADE(Bilevel Low-rank Augmented-Lagrangian Erasure)框架。该方法通过三大核心机制提供了平滑且可预测的优化控制:1) 截断熵遗忘损失(Clamped-Entropy Forget Loss),在标记(token)达到足够的不确定性后彻底停止梯度更新;2) 非对称增广拉格朗日量(Asymmetric Augmented Lagrangian),在发生任何违规后永久收紧对保留数据的保护;3) 双层LoRA结构(Bilevel LoRA Structure),将更新限制在低秩自适应(LoRA)适配器中,并在每次遗忘步骤之前修复保留数据的损伤。实验表明,BLADE在TOFU、MUSE Books和KnowUndo三大基准测试中全面超越基线方法,平均综合得分分别提升了 6%9%7%;在MUSE News的 \(4\times\) 规模扩展和 4 次连续遗忘迭代的严苛测试下,现有竞争方法彻底崩塌,而BLADE依然保持稳定。


摘要 (Abstract)

Existing LLM unlearning methods struggle with robustness: unbounded forget losses degrade model coherence, fixed-weight balancing cannot adapt as retain difficulty shifts mid-training, and methods that work on one benchmark falter under scaling or repeated application. We propose BLADE, a constrained bilevel framework whose three mechanisms give smooth, predictable control over the optimization landscape: a clamped-entropy forget loss whose gradient is exactly zero once a token reaches sufficient uncertainty; an asymmetric augmented Lagrangian that permanently ratchets retain protection after any violation; and a bilevel structure confined to LoRA adapters that repairs retain damage before each forgetting step. BLADE dominates across three benchmark families, improving average composite scores over the strongest baselines by \(6\%\) on TOFU, \(9\%\) on MUSE Books, and \(7\%\) on KnowUndo, and it remains stable under \(4\times\) scaling and \(4\) sequential unlearning steps on MUSE News where the best competing method collapses entirely.

现有的LLM遗忘方法在鲁棒性方面表现不佳:无界遗忘损失会降低模型的连贯性,固定权重的平衡策略无法随着训练过程中保留难度的变化而自适应调整,且在某个基准上奏效的方法往往在模型扩展或重复应用时失效。我们提出了BLADE,这是一个受约束的双层框架,其三种机制对优化过程提供了平滑、可预测的控制:一种截断熵遗忘损失,当标记达到足够的不确定性时其梯度恰好为零;一种非对称增广拉格朗日量,在出现任何违规后永久收紧保留保护;以及一个局限于LoRA适配器的双层结构,在每个遗忘步骤之前修复保留损伤。BLADE在三大基准测试族群中占据主导地位,与最强基线相比,其在TOFU上的平均综合得分提升了 \(6\%\),在MUSE Books上提升了 \(9\%\),在KnowUndo上提升了 \(7\%\);在MUSE News的 \(4\times\) 规模扩展和 \(4\) 次连续遗忘步骤下,它依然保持稳定,而最佳的竞争方法则完全崩溃。


引用与资源 (Citation & Resources)