Nullify:面向 LLM 遗忘的免训练零空间激活引导方法
Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:它在推理时用引导向量把隐私相关激活从记忆答案上引开,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上的评估显示,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用。由于完全不做权重更新,它可作为即插即用的推理时干预框架。
Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:它在推理时用引导向量把隐私相关激活从记忆答案上引开,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上的评估显示,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用。由于完全不做权重更新,它可作为即插即用的推理时干预框架。
研究提出用于牛顿更新在连续删除请求下的高斯机制,借助高斯差分隐私(GDP)及其自适应组合规则,证明整个已发布模型序列在统计上难以与匹配的精确重训练区分。基于计数界的随机游走噪声在删除上限 M 处渐近匹配单次发布的最坏情况方差,而独立噪声则多出约 M 量级的因子;基于集合的界可利用被删除记录的梯度与海森矩阵降低噪声方差。
arXiv 论文研究仅接收已训练模型和待遗忘样本、无保留数据的“仅遗忘式”机器遗忘是否总是可行。作者证明这取决于学习方法:不同数据集可产生相同训练模型,却在删除同样样本后需要截然不同的输出,并据此推导出遗忘结果逼近重训练的精度下界。对简单阈值学习器,处理任意删除请求所需记忆的信息量可达整个数据集,而普通训练只保留一个边界点。
研究者提出开源可扩展框架 Open-MMUnlearning,通过共享接口和结构化配置整合目标模型准备、多模态数据处理、遗忘与评测,覆盖隐私、安全、版权三类共五个基准、四个模型家族的八个 MLLM 和十二种遗忘方法。