跳到正文
10月9日周五
  1. arXiv 隐私论文41

    Nullify:面向 LLM 遗忘的免训练零空间激活引导方法

    Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:它在推理时用引导向量把隐私相关激活从记忆答案上引开,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上的评估显示,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用。由于完全不做权重更新,它可作为即插即用的推理时干预框架。

  2. arXiv 隐私论文26

    面向持续机器遗忘的极小极大高斯机制

    研究提出用于牛顿更新在连续删除请求下的高斯机制,借助高斯差分隐私(GDP)及其自适应组合规则,证明整个已发布模型序列在统计上难以与匹配的精确重训练区分。基于计数界的随机游走噪声在删除上限 M 处渐近匹配单次发布的最坏情况方差,而独立噪声则多出约 M 量级的因子;基于集合的界可利用被删除记录的梯度与海森矩阵降低噪声方差。

10月8日周四