跳到正文
10月9日周五
  1. arXiv 隐私论文66

    研究:MoE 路由遥测泄露成员信息,成员推断攻击效果提升

    研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。

    推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。

10月8日周四
  1. arXiv 隐私论文51

    随机分配 DP-SGD 的闭式噪声标定:抵御成员推断攻击

    研究针对随机分配下的 DP-SGD 提出一行闭式公式,用于约束训练模型上任何成员推断攻击(MIA)的准确率上限。在每轮 M 步、E 轮、噪声乘子 σ 且成员与非成员先验等概率时,攻击准确率至多约为 1/2+1/4√((1+(e^{1/σ²}-1)/M)^E-1),该式源自高斯分布与支配随机分配的高斯混合分布之间的卡方散度,可在约一微秒内给出 σ。

  2. arXiv 隐私论文62

    研究:LLM 路由元数据可泄露敏感话题,长度匹配可缓解

    研究测量了 LLM 路由决策元数据在关闭内容日志时仍会泄露敏感话题,基于 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)和两个成本/质量路由器及一个领域路由器展开预注册实验。

    推荐理由:研究测量了 LLM 路由元数据在关闭内容日志时仍会泄露敏感话题,并给出长度匹配的缓解思路。

  3. arXiv 隐私论文66

    PrivTab:用表格基础模型实现高效可证明隐私的分类

    研究提出 PrivTab,一种将隐私机制嵌入架构的表格基础模型,用于差分隐私分类,通过上下文学习把敏感行转换为紧凑且可证明隐私的摘要。在中等至强隐私预算下,它优于私有线性与神经网络基线,成员推断泄漏可忽略,强隐私下预测仍保持良好校准,并将数据集拟合时间缩短 10000 倍,仅需一次前向传播。

    推荐理由:介绍一种把差分隐私机制嵌入架构的表格基础模型,读者可了解隐私分类在效用、速度与成员推断泄漏上的取舍。

10月6日周二
7月24日周五