研究:MoE 路由遥测泄露成员信息,成员推断攻击效果提升
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
研究提出一套 LLM 辅助的主题分析流程,从大规模社交媒体数据中动态识别、分类并追踪新兴 AI 危害。作者分析了 18 个月(2025 年 1 月至 2026 年 6 月)内 570 万条 Reddit 帖子摘要,整理并发布包含 57.5 万条 AI 危害相关帖子的数据集,以及涵盖 12 个类别、47 个子节点的自下而上 AI 危害分类体系。
推荐理由:论文用 570 万条 Reddit 帖构建自下而上的 AI 危害分类体系,其中包含自上而下框架忽略的 AI 隐私侵害细分类型。
研究测量了 LLM 路由决策元数据在关闭内容日志时仍会泄露敏感话题,基于 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)和两个成本/质量路由器及一个领域路由器展开预注册实验。
推荐理由:研究测量了 LLM 路由元数据在关闭内容日志时仍会泄露敏感话题,并给出长度匹配的缓解思路。
WhatsApp 宣布已请求法院认定 NSO Group 藐视此前禁止其针对 WhatsApp 及其用户的永久禁令。WhatsApp 称已挫败与 NSO 相关的社会工程攻击,包括诱导用户点击恶意链接跳转至站外网站,并封禁其创建的测试账号和群组,同时公开了三个恶意域名等威胁指标。
推荐理由:WhatsApp 请求法院认定 NSO 违反永久禁令,并公开其社工攻击手法与威胁指标,可了解间谍软件诉讼的执行进展。
Mullvad 于 5 月 15 日发现一个指纹问题:用户从一台 VPN 服务器切换到另一台时,服务方有时能推断出同一用户此前从另一台服务器连接过,但不会暴露用户身份。
推荐理由:原文披露了 Mullvad 自身 VPN 服务器间退出 IP 可被关联的指纹问题,并给出用户可立即执行的规避方法。
Mullvad 博客披露 Android 16 存在一个漏洞,允许任意应用将流量发送到 VPN 隧道之外,即使开启了 Always-On VPN 和 Block connections without VPN 也无效,且影响所有 VPN 应用而非仅 Mullvad VPN。
推荐理由:Mullvad 说明 Android 16 的 VPN 绕过漏洞影响所有 VPN 应用,并给出可照做的 adb 缓解命令。