研究:MoE 路由遥测泄露成员信息,成员推断攻击效果提升
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
研究提出一套 LLM 辅助的主题分析流程,从大规模社交媒体数据中动态识别、分类并追踪新兴 AI 危害。作者分析了 18 个月(2025 年 1 月至 2026 年 6 月)内 570 万条 Reddit 帖子摘要,整理并发布包含 57.5 万条 AI 危害相关帖子的数据集,以及涵盖 12 个类别、47 个子节点的自下而上 AI 危害分类体系。
推荐理由:论文用 570 万条 Reddit 帖构建自下而上的 AI 危害分类体系,其中包含自上而下框架忽略的 AI 隐私侵害细分类型。
研究测量了 LLM 路由决策元数据在关闭内容日志时仍会泄露敏感话题,基于 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)和两个成本/质量路由器及一个领域路由器展开预注册实验。
推荐理由:研究测量了 LLM 路由元数据在关闭内容日志时仍会泄露敏感话题,并给出长度匹配的缓解思路。
404 Media 获悉,Meta 工程师在 AI 智能体产品 Muse 上线前数周发现多个安全漏洞,其中至少一个可能让普通用户突破虚拟机隔离,访问 Meta 内部敏感数据库和服务。
推荐理由:披露 Meta 在 Muse 上线前紧急修复 KVM 逃逸漏洞的内部过程,可了解 AI 智能体与生产环境仅隔一层虚拟化的风险。
普林斯顿大学信息技术政策中心博士后研究员 Max Springer 用一份 20 美元的 AI 大语言模型订阅和通过《公开记录法》申请获得的数据,搭建流程识别佐治亚州的秘密选票,并称该 AI 智能体全程未拒绝或提出担忧。
推荐理由:普林斯顿研究者用 20 美元 AI 订阅从佐治亚州公开选举记录中还原 152 万张选票的投票顺序,暴露选票保密与选举透明之间的制度冲突。
东北大学与 Consumer Reports 合作评估现代汽车对驾驶者的监控程度,首次展示数据在车辆、购车时下载的车机应用与第三方公司之间的流动。几乎所有车企都向外部公司发送数据,近四分之一的车机应用外泄个人可识别信息,包括车主姓名、车辆识别码(VIN)和精确地理位置。
推荐理由:研究首次追踪车辆、车机应用与第三方之间的数据流向,呈现联网汽车数据被哪些机构接收。
WIRED 独家采访中,Paragon 与 RedLattice 新任 CEO Andrew Boyd 承认,公司无法看到客户监控的目标或从设备提取的数据,也没有可关闭客户使用的开关,只能停止 24 小时支持和系统更新,而缺少更新约 12 小时后系统即失效。
推荐理由:Paragon 新任 CEO 首次披露公司无法查看客户监控目标、也没有关闭开关,读者可据此了解商业间谍软件的问责边界。
Mullvad 于 5 月 15 日发现一个指纹问题:用户从一台 VPN 服务器切换到另一台时,服务方有时能推断出同一用户此前从另一台服务器连接过,但不会暴露用户身份。
推荐理由:原文披露了 Mullvad 自身 VPN 服务器间退出 IP 可被关联的指纹问题,并给出用户可立即执行的规避方法。
Mullvad 博客披露 Android 16 存在一个漏洞,允许任意应用将流量发送到 VPN 隧道之外,即使开启了 Always-On VPN 和 Block connections without VPN 也无效,且影响所有 VPN 应用而非仅 Mullvad VPN。
推荐理由:Mullvad 说明 Android 16 的 VPN 绕过漏洞影响所有 VPN 应用,并给出可照做的 adb 缓解命令。