研究:MoE 路由遥测泄露成员信息,成员推断攻击效果提升
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
CPU-Auth 是一种基于设备 CPU 物理特性差异的新型认证机制,通过在浏览器内远程测量 DVFS 调频器的行为,提取 CPU 的独有特征来构建硬件级设备指纹。该研究在超过 50,000 条数据轨迹上使用距离度量与深度学习方法评估了 CPU-Auth 的性能。
研究提出 PSCMIA,一种针对嵌入式机器学习模型的功耗侧信道成员推断攻击,可直接从功耗轨迹推断样本是否用于训练,无需预测概率甚至预测标签。
研究测量了 LLM 路由决策元数据在关闭内容日志时仍会泄露敏感话题,基于 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)和两个成本/质量路由器及一个领域路由器展开预注册实验。
推荐理由:研究测量了 LLM 路由元数据在关闭内容日志时仍会泄露敏感话题,并给出长度匹配的缓解思路。
针对 EmoNet-Face-HQ 细粒度情绪识别基准,研究者保留其图像、分类体系与评分,仅把答案读取方式从生成式作答改为按类别逐项读取 logits 的二分类查询。
普林斯顿大学信息技术政策中心博士后研究员 Max Springer 用一份 20 美元的 AI 大语言模型订阅和通过《公开记录法》申请获得的数据,搭建流程识别佐治亚州的秘密选票,并称该 AI 智能体全程未拒绝或提出担忧。
推荐理由:普林斯顿研究者用 20 美元 AI 订阅从佐治亚州公开选举记录中还原 152 万张选票的投票顺序,暴露选票保密与选举透明之间的制度冲突。
密码学家 Matthew Green 对 OpenAI 和 Anthropic 的加密推理块做了周末实验,发现未修改的旧推理块可跨会话、跨账号重放,OpenAI 甚至可跨模型重放,说明两家可能用单一全局密钥加密所有推理数据。