研究:MoE 路由遥测泄露成员信息,成员推断攻击效果提升
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。
推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。
CPU-Auth 是一种基于设备 CPU 物理特性差异的新型认证机制,通过在浏览器内远程测量 DVFS 调频器的行为,提取 CPU 的独有特征来构建硬件级设备指纹。该研究在超过 50,000 条数据轨迹上使用距离度量与深度学习方法评估了 CPU-Auth 的性能。
研究提出 PSCMIA,一种针对嵌入式机器学习模型的功耗侧信道成员推断攻击,可直接从功耗轨迹推断样本是否用于训练,无需预测概率甚至预测标签。
研究显示,在第二价格拍卖中保护落败者估值信息与拍卖可信度存在冲突。在私有通信的确定性协议下,下尾隐私会迫使首个信息性问题暴露投标人是否拥有最高可能估值,卖方随后可在无人察觉的情况下操纵赢家支付,从而在某些估值情形下增加收入且从不减少收入。降价式协议虽能隐藏低于价格的落败估值,却允许操纵;在强制出售情形下,可信的升价式协议则会暴露这些估值。
404 Media 播客本期讨论一段泄露视频,其声称警方可绕过 iPhone 的自动重启(inactivity reboot)机制,进入已锁定的手机。节目还谈到有人在一个机器人监狱中“折磨”LLM,引发 AI 领域一场争论;以及新墨西哥州一起 ChatGPT 案件中,律师在谋杀案上诉中引用了 ChatGPT 编造的假证人。
Google 称攻击者攻陷了 .gh(加纳)、.sl(塞拉利昂)和 .as(美属萨摩亚)三个国家代码域名命名空间背后的基础设施,借此为 Google 域名及其他组织的域名获取未授权的 HTTPS 证书。
与俄罗斯利益关联的间谍组织 UAC-0099 使用不断演进的 MatchBoil 恶意软件攻击乌克兰交通、制造和能源企业,ESET 观测到的感染全部位于乌克兰。
Bitdefender 发现数千部廉价 Android 手机在固件中预装了名为 Midnight Mimosa 的恶意软件,涉及多家品牌、使用 MediaTek 芯片,覆盖 150 多个国家,墨西哥、法国和意大利占比最高。
Hugging Suit 是一套气动驱动的可穿戴系统,可让用户在实时模拟并接收远程拥抱。系统整合可编程气囊矩阵(AAM)、便携式高压气动单元与织物压力传感层,在保持轻便可移动的同时提供精准触觉反馈。初步反馈显示,低光私密空间、尤其配合视频看到远端伙伴时,能提升远程拥抱的情感投入与舒适度。
研究提出一套 LLM 辅助的主题分析流程,从大规模社交媒体数据中动态识别、分类并追踪新兴 AI 危害。作者分析了 18 个月(2025 年 1 月至 2026 年 6 月)内 570 万条 Reddit 帖子摘要,整理并发布包含 57.5 万条 AI 危害相关帖子的数据集,以及涵盖 12 个类别、47 个子节点的自下而上 AI 危害分类体系。
推荐理由:论文用 570 万条 Reddit 帖构建自下而上的 AI 危害分类体系,其中包含自上而下框架忽略的 AI 隐私侵害细分类型。
研究揭示,在最小双人强单调设定中,欺骗方利用与受害者探索仅存在相关性的泄露信号,将自身探索动作与之耦合,从而注入外部性并把学习动态导向新的稳态——欺骗纳什均衡(DNE)。作者证明欺骗性老虎机学习(DBL)动态以最优收敛速率收敛到 DNE 的任意小邻域,且在放宽标准老虎机优化文献的二阶光滑条件下仍成立,并用资源分配博弈展示了欺骗对稳态与欺骗方成本的严格影响。
emg2face 提出用高密度表面肌电(HD-sEMG)替代光学方法捕捉面部动作,在额头和面侧各布 32 通道、共 64 通道纺织电极,以 2048 Hz 采样,并用模拟音频脉冲实现亚毫秒级 EMG 与视频同步。
该研究将单输出后验刻画扩展为同时的后验与条件组合图像界,保留多输出的实际耦合、量化不规则单元的条件似然损失并纳入实际失真标记。两项扩展分别以加权重建策略图像替代不相交计数、以后验质量约束替代输出基数以实现保密。直接应用给出多源辅助交集、Gaussian 公共/私有描述及指定条件类型的隐私放大等匹配的二阶区域,并给出联合率失真偏移与显式速率界。
研究测量了 LLM 路由决策元数据在关闭内容日志时仍会泄露敏感话题,基于 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)和两个成本/质量路由器及一个领域路由器展开预注册实验。
推荐理由:研究测量了 LLM 路由元数据在关闭内容日志时仍会泄露敏感话题,并给出长度匹配的缓解思路。
一波针对广告账户管理者的钓鱼活动利用假 ChatGPT、Gemini、Claude 和 Perplexity 站点,通过浏览器套浏览器(BitB)攻击窃取登录凭证和 MFA 验证码,并借 Meta 新推出的 Muse AI 智能体之名设饵。
FBI 警告 FortiBleed 攻击仍在针对暴露的 Fortinet FortiGate 防火墙和 SSL VPN 网关,攻击者利用此前泄露的凭据、infostealer 日志、撞库和密码喷洒获取访问权限,再用 Hashcat 和 Hashtopolis 的分布式 GPU 集群离线破解窃取的口令哈希,并创建管理员账户删除或修改现有管理员账户以锁出合法管理员。
研究提出身份感知视频字幕与人物中心问答框架,基于 LSMDC v2 电影片段将检测人脸匹配演员参考图像并跨帧追踪角色,构建含 750 个字幕片段和 3,000 个人物中心问题的基准。
Malwarebytes 研究团队披露钓鱼即服务工具包 BlueKit,攻击者无需深厚技术背景即可通过单一仪表盘管理整场钓鱼活动。截至 9 月,BlueKit 模板库覆盖 97 个品牌、176 个变体,可仿冒 Amazon、Google/Gmail、Apple、美国运通、TikTok、Facebook、X 以及 OpenAI、Anthropic 等平台登录页。
Facebook 用户报告收到 iMessage 消息,询问某件 Facebook Marketplace 商品是否仍在售,附带的伪造列表中卖家姓名与收件人相同,但头像属于另一位同名 Facebook 用户。
针对 EmoNet-Face-HQ 细粒度情绪识别基准,研究者保留其图像、分类体系与评分,仅把答案读取方式从生成式作答改为按类别逐项读取 logits 的二分类查询。
404Media 报道称,网络武器厂商 Magnet Forensics 利用 iOS 漏洞绕过 iPhone 的自动重启安全功能,该功能会在设备 72 小时未使用后将其置于更安全状态。
研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证效果,并构建多语言语音转换数据集以提升跨语言泛化能力。结果显示攻击效果取决于匿名语音的语言可用性,声学导向攻击者整体表现更优,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。该数据集进一步提升了攻击性能并部分缩小了跨语言差距。
404 Media 获悉,Meta 工程师在 AI 智能体产品 Muse 上线前数周发现多个安全漏洞,其中至少一个可能让普通用户突破虚拟机隔离,访问 Meta 内部敏感数据库和服务。
推荐理由:披露 Meta 在 Muse 上线前紧急修复 KVM 逃逸漏洞的内部过程,可了解 AI 智能体与生产环境仅隔一层虚拟化的风险。
Meta 的新个人助理 Muse 走红后,多名研究者提取了其内部文件和系统提示词。独立 AI 安全与隐私研究者 Karan Joshi 通过普通聊天界面让 Muse 复制并分享自身软件文件,并将发现提供给 WIRED。
普林斯顿大学信息技术政策中心博士后研究员 Max Springer 用一份 20 美元的 AI 大语言模型订阅和通过《公开记录法》申请获得的数据,搭建流程识别佐治亚州的秘密选票,并称该 AI 智能体全程未拒绝或提出担忧。
推荐理由:普林斯顿研究者用 20 美元 AI 订阅从佐治亚州公开选举记录中还原 152 万张选票的投票顺序,暴露选票保密与选举透明之间的制度冲突。
Objective-See Foundation 研究人员发现 OpenAI 的 ChatGPT macOS 应用存在一个已被修复的漏洞,攻击者可借此接管本机 ChatGPT,访问全部聊天记录及浏览器会话等数据。
东北大学与 Consumer Reports 合作评估现代汽车对驾驶者的监控程度,首次展示数据在车辆、购车时下载的车机应用与第三方公司之间的流动。几乎所有车企都向外部公司发送数据,近四分之一的车机应用外泄个人可识别信息,包括车主姓名、车辆识别码(VIN)和精确地理位置。
推荐理由:研究首次追踪车辆、车机应用与第三方之间的数据流向,呈现联网汽车数据被哪些机构接收。
Privacy International 发布《Watch Your Step:危害移民的技术指南》,基于对多地区移民律师、倡导者和组织者的全球调查,梳理了当前用于移民治理的监控技术。
Mullvad 披露 Android 网络栈中新发现的漏洞,恶意应用无需任何特殊权限,即可在开启“无 VPN 时阻止所有连接”的情况下把流量发到 VPN 隧道之外,从而暴露设备真实 IP。
密码学家 Matthew Green 对 OpenAI 和 Anthropic 的加密推理块做了周末实验,发现未修改的旧推理块可跨会话、跨账号重放,OpenAI 甚至可跨模型重放,说明两家可能用单一全局密钥加密所有推理数据。
Mullvad 于 5 月 15 日发现一个指纹问题:用户从一台 VPN 服务器切换到另一台时,服务方有时能推断出同一用户此前从另一台服务器连接过,但不会暴露用户身份。
推荐理由:原文披露了 Mullvad 自身 VPN 服务器间退出 IP 可被关联的指纹问题,并给出用户可立即执行的规避方法。
Mullvad 博客披露 Android 16 存在一个漏洞,允许任意应用将流量发送到 VPN 隧道之外,即使开启了 Always-On VPN 和 Block connections without VPN 也无效,且影响所有 VPN 应用而非仅 Mullvad VPN。
推荐理由:Mullvad 说明 Android 16 的 VPN 绕过漏洞影响所有 VPN 应用,并给出可照做的 adb 缓解命令。
2026 年 2 月 28 日美以对伊朗军事行动期间,拥有 3700 万安装量的伊朗 BadeSaba 祈祷应用被入侵,其推送通知系统在德黑兰时间 9:52 起的 30 分钟内以波斯语向数百万手机发送劝降信息,与动能打击同步。
Claude 模型的保留关键字 token 可确定性地触发终止性拒绝,使 AI 智能体流水线在检查执行前就停止运行。若不可信文本被提升进提示词,这些 token 可被用于规避检查、压制审计或拒绝服务。缓解方法包括在组装提示词前预过滤保留 token、隔离状态,并在出现终止性停止时将结果视为“评估未完成”。