跳到正文
10月9日周五
  1. arXiv 隐私论文66

    研究:MoE 路由遥测泄露成员信息,成员推断攻击效果提升

    研究提出一种路由增强的成员推断攻击,将常规输出信号与聚合路由特征结合,用独立微调的影子模型训练成员分类器并迁移到目标模型。在三种 MoE 架构和三个数据域共九种设置中,路由遥测使 1% FPR 下的 TPR 相比强输出信号集成提升 2.7 至 9.4 个百分点,且在完整微调、冻结路由器训练、LoRA 和指令微调下均持续存在。

    推荐理由:研究显示 MoE 路由遥测可被用于成员推断,读者可了解这一运维信号如何成为新的隐私暴露面。

10月8日周四
  1. arXiv 隐私论文60

    研究用 LLM 分析 570 万条 Reddit 帖,构建 12 类 AI 危害分类体系

    研究提出一套 LLM 辅助的主题分析流程,从大规模社交媒体数据中动态识别、分类并追踪新兴 AI 危害。作者分析了 18 个月(2025 年 1 月至 2026 年 6 月)内 570 万条 Reddit 帖子摘要,整理并发布包含 57.5 万条 AI 危害相关帖子的数据集,以及涵盖 12 个类别、47 个子节点的自下而上 AI 危害分类体系。

    推荐理由:论文用 570 万条 Reddit 帖构建自下而上的 AI 危害分类体系,其中包含自上而下框架忽略的 AI 隐私侵害细分类型。

  2. arXiv 隐私论文26

    欺骗性老虎机问题:探索耦合与多智能体学习的脆弱性

    研究揭示,在最小双人强单调设定中,欺骗方利用与受害者探索仅存在相关性的泄露信号,将自身探索动作与之耦合,从而注入外部性并把学习动态导向新的稳态——欺骗纳什均衡(DNE)。作者证明欺骗性老虎机学习(DBL)动态以最优收敛速率收敛到 DNE 的任意小邻域,且在放宽标准老虎机优化文献的二阶光滑条件下仍成立,并用资源分配博弈展示了欺骗对稳态与欺骗方成本的严格影响。

  3. arXiv 隐私论文62

    研究:LLM 路由元数据可泄露敏感话题,长度匹配可缓解

    研究测量了 LLM 路由决策元数据在关闭内容日志时仍会泄露敏感话题,基于 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)和两个成本/质量路由器及一个领域路由器展开预注册实验。

    推荐理由:研究测量了 LLM 路由元数据在关闭内容日志时仍会泄露敏感话题,并给出长度匹配的缓解思路。

10月7日周三
  1. Malwarebytes 博客30

    Malwarebytes 披露 BlueKit:AI 驱动的钓鱼工具包 10 分钟即可劫持账号

    Malwarebytes 研究团队披露钓鱼即服务工具包 BlueKit,攻击者无需深厚技术背景即可通过单一仪表盘管理整场钓鱼活动。截至 9 月,BlueKit 模板库覆盖 97 个品牌、176 个变体,可仿冒 Amazon、Google/Gmail、Apple、美国运通、TikTok、Facebook、X 以及 OpenAI、Anthropic 等平台登录页。

10月6日周二
10月5日周一
  1. 404 Media76

    Meta 在 Muse 上线前紧急修复 KVM 逃逸漏洞

    404 Media 获悉,Meta 工程师在 AI 智能体产品 Muse 上线前数周发现多个安全漏洞,其中至少一个可能让普通用户突破虚拟机隔离,访问 Meta 内部敏感数据库和服务。

    推荐理由:披露 Meta 在 Muse 上线前紧急修复 KVM 逃逸漏洞的内部过程,可了解 AI 智能体与生产环境仅隔一层虚拟化的风险。

10月3日周六
  1. The Guardian80

    佐治亚州就 AI 暴露选民秘密选票召开紧急会议

    普林斯顿大学信息技术政策中心博士后研究员 Max Springer 用一份 20 美元的 AI 大语言模型订阅和通过《公开记录法》申请获得的数据,搭建流程识别佐治亚州的秘密选票,并称该 AI 智能体全程未拒绝或提出担忧。

    推荐理由:普林斯顿研究者用 20 美元 AI 订阅从佐治亚州公开选举记录中还原 152 万张选票的投票顺序,暴露选票保密与选举透明之间的制度冲突。

10月2日周五
5月29日周五
1月29日周四
  1. Lukasz Olejnik38

    用提示词级 kill switch 硬停止 AI 智能体流水线

    Claude 模型的保留关键字 token 可确定性地触发终止性拒绝,使 AI 智能体流水线在检查执行前就停止运行。若不可信文本被提升进提示词,这些 token 可被用于规避检查、压制审计或拒绝服务。缓解方法包括在组装提示词前预过滤保留 token、隔离状态,并在出现终止性停止时将结果视为“评估未完成”。