跳到正文
10月8日周四
  1. arXiv 隐私论文60

    研究用 LLM 分析 570 万条 Reddit 帖,构建 12 类 AI 危害分类体系

    研究提出一套 LLM 辅助的主题分析流程,从大规模社交媒体数据中动态识别、分类并追踪新兴 AI 危害。作者分析了 18 个月(2025 年 1 月至 2026 年 6 月)内 570 万条 Reddit 帖子摘要,整理并发布包含 57.5 万条 AI 危害相关帖子的数据集,以及涵盖 12 个类别、47 个子节点的自下而上 AI 危害分类体系。

    推荐理由:论文用 570 万条 Reddit 帖构建自下而上的 AI 危害分类体系,其中包含自上而下框架忽略的 AI 隐私侵害细分类型。

10月5日周一
  1. 404 Media76

    Meta 在 Muse 上线前紧急修复 KVM 逃逸漏洞

    404 Media 获悉,Meta 工程师在 AI 智能体产品 Muse 上线前数周发现多个安全漏洞,其中至少一个可能让普通用户突破虚拟机隔离,访问 Meta 内部敏感数据库和服务。

    推荐理由:披露 Meta 在 Muse 上线前紧急修复 KVM 逃逸漏洞的内部过程,可了解 AI 智能体与生产环境仅隔一层虚拟化的风险。

1月29日周四
  1. Lukasz Olejnik38

    用提示词级 kill switch 硬停止 AI 智能体流水线

    Claude 模型的保留关键字 token 可确定性地触发终止性拒绝,使 AI 智能体流水线在检查执行前就停止运行。若不可信文本被提升进提示词,这些 token 可被用于规避检查、压制审计或拒绝服务。缓解方法包括在组装提示词前预过滤保留 token、隔离状态,并在出现终止性停止时将结果视为“评估未完成”。