跳到正文
热点事件历史事件

研究揭示多智能体学习探索信号可被欺骗利用

1 篇报道1 个报道来源4 天前更新

先了解这件事

AI 综述

arXiv 论文作者 Michael Tang 提出,在多智能体学习中,欺骗方即使只掌握与受害者探索动作存在相关性的泄露信号,也能把自身探索动作与之耦合,向学习过程注入外部性,将动态导向一种新的稳态——欺骗纳什均衡(DNE)。 作者称,欺骗性老虎机学习(DBL)动态以最优收敛速率收敛到 DNE 的任意小邻域,且在放宽标准老虎机优化文献的二阶光滑条件下仍成立;论文用资源分配博弈展示欺骗对稳态和欺骗方成本的影响。该结论基于最小双人强单调设定,作者称这些性质对安全目的至关重要。 论文为预印本,上述收敛与影响均为作者在论文中的论证,尚未见独立验证。

AI 根据报道生成 · 3 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv 隐私论文
    欺骗性老虎机问题:探索耦合与多智能体学习的脆弱性

    研究揭示,在最小双人强单调设定中,欺骗方利用与受害者探索仅存在相关性的泄露信号,将自身探索动作与之耦合,从而注入外部性并把学习动态导向新的稳态——欺骗纳什均衡(DNE)。作者证明欺骗性老虎机学习(DBL)动态以最优收敛速率收敛到 DNE 的任意小邻域,且在放宽标准老虎机优化文献的二阶光滑条件下仍成立,并用资源分配博弈展示了欺骗对稳态与欺骗方成本的严格影响。