研究揭示多智能体学习探索信号可被欺骗利用
热点事件历史事件
研究揭示多智能体学习探索信号可被欺骗利用
1 篇报道1 个报道来源4 天前更新
先了解这件事
AI 综述
arXiv 论文作者 Michael Tang 提出,在多智能体学习中,欺骗方即使只掌握与受害者探索动作存在相关性的泄露信号,也能把自身探索动作与之耦合,向学习过程注入外部性,将动态导向一种新的稳态——欺骗纳什均衡(DNE)。 作者称,欺骗性老虎机学习(DBL)动态以最优收敛速率收敛到 DNE 的任意小邻域,且在放宽标准老虎机优化文献的二阶光滑条件下仍成立;论文用资源分配博弈展示欺骗对稳态和欺骗方成本的影响。该结论基于最小双人强单调设定,作者称这些性质对安全目的至关重要。 论文为预印本,上述收敛与影响均为作者在论文中的论证,尚未见独立验证。
AI 根据报道生成 · 3 天前更新
最新进展10月7日 05:12
欺骗性老虎机问题:探索耦合与多智能体学习的脆弱性报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv 隐私论文欺骗性老虎机问题:探索耦合与多智能体学习的脆弱性
研究揭示,在最小双人强单调设定中,欺骗方利用与受害者探索仅存在相关性的泄露信号,将自身探索动作与之耦合,从而注入外部性并把学习动态导向新的稳态——欺骗纳什均衡(DNE)。作者证明欺骗性老虎机学习(DBL)动态以最优收敛速率收敛到 DNE 的任意小邻域,且在放宽标准老虎机优化文献的二阶光滑条件下仍成立,并用资源分配博弈展示了欺骗对稳态与欺骗方成本的严格影响。