arXiv 隐私论文· Michael Tang·· 4 天前AI 评分26
欺骗性老虎机问题:探索耦合与多智能体学习的脆弱性
The Deceptive Bandit Problem: Exploratory Coupling and the Fragility of Multi-Agent Learning
AI 导读
研究揭示,在最小双人强单调设定中,欺骗方利用与受害者探索仅存在相关性的泄露信号,将自身探索动作与之耦合,从而注入外部性并把学习动态导向新的稳态——欺骗纳什均衡(DNE)。作者证明欺骗性老虎机学习(DBL)动态以最优收敛速率收敛到 DNE 的任意小邻域,且在放宽标准老虎机优化文献的二阶光滑条件下仍成立,并用资源分配博弈展示了欺骗对稳态与欺骗方成本的严格影响。
来源:arXiv 隐私论文 · arxiv.org