SBW:LLM智能体语义行为水印
热点事件历史事件
SBW:LLM智能体语义行为水印
1 篇报道1 个报道来源5 天前更新
先了解这件事
AI 综述
Suxin Ji 提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分箱替代公开簇分箱。论文称该分箱的新桶分配在随机预言机模型下可证明不可预测。 在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench 改写场景下簇级检测率为 0.49-0.66,精确符号方案仅 0.05-0.17;ALFWorld 上为 0.92-0.97 对 0.00-0.01。论文称改写鲁棒性约损失一半的每步水印容量。 对抗方面,论文称当攻击者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,论文将其列为未解决问题。代码已公开。
AI 根据报道生成 · 3 天前更新
最新进展10月7日 00:50
SBW:面向 LLM 智能体的抗改写、抗伪造语义行为水印报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv 隐私论文精选SBW:面向 LLM 智能体的抗改写、抗伪造语义行为水印
论文提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分箱替代公开簇分箱。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench 改写场景下簇级检测率为 0.49-0.66,精确符号方案仅 0.05-0.17;ALFWorld 上为 0.92-0.97 对 0.00-0.01。