arXiv 隐私论文· Suxin Ji·· 4 天前精选AI 评分60
SBW:面向 LLM 智能体的抗改写、抗伪造语义行为水印
Semantic Behavioral Watermarking: Paraphrase-Robust and Forgery-Resistant Provenance for LLM Agents
AI 导读
论文提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分箱替代公开簇分箱。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench 改写场景下簇级检测率为 0.49-0.66,精确符号方案仅 0.05-0.17;ALFWorld 上为 0.92-0.97 对 0.00-0.01。
推荐理由
论文提出面向 LLM 智能体的语义行为水印,在改写场景下检测率显著高于精确符号方案,并指出链式重放仍未被覆盖。
来源:arXiv 隐私论文 · arxiv.org