跳到正文
Ars Technica: AI· Dan Goodin·· 19 天前AI 评分55

研究显示 AI 水印可使 LLM 更易受对抗性提示影响

LLMs respond differently to harmful prompts when AI watermarking is used

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

新研究显示,Google 开源的 SynthID-Text 水印不仅改变模型的选词,还会改变模型调用的工具以及是否遵守安全护栏,在对抗性提示下这种影响更明显。Anthropic 近期披露,其未来的 Claude 模型将采用 SynthID-Text,该方法通过密钥微调模型选择下一个词的过程。

来源:Ars Technica: AI · arstechnica.com