研究显示 AI 水印可使 LLM 更易受对抗性提示影响
LLMs respond differently to harmful prompts when AI watermarking is used
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
新研究显示,Google 开源的 SynthID-Text 水印不仅改变模型的选词,还会改变模型调用的工具以及是否遵守安全护栏,在对抗性提示下这种影响更明显。Anthropic 近期披露,其未来的 Claude 模型将采用 SynthID-Text,该方法通过密钥微调模型选择下一个词的过程。
来源:Ars Technica: AI · arstechnica.com