跳到正文
原文
Hugging Face Daily Papers·· 3 天前AI 评分42

针对黑盒 LLM 的受控解码攻击

Controlled Decoding Attacks on Black-Box LLMs

AI 导读

研究者提出受控解码攻击框架,可在仅返回采样文本的黑盒 LLM 接口上绕过安全对齐。该方法通过采样分布重建、风险门控残差控制和推测式多 token 执行,将采样成本集中在少数关键位置。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。

来源:Hugging Face Daily Papers · arxiv.org