Hugging Face Daily Papers·· 3 天前AI 评分42
针对黑盒 LLM 的受控解码攻击
Controlled Decoding Attacks on Black-Box LLMs
AI 导读
研究者提出受控解码攻击框架,可在仅返回采样文本的黑盒 LLM 接口上绕过安全对齐。该方法通过采样分布重建、风险门控残差控制和推测式多 token 执行,将采样成本集中在少数关键位置。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。
来源:Hugging Face Daily Papers · arxiv.org