SAILS:为更强的 LLM 后门攻击学习选择投毒集
Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究显示,在三个 LLaMA-3-8B 后门场景中,固定模型、干净数据和投毒数量时,仅因投毒集选择不同,攻击成功率就从 3% 波动到 80%。为此作者提出 SAILS,将投毒集选择形式化为带 oracle 预算的集合优化,用数百次微调-评估训练集合打分器,从数百万候选集中筛选并审计少量候选。
来源:Hugging Face Daily Papers · arxiv.org