跳到正文
Hugging Face Daily Papers·· 21 天前AI 评分47

SAILS:为更强的 LLM 后门攻击学习选择投毒集

Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究显示,在三个 LLaMA-3-8B 后门场景中,固定模型、干净数据和投毒数量时,仅因投毒集选择不同,攻击成功率就从 3% 波动到 80%。为此作者提出 SAILS,将投毒集选择形式化为带 oracle 预算的集合优化,用数百次微调-评估训练集合打分器,从数百万候选集中筛选并审计少量候选。

来源:Hugging Face Daily Papers · arxiv.org