DiSCO:通过分布引导的对比提示词优化防御文生图有害内容
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
DiSCO 是一种零样本、严格黑盒的文生图防御方法,完全在提示词层面工作,无需重训练、微调或访问模型内部。它通过 beam search 做分布引导的后缀扩展,并用目标模型自身生成的安全与不安全图像池进行对比打分,迭代反馈直至产出安全内容。在 I2P 基准的多种红队攻击下,DiSCO 将无防御与已有防御模型的 ASR 分别降低 37.7% 和 25.13%,同时保持语义保真度并提升图像连贯性。
来源:Hugging Face Daily Papers · arxiv.org