扩散语言模型定向偏见注入攻击:通过闭环激活引导操控 LLaDA-8B-Instruct
Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出一种针对掩码扩散语言模型(dLLM)的定向偏见注入攻击,利用 PI 控制器在去噪过程中实时追踪目标答案概率并动态调整引导向量强度。
来源:Hugging Face Daily Papers · arxiv.org