跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分50

扩散语言模型定向偏见注入攻击:通过闭环激活引导操控 LLaDA-8B-Instruct

Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出一种针对掩码扩散语言模型(dLLM)的定向偏见注入攻击,利用 PI 控制器在去噪过程中实时追踪目标答案概率并动态调整引导向量强度。

来源:Hugging Face Daily Papers · arxiv.org