Hugging Face 论文:Safety for Whom? 用边界感知自蒸馏控制 LLM 安全拒答
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Hugging Face 博客介绍论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,提出安全拒答不应按话题整体拒绝,而应只拒绝话题中与部署策略冲突的子集。
来源:Hugging Face Blog · huggingface.co