跳到正文
Hugging Face Blog·· 28 天前AI 评分44

Hugging Face 论文:Safety for Whom? 用边界感知自蒸馏控制 LLM 安全拒答

Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Hugging Face 博客介绍论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,提出安全拒答不应按话题整体拒绝,而应只拒绝话题中与部署策略冲突的子集。

来源:Hugging Face Blog · huggingface.co