跳到正文
Hugging Face Daily Papers·· 27 天前AI 评分42

面向谁的安全?用于可控 LLM 安全拒答的边界感知自蒸馏

Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出"窄边界安全"问题与边界感知自蒸馏框架,结合受控主题生成、覆盖修复、分布内补偿数据和有害-良性配对数据,让同一基座模型可在同一话题内设定不同拒答边界。

来源:Hugging Face Daily Papers · arxiv.org