面向谁的安全?用于可控 LLM 安全拒答的边界感知自蒸馏
Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出"窄边界安全"问题与边界感知自蒸馏框架,结合受控主题生成、覆盖修复、分布内补偿数据和有害-良性配对数据,让同一基座模型可在同一话题内设定不同拒答边界。
来源:Hugging Face Daily Papers · arxiv.org