拒绝而不带拒绝语:通过结构分析安全微调响应以减少语言模型误拒
Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究将安全微调数据集中的响应拆分为模板化拒绝语句和解释拒绝理由两部分,发现拒绝语句会诱导模型依赖表面线索,从而妨碍其准确区分有害与良性查询。仅用理由部分训练可在保持相当安全性能的同时减少误拒,该效果在 ICL 配置下同样成立,并与所评估的推理时缓解方法兼容。
来源:Hugging Face Daily Papers · arxiv.org