港中文/FaceMind 提出 ToxPrune:不训练不改权重,剪掉有毒子词让大模型说不出脏话
大模型终于说不出脏话了!有毒子词剪枝ToxPrune,预训练+推理双重防线
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
港中文与 FaceMind 团队提出 ToxPrune,在推理阶段从 BPE 词表中剪除有毒子词,无需训练或改权重即可让模型无法输出脏话。在专门生成不良内容的 NSFW-3B 上,毒性评分从 0.89 降至 0.13,同时 BLEU、ROUGE 和多样性指标不降反升;在 Llama-3.1-6B 上 Distinct-1 从 0.232 提升至 0.323。
来源:量子位 · 微信公众号 · mp.weixin.qq.com