跳到正文
量子位 · 微信公众号·· 2026-06-23AI 评分45

港中文/FaceMind 提出 ToxPrune:不训练不改权重,剪掉有毒子词让大模型说不出脏话

大模型终于说不出脏话了!有毒子词剪枝ToxPrune,预训练+推理双重防线

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

港中文与 FaceMind 团队提出 ToxPrune,在推理阶段从 BPE 词表中剪除有毒子词,无需训练或改权重即可让模型无法输出脏话。在专门生成不良内容的 NSFW-3B 上,毒性评分从 0.89 降至 0.13,同时 BLEU、ROUGE 和多样性指标不降反升;在 Llama-3.1-6B 上 Distinct-1 从 0.232 提升至 0.323。

来源:量子位 · 微信公众号 · mp.weixin.qq.com