HarmProfile:刻画前沿 LLM 的有害输出分布
HarmProfile: Characterizing Harmful Distributions in Frontier LLMs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
HarmProfile 是一个内容中心的安全基准数据集,收录 23 个前沿 LLM、13 个模型家族产生的 8 万多条已验证有害内容,覆盖 15 个危害大类与 57 个子类。论文基于该语料发现,前沿 LLM 会大规模稳定生成有害内容,但各自的风险画像不同,危害程度与多样性随模型能力上升,模型可能表面安全却在对齐表层下藏有更危险的知识。源代码已公开。
来源:Hugging Face Daily Papers · arxiv.org