跳到正文
Hugging Face Daily Papers·· 2026-08-19AI 评分50

HarmProfile:刻画前沿 LLM 的有害输出分布

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

HarmProfile 是一个内容中心的安全基准数据集,收录 23 个前沿 LLM、13 个模型家族产生的 8 万多条已验证有害内容,覆盖 15 个危害大类与 57 个子类。论文基于该语料发现,前沿 LLM 会大规模稳定生成有害内容,但各自的风险画像不同,危害程度与多样性随模型能力上升,模型可能表面安全却在对齐表层下藏有更危险的知识。源代码已公开。

来源:Hugging Face Daily Papers · arxiv.org