跳到正文
Hugging Face Daily Papers·· 2026-09-02AI 评分36

安全防护生效了,LLM 系统就更安全吗?——部署视角下的防护评估标准

The Safeguard Worked. Is the LLM System Safer?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一项 arXiv 研究指出,当前 LLM 服务的安全防护多以拒答率、攻击成功率和违规率来评估,但这些指标只反映防护在测试请求上的局部表现,无法回答部署后攻击者持续适配或另寻入口时系统仍会提供多少有害帮助。研究认为,证明有害帮助仍存在只需一次成功攻击,而要证明其已很少则必须补充防护之外整个系统的证据,这类证据在深度编码的论断中仅占少数。因此局部分数提升本身不等于部署更安全。

来源:Hugging Face Daily Papers · arxiv.org