跳到正文
The Decoder· Jonathan Kemper·· 2026-08-22AI 评分55

英国 AI 安全研究所用心理测量方法揭示 AI 安全测试的弱点

Psychological methods reveal major weaknesses in AI security testing

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

英国 AI 安全研究所的研究人员用心理测量方法表明,主流语言模型安全基准衡量的并不是一个一致的特质。一律拦截请求会人为抬高安全分数,即便模型在日常使用中变得更不好用。研究还提供了一种方法,用于识别在测试中比正常使用时表现得更谨慎的模型。

来源:The Decoder · the-decoder.com