跳到正文
量子位 · 微信公众号·· 2026-07-30AI 评分61

UIUC与亚马逊ICML论文:提示词注入防御用丢弃近30%数据换取高安全率

AI安全防御被曝重大缺陷,为了安全性,大量有效文本被直接清除! | ICML‘26 Spotlight

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

UIUC DREAM Lab与亚马逊的研究提出SECFID基准,发现提示词注入防御中安全性与忠实度无法兼得。团队在48种模型与防御配置上评测,强防御可达99%安全率,代价是丢掉近30%数据;SECFID将模型反应区分为执行、作为数据处理和忽略三种行为。

来源:量子位 · 微信公众号 · mp.weixin.qq.com