跳到正文
量子位 · 微信公众号·· 2026-09-02AI 评分61

人大与阿里提出 LoD 越狱检测方法,不用越狱样本仍最快 0.25 秒检出未见攻击

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

中国人民大学与阿里巴巴集团联合提出 Learning to Detect(LoD),不使用任何越狱攻击样本,而是从 LVLM 逐层内部激活中学习安全模式,在三种模型上的平均 F1 分别达到 0.949、0.947 和 0.921。

来源:量子位 · 微信公众号 · mp.weixin.qq.com