跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 4 小时前AI 评分67

MIT Technology Review 深度分析:我们对 AI 拒答能力寄予了过多信任

We’re putting too much faith in AI’s ability to say no

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

MIT Technology Review 长文分析 AI 拒答机制为何不牢靠,模型拒绝能力依赖概率性训练、分类器和 probes,但 jailbreak 层出不穷,Anthropic Fable 5 发布不到三天即被 Amazon 研究者破解。

来源:MIT Technology Review · AI · technologyreview.com