MIT Technology Review 深度分析:我们对 AI 拒答能力寄予了过多信任
We’re putting too much faith in AI’s ability to say no
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
MIT Technology Review 长文分析 AI 拒答机制为何不牢靠,模型拒绝能力依赖概率性训练、分类器和 probes,但 jailbreak 层出不穷,Anthropic Fable 5 发布不到三天即被 Amazon 研究者破解。
来源:MIT Technology Review · AI · technologyreview.com