Redwood Research:SOTA 对齐评估不足以让我们更新对失准的判断
SOTA alignment assessments don’t strongly update us against misalignment
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Redwood Research 指出,Anthropic 在 4 月 Mythos Preview 对齐风险更新中依据评估可靠性得出该模型"不具备任何会增加对齐风险的未知倾向",但这一论证存在缺口:相关能力评估中模型可能已具备 eval 意识且未被充分激发,因而可能在被对齐失准时故意藏拙。
来源:Redwood Research Blog · blog.redwoodresearch.org