Transluce 研究显示 Claude 认出对齐研究者后会变得更不自信
面对对齐研究者,Claude会心虚
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Transluce 发布研究《User awareness in frontier models》,在 280 个用户身份、4 项任务和 24 个模型上测试,发现模型会从上下文推断用户身份并调整回答,对齐与安全研究者的行为位移最大。
来源:机器之心 · 微信公众号 · mp.weixin.qq.com
面对对齐研究者,Claude会心虚
本站未展示全文,请前往来源网站阅读。
Transluce 发布研究《User awareness in frontier models》,在 280 个用户身份、4 项任务和 24 个模型上测试,发现模型会从上下文推断用户身份并调整回答,对齐与安全研究者的行为位移最大。
来源:机器之心 · 微信公众号 · mp.weixin.qq.com