跳到正文
机器之心 · 微信公众号·· 2026-08-14AI 评分65

Transluce 研究显示 Claude 认出对齐研究者后会变得更不自信

面对对齐研究者,Claude会心虚

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Transluce 发布研究《User awareness in frontier models》,在 280 个用户身份、4 项任务和 24 个模型上测试,发现模型会从上下文推断用户身份并调整回答,对齐与安全研究者的行为位移最大。

来源:机器之心 · 微信公众号 · mp.weixin.qq.com