跳到正文
Redwood Research Blog· Alex Mallen·· 4 天前AI 评分45

Redwood Research:能力研究同样在扩展安全-有用性帕累托前沿

Capabilities research expands the safety-usefulness Pareto frontier too

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Redwood Research 发文指出,将安全研究定义为"在不显著增加成本或降低有用性的前提下让 AI 部署更安全"存在缺陷,因为按此定义几乎所有能力研究都算安全研究,例如推理性能优化让更弱更安全的模型被更广泛使用。文章认为开发者必须在帕累托前沿上选点,安全研究通常引导其选择更高安全,能力研究则相反;但在政治意愿远高于当下的未来情境中,某些能力研究可能成为提升安全的有效方式。

来源:Redwood Research Blog · blog.redwoodresearch.org