Safety Paradox:RLHF 如何制造出它本要预防的 AI 精神病问题
Safety Paradox: How RLHF Creates the AI Psychosis Problem It's Meant to Prevent
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一篇题为《Safety Paradox》的文章提出,RLHF 会制造出它本要预防的 AI 精神病问题。文章认为这一对齐方法在训练中反而催生了相关行为问题,但正文未给出具体模型、参数或实验数据。
来源:promptinjection.net(经 Hacker News) · promptinjection.net