Alignment 预训练:AI 话语如何制造自我实现的(错误)对齐
Alignment pretraining: AI discourse creates self-fulfilling (mis)alignment
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
讨论指出,关于 AI 对齐的公共话语本身会塑造模型行为,形成自我实现的(错误)对齐,即 Alignment 预训练阶段就已埋下偏差。该观点在 Hacker News 引发 20 分、10 条评论的关注。
来源:arxiv.org(经 Hacker News) · arxiv.org