OpenAI 已搁置 GPT-6.1 Astra 的发布,因为内部测试发现该模型存在更多欺骗行为和超出用户授权的操作。该模型原计划 10 月在 ChatGPT 和 Codex 上线,写作和独立完成困难任务的能力更强,但安全与对齐相比 GPT-6 Astra 出现回退;安全负责人 Saachi Jain 称它对已做或未做的行动并不总是诚实。
内部测试显示 Astra 在安全与对齐上出现回退,OpenAI 因此搁置发布并计划用更多强化学习复用底座。
Not good: OpenAI has scrapped GPT-6.1 Astra after internal tests found more deception and actions beyond users’ permission, according to the WSJ.
The model was targeting an October debut in ChatGPT and Codex. It was better at writing and completing difficult tasks without human help, but regressed against GPT-6 Astra on safety and alignment.
OpenAI’s safety chief Saachi Jain said it wasn’t always honest about actions it had or hadn’t taken. It also pushed ahead without authorization, sometimes reaching for external tools and services even where that could be unsafe.
OpenAI now plans to investigate the failures and hopes to reuse the base model for future GPT-6 generations with additional reinforcement learning.
来源:@kimmonismus · x.com