跳到正文
@OpenAI· @openai · X·· 2026-05-09AI 评分49
AI 导读

思维链监控是防御 AI 智能体失准的关键防线。为保持可监控性,我们在 RL 中避免惩罚失准的推理。 我们发现存在少量意外的 CoT 评分,影响了已发布的模型,现分享我们的分析。 alignment.openai.com/acciden…

正文

Chain of thought monitors are a key layer of defense against AI agent misalignment. To preserve monitorability, we avoid penalizing misaligned reasoning during RL.

We found a limited amount of accidental CoT grading which affected released models, and are sharing our analysis.

alignment.openai.com/acciden…

来源:@OpenAI · x.com