Redwood Research 提出不可信建议协议:短而强的建议显著提升弱模型表现
Untrusted advice for AI control: Short, strong advice significantly uplifts weak LLMs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Redwood Research 提出不可信建议协议,由可信执行模型执行所有动作,不可信模型只能通过受限信道发送简短建议。
来源:Redwood Research Blog · blog.redwoodresearch.org