AI 导读
在合成环境中进行强化学习后,我们会用真实世界的会话进行训练,这些会话会暴露出超出我们预设场景的失败情况。 我们的采样流程会排除包含个人身份信息(PII)的会话,以及已选择退出训练的用户会话。
正文
After reinforcement learning in synthetic environments, we train on real-world sessions that expose failures beyond our designed scenarios.
Our sampling pipeline excludes sessions with personally identifiable information (PII) and sessions from users who opted out of training.
来源:@perplexity_ai · x.com