跳到正文
@perplexity_ai· @perplexity_ai · X·· 14 天前AI 评分20
AI 导读

在合成环境中进行强化学习后,我们会用真实世界的会话进行训练,这些会话会暴露出超出我们预设场景的失败情况。 我们的采样流程会排除包含个人身份信息(PII)的会话,以及已选择退出训练的用户会话。

正文

After reinforcement learning in synthetic environments, we train on real-world sessions that expose failures beyond our designed scenarios.

Our sampling pipeline excludes sessions with personally identifiable information (PII) and sessions from users who opted out of training.

来源:@perplexity_ai · x.com