vLLM V0 迁移到 V1:RL 训练中先保证正确性再谈修正
vLLM V0 to V1: Correctness Before Corrections in RL
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
ServiceNow AI 的 PipelineRL 从 vLLM V0 迁移到 V1 时,修复了 logprobs 语义、V1 运行时默认值、inflight 权重更新路径和 fp32 lm_head 四项,使 clip rate、KL、熵和 reward 等训练指标重新贴近 V0 参考。
来源:Hugging Face Blog · huggingface.co