跳到正文
Hugging Face Blog·· 2026-05-07AI 评分53

vLLM V0 迁移到 V1:RL 训练中先保证正确性再谈修正

vLLM V0 to V1: Correctness Before Corrections in RL

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

ServiceNow AI 的 PipelineRL 从 vLLM V0 迁移到 V1 时,修复了 logprobs 语义、V1 运行时默认值、inflight 权重更新路径和 fp32 lm_head 四项,使 clip rate、KL、熵和 reward 等训练指标重新贴近 V0 参考。

来源:Hugging Face Blog · huggingface.co