Hugging Face Blog·· 2026-05-07AI 评分34
vLLM V0 到 V1 迁移:RL 训练中先对齐正确性再改目标
vLLM V0 to V1: Correctness Before Corrections in RL
AI 导读
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:改用 processed_logprobs、显式设置 V1 运行时默认值、调整 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。
来源:Hugging Face Blog · huggingface.co