Hugging Face Blog·· 2025-04-26精选AI 评分60
ServiceNow 开源 PipelineRL:用 inflight 权重更新加速 LLM 强化学习
PipelineRL
AI 导读
ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。
推荐理由
ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。
来源:Hugging Face Blog · huggingface.co