跳到正文
原文
Hugging Face Blog·· 2025-04-26精选AI 评分60

ServiceNow 开源 PipelineRL:用 inflight 权重更新加速 LLM 强化学习

PipelineRL

AI 导读

ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。

推荐理由

ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。

来源:Hugging Face Blog · huggingface.co