Hugging Face Blog·· 2025-05-25AI 评分10
Liger GRPO 与 TRL 集成:Qwen2.5-0.5B-Instruct 在 DeepSpeed ZeRO3 下报形状不匹配
🐯 Liger GRPO meets TRL
AI 导读
用户反馈在 TRL 中使用 Liger GRPO loss 配合 DeepSpeed ZeRO3 训练 Qwen/Qwen2.5-0.5B-Instruct(bf16)时出现形状不匹配错误,报错栈指向 liger_kernel 的 chunked_loss/grpo_loss.py 与 fused_linear_ppo.py。
来源:Hugging Face Blog · huggingface.co