跳到正文
原文
Hugging Face Blog·· 2025-05-25AI 评分10

Liger GRPO 与 TRL 集成:Qwen2.5-0.5B-Instruct 在 DeepSpeed ZeRO3 下报形状不匹配

🐯 Liger GRPO meets TRL

AI 导读

用户反馈在 TRL 中使用 Liger GRPO loss 配合 DeepSpeed ZeRO3 训练 Qwen/Qwen2.5-0.5B-Instruct(bf16)时出现形状不匹配错误,报错栈指向 liger_kernel 的 chunked_loss/grpo_loss.py 与 fused_linear_ppo.py。

来源:Hugging Face Blog · huggingface.co