跳到正文
原文
Hugging Face Blog·· 2026-01-27AI 评分38

解锁 GPT-OSS 的 Agentic RL 训练:一次实践复盘

Unlocking Agentic RL Training for GPT-OSS: A Practical Retrospective

AI 导读

Hugging Face 博客复盘了用 verl 框架对 GPT-OSS-20B 做 Agentic RL 训练时遇到的问题:训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双次前向传播导致新旧 log-prob 不匹配,使 PPO 的 importance sampling ratio 偏离 1。

来源:Hugging Face Blog · huggingface.co