跳到正文
原文
Hugging Face Blog·· 2022-08-05AI 评分22

Hugging Face 深度强化学习课程:PPO(Proximal Policy Optimization)详解与 PyTorch 实现

Proximal Policy Optimization (PPO)

AI 导读

Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),通过将新旧策略的概率比裁剪在 [1−ϵ, 1+ϵ] 区间内,避免策略更新过大,从而提升训练稳定性。文中用 PyTorch 从零实现 PPO,并在 CartPole-v1 和 LunarLander-v2 上验证。

来源:Hugging Face Blog · huggingface.co