跳到正文
原文
Hugging Face Blog·· 2022-06-30AI 评分22

Hugging Face 深度强化学习课程:用 PyTorch 实现 Policy Gradient

Policy Gradient with PyTorch

AI 导读

Hugging Face 深度强化学习课程第 5 单元讲解 Policy-Based 方法中的 Policy Gradient,并从头用 PyTorch 实现首个策略梯度算法 Reinforce。

来源:Hugging Face Blog · huggingface.co