跳到正文
原文
OpenAI News·· 2018-07-04精选AI 评分62

OpenAI 从单次演示中学会 Montezuma's Revenge

Learning Montezuma’s Revenge from a single demonstration

AI 导读

OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行多局游戏,并用 PPO 优化游戏得分,PPO 也是 OpenAI Five 所依赖的强化学习算法。

推荐理由

OpenAI 用单次人类演示加 PPO 在 Montezuma's Revenge 上取得 74,500 分,可了解其从演示状态起步的训练思路。

来源:OpenAI News · openai.com