跳到正文
原文
OpenAI News·· 2018-04-18AI 评分42

OpenAI 发布 Evolved Policy Gradients 元学习方法

Evolved Policy Gradients

AI 导读

OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体可在测试时完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。

来源:OpenAI News · openai.com