OpenAI News·· 2018-04-18AI 评分42
OpenAI 发布 Evolved Policy Gradients 元学习方法
Evolved Policy Gradients
AI 导读
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体可在测试时完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。
来源:OpenAI News · openai.com