跳到正文
原文
OpenAI News·· 2016-12-21AI 评分22

OpenAI 探讨强化学习中的奖励函数设定错误

Faulty reward functions in the wild

AI 导读

OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式出现故障。

来源:OpenAI News · openai.com