OpenAI 开源 RL-Teacher:用人类反馈训练 AI
OpenAI 开源了 RL-Teacher,这是其通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术为迈向安全 AI 系统而开发,也适用于奖励难以明确指定的强化学习问题。
OpenAI 开源了 RL-Teacher,这是其通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术为迈向安全 AI 系统而开发,也适用于奖励难以明确指定的强化学习问题。
OpenAI 开源了一个基于 MuJoCo 引擎的高性能 Python 机器人仿真库,该库在其过去一年的机器人研究中开发完成。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在接下来几个月内陆续放出。
推荐理由:OpenAI 开源内部强化学习复现项目 Baselines,首批放出 DQN 及三个变体,可了解其复现思路与后续发布节奏。
OpenAI 发布开源机器人仿真软件 Roboschool,并已集成到 OpenAI Gym 中。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 发布 Universe 平台,读者可了解其用游戏与网站训练和衡量 AI 通用智能的定位。
OpenAI 发布 OpenAI Gym 公测版,这是一个用于开发和对比强化学习(RL)算法的工具包。它包含一套持续扩充的环境(从模拟机器人到 Atari 游戏),以及一个用于对比和复现结果的站点。
推荐理由:OpenAI 公开了强化学习算法开发与对比工具包的测试版,读者可了解其环境套件与结果复现入口。