OpenAI 打造在 Dota 2 1v1 中击败顶尖选手的机器人
OpenAI 宣布其打造的机器人在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶尖职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出在标准赛制 1v1 中击败顶尖选手的 Dota 2 机器人,可作为复杂环境中目标导向 AI 的早期样本。
OpenAI 宣布其打造的机器人在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶尖职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出在标准赛制 1v1 中击败顶尖选手的 Dota 2 机器人,可作为复杂环境中目标导向 AI 的早期样本。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声(参数噪声)往往能提升性能。该方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定欺骗神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。
推荐理由:OpenAI 用多尺度多视角仍能骗过分类器的图像,回应了上周关于自动驾驶难以被恶意欺骗的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要什么。OpenAI 称,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标、或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
OpenAI 发文指出,智能体争夺资源的多智能体环境是通往 AGI 的踏脚石。这类环境具备两个有用特性:难度由竞争对手的水平决定,与自身克隆体竞争时难度恰好匹配自身水平;同时不存在稳定均衡,智能体再聪明也始终面临变得更聪明的压力。
OpenAI 发布一套机器人系统,完全在仿真环境中训练后部署到实体机器人上,能够在看过一次示范后学会一项新任务。
推荐理由:OpenAI 早期机器人研究,展示仿真训练后迁移到实体机器人并实现单次示范学习新任务。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论中的下一个字符进行训练,就学到了出色的情感表征。该系统无需情感标注数据,即可在文本中捕捉情感信息。
OpenAI 称已打造出全球首个完全在仿真环境中训练、并部署到实体机器人上的垃圾邮件检测 AI。该系统将仿真训练与物理机器人部署结合,用于在物理世界中进行垃圾邮件检测。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)技术相媲美,同时克服了 RL 的诸多不便。
OpenAI 发布一项新研究,介绍智能体在其中发展出自己的语言。该帖仅给出研究概要,未提供完整正文。
OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式出现故障。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了 Google Brain 主导的论文《Concrete Problems in AI Safety》,该论文探讨了确保现代机器学习系统按预期运行的诸多研究问题。
OpenAI 介绍了四个围绕生成模型的项目,生成模型是机器学习中无监督学习技术的一个分支。文章同时解释了生成模型是什么、为何重要,以及它们可能的发展方向。