跳到正文

全部动态

今日 2 条
10月26日周四
10月19日周四
10月11日周三
  1. OpenAI News62

    OpenAI 研究:自博弈让模拟 AI 自行学会身体技能

    OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时显式加入这些技能。自博弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自博弈结果,OpenAI 表示对自博弈将成为未来强大 AI 系统的核心部分越来越有信心。

    推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练价值。

9月14日周四
8月16日周三
  1. OpenAI News83

    OpenAI 详解 Dota 2:自对弈如何把系统从远低于人类提升到超人水平

    OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统的可用数据会随着智能体变强而自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。

7月27日周四
7月20日周四
  1. OpenAI News75

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且性能良好,已成为 OpenAI 的默认强化学习算法。

    推荐理由:OpenAI 发布 PPO 强化学习算法,读者可了解它为何成为 OpenAI 默认算法及相比已有方法的简化之处。

7月17日周一
  1. OpenAI News60

    OpenAI 发布可稳定欺骗神经网络分类器的对抗样本图像

    OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定欺骗神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。

    推荐理由:OpenAI 用多尺度多视角仍能骗过分类器的图像,回应了上周关于自动驾驶难以被恶意欺骗的说法。

6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 合作提出从人类偏好中学习的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要什么。OpenAI 称,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标、或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。

6月8日周四
5月16日周二
4月6日周四
4月1日周六
3月24日周五
3月16日周四
12月21日周三
6月21日周二
6月16日周四