OpenAI Five 击败 Dota 2 世界冠军 OG
OpenAI Five 成为首个在电竞游戏中击败世界冠军的 AI,本周末在 Finals 上连续两局战胜 Dota 2 世界冠军战队 OG。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下击败优秀职业选手,但在公开职业比赛中落败,这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:OpenAI Five 在直播中击败 Dota 2 世界冠军 OG,可了解 AI 在电竞对抗中的里程碑节点。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI Five 成为首个在电竞游戏中击败世界冠军的 AI,本周末在 Finals 上连续两局战胜 Dota 2 世界冠军战队 OG。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下击败优秀职业选手,但在公开职业比赛中落败,这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:OpenAI Five 在直播中击败 Dota 2 世界冠军 OG,可了解 AI 在电竞对抗中的里程碑节点。
OpenAI 宣布成立 OpenAI LP,一家采用 capped-profit(利润上限)结构的新公司,目的是在快速增加算力与人才投入的同时,通过制衡机制推进其使命。
推荐理由:OpenAI 官方说明其营利实体采用利润上限结构,读者可据此理解该组织在算力与人才投入上的制度安排。
OpenAI 训练了一个大规模无监督语言模型,能够生成连贯的段落文本,在多项语言建模基准上取得当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 公布一个无监督语言模型在多项语言任务上取得当时最优表现,可了解大模型早期路线。
OpenAI Five 在一场三局两胜的比赛中击败了由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人曾打过职业 Dota。比赛在直播观众和 10 万名同时在线观看者面前进行。
OpenAI 发布可逆生成模型 Glow,采用可逆 1x1 卷积,在简化此前可逆生成模型架构的同时支持生成高分辨率图像和高效采样,并能发现可用于操控数据属性的特征。OpenAI 同时开放该模型的代码和一个在线可视化工具,供人们探索并在此基础上继续开发。
推荐理由:OpenAI 介绍可逆生成模型 Glow 的架构简化思路,并开放代码与可视化工具供复现探索。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行多局游戏,并用 PPO 优化游戏得分,PPO 也是 OpenAI Five 所依赖的强化学习算法。
推荐理由:OpenAI 用单次人类演示加 PPO 在 Montezuma's Revenge 上取得 74,500 分,可了解其从演示状态起步的训练思路。
OpenAI 宣布其由五个神经网络组成的 OpenAI Five 已开始在 Dota 2 中击败业余人类战队。
OpenAI 用 Transformer 与无监督预训练结合的可扩展、任务无关系统,在一组多样化的语言任务上取得当时最优结果,并对外发布了该系统。这一结果说明监督学习方法与无监督预训练搭配效果很好,作者希望它推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了可扩展的任务无关系统。
OpenAI 发布强化学习游戏平台 Gym Retro 的完整版,公开游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的 1000 多款游戏。同时发布的还有用于向该平台添加新游戏的工具。
推荐理由:OpenAI 把强化学习游戏平台从约百款扩展到 1000 多款,并公开添加新游戏的工具,可据此判断其覆盖范围与可扩展性。
OpenAI 发布一项分析,指出自 2012 年以来,最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。同一时期该指标增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。
OpenAI 与未来人类研究所、存在风险研究中心、新美国安全中心、电子前沿基金会等机构合作,共同撰写了一篇论文,预测恶意行为者可能如何滥用 AI 技术,以及可以预防和缓解这些威胁的潜在方法。该论文是双方近一年持续合作的成果。
推荐理由:OpenAI 与多家机构合作近一年,梳理 AI 被恶意滥用的可能路径与防范思路。
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU kernel,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。OpenAI 表示已用这些 kernel 在文本情感分析和文本、图像生成建模上取得当时的最优结果。
推荐理由:OpenAI 公开面向块稀疏权重网络的 GPU kernel,并给出相对 cuBLAS 与 cuSPARSE 的加速幅度和落地任务。
OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时显式加入这些技能。自博弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自博弈结果,OpenAI 表示对自博弈将成为未来强大 AI 系统的核心部分越来越有信心。
推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练价值。
OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统的可用数据会随着智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的机器人在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶尖职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出在标准赛制 1v1 中击败顶尖选手的 Dota 2 机器人,可作为复杂环境中目标导向 AI 的早期样本。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且性能良好,已成为 OpenAI 的默认强化学习算法。
推荐理由:OpenAI 发布 PPO 强化学习算法,读者可了解它为何成为 OpenAI 默认算法及相比已有方法的简化之处。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定欺骗神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。
推荐理由:OpenAI 用多尺度多视角仍能骗过分类器的图像,回应了上周关于自动驾驶难以被恶意欺骗的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要什么。OpenAI 称,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标、或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在接下来几个月内陆续放出。
推荐理由:OpenAI 开源内部强化学习复现项目 Baselines,首批放出 DQN 及三个变体,可了解其复现思路与后续发布节奏。
OpenAI 发布一套机器人系统,完全在仿真环境中训练后部署到实体机器人上,能够在看过一次示范后学会一项新任务。
推荐理由:OpenAI 早期机器人研究,展示仿真训练后迁移到实体机器人并实现单次示范学习新任务。