OpenAI 举办 2019 机器人研讨会
OpenAI 于 2019 年 4 月 27 日举办了首届 OpenAI Robotics Symposium。
OpenAI 于 2019 年 4 月 27 日举办了首届 OpenAI Robotics Symposium。
OpenAI Scholars 2019 届八位学者完成最终项目,并在 OpenAI 举办的 Scholars Demo Day 上展示。这是该项目的第二届结业班。
OpenAI Fellows 第二批学员完成 6 个月学徒期,从机器学习初学者成长为 OpenAI 核心贡献者,并已提交最终项目。OpenAI Fellows Summer 2019 的申请正在滚动审核中。
OpenAI 发布 MuseNet,这是一个深度神经网络,能生成 4 分钟、包含 10 种乐器的音乐作品,并可融合从乡村到莫扎特再到披头士的多种风格。MuseNet 并未被显式编程音乐知识,而是通过学习预测数十万个 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。
推荐理由:OpenAI 公开 MuseNet 的生成能力与训练方式,读者可了解其与 GPT-2 同源的技术路线。
OpenAI 开发了 Sparse Transformer,这是一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过对注意力机制做算法改进,从比以往长 30 倍的序列中提取模式。
推荐理由:OpenAI 用稀疏注意力把序列建模长度提升 30 倍,可了解长序列建模的早期技术路线。
OpenAI Five 成为首个在电竞游戏中击败世界冠军的 AI,本周末在 Finals 上连续两局战胜 Dota 2 世界冠军战队 OG。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下击败优秀职业选手,但在公开职业比赛中落败,这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:OpenAI Five 在直播中击败 Dota 2 世界冠军 OG,可了解 AI 在电竞对抗中的里程碑节点。
OpenAI 将于 4 月 13 日太平洋时间上午 11:30 举办 OpenAI Five 的最后一场线下活动。
OpenAI 在能量模型(EBM)的稳定可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时通过投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 公布 2019 届 Scholars 名单,8 位学者从 550 名申请者中入选。他们的专业背景涵盖文学、哲学、细胞生物学、统计学、经济学、量子物理和商业创新。
OpenAI 宣布成立 OpenAI LP,一家采用 capped-profit(利润上限)结构的新公司,目的是在快速增加算力与人才投入的同时,通过制衡机制推进其使命。
推荐理由:OpenAI 官方说明其营利实体采用利润上限结构,读者可据此理解该组织在算力与人才投入上的制度安排。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表内容的新技术。随着 AI 系统被部署到日益敏感的场景,更好地理解其内部决策过程有助于识别弱点和调查失败原因。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境,支持在持久、开放式的任务中容纳大量且数量可变的智能体。该平台引入众多智能体与物种,带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 于 2 月 2 日举办了首届 Spinning Up 研讨会,这是其新教育计划的一部分。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保 AI 对齐算法在真实人类参与时有效。论文认为,将先进 AI 系统与人类价值观正确对齐,需解决人类理性、情感与偏见心理学相关的诸多不确定性。OpenAI 计划招聘社会科学家全职从事这一方向的研究。
OpenAI 训练了一个大规模无监督语言模型,能够生成连贯的段落文本,在多项语言建模基准上取得当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 公布一个无监督语言模型在多项语言任务上取得当时最优表现,可了解大模型早期路线。
OpenAI 首期 Fellows 项目结业,每位学员在 6 个月学徒期内从机器学习初学者成长为 OpenAI 的核心贡献者。
OpenAI 发现梯度噪声尺度这一统计指标可预测神经网络训练在多种任务上的可并行性。复杂任务的梯度噪声更大,因此未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。该结果还表明,神经网络训练并非神秘技艺,而是可以被严谨化和系统化。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的能力,并已帮助厘清强化学习领域一个长期存在的难题。该环境在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但仍对当前最先进算法构成值得一试的泛化挑战。
OpenAI 发布深度强化学习教育资源 Spinning Up in Deep RL,旨在让任何人都能学习成为深度强化学习的熟练实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 开发了一种基于能量的模型,仅需五次演示就能学会识别和生成以 2D 点集表达的概念,如 near、above、between、closest 和 furthest。该模型还展示了跨域迁移能力:在 2D 粒子环境中学习的概念可用于解决 3D 物理机器人任务。
OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境。该方法首次在 Montezuma's Revenge 上超越人类平均表现。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过将复杂任务分解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处于极早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它可能成为可扩展的 AI 安全方案。
OpenAI 开放第二届 OpenAI Scholars 项目申请,面向代表性不足群体提供 6–10 个津贴与导师指导名额,入选者可全职学习深度学习 3 个月并开源一个项目。
OpenAI 开始接受 2019 年 Fellows 与 Interns 申请,其中 Fellows 为冬季项目、Interns 为夏季项目。原文未披露申请截止时间、名额、薪酬或具体研究方向等细节。
OpenAI Scholars 2018 首批学员已完成该项目。这是 OpenAI Scholars 的首期 cohort,学员在结业时提交了最终项目。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两场比赛均告负,但在两场的前 20–35 分钟内都保持着较高的获胜机会。
OpenAI Five 在一场三局两胜的比赛中击败了由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人曾打过职业 Dota。比赛在直播观众和 10 万名同时在线观看者面前进行。
OpenAI 训练出一只类人机械手,能以史无前例的灵巧度操控实体物体。
OpenAI 首届 Scholars 项目已启动,一批经验丰富的软件开发者正在该项目中转型为机器学习从业者。
OpenAI Five Benchmark 比赛已结束。该消息由 OpenAI 发布,正文未披露更多细节。
OpenAI 发布可逆生成模型 Glow,采用可逆 1x1 卷积,在简化此前可逆生成模型架构的同时支持生成高分辨率图像和高效采样,并能发现可用于操控数据属性的特征。OpenAI 同时开放该模型的代码和一个在线可视化工具,供人们探索并在此基础上继续开发。
推荐理由:OpenAI 介绍可逆生成模型 Glow 的架构简化思路,并开放代码与可视化工具供复现探索。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行多局游戏,并用 PPO 优化游戏得分,PPO 也是 OpenAI Five 所依赖的强化学习算法。
推荐理由:OpenAI 用单次人类演示加 PPO 在 Montezuma's Revenge 上取得 74,500 分,可了解其从演示状态起步的训练思路。
OpenAI 宣布其由五个神经网络组成的 OpenAI Five 已开始在 Dota 2 中击败业余人类战队。
OpenAI 首届 Retro Contest 已完成,该比赛旨在探索能够从过往经验中泛化迁移的算法。
OpenAI 用 Transformer 与无监督预训练结合的可扩展、任务无关系统,在一组多样化的语言任务上取得当时最优结果,并对外发布了该系统。这一结果说明监督学习方法与无监督预训练搭配效果很好,作者希望它推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了可扩展的任务无关系统。
OpenAI 开放 2018 秋季班 OpenAI Fellows 申请,该项目提供为期 6 个月、带薪酬的 AI 研究学徒岗位。
OpenAI 发布强化学习游戏平台 Gym Retro 的完整版,公开游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的 1000 多款游戏。同时发布的还有用于向该平台添加新游戏的工具。
推荐理由:OpenAI 把强化学习游戏平台从约百款扩展到 1000 多款,并公开添加新游戏的工具,可据此判断其覆盖范围与可扩展性。
OpenAI 发布一项分析,指出自 2012 年以来,最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。同一时期该指标增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断胜负。该方法旨在借助辩论提升 AI 系统的安全性。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体可在测试时完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。