OpenAI 首届黑客松活动报告
OpenAI 于 3 月 3 日举办了首届黑客松,共有 100 名人工智能社区成员参与。
OpenAI 于 3 月 3 日举办了首届黑客松,共有 100 名人工智能社区成员参与。
OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、对其执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是将 Shortest Descent 算法应用于元学习场景,数学上与一阶 MAML 相似,只需对 SGD 或 Adam 等优化器进行黑盒访问,计算效率与性能相近。
OpenAI 启动 Scholars 项目,为来自 underrepresented 群体的个人提供 6–10 份津贴和导师指导,支持其全职学习深度学习 3 个月并开源一个项目。
OpenAI 发布八个模拟机器人环境及 Hindsight Experience Replay 的 Baselines 实现,均为过去一年研究开发,并已用于训练可迁移到实体机器人的模型。同时发布一组机器人研究课题请求。
OpenAI 将于 3 月 3 日(周六)在旧金山 Mission District 办公室举办演讲与 hackathon 活动。
OpenAI 宣布迎来新的捐赠者加入支持者行列。原文未披露捐赠者身份、金额或具体用途等细节。
OpenAI 与未来人类研究所、存在风险研究中心、新美国安全中心、电子前沿基金会等机构合作,共同撰写了一篇论文,预测恶意行为者可能如何滥用 AI 技术,以及可以预防和缓解这些威胁的潜在方法。该论文是双方近一年持续合作的成果。
推荐理由:OpenAI 与多家机构合作近一年,梳理 AI 被恶意滥用的可能路径与防范思路。
OpenAI 设计了一种让 AI 互相教学的方法,所选取的示例同样能被人类理解。该方法自动挑选最具信息量的示例来教授某个概念,例如用最适合描述"狗"这一概念的图像,实验显示其对 AI 教学有效。
OpenAI 构建了一套实体消歧系统,通过神经网络判断一个词是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定该词指代的是哪个对象。
OpenAI 发布 Requests for Research 2.0,公布其在研究过程中遇到的七个未解问题。这是继此前版本之后的新一批问题清单,面向研究社区公开。
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU kernel,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。OpenAI 表示已用这些 kernel 在文本情感分析和文本、图像生成建模上取得当时的最优结果。
推荐理由:OpenAI 公开面向块稀疏权重网络的 GPU kernel,并给出相对 cuBLAS 与 cuSPARSE 的加速幅度和落地任务。
OpenAI 开发出一种分层强化学习算法,能学习对求解多类任务有用的高层动作,从而快速解决需要数千个 timestep 的任务。在一组导航问题上,该算法发现了向不同方向行走和爬行的高层动作集合,使智能体能够快速掌握新的导航任务。
OpenAI 最新机器人技术让完全在模拟中训练的控制器部署到实体机器人后,能应对环境中的意外变化并完成简单任务。与以往的开环系统不同,这些技术构建的是闭环系统。
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体可快速击败更强的非元学习智能体,并能适应自身物理故障。
OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时显式加入这些技能。自博弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自博弈结果,OpenAI 表示对自博弈将成为未来强大 AI 系统的核心部分越来越有信心。
推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练价值。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习,从而在迭代囚徒困境中发现"以牙还牙"这类既自利又合作的策略。OpenAI 称这是迈向能够建模他方心智的智能体的一小步。
OpenAI Baselines 发布 ACKTR 和 A2C 两个新实现。A2C 是 A3C 的同步确定性变体,性能与之相当;ACKTR 比 TRPO 和 A2C 更具样本效率,每次更新仅比 A2C 略多计算量。
OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统的可用数据会随着智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的机器人在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶尖职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出在标准赛制 1v1 中击败顶尖选手的 Dota 2 机器人,可作为复杂环境中目标导向 AI 的早期样本。
OpenAI 开源了 RL-Teacher,这是其通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术为迈向安全 AI 系统而开发,也适用于奖励难以明确指定的强化学习问题。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声(参数噪声)往往能提升性能。该方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且性能良好,已成为 OpenAI 的默认强化学习算法。
推荐理由:OpenAI 发布 PPO 强化学习算法,读者可了解它为何成为 OpenAI 默认算法及相比已有方法的简化之处。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定欺骗神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。
推荐理由:OpenAI 用多尺度多视角仍能骗过分类器的图像,回应了上周关于自动驾驶难以被恶意欺骗的说法。
OpenAI 开源了一个基于 MuJoCo 引擎的高性能 Python 机器人仿真库,该库在其过去一年的机器人研究中开发完成。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要什么。OpenAI 称,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标、或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
OpenAI 发文指出,智能体争夺资源的多智能体环境是通往 AGI 的踏脚石。这类环境具备两个有用特性:难度由竞争对手的水平决定,与自身克隆体竞争时难度恰好匹配自身水平;同时不存在稳定均衡,智能体再聪明也始终面临变得更聪明的压力。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在接下来几个月内陆续放出。
推荐理由:OpenAI 开源内部强化学习复现项目 Baselines,首批放出 DQN 及三个变体,可了解其复现思路与后续发布节奏。
OpenAI 发布一套机器人系统,完全在仿真环境中训练后部署到实体机器人上,能够在看过一次示范后学会一项新任务。
推荐理由:OpenAI 早期机器人研究,展示仿真训练后迁移到实体机器人并实现单次示范学习新任务。
OpenAI 发布开源机器人仿真软件 Roboschool,并已集成到 OpenAI Gym 中。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论中的下一个字符进行训练,就学到了出色的情感表征。该系统无需情感标注数据,即可在文本中捕捉情感信息。
OpenAI 称已打造出全球首个完全在仿真环境中训练、并部署到实体机器人上的垃圾邮件检测 AI。该系统将仿真训练与物理机器人部署结合,用于在物理世界中进行垃圾邮件检测。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)技术相媲美,同时克服了 RL 的诸多不便。
OpenAI 宣布支持 Distill 上线,这是一本旨在出色传播机器学习成果(无论新成果还是已有成果)的新型期刊。
OpenAI 发布一项新研究,介绍智能体在其中发展出自己的语言。该帖仅给出研究概要,未提供完整正文。
OpenAI 发文解释对抗样本——攻击者刻意设计、能让机器学习模型出错的输入,相当于机器的视觉错觉。文章展示了对抗样本在不同媒介上的表现,并讨论了为何防御这类攻击十分困难。
OpenAI 团队现已达到 45 人,正共同推进 AI 能力前沿,包括验证新想法、构建新软件系统以及在机器人上部署机器学习。
OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式出现故障。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 发布 Universe 平台,读者可了解其用游戏与网站训练和衡量 AI 通用智能的定位。
OpenAI 正与 Microsoft 合作,将其大部分大规模实验放到 Azure 上运行。
OpenAI 上周在其办公室举办了首届机器学习自组织会议,超过 150 名 AI 从业者参加。