OpenAI 发布 WebGPT:通过网页浏览提升语言模型事实准确率
OpenAI 对 GPT-3 进行微调,使其能借助基于文本的网页浏览器更准确地回答开放式问题。
OpenAI 对 GPT-3 进行微调,使其能借助基于文本的网页浏览器更准确地回答开放式问题。
OpenAI 为 GPT-3 推出微调功能,开发者只需一条命令即可针对自己的应用定制模型。该功能面向需要将 GPT-3 适配特定任务的开发者,具体可用方式与价格尚未在文中披露。
OpenAI 宣布推出 OpenAI Residency,作为其支持和培养 AI 人才努力的一部分。该计划面向有志进入 AI 领域的人才,具体安排与申请细节尚未在公告中披露。
OpenAI 宣布其 API 不再需要等待名单即可使用,官方称更广泛的开放得益于安全方面的进展。
推荐理由:OpenAI API 取消等待名单,读者可据此了解其开放范围与安全进展的关系。
OpenAI 训练了一个求解小学数学应用题的系统,准确率约为微调 GPT-3 模型的两倍。该系统能解出约 90% 的题目数量,在一组 9-12 岁儿童样本上,儿童在同一数据集测试中得分 60%,该系统得分为 55%。
推荐理由:读者可了解该数学应用题求解系统与微调 GPT-3 及小学生的准确率对比,判断其能力位置。
一个跨 12 个时区的团队用 RSICD、UCM 和 Sydney 三个遥感数据集微调了 OpenAI 的 CLIP,让模型支持用文本查询检索卫星图像。RSICD 约含 10,000 张来自 Google Earth、百度地图等的图像,每张最多 5 条描述;训练采用对比学习,并用图像增强与 Marian MT 回译文本增强抑制过拟合。模型已开放下载,并提供在线 demo。
OpenAI 提出用人类反馈来扩展 AI 系统在难以评估任务上的监督能力,并以书籍摘要作为测试场景。该方法针对的是评估困难、无法用简单指标衡量的任务,试图让人类监督在规模上可行。
OpenAI 宣布任命 Helen Toner 为董事会成员。Helen Toner 此前担任乔治城大学安全与新兴技术中心(CSET)战略主管,其任命于今日公布。
OpenAI 发布改进版 Codex,这是其将自然语言转换为代码的 AI 系统。该版本从今天起通过 API 以私测形式开放。
推荐理由:OpenAI 官方公布 Codex 改进版本并开放 API 私测,读者可了解自然语言转代码能力的接入方式。
OpenAI 发布 Triton 1.0,这是一门开源的类 Python 编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,多数情况下能达到专家水平。
推荐理由:OpenAI 开源 Triton 1.0,让没有 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
OpenAI 宣布 2021 届 OpenAI Scholars 已完成为期六个月的导师计划,并在 OpenAI 提供的津贴与支持下完成了开源研究项目。
美国国会议员 Will Hurd 加入 OpenAI 董事会。OpenAI 表示,实现造福全人类的通用人工智能目标,既需要技术专长,也需要公共政策方面的经验。
OpenAI 表示,已有超过 300 款应用通过其 API 使用 GPT-3,提供搜索、对话、文本补全等 AI 功能。
OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以文字、符号还是概念形式呈现,这些神经元都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的概念视觉变体,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。
推荐理由:OpenAI 在 CLIP 中发现对同一概念的多模态神经元,为理解其分类准确性与习得偏见提供线索。
OpenAI 将 Kubernetes 集群扩展至 7,500 节点,为 GPT-3、CLIP、DALL·E 等大模型提供可扩展基础设施,同时支持小规模快速迭代研究。
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 介绍 CLIP 用自然语言监督学习视觉概念,读者可了解零样本视觉分类的思路来源。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 公布 DALL·E 这一从文本生成图像的神经网络,可据此了解文生图方向的早期形态。
OpenAI 发布组织更新,称过去一年公司经历了剧烈变化与增长。原文未披露具体调整内容。
OpenAI 宣布已同意将 GPT-3 授权给 Microsoft,用于其自有产品和服务。
推荐理由:OpenAI 将 GPT-3 授权给 Microsoft 用于其自有产品和服务,读者可据此了解双方早期的技术授权关系。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其在摘要任务上表现更好。
OpenAI Scholars 2020 届学员在线上 Demo Day 展示了最终项目,呈现过去五个多月的研究成果。这是该项目的第三届学员班。
OpenAI 宣布与 AIcrowd、卡内基梅隆大学和 DeepMind 联合举办两场 NeurIPS 2020 竞赛,分别基于 Procgen Benchmark 和 MineRL。
OpenAI 发现,正如在语言上训练的大型 Transformer 能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。研究还建立了样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所含特征可与顶级卷积网络竞争。
推荐理由:原文给出用同一 Transformer 处理像素序列生成图像并做无监督分类的早期思路,可了解生成与表征学习的关联。
OpenAI 发布 API,用于访问 OpenAI 开发的新 AI 模型。
推荐理由:OpenAI 官方发布 API,读者可了解其模型首次以接口形式对外开放这一节点。
OpenAI 发布题为《Language models are few-shot learners》的论文,提出语言模型具备少样本学习能力。
OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类上训练达到同等性能的神经网络所需算力每 16 个月减少一半。与 2012 年相比,如今训练到 AlexNet 水平所需的算力减少了 44 倍,而同期摩尔定律带来的成本改善约为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。
OpenAI 推出 Jukebox,一个能生成音乐(包括初级人声)的神经网络,以原始音频形式输出,覆盖多种曲风和艺术家风格。OpenAI 同时公开了模型权重和代码,并提供用于试听生成样本的工具。
推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解其生成原始音频音乐的能力边界。
OpenAI 参与撰写的多利益相关方报告提出 10 项机制,用于提升 AI 系统相关声明的可验证性。该报告由 30 家机构的 58 位合著者共同完成,涵盖 Centre for the Future of Intelligence、Mila、Schwartz Reisman Institute for Technology and Society 等。
OpenAI 推出 Microscope,一个收录八个视觉"模式生物"模型中每个重要层与神经元可视化的工具集。它让研究者更易分析这些神经网络内部形成的特征,以推动对复杂系统的理解。
OpenAI 宣布将其深度学习框架标准化为 PyTorch。
OpenAI 发布关于神经语言模型缩放定律的研究,探讨模型性能与规模之间的关系。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,标题为 Dota 2 with large scale deep reinforcement learning,正文内容未能获取。
OpenAI 发现双重下降现象在 CNN、ResNet 和 Transformer 中普遍存在:随着模型规模、数据量或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但其成因尚不完全清楚,OpenAI 将其视为重要研究方向。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具。该套件面向在训练过程中尊重安全约束的强化学习智能体,提供相应的环境和工具来度量其进展。
OpenAI 发布 GPT-2 分阶段发布的最后一个版本,即参数量 1.5B 的最大版本,并公开代码与模型权重,以便检测 GPT-2 模型的输出。OpenAI 表示,尽管自 8 月以来已有更大的语言模型发布,仍按原定分阶段发布计划推进,为社区提供一个完整分阶段发布流程的测试案例。
推荐理由:OpenAI 以分阶段发布收尾,公开 GPT-2 最大版本与权重,为后续强模型的负责任发布提供参照。
OpenAI 训练了一对神经网络,让类人机械手解开魔方。两个网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要高灵巧度的物理世界问题。
推荐理由:OpenAI 用仿真训练加自动域随机化让机械手解魔方,可了解强化学习迁移到物理操作任务的思路。
OpenAI 已开放第三期 OpenAI Scholars 项目的申请。该项目此前已举办两期,此次面向 2020 年度的招募现已启动。
OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,尽管这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接从输入中整句复制的内容,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何让模型学会复制而非改写。