OpenAI 发布 CLIP:用自然语言连接文本与图像
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 介绍 CLIP 用自然语言监督学习视觉概念,读者可了解零样本视觉分类的思路来源。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 介绍 CLIP 用自然语言监督学习视觉概念,读者可了解零样本视觉分类的思路来源。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 公布 DALL·E 这一从文本生成图像的神经网络,可据此了解文生图方向的早期形态。
OpenAI 推出 Jukebox,一个能生成音乐(包括初级人声)的神经网络,以原始音频形式输出,覆盖多种曲风和艺术家风格。OpenAI 同时公开了模型权重和代码,并提供用于试听生成样本的工具。
推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解其生成原始音频音乐的能力边界。
OpenAI 发布 MuseNet,这是一个深度神经网络,能生成 4 分钟、包含 10 种乐器的音乐作品,并可融合从乡村到莫扎特再到披头士的多种风格。MuseNet 并未被显式编程音乐知识,而是通过学习预测数十万个 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。
推荐理由:OpenAI 公开 MuseNet 的生成能力与训练方式,读者可了解其与 GPT-2 同源的技术路线。