跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

124条精选相关主题图像生成AI 视频语音与音频

最新精选

第 121–124 条 · 共 124 条
1月5日周二
  1. OpenAI News80

    OpenAI 发布 CLIP:用自然语言连接文本与图像

    OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:OpenAI 介绍 CLIP 用自然语言监督学习视觉概念,读者可了解零样本视觉分类的思路来源。

4月30日周四
  1. OpenAI News62

    OpenAI 发布音乐生成神经网络 Jukebox

    OpenAI 推出 Jukebox,一个能生成音乐(包括初级人声)的神经网络,以原始音频形式输出,覆盖多种曲风和艺术家风格。OpenAI 同时公开了模型权重和代码,并提供用于试听生成样本的工具。

    推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解其生成原始音频音乐的能力边界。

4月25日周四
  1. OpenAI News62

    OpenAI 发布 MuseNet,可生成 4 分钟多乐器音乐

    OpenAI 发布 MuseNet,这是一个深度神经网络,能生成 4 分钟、包含 10 种乐器的音乐作品,并可融合从乡村到莫扎特再到披头士的多种风格。MuseNet 并未被显式编程音乐知识,而是通过学习预测数十万个 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。

    推荐理由:OpenAI 公开 MuseNet 的生成能力与训练方式,读者可了解其与 GPT-2 同源的技术路线。