跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

117条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–117 条 · 共 117 条
2月15日周四
  1. OpenAI News83

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 发布研究,探索在视频数据上大规模训练生成模型,联合在可变时长、分辨率和宽高比的视频与图像上训练文本条件扩散模型,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果表明扩展视频生成模型是构建通用物理世界模拟器的一条有前景的路径。

    推荐理由:OpenAI 首次公开 Sora 的技术路线,说明视频生成模型可扩展为物理世界模拟器。

11月6日周一
9月25日周一
9月18日周一
  1. Hugging Face Blog62

    3D Gaussian Splatting 入门:原理、训练流程与图形学前景

    Hugging Face 博客发布 3D Gaussian Splatting 入门介绍,说明这是一种从少量图像学习逼真场景并实时渲染的栅格化技术。文章拆解了完整流程:先用 COLMAP 做 Structure from Motion 估计点云,再把每个点转成高斯并训练,训练中通过可微高斯栅格化计算损失,并按梯度大小自动分裂、克隆或剪枝高斯。

    推荐理由:文章把 3D Gaussian Splatting 的流程拆成可理解的步骤,并列出显存、磁盘与渲染管线兼容性等实际限制。

8月22日周二
  1. Hugging Face Blog75

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,接受任意图像与文本序列输入并生成文本,提供 9B 和 80B 两个参数规模及对应的 instruct 版本。

    推荐理由:Hugging Face 复现了未开源的 Flamingo,并公开训练数据、技术教训与红队评估过程,读者可据此了解开源多模态模型的复现路径。

3月14日周二
  1. OpenAI News92

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在许多真实场景中能力不及人类,但在多项专业和学术基准上达到人类水平。

    推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解这一代模型的能力边界。

  2. OpenAI News90

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4,可生成、编辑并与用户迭代完成创意与技术写作任务,例如创作歌曲、撰写剧本,或学习用户的写作风格。

    推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑与迭代能力。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 发布 ViT 与 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。

2月15日周三
12月16日周五
12月15日周三
3月4日周四
  1. OpenAI News60

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以文字、符号还是概念形式呈现,这些神经元都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的概念视觉变体,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。

    推荐理由:OpenAI 在 CLIP 中发现对同一概念的多模态神经元,为理解其分类准确性与习得偏见提供线索。

1月5日周二
  1. OpenAI News80

    OpenAI 发布 CLIP:用自然语言连接文本与图像

    OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:OpenAI 介绍 CLIP 用自然语言监督学习视觉概念,读者可了解零样本视觉分类的思路来源。

4月30日周四
  1. OpenAI News62

    OpenAI 发布音乐生成神经网络 Jukebox

    OpenAI 推出 Jukebox,一个能生成音乐(包括初级人声)的神经网络,以原始音频形式输出,覆盖多种曲风和艺术家风格。OpenAI 同时公开了模型权重和代码,并提供用于试听生成样本的工具。

    推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解其生成原始音频音乐的能力边界。

4月25日周四
  1. OpenAI News62

    OpenAI 发布 MuseNet,可生成 4 分钟多乐器音乐

    OpenAI 发布 MuseNet,这是一个深度神经网络,能生成 4 分钟、包含 10 种乐器的音乐作品,并可融合从乡村到莫扎特再到披头士的多种风格。MuseNet 并未被显式编程音乐知识,而是通过学习预测数十万个 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。

    推荐理由:OpenAI 公开 MuseNet 的生成能力与训练方式,读者可了解其与 GPT-2 同源的技术路线。