OpenAI 为微调 API 引入视觉能力
OpenAI 宣布开发者现在可以用图像和文本对 GPT-4o 进行微调,以提升视觉能力。
推荐理由:OpenAI 把图像纳入微调 API,开发者可据此判断视觉任务能否用自有数据定制。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
OpenAI 宣布开发者现在可以用图像和文本对 GPT-4o 进行微调,以提升视觉能力。
推荐理由:OpenAI 把图像纳入微调 API,开发者可据此判断视觉任务能否用自有数据定制。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 和 Codestral 输入输出价格均下调 80%,Mistral Large 下调 33%。
推荐理由:Mistral 一次性公布免费额度、全线降价和新版小模型,可据此判断其 API 成本与部署选择。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,128k token 上下文窗口内可处理任意数量图片。
推荐理由:官方给出架构、评测口径与本地部署方式,可据此判断这一 12B 多模态模型在开源阵营中的位置。
Mistral AI 发布新一代 Mistral Large 2,拥有 128k 上下文窗口和 123B 参数,可在单节点上以较大吞吐运行,支持包括中文、日文、韩文在内的数十种语言和 80 多种编程语言。
推荐理由:官方给出 Mistral Large 2 的 128k 上下文、123B 参数与多项基准对比,可据此判断其单节点部署的成本位置。
TII 发布 Falcon 2 系列首批模型,包括 11B 基座语言模型和 11B 视觉语言模型(VLM),后者在 LLM 基础上接入 CLIP ViT-L/14 视觉编码器,支持图像问答。
推荐理由:官方给出 Falcon 2 11B 的架构、训练数据与多语言评测,可对照同尺寸开源模型判断其定位。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间进行实时推理。
推荐理由:OpenAI 官方发布新旗舰模型,读者可据此了解其在音频、视觉与文本上的实时推理定位。
OpenAI 发布 GPT-4o,并在 ChatGPT 中免费开放更多能力。
推荐理由:OpenAI 发布 GPT-4o 并扩大 ChatGPT 免费能力,读者可据此了解模型与产品开放策略的同步变化。
OpenAI 发布最新旗舰模型 GPT-4o,同时为 ChatGPT 免费用户开放更多能力。官方称这是其最新旗舰模型,免费用户将获得更多工具。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并首次把更多能力开放给 ChatGPT 免费用户。
Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的通用多模态模型,可处理任意文本与图像序列并生成文本回复,支持图像问答、文档信息抽取和基础算术。
推荐理由:8B 参数、Apache 2.0 许可并同步开源指令微调数据集,读者可据此判断多模态微调的门槛变化。
OpenAI 发布研究,探索在视频数据上大规模训练生成模型,联合在可变时长、分辨率和宽高比的视频与图像上训练文本条件扩散模型,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果表明扩展视频生成模型是构建通用物理世界模拟器的一条有前景的路径。
推荐理由:OpenAI 首次公开 Sora 的技术路线,说明视频生成模型可扩展为物理世界模拟器。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文并下调价格,同时推出 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等多项更新,可据此了解其模型与开发者产品的整体走向。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 博客发布 3D Gaussian Splatting 入门介绍,说明这是一种从少量图像学习逼真场景并实时渲染的栅格化技术。文章拆解了完整流程:先用 COLMAP 做 Structure from Motion 估计点云,再把每个点转成高斯并训练,训练中通过可微高斯栅格化计算损失,并按梯度大小自动分裂、克隆或剪枝高斯。
推荐理由:文章把 3D Gaussian Splatting 的流程拆成可理解的步骤,并列出显存、磁盘与渲染管线兼容性等实际限制。
Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,接受任意图像与文本序列输入并生成文本,提供 9B 和 80B 两个参数规模及对应的 instruct 版本。
推荐理由:Hugging Face 复现了未开源的 Flamingo,并公开训练数据、技术教训与红队评估过程,读者可据此了解开源多模态模型的复现路径。
OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在许多真实场景中能力不及人类,但在多项专业和学术基准上达到人类水平。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解这一代模型的能力边界。
OpenAI 发布 GPT-4,可生成、编辑并与用户迭代完成创意与技术写作任务,例如创作歌曲、撰写剧本,或学习用户的写作风格。
推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑与迭代能力。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可在冻结图像编码器与大语言模型之间加入轻量 Q-Former 完成视觉语言预训练。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示续写与视觉问答,可据此快速上手多模态推理。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。