跳到正文

全部动态

今日 2 条
12月9日周一
  1. OpenAI News70

    OpenAI 发布 Sora 视频生成模型系统卡

    OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位为面向叙事与创意表达的扩展工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型沿革,可据此了解其能力边界。

12月5日周四
  1. Hugging Face Blog60

    Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模

    Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,每种均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。

    推荐理由:PaliGemma 2 给出 3B 到 28B 三种规模与三种分辨率组合,读者可据此判断视觉语言模型的微调选型空间。

11月26日周二
  1. Hugging Face Blog62

    Hugging Face 发布 2B 视觉语言模型 SmolVLM

    Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方和工具均以 Apache 2.0 协议开源。

    推荐理由:2B 参数 VLM 把显存压到 5GB 并开放全部训练配方,读者可据此判断端侧多模态部署的可行边界。

11月18日周一
  1. Mistral AI78

    Mistral AI 发布 124B 开源多模态模型 Pixtral Large

    Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开源权重多模态模型,由 123B 多模态解码器和 1B 参数视觉编码器组成,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。

    推荐理由:官方给出 Pixtral Large 在 MathVista、DocVQA 等基准上的对比数据,可据此判断开源多模态模型的当前水平。

10月24日周四
  1. Hugging Face Blog62

    Cohere For AI 发布 Aya Expanse 8B 与 32B 多语言模型

    Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。官方称 Aya Expanse 32B 在成对比较中优于 Gemma 2 27B、Mistral 8x22B 和 Llama 3.1 70B,Aya Expanse 8B 在同参数级别模型中的胜率为 60.4% 至 70.6%。

    推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,包括数据套利、多语言偏好训练与模型合并的具体做法。

10月22日周二
10月16日周三
  1. Mistral AI71

    Mistral 发布 Ministral 3B 与 8B 两款端侧模型

    Mistral AI 在 Mistral 7B 发布一周年之际推出 Ministral 3B 和 Ministral 8B 两款面向端侧与本地推理的模型,称其在 10B 以下级别刷新了知识、常识、推理、函数调用和效率的表现。

    推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出定价、上下文长度与基准对比,可据此判断本地推理的选型空间。

9月17日周二
  1. Mistral AI73

    Mistral AI 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,128k token 上下文窗口内可处理任意数量图片。

    推荐理由:官方给出架构、评测口径与本地部署方式,可据此判断这一 12B 多模态模型在开源阵营中的位置。

9月12日周四
8月12日周一
7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。

    推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。

7月24日周三
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数支持 128k 上下文

    Mistral AI 发布新一代 Mistral Large 2,拥有 128k 上下文窗口和 123B 参数,可在单节点上以较大吞吐运行,支持包括中文、日文、韩文在内的数十种语言和 80 多种编程语言。

    推荐理由:官方给出 Mistral Large 2 的 128k 上下文、123B 参数与多项基准对比,可据此判断其单节点部署的成本位置。

7月23日周二
  1. Hugging Face Blog88

    Llama 3.1 发布:405B、70B 与 8B,支持多语言和长上下文

    Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。

    推荐理由:Hugging Face 官方给出 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,便于评估部署成本。

7月18日周四
7月16日周二
  1. Mistral AI71

    Mistral 发布 Codestral Mamba 代码模型

    Mistral AI 发布 Codestral Mamba,这是继 Mixtral 系列之后对 Mamba 架构的又一次探索,采用 Apache 2.0 许可,可自由使用、修改和分发。

    推荐理由:Mistral 发布基于 Mamba 架构的代码模型,给出参数规模、256k 检索测试与多种部署方式,可据此判断非 Transformer 架构在代码场景的可用性。

6月27日周四
6月12日周三
5月29日周三
  1. Mistral AI78

    Mistral 发布首款代码模型 Codestral,22B 开放权重、支持 80+ 编程语言

    Mistral AI 发布首款代码模型 Codestral,这是一个 22B 开放权重生成式模型,训练数据覆盖 80+ 编程语言,上下文窗口 32k,可通过指令与补全 API 端点使用。

    推荐理由:Mistral 首款代码模型给出 22B 开放权重、32k 上下文和 80+ 语言支持,可对照其与既有代码模型的定位差异。

5月24日周五
5月13日周一
4月29日周一
  1. Hugging Face Blog62

    StarCoder2-15B-Instruct 发布:全透明自对齐代码生成模型

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码 LLM,用 StarCoder2-15B 自生成指令-响应对微调自身,无需人工标注或 GPT-4 蒸馏数据。

    推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。

4月18日周四
  1. Hugging Face Blog88

    Meta 发布 Llama 3 开源大模型,Hugging Face 同步集成

    Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸的 base 与 instruct 版本,并同步发布基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face。

    推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。

4月17日周三
  1. Mistral AI78

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准,便于判断其成本效率定位。

4月15日周一
4月9日周二
  1. Hugging Face Blog60

    Google 发布代码专用模型 CodeGemma,含 2B 与 7B 三个版本

    Google 发布代码专用模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint,额外用 5000 亿 token 的英文、数学和代码数据训练,包含 2B base、7B base 和 7B instruct 三个版本,均保持 8K token 上下文。

    推荐理由:Google 与 Hugging Face 联合发布三款代码专用 Gemma 模型,读者可据此了解其规格、基准表现与部署方式。

2月28日周三
  1. Hugging Face Blog78

    BigCode 发布 StarCoder2 系列代码模型与 The Stack v2 数据集

    BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。

    推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、数据集与训练代码,读者可据此了解开源代码模型在参数规模与训练数据上的具体取舍。

2月26日周一
  1. Mistral AI80

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 使用,并首次通过 Azure 分发。官方称其在常用基准上表现强劲,是继 GPT-4 之后第二个可通过 API 获得的顶级模型,具备 32K token 上下文窗口、原生函数调用与 JSON 格式输出,原生支持英语、法语、西班牙语、德语和意大利语。

    推荐理由:官方给出 Mistral Large 的基准对比、32K 上下文与函数调用能力,可据此判断其与 GPT-4 的定位差异。

2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面集成

    Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种尺寸,各有基础版和指令微调版,上下文长度 8K tokens。Gemma-7B 在 LLM Leaderboard 上得分 63.75,性能接近 Mistral 7B;Hugging Face 提供了 Transformers、Google Cloud、Inference Endpoints 集成以及基于 TRL 的微调示例。

    推荐理由:Google 发布 Gemma 开源模型家族,读者可了解其两种尺寸、性能位次及在 Hugging Face 生态中的部署与微调路径。

2月15日周四
  1. OpenAI News83

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 发布研究,探索在视频数据上大规模训练生成模型,联合在可变时长、分辨率和宽高比的视频与图像上训练文本条件扩散模型,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果表明扩展视频生成模型是构建通用物理世界模拟器的一条有前景的路径。

    推荐理由:OpenAI 首次公开 Sora 的技术路线,说明视频生成模型可扩展为物理世界模拟器。

2月3日周六
  1. Hugging Face Blog60

    Hugging Face 发布 SegMoE:从零构建混合专家扩散模型

    Hugging Face 发布 SegMoE 框架,可从零创建混合专家(MoE)扩散模型,并已集成 diffusers。同时发布 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。

    推荐理由:原文给出从零构建 MoE 扩散模型的完整流程与配置示例,读者可据此判断能否把已有模型合并成新模型。