Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。
Mistral AI 发布新一代 Mistral Large 2,拥有 128k 上下文窗口和 123B 参数,可在单节点上以较大吞吐运行,支持包括中文、日文、韩文在内的数十种语言和 80 多种编程语言。
推荐理由:官方给出 Mistral Large 2 的 128k 上下文、123B 参数与多项基准对比,可据此判断其单节点部署的成本位置。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方给出 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,便于评估部署成本。
OpenAI 发布 GPT-4o mini,定位为更具成本效率的智能模型。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,预训练基座与指令微调 checkpoint 均以 Apache 2.0 许可开源。
推荐理由:Mistral 与 NVIDIA 合作的 12B 模型以 Apache 2.0 开源,128k 上下文和 FP8 推理对部署选型有直接参考。
Mistral AI 发布 Codestral Mamba,这是继 Mixtral 系列之后对 Mamba 架构的又一次探索,采用 Apache 2.0 许可,可自由使用、修改和分发。
推荐理由:Mistral 发布基于 Mamba 架构的代码模型,给出参数规模、256k 检索测试与多种部署方式,可据此判断非 Transformer 架构在代码场景的可用性。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了三个尺寸小模型的训练数据配比与评测对比,可据此判断端侧小模型的选型与数据策略。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个规模,各有基础版与指令微调版,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布并接入 Diffusers。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Mistral AI 发布首款代码模型 Codestral,这是一个 22B 开放权重生成式模型,训练数据覆盖 80+ 编程语言,上下文窗口 32k,可通过指令与补全 API 端点使用。
推荐理由:Mistral 首款代码模型给出 22B 开放权重、32k 上下文和 80+ 语言支持,可对照其与既有代码模型的定位差异。
TII 发布 Falcon 2 系列首批模型,包括 11B 基座语言模型和 11B 视觉语言模型(VLM),后者在 LLM 基础上接入 CLIP ViT-L/14 视觉编码器,支持图像问答。
推荐理由:官方给出 Falcon 2 11B 的架构、训练数据与多语言评测,可对照同尺寸开源模型判断其定位。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间进行实时推理。
推荐理由:OpenAI 官方发布新旗舰模型,读者可据此了解其在音频、视觉与文本上的实时推理定位。
OpenAI 发布 GPT-4o,并在 ChatGPT 中免费开放更多能力。
推荐理由:OpenAI 发布 GPT-4o 并扩大 ChatGPT 免费能力,读者可据此了解模型与产品开放策略的同步变化。
OpenAI 发布最新旗舰模型 GPT-4o,同时为 ChatGPT 免费用户开放更多能力。官方称这是其最新旗舰模型,免费用户将获得更多工具。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并首次把更多能力开放给 ChatGPT 免费用户。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码 LLM,用 StarCoder2-15B 自生成指令-响应对微调自身,无需人工标注或 GPT-4 蒸馏数据。
推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸的 base 与 instruct 版本,并同步发布基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face。
推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。
Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准,便于判断其成本效率定位。
Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的通用多模态模型,可处理任意文本与图像序列并生成文本回复,支持图像问答、文档信息抽取和基础算术。
推荐理由:8B 参数、Apache 2.0 许可并同步开源指令微调数据集,读者可据此判断多模态微调的门槛变化。
Google 发布代码专用模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint,额外用 5000 亿 token 的英文、数学和代码数据训练,包含 2B base、7B base 和 7B instruct 三个版本,均保持 8K token 上下文。
推荐理由:Google 与 Hugging Face 联合发布三款代码专用 Gemma 模型,读者可据此了解其规格、基准表现与部署方式。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、数据集与训练代码,读者可据此了解开源代码模型在参数规模与训练数据上的具体取舍。