跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

182条精选相关主题产品更新论文研究开源生态

最新精选

第 101–120 条 · 共 182 条
4月29日周二
4月5日周六
  1. Hugging Face Blog88

    Llama 4 Maverick 与 Scout 上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持多模态,已在 Hugging Face Hub 上线。

    推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的参数、上下文长度与架构细节,可据此判断部署门槛。

3月27日周四
3月25日周二
  1. OpenAI News62

    OpenAI 发布 GPT-4o 系统卡增补:4o 图像生成

    OpenAI 发布 GPT-4o 系统卡增补,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级写实输出,也能接收图像作为输入并对其进行变换。

    推荐理由:GPT-4o 图像生成系统卡增补说明,交代了它相对 DALL·E 3 的能力变化与图像输入输出方式。

3月18日周二
3月17日周一
  1. Mistral AI71

    Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,并以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并给出多模态与长上下文能力,读者可据此判断小模型在端侧与智能体场景的可用性。

3月12日周三
  1. Hugging Face Blog78

    Google 发布 Gemma 3 开源模型:多模态、多语言、128k 上下文

    Google 发布 Gemma 家族新成员 Gemma 3,提供 1B、4B、12B、27B 四种参数规模,含预训练和指令微调版本。4B、12B、27B 支持图像与文本输入、140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。

    推荐理由:梳理了 Gemma 3 的四种参数规模、多模态与 128k 上下文变化,并给出 transformers 与端侧推理的可用入口。

3月4日周二
  1. Hugging Face Blog62

    Cohere For AI 发布 Aya Vision 8B 与 32B 多语言多模态模型

    Cohere For AI 发布 Aya Vision 系列开源权重视觉语言模型,包含 8B 和 32B 两个版本,覆盖 23 种语言,支持图像描述、视觉问答、文本生成以及文本与图像翻译等任务。

    推荐理由:原文给出 8B 与 32B 两个开源权重的多语言视觉语言模型,并公开训练方法与评测基准,便于读者判断小参数模型在多语言多模态上的位置。

2月27日周四
  1. OpenAI News75

    OpenAI 发布 GPT-4.5 研究预览

    OpenAI 发布 GPT-4.5 的研究预览,称其为目前规模最大、知识最广的模型。该发布以系统卡形式公布。

    推荐理由:OpenAI 发布 GPT-4.5 研究预览,读者可了解其作为当前规模最大、知识最广模型的基本定位。

2月21日周五
  1. Hugging Face Blog62

    Google 发布 SigLIP 2 多语言视觉语言编码器

    Google 发布 SigLIP 2 系列多语言视觉语言编码器,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local loss 与 Masked Prediction loss 等训练目标,在零样本分类、图文检索及为 VLM 提取视觉表征等核心能力上全面优于旧版 SigLIP。

    推荐理由:梳理 SigLIP 2 相比前代新增的训练目标与 naflex 动态分辨率变体,便于理解视觉编码器的演进方向。

2月20日周四
2月17日周一
  1. Mistral AI60

    Mistral 发布区域语言模型 Mistral Saba

    Mistral AI 发布首款区域语言模型 Mistral Saba,24B 参数,基于中东和南亚数据集训练,支持阿拉伯语及多种印度语系语言,在泰米尔语等南印度语言上表现突出。官方称其回答比体量大 5 倍以上的模型更准确,速度更快、成本更低,可通过 API 调用,也能在客户本地单 GPU 系统部署,速度超过 150 tokens/s。

    推荐理由:Mistral 首款区域语言模型,24B 参数却对标 5 倍体量模型,并支持单卡本地部署,可据此判断区域化模型的落地路径。

1月31日周五
  1. OpenAI News62

    OpenAI 发布 o3-mini 系统卡

    OpenAI 发布 o3-mini 系统卡,说明该模型的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。

    推荐理由:官方系统卡披露 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,便于了解其安全验证流程。

1月30日周四
1月23日周四
1月13日周一
  1. Mistral AI62

    Mistral AI 发布 Codestral 25.01 编码模型

    Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。

    推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在 FIM 与低延迟补全场景的位置。

12月19日周四
  1. Hugging Face Blog71

    Answer.AI 与 LightOn 发布 ModernBERT,为 BERT 提供现代替代方案

    Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作为 BERT 类模型的直接替代。

    推荐理由:ModernBERT 用现代 LLM 技术重做编码器,给出 8k 上下文与速度数据,可据此判断它能否替换现有 BERT 类模型。