跳到正文

#模型发布

今日 0 条
11月13日周四
11月12日周三
10月28日周二
9月30日周二
  1. OpenAI News76

    OpenAI 发布 Sora 2 视频与音频生成模型系统卡

    OpenAI 发布新一代视频与音频生成模型 Sora 2,并公开其系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升,官方称这些能力此前的视频模型较难实现。

    推荐理由:官方系统卡披露 Sora 2 在物理准确性、音画同步与可控性上的能力变化,可据此判断视频生成模型的当前边界。

9月26日周五
9月15日周一
  1. OpenAI News71

    OpenAI 发布 GPT-5 系统卡增补:GPT-5-Codex

    OpenAI 发布 GPT-5 系统卡增补,公开新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。

    推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。

9月12日周五
9月9日周二
  1. Hugging Face Blog50

    Hugging Face 发布 mmBERT:基于 ModernBERT 的多语言编码器,覆盖 1800+ 语言

    Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在超 3T token、1800 多种语言上训练,是首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用三阶段训练与逆掩码率调度(30%→15%→5%),在 GLUE 和 XTREME 基准上显著领先 XLM-R 与 mGTE。

9月4日周四
  1. Hugging Face Blog60

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。

    推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。

8月28日周四
8月22日周五
8月7日周四
  1. OpenAI News85

    OpenAI 在 API 平台推出 GPT-5

    OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。

    推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。

  2. OpenAI News82

    OpenAI 发布 GPT-5 系统卡,披露统一模型路由机制

    OpenAI 发布 GPT-5 系统卡,说明其通过统一模型路由系统实现快速与智能的响应。该系统使用 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本,针对不同任务和开发者用途进行优化。

    推荐理由:系统卡披露 GPT-5 用统一路由在 gpt-5-main、gpt-5-thinking 与轻量版本间分配任务。

  3. OpenAI News85

    OpenAI 发布 GPT-5

    OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。

    推荐理由:OpenAI 官方公布 GPT-5 的定位与能力覆盖范围,读者可据此了解其相对前代模型的升级方向。

8月5日周二
  1. OpenAI News62

    OpenAI 发布其最强开放权重模型

    OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、灵活和可及的重要一步。官方表示,其使命是让尽可能多的人用上 AI,此次发布旨在推动 AI 在全球范围内的普及。

    推荐理由:OpenAI 官方宣布发布其能力最强的开放权重模型,读者可据此了解其开放与可及性主张。

  2. OpenAI News85

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:OpenAI 开源两款权重模型,给出参数量、许可与部署定位,便于判断本地推理的可用边界。

7月16日周三
7月15日周二
  1. Mistral AI80

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。

    推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此判断语音能力的部署与成本选择。

7月11日周五
7月10日周四
7月8日周二
6月28日周六
6月26日周四
6月10日周二
6月3日周二
  1. Hugging Face Blog71

    H Company 发布 Holo1 系列 GUI 自动化 VLM 与 WebClick 基准

    H Company 发布 Holo1 系列动作视觉语言模型(含 Holo1-3B 与 Holo1-7B)以及 WebClick 多模态定位基准,模型已在 Hugging Face 开源。

    推荐理由:Holo1 开源了面向 GUI 自动化的动作 VLM 家族,并给出 WebClick 基准与 Surfer-H 智能体的组合方式,读者可据此评估网页自动化方案的成本与精度取舍。

  2. Hugging Face Blog62

    Hugging Face 发布 SmolVLA:450M 开源视觉-语言-动作模型

    Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。

    推荐理由:450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。

5月28日周三
  1. Mistral AI62

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索场景中明显优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。

    推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度可调的取舍方式,便于评估检索成本。

5月21日周三
  1. Mistral AI76

    Mistral AI 发布编码智能体模型 Devstral,Apache 2.0 开源

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Mistral 与 All Hands AI 联合发布开源编码智能体模型,给出 SWE-Bench Verified 分数与本地部署门槛,便于判断其可用性。

5月15日周四
  1. Hugging Face Blog62

    Falcon-Edge 发布 1B 与 3B 三值语言模型系列

    Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。

    推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。

5月7日周三
4月29日周二