跳到正文

#模型发布

今日 0 条
2月27日周五
2月20日周五
2月13日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。官方称其在 Humanity's Last Exam 上取得 48.4%(无工具)、ARC-AGI-2 上 84.6%、Codeforces 上 Elo 3455,并在 2025 国际数学奥林匹克达到金牌水平。

    推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并说明 API 早期访问入口,便于判断其科研与工程定位。

2月12日周四
  1. OpenAI News60

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前以研究预览形式面向 ChatGPT Pro 用户开放。

    推荐理由:OpenAI 发布首个实时编码模型,15 倍生成速度与 128k 上下文让读者了解编码模型的实时化方向。

2月5日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。

    推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可了解其在编码与通用推理上的定位。

2月4日周三
1月20日周二
  1. Hugging Face Blog74

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布 Waypoint-1,一个可通过文本、鼠标和键盘实时控制的交互式视频扩散模型,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。

    推荐理由:Waypoint-1 把实时交互视频扩散模型与配套推理库一并开源,读者可据此了解世界模型从预训练到低延迟部署的完整路径。

1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT 模型,统一 4D 场景重建与追踪

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。

    推荐理由:D4RT 把 4D 重建统一进单一查询式框架,效率提升幅度和实时应用场景是主要看点。

1月14日周三
  1. Google Research62

    Google 发布 MedGemma 1.5 4B 与医疗语音识别模型 MedASR

    Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。官方称其在 CT 病变分类上绝对准确率较 MedGemma 1 提升 3%(61% vs. 58%),MRI 提升 14%(65% vs. 51%),MedQA 提升 5%(69% vs. 64%)。

    推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。

1月6日周二
1月5日周一
12月24日周三
12月23日周二
12月18日周四
  1. OpenAI News80

    OpenAI 发布 GPT-5.2-Codex 编码模型

    OpenAI 发布 GPT-5.2-Codex,称其为该公司最先进的编码模型。该模型具备长程推理、大规模代码转换和增强的网络安全能力。

    推荐理由:OpenAI 官方给出 GPT-5.2-Codex 的定位与三项能力方向,可据此了解其编码模型迭代重点。

12月17日周三
  1. Hugging Face Blog41

    NVIDIA 发布 Nemotron 3 Nano 30B A3B,公开完整评测配方

    NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核验结果。NeMo Evaluator 将多个评测 harness 统一到单一接口,分离评测流程与推理后端,默认生成结构化结果与日志。NVIDIA 同时公开了模型卡评测所用的 YAML 配置。

  2. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Flash

    Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。

    推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。

12月16日周二
12月13日周六
12月11日周四
  1. OpenAI News82

    OpenAI 发布 GPT-5.2,面向科学与数学任务

    OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:官方给出 GPT-5.2 在数学与科学基准上的新结果,并说明这些提升如何落到实际研究进展。

12月9日周二
  1. Mistral AI82

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。

12月3日周三
11月20日周四
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),一个基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式通过 Gemini API 逐步开放。

    推荐理由:官方给出 Gemini 3 Pro Image 的分辨率、文本渲染与搜索接地等能力细节,可据此判断图像生成与编辑的可用边界。

11月17日周一
11月13日周四
10月28日周二
9月30日周二
  1. OpenAI News76

    OpenAI 发布 Sora 2 视频与音频生成模型系统卡

    OpenAI 发布新一代视频与音频生成模型 Sora 2,并公开其系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升,官方称这些能力此前的视频模型较难实现。

    推荐理由:官方系统卡披露 Sora 2 在物理准确性、音画同步与可控性上的能力变化,可据此判断视频生成模型的当前边界。

9月26日周五
9月15日周一
  1. OpenAI News71

    OpenAI 发布 GPT-5 系统卡增补:GPT-5-Codex

    OpenAI 发布 GPT-5 系统卡增补,公开新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。

    推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。

9月12日周五
9月9日周二
  1. Hugging Face Blog50

    Hugging Face 发布 mmBERT:基于 ModernBERT 的多语言编码器,覆盖 1800+ 语言

    Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在超 3T token、1800 多种语言上训练,是首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用三阶段训练与逆掩码率调度(30%→15%→5%),在 GLUE 和 XTREME 基准上显著领先 XLM-R 与 mGTE。

9月4日周四
  1. Hugging Face Blog60

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。

    推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。

8月28日周四
8月22日周五
8月7日周四
  1. OpenAI News85

    OpenAI 在 API 平台推出 GPT-5

    OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。

    推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。