跳到正文

#模型发布

今日 0 条
10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放方式,可据此判断前沿模型的能力边界与落地节奏。

9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Kumo Tabular 表格基础模型,四个基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参或特征工程,同时支持分类与回归。

    推荐理由:原文给出表格基础模型的架构设计、训练数据生成方式与四个基准排名,可据此判断免训练表格预测的可行边界。

  2. OpenAI News80

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作上接近 Astra 的智能水平,标准 API 输入与输出 token 价格仅为 Astra 的五分之一。

    推荐理由:官方给出 GPT-6.1 Sol 的定位与定价对比,读者可据此判断它在编码和电脑操作任务上的成本取舍。

9月28日周一
9月25日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级虚拟形象的应用边界。

9月24日周四
9月23日周三
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行表演控制与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。

9月16日周三
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:两款语音对话模型同时发布,给出语音智能体基准成绩与开发者接入路径,可据此判断实时语音 Agent 的当前水位。

9月10日周四
9月9日周三
  1. OpenAI News82

    OpenAI 发布 GPT-6 Astra,面向商业场景强化推理与计算机使用能力

    OpenAI 发布 GPT-6 Astra,称其为面向商业场景能力最强的模型,具备高级推理、计算机使用以及更强的写作与设计判断力。目前官方仅给出简要介绍,未披露具体参数、可用时间或定价信息。

    推荐理由:OpenAI 官方发布 GPT-6 Astra,读者可据此了解其面向商业场景的推理与计算机使用能力定位。

9月3日周四
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 3 全球天气预报 AI 模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,可直接学习实时观测数据,每小时生成一次预报,最高分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。

    推荐理由:官方给出分辨率、更新频率与降水精度等具体指标,可据此判断 AI 天气预报在 Google 产品中的落地程度。

9月1日周二
  1. Google Research58

    Google 发布 TimesFM-3:面向多变量预测的零样本基础模型

    Google 发布 TimesFM-3,一个原生预训练支持多变量预测的零样本时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向即可输出整个预测区间及 9 个分位数。

8月28日周五
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力,通过 Google AI Studio 的 Gemini API 与 Agent Platform API 提供。

    推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体能力与定价入口,可据此判断生成视频工作流的变化。

8月27日周四
8月25日周二
8月14日周五
8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

    推荐理由:官方披露了 SL2T 的训练规模、隐私设计与基准成绩,可据此判断手语翻译进入消费级产品的可行边界。

8月10日周一
8月6日周四
8月4日周二
  1. Mistral AI62

    Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言策略提问并输出校准后的安全分数,无需重新训练即可适配新策略,统一处理文本与图像。

    推荐理由:3B 开源安全分类器把内容审核变成可推理时替换策略的问答任务,读者可据此判断小模型在审核场景的可用边界。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断机器人大脑的落地边界。

  2. Google DeepMind62

    Google DeepMind 在 Google Flow Music 发布音乐生成模型 Lyria 3.5

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词和人声质量上均有提升:可生成更丰富复杂的旋律结构,歌词的提示词遵循度和结构感知更好,人声更具表现力与情感细节、发音也更准确。用户还能更便捷地控制输出的节奏和时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。

7月28日周二
7月27日周一
7月21日周二
7月17日周五
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比数据与受限开放方式,可据此判断专用小模型在代码安全场景的定位。

7月15日周三
  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月8日周三
  1. Mistral AI71

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:原文给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的能力边界。

7月2日周四
  1. Mistral AI66

    Mistral 发布 Leanstral 1.5:119B 总参数、6B 激活的形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的形式化验证模型,119B 总参数、6B 激活参数,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。

    推荐理由:原文给出模型规模、基准成绩与每道题成本对比,读者可据此判断形式化验证的实用门槛。

7月1日周三