跳到正文

#模型发布

今日 1 条
7月30日周四
  1. Google DeepMind62

    Google DeepMind 在 Google Flow Music 发布音乐生成模型 Lyria 3.5

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词和人声质量上均有提升:可生成更丰富复杂的旋律结构,歌词的提示词遵循度和结构感知更好,人声更具表现力与情感细节、发音也更准确。用户还能更便捷地控制输出的节奏和时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。

7月28日周二
7月27日周一
7月21日周二
7月17日周五
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比数据与受限开放方式,可据此判断专用小模型在代码安全场景的定位。

7月15日周三
  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月8日周三
  1. Mistral AI71

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:原文给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的能力边界。

7月2日周四
  1. Mistral AI66

    Mistral 发布 Leanstral 1.5:119B 总参数、6B 激活的形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的形式化验证模型,119B 总参数、6B 激活参数,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。

    推荐理由:原文给出模型规模、基准成绩与每道题成本对比,读者可据此判断形式化验证的实用门槛。

7月1日周三
6月30日周二
  1. Google Research78

    Google 发布表格数据零样本基础模型 TabFM

    Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比结果。

6月26日周五
  1. OpenAI News62

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面能力更强,并搭配其最先进的安全栈。

    推荐理由:OpenAI 官方预告 GPT-5.6 Sol 在编码、科学与网络安全上的能力提升,并同步给出安全栈信息。

6月23日周二
  1. Mistral AI66

    Mistral 发布 OCR 4,支持边界框、块分类与置信度输出

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言,可单容器自托管部署。官方称独立标注者在 600+ 份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高分。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和定价细节,便于判断其在 RAG 与智能体流程中的接入方式。

6月22日周一
6月17日周三
  1. Hugging Face Blog88

    GLM-5.2 发布:面向长周期任务,支持 1M token 上下文

    智谱发布旗舰模型 GLM-5.2,主打长周期任务能力,首次在 1M token 上下文上稳定支撑长程工作,并采用 MIT 开源许可。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,MTP 层改进使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文落到长周期编码任务上,并给出与闭源前沿模型的逐项对比,可据此判断开源模型在长程工程任务中的位置。

6月11日周四
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB VRAM 或统一内存的消费级笔记本上本地运行,并首次在中等规模模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体的硬件门槛。

6月5日周五
6月3日周三
  1. OpenAI News62

    OpenAI 为 GPT-Rosalind 引入生命科学新能力

    OpenAI 为 GPT-Rosalind 引入新能力,用于推进生命科学研究。该模型增强了生物推理、药物化学专业知识、基因组分析和实验工作流能力。

    推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学能力,读者可了解该模型在生物推理与基因组分析上的定位。

6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。

    推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。

6月1日周一
  1. Hugging Face Blog62

    JetBrains 发布 Mellum2:12B 参数 MoE 模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。

    推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。

5月22日周五
5月20日周三
5月19日周二
5月18日周一
  1. Google DeepMind87

    Google DeepMind 发布 Gemini Omni,首款模型 Gemini Omni Flash 支持对话式视频生成与编辑

    Google DeepMind 发布 Gemini Omni 模型家族,首款模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入生成高质量视频,并支持通过自然语言多轮编辑视频。

    推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可了解其能力边界与首发渠道。

5月16日周六
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 多模态理解 84.2%,输出速度是其他前沿模型的 4 倍。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放入口,可据此判断其速度与成本取舍。

5月15日周五
5月7日周四
4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni:面向文档、音频与视频智能体的长上下文全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款覆盖文本、图像、视频与音频的全模态理解模型,基于 Nemotron 3 Nano 30B-A3B 骨干,搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

4月23日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.5

    OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等跨工具复杂任务打造的模型。

    推荐理由:OpenAI 官方发布 GPT-5.5,面向编码、研究与数据分析等跨工具复杂任务,可据此了解其定位。

4月16日周四
4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力如何落地机器人巡检。

4月9日周四
  1. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型,消费级 GPU 可跑 720p 60 FPS

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可实时生成最高 720p、60 FPS 的环境,并新增面向更广消费级硬件的 360p 版本,后续将支持 Apple Silicon Mac。

    推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级显卡,读者可据此判断本地生成式世界的硬件门槛变化。

4月3日周五
4月2日周四
4月1日周三
  1. Hugging Face Blog60

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词表定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干感知路线相对模块化管线的取舍。

3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一款面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可并在 Hugging Face 上线。

    推荐理由:Granite 4.0 3B Vision 以 3B 规模在图表与表格抽取基准上超过更大模型,并给出 LoRA 适配器与 Docling 集成路径。