跳到正文

#开源生态

今日 1 条
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB VRAM 或统一内存的消费级笔记本上本地运行,并首次在中等规模模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体的硬件门槛。

6月8日周一
  1. Hugging Face Blog66

    OpenEnv 转为委员会共管,成为智能体 RL 的开源环境协议层

    Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。

    推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此判断开源智能体 RL 环境标准化的走向。

6月5日周五
6月4日周四
  1. Google Research62

    Google 开源其水文建模框架,支持本地化 AI 洪水预报

    Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。

    推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可据此判断本地洪水预报如何接入自有数据。

6月3日周三
6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。

    推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。

6月1日周一
  1. Hugging Face Blog62

    JetBrains 发布 Mellum2:12B 参数 MoE 模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。

    推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。

5月27日周三
  1. Mistral AI62

    Mistral 推出物理 AI,将 Emmi AI 并入企业工程栈

    Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单张 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。

    推荐理由:Mistral 把物理仿真 AI 纳入企业平台,读者可了解其定位、适用场景与合作伙伴。

5月22日周五
5月17日周日
5月16日周六
5月12日周二
5月7日周四
5月2日周六
4月29日周三
  1. Hugging Face Blog60

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与 RL 全流程

    IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。

    推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。

4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni:面向文档、音频与视频智能体的长上下文全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款覆盖文本、图像、视频与音频的全模态理解模型,基于 Nemotron 3 Nano 30B-A3B 骨干,搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月27日周一
4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

4月23日周四
  1. Hugging Face Blog62

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并以官方发布的 Gemma 4 浏览器助手扩展为参照。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本分工的架构取舍。

4月21日周二
  1. Hugging Face Blog36

    AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。

4月16日周四
4月9日周四
  1. Hugging Face Blog60

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 下编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此评估跨模态检索的落地成本。

  2. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型,消费级 GPU 可跑 720p 60 FPS

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可实时生成最高 720p、60 FPS 的环境,并新增面向更广消费级硬件的 360p 版本,后续将支持 Apple Silicon Mac。

    推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级显卡,读者可据此判断本地生成式世界的硬件门槛变化。

4月8日周三
4月3日周五
4月2日周四
4月1日周三
  1. Hugging Face Blog60

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词表定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干感知路线相对模块化管线的取舍。

3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一款面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可并在 Hugging Face 上线。

    推荐理由:Granite 4.0 3B Vision 以 3B 规模在图表与表格抽取基准上超过更大模型,并给出 LoRA 适配器与 Docling 集成路径。

  2. Hugging Face Blog22

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

3月27日周五
3月24日周二
  1. Mistral AI71

    Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可生成带情感表达的语音。

    推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开与 ElevenLabs 的人工对比结果。

3月21日周六
  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。

    推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。

3月18日周三
3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。

    推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。