微软在 Foundry Managed Compute 上线 Hugging Face 模型集合
微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型以每周刷新的方式引入 Foundry 模型目录,可一键部署到托管 GPU 平台。
推荐理由:微软把 Hugging Face 开源模型的部署运维层接进 Foundry,读者可据此判断开源模型进入企业生产环境的门槛变化。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型以每周刷新的方式引入 Foundry 模型目录,可一键部署到托管 GPU 平台。
推荐理由:微软把 Hugging Face 开源模型的部署运维层接进 Foundry,读者可据此判断开源模型进入企业生产环境的门槛变化。
Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用一条 hf:// URL 和已有的 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境中调度运行。
推荐理由:原文给出 hf:// 挂载方式与免出站流量费的具体机制,读者可据此判断跨云训练与推理的存储成本变化。
Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比结果。
Google Research 发布一种新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,作为端侧推理的即插即用加速方案,已部署到 Pixel 9 和 10 系列。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言,可单容器自托管部署。官方称独立标注者在 600+ 份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高分。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和定价细节,便于判断其在 RAG 与智能体流程中的接入方式。
Hugging Face 博客分享了用本地模型加 agent harness 对 OpenClaw 仓库的 issue 和 PR 做实时分类分诊的方案,作者在 NVIDIA GB10 上运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,通过受限的 reposhell 只读命令补充上下文后输出结构化标签。
推荐理由:作者用本地模型加受限 shell 做 PR 分类的完整配方,含 330 行评测对比与吞吐数据,可迁移到其他分诊场景。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理提速。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,读者可据此判断本地低并发场景的取舍。
Hugging Face 发布教程,介绍如何让 GitHub Actions 把 CI 任务调度到 Hugging Face Jobs 上运行。
推荐理由:原文给出把 GitHub Actions 任务迁移到 Hugging Face Jobs 的完整步骤与 Trackio 实测数据,可据此评估 GPU CI 的可行性。
H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。
推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。
推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。
OpenAI 在密歇根破土动工一个 1GW 数据中心项目,属于 Stargate 计划的一部分。该项目建设 AI 基础设施,目标是扩大接入、创造就业并支持当地社区。
推荐理由:OpenAI 在密歇根动工 1GW 数据中心,读者可了解 Stargate 的落地规模与选址进展。
OpenAI 前沿模型与 Codex 现已在 AWS 上正式可用,企业可通过已有的 AWS 环境、控制机制和采购流程接入 OpenAI。客户可借此从评估阶段更快推进到生产部署。
推荐理由:OpenAI 前沿模型与 Codex 上线 AWS,企业可在既有云环境与采购流程中直接接入。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。其智能体工具 Vibe 升级为统一智能体,可处理收件箱与日历、深度研究、交付物撰写,并完成从需求到合并变更的编码工作。位于法国 Les Ulis 的 10 MW 推理数据中心计划于 2026 年 Q3 开放。
推荐理由:Mistral 一次性公布工业 AI 栈、Vibe 智能体与自建数据中心,可据此观察其企业级全栈布局。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单张 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真 AI 纳入企业平台,读者可了解其定位、适用场景与合作伙伴。
Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注 Physics AI 与大型工程模型,可实时仿真替代多日计算并构建数字孪生,其 30 多名研究人员与工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其 Science 路线与工业 AI 布局。
Mistral 在 Studio 发布 Connectors(公开预览),内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与 Agent 调用。
推荐理由:Mistral 把 MCP 连接器做成平台级注册实体,读者可据此判断企业 Agent 集成层会如何被收敛。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。
推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,基于 Temporal 持久执行引擎,提供持久化执行、可观测性和人工介入审批能力。
推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。
Hugging Face 博客介绍如何基于 OpenAI 本周在 Hub 上开源的 Privacy Filter 构建三个 Web 应用。该模型是 1.5B 参数、50M 激活参数的 PII 检测器,Apache 2.0 许可,单次前向处理 128k 上下文,可标注八类 PII,并在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章用三个可运行示例拆解 gradio.Server 的队列与路由分工,读者可据此复用这套前后端拆分模式。