Google 用冻结多 Token 预测加速 Pixel 上的 Gemini Nano 模型
Google Research 发布一种新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,作为端侧推理的即插即用加速方案,已部署到 Pixel 9 和 10 系列。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。
Google Research 发布一种新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,作为端侧推理的即插即用加速方案,已部署到 Pixel 9 和 10 系列。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF 基础设施上启动私有、兼容 OpenAI API 的 vLLM 端点,按秒计费,无需自行配置服务器或 Kubernetes。
推荐理由:原文给出从启动到查询、调试、接入编码智能体的完整命令链路,可直接照做复现。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境运行数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
NVIDIA 发布开源库 NeMo AutoModel,构建在 HuggingFace Transformers v5 之上,为 MoE 模型微调带来 3.4-3.7 倍训练吞吐提升和 29-32% 的 GPU 显存下降。
推荐理由:原文给出 NeMo AutoModel 在 MoE 微调上的吞吐与显存对比数据,读者可据此判断是否值得替换现有训练栈。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织管理连接器访问权限并支持工具级开关,带 connector scope 的 API key 可防止自动化 AI 工作负载中的身份冒用,多账号连接器允许一个连接器绑定多个账号。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言,可单容器自托管部署。官方称独立标注者在 600+ 份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高分。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和定价细节,便于判断其在 RAG 与智能体流程中的接入方式。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客展示了 Transformers.js 对跨源存储(Cross-Origin Storage)API 的试验。
Hugging Face 将 huggingface_hub 的发布周期从每 4 到 6 周一次改为每周一次,整套流程由单个 GitHub Actions 工作流驱动,使用 OpenCode 和开源权重模型(当前为 Z.ai 的 GLM-5.2)起草发布说明与 Slack 公告。
推荐理由:原文公开了每周发版工作流的完整结构,其中确定性校验加人工复核的循环可迁移到其他生成任务。
Hugging Face 博客分享了用本地模型加 agent harness 对 OpenClaw 仓库的 issue 和 PR 做实时分类分诊的方案,作者在 NVIDIA GB10 上运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,通过受限的 reposhell 只读命令补充上下文后输出结构化标签。
推荐理由:作者用本地模型加受限 shell 做 PR 分类的完整配方,含 330 行评测对比与吞吐数据,可迁移到其他分诊场景。
Samsung Electronics 在全球员工中部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 规模最大的企业级 AI 落地之一。
OpenAI 推出 Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业 AI 的采用、部署与转型。
加州大学圣地亚哥分校在 Google 支持下,正用 2000 台退役 Pixel 智能手机的主板搭建数据中心,为数百名研究人员和学生提供低成本、低碳的云计算。SPEC 基准显示 25-50 台手机约等于一台现代服务器,这些手机以 25-50 台为单位组成由 Kubernetes 管理的自管理集群。该系统预计于 2026 年秋季全面上线。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 换成 nn.Linear,并堆叠三层加激活函数构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
OpenAI 模型与 Codex 现可通过 Oracle Cloud 访问,企业可使用既有云承诺额度来构建和部署 AI。该方式支持企业级安全与治理。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理提速。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,读者可据此判断本地低并发场景的取舍。
Hugging Face 发布教程,介绍如何让 GitHub Actions 把 CI 任务调度到 Hugging Face Jobs 上运行。
推荐理由:原文给出把 GitHub Actions 任务迁移到 Hugging Face Jobs 的完整步骤与 Trackio 实测数据,可据此评估 GPU CI 的可行性。
H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。
推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。
推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。
Hugging Face 博客指出,企业级 AI 规模化落地的关键不在 LLM 本身,而在 agentic layer 中的 agent logic——知识图谱、算法、程序分析库等软件原语,可引导 LLM 聚焦企业工作流、压缩上下文空间。
OpenAI 在密歇根破土动工一个 1GW 数据中心项目,属于 Stargate 计划的一部分。该项目建设 AI 基础设施,目标是扩大接入、创造就业并支持当地社区。
推荐理由:OpenAI 在密歇根动工 1GW 数据中心,读者可了解 Stargate 的落地规模与选址进展。
OpenAI 前沿模型与 Codex 现已在 AWS 上正式可用,企业可通过已有的 AWS 环境、控制机制和采购流程接入 OpenAI。客户可借此从评估阶段更快推进到生产部署。
推荐理由:OpenAI 前沿模型与 Codex 上线 AWS,企业可在既有云环境与采购流程中直接接入。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。其智能体工具 Vibe 升级为统一智能体,可处理收件箱与日历、深度研究、交付物撰写,并完成从需求到合并变更的编码工作。位于法国 Les Ulis 的 10 MW 推理数据中心计划于 2026 年 Q3 开放。
推荐理由:Mistral 一次性公布工业 AI 栈、Vibe 智能体与自建数据中心,可据此观察其企业级全栈布局。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单张 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真 AI 纳入企业平台,读者可了解其定位、适用场景与合作伙伴。
Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注 Physics AI 与大型工程模型,可实时仿真替代多日计算并构建数字孪生,其 30 多名研究人员与工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其 Science 路线与工业 AI 布局。
Mistral 在 Studio 发布 Connectors(公开预览),内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与 Agent 调用。
推荐理由:Mistral 把 MCP 连接器做成平台级注册实体,读者可据此判断企业 Agent 集成层会如何被收敛。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5、PaddleOCR-VL 1.5 等模型。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,帮助企业在数据与工作流中安全部署 AI 编程智能体。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
Hugging Face 发文解析连续批处理中的同步瓶颈:用 8B 模型、batch size 32 生成 8K tokens 时,总耗时 300.6 秒,其中 24.0% 的时间 GPU 在等待 CPU,纯属浪费。
OpenAI 为在 Windows 上启用 Codex 构建了安全有效的沙箱,通过受控的文件访问和网络限制来隔离其运行。该方案旨在让 Codex 在 Windows 环境下安全执行任务。
Hugging Face 发文解析 AWS 上基础模型训练与推理的开源软件栈分层架构,涵盖 Slurm、Kubernetes、PyTorch、JAX 及 Prometheus、Grafana 等工具。
OpenAI 推出企业部署公司 DeployCo,帮助各类组织将前沿 AI 投入生产环境并转化为可衡量的业务成果。该公司定位为企业级部署主体,聚焦前沿 AI 的实际落地与业务影响。
OpenAI 通过沙箱隔离、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持编程智能体的安全合规采用。
一篇综述指出,并行推理正从固定 fork-and-join、树搜索等外部预设结构,转向让模型自行决定何时分解子任务、开多少并行线程以及如何协调的自适应并行推理。文中梳理了 Self-consistency、Best-of-N、MCTS、ParaThinker、GroupThink、Hogwild! Inference 等方法,并指出顺序推理的 token 增长会带来上下文退化和延迟问题。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:改用 processed_logprobs、显式设置 V1 运行时默认值、调整 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。
OpenAI 推出 MRC(Multipath Reliable Connection)超级计算机网络协议,通过 OCP 开放发布,用于提升大规模 AI 训练集群的韧性与性能。
IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。
推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。
DeepInfra 正式成为 Hugging Face Hub 支持的推理服务商,首批上线对话与文本生成任务,可访问 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开源权重模型。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,基于 Temporal 持久执行引擎,提供持久化执行、可观测性和人工介入审批能力。
推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。
Hugging Face 博客介绍如何基于 OpenAI 本周在 Hub 上开源的 Privacy Filter 构建三个 Web 应用。该模型是 1.5B 参数、50M 激活参数的 PII 检测器,Apache 2.0 许可,单次前向处理 128k 上下文,可标注八类 PII,并在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章用三个可运行示例拆解 gradio.Server 的队列与路由分工,读者可据此复用这套前后端拆分模式。