GGML 与 llama.cpp 团队加入 Hugging Face,继续维护本地 AI 开源项目
Hugging Face 宣布 GGML(llama.cpp 的创建者)加入 HF,Georgi Gerganov 及团队一同加入,目标是持续支持 ggml 与 llama.cpp 社区,推动本地 AI 发展。
推荐理由:GGML 与 llama.cpp 团队加入 Hugging Face,读者可了解本地推理项目在资源与维护方式上的变化。
Hugging Face 宣布 GGML(llama.cpp 的创建者)加入 HF,Georgi Gerganov 及团队一同加入,目标是持续支持 ggml 与 llama.cpp 社区,推动本地 AI 发展。
推荐理由:GGML 与 llama.cpp 团队加入 Hugging Face,读者可了解本地推理项目在资源与维护方式上的变化。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 的 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端和状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此判断如何让 LLM 一次生成可部署的交互组件。
OpenAI 构建了一套结合速率限制、用量追踪与积分的实时访问系统,用于支撑 Codex 和 Sora 的持续访问。该系统将速率限制、用量追踪和积分机制整合在一起,以扩展两个产品的访问能力。
Hugging Face 构建了一个 Agent Skill,教编码智能体编写生产级 CUDA kernel,并让 Claude 和 Codex 分别针对 diffusers 的 LTX-Video 和 transformers 的 Qwen3-8B 生成可用 kernel,包含正确的 PyTorch 绑定与基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识封装成 Agent Skill,并给出两个真实模型的端到端基准数据,可据此判断这类技能包的实际收益。
Transformers.js v4 已在 NPM 发布,可通过 npm i @huggingface/transformers 安装。最大变化是采用完全用 C++ 重写的 WebGPU 运行时,与 ONNX Runtime 团队在约 200 个模型架构上测试,同一份代码可运行在浏览器、Node、Bun 和 Deno 等环境。
推荐理由:Transformers.js v4 换用 C++ 重写的 WebGPU 运行时,并给出 BERT 嵌入约 4 倍加速等具体数据,可据此判断浏览器端推理的性能变化。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练内顺序、自适应地挑选最佳组件(层、块或特征),无需反复重训即可完成特征选择。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,兼顾效率、准确率、可解释性与大规模可扩展性。
中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。
OpenAI 介绍其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文中提到的主要手段包括副本、缓存、限流和工作负载隔离。
Mistral AI 团队在预生产测试中发现,vLLM 搭配 Mistral Medium 3.1 并启用图编译时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
OpenAI 公布 Stargate 社区计划,提出以社区优先的方式建设 AI 基础设施,方案将根据社区意见、能源需求与劳动力优先事项进行本地化定制。
ServiceNow 扩大对 OpenAI 前沿模型的接入,用于驱动 ServiceNow 平台上的 AI 工作流、摘要、搜索与语音功能。此次合作将 OpenAI 模型能力引入企业级工作场景,覆盖 AI 驱动的企业流程自动化与交互体验。
OpenAI 发起一项新的 RFP,旨在通过加速美国本土制造、创造就业岗位并扩展 AI 基础设施,强化美国 AI 供应链。
OpenAI 宣布与 Cerebras 合作,新增 750MW 高速 AI 算力,用于降低推理延迟。该合作旨在让 ChatGPT 在实时 AI 工作负载下响应更快。
推荐理由:OpenAI 与 Cerebras 达成算力合作,读者可了解其新增算力规模与对推理延迟的直接影响。
OpenAI 与软银集团合作,联合 SB Energy 开发多吉瓦级 AI 数据中心园区,其中包括一座位于得克萨斯州、容量 1.2 GW 的设施,用于支持 Stargate 计划。
推荐理由:OpenAI 与软银、SB Energy 合作建设多吉瓦数据中心,可了解 Stargate 的算力落地规模。
OpenAI 推出 OpenAI for Healthcare,提供安全的企业级 AI 并支持 HIPAA 合规。该产品旨在减轻行政负担并支持临床工作流。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,面向物理 AI,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:NVIDIA 开源视觉语言模型 Cosmos Reason 2 的升级细节,读者可据此判断物理 AI 场景的可用能力。
Mistral 发布文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出 Mistral OCR 3 相对上一代的胜率、定价与自托管选项,便于判断文档解析的落地成本。
llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持从 llama.cpp 缓存或 --models-dir 目录自动发现 GGUF 文件,按需加载,并在达到 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。
推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型动态切换与显存管理方式。
Hugging Face 推出 swift-huggingface,一个面向 Hub 的完整 Swift 客户端,可独立使用并即将集成进 swift-transformers 替代现有 HubApi。它提供完整 Hub API 覆盖、支持断点续传的下载、与 Python 兼容的共享缓存,以及 TokenProvider 认证和 OAuth 2.0 支持,Xet 存储后端即将上线。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天通过 pip 安装超 300 万次,累计安装量突破 12 亿。
推荐理由:官方梳理了 v5 在简化模型定义、训练与推理上的改动,可据此判断生态工具链的兼容方向。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该技术通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Tavily 分享了其构建 SOTA 深度研究智能体的经验,曾因第一版架构假设过时被迫推倒重建。其核心思路是简化编排逻辑、拥抱模型自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终结果时引入原始信息,以模拟人类研究方式。
OVHcloud 正式加入 Hugging Face Hub 的 Inference Provider 生态,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源权重模型。
Google 推出一款轻量级 EV 充电桩可用性预测模型,用简单线性回归预测某站点在未来若干分钟内是否有空闲充电口。模型以一天中各小时为特征,在 30 至 60 分钟时间跨度、100 个随机站点上评测,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的替代方案,让开发者用同一套 API 调用多种模型。
Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其 AI Foundation 提供完全自主的 AI 技术栈,并联合开发面向欧洲复杂行业与政府机构的行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还计划在未来数月内于德国开设办公室,并大幅扩充本地团队。
ServiceNow 将 15B 推理模型改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1x 吞吐,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降,总训练 76.8B token。
Hugging Face 的 kernels 库现已支持构建和共享 ROCm 兼容内核,可运行在 AMD GPU 上并集成进 PyTorch。指南以 RadeonFlow 的 FP8 GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,曾获 AMD Developer Challenge 2025 大奖。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自有 AI。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星星座搭载 TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。配套预印本论文《Towards a future space-based, highly scalable AI infrastructure system design》讨论了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的早期实测数据。
MiniMax M2 在智能体后训练中提出"交错思考"(Interleaved Thinking),让模型在任务任意阶段都能思考,以应对工具输出带来的外部扰动。团队发现单纯扩展工具数量无法带来真正泛化,转而构建覆盖工具信息、系统提示词、用户提示词、环境与工具响应全轨迹的数据管线。内部测试中,M2 在陌生"冷启动"框架下工具调用与指令遵循表现均超出预期。
Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。
NVIDIA Isaac for Healthcare v0.4 发布,提供基于 SO-ARM 的端到端入门工作流和"自带手术室"教程,让开发者从仿真、训练到部署自主医疗机器人。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、训练与真机部署,用于构建自主手术辅助机器人。
推荐理由:原文给出从仿真数据采集到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,读者可据此判断生产级 AI 基础设施的构成。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化或静态量化压缩模型,最后执行推理。
Arm 将于 10 月 22-23 日参展 PyTorch Conference,展位 P1 提供神经图形训练、音频生成、语音识别和智能体 AI 工作流等交互演示,并展示云端 vLLM 与 Mixture of Experts、面向移动与边缘 AI 的 ExecuTorch。