Arm 将参展 PyTorch Conference,邀开发者现场体验 ExecuTorch 与 vLLM
Arm 将于 10 月 22-23 日参展 PyTorch Conference,展位 P1 提供神经图形训练、音频生成、语音识别和智能体 AI 工作流等交互演示,并展示云端 vLLM 与 Mixture of Experts、面向移动与边缘 AI 的 ExecuTorch。
Arm 将于 10 月 22-23 日参展 PyTorch Conference,展位 P1 提供神经图形训练、音频生成、语音识别和智能体 AI 工作流等交互演示,并展示云端 vLLM 与 Mixture of Experts、面向移动与边缘 AI 的 ExecuTorch。
AMD 与 OpenAI 宣布达成多年战略合作,将部署 6 吉瓦 AMD Instinct GPU,用于支撑 OpenAI 的下一代 AI 基础设施。其中首批 1 吉瓦将于 2026 年开始部署。
推荐理由:OpenAI 与 AMD 达成多年算力合作,读者可了解其分阶段部署规模与时间安排。
Hugging Face 发布教程,介绍如何将小红书 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。方案用 Core ML 跑 1.2B 的 NaViT 视觉编码器、用 MLX 跑 Qwen2.5-1.5B 语言主干,并称 Neural Engine 能效比 CPU 高 12 倍、比 GPU 高 4 倍。
三星与 SK 加入 OpenAI 的 Stargate 计划,以扩展全球 AI 基础设施。双方将扩大先进存储芯片生产,并在韩国建设下一代数据中心。
推荐理由:三星与 SK 加入 Stargate,读者可据此了解该计划在存储芯片与韩国数据中心上的落地方式。
OpenAI 构建了一个内部 AI 销售助手,用于自动化客户调研、会议准备、产品知识查询和客户跟进。该助手旨在提升销售生产力和客户成功团队的工作效率。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 为草稿模型做投机解码,生成速度提升约 1.3 倍。
针对 vibe coding 游戏随项目增长而失控的问题,作者推出 VibeGame——一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
ChatGPT 推出共享项目、更智能的连接器,并更新合规与安全能力,帮助团队更高效协作。新功能面向团队与工具协同场景,具体参数与可用性细节尚未公布。
OpenAI、Oracle 和 SoftBank 宣布为 Stargate 新增五个 AI 数据中心站点,推进总额 5000 亿美元、10 吉瓦的美国基础设施扩建,用于支撑下一代 AI 并创造数万个就业岗位。
推荐理由:Stargate 新增五个站点,读者可据此了解 5000 亿美元、10 吉瓦级 AI 基建的推进节奏。
OpenAI 与 NVIDIA 宣布战略合作,将部署 10 吉瓦由 NVIDIA 系统驱动的 AI 数据中心,首期于 2026 年启动。
推荐理由:OpenAI 与 NVIDIA 的 10 吉瓦算力合作给出了首期落地时间,读者可据此判断前沿模型的算力供给节奏。
Hugging Face 发布 SyGra,一个面向 LLM 与 SLM 的低代码/无代码数据构建框架,用于数据集的创建、转换与对齐。它支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可生成 Q&A、DPO 偏好对、推理及多语言数据,覆盖 SFT、DPO、RAG 等场景。
Hugging Face Hub 新增 Scaleway 为 Inference Provider,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开源权重模型。
Hugging Face Hub 新增 Public AI 作为 Inference Provider,用户可直接在模型页调用 Swiss AI Initiative、AI Singapore 等机构的公共主权模型。
Hugging Face 博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与 Paged Attention,以及更快的模型加载。
Together AI 与 Hugging Face 联合推出新能力,Hub 上任意兼容的 LLM 均可通过 Together AI 基础设施微调,支持公开和私有仓库,训练完成后可自动回传 Hub。该功能覆盖 100B 参数以下的所有 CausalLM 模型,用户只需几行 API 调用即可完成微调,无需自建训练基础设施。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。
Hugging Face 为 ZeroGPU Spaces 引入 PyTorch 提前(AoT)编译,让模型只需优化一次即可即时重载,在 Flux、Wan、LTX 等模型上取得 1.3×–1.8× 加速。
Hugging Face 发布 kernel-builder 库,开发者可在本地开发自定义 CUDA kernel,再针对多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
Arm 与 ExecuTorch 0.7 beta 将默认启用 KleidiAI,为基于 Arm CPU 的设备带来自动加速,Android 与跨平台开发者无需改动代码即可获得性能优化。
Arm 面向图形与游戏开发者发布 AI 超采样方案 Neural Super Sampling(NSS),基于 Arm Neural Technology 面向未来移动设备实时运行。
Hugging Face 在 Accelerate 中联合 Axolotl 集成了 ND-Parallel,让训练脚本可任意组合数据并行、FSDP、张量并行与上下文并行等策略。
OpenAI 发文介绍 Cursor 如何使用 GPT-5。原文未披露具体功能细节、参数或性能数据。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型,给出参数量、许可与部署定位,便于判断本地推理的可用边界。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
Mistral 通过 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上较基座模型显著提升,并减少了模型幻觉出的无效类别名。
OpenAI 在 OpenAI for Countries 计划下启动 Stargate Norway,这是其在欧洲的首个 AI 数据中心项目。Stargate 是 OpenAI 的整体基础设施平台,也是其长期愿景的关键部分。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比此前版本补全采纳率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估体系与架构设计,目标是引领客户支持的未来。内容围绕如何将 AI 能力沉淀为可持续的竞争优势展开。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘,并可同步到 Hugging Face Spaces 通过 URL 分享。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),配合 Hugging Face 的 Xet 存储层,可在重新上传、增删列、改列类型、追加行等场景下只传输变更的数据块,大幅降低传输与存储成本。
Hugging Face 将其 CLI 从 huggingface-cli 正式更名为 hf,命令按资源分组为 hf auth、hf cache、hf repo 等,旧命令仍可用但会提示弃用警告。
Hugging Face 发布教程,介绍如何用 Diffusers 和 PEFT 优化 Flux.1-Dev 的 LoRA 推理速度。方案组合 Flash Attention 3、torch.compile 和 FP8 量化,并通过 hotswap 机制避免切换 LoRA 时触发重新编译,在 H100 上相比基线取得 2.23 倍加速。
推荐理由:原文给出 Flux LoRA 推理的完整优化配方与实测数据,读者可据此在 H100 或 4090 上复现加速效果。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开两项指标:Mistral Large 2 截至 2025 年 1 月训练及 18 个月使用产生 20.4 ktCO₂e。
OpenAI 与 Oracle 达成协议,将在美国为 Stargate 开发 4.5 GW 的额外数据中心容量。OpenAI 称这笔投资将创造就业、加速美国再工业化,并推进美国在 AI 领域的领先地位,同时是 Stargate 这一 AI 基础设施平台的重要里程碑。
推荐理由:OpenAI 与 Oracle 就 Stargate 新增 4.5 GW 数据中心容量达成协议,读者可据此了解其美国 AI 基础设施扩张规模。
NVIDIA 宣布通过 NIM 推理微服务在 Hugging Face 上解锁超过 10 万个 LLM 的快速部署。NIM 现在提供单个 Docker 容器,可部署 TensorRT-LLM、vLLM 和 SGLang 支持的多种 LLM,自动识别模型格式、架构与量化方式并选择推理后端,无需手动配置。
推荐理由:NIM 用单个容器自动识别模型格式并选择推理后端,读者可据此判断多模型部署流程能简化到什么程度。
Hugging Face 官方宣布 Hub 存储后端从 Git LFS 迁移到 Xet,已有 50 万个仓库、20 PB 数据完成迁移,超过 100 万用户在用。迁移依靠 Git LFS Bridge 和后台迁移流程实现无硬切换,旧版客户端仍可正常上传下载。从本月起 Xet 将向所有用户开放,现有仓库会自动迁移,新仓库默认启用 Xet。
推荐理由:Hugging Face 官方复盘 Hub 从 Git LFS 迁移到 Xet 的工程细节,可了解大规模存储迁移如何做到对用户零打扰。
Hugging Face 发布博客详解异步机器人推理,将动作预测与动作执行解耦,让机器人在 PolicyServer 计算下一段动作时继续执行当前动作队列,从而消除推理等待。该方案在 SmolVLA 上实现约 2 倍任务完成提速,成功率相当,PolicyServer 与 RobotClient 通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 发布官方 MCP Server(hf.co/mcp),通过一个 URL 让 AI 助手访问 Hub 及 Spaces 上的数千个 AI 应用,并支持用户动态配置工具。生产环境采用 Streamable HTTP 传输的无状态 Direct Response 模式,开源代码同时支持 STDIO、SSE 和 Streamable HTTP 三种部署方式。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义 kernel——融合残差连接/RMS norm/FP8 转换、融合 SwiGLU 激活/FP8 转换以及 Skinny GEMM,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 以 nanoVLM 项目为例,分五个阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,随后依次采用受限填充、背包算法打包,并推出支持贪心与 binpack 策略的 ConstantLengthDataset,按 token 与图像数量打包样本。