AnyLanguageModel 发布:为 Apple 平台本地与远程 LLM 提供统一 API
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的替代方案,让开发者用同一套 API 调用多种模型。
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的替代方案,让开发者用同一套 API 调用多种模型。
Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其 AI Foundation 提供完全自主的 AI 技术栈,并联合开发面向欧洲复杂行业与政府机构的行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还计划在未来数月内于德国开设办公室,并大幅扩充本地团队。
ServiceNow 将 15B 推理模型改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1x 吞吐,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降,总训练 76.8B token。
Hugging Face 的 kernels 库现已支持构建和共享 ROCm 兼容内核,可运行在 AMD GPU 上并集成进 PyTorch。指南以 RadeonFlow 的 FP8 GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,曾获 AMD Developer Challenge 2025 大奖。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自有 AI。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星星座搭载 TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。配套预印本论文《Towards a future space-based, highly scalable AI infrastructure system design》讨论了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的早期实测数据。
MiniMax M2 在智能体后训练中提出"交错思考"(Interleaved Thinking),让模型在任务任意阶段都能思考,以应对工具输出带来的外部扰动。团队发现单纯扩展工具数量无法带来真正泛化,转而构建覆盖工具信息、系统提示词、用户提示词、环境与工具响应全轨迹的数据管线。内部测试中,M2 在陌生"冷启动"框架下工具调用与指令遵循表现均超出预期。
Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。
NVIDIA Isaac for Healthcare v0.4 发布,提供基于 SO-ARM 的端到端入门工作流和"自带手术室"教程,让开发者从仿真、训练到部署自主医疗机器人。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、训练与真机部署,用于构建自主手术辅助机器人。
推荐理由:原文给出从仿真数据采集到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,读者可据此判断生产级 AI 基础设施的构成。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化或静态量化压缩模型,最后执行推理。
Arm 将于 10 月 22-23 日参展 PyTorch Conference,展位 P1 提供神经图形训练、音频生成、语音识别和智能体 AI 工作流等交互演示,并展示云端 vLLM 与 Mixture of Experts、面向移动与边缘 AI 的 ExecuTorch。
AMD 与 OpenAI 宣布达成多年战略合作,将部署 6 吉瓦 AMD Instinct GPU,用于支撑 OpenAI 的下一代 AI 基础设施。其中首批 1 吉瓦将于 2026 年开始部署。
推荐理由:OpenAI 与 AMD 达成多年算力合作,读者可了解其分阶段部署规模与时间安排。
Hugging Face 发布教程,介绍如何将小红书 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。方案用 Core ML 跑 1.2B 的 NaViT 视觉编码器、用 MLX 跑 Qwen2.5-1.5B 语言主干,并称 Neural Engine 能效比 CPU 高 12 倍、比 GPU 高 4 倍。
三星与 SK 加入 OpenAI 的 Stargate 计划,以扩展全球 AI 基础设施。双方将扩大先进存储芯片生产,并在韩国建设下一代数据中心。
推荐理由:三星与 SK 加入 Stargate,读者可据此了解该计划在存储芯片与韩国数据中心上的落地方式。
OpenAI 构建了一个内部 AI 销售助手,用于自动化客户调研、会议准备、产品知识查询和客户跟进。该助手旨在提升销售生产力和客户成功团队的工作效率。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 为草稿模型做投机解码,生成速度提升约 1.3 倍。
针对 vibe coding 游戏随项目增长而失控的问题,作者推出 VibeGame——一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
ChatGPT 推出共享项目、更智能的连接器,并更新合规与安全能力,帮助团队更高效协作。新功能面向团队与工具协同场景,具体参数与可用性细节尚未公布。
OpenAI、Oracle 和 SoftBank 宣布为 Stargate 新增五个 AI 数据中心站点,推进总额 5000 亿美元、10 吉瓦的美国基础设施扩建,用于支撑下一代 AI 并创造数万个就业岗位。
推荐理由:Stargate 新增五个站点,读者可据此了解 5000 亿美元、10 吉瓦级 AI 基建的推进节奏。
OpenAI 与 NVIDIA 宣布战略合作,将部署 10 吉瓦由 NVIDIA 系统驱动的 AI 数据中心,首期于 2026 年启动。
推荐理由:OpenAI 与 NVIDIA 的 10 吉瓦算力合作给出了首期落地时间,读者可据此判断前沿模型的算力供给节奏。
Hugging Face 发布 SyGra,一个面向 LLM 与 SLM 的低代码/无代码数据构建框架,用于数据集的创建、转换与对齐。它支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可生成 Q&A、DPO 偏好对、推理及多语言数据,覆盖 SFT、DPO、RAG 等场景。
Hugging Face Hub 新增 Scaleway 为 Inference Provider,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开源权重模型。
Hugging Face Hub 新增 Public AI 作为 Inference Provider,用户可直接在模型页调用 Swiss AI Initiative、AI Singapore 等机构的公共主权模型。
Hugging Face 博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与 Paged Attention,以及更快的模型加载。
Together AI 与 Hugging Face 联合推出新能力,Hub 上任意兼容的 LLM 均可通过 Together AI 基础设施微调,支持公开和私有仓库,训练完成后可自动回传 Hub。该功能覆盖 100B 参数以下的所有 CausalLM 模型,用户只需几行 API 调用即可完成微调,无需自建训练基础设施。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。
Hugging Face 为 ZeroGPU Spaces 引入 PyTorch 提前(AoT)编译,让模型只需优化一次即可即时重载,在 Flux、Wan、LTX 等模型上取得 1.3×–1.8× 加速。
Hugging Face 发布 kernel-builder 库,开发者可在本地开发自定义 CUDA kernel,再针对多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
Arm 与 ExecuTorch 0.7 beta 将默认启用 KleidiAI,为基于 Arm CPU 的设备带来自动加速,Android 与跨平台开发者无需改动代码即可获得性能优化。
Arm 面向图形与游戏开发者发布 AI 超采样方案 Neural Super Sampling(NSS),基于 Arm Neural Technology 面向未来移动设备实时运行。
Hugging Face 在 Accelerate 中联合 Axolotl 集成了 ND-Parallel,让训练脚本可任意组合数据并行、FSDP、张量并行与上下文并行等策略。
OpenAI 发文介绍 Cursor 如何使用 GPT-5。原文未披露具体功能细节、参数或性能数据。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型,给出参数量、许可与部署定位,便于判断本地推理的可用边界。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
Mistral 通过 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上较基座模型显著提升,并减少了模型幻觉出的无效类别名。
OpenAI 在 OpenAI for Countries 计划下启动 Stargate Norway,这是其在欧洲的首个 AI 数据中心项目。Stargate 是 OpenAI 的整体基础设施平台,也是其长期愿景的关键部分。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比此前版本补全采纳率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。