oMLX 作者 Jun Kim 加入 Hugging Face,支持 MLX 社区
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,保持 Apache 2.0 开源协议,仍由 Jun 继续领导,目标是提升稳定性并加快开发。Hugging Face 计划让 oMLX 充当新想法的试验场,并推动 transformers 模型定义更快落地为可供不同引擎使用的 MLX 参考实现。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,保持 Apache 2.0 开源协议,仍由 Jun 继续领导,目标是提升稳定性并加快开发。Hugging Face 计划让 oMLX 充当新想法的试验场,并推动 transformers 模型定义更快落地为可供不同引擎使用的 MLX 参考实现。
Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化检查点,通过 from_pretrained 传入 gguf_file 在本地生成,无需额外配置。
推荐理由:Hugging Face 官方给出在 transformers 中加载 GGUF 的具体方式与性能对比,读者可据此判断本地推理工作流是否值得迁移。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方披露了 SL2T 的训练规模、隐私设计与基准成绩,可据此判断手语翻译进入消费级产品的可行边界。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,新增结构化 CUDA-to-MLX 翻译层,让 CUDA 内核作为知识库被改写为 Apple Silicon 内核。
推荐理由:展示了把 CUDA 内核优化经验迁移到 Apple Silicon 的结构化翻译层,读者可了解跨硬件内核迁移的具体做法与实测差距。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。
Google Research 发布一种新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,作为端侧推理的即插即用加速方案,已部署到 Pixel 9 和 10 系列。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB VRAM 或统一内存的消费级笔记本上本地运行,并首次在中等规模模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体的硬件门槛。
Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。
H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。
推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。
Google 为隐私分析服务提出零信任聚合方案,将新型单次消息密码学聚合协议与 TEE 结合,设备无需多轮在线即可提交数据。该设计使原始数据在任何服务器内存中都不会被暴露或重建,仅在最终阶段处理已聚合匿名的数据,并通过 TEE 远程认证向参与者证明协议按公开代码正确执行。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖端侧到工作站,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调路径。
Google DeepMind 的 Gemma 4 多模态模型家族已在 Hugging Face 上线,采用 Apache 2 许可,支持图像、文本和音频输入并生成文本。
推荐理由:Gemma 4 以 Apache 2 许可开放五个尺寸并覆盖音频与端侧部署,读者可据此判断开源多模态模型的可用边界。
Google 发布 Vibe Coding XR 工作流,将 Gemini 的长上下文推理与开源 WebXR 框架 XR Blocks 结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。
Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。
Transformers.js v4 已在 NPM 发布,可通过 npm i @huggingface/transformers 安装。最大变化是采用完全用 C++ 重写的 WebGPU 运行时,与 ONNX Runtime 团队在约 200 个模型架构上测试,同一份代码可运行在浏览器、Node、Bun 和 Deno 等环境。
推荐理由:Transformers.js v4 换用 C++ 重写的 WebGPU 运行时,并给出 BERT 嵌入约 4 倍加速等具体数据,可据此判断浏览器端推理的性能变化。
Google Research 在 EMNLP 2025 发表的论文提出分解式意图提取方法:先用小型多模态 LLM 逐屏总结用户交互,再从摘要序列中提取意图,在移动端和网页轨迹上均优于 CoT 与端到端微调。该方法用 Gemini 1.5 Flash 8B 即可达到 Gemini 1.5 Pro 相当的效果,成本与速度更优,适用于端侧部署。
Google 提出基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 50 Hz IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。在 246 名参与者、约 7 万个步行片段的大规模验证中,多数指标达到 Pearson r >0.80、ICC >0.80,与 Pixel 6 手机估算结果无显著差异(p >0.05)。
Mistral 发布 Mistral 3 系列,包含 Mistral Large 3 与 Ministral 3(3B、8B、14B),全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 同时给出 675B 稀疏 MoE 大模型与 3B 到 14B 端侧系列,并公开 Apache 2.0 权重与部署格式,读者可据此判断开源前沿模型与端侧路线的分工。
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的替代方案,让开发者用同一套 API 调用多种模型。
Google Research 介绍一种端到端语音到语音翻译(S2ST)模型,可在保留原说话人音色的同时实现实时翻译,延迟仅 2 秒,而现有系统通常有 4–5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,读者可了解其数据管线与流式架构。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),对非结构化 GenAI 数据做分析,保证个体数据不可被查看、聚合结果匿名。
IBM 发布 Granite 4.0 家族中最小的 Granite 4.0 Nano,含 4 个 instruct 模型及对应 base 版本:Granite 4.0 H 1B(约 15 亿参数)与 H 350M(约 3.5 亿参数)采用 hybrid-SSM 架构,另有传统 Transformer 版 Granite 4.0 1B 和 350M。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化或静态量化压缩模型,最后执行推理。
Arm 将于 10 月 22-23 日参展 PyTorch Conference,展位 P1 提供神经图形训练、音频生成、语音识别和智能体 AI 工作流等交互演示,并展示云端 vLLM 与 Mixture of Experts、面向移动与边缘 AI 的 ExecuTorch。
Hugging Face 发布教程,介绍如何将小红书 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。方案用 Core ML 跑 1.2B 的 NaViT 视觉编码器、用 MLX 跑 Qwen2.5-1.5B 语言主干,并称 Neural Engine 能效比 CPU 高 12 倍、比 GPU 高 4 倍。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 为草稿模型做投机解码,生成速度提升约 1.3 倍。
Hugging Face 的 Swift 库 swift-transformers 发布 1.0 版本,为 Apple Silicon 平台上的本地模型推理提供 Tokenizers、Hub 和 Core ML 模型封装等组件。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前的英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,规模 600 万条。
Arm 与 ExecuTorch 0.7 beta 将默认启用 KleidiAI,为基于 Arm CPU 的设备带来自动加速,Android 与跨平台开发者无需改动代码即可获得性能优化。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库中可用,并发布 gemma-3n-E2B 与 gemma-3n-E4B 两个尺寸(各含 base 与 instruct 变体)。
推荐理由:原文给出 Gemma 3n 的端侧内存占用、多模态输入与各开源库接入方式,便于判断本地部署可行性。
Arm 工程师 Michael Gamble 用 Stable Audio Open 模型、PyTorch 和 TorchAudio 打造了一款完全在 Arm CPU 上本地运行的个人音效生成工具,无需 GPU 和云端推理,几秒内即可根据提示词生成 .wav 文件并直接导入 Ableton Live。
Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供可直接部署的模型与应用目录,支持 Meta Llama 4 Maverick。
Falcon-LLM 团队发布 Falcon-H1 系列六个开源模型,参数规模从 0.5B 到 34B,每个都提供 base 和 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用混合注意力与 SSM 架构覆盖 0.5B 到 34B,读者可据此判断小模型在长上下文与端侧场景的取舍。
Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。
Hugging Face 发布教程,介绍如何在本地通过 LM Studio 加载 4bit GGUF 量化的 OlympicCoder 7B,并接入 VS Code 的 Continue 扩展实现代码补全、生成、解释、重构和写测试。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。
Hugging Face 发布教程,演示如何用 React Native 和 llama.rn(llama.cpp 的绑定)构建可在 Android 与 iOS 上离线运行 LLM 的聊天应用,模型从 Hugging Face hub 下载 GGUF 文件,全程本地推理保证隐私。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三种参数规模,官方称 500M 与 256M 是目前最小的视频语言模型。
推荐理由:Hugging Face 官方发布三档小尺寸视频理解模型,并给出 MLX 与 iPhone 本地运行方案,可据此判断端侧视频理解的可行边界。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出单卡本地部署的量化条件,便于判断小模型落点。