Reachy Mini 通过 MCP 接入 Hugging Face Spaces 远程工具
Reachy Mini 对话应用现已支持通过 MCP 调用托管在公开 Hugging Face Spaces 上的工具,用户只需执行 `reachy-mini-conversation-app tool-spaces add` 命令即可为机器人添加天气查询、网页搜索等能力,无需修改应用代码。
Reachy Mini 对话应用现已支持通过 MCP 调用托管在公开 Hugging Face Spaces 上的工具,用户只需执行 `reachy-mini-conversation-app tool-spaces add` 命令即可为机器人添加天气查询、网页搜索等能力,无需修改应用代码。
H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。
推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。
推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的可行边界。
Hugging Face 发布 OlmoEarth v1.1 地球观测模型系列,在保持 v1 性能的同时将计算成本最高降低 3 倍。该系列通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,并修改预训练方案以避免性能下降,提供 Base、Tiny、Nano 三种规模权重及训练代码。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数量覆盖 17m、32m、68m、150m、400m 到 1b,均基于 Ettin ModernBERT 编码器,在同尺寸下达到 SOTA。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5、PaddleOCR-VL 1.5 等模型。
Hugging Face 发布两款基于 ModernBERT 的 Apache 2.0 多语言嵌入模型:97M 参数的 granite-embedding-97m-multilingual-r2 在 MTEB Multilingual Retrieval 上得分 60.3。
Hugging Face 发文解析连续批处理中的同步瓶颈:用 8B 模型、batch size 32 生成 8K tokens 时,总耗时 300.6 秒,其中 24.0% 的时间 GPU 在等待 CPU,纯属浪费。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、脚本化与对话语音的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。
IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。
推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。
DeepInfra 正式成为 Hugging Face Hub 支持的推理服务商,首批上线对话与文本生成任务,可访问 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开源权重模型。
Hugging Face 博客介绍如何基于 OpenAI 本周在 Hub 上开源的 Privacy Filter 构建三个 Web 应用。该模型是 1.5B 参数、50M 激活参数的 PII 检测器,Apache 2.0 许可,单次前向处理 128k 上下文,可标注八类 PII,并在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章用三个可运行示例拆解 gradio.Server 的队列与路由分工,读者可据此复用这套前后端拆分模式。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并以官方发布的 Gemma 4 浏览器助手扩展为参照。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本分工的架构取舍。
Hugging Face 发布 QIMMA قِمّة,一个在评测模型前先验证基准质量的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。
Hugging Face 发布一个 Skill 和配套测试工具,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试工具,读者可了解其流程与对评审者的减负设计。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。
Sentence Transformers 现已支持训练和微调多模态嵌入与重排序模型,作者以微调 Qwen/Qwen3-VL-Embedding-2B 做视觉文档检索(VDR)为例演示流程。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。
Sentence Transformers 发布 v5.4,可在同一套 API 下编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持模型。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此评估跨模态检索的落地成本。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可实时生成最高 720p、60 FPS 的环境,并新增面向更广消费级硬件的 360p 版本,后续将支持 Apple Silicon Mac。
推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级显卡,读者可据此判断本地生成式世界的硬件门槛变化。
Safetensors 已加入 PyTorch 基金会,成为 Linux 基金会下由基金会托管的项目,与 DeepSpeed、Helion、Ray、vLLM 和 PyTorch 并列。
Google DeepMind 的 Gemma 4 多模态模型家族已在 Hugging Face 上线,采用 Apache 2 许可,支持图像、文本和音频输入并生成文本。
推荐理由:Gemma 4 以 Apache 2 许可开放五个尺寸并覆盖音频与端侧部署,读者可据此判断开源多模态模型的可用边界。
TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词表定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干感知路线相对模块化管线的取舍。
Hugging Face 发布 gradio.Server,它扩展自 FastAPI,让开发者用 React、Svelte 或原生 HTML/JS 等任意前端搭配 Gradio 的队列、SSE 流式、并发控制和 gradio_client 兼容能力。
推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。
IBM 发布 Granite 4.0 3B Vision,一款面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可并在 Hugging Face 上线。
推荐理由:Granite 4.0 3B Vision 以 3B 规模在图表与表格抽取基准上超过更大模型,并给出 LoRA 适配器与 Docling 集成路径。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为带明确稳定性契约的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。
推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型。
Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 给出两条把 OpenClaw、Pi 或 Open Code 智能体迁移到开源模型的路径。
推荐理由:给出两条把 OpenClaw 等智能体从 Claude 迁到开源模型的路径,含具体命令与配置,可直接照做。
ServiceNow 在 Hugging Face 发布 EVA,一个面向对话式语音智能体的端到端评测框架,同时给出 EVA-A(准确率)和 EVA-X(体验)两个分数,并开源代码与数据集。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可生成带情感表达的语音。
推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开与 ElevenLabs 的人工对比结果。
NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。
推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,中国模型下载占比与机器人数据集增长是两条主线。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态 computer-use 模型,现已上线 Hugging Face,采用 NVIDIA Open Model License。
推荐理由:原文给出模型架构、吞吐对比与基准提升,读者可据此判断它在高并发 computer-use 场景的可用性。
Hugging Face 发布对 16 个开源异步 RL 训练库的调研,按编排原语、rollout 缓冲设计、权重同步协议、陈旧度管理、部分 rollout 处理、LoRA 支持和分布式训练后端七个维度进行对比。
Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 风格对象存储,用于存放 checkpoint、优化器状态、处理后的数据分片和 Agent traces 等频繁变动的中间产物。
推荐理由:Hugging Face 官方发布可变对象存储 Buckets,读者可据此判断训练中间产物该放在哪一层。
Hugging Face 博客介绍 Ulysses 序列并行(来自 Snowflake AI Research 的 ALST 协议),通过按注意力头切分并配合 all-to-all 通信,把长序列注意力计算分散到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
Hugging Face 发布 LeRobot v0.5.0,这是该项目迄今最大的一次更新,自 v0.4.0 以来合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:LeRobot v0.5.0 一次性补齐人形机器人、VLA 策略与仿真环境加载,可据此判断开源机器人栈的当前边界。
Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。