LeRobot v0.5.0 发布:首次支持 Unitree G1 人形机器人
Hugging Face 发布 LeRobot v0.5.0,这是该项目迄今最大的一次更新,自 v0.4.0 以来合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:LeRobot v0.5.0 一次性补齐人形机器人、VLA 策略与仿真环境加载,可据此判断开源机器人栈的当前边界。
Hugging Face 发布 LeRobot v0.5.0,这是该项目迄今最大的一次更新,自 v0.4.0 以来合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:LeRobot v0.5.0 一次性补齐人形机器人、VLA 策略与仿真环境加载,可据此判断开源机器人栈的当前边界。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲学术与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。该资源旨在支持非洲语言语音识别与合成系统的开发,并计划持续扩充语言种类。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。
Hugging Face 发布 Modular Diffusers,用可复用的块组合扩散流水线,作为现有 DiffusionPipeline 类的更灵活替代方案。每个块自带输入输出,可独立运行或增删替换,并支持自定义块发布到 Hub 供他人以 trust_remote_code=True 加载。该功能还与节点式可视化界面 Mellon 集成,可从块定义自动生成节点 UI。
推荐理由:Hugging Face 官方介绍 Modular Diffusers 的可组合块机制,读者可据此判断扩散流水线搭建方式的改动。
Photoroom 在 Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元预算在 24 小时内训练出一个文生图扩散模型。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Hugging Face 发文介绍 transformers 库为 Mixture of Experts 模型所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 做的加载、后端与并行改造,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 宣布 GGML(llama.cpp 的创建者)加入 HF,Georgi Gerganov 及团队一同加入,目标是持续支持 ggml 与 llama.cpp 社区,推动本地 AI 发展。
推荐理由:GGML 与 llama.cpp 团队加入 Hugging Face,读者可了解本地推理项目在资源与维护方式上的变化。
Hugging Face 构建了一个 Agent Skill,教编码智能体编写生产级 CUDA kernel,并让 Claude 和 Codex 分别针对 diffusers 的 LTX-Video 和 transformers 的 Qwen3-8B 生成可用 kernel,包含正确的 PyTorch 绑定与基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识封装成 Agent Skill,并给出两个真实模型的端到端基准数据,可据此判断这类技能包的实际收益。
Meta 与 Hugging Face 联合推出的开源框架 OpenEnv 用于在真实系统而非模拟环境中评测 AI 智能体,Turing 为其贡献了生产级日历管理环境 Calendar Gym。
推荐理由:OpenEnv 与 Calendar Gym 的实测数据揭示了工具型智能体在多步推理和歧义解析上的具体瓶颈,可迁移到其他 Agent 评测设计。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:官方给出两款语音转写模型的延迟、错误率与价格对比,便于判断实时语音场景的落地成本。
Hugging Face 在 Hub 上线 Community Evals,基准数据集仓库可注册为 benchmark 并在数据集卡片展示排行榜,模型仓库用 .eval_results/*.yaml 存放评测分数。
推荐理由:Hugging Face 把评测结果从黑箱榜单搬到 Hub 上公开聚合,读者可据此了解评测透明化的一种新做法。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;Kimi K2、GLM-4.5、MiniMax M2 等模型相继开源,Kimi K2 被广泛称为"另一个 DeepSeek 时刻"。
Hugging Face 发布新工具 upskill,可用 Claude Opus 4.5 等大模型生成并评测 agent skill,再迁移给更小或本地模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测方法,可复用到其他领域任务。
中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。
Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。
Hugging Face 博客复盘了用 verl 框架对 GPT-OSS-20B 做 Agentic RL 训练时遇到的问题:训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双次前向传播导致新旧 log-prob 不匹配,使 PPO 的 importance sampling ratio 偏离 1。
Mistral AI 团队在预生产测试中发现,vLLM 搭配 Mistral Medium 3.1 并启用图编译时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
DeepSeek 于 2025 年 1 月发布 R-1 模型,一年后成为 Hugging Face 史上获赞最多的模型,其 MIT 许可让推理能力可下载、蒸馏和微调,推动中国开源 AI 生态成型。
OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API,面向智能体场景设计。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 试用早期访问版本。
推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解 Responses API 开源化后的关键变化与迁移路径。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。官方称其在 CT 病变分类上绝对准确率较 MedGemma 1 提升 3%(61% vs. 58%),MRI 提升 14%(65% vs. 51%),MedQA 提升 5%(69% vs. 64%)。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,面向物理 AI,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:NVIDIA 开源视觉语言模型 Cosmos Reason 2 的升级细节,读者可据此判断物理 AI 场景的可用能力。
Google Research 回顾 2025 年成果:Gemini 3 成为其事实性最强的 LLM,在 SimpleQA Verified 和与 Google DeepMind、Kaggle 联合发布的新 FACTS 基准上达到 SOTA。
Hugging Face 发布 Transformers v5,将 tokenizer 架构与训练词表分离,类似 PyTorch 分离网络结构与权重,使 tokenizer 可检查、可定制、可从零训练。v5 引入清晰的类层级和单一快速后端,并保留 BPE、Unigram、WordPiece 等算法支持。
CUGA(Configurable Generalist Agent)在 Hugging Face Spaces 上线演示,这是一个 Apache 2.0 开源的可配置通用 AI 智能体,支持跨 Web 与 API 的多步任务。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和可配置推理模式,为评估通用智能体框架提供了具体参照。
Google 联合 SisonkeBiotik、Ro'ya、DS-I Africa 举办非洲健康数据科学 Ideathon,从 30 多份提交中选出六支决赛团队,使用 MedGemma、TxGemma、MedSigLIP 等开放健康 AI 模型开发医疗方案。
llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持从 llama.cpp 缓存或 --models-dir 目录自动发现 GGUF 文件,按需加载,并在达到 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。
推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型动态切换与显存管理方式。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端机器学习实验,包括数据集校验、硬件选择、提交训练任务、监控进度、评测与导出 GGUF。
推荐理由:原文给出 Codex 结合 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。
OpenAI 在 Linux 基金会下联合发起 Agentic AI Foundation,并将 AGENTS.md 捐赠给该基金会,用于支持安全智能体 AI 的开放、可互操作标准。
推荐理由:OpenAI 把 AGENTS.md 交给 Linux 基金会下的新组织,读者可据此观察智能体标准由谁主导。
Hugging Face 推出 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交微调任务到云端 GPU、监控进度并把模型推送到 Hub。
推荐理由:Hugging Face 把微调流程封装成 Claude Code 可调用的 Skill,读者可据此了解对话式训练的实际操作与成本。
Mistral 发布 Mistral 3 系列,包含 Mistral Large 3 与 Ministral 3(3B、8B、14B),全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 同时给出 675B 稀疏 MoE 大模型与 3B 到 14B 端侧系列,并公开 Apache 2.0 权重与部署格式,读者可据此判断开源前沿模型与端侧路线的分工。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天通过 pip 安装超 300 万次,累计安装量突破 12 亿。
推荐理由:官方梳理了 v5 在简化模型定义、训练与推理上的改动,可据此判断生态工具链的兼容方向。
Hugging Face Diffusers 官方博客宣布支持 FLUX.2,提供 Flux2Pipeline 与 Flux2Transformer2DModel 的调用示例,文本编码器使用 Mistral3ForConditionalGeneration。
推荐理由:Diffusers 集成 FLUX.2 并给出可直接运行的代码示例,读者可据此了解该模型的调用方式与显存门槛。
OVHcloud 正式加入 Hugging Face Hub 的 Inference Provider 生态,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源权重模型。
Hugging Face TRL 官方集成 RapidFire AI,用户可用 RFSFTConfig、RFDPOConfig、RFGRPOConfig 近乎零代码替换原有 SFT/DPO/GRPO 配置,并发运行多个微调配置。
推荐理由:官方集成给出了并发配置对比的调度机制与实测加速数据,可据此判断微调实验流程能压缩多少时间。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 个开源与闭源模型的 ASR 趋势预印本。
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的替代方案,让开发者用同一套 API 调用多种模型。
Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其 AI Foundation 提供完全自主的 AI 技术栈,并联合开发面向欧洲复杂行业与政府机构的行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还计划在未来数月内于德国开设办公室,并大幅扩充本地团队。
Google DeepMind 在新加坡开设新研究实验室,聚焦推进 Gemini 核心能力与亚太语言文化包容性研究,其亚太团队过去一年规模已增长逾一倍。新实验室将与当地政府、企业和学术机构合作,并延续与 AI Singapore 共建 SEA-LION 等项目,其中 SEA-LION v4 基于 Gemma 3 的多模态能力构建。
Hugging Face 的 kernels 库现已支持构建和共享 ROCm 兼容内核,可运行在 AMD GPU 上并集成进 PyTorch。指南以 RadeonFlow 的 FP8 GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,曾获 AMD Developer Challenge 2025 大奖。