Hugging Face 联合发起 RiskRubric.ai,为 50 万+ 模型提供标准化风险评估
Cloud Security Alliance 与 Noma Security 主导、Haize Labs 和 Harmonic Security 参与发起 RiskRubric.ai,对 Hugging Face hub 上超 50 万个模型按透明度、可靠性、安全、隐私、防护、声誉六个维度打分,输出 0-100 分及 A-F 等级。
Cloud Security Alliance 与 Noma Security 主导、Haize Labs 和 Harmonic Security 参与发起 RiskRubric.ai,对 Hugging Face hub 上超 50 万个模型按透明度、可靠性、安全、隐私、防护、声誉六个维度打分,输出 0-100 分及 A-F 等级。
Hugging Face Hub 新增 Public AI 作为 Inference Provider,用户可直接在模型页调用 Swiss AI Initiative、AI Singapore 等机构的公共主权模型。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
Hugging Face 在 Gradio 中推出可见水印功能,只需一条命令即可为 AI 生成的图像、视频和文本添加水印。图像和视频通过 watermark 参数指定水印文件,文本则在 Chatbot 组件中设置 watermark,用户复制 AI 回复时会自动附带署名。水印支持文件名、图像或 numpy 数组,还可使用 QR 水印。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两个推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与 Paged Attention,以及更快的模型加载。
Together AI 与 Hugging Face 联合推出新能力,Hub 上任意兼容的 LLM 均可通过 Together AI 基础设施微调,支持公开和私有仓库,训练完成后可自动回传 Hub。该功能覆盖 100B 参数以下的所有 CausalLM 模型,用户只需几行 API 调用即可完成微调,无需自建训练基础设施。
Hugging Face 发布 Jupyter Agent 项目,通过清洗约 2TB Kaggle notebook 构建 51k 合成 notebook、近 0.2B token 的数据集,并用 TRL 全参数微调 Qwen3-4B。
推荐理由:完整披露了从 Kaggle notebook 清洗到 SFT 的数据管线与消融结果,可迁移到其他小模型智能体训练。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在超 3T token、1800 多种语言上训练,是首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用三阶段训练与逆掩码率调度(30%→15%→5%),在 GLUE 和 XTREME 基准上显著领先 XLM-R 与 mGTE。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。
SandboxAQ 将其 Structurally Augmented IC50 Repository(SAIR)数据集上线 Hugging Face,以 CC BY 4.0 许可免费开放,包含 5.24 million 个 AI 生成的蛋白质-配体 3D 复合物结构,每个结构均配 ChEMBL 或 BindingDB 的实验 IC₅₀ 数据。
Hugging Face 为 ZeroGPU Spaces 引入 PyTorch 提前(AoT)编译,让模型只需优化一次即可即时重载,在 Flux、Wan、LTX 等模型上取得 1.3×–1.8× 加速。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前的英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,规模 600 万条。
通过 Hugging Face MCP Server 将 Claude 连接至 Hugging Face Spaces,即可调用 FLUX.1 Krea [dev] 和 Qwen-Image 等模型生成图像。
Hugging Face 发布 Research Tracker MCP,让 AI 通过自然语言调用研究工具,自动完成论文、代码、模型与数据集的跨平台检索和交叉引用。
Hugging Face 发布 kernel-builder 库,开发者可在本地开发自定义 CUDA kernel,再针对多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
Kimina Prover 团队开源了 kimina-prover-rl 训练流水线,用于在 Lean 4 中训练形式化定理证明模型,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容开源 Verl 框架。
Hugging Face 推出 FilBench 评测套件,覆盖文化知识、经典 NLP、阅读理解与生成四大类共 12 项任务,用于评估 LLM 在 Tagalog、Filipino 和 Cebuano 上的表现,并已评测 20+ 个 SOTA 模型。
Hugging Face 在 Accelerate 中联合 Axolotl 集成了 ND-Parallel,让训练脚本可任意组合数据并行、FSDP、张量并行与上下文并行等策略。
Hugging Face 发布开源无代码工具 AI Sheets,可在本地或 Hub 上部署,通过类似电子表格的界面用提示词新建列来构建、转换和丰富数据集。工具可调用 Hub 上数千个开放模型(含 OpenAI 的 gpt-oss),支持模型对比、提示词迭代、数据分类与合成数据生成,并可导出到 Hub 生成可复用配置,配合 HF Jobs 脚本扩展至更大规模数据生成。
推荐理由:Hugging Face 官方开源的无代码数据集工具,读者可了解如何用开放模型批量构建、清洗和评测数据。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐方法支持,包括 Mixed Preference Optimization(MPO)、Group Relative Policy Optimization(GRPO)和 Group Sequence Policy Optimization(GSPO),并扩展 RLOO 与 Online DPO 到多模态场景。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
NVIDIA 的 AI-Q Blueprint 在 DeepResearch Bench 的 Hugging Face "LLM with Search" 榜单上以 40.52 分登顶,成为排名最高的全开源许可方案。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成 STEM 选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码任务。
Hugging Face 博客介绍如何用 Gradio 的 MCP 集成在 Python 中实现 MCP 服务器,构建一个能浏览服装网站并调用 IDM-VTON 虚拟试穿模型的 AI 购物助手。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘,并可同步到 Hugging Face Spaces 通过 URL 分享。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),配合 Hugging Face 的 Xet 存储层,可在重新上传、增删列、改列类型、追加行等场景下只传输变更的数据块,大幅降低传输与存储成本。
Hugging Face 将其 CLI 从 huggingface-cli 正式更名为 hf,命令按资源分组为 hf auth、hf cache、hf repo 等,旧命令仍可用但会提示弃用警告。
TimeScope 是一个开源长视频理解基准,通过在 1 分钟到 8 小时的基础视频中插入 5-10 秒的短片段作为“针”,评测模型的局部检索、信息综合和细粒度时序感知三项能力。
Hugging Face 发布教程,介绍如何用 Diffusers 和 PEFT 优化 Flux.1-Dev 的 LoRA 推理速度。方案组合 Flash Attention 3、torch.compile 和 FP8 量化,并通过 hotswap 机制避免切换 LoRA 时触发重新编译,在 H100 上相比基线取得 2.23 倍加速。
推荐理由:原文给出 Flux LoRA 推理的完整优化配方与实测数据,读者可据此在 H100 或 4090 上复现加速效果。
NVIDIA 宣布通过 NIM 推理微服务在 Hugging Face 上解锁超过 10 万个 LLM 的快速部署。NIM 现在提供单个 Docker 容器,可部署 TensorRT-LLM、vLLM 和 SGLang 支持的多种 LLM,自动识别模型格式、架构与量化方式并选择推理后端,无需手动配置。
推荐理由:NIM 用单个容器自动识别模型格式并选择推理后端,读者可据此判断多模型部署流程能简化到什么程度。
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默基因对(部分)未见细胞类型的影响,即"上下文泛化"。
Gradio 5.38.0 为 MCP Servers 带来五项改进:新增 "File Upload" MCP server 让智能体直接上传本地文件,支持实时进度通知,并可通过 gr.load_openapi 一行代码将 OpenAPI 规范转为 MCP 工具。
Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。
在 Gradio Agents & MCP Hackathon 期间构建的多 LLM 平台 Consilium,让多个 AI 模型围绕复杂问题展开结构化辩论并达成共识,同时提供可视化 Gradio 界面和可接入 Cline 的 MCP server。
Hugging Face 发布 Ettin Suite,这是首个用完全相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 到 1B。
Hugging Face 官方宣布 Hub 存储后端从 Git LFS 迁移到 Xet,已有 50 万个仓库、20 PB 数据完成迁移,超过 100 万用户在用。迁移依靠 Git LFS Bridge 和后台迁移流程实现无硬切换,旧版客户端仍可正常上传下载。从本月起 Xet 将向所有用户开放,现有仓库会自动迁移,新仓库默认启用 Xet。
推荐理由:Hugging Face 官方复盘 Hub 从 Git LFS 迁移到 Xet 的工程细节,可了解大规模存储迁移如何做到对用户零打扰。
Numina 与 Kimi 团队发布 Kimina-Prover-72B 形式化定理证明模型,基于 Qwen2.5-72B 并用 Kimi k1.5 的 RL 流程训练,同时开源 8B 和 1.7B 蒸馏版本。
Hugging Face 发布博客详解异步机器人推理,将动作预测与动作执行解耦,让机器人在 PolicyServer 计算下一段动作时继续执行当前动作队列,从而消除推理等待。该方案在 SmolVLA 上实现约 2 倍任务完成提速,成功率相当,PolicyServer 与 RobotClient 通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 发布 Python 库 ScreenEnv,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 智能体(Computer Use 智能体)。
推荐理由:Hugging Face 开源 ScreenEnv,给出 Docker 沙箱与 MCP 两种接入方式,可据此判断桌面智能体的部署路径。