Hugging Face 发布 Smol2Operator:基于 SmolVLM2-2.2B 的后训练 GUI 智能体
Hugging Face 发布 Smol2Operator,用两阶段训练把无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 变成能理解并操作图形界面的智能体。
Hugging Face 发布 Smol2Operator,用两阶段训练把无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 变成能理解并操作图形界面的智能体。
Hugging Face 发布 SyGra,一个面向 LLM 与 SLM 的低代码/无代码数据构建框架,用于数据集的创建、转换与对齐。它支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可生成 Q&A、DPO 偏好对、推理及多语言数据,覆盖 SFT、DPO、RAG 等场景。
Hugging Face 博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与 Paged Attention,以及更快的模型加载。
Hugging Face 为 ZeroGPU Spaces 引入 PyTorch 提前(AoT)编译,让模型只需优化一次即可即时重载,在 Flux、Wan、LTX 等模型上取得 1.3×–1.8× 加速。
通过 Hugging Face MCP Server 将 Claude 连接至 Hugging Face Spaces,即可调用 FLUX.1 Krea [dev] 和 Qwen-Image 等模型生成图像。
Hugging Face 发布 Research Tracker MCP,让 AI 通过自然语言调用研究工具,自动完成论文、代码、模型与数据集的跨平台检索和交叉引用。
Hugging Face 发布 kernel-builder 库,开发者可在本地开发自定义 CUDA kernel,再针对多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
Hugging Face 在 Accelerate 中联合 Axolotl 集成了 ND-Parallel,让训练脚本可任意组合数据并行、FSDP、张量并行与上下文并行等策略。
OpenAI 发布文章介绍 GPT-5 在编码与设计方面带来的新可能,但摘要未给出具体功能、能力数据或使用方式。
Mistral 通过 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上较基座模型显著提升,并减少了模型幻觉出的无效类别名。
Hugging Face 博客介绍如何用 Gradio 的 MCP 集成在 Python 中实现 MCP 服务器,构建一个能浏览服装网站并调用 IDM-VTON 虚拟试穿模型的 AI 购物助手。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),配合 Hugging Face 的 Xet 存储层,可在重新上传、增删列、改列类型、追加行等场景下只传输变更的数据块,大幅降低传输与存储成本。
Hugging Face 发布教程,介绍如何用 Diffusers 和 PEFT 优化 Flux.1-Dev 的 LoRA 推理速度。方案组合 Flash Attention 3、torch.compile 和 FP8 量化,并通过 hotswap 机制避免切换 LoRA 时触发重新编译,在 H100 上相比基线取得 2.23 倍加速。
推荐理由:原文给出 Flux LoRA 推理的完整优化配方与实测数据,读者可据此在 H100 或 4090 上复现加速效果。
Hugging Face 发布博客详解异步机器人推理,将动作预测与动作执行解耦,让机器人在 PolicyServer 计算下一段动作时继续执行当前动作队列,从而消除推理等待。该方案在 SmolVLA 上实现约 2 倍任务完成提速,成功率相当,PolicyServer 与 RobotClient 通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 发布官方 MCP Server(hf.co/mcp),通过一个 URL 让 AI 助手访问 Hub 及 Spaces 上的数千个 AI 应用,并支持用户动态配置工具。生产环境采用 Streamable HTTP 传输的无状态 Direct Response 模式,开源代码同时支持 STDIO、SSE 和 Streamable HTTP 三种部署方式。
Hugging Face 博客介绍如何通过 Gradio MCP 服务器为 LLM 增加新能力。Gradio 5.28.0 起支持 MCP 协议,Hugging Face Spaces 上数千个 AI 应用因此可作为 MCP 服务器接入 Cursor、Claude Code、Cline 等客户端。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义 kernel——融合残差连接/RMS norm/FP8 转换、融合 SwiGLU 激活/FP8 转换以及 Skinny GEMM,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 以 nanoVLM 项目为例,分五个阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,随后依次采用受限填充、背包算法打包,并推出支持贪心与 binpack 策略的 ConstantLengthDataset,按 token 与图像数量打包样本。
Hugging Face 基础设施团队公开了支撑其生产环境的三大关键告警机制,包括 NAT 网关吞吐量告警和 Hub 请求日志归档成功率告警。NAT 网关告警在流量超过预设静态阈值时触发,用于发现异常流量峰值并优化成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成日志的采集、加工与存储。
Sentence Transformers 现已支持训练和微调稀疏嵌入模型,可产出如 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 这类低成本模型,适合混合检索或先检索后重排场景。
Hugging Face 发布教程,介绍用 QLoRA 和 diffusers 库在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以内。在 RTX 4090 上,QLoRA 微调峰值显存约 9GB,而 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。
TNG 在 24 块 H100 上自托管多个大语言模型,每日消耗超 1 亿 token、生成超 1000 万 token,发现 vLLM 默认 chunked-prefill 会顺序调度不同请求的 prefill,单个长提示词请求会阻塞后续请求,导致首 token 等待时间变长。
Hugging Face 发布 Kernel Hub,让 Python 库和应用通过 kernels 库的 get_kernel 直接从 Hub 加载预编译的优化计算 kernel,无需本地编译。
NVIDIA 发布 Isaac GR00T N1.5,这是 Isaac GR00T N1 的首次重大更新,可通过后训练适配特定本体、任务和环境。
推荐理由:原文给出从数据准备到真机部署的完整命令,读者可据此在低成本 SO-101 机械臂上复现微调流程。
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使自回归生成速度提升 38%。该实现覆盖 Attention 块的缓存更新、语言模型逐层缓存管理,以及区分 prefill 与逐 token 解码的生成循环。相关经验可推广到所有自回归语言模型的生成优化。
Arm 工程师 Michael Gamble 用 Stable Audio Open 模型、PyTorch 和 TorchAudio 打造了一款完全在 Arm CPU 上本地运行的个人音效生成工具,无需 GPU 和云端推理,几秒内即可根据提示词生成 .wav 文件并直接导入 Ableton Live。
用户反馈在 TRL 中使用 Liger GRPO loss 配合 DeepSpeed ZeRO3 训练 Qwen/Qwen2.5-0.5B-Instruct(bf16)时出现形状不匹配错误,报错栈指向 liger_kernel 的 chunked_loss/grpo_loss.py 与 fused_linear_ppo.py。
Hugging Face 在 huggingface_hub 中新增 MCPClient,并基于它实现 Python 版 Tiny Agents,用约 70 行代码即可搭建连接 MCP 服务器的智能体。
推荐理由:原文给出约 70 行 Python 代码实现 MCP 智能体的完整方法,读者可据此复用并接入自有工具。
Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,灵感来自 nanoGPT,可在免费 Colab 上启动训练。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
Hugging Face 发文回顾过去一年视觉语言模型(VLM)的关键变化,涵盖 any-to-any 模型、推理模型、小尺寸模型、MoE 解码器、视觉语言动作模型、多模态 RAG 与智能体、视频语言模型等新趋势。
Hugging Face 发文称 LeRobot 社区贡献数据集正快速增长,目标是把泛化当作数据问题,构建开放多样的“机器人 ImageNet”。目前上传数据集多集中在 So100 和 Koch 机械臂,社区案例还包括抽屉操作、国际象棋对局和动物玩偶交互等。文章同时指出,随着数据采集门槛降低,数据整理与策展将成为下一阶段挑战。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四处关键变化:通过 enable_thinking 标志可开关推理,设为 false 时模板插入空对以跳过逐步思考,而 QwQ 等旧模型强制每轮生成思维链。
Hugging Face 发布教程,介绍如何用 Gradio 在几行 Python 代码内把应用变成 MCP Server,供 LLM 作为工具调用。只需在 launch() 中设置 mcp_server=True,Gradio 就会自动把函数转成 MCP 工具,并用 docstring 生成工具描述和参数,MCP 端点位于 /gradio_api/mcp/sse。
推荐理由:原文给出用 Gradio 把 Python 函数变成 MCP 工具的完整步骤,读者可据此把自有应用接入 LLM 工具调用。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,实现 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
Hugging Face 发布 Tiny Agents 教程,展示如何用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体。
推荐理由:作者用 50 行代码演示 MCP 客户端与智能体的最小实现,读者可据此理解工具调用如何接入推理客户端。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调版可完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。
Hugging Face 发文列举 Gradio 的 17 项特性,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习应用框架。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集取平均得到加权总分。