Hugging Face 发布 upskill:用 Claude 生成 CUDA 内核 Skill 并教给开源模型
Hugging Face 发布新工具 upskill,可用 Claude Opus 4.5 等大模型生成并评测 agent skill,再迁移给更小或本地模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测方法,可复用到其他领域任务。
拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。
Hugging Face 发布新工具 upskill,可用 Claude Opus 4.5 等大模型生成并评测 agent skill,再迁移给更小或本地模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测方法,可复用到其他领域任务。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端机器学习实验,包括数据集校验、硬件选择、提交训练任务、监控进度、评测与导出 GGUF。
推荐理由:原文给出 Codex 结合 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。
Hugging Face 推出 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交微调任务到云端 GPU、监控进度并把模型推送到 Hub。
推荐理由:Hugging Face 把微调流程封装成 Claude Code 可调用的 Skill,读者可据此了解对话式训练的实际操作与成本。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、训练与真机部署,用于构建自主手术辅助机器人。
推荐理由:原文给出从仿真数据采集到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。
Hugging Face 发布教程,介绍如何用 Diffusers 和 PEFT 优化 Flux.1-Dev 的 LoRA 推理速度。方案组合 Flash Attention 3、torch.compile 和 FP8 量化,并通过 hotswap 机制避免切换 LoRA 时触发重新编译,在 H100 上相比基线取得 2.23 倍加速。
推荐理由:原文给出 Flux LoRA 推理的完整优化配方与实测数据,读者可据此在 H100 或 4090 上复现加速效果。
Hugging Face 发布教程,介绍用 QLoRA 和 diffusers 库在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以内。在 RTX 4090 上,QLoRA 微调峰值显存约 9GB,而 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。
NVIDIA 发布 Isaac GR00T N1.5,这是 Isaac GR00T N1 的首次重大更新,可通过后训练适配特定本体、任务和环境。
推荐理由:原文给出从数据准备到真机部署的完整命令,读者可据此在低成本 SO-101 机械臂上复现微调流程。
Hugging Face 在 huggingface_hub 中新增 MCPClient,并基于它实现 Python 版 Tiny Agents,用约 70 行代码即可搭建连接 MCP 服务器的智能体。
推荐理由:原文给出约 70 行 Python 代码实现 MCP 智能体的完整方法,读者可据此复用并接入自有工具。
Hugging Face 发布教程,介绍如何用 Gradio 在几行 Python 代码内把应用变成 MCP Server,供 LLM 作为工具调用。只需在 launch() 中设置 mcp_server=True,Gradio 就会自动把函数转成 MCP 工具,并用 docstring 生成工具描述和参数,MCP 端点位于 /gradio_api/mcp/sse。
推荐理由:原文给出用 Gradio 把 Python 函数变成 MCP 工具的完整步骤,读者可据此把自有应用接入 LLM 工具调用。
Hugging Face 发布 Tiny Agents 教程,展示如何用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体。
推荐理由:作者用 50 行代码演示 MCP 客户端与智能体的最小实现,读者可据此理解工具调用如何接入推理客户端。
Hugging Face 博客发布 Mini-R1 教程,用 GRPO 和 Countdown 游戏在 Qwen2.5-3B-Instruct 上复现 DeepSeek-R1 的 aha moment。
推荐理由:作者用 4 张 H100 复现 DeepSeek-R1 的 aha moment,给出完整脚本与训练观察,可迁移到自己的 RL 实验。
Hugging Face Diffusers 团队发布博客,梳理开源视频生成模型现状,并介绍 Diffusers 对 CogVideoX、Mochi-1、HunyuanVideo、LTX-Video 等模型的支持与优化方案。
推荐理由:梳理开源视频生成模型现状与 Diffusers 的显存优化路径,给出可复用的量化与卸载配置。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练时的 GPU 显存占用。文章以 Qwen2.5-1.5B 为例拆解模型参数、优化器状态、激活值、梯度和优化器中间值各占多少显存,并给出总显存估算公式和激活值随参数量线性变化的启发式。作者还提供了一个显存估算小工具。
推荐理由:原文用可视化快照拆解训练各阶段显存占用,并给出可复用的显存估算公式与启发式。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。
Hugging Face 博客介绍嵌入量化方法,将 float32 嵌入转为二值或 int8,内存与磁盘占用分别缩小 32 倍和 4 倍。在 MTEB 检索的 15 个基准上,二值量化配合重排序可保留约 96% 的默认性能,检索速度平均提升 24.76 倍,int8 平均提升 3.66 倍。
推荐理由:Hugging Face 官方给出嵌入量化在检索速度、内存与成本上的实测对比,并附可复用脚本。
Hugging Face 博客介绍 GaLore 优化器,通过将梯度投影到低秩子空间,可把优化器状态显存占用降低 82.5% 以上,从而在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 70 亿参数的 Llama 架构模型。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的训练流程和可运行代码,读者可据此在消费级显卡上复现大模型训练。
Hugging Face 博客给出用开源 LLM 生成合成数据、再蒸馏出专用小模型的完整流程,并以金融新闻投资者情绪识别为案例。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
Hugging Face 发布了一套用开源模型实现 Constitutional AI 的端到端配方,并开源了 llm-swarm 工具,用于在 Slurm 集群上基于 TGI 和 vLLM 做可扩展的合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可迁移到自定义对齐流程。
Hugging Face 发布博客,介绍如何用新集成的 ChatHuggingFace 在 LangChain 中把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,读者可据此判断哪些模型适合驱动智能体工作流。