跳到正文

全部动态

今日 4 条
3月9日周四
  1. Hugging Face Blog67

    Hugging Face 集成 trl 与 peft,在 24GB 消费级 GPU 上微调 20B 大模型

    Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。该方案用 8-bit 加载、低秩适配器和共享参考模型三层手段压缩显存,在 24GB NVIDIA 4090 上完成了 20B 参数 gpt-neox 的 RLHF 微调,完整训练则在单张 A100 上跑完。

    推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到显存受限的训练场景。

3月3日周五
3月1日周三
2月24日周五
  1. Hugging Face Blog35

    Hugging Face 详解大语言模型红队测试

    红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。

2月15日周三
2月7日周二
2月6日周一
2月3日周五
1月26日周四
  1. Hugging Face Blog75

    用 LoRA 高效微调 Stable Diffusion

    Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。

    推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。

1月24日周二
1月20日周五
  1. Hugging Face Blog22

    3D 资产生成:AI 用于游戏开发 #3

    Hugging Face 博客"AI for Game Development"系列第 3 天聚焦 3D 资产生成,结论是 text-to-3D 目前还无法实际用于游戏开发。文章梳理了 DreamFusion、Point-E、CLIP-NeRF 等近期方案,指出它们多基于 NeRF 视图合成,生成的 mesh 需大量人工后处理才能达到游戏可用标准。作者因此在本作中改用不同颜色的立方体代表农作物。

1月19日周四
  1. Hugging Face Blog42

    Hugging Face transformers 集成 Mask2Former 与 OneFormer,统一图像分割

    Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一套架构解决实例、语义和全景分割,但每个任务仍需单独训练;OneFormer 加入文本编码器,仅在全景数据集上训练一次即可在三个任务上达到 SOTA,精度更高但延迟更大。

1月16日周一
1月9日周一
  1. Hugging Face Blog22

    AI 用于游戏开发:5 天做出一个农场游戏(第 2 部分)

    Hugging Face 博客系列教程第二部分展示如何用 ChatGPT 辅助农场游戏设计,作者让其以专业游戏设计师身份给出作物多样性、进阶系统、动态环境、社交多人、沉浸式剧情等建议,并因 5 天工期只先灰盒实现了前两项。文章同时解释语言模型与 Transformer 原理,并提醒 ChatGPT 常言之凿凿却出错,宜作头脑风暴工具而非开发流程的替代品。

1月3日周二
  1. Hugging Face Blog22

    Hugging Face 博客:图机器学习入门指南

    Hugging Face 发布图机器学习入门博客,梳理图的基本概念、表示方法及学习范式,涵盖从预神经网络方法到图神经网络(GNN),并延伸至面向图的 Transformer。文章还介绍了图在社交网络、分子、知识图谱等场景的应用,以及图级、节点级、边级和子图级四类任务,并区分了直推式与归纳式两种设定。

1月2日周一
12月21日周三
  1. Hugging Face Blog42

    用 CLIPSeg 实现零样本图像分割

    Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。CLIPSeg 在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持以文本或示例图像作为提示词的"视觉提示"。

12月15日周四
  1. Hugging Face Blog22

    Hugging Face 音频数据集完全指南:用 🤗 Datasets 一行代码加载与处理

    Hugging Face 发布音频数据集使用指南,介绍如何用 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。文中以 GigaSpeech 为例,其 xs 配置含 10 小时数据,加载后自动划分 train、validation、test 三个 split。Hub 上现有 77 个语音识别数据集和 28 个音频分类数据集,并支持在线试听样本预览。

12月14日周三
12月2日周五
12月1日周四
11月21日周一
11月17日周四
  1. Hugging Face Blog28

    用同态加密在加密数据上做情感分析:Concrete-ML 实战教程

    Hugging Face 博客发布教程,演示如何借助 Concrete-ML 库在全同态加密(FHE)环境下对加密数据做情感分析,数据科学家无需密码学背景即可上手。方案用 BERT 提取文本隐藏表示(hidden size 768),再交给 XGBoost 分类,并通过客户端/服务器协议部署到云端,最后在 Hugging Face Spaces 提供完整 demo。

10月24日周一
  1. Hugging Face Blog40

    Hugging Face 在 🤗 Evaluate 中加入语言模型偏见评估指标

    Hugging Face 为 🤗 Evaluate 库新增偏见指标与测量方法,用于评估 GPT-2、BLOOM 等因果语言模型的偏见。该工作流先用 🤗 Datasets 中的预设提示词引导模型生成文本,再用 🤗 Evaluate 的指标打分,示例覆盖 Toxicity、Polarity 和 Hurtfulness 三类任务,其中 toxicity 指标基于 R4 Target 仇恨检测模型。

10月21日周五
  1. Hugging Face Blog36

    从 PyTorch DDP 到 Accelerate 再到 Trainer:轻松掌握分布式训练

    Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 轻量封装,以及 🤗 Transformer 的 Trainer API。Accelerate 无需修改代码即可在单 GPU 和 TPU 上运行,Trainer 则抽象掉所有样板代码并支持多种设备和分布式场景。

10月13日周四
10月12日周三
9月27日周二
9月16日周五
8月24日周三
8月22日周一
8月19日周五
8月18日周四
8月12日周五
  1. Hugging Face Blog22

    Hugging Face 的 TensorFlow 哲学

    Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计哲学:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。库通过 TFAutoModel 等类一行代码加载预训练模型,并强调应保留 Keras 高层 API 而非绕开它。

8月11日周四
8月10日周三
8月5日周五
8月2日周二
  1. Hugging Face Blog22

    Nyströmformer:用 Nyström 方法以线性时间与内存近似自注意力

    Nyströmformer 通过 Nyström 方法近似标准自注意力,将时间和内存复杂度从 O(n²) 降至 O(n)。它不直接对 softmax 矩阵采样,而是从 query 和 key 中选取 landmark,用分段均值构造 Q̃、K̃,并据此构建三个矩阵完成近似。实验显示仅选 32 或 64 个 landmark 即可在 n=4096 或 8192 的长序列上取得有竞争力的性能。