跳到正文

#Hugging Face

今日 0 条
4月5日周三
3月30日周四
3月28日周二
3月27日周一
3月24日周五
  1. Hugging Face Blog62

    用 diffusers 训练你自己的 ControlNet

    Hugging Face 发布教程,介绍如何用 diffusers 训练自定义 ControlNet,并以人脸姿态为例完整走通流程。训练分三步:规划条件、构建数据集、训练模型,数据集需包含原图、条件图和提示词三列。

    推荐理由:完整复现了从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。

3月23日周四
3月10日周五
  1. Hugging Face Blog22

    Hugging Face Transformers 上线 Informer:面向多变量概率时间序列预测

    Informer 模型已在 🤗 Transformers 中可用,用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层内存占用从 O(NT²) 降至 O(N·T log T)。

3月9日周四
  1. Hugging Face Blog67

    Hugging Face 集成 trl 与 peft,在 24GB 消费级 GPU 上微调 20B 大模型

    Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。该方案用 8-bit 加载、低秩适配器和共享参考模型三层手段压缩显存,在 24GB NVIDIA 4090 上完成了 20B 参数 gpt-neox 的 RLHF 微调,完整训练则在单张 A100 上跑完。

    推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到显存受限的训练场景。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 发布 ViT 与 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。

3月3日周五
  1. Hugging Face Blog78

    Diffusers 集成 ControlNet,支持多种空间条件控制生成

    Hugging Face 在 Diffusers 中推出 StableDiffusionControlNetPipeline,把 ControlNet 的空间条件控制接入扩散模型生成流程,支持 canny 边缘、深度图、分割图、scribble、关键点等 8 种条件模型。

    推荐理由:Diffusers 集成 ControlNet 并给出多种条件控制的完整代码示例,读者可据此复现并评估显存与速度开销。

3月2日周四
  1. Hugging Face Blog22

    Hugging Face 发布 Diffusers 库开发伦理准则

    Hugging Face 为 Diffusers 库发布了一套伦理框架,用于指导维护者处理社区贡献时的技术决策。该准则包含透明度、一致性、简洁性、可访问性、可复现性和责任六项价值观,并列出 Community tab、Tag 功能、偏见探索与评估等安全机制,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全措施。

3月1日周三
2月24日周五
  1. Hugging Face Blog35

    Hugging Face 详解大语言模型红队测试

    红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。

2月23日周四
2月21日周二
2月15日周三
2月10日周五
2月8日周三
  1. Hugging Face Blog60

    SpeechT5 上线 Hugging Face Transformers,支持语音合成、识别与音色转换

    Hugging Face 宣布 SpeechT5 已集成进 Transformers,论文作者发布的官方 checkpoint 可在 Hugging Face Hub 获取,并提供语音合成、音色转换和自动语音识别三个 Spaces 演示。

    推荐理由:SpeechT5 以同一套编码器解码器架构覆盖 TTS、语音转换与 ASR,读者可据此了解多任务语音模型在 Transformers 中的接入方式。

2月7日周二
2月6日周一
2月3日周五
1月30日周一
1月26日周四
  1. Hugging Face Blog75

    用 LoRA 高效微调 Stable Diffusion

    Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。

    推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。

1月24日周二
1月19日周四
  1. Hugging Face Blog42

    Hugging Face transformers 集成 Mask2Former 与 OneFormer,统一图像分割

    Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一套架构解决实例、语义和全景分割,但每个任务仍需单独训练;OneFormer 加入文本编码器,仅在全景数据集上训练一次即可在三个任务上达到 SOTA,精度更高但延迟更大。

1月17日周二
1月16日周一
1月9日周一
  1. Hugging Face Blog22

    AI 用于游戏开发:5 天做出一个农场游戏(第 2 部分)

    Hugging Face 博客系列教程第二部分展示如何用 ChatGPT 辅助农场游戏设计,作者让其以专业游戏设计师身份给出作物多样性、进阶系统、动态环境、社交多人、沉浸式剧情等建议,并因 5 天工期只先灰盒实现了前两项。文章同时解释语言模型与 Transformer 原理,并提醒 ChatGPT 常言之凿凿却出错,宜作头脑风暴工具而非开发流程的替代品。

1月3日周二
  1. Hugging Face Blog22

    Hugging Face 博客:图机器学习入门指南

    Hugging Face 发布图机器学习入门博客,梳理图的基本概念、表示方法及学习范式,涵盖从预神经网络方法到图神经网络(GNN),并延伸至面向图的 Transformer。文章还介绍了图在社交网络、分子、知识图谱等场景的应用,以及图级、节点级、边级和子图级四类任务,并区分了直推式与归纳式两种设定。

1月2日周一
12月21日周三
  1. Hugging Face Blog42

    用 CLIPSeg 实现零样本图像分割

    Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。CLIPSeg 在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持以文本或示例图像作为提示词的"视觉提示"。

12月20日周二
12月15日周四