Hugging Face 用 bitsandbytes 与 QLoRA 支持 4-bit 量化模型
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 集成进 transformers,读者可据此判断消费级硬件微调大模型的门槛变化。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 集成进 transformers,读者可据此判断消费级硬件微调大模型的门槛变化。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的严重安全漏洞,部分规范格式不精确和缺失校验(允许 polyglot 文件)的问题已被修复。
推荐理由:外部安全审计确认 safetensors 无任意代码执行漏洞,并推动其成为 transformers 默认格式。
Hugging Face 发文介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优势,并已被集成进 transformers 库。RWKV 由 Bo Peng 主导,训练 GPU 由 Stability AI 捐赠,现有模型参数从约 170M 到 14B,训练上下文长度达 8192 且速度与 ctx1024 模型相当。
推荐理由:结合 RWKV 架构原理与 transformers 集成示例,读者可了解 RNN 与 Transformer 优势如何被合并。
Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder 模型,用 OpenAssistant 对话数据集微调出编码助手 StarChat,并公开了代码、数据集与模型。
推荐理由:原文完整给出了用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大语言模型,基于 GitHub 上 80 多种编程语言的宽松许可数据训练,参数量约 15B、训练 1 万亿 token,上下文长度超过 8,000 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的水平与许可条件。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现并迁移到自己的任务。
Hugging Face 发布教程,介绍如何用 diffusers 训练自定义 ControlNet,并以人脸姿态为例完整走通流程。训练分三步:规划条件、构建数据集、训练模型,数据集需包含原图、条件图和提示词三列。
推荐理由:完整复现了从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。该方案用 8-bit 加载、低秩适配器和共享参考模型三层手段压缩显存,在 24GB NVIDIA 4090 上完成了 20B 参数 gpt-neox 的 RLHF 微调,完整训练则在单张 A100 上跑完。
推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到显存受限的训练场景。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。
Hugging Face 在 Diffusers 中推出 StableDiffusionControlNetPipeline,把 ControlNet 的空间条件控制接入扩散模型生成流程,支持 canny 边缘、深度图、分割图、scribble、关键点等 8 种条件模型。
推荐理由:Diffusers 集成 ControlNet 并给出多种条件控制的完整代码示例,读者可据此复现并评估显存与速度开销。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可在冻结图像编码器与大语言模型之间加入轻量 Q-Former 完成视觉语言预训练。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示续写与视觉问答,可据此快速上手多模态推理。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:原文给出 PEFT 库支持的方法与消费级硬件上的微调示例,读者可据此判断低成本微调的可行路径。
Hugging Face 宣布 SpeechT5 已集成进 Transformers,论文作者发布的官方 checkpoint 可在 Hugging Face Hub 获取,并提供语音合成、音色转换和自动语音识别三个 Spaces 演示。
推荐理由:SpeechT5 以同一套编码器解码器架构覆盖 TTS、语音转换与 ASR,读者可据此了解多任务语音模型在 Transformers 中的接入方式。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。
推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。
Hugging Face 博客图解 RLHF 的完整训练流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文中说明奖励模型输出标量奖励,训练时用 KL 散度惩罚策略偏离初始模型,并给出 OpenAI、Anthropic、DeepMind 在模型与奖励模型规模上的不同选择。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并列出 TRL、TRLX、RL4LMs 等开源工具与数据成本。
借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以通过 Core ML 在 Apple Silicon 上运行,Hugging Face 已将 v1.4、v1.5、v2 base 和 v2.1 base 的官方权重转换并上传到 Hub。
推荐理由:Hugging Face 与 Apple 合作把 Stable Diffusion 转成 Core ML 权重,读者可据此在 Apple Silicon 上本地跑图并了解不同变体的取舍。
Hugging Face 在 transformers 4.24.0 中集成了 Contrastive Search 解码方法,PyTorch 和 TensorFlow 均可用。
推荐理由:Hugging Face 把对比搜索集成进 transformers,读者可据此替换现有解码方式并对比生成质量。
Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,给出推荐设置:低学习率配合逐步增加训练步数,人脸需要 800-1200 步、batch size 2、LR 1e-6,并建议使用 prior preservation 避免过拟合。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可直接用于复现和调参。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 在任意多语种 ASR 数据集上微调 Whisper。教程以 Common Voice 11.0 的印地语为例,用约 8 小时训练数据微调 Whisper small,在测试集上把 WER 从预训练模型的 63.5% 降到 32.0%。
推荐理由:以印地语为例给出 Whisper 多语种 ASR 微调全流程,8 小时数据即可把 WER 从 63.5% 降到 32.0%。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于在多种嵌入任务上衡量文本嵌入模型性能,包含 56 个数据集、8 类任务,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总成统一榜单,读者可据此理解文本嵌入模型的评测口径与选型依据。