如何用 Inference API 部署 AI Comic Factory
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。流程分三步:用 Spaces 部署 AutoTrain 和 ChatUI 模板,在 AutoTrain 中选用 Meta Llama 2 7b 基础模型、A10G Large GPU 和 Alpaca 指令数据集完成微调,再通过 ChatUI 部署成可分享的聊天应用。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模,在 g5.2xlarge、g5.12xlarge、g5.48xlarge 和 p4d.24xlarge 实例上测试了 1、5、10、20 并发请求,并对比了 GPTQ 4-bit 量化与未量化性能。
Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并在 2 节点 16 张 A100 80GB 上完成训练,耗时约 13.5 小时。
推荐理由:原文给出 70B 模型多节点微调的三个具体瓶颈及对应配置改法,可迁移到其他大模型训练场景。
Meta 发布 Code Llama,基于 Llama 2 初始化并在 5000 亿 token 代码数据上训练,提供 7B、13B、34B 三种规格,另有 Python 专用版和指令微调版,采用与 Llama 2 相同的社区许可并允许商用。
推荐理由:梳理 Code Llama 三种规格与 Python 专用、指令微调变体的差异,并给出 Hugging Face 生态的接入方式与基准对比。
Hugging Face 博客介绍 TRL 库新增的 DPO 训练支持,并演示如何用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B。
推荐理由:TRL 官方给出 DPO 微调 Llama 2 的完整代码与数据格式,读者可据此在自己的偏好数据上复现。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用宽松社区许可并允许商用。相比 Llama 1,预训练 token 增加 40%,上下文长度提升至 4k,70B 模型使用 grouped-query attention。
推荐理由:Meta 发布 Llama 2 并开放商用,Hugging Face 同步给出推理、部署与微调入口,可据此判断开源模型的可落地程度。
Hugging Face 梳理其开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型、许可协议、LLM 服务工具及 PEFT 微调。
Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。
推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。
Hugging Face 发布教程,介绍如何为 Meta AI 的 MMS 模型微调 Adapter 层以适配低资源语言的 ASR 任务。MMS 预训练 checkpoint 覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错率。对低资源语言,Adapter 训练比全模型微调更省内存、更鲁棒且性能更好。
Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成还支持文本分类与特征提取 widget,模型页面提供语言识别和词向量最近邻查询的在线试用。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现并迁移到自己的任务。
红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、模型规模、训练数据和评测标准上的差异。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,免费讲解扩散模型理论与应用。配合课程上线,11 月 30 日将举办社区直播活动,Stable Diffusion 创作者及 Stability AI、Meta 等机构的研究者将带来演讲,聚焦扩散模型概览及构建应用的工具。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 的 meta device、自动 device map 和分片 checkpoint,在显存和内存有限的设备上加载并推理超大模型。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,方法可直接迁移。
Hugging Face 博客介绍如何利用 Wav2Vec2 所用 CTC 架构的特性,在 Transformers 中对任意长音频乃至实时流做语音识别。
推荐理由:原文给出 CTC 模型分块加 stride 的具体参数与代码,读者可据此在长音频和实时场景中复用。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 checkpoint 结合解码音频。
Hugging Face 发布博客,讲解如何用 🤗 Transformers 将预训练模型 Wav2Vec2-XLS-R-300M 微调用于低资源语音识别(ASR)。
Hugging Face 与 Facebook PyTorch、Google TPU 团队合作,让用户通过 PyTorch / XLA 在 Cloud TPU 上训练 Transformer,并保持与 Hugging Face Trainer 完全相同的接口。
Hugging Face 的 transformers v4.2.0 起通过 --sharded_ddp 和 --deepspeed 两个 Trainer 参数实验性支持 FairScale 与 DeepSpeed 的 ZeRO 功能。
推荐理由:作者用 t5-large 与 t5-3b 实测对比 FairScale 与 DeepSpeed 的显存与速度差异,并给出可直接复用的 Trainer 参数。
Hugging Face 博客发布 Stas Bekman 的客座文章,记录将 fairseq wmt19 翻译系统移植到 transformers 的完整过程。作者选用 en-ru / ru-en 预训练模型进行移植,并创建了 configuration_fsmt.py、modeling_fsmt.py、tokenization_fsmt.py 及转换脚本等文件。