Llama 2 在 Amazon SageMaker 上的部署基准测试
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模,在 g5.2xlarge、g5.12xlarge、g5.48xlarge 和 p4d.24xlarge 实例上测试了 1、5、10、20 并发请求,并对比了 GPTQ 4-bit 量化与未量化性能。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模,在 g5.2xlarge、g5.12xlarge、g5.48xlarge 和 p4d.24xlarge 实例上测试了 1、5、10、20 并发请求,并对比了 GPTQ 4-bit 量化与未量化性能。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct。
Rocket Money 将每月超 1 亿笔交易的商户识别从正则系统迁移到基于 BERT 家族模型的文本分类方案,该模型覆盖 4000+ 类别。经过三个月评估和逐步放量压测后,团队选择 Hugging Face Inference API 托管模型,因其接入快、可动态扩展并保持低延迟。
Hugging Face 博客总结了生产环境部署 LLM 的三大优化方向:降低数值精度至 8-bit 和 4-bit、采用 Flash Attention 注意力算法,以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
Hugging Face Transformers 目前原生支持 bitsandbytes 和 auto-gptq 两种量化方案,前者无需校准数据即可开箱量化任意含 torch.nn.Linear 的模型,后者在文本生成上更快且支持 2-bit 量化。bitsandbytes 的 4-bit 模型暂不支持序列化,GPTQ 则需校准数据集且目前仅适用于语言模型。
Fetch 在 Amazon SageMaker 上结合 Hugging Face AWS Deep Learning Container 与 Hugging Face Inference Toolkit 优化其 ML 流水线,将最慢扫描的延迟降低 50%,文档理解模型准确率提升 200%。
Hugging Face 博客介绍在 🧨 Diffusers 中使用 AudioLDM 2 的四种优化方法,将 10 秒音频的生成时间从约 14 秒降到不足 1 秒,且音频质量下降很小。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。
Hugging Face 发布面向企业的端到端代码助手 SafeCoder,基于 BigCode 项目的 StarCoder 系列代码大模型,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并支付 Hugging Face 的使用费用。订阅后,Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量费用将直接计入 AWS 账单,价格与 Hugging Face 公开定价一致。
Hugging Face 博客演示了如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结的文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 基础图逐步放大至 1024x1024 px。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库优化 Suno AI 的文本转语音模型 Bark。教程基于 suno/bark-small 检查点,通过三项简单优化降低显存占用并提升推理速度,并给出未优化基线的 benchmark 对比:5 次迭代平均执行时间 9.38 秒、最大显存占用 1.91 GB。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。
Zama 展示了用全同态加密(FHE)在加密数据上运行大语言模型推理的方案,基于 Hugging Face transformers 库改造 GPT2,将首个多头注意力头用 Concrete-Python 转为 FHE 等价实现。实验显示 4-bit 量化可保留原模型 96% 的精度,客户端本地推理至首层后加密中间结果交由服务器计算,兼顾用户数据隐私与模型 IP 保护。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face Inference Endpoints 可将 Falcon 40B instruct 等开源 LLM 部署为生产级 API,无需管理基础设施,支持自动扩缩容与 scale-to-zero。
Hugging Face 发布教程,用 Node.js 调用 Inference Endpoints 上的 WizardCoder-15B,把提示词流式生成并直接渲染为 HTML 网页。
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速、相比 H100 实现 1.4 倍加速。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。该应用支持多人协作,可并发提供机器学习模型推理服务,并集成了 Hugging Face Models。Livebook 还作为 Space Docker 模板之一,可直接在 Hugging Face Spaces 中免费运行。
Hugging Face 博客介绍如何借助 Core ML 的新压缩与优化能力,在 iPhone、iPad 和 Mac 上更快运行 Stable Diffusion。
推荐理由:文章给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 部署到 iPhone 和 Mac 本地运行。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face 发布教程,讲解如何用 Hugging Face Unity API 在 Unity 游戏中实现语音识别,将语音转为文本,可用于下达指令、与 NPC 对话或提升无障碍体验。
Hugging Face 发布面向 Amazon SageMaker 的 LLM Inference Container(DLC),基于 Text Generation Inference(TGI),可部署 BLOOM、StarCoder、Llama、T5 等开源大模型。
Hugging Face 借助 OpenVINO 的 NNCF 与 Diffusers,对 Stable Diffusion 的 UNet 采用量化感知训练(QAT)并叠加 Token Merging,在 Intel CPU 上实现相比 PyTorch 5.1 倍推理加速和 4 倍模型体积缩减。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在托管端点上一键部署。该目录已在所有提供 Azure Machine Learning 的 Azure 区域开放公开预览。
Hugging Face 宣布与 IBM 合作,共同推进新一代企业级 AI 工作室 watsonx.ai,用于训练、验证、微调和部署传统机器学习与生成式 AI 能力。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley、CMU、斯坦福和 UCSD 团队基于 LLaMA 微调,训练成本约 300 美元,以 GPT-4 为参考的初步评估中质量达到 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)解码方法,用一个至少小一个数量级的助手模型快速生成候选 token,再由主模型前向验证,在 Transformers 中通过 assistant_model 参数即可启用。
推荐理由:Hugging Face 官方详解辅助生成解码方法,给出可复现的延迟数据与 Transformers 调用方式。
Hugging Face Unity API 是 Hugging Face Inference API 的集成工具,让开发者在 Unity 项目中调用 Hugging Face AI 模型。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 上传 GCS,再到模型训练与上传的完整流程。代码默认使用 BERT 规模模型,可通过修改配置扩展到更大模型和更强 TPU pod 切片。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 各组件、8bit 量化 T5 并逐段释放显存的具体做法,可迁移到其他大模型推理。
Hugging Face Space 除了托管机器学习 demo,也能托管可玩的 Unity 游戏。教程给出 11 步流程:用 Static HTML 模板创建 Space、将 Unity 项目构建目标切换为 WebGL、把压缩格式设为 Disabled,再通过 Git-LFS 推送构建文件即可运行。官方还提供可选的 Hugging Face Unity WebGL 模板。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,通过 optimum neuron 只需一行代码即可编译模型。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务接入 Snorkel Flow 平台,让企业用户可直接调用其 150,000 多个开源模型来适配和微调基础模型。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,客户按需激活、闲置休眠,从而在控制成本的同时扩展可用模型数量。
Hugging Face 展示用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ 并做推理,8 卡 16-bit 下延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术。
Hugging Face 宣布为 Hub 上托管的 Jupyter Notebook 增加渲染支持,ipynb 文件将以人类可读格式显示。Hub 目前托管超过 7,000 个 notebook,并支持一键在 Google Colab 中打开。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作开发了灾害地图应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。