用 Inference Endpoints 快速部署 MusicGen
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。
Zama 展示了用全同态加密(FHE)在加密数据上运行大语言模型推理的方案,基于 Hugging Face transformers 库改造 GPT2,将首个多头注意力头用 Concrete-Python 转为 FHE 等价实现。实验显示 4-bit 量化可保留原模型 96% 的精度,客户端本地推理至首层后加密中间结果交由服务器计算,兼顾用户数据隐私与模型 IP 保护。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face Inference Endpoints 可将 Falcon 40B instruct 等开源 LLM 部署为生产级 API,无需管理基础设施,支持自动扩缩容与 scale-to-zero。
Hugging Face 发布教程,用 Node.js 调用 Inference Endpoints 上的 WizardCoder-15B,把提示词流式生成并直接渲染为 HTML 网页。
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速、相比 H100 实现 1.4 倍加速。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。该应用支持多人协作,可并发提供机器学习模型推理服务,并集成了 Hugging Face Models。Livebook 还作为 Space Docker 模板之一,可直接在 Hugging Face Spaces 中免费运行。
Hugging Face 博客介绍如何借助 Core ML 的新压缩与优化能力,在 iPhone、iPad 和 Mac 上更快运行 Stable Diffusion。
推荐理由:文章给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 部署到 iPhone 和 Mac 本地运行。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face 发布教程,讲解如何用 Hugging Face Unity API 在 Unity 游戏中实现语音识别,将语音转为文本,可用于下达指令、与 NPC 对话或提升无障碍体验。
Hugging Face 发布面向 Amazon SageMaker 的 LLM Inference Container(DLC),基于 Text Generation Inference(TGI),可部署 BLOOM、StarCoder、Llama、T5 等开源大模型。
Hugging Face 借助 OpenVINO 的 NNCF 与 Diffusers,对 Stable Diffusion 的 UNet 采用量化感知训练(QAT)并叠加 Token Merging,在 Intel CPU 上实现相比 PyTorch 5.1 倍推理加速和 4 倍模型体积缩减。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在托管端点上一键部署。该目录已在所有提供 Azure Machine Learning 的 Azure 区域开放公开预览。
Hugging Face 宣布与 IBM 合作,共同推进新一代企业级 AI 工作室 watsonx.ai,用于训练、验证、微调和部署传统机器学习与生成式 AI 能力。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley、CMU、斯坦福和 UCSD 团队基于 LLaMA 微调,训练成本约 300 美元,以 GPT-4 为参考的初步评估中质量达到 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)解码方法,用一个至少小一个数量级的助手模型快速生成候选 token,再由主模型前向验证,在 Transformers 中通过 assistant_model 参数即可启用。
推荐理由:Hugging Face 官方详解辅助生成解码方法,给出可复现的延迟数据与 Transformers 调用方式。
Hugging Face Unity API 是 Hugging Face Inference API 的集成工具,让开发者在 Unity 项目中调用 Hugging Face AI 模型。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 上传 GCS,再到模型训练与上传的完整流程。代码默认使用 BERT 规模模型,可通过修改配置扩展到更大模型和更强 TPU pod 切片。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 各组件、8bit 量化 T5 并逐段释放显存的具体做法,可迁移到其他大模型推理。
Hugging Face Space 除了托管机器学习 demo,也能托管可玩的 Unity 游戏。教程给出 11 步流程:用 Static HTML 模板创建 Space、将 Unity 项目构建目标切换为 WebGL、把压缩格式设为 Disabled,再通过 Git-LFS 推送构建文件即可运行。官方还提供可选的 Hugging Face Unity WebGL 模板。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,通过 optimum neuron 只需一行代码即可编译模型。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务接入 Snorkel Flow 平台,让企业用户可直接调用其 150,000 多个开源模型来适配和微调基础模型。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,客户按需激活、闲置休眠,从而在控制成本的同时扩展可用模型数量。
Hugging Face 展示用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ 并做推理,8 卡 16-bit 下延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术。
Hugging Face 宣布为 Hub 上托管的 Jupyter Notebook 增加渲染支持,ipynb 文件将以人类可读格式显示。Hub 目前托管超过 7,000 个 notebook,并支持一键在 Google Colab 中打开。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作开发了灾害地图应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Hugging Face 专家加速计划帮助 Witty Works 将其包容性写作助手的非包容性词汇分类器从 vanilla transformers 转向 Sentence Transformers 架构,结合 SetFit 库实现少样本微调,每个词仅需 15-20 条标注句子。
消费者奖励公司 Fetch 在 AWS 上借助 Hugging Face 专家加速计划,将原本依赖第三方黑盒的收据处理方案替换为自研 AI 模型,开发时间缩短 30%,处理延迟降低 50%。Fetch 目前每天处理超 1100 万张收据,服务 1800 万月活用户,方案基于 Amazon SageMaker 和 AWS Inferentia 加速器。
Hugging Face 与 AWS 宣布扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,社区开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调与部署模型。
团队将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移到 Hugging Face Inference Endpoints,部署流程从六步简化为三步。基于 RoBERTa 文本分类模型的测试显示,large 实例延迟约 80ms,比此前 ECS 方案快一倍以上,但成本高出 24% 至 50%,large CPU 实例每月约多花 60 美元。
Hugging Face 发布博客第二部分,测试在 Intel Sapphire Rapids 服务器上运行 PyTorch Transformers 推理的性能。
Hugging Face 与微软 ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为多种 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)CPU 集群上加速 PyTorch 训练,借助 Intel oneAPI CCL 做分布式通信、Intel Extension for PyTorch(IPEX)自动启用 AMX 指令,无需改动任何 transformers 代码。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,让 GPT2 到 Stable Diffusion 等模型可在 Elixir 中运行。
Hugging Face 梳理了其推理方案:模型页上的免费 Inference Widget 与免费 Inference API 可零代码或单次 HTTP 请求调用 Hub 模型,但受速率限制,不建议用于生产。
Hugging Face 更新定价体系,下线 Inference API 的付费层,该 API 仍对所有人免费开放。面向企业级高速推理需求,平台推出新服务 Inference Endpoints,并为 Spaces 提供硬件升级,可自选硬件运行 ML demo。这些服务无需订阅,只需在账单设置中绑定信用卡,用量按月计费并生成合并发票。
Hugging Face 将 Intel OpenVINO 集成进 Optimum Intel,用户可在多种 Intel 处理器上用 OpenVINO Runtime 对 Transformers 模型执行推理,并借助 NNCF 在数分钟内完成量化以压缩模型体积、降低预测延迟。