跳到正文
原文
Hugging Face Blog·· 2023-03-28AI 评分42

BLOOMZ 在 Habana Gaudi2 加速器上的快速推理

Fast Inference on Large Language Models: BLOOMZ on Habana Gaudi2 Accelerator

AI 导读

Hugging Face 展示用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ 并做推理,8 卡 16-bit 下延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。

来源:Hugging Face Blog · huggingface.co