Hugging Face Blog·· 2023-03-28AI 评分42
BLOOMZ 在 Habana Gaudi2 加速器上的快速推理
Fast Inference on Large Language Models: BLOOMZ on Habana Gaudi2 Accelerator
AI 导读
Hugging Face 展示用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ 并做推理,8 卡 16-bit 下延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。
来源:Hugging Face Blog · huggingface.co