跳到正文
原文
Hugging Face Blog·· 2022-10-12精选AI 评分62

Hugging Face 复盘 BLOOM 推理优化:延迟降低 5 倍、吞吐提升 50 倍

Optimization story: Bloom inference

AI 导读

Hugging Face 团队复盘了为 BLOOM(176B 参数,bf16 下 352GB)构建推理服务器的优化过程,最终实现延迟降低 5 倍、吞吐提升 50 倍。

推荐理由

Hugging Face 团队复盘 BLOOM 推理优化全过程,从 PP 到 TP、自定义 kernel 的取舍细节对部署大模型有参考价值。

来源:Hugging Face Blog · huggingface.co