Hugging Face Blog·· 2022-10-12精选AI 评分62
Hugging Face 复盘 BLOOM 推理优化:延迟降低 5 倍、吞吐提升 50 倍
Optimization story: Bloom inference
AI 导读
Hugging Face 团队复盘了为 BLOOM(176B 参数,bf16 下 352GB)构建推理服务器的优化过程,最终实现延迟降低 5 倍、吞吐提升 50 倍。
推荐理由
Hugging Face 团队复盘 BLOOM 推理优化全过程,从 PP 到 TP、自定义 kernel 的取舍细节对部署大模型有参考价值。
来源:Hugging Face Blog · huggingface.co