跳到正文
原文
Hugging Face Blog·· 2023-12-05精选AI 评分62

Hugging Face 发布 Optimum-NVIDIA,一行代码加速 LLM 推理

Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code

AI 导读

Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐量和 1200 tokens/秒。

推荐理由

官方给出单行代码接入方式与首 token 延迟、吞吐量对比数据,可据此判断现有 LLaMA 推理流程的改造代价。

来源:Hugging Face Blog · huggingface.co