跳到正文
原文
Hugging Face Blog·· 2025-01-16AI 评分57

Hugging Face 为 Text Generation Inference 引入多后端支持(TRT-LLM、vLLM)

Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference

AI 导读

Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过 Rust 的 Backend 接口把 HTTP 服务与调度层同推理引擎解耦,让用户按模型、硬件和性能需求切换后端。

来源:Hugging Face Blog · huggingface.co