跳到正文
原文
Hugging Face Blog·· 2023-12-05AI 评分52

Hugging Face 如何让 LoRA 推理提速 300%:告别冷启动

Goodbye cold boot - how we made LoRA Inference 300% faster

AI 导读

Hugging Face 在 Hub 的 Inference API 中实现 LoRA 动态加载,保持基础模型常驻、按请求即时加载和卸载 LoRA 适配器,把冷启动时间从 25s 降到 3s,用户请求响应时间从 35s 降到 13s。

来源:Hugging Face Blog · huggingface.co