Hugging Face Blog·· 2023-12-05AI 评分52
Hugging Face 如何让 LoRA 推理提速 300%:告别冷启动
Goodbye cold boot - how we made LoRA Inference 300% faster
AI 导读
Hugging Face 在 Hub 的 Inference API 中实现 LoRA 动态加载,保持基础模型常驻、按请求即时加载和卸载 LoRA 适配器,把冷启动时间从 25s 降到 3s,用户请求响应时间从 35s 降到 13s。
来源:Hugging Face Blog · huggingface.co