跳到正文
原文
Hugging Face Blog·· 2025-12-11精选AI 评分62

llama.cpp 新增模型管理功能:router 模式支持动态加载与切换模型

New in llama.cpp: Model Management

AI 导读

llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持从 llama.cpp 缓存或 --models-dir 目录自动发现 GGUF 文件,按需加载,并在达到 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。

推荐理由

llama.cpp server 新增 router 模式,读者可据此了解本地多模型动态切换与显存管理方式。

来源:Hugging Face Blog · huggingface.co