跳到正文
原文
Hugging Face Blog·· 2025-04-02AI 评分38

高效请求排队:优化 LLM 推理性能的公平调度策略

Efficient Request Queueing – Optimizing LLM Performance

AI 导读

TNG Technology Consulting 分享了自托管 LLM 服务中请求排队导致"重度用户"阻塞其他用户的问题,提出在 LLM-Server 层为每个用户和模型建立独立队列并采用轮询调度实现公平分配。由于 vLLM 不支持限制后端队列长度,方案通过抓取 vLLM /metrics 端点的 Prometheus 指标动态调节请求发送速率,将后端队列长度控制在 3 以下以降低新用户延迟。

来源:Hugging Face Blog · huggingface.co