Hugging Face Blog·· 2025-04-16AI 评分36
TNG 如何优化 LLM 并发请求的 Prefill 与 Decode 性能
Prefill and Decode for Concurrent Requests - Optimizing LLM Performance
AI 导读
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。
来源:Hugging Face Blog · huggingface.co