跳到正文
原文
Hugging Face Blog·· 2025-06-04AI 评分22

nanoVLM 从零实现 KV Cache,生成速度提升 38%

KV Cache from scratch in nanoVLM

AI 导读

Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使自回归生成速度提升 38%。该实现覆盖 Attention 块的缓存更新、语言模型逐层缓存管理,以及区分 prefill 与逐 token 解码的生成循环。相关经验可推广到所有自回归语言模型的生成优化。

来源:Hugging Face Blog · huggingface.co