跳到正文
原文
Hugging Face Blog·· 2026-08-10AI 评分42

Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,让知识蒸馏低成本跑起来

Making Knowledge Distillation Cheap Enough to Run at Scale

AI 导读

Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。

来源:Hugging Face Blog · huggingface.co