Hugging Face Blog·· 2024-10-08AI 评分42
Intel Labs 与 Hugging Face 推出动态推测解码,文本生成最高提速 2.7 倍
Faster Assisted Generation with Dynamic Speculation
AI 导读
Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。
来源:Hugging Face Blog · huggingface.co