跳到正文
原文
Hugging Face Blog·· 2024-10-08AI 评分42

Intel Labs 与 Hugging Face 推出动态推测解码,文本生成最高提速 2.7 倍

Faster Assisted Generation with Dynamic Speculation

AI 导读

Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。

来源:Hugging Face Blog · huggingface.co