Hugging Face Blog·· 2023-05-16AI 评分41
更小即更好:Q8-Chat 在 Xeon 上的高效生成式 AI 体验
Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon
AI 导读
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
来源:Hugging Face Blog · huggingface.co