Hugging Face Blog·· 2023-08-23精选AI 评分62
Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化
Making LLMs lighter with AutoGPTQ and transformers
AI 导读
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由
原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。
来源:Hugging Face Blog · huggingface.co