Hugging Face Blog·· 2024-07-30AI 评分36
用 Quanto 和 Diffusers 实现内存高效的 Diffusion Transformer
Memory-efficient Diffusion Transformers with Quanto and Diffusers
AI 导读
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化至 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟仅小幅上升。
来源:Hugging Face Blog · huggingface.co