Hugging Face Blog·· 2023-08-08精选AI 评分62
用 DPO 微调 Llama 2:TRL 库教程与代码
Fine-tune Llama 2 with DPO
AI 导读
Hugging Face 博客介绍 TRL 库新增的 DPO 训练支持,并演示如何用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B。
推荐理由
TRL 官方给出 DPO 微调 Llama 2 的完整代码与数据格式,读者可据此在自己的偏好数据上复现。
来源:Hugging Face Blog · huggingface.co