跳到正文
原文
Hugging Face Blog·· 2023-08-08精选AI 评分62

用 DPO 微调 Llama 2:TRL 库教程与代码

Fine-tune Llama 2 with DPO

AI 导读

Hugging Face 博客介绍 TRL 库新增的 DPO 训练支持,并演示如何用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B。

推荐理由

TRL 官方给出 DPO 微调 Llama 2 的完整代码与数据格式,读者可据此在自己的偏好数据上复现。

来源:Hugging Face Blog · huggingface.co