跳到正文
原文
Hugging Face Blog·· 2024-01-18AI 评分34

用 DPO、IPO 与 KTO 做偏好微调:Hugging Face 的实证对比

Preference Tuning LLMs with Direct Preference Optimization Methods

AI 导读

Hugging Face 在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个 7B 模型上,用 MT-Bench 对比了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法,并扫描 β 等关键超参数。结果显示其中一种方法明显优于其他两种,但需调好关键超参数才能达到最佳效果;相关代码已在 alignment-handbook 开源。

来源:Hugging Face Blog · huggingface.co