跳到正文
原文
Hugging Face Blog·· 2023-04-05精选AI 评分62

StackLLaMA:用 RLHF 训练 LLaMA 的实操指南

StackLLaMA: A hands-on guide to train LLaMA with RLHF

AI 导读

Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。

推荐理由

Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现并迁移到自己的任务。

来源:Hugging Face Blog · huggingface.co