Hugging Face Blog·· 2023-04-05精选AI 评分62
StackLLaMA:用 RLHF 训练 LLaMA 的实操指南
StackLLaMA: A hands-on guide to train LLaMA with RLHF
AI 导读
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由
Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现并迁移到自己的任务。
来源:Hugging Face Blog · huggingface.co