跳到正文
原文
Hugging Face Blog·· 2023-10-24AI 评分55

RLHF with PPO 的 N 个实现细节:复现 OpenAI 原始代码库

The N Implementation Details of RLHF with PPO

AI 导读

Hugging Face 博客复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。

来源:Hugging Face Blog · huggingface.co