跳到正文
原文
OpenAI News·· 2019-09-19精选AI 评分62

OpenAI 用人类偏好微调 774M 参数 GPT-2

Fine-tuning GPT-2 from human preferences

AI 导读

OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,尽管这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接从输入中整句复制的内容,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

推荐理由

OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何让模型学会复制而非改写。

来源:OpenAI News · openai.com