跳到正文
原文
OpenAI News·· 2023-05-31精选AI 评分62

OpenAI 用过程监督提升数学推理能力

Improving mathematical reasoning with process supervision

AI 导读

OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。除性能提升外,过程监督还带来对齐收益:直接训练模型产出人类认可的思维链。

推荐理由

OpenAI 用过程监督替代结果监督提升数学推理,并给出对对齐的额外收益,可了解训练方法差异。

来源:OpenAI News · openai.com