跳到正文
原文
OpenAI News·· 2024-07-24AI 评分40

OpenAI 用基于规则的奖励(RBRs)提升模型安全行为

Improving Model Safety Behavior with Rule-Based Rewards

AI 导读

OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下对齐至安全行为。

来源:OpenAI News · openai.com