跳到正文
原文
OpenAI News·· 2025-08-07AI 评分50

OpenAI 在 GPT-5 中用 safe-completions 替代硬拒绝,推进以输出为中心的安全训练

From hard refusals to safe-completions: toward output-centric safety training

AI 导读

OpenAI 在 GPT-5 中引入 safe-completions 方法,用更细致的输出导向安全训练取代此前的硬拒绝策略,以同时提升模型的安全性与有用性。该方案针对双重用途提示词的处理,让模型在敏感请求下给出有分寸的回应而非直接拒答。

来源:OpenAI News · openai.com