跳到正文
原文
OpenAI News·· 2024-04-20AI 评分42

OpenAI 提出指令层级:训练 LLM 优先执行高优先级指令

The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

AI 导读

OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行高优先级指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在解决这一安全问题。

来源:OpenAI News · openai.com