跳到正文
原文
MIT Technology Review · AI· Arthur Holland Michel·· 4 小时前AI 评分34

我们高估了 AI 说"不"的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文指出,AI 的拒绝机制正成为 AI 安全的核心支柱,但这一机制并不可靠。Anthropic 2021 年提出模型应"有用、诚实、无害",如今各大公司通过红队测试和 AI 训练 AI 的方式让模型学会拒绝有害提示词,但拒绝机制基于概率,determined miscreants 已多次突破。

来源:MIT Technology Review · AI · technologyreview.com