Hugging Face Blog·· 2023-02-24AI 评分35
Hugging Face 详解大语言模型红队测试
Red-Teaming Large Language Models
AI 导读
红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。
来源:Hugging Face Blog · huggingface.co