Hugging Face 详解大语言模型红队测试
红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。
红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、模型规模、训练数据和评测标准上的差异。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,免费讲解扩散模型理论与应用。配合课程上线,11 月 30 日将举办社区直播活动,Stable Diffusion 创作者及 Stability AI、Meta 等机构的研究者将带来演讲,聚焦扩散模型概览及构建应用的工具。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 的 meta device、自动 device map 和分片 checkpoint,在显存和内存有限的设备上加载并推理超大模型。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,方法可直接迁移。
Hugging Face 博客介绍如何利用 Wav2Vec2 所用 CTC 架构的特性,在 Transformers 中对任意长音频乃至实时流做语音识别。
推荐理由:原文给出 CTC 模型分块加 stride 的具体参数与代码,读者可据此在长音频和实时场景中复用。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 checkpoint 结合解码音频。
Hugging Face 发布博客,讲解如何用 🤗 Transformers 将预训练模型 Wav2Vec2-XLS-R-300M 微调用于低资源语音识别(ASR)。
Hugging Face 与 Facebook PyTorch、Google TPU 团队合作,让用户通过 PyTorch / XLA 在 Cloud TPU 上训练 Transformer,并保持与 Hugging Face Trainer 完全相同的接口。
Hugging Face 的 transformers v4.2.0 起通过 --sharded_ddp 和 --deepspeed 两个 Trainer 参数实验性支持 FairScale 与 DeepSpeed 的 ZeRO 功能。
推荐理由:作者用 t5-large 与 t5-3b 实测对比 FairScale 与 DeepSpeed 的显存与速度差异,并给出可直接复用的 Trainer 参数。
Hugging Face 博客发布 Stas Bekman 的客座文章,记录将 fairseq wmt19 翻译系统移植到 transformers 的完整过程。作者选用 en-ru / ru-en 预训练模型进行移植,并创建了 configuration_fsmt.py、modeling_fsmt.py、tokenization_fsmt.py 及转换脚本等文件。