跳到正文

#Microsoft

今日 0 条
7月26日周三
5月24日周三
4月14日周五
2月24日周五
  1. Hugging Face Blog35

    Hugging Face 详解大语言模型红队测试

    红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。

2月8日周三
  1. Hugging Face Blog60

    SpeechT5 上线 Hugging Face Transformers,支持语音合成、识别与音色转换

    Hugging Face 宣布 SpeechT5 已集成进 Transformers,论文作者发布的官方 checkpoint 可在 Hugging Face Hub 获取,并提供语音合成、音色转换和自动语音识别三个 Spaces 演示。

    推荐理由:SpeechT5 以同一套编码器解码器架构覆盖 TTS、语音转换与 ASR,读者可据此了解多任务语音模型在 Transformers 中的接入方式。

1月26日周四
  1. Hugging Face Blog75

    用 LoRA 高效微调 Stable Diffusion

    Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。

    推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。

1月24日周二
1月23日周一
11月30日周三
11月21日周一
7月14日周四
  1. Hugging Face Blog48

    BLOOM 训练背后的技术:176B 参数模型如何用 Megatron-DeepSpeed 完成训练

    Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 GPT3 架构,使用 Megatron-DeepSpeed 框架在 384 张 80GB A100 GPU 上训练,耗时约 3.5 个月。训练数据为 59 种语言、350B token,模型词表大小 250,680,采用 3D 并行(数据、张量、流水线并行)方案。

5月23日周一
3月23日周三
10月26日周二
  1. Hugging Face Blog22

    大语言模型:新的摩尔定律?

    Hugging Face 发文质疑微软与 NVIDIA 发布的 Megatron-Turing NLG 530B 这类超大模型趋势,指出复现该实验需花费近 1 亿美元,且训练 BERT 的碳排放已相当于一次跨美飞行。文章主张改用预训练模型、更小模型(如 DistilBERT 保留 97% 语言理解能力、体积小 40%、速度快 60%)和微调等务实方案。

1月19日周二
9月22日周二
7月22日周一
  1. OpenAI News82

    微软向 OpenAI 投资 10 亿美元并达成合作

    微软向 OpenAI 投资 10 亿美元,支持其构建通用人工智能(AGI)并让经济收益广泛分布。双方将在 Microsoft Azure 上合作开发可扩展至 AGI 的硬件和软件平台,联合开发新的 Azure AI 超算技术,微软同时成为 OpenAI 的独家云服务商。

    推荐理由:微软以 10 亿美元投资 OpenAI 并成为其独家云服务商,读者可据此了解双方早期算力与平台合作框架。

11月15日周二