跳到正文

#Meta

今日 4 条
10月2日周一
9月28日周四
9月26日周二
9月13日周三
  1. Hugging Face Blog62

    用 PyTorch FSDP 微调 Llama 2 70B

    Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并在 2 节点 16 张 A100 80GB 上完成训练,耗时约 13.5 小时。

    推荐理由:原文给出 70B 模型多节点微调的三个具体瓶颈及对应配置改法,可迁移到其他大模型训练场景。

8月25日周五
  1. Hugging Face Blog82

    Code Llama 发布:Llama 2 学会写代码

    Meta 发布 Code Llama,基于 Llama 2 初始化并在 5000 亿 token 代码数据上训练,提供 7B、13B、34B 三种规格,另有 Python 专用版和指令微调版,采用与 Llama 2 相同的社区许可并允许商用。

    推荐理由:梳理 Code Llama 三种规格与 Python 专用、指令微调变体的差异,并给出 Hugging Face 生态的接入方式与基准对比。

8月8日周二
8月4日周五
7月18日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 2,Hugging Face 全面集成

    Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用宽松社区许可并允许商用。相比 Llama 1,预训练 token 增加 40%,上下文长度提升至 4k,70B 模型使用 grouped-query attention。

    推荐理由:Meta 发布 Llama 2 并开放商用,Hugging Face 同步给出推理、部署与微调入口,可据此判断开源模型的可落地程度。

7月17日周一
6月23日周五
  1. Hugging Face Blog62

    Open LLM Leaderboard 的 MMLU 分数为何与 LLaMA 论文不一致

    Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。

    推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。

6月19日周一
  1. Hugging Face Blog50

    如何为低资源 ASR 微调 MMS Adapter 模型

    Hugging Face 发布教程,介绍如何为 Meta AI 的 MMS 模型微调 Adapter 层以适配低资源语言的 ASR 任务。MMS 预训练 checkpoint 覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错率。对低资源语言,Adapter 训练比全模型微调更省内存、更鲁棒且性能更好。

6月6日周二
  1. Hugging Face Blog22

    Hugging Face Hub 上线 fastText 官方镜像:157 种语言词向量与语言识别模型

    Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成还支持文本分类与特征提取 widget,模型页面提供语言识别和词向量最近邻查询的在线试用。

4月5日周三
2月24日周五
  1. Hugging Face Blog35

    Hugging Face 详解大语言模型红队测试

    红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。

1月24日周二
11月25日周五
9月27日周二
2月1日周二
1月12日周三
11月15日周一
2月9日周二
1月19日周二
11月3日周二