跳到正文

#开源生态

今日 1 条
2月3日周六
  1. Hugging Face Blog60

    Hugging Face 发布 SegMoE:从零构建混合专家扩散模型

    Hugging Face 发布 SegMoE 框架,可从零创建混合专家(MoE)扩散模型,并已集成 diffusers。同时发布 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。

    推荐理由:原文给出从零构建 MoE 扩散模型的完整流程与配置示例,读者可据此判断能否把已有模型合并成新模型。

2月1日周四
  1. Hugging Face Blog22

    Hugging Face 上的 PatchTST 时间序列 Transformer 实战

    Hugging Face 博客给出 PatchTST 的上手示例,先在 Electricity 数据集上做预测,再用预训练模型对 ETTh1 数据集做零样本预测,随后进行线性探测与微调。PatchTST 由 Yuqi Nie 等人提出、发表于 ICLR 2023,通过将时间序列切分为 patch 作为输入 token,并采用通道独立设计,在保留局部语义的同时二次方降低注意力计算与内存开销。

  2. Hugging Face Blog62

    Hugging Face 发布开源模型 Constitutional AI 完整配方

    Hugging Face 发布了一套用开源模型实现 Constitutional AI 的端到端配方,并开源了 llm-swarm 工具,用于在 Slurm 集群上基于 TGI 和 vLLM 做可扩展的合成数据生成。

    推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可迁移到自定义对齐流程。

1月25日周四
1月24日周三
1月19日周五
1月18日周四
  1. Hugging Face Blog34

    用 DPO、IPO 与 KTO 做偏好微调:Hugging Face 的实证对比

    Hugging Face 在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个 7B 模型上,用 MT-Bench 对比了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法,并扫描 β 等关键超参数。结果显示其中一种方法明显优于其他两种,但需调好关键超参数才能达到最佳效果;相关代码已在 alignment-handbook 开源。

1月12日周五
  1. Hugging Face Blog28

    如何用 Hugging Face 排行榜模板搭建自己的 LLM 排行榜:以 Vectara 幻觉排行榜为例

    Vectara 基于 Hugging Face 开源的排行榜模板,搭建了全新的 HHEM 幻觉评测排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜支持动态提交新模型评测请求并自动更新结果,相关源码已公开在其 Hugging Face Space 仓库中。

1月10日周三
  1. Hugging Face Blog62

    Unsloth 与 TRL 集成:LLM 微调提速 2 倍、显存最多降 74%

    Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。

    推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。

1月4日周四
1月2日周二
12月18日周一
  1. Hugging Face Blog38

    2023:开源大语言模型之年

    Hugging Face 回顾 2023 年开源 LLM 进展,指出公众对开源与闭源之争的关注度大幅上升。文章梳理了预训练大模型的构成要素,包括架构、训练数据、tokenizer、训练超参数与模型权重,并回顾 2022 年的代表模型:176B 参数的 BLOOM、175B 参数的 OPT 以及 GLM-130B。

12月11日周一
  1. Hugging Face Blog62

    Hugging Face 详解混合专家模型 MoE

    Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。

    推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。

12月5日周二
  1. Hugging Face Blog62

    Hugging Face 与 AMD 合作:AMD GPU 开箱即用加速大语言模型

    Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。

    推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。

12月1日周五
  1. Hugging Face Blog34

    Open LLM Leaderboard 的 DROP 基准深度排查

    Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。

11月9日周四
  1. Hugging Face Blog80

    Hugging Face 发布 LCM LoRA,SDXL 4 步出图

    Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。

    推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。

11月7日周二
10月27日周五
10月25日周三
10月24日周二
10月19日周四
10月4日周三
10月3日周二
9月29日周五
  1. Hugging Face Blog12

    Hugging Face ethics and society Newsletter #5:Hugging Face 走进华盛顿与 2023 夏季随想

    Hugging Face 发布 Ethics and Society Newsletter #5,回顾其今夏向欧盟、英国和美国立法者提供 AI 价值观与监管建议的工作,包括 CEO Clem 在美国国会作证及在美国参议院 AI Insight Forum 发言。团队还就 EU AI Act、NTIA AI 问责、开源 AI 益处等议题公开发声,并将偏见与危害测试应用于新多模态模型 IDEFICS。

9月27日周三
  1. Mistral AI82

    Mistral AI 发布 7.3B 参数模型 Mistral 7B

    Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地部署。官方称该模型在所有基准上超过 Llama 2 13B,在多项基准上超过 Llama 1 34B,代码能力接近 CodeLlama 7B。

    推荐理由:官方给出 Mistral 7B 与 Llama 2 系列的逐项对比和滑动窗口注意力设计,可据此判断小参数模型的性价比边界。

9月26日周二
9月22日周五
9月18日周一
  1. Hugging Face Blog62

    3D Gaussian Splatting 入门:原理、训练流程与图形学前景

    Hugging Face 博客发布 3D Gaussian Splatting 入门介绍,说明这是一种从少量图像学习逼真场景并实时渲染的栅格化技术。文章拆解了完整流程:先用 COLMAP 做 Structure from Motion 估计点云,再把每个点转成高斯并训练,训练中通过可微高斯栅格化计算损失,并按梯度大小自动分裂、克隆或剪枝高斯。

    推荐理由:文章把 3D Gaussian Splatting 的流程拆成可理解的步骤,并列出显存、磁盘与渲染管线兼容性等实际限制。

9月15日周五
9月13日周三
  1. Hugging Face Blog62

    Würstchen 发布:面向图像生成的高效扩散模型

    Würstchen 是一个文本条件扩散模型,其文本条件部分在高度压缩的潜空间中工作,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 组成 Decoder,实现 42x 空间压缩,Stage C 作为 Prior 在该潜空间中训练。

    推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断高效扩散模型在成本上的取舍。

  2. Hugging Face Blog62

    用 PyTorch FSDP 微调 Llama 2 70B

    Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并在 2 节点 16 张 A100 80GB 上完成训练,耗时约 13.5 小时。

    推荐理由:原文给出 70B 模型多节点微调的三个具体瓶颈及对应配置改法,可迁移到其他大模型训练场景。

9月12日周二