跳到正文

#部署/工程

今日 6 条
5月1日周三
4月23日周二
4月16日周二
4月10日周三
4月3日周三
  1. Hugging Face Blog36

    在 Intel Xeon 上用 🤗 Optimum Intel 实现极速 SetFit 推理

    借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。该量化基于 Intel Neural Compressor,只需约 100 条无标注校准样本、无需训练,即可在保持精度的同时降低内存占用与延迟,Optimum Intel 版本需不低于 1.14.0。

4月2日周二
3月25日周一
3月22日周五
3月21日周四
3月20日周三
3月18日周一
3月15日周五
2月29日周四
2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面集成

    Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种尺寸,各有基础版和指令微调版,上下文长度 8K tokens。Gemma-7B 在 LLM Leaderboard 上得分 63.75,性能接近 Mistral 7B;Hugging Face 提供了 Transformers、Google Cloud、Inference Endpoints 集成以及基于 TRL 的微调示例。

    推荐理由:Google 发布 Gemma 开源模型家族,读者可了解其两种尺寸、性能位次及在 Hugging Face 生态中的部署与微调路径。

2月14日周三
2月1日周四
1月30日周二
1月25日周四
1月15日周一
1月14日周日
12月20日周三
12月11日周一
  1. Hugging Face Blog62

    Hugging Face 详解混合专家模型 MoE

    Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。

    推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。

12月5日周二
  1. Hugging Face Blog62

    Hugging Face 与 AMD 合作:AMD GPU 开箱即用加速大语言模型

    Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。

    推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。

11月7日周二
11月3日周五
  1. Hugging Face Blog22

    Hugging Face Hub 推出存储区域功能

    Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,可让组织自行选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,亚太区即将上线;非默认位置的仓库会直接显示 Region 标签。官方称欧洲用户将仓库放在 EU 区域时,上传和下载速度约为存放在 US 时的 4-5 倍。

10月24日周二
10月19日周四
10月11日周三
10月4日周三
10月3日周二
10月2日周一