跳到正文

#部署/工程

今日 8 条
3月18日周一
3月15日周五
2月29日周四
2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面集成

    Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种尺寸,各有基础版和指令微调版,上下文长度 8K tokens。Gemma-7B 在 LLM Leaderboard 上得分 63.75,性能接近 Mistral 7B;Hugging Face 提供了 Transformers、Google Cloud、Inference Endpoints 集成以及基于 TRL 的微调示例。

    推荐理由:Google 发布 Gemma 开源模型家族,读者可了解其两种尺寸、性能位次及在 Hugging Face 生态中的部署与微调路径。

2月14日周三
2月1日周四
1月30日周二
1月25日周四
1月15日周一
1月14日周日
12月20日周三
12月11日周一
  1. Hugging Face Blog62

    Hugging Face 详解混合专家模型 MoE

    Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。

    推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。

12月5日周二
  1. Hugging Face Blog62

    Hugging Face 与 AMD 合作:AMD GPU 开箱即用加速大语言模型

    Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。

    推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。

11月7日周二
11月3日周五
  1. Hugging Face Blog22

    Hugging Face Hub 推出存储区域功能

    Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,可让组织自行选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,亚太区即将上线;非默认位置的仓库会直接显示 Region 标签。官方称欧洲用户将仓库放在 EU 区域时,上传和下载速度约为存放在 US 时的 4-5 倍。

10月24日周二
10月19日周四
10月11日周三
10月4日周三
10月3日周二
10月2日周一
9月28日周四
9月26日周二
9月22日周五
9月19日周二
9月15日周五
9月12日周二
9月1日周五
8月30日周三
8月23日周三
  1. Hugging Face Blog62

    Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化

    Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。

    推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。

8月22日周二
8月10日周四
8月9日周三