跳到正文

#部署/工程

今日 5 条
9月26日周二
9月22日周五
9月19日周二
9月15日周五
9月12日周二
9月1日周五
8月30日周三
8月23日周三
  1. Hugging Face Blog62

    Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化

    Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。

    推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。

8月22日周二
8月10日周四
8月9日周三
8月4日周五
8月2日周三
  1. Hugging Face Blog35

    Zama 用 FHE 加密大语言模型:基于 Hugging Face GPT2 的隐私推理实践

    Zama 展示了用全同态加密(FHE)在加密数据上运行大语言模型推理的方案,基于 Hugging Face transformers 库改造 GPT2,将首个多头注意力头用 Concrete-Python 转为 FHE 等价实现。实验显示 4-bit 量化可保留原模型 96% 的精度,客户端本地推理至首层后加密中间结果交由服务器计算,兼顾用户数据隐私与模型 IP 保护。

7月14日周五
7月4日周二
7月3日周一
7月1日周六
6月29日周四
6月15日周四
6月13日周二
6月2日周五
5月31日周三
5月25日周四
5月24日周三
5月23日周二
5月16日周二
5月15日周一
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成:低延迟文本生成的新方向

    Hugging Face 发布辅助生成(assisted generation)解码方法,用一个至少小一个数量级的助手模型快速生成候选 token,再由主模型前向验证,在 Transformers 中通过 assistant_model 参数即可启用。

    推荐理由:Hugging Face 官方详解辅助生成解码方法,给出可复现的延迟数据与 Transformers 调用方式。

5月1日周一
4月27日周四
  1. Hugging Face Blog36

    用 🤗 Transformers、TensorFlow 和 TPU 从零训练语言模型

    Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 上传 GCS,再到模型训练与上传的完整流程。代码默认使用 BERT 规模模型,可通过修改配置扩展到更大模型和更强 TPU pod 切片。

4月26日周三
4月21日周五
4月17日周一
4月6日周四
  1. Hugging Face Blog22

    Snorkel AI 联手 Hugging Face:为企业解锁基础模型能力

    Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务接入 Snorkel Flow 平台,让企业用户可直接调用其 150,000 多个开源模型来适配和微调基础模型。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,客户按需激活、闲置休眠,从而在控制成本的同时扩展可用模型数量。

3月28日周二
3月23日周四
3月3日周五