跳到正文

#部署/工程

今日 5 条
3月1日周三
2月23日周四
2月21日周二
2月15日周三
2月6日周一
1月24日周二
1月2日周一
12月14日周三
12月9日周五
11月21日周一
11月8日周二
  1. Hugging Face Blog30

    Hugging Face 更新定价:Inference API 付费层下线,推出 Inference Endpoints

    Hugging Face 更新定价体系,下线 Inference API 的付费层,该 API 仍对所有人免费开放。面向企业级高速推理需求,平台推出新服务 Inference Endpoints,并为 Spaces 提供硬件升级,可自选硬件运行 ML demo。这些服务无需订阅,只需在账单设置中绑定信用卡,用量按月计费并生成合并发票。

11月2日周三
10月21日周五
  1. Hugging Face Blog36

    从 PyTorch DDP 到 Accelerate 再到 Trainer:轻松掌握分布式训练

    Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 轻量封装,以及 🤗 Transformer 的 Trainer API。Accelerate 无需修改代码即可在单 GPU 和 TPU 上运行,Trainer 则抽象掉所有样板代码并支持多种设备和分布式场景。

10月14日周五
10月13日周四
10月12日周三
9月27日周二
9月16日周五
9月7日周三
8月24日周三
8月19日周五
8月18日周四
8月12日周五
  1. Hugging Face Blog22

    Hugging Face 的 TensorFlow 哲学

    Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计哲学:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。库通过 TFAutoModel 等类一行代码加载预训练模型,并强调应保留 Keras 高层 API 而非绕开它。

8月11日周四
8月3日周三
8月2日周二
  1. Hugging Face Blog22

    Nyströmformer:用 Nyström 方法以线性时间与内存近似自注意力

    Nyströmformer 通过 Nyström 方法近似标准自注意力,将时间和内存复杂度从 O(n²) 降至 O(n)。它不直接对 softmax 矩阵采样,而是从 query 和 key 中选取 landmark,用分段均值构造 Q̃、K̃,并据此构建三个矩阵完成近似。实验显示仅选 32 或 64 个 landmark 即可在 n=4096 或 8192 的长序列上取得有竞争力的性能。

7月27日周三
7月25日周一
7月14日周四
  1. Hugging Face Blog48

    BLOOM 训练背后的技术:176B 参数模型如何用 Megatron-DeepSpeed 完成训练

    Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 GPT3 架构,使用 Megatron-DeepSpeed 框架在 384 张 80GB A100 GPU 上训练,耗时约 3.5 个月。训练数据为 59 种语言、350B token,模型词表大小 250,680,采用 3D 并行(数据、张量、流水线并行)方案。

7月13日周三
6月28日周二
6月22日周三
6月15日周三
6月14日周二
6月9日周四
6月2日周四
5月26日周四
5月19日周四
5月10日周二