跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

132条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–132 条 · 共 132 条
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成:低延迟文本生成的新方向

    Hugging Face 发布辅助生成(assisted generation)解码方法,用一个至少小一个数量级的助手模型快速生成候选 token,再由主模型前向验证,在 Transformers 中通过 assistant_model 参数即可启用。

    推荐理由:Hugging Face 官方详解辅助生成解码方法,给出可复现的延迟数据与 Transformers 调用方式。

4月26日周三
10月13日周四
10月12日周三
9月27日周二
9月16日周五
9月14日周二
7月28日周三
5月25日周二
  1. Hugging Face Blog60

    Gradio 2.0 发布:一行代码加载并混用 Hugging Face 模型

    Gradio 2.0 发布,可用一行代码为 Hugging Face 模型加载 GUI,默认调用 Hugging Face 托管的 Inference API,也可本地运行 transformers。该版本支持把多个模型并联对比或串联组合,例如用 3 行代码搭建翻译并摘要芬兰语新闻的应用,安装方式为 pip install gradio。

    推荐理由:原文给出 Gradio 2.0 一行代码加载 Hugging Face 模型并串联、并联组合的方式,读者可据此判断搭建模型演示的成本变化。

4月16日周五
  1. Hugging Face Blog60

    Hugging Face 发布 Accelerate 库,让原始 PyTorch 训练脚本适配分布式与混合精度

    Hugging Face 发布 Accelerate 库,面向希望完全掌控训练循环、又不愿编写分布式训练和混合精度样板代码的 PyTorch 用户。只需在标准训练脚本中加入约五行代码,即可在单机多卡、多节点、TPU 等分布式环境以及有无混合精度的情况下运行,并自动处理设备放置。

    推荐理由:官方给出五处代码改动即可切换分布式与混合精度的具体做法,便于评估对现有 PyTorch 训练脚本的改造成本。

1月19日周二
12月6日周三
  1. OpenAI News62

    OpenAI 发布块稀疏 GPU kernel

    OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU kernel,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。OpenAI 表示已用这些 kernel 在文本情感分析和文本、图像生成建模上取得当时的最优结果。

    推荐理由:OpenAI 公开面向块稀疏权重网络的 GPU kernel,并给出相对 cuBLAS 与 cuSPARSE 的加速幅度和落地任务。