跳到正文

#Hugging Face

今日 1 条
6月20日周四
6月19日周三
6月18日周二
6月13日周四
6月12日周三
6月7日周五
6月6日周四
6月5日周三
6月4日周二
5月29日周三
  1. Mistral AI78

    Mistral 发布首款代码模型 Codestral,22B 开放权重、支持 80+ 编程语言

    Mistral AI 发布首款代码模型 Codestral,这是一个 22B 开放权重生成式模型,训练数据覆盖 80+ 编程语言,上下文窗口 32k,可通过指令与补全 API 端点使用。

    推荐理由:Mistral 首款代码模型给出 22B 开放权重、32k 上下文和 80+ 语言支持,可对照其与既有代码模型的定位差异。

  2. Hugging Face Blog34

    Hugging Face 如何用 TGI Benchmarking 工具评测文本生成推理

    Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可在 Hugging Face Space 中部署模型并通过 CLI 运行,同时测量吞吐量与延迟。该工具提供 pre-fill 统计与直方图、吞吐量对延迟散点图,并按 batch size 展示结果,帮助用户在 TTFT 与吞吐之间权衡调优部署。

5月28日周二
5月24日周五
5月22日周三
5月21日周二
5月16日周四
5月14日周二
5月13日周一
5月9日周四
5月5日周日
5月3日周五
5月1日周三
4月30日周二
4月29日周一
  1. Hugging Face Blog62

    StarCoder2-15B-Instruct 发布:全透明自对齐代码生成模型

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码 LLM,用 StarCoder2-15B 自生成指令-响应对微调自身,无需人工标注或 GPT-4 蒸馏数据。

    推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。

4月23日周二
4月22日周一
4月19日周五
4月18日周四
  1. Hugging Face Blog88

    Meta 发布 Llama 3 开源大模型,Hugging Face 同步集成

    Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸的 base 与 instruct 版本,并同步发布基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face。

    推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。

4月16日周二