跳到正文

#Hugging Face

今日 1 条
4月15日周一
4月11日周四
4月10日周三
4月9日周二
  1. Hugging Face Blog60

    Google 发布代码专用模型 CodeGemma,含 2B 与 7B 三个版本

    Google 发布代码专用模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint,额外用 5000 亿 token 的英文、数学和代码数据训练,包含 2B base、7B base 和 7B instruct 三个版本,均保持 8K token 上下文。

    推荐理由:Google 与 Hugging Face 联合发布三款代码专用 Gemma 模型,读者可据此了解其规格、基准表现与部署方式。

4月4日周四
4月3日周三
  1. Hugging Face Blog36

    在 Intel Xeon 上用 🤗 Optimum Intel 实现极速 SetFit 推理

    借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。该量化基于 Intel Neural Compressor,只需约 100 条无标注校准样本、无需训练,即可在保持精度的同时降低内存占用与延迟,Optimum Intel 版本需不低于 1.14.0。

4月2日周二
3月25日周一
3月22日周五
  1. Hugging Face Blog62

    Hugging Face 发布二值与标量嵌入量化方法,检索提速最高 45 倍

    Hugging Face 博客介绍嵌入量化方法,将 float32 嵌入转为二值或 int8,内存与磁盘占用分别缩小 32 倍和 4 倍。在 MTEB 检索的 15 个基准上,二值量化配合重排序可保留约 96% 的默认性能,检索速度平均提升 24.76 倍,int8 平均提升 3.66 倍。

    推荐理由:Hugging Face 官方给出嵌入量化在检索速度、内存与成本上的实测对比,并附可复用脚本。

3月21日周四
3月20日周三
  1. Hugging Face Blog62

    Cosmopedia:如何为 LLM 预训练构建大规模合成数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。

    推荐理由:Hugging Face 公开了从提示词设计到去污染、训练评估的完整合成数据流水线,可迁移到自建预训练数据。

  2. Hugging Face Blog62

    Hugging Face 博客介绍 GaLore:在消费级硬件上训练大模型

    Hugging Face 博客介绍 GaLore 优化器,通过将梯度投影到低秩子空间,可把优化器状态显存占用降低 82.5% 以上,从而在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 70 亿参数的 Llama 架构模型。

    推荐理由:原文给出 GaLore 与 8-bit 优化器结合的训练流程和可运行代码,读者可据此在消费级显卡上复现大模型训练。

3月18日周一
3月15日周五
  1. Hugging Face Blog40

    Hugging Face 发布 WebSight 数据集,用 VLM 将网页截图转为 HTML 代码

    Hugging Face 推出 WebSight 数据集,用于训练视觉语言模型将网页截图转换为 HTML 代码。该数据集从 v0.1 的 823,000 对截图/HTML 样本扩展至 v0.2 的 200 万例,改用真实截图和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将网页截图转为可用的 HTML 代码,并还原截图中的图像。

3月5日周二
  1. Hugging Face Blog36

    Hugging Face 发布 ConTextual:评测多模态模型在文本密集场景中的图文联合推理能力

    加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。

3月4日周一
2月29日周四
2月28日周三
  1. Hugging Face Blog78

    BigCode 发布 StarCoder2 系列代码模型与 The Stack v2 数据集

    BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。

    推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、数据集与训练代码,读者可据此了解开源代码模型在参数规模与训练数据上的具体取舍。

2月27日周二
2月26日周一
2月23日周五
2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面集成

    Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种尺寸,各有基础版和指令微调版,上下文长度 8K tokens。Gemma-7B 在 LLM Leaderboard 上得分 63.75,性能接近 Mistral 7B;Hugging Face 提供了 Transformers、Google Cloud、Inference Endpoints 集成以及基于 TRL 的微调示例。

    推荐理由:Google 发布 Gemma 开源模型家族,读者可了解其两种尺寸、性能位次及在 Hugging Face 生态中的部署与微调路径。

2月20日周二
2月19日周一
2月16日周五
2月14日周三
2月8日周四
2月3日周六
  1. Hugging Face Blog60

    Hugging Face 发布 SegMoE:从零构建混合专家扩散模型

    Hugging Face 发布 SegMoE 框架,可从零创建混合专家(MoE)扩散模型,并已集成 diffusers。同时发布 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。

    推荐理由:原文给出从零构建 MoE 扩散模型的完整流程与配置示例,读者可据此判断能否把已有模型合并成新模型。

2月2日周五
2月1日周四
  1. Hugging Face Blog22

    Hugging Face 上的 PatchTST 时间序列 Transformer 实战

    Hugging Face 博客给出 PatchTST 的上手示例,先在 Electricity 数据集上做预测,再用预训练模型对 ETTh1 数据集做零样本预测,随后进行线性探测与微调。PatchTST 由 Yuqi Nie 等人提出、发表于 ICLR 2023,通过将时间序列切分为 patch 作为输入 token,并采用通道独立设计,在保留局部语义的同时二次方降低注意力计算与内存开销。

  2. Hugging Face Blog62

    Hugging Face 发布开源模型 Constitutional AI 完整配方

    Hugging Face 发布了一套用开源模型实现 Constitutional AI 的端到端配方,并开源了 llm-swarm 工具,用于在 Slurm 集群上基于 TGI 和 vLLM 做可扩展的合成数据生成。

    推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可迁移到自定义对齐流程。

1月31日周三