跳到正文

#Hugging Face

今日 1 条
5月31日周三
5月25日周四
5月24日周三
  1. Hugging Face Blog78

    Hugging Face 用 bitsandbytes 与 QLoRA 支持 4-bit 量化模型

    Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。

    推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 集成进 transformers,读者可据此判断消费级硬件微调大模型的门槛变化。

5月23日周二
  1. Hugging Face Blog62

    Hugging Face 公布 safetensors 安全审计结果,将成默认保存格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的严重安全漏洞,部分规范格式不精确和缺失校验(允许 polyglot 文件)的问题已被修复。

    推荐理由:外部安全审计确认 safetensors 无任意代码执行漏洞,并推动其成为 transformers 默认格式。

5月16日周二
  1. Hugging Face Blog34

    BigCode 背后的大规模近重复数据删除

    Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH(参数 256, 0.7, 5)进行文档级近重复数据删除,并确认去重同样能提升代码模型性能且所需数据集更小。文章还对比了 The Stack、CodeParrot、InCoder 等代码数据集所用的精确匹配、Levenshtein 距离等去重方法,指出去重可减少训练步数、防止基准污染与数据泄露。

5月15日周一
  1. Hugging Face Blog62

    Hugging Face 介绍 RWKV:兼具 Transformer 优势的 RNN 架构

    Hugging Face 发文介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优势,并已被集成进 transformers 库。RWKV 由 Bo Peng 主导,训练 GPU 由 Stability AI 捐赠,现有模型参数从约 170M 到 14B,训练上下文长度达 8192 且速度与 ctx1024 模型相当。

    推荐理由:结合 RWKV 架构原理与 transformers 集成示例,读者可了解 RNN 与 Transformer 优势如何被合并。

5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成:低延迟文本生成的新方向

    Hugging Face 发布辅助生成(assisted generation)解码方法,用一个至少小一个数量级的助手模型快速生成候选 token,再由主模型前向验证,在 Transformers 中通过 assistant_model 参数即可启用。

    推荐理由:Hugging Face 官方详解辅助生成解码方法,给出可复现的延迟数据与 Transformers 调用方式。

5月9日周二
  1. Hugging Face Blog62

    用 StarCoder 打造编码助手 StarChat

    Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder 模型,用 OpenAssistant 对话数据集微调出编码助手 StarChat,并公开了代码、数据集与模型。

    推荐理由:原文完整给出了用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。

5月8日周一
  1. Hugging Face Blog42

    Hugging Face 解读文本到视频模型:从 GAN 到扩散模型的发展与挑战

    Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则转向扩散模型。文章还分析了算力成本高、高质量数据集稀缺、视频描述模糊等核心挑战。

5月4日周四
  1. Hugging Face Blog78

    BigCode 发布 StarCoder:面向代码的 15B 开源大模型

    BigCode 发布 StarCoder 与 StarCoderBase 两个代码大语言模型,基于 GitHub 上 80 多种编程语言的宽松许可数据训练,参数量约 15B、训练 1 万亿 token,上下文长度超过 8,000 token。

    推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的水平与许可条件。

5月1日周一
4月27日周四
  1. Hugging Face Blog36

    用 🤗 Transformers、TensorFlow 和 TPU 从零训练语言模型

    Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 上传 GCS,再到模型训练与上传的完整流程。代码默认使用 BERT 规模模型,可通过修改配置扩展到更大模型和更强 TPU pod 切片。

4月26日周三
4月24日周一
4月21日周五
4月17日周一
4月14日周五
4月12日周三
  1. Hugging Face Blog27

    Hugging Face 与 Substra 合作推出联邦学习演示空间,推动隐私保护 AI

    Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多数据源训练的模型在验证数据上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等复杂安全环境中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子数据集。

4月6日周四
  1. Hugging Face Blog22

    Snorkel AI 联手 Hugging Face:为企业解锁基础模型能力

    Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务接入 Snorkel Flow 平台,让企业用户可直接调用其 150,000 多个开源模型来适配和微调基础模型。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,客户按需激活、闲置休眠,从而在控制成本的同时扩展可用模型数量。

4月5日周三
3月30日周四
3月28日周二
3月27日周一
3月24日周五
  1. Hugging Face Blog62

    用 diffusers 训练你自己的 ControlNet

    Hugging Face 发布教程,介绍如何用 diffusers 训练自定义 ControlNet,并以人脸姿态为例完整走通流程。训练分三步:规划条件、构建数据集、训练模型,数据集需包含原图、条件图和提示词三列。

    推荐理由:完整复现了从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。

3月23日周四
3月10日周五
  1. Hugging Face Blog22

    Hugging Face Transformers 上线 Informer:面向多变量概率时间序列预测

    Informer 模型已在 🤗 Transformers 中可用,用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层内存占用从 O(NT²) 降至 O(N·T log T)。

3月9日周四
  1. Hugging Face Blog67

    Hugging Face 集成 trl 与 peft,在 24GB 消费级 GPU 上微调 20B 大模型

    Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。该方案用 8-bit 加载、低秩适配器和共享参考模型三层手段压缩显存,在 24GB NVIDIA 4090 上完成了 20B 参数 gpt-neox 的 RLHF 微调,完整训练则在单张 A100 上跑完。

    推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到显存受限的训练场景。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 发布 ViT 与 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。

3月3日周五
  1. Hugging Face Blog78

    Diffusers 集成 ControlNet,支持多种空间条件控制生成

    Hugging Face 在 Diffusers 中推出 StableDiffusionControlNetPipeline,把 ControlNet 的空间条件控制接入扩散模型生成流程,支持 canny 边缘、深度图、分割图、scribble、关键点等 8 种条件模型。

    推荐理由:Diffusers 集成 ControlNet 并给出多种条件控制的完整代码示例,读者可据此复现并评估显存与速度开销。

3月2日周四
  1. Hugging Face Blog22

    Hugging Face 发布 Diffusers 库开发伦理准则

    Hugging Face 为 Diffusers 库发布了一套伦理框架,用于指导维护者处理社区贡献时的技术决策。该准则包含透明度、一致性、简洁性、可访问性、可复现性和责任六项价值观,并列出 Community tab、Tag 功能、偏见探索与评估等安全机制,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全措施。

3月1日周三
2月24日周五