跳到正文

#Hugging Face

今日 0 条
6月20日周二
  1. Hugging Face Blog22

    Hugging Face 就美国 NTIA 的 AI 问责政策提交回应意见

    Hugging Face 于 6 月 12 日向美国商务部 NTIA 提交了关于 AI 问责政策的回应意见,强调文档规范与透明度在推动 AI 问责中的作用。其建议问责机制应覆盖 ML 开发全流程、结合内部要求与外部访问透明,并吸纳开发者、多学科研究社区、倡导组织、政策制定者和记者等最广泛参与者。

6月19日周一
  1. Hugging Face Blog50

    如何为低资源 ASR 微调 MMS Adapter 模型

    Hugging Face 发布教程,介绍如何为 Meta AI 的 MMS 模型微调 Adapter 层以适配低资源语言的 ASR 任务。MMS 预训练 checkpoint 覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错率。对低资源语言,Adapter 训练比全模型微调更省内存、更鲁棒且性能更好。

6月16日周五
6月15日周四
  1. Hugging Face Blog22

    Hugging Face 发布新版内容政策与指南

    Hugging Face 更新了平台内容政策,以应对机器学习内容审核带来的新挑战,并强调“同意”为核心价值。新政策关注用户对所见内容及自身身份与表达被呈现方式的同意权,同时禁止针对用户和 Hugging Face 员工的攻击性或骚扰性语言。平台鼓励通过 Community Tab 公开讨论并协作解决冲突,用户可通过 feedback@huggingface.co 反馈意见。

6月13日周二
6月12日周一
  1. Hugging Face Blog22

    Hugging Face Hub 如何服务美术馆、图书馆、档案馆与博物馆(GLAM)

    Hugging Face Hub 目前托管超 190,000 个机器学习模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频及多模态任务。这篇博客面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何在 Hub 上按任务和语言筛选模型、用 model widget 测试效果,并以 CSV 格式上传 GLAM 数据集。

6月7日周三
6月6日周二
  1. Hugging Face Blog22

    Hugging Face Hub 上线 fastText 官方镜像:157 种语言词向量与语言识别模型

    Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成还支持文本分类与特征提取 widget,模型页面提供语言识别和词向量最近邻查询的在线试用。

6月5日周一
  1. Hugging Face Blog78

    Falcon 模型家族落地 Hugging Face 生态

    阿布扎比技术创新研究院发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。

    推荐理由:介绍 Falcon 系列的开源许可、训练数据与多查询注意力设计,并给出在 Hugging Face 生态中推理和微调的具体路径。

6月2日周五
6月1日周四
5月31日周三
5月25日周四
5月24日周三
  1. Hugging Face Blog78

    Hugging Face 用 bitsandbytes 与 QLoRA 支持 4-bit 量化模型

    Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。

    推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 集成进 transformers,读者可据此判断消费级硬件微调大模型的门槛变化。

5月23日周二
  1. Hugging Face Blog62

    Hugging Face 公布 safetensors 安全审计结果,将成默认保存格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的严重安全漏洞,部分规范格式不精确和缺失校验(允许 polyglot 文件)的问题已被修复。

    推荐理由:外部安全审计确认 safetensors 无任意代码执行漏洞,并推动其成为 transformers 默认格式。

5月16日周二
  1. Hugging Face Blog34

    BigCode 背后的大规模近重复数据删除

    Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH(参数 256, 0.7, 5)进行文档级近重复数据删除,并确认去重同样能提升代码模型性能且所需数据集更小。文章还对比了 The Stack、CodeParrot、InCoder 等代码数据集所用的精确匹配、Levenshtein 距离等去重方法,指出去重可减少训练步数、防止基准污染与数据泄露。

5月15日周一
  1. Hugging Face Blog62

    Hugging Face 介绍 RWKV:兼具 Transformer 优势的 RNN 架构

    Hugging Face 发文介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优势,并已被集成进 transformers 库。RWKV 由 Bo Peng 主导,训练 GPU 由 Stability AI 捐赠,现有模型参数从约 170M 到 14B,训练上下文长度达 8192 且速度与 ctx1024 模型相当。

    推荐理由:结合 RWKV 架构原理与 transformers 集成示例,读者可了解 RNN 与 Transformer 优势如何被合并。

5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成:低延迟文本生成的新方向

    Hugging Face 发布辅助生成(assisted generation)解码方法,用一个至少小一个数量级的助手模型快速生成候选 token,再由主模型前向验证,在 Transformers 中通过 assistant_model 参数即可启用。

    推荐理由:Hugging Face 官方详解辅助生成解码方法,给出可复现的延迟数据与 Transformers 调用方式。

5月9日周二
  1. Hugging Face Blog62

    用 StarCoder 打造编码助手 StarChat

    Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder 模型,用 OpenAssistant 对话数据集微调出编码助手 StarChat,并公开了代码、数据集与模型。

    推荐理由:原文完整给出了用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。

5月8日周一
  1. Hugging Face Blog42

    Hugging Face 解读文本到视频模型:从 GAN 到扩散模型的发展与挑战

    Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则转向扩散模型。文章还分析了算力成本高、高质量数据集稀缺、视频描述模糊等核心挑战。

5月4日周四
  1. Hugging Face Blog78

    BigCode 发布 StarCoder:面向代码的 15B 开源大模型

    BigCode 发布 StarCoder 与 StarCoderBase 两个代码大语言模型,基于 GitHub 上 80 多种编程语言的宽松许可数据训练,参数量约 15B、训练 1 万亿 token,上下文长度超过 8,000 token。

    推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的水平与许可条件。

5月1日周一
4月27日周四
  1. Hugging Face Blog36

    用 🤗 Transformers、TensorFlow 和 TPU 从零训练语言模型

    Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 上传 GCS,再到模型训练与上传的完整流程。代码默认使用 BERT 规模模型,可通过修改配置扩展到更大模型和更强 TPU pod 切片。

4月26日周三
4月24日周一
4月21日周五
4月17日周一
4月14日周五
4月12日周三
  1. Hugging Face Blog27

    Hugging Face 与 Substra 合作推出联邦学习演示空间,推动隐私保护 AI

    Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多数据源训练的模型在验证数据上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等复杂安全环境中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子数据集。

4月6日周四
  1. Hugging Face Blog22

    Snorkel AI 联手 Hugging Face:为企业解锁基础模型能力

    Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务接入 Snorkel Flow 平台,让企业用户可直接调用其 150,000 多个开源模型来适配和微调基础模型。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,客户按需激活、闲置休眠,从而在控制成本的同时扩展可用模型数量。