Hugging Face 音频数据集完全指南:用 🤗 Datasets 一行代码加载与处理
Hugging Face 发布音频数据集使用指南,介绍如何用 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。文中以 GigaSpeech 为例,其 xs 配置含 10 小时数据,加载后自动划分 train、validation、test 三个 split。Hub 上现有 77 个语音识别数据集和 28 个音频分类数据集,并支持在线试听样本预览。
Hugging Face 发布音频数据集使用指南,介绍如何用 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。文中以 GigaSpeech 为例,其 xs 配置含 10 小时数据,加载后自动划分 train、validation、test 三个 split。Hub 上现有 77 个语音识别数据集和 28 个音频分类数据集,并支持在线试听样本预览。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,让 GPT2 到 Stable Diffusion 等模型可在 Elixir 中运行。
Hugging Face 发布《Deep Learning with Proteins》教程,面向想入门机器学习的生物学家和想入门生物学的机器学习者,并附上蛋白质语言模型微调(PyTorch、TensorFlow)与 ESMFold 蛋白质折叠(仅 PyTorch)的示例 notebook。
借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以通过 Core ML 在 Apple Silicon 上运行,Hugging Face 已将 v1.4、v1.5、v2 base 和 v2.1 base 的官方权重转换并上传到 Hub。
推荐理由:Hugging Face 与 Apple 合作把 Stable Diffusion 转成 Core ML 权重,读者可据此在 Apple Silicon 上本地跑图并了解不同变体的取舍。
Hugging Face 博客介绍如何用 🤗 Transformers 库中的 Time Series Transformer 完成单变量概率时间序列预测。该模型基于 Encoder-Decoder 的 vanilla Transformer,通过 Ancestral Sampling 自回归生成预测,并借助掩码处理缺失值,无需插补即可训练。
中国科学技术大学与微软提出的 VQ-Diffusion 是一种在量化隐空间上做加噪与去噪的条件隐扩散模型,其隐空间由离散向量集合构成。Hugging Face 现已支持通过 Diffusers 用几行代码运行该模型,加载 microsoft/vq-diffusion-ithq,并可选 FP16 权重。
Hugging Face 宣布启动 2023 年实习生项目,开放 8 个岗位,涵盖 Accelerate、Text to Speech、Embodied AI、大语言模型分布式训练框架、LLM 数据集、生成式 ML 社会影响评估和 AI 艺术工具等方向。实习生将与 Hugging Face 导师及对应开源库维护者合作,申请需通过官方招聘门户并注册 Hugging Face 账号。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,免费讲解扩散模型理论与应用。配合课程上线,11 月 30 日将举办社区直播活动,Stable Diffusion 创作者及 Stability AI、Meta 等机构的研究者将带来演讲,聚焦扩散模型概览及构建应用的工具。
Hugging Face 发布《机器学习总监洞察》系列第四期,邀请 Javier Mansilla、Shaun Gittens、Samuel Franklin 和 Evan Castle 四位机器学习总监分享 ML 对各自行业的影响。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。
Hugging Face 梳理了其推理方案:模型页上的免费 Inference Widget 与免费 Inference API 可零代码或单次 HTTP 请求调用 Hub 模型,但受速率限制,不建议用于生产。
Hugging Face 与 arXiv 合作,通过 arXivLabs 将 Spaces 集成进论文页面,新增 Demo 标签页,可直接打开社区或作者创建的开源演示。
Hugging Face 博客发布教程,演示如何借助 Concrete-ML 库在全同态加密(FHE)环境下对加密数据做情感分析,数据科学家无需密码学背景即可上手。方案用 BERT 提取文本隐藏表示(hidden size 768),再交给 XGBoost 分类,并通过客户端/服务器协议部署到云端,最后在 Hugging Face Spaces 提供完整 demo。
Hugging Face 在 transformers 4.24.0 中集成了 Contrastive Search 解码方法,PyTorch 和 TensorFlow 均可用。
推荐理由:Hugging Face 把对比搜索集成进 transformers,读者可据此替换现有解码方式并对比生成质量。
Hugging Face 更新定价体系,下线 Inference API 的付费层,该 API 仍对所有人免费开放。面向企业级高速推理需求,平台推出新服务 Inference Endpoints,并为 Spaces 提供硬件升级,可自选硬件运行 ML demo。这些服务无需订阅,只需在账单设置中绑定信用卡,用量按月计费并生成合并发票。
Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,给出推荐设置:低学习率配合逐步增加训练步数,人脸需要 800-1200 步、batch size 2、LR 1e-6,并建议使用 prior preservation 避免过拟合。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可直接用于复现和调参。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 在任意多语种 ASR 数据集上微调 Whisper。教程以 Common Voice 11.0 的印地语为例,用约 8 小时训练数据微调 Whisper small,在测试集上把 WER 从预训练模型的 63.5% 降到 32.0%。
推荐理由:以印地语为例给出 Whisper 多语种 ASR 微调全流程,8 小时数据即可把 WER 从 63.5% 降到 32.0%。
Hugging Face 将 Intel OpenVINO 集成进 Optimum Intel,用户可在多种 Intel 处理器上用 OpenVINO Runtime 对 Transformers 模型执行推理,并借助 NNCF 在数分钟内完成量化以压缩模型体积、降低预测延迟。
Hugging Face 为 🤗 Evaluate 库新增偏见指标与测量方法,用于评估 GPT-2、BLOOM 等因果语言模型的偏见。该工作流先用 🤗 Datasets 中的预设提示词引导模型生成文本,再用 🤗 Evaluate 的指标打分,示例覆盖 Toxicity、Polarity 和 Hurtfulness 三类任务,其中 toxicity 指标基于 R4 Target 仇恨检测模型。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 轻量封装,以及 🤗 Transformer 的 Trainer API。Accelerate 无需修改代码即可在单 GPU 和 TPU 上运行,Trainer 则抽象掉所有样板代码并支持多种设备和分布式场景。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于在多种嵌入任务上衡量文本嵌入模型性能,包含 56 个数据集、8 类任务,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总成统一榜单,读者可据此理解文本嵌入模型的评测口径与选型依据。
Hugging Face 推出 Inference Endpoints,可将 Hub 上的模型一键部署到云端托管基础设施。该服务支持 Public、Protected、Private 三种访问级别,Private 模式通过 AWS PrivateLink 的 VPC Endpoint 接入,仅限指定 AWS 账户访问。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud Platform 的 TPU 上实现快速推理。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整流程,含并行与编译耗时数据。
Hugging Face 团队复盘了为 BLOOM(176B 参数,bf16 下 352GB)构建推理服务器的优化过程,最终实现延迟降低 5 倍、吞吐提升 50 倍。
推荐理由:Hugging Face 团队复盘 BLOOM 推理优化全过程,从 PP 到 TP、自定义 kernel 的取舍细节对部署大模型有参考价值。
Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,其他人在模型或数据集页面点击“Cite this model/dataset”即可引用。该功能通过与 DataCite 合作实现,注册用户填写元数据后即可获得 DOI,新版本发布时 DOI 可更新、旧版本随之失效。带 DOI 的数据集和模型将永久保存,仅能通过向官方支持提交请求删除。
rinna 通过对 Stable Diffusion 进行微调,开发出日文文生图模型 Japanese Stable Diffusion,可理解日语特有词汇、拟声词与专有名词并生成日式风格图像。
Hugging Face 在 Hub 上线由 AutoTrain 驱动的 Evaluation on the Hub,无需写代码即可对任意因果语言模型做零样本评估,目前支持最大 66B 参数模型,更大模型的支持即将推出。
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可训练模型。上传数据后选择模型候选数量即可开始训练,5 个候选模型、500 张以内图片免费;示例中最佳模型达到 84% 准确率。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 的 meta device、自动 device map 和分片 checkpoint,在显存和内存有限的设备上加载并推理超大模型。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,方法可直接迁移。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个用于 Sentence Transformers 少样本微调的框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可据此判断少样本分类的成本与精度取舍。
Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”撰写。该通讯聚焦如何将伦理价值落地到机器学习开发中,并介绍了模型与 Spaces 仓库“flag”举报功能、Private Hub、评估库、数据偏差分析代码及训练碳排放追踪工具等近期工作。
Hugging Face 发布教程,展示如何用 DeepSpeed 和 Accelerate 加速 176B 参数的 BLOOM 模型推理。
推荐理由:文章给出 BLOOM 176B 在多种并行与量化方案下的实测吞吐和显存占用,可作为大模型推理部署的选型参考。
Hugging Face 发布 diffusers 0.3,新增图生图 pipeline、Textual Inversion、实验性 inpainting 与 ONNX 导出等能力。
推荐理由:diffusers 0.3 集中放出图生图、Textual Inversion 与显存优化,可据此判断扩散模型工具链的成熟度。
Hugging Face 发布教程,教你用 transformers 库的 Trainer 和自定义 Data Collator,在 Google Colab 上从零训练一个离线 Decision Transformer,让 HalfCheetah 学会奔跑。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。
RAIL Initiative 推出 OpenRAIL 许可框架,并获 Hugging Face 支持,允许 AI 模型免版税开放获取、下游使用与再分发,同时嵌入针对特定关键场景的使用限制条款。该框架主张开源许可证不适配 ML 模型,需在开放与负责任使用之间划界,被视为迈向开放且负责任 ML 开发、使用与获取的许可工具。
Hugging Face Spaces 可通过 3Dmol.js 与 Gradio 的 HTML 组件在浏览器中可视化蛋白质结构,用户输入 4 位 PDB 代码或上传 PDB 文件即可查看。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion 文生图模型。文中给出安装 diffusers==0.10.2 与加载 StableDiffusionPipeline 的代码,并说明 guidance_scale、num_inference_steps 等参数对生成结果的影响。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 Diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库完成掩码语言建模任务。