用 🤗 Transformers 微调 W2V2-BERT 实现低资源 ASR
Hugging Face 发布教程,演示如何用 🤗 Transformers 将 facebook/w2v-bert-2.0 微调至低资源 ASR 任务。
Hugging Face 发布教程,演示如何用 🤗 Transformers 将 facebook/w2v-bert-2.0 微调至低资源 ASR 任务。
Hugging Face 在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个 7B 模型上,用 MT-Bench 对比了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法,并扫描 β 等关键超参数。结果显示其中一种方法明显优于其他两种,但需调好关键超参数才能达到最佳效果;相关代码已在 alignment-handbook 开源。
Hugging Face 发布经 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime CUDA 与 TensorRT 执行提供程序加速推理,吞吐量最高较 PyTorch 提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 官方博客给出教程,把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整给出从 ComfyUI 工作流导出 Python、包成 Gradio 应用并部署到 ZeroGPU 的步骤,可照着复现。
Vectara 基于 Hugging Face 开源的排行榜模板,搭建了全新的 HHEM 幻觉评测排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜支持动态提交新模型评测请求并自动更新结果,相关源码已公开在其 Hugging Face Space 仓库中。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。
Hugging Face 发布 aMUSEd,这是对 Google MUSE 的开源复现,采用 Masked Image Model(MIM)而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
推荐理由:Hugging Face 开源复现 Google MUSE 的非扩散文生图模型,读者可了解 MIM 路线在推理步数与体积上的取舍。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:汇总社区 SDXL Dreambooth LoRA 微调的 SOTA 实践,并给出可直接运行的 diffusers 训练脚本与参数。
Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,同时保证输出与单独使用主模型完全一致。
推荐理由:给出 Whisper 投机解码的完整实现与基准数据,读者可据此在现有管线中获得约 2 倍加速且输出不变。
Hugging Face 回顾 2023 年开源 LLM 进展,指出公众对开源与闭源之争的关注度大幅上升。文章梳理了预训练大模型的构成要素,包括架构、训练数据、tokenizer、训练超参数与模型权重,并回顾 2022 年的代表模型:176B 参数的 BLOOM、175B 参数的 OPT 以及 GLM-130B。
Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。
推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,在多项基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:Hugging Face 官方给出 Mixtral 在自家生态的完整接入方式,包括推理、量化与单卡微调的具体路径。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐量和 1200 tokens/秒。
推荐理由:官方给出单行代码接入方式与首 token 延迟、吞吐量对比数据,可据此判断现有 LLaMA 推理流程的改造代价。
Hugging Face 在 Hub 的 Inference API 中实现 LoRA 动态加载,保持基础模型常驻、按请求即时加载和卸载 LoRA 适配器,把冷启动时间从 25s 降到 3s,用户请求响应时间从 35s 降到 13s。
Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。
Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1 三个模型,在灾难推文二分类任务上评测性能。实验统一设置 MAX_LEN=512,在单张 A6000(48GB)上完成训练,并使用 Weights & Biases 做超参数调优与实验记录。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 作为演示模型。
Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,可让组织自行选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,亚太区即将上线;非默认位置的仓库会直接显示 Region 标签。官方称欧洲用户将仓库放在 EU 区域时,上传和下载速度约为存放在 US 时的 4-5 倍。
Hugging Face 博客介绍如何基于 huggingface GitHub 组织公开仓库的代码,微调出名为 HugCoder 的代码补全模型。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,以及本地部署路径,可迁移到自有代码库。
Renumics Spotlight 现可直接读取 Hugging Face datasets,只需一行 spotlight.show(ds) 即可交互式可视化数据集。它支持加载模型预测与嵌入向量,通过相似度图、混淆矩阵等定位关键数据簇与模型失败模式,并可在 GUI 或 Python API 中自定义检查布局。
Hugging Face 博客复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
Hugging Face 发布博客,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints,并支持大规模批量请求。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化时显存占用 28GB、延迟 72.2 秒,使用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 各项推理优化的实测数据,读者可据此按显存和延迟取舍配置。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用直接在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断部署成本与加载延迟的取舍。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,其中包括众多 LLM 和云端模型。ONNX Runtime 已支持 90 多个 Hugging Face 模型架构,涵盖 BERT、GPT2、T5、Whisper、Stable-Diffusion 等最热门架构。
Hugging Face 为 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,并随 tokenizer 一起加载。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可了解格式错配为何造成静默性能下降。
Hugging Face Diffusers 现已支持在 Cloud TPU v5e 上通过 JAX 运行 Stable Diffusion XL 推理。该方案借助 JAX 的 jit 编译与 XLA 并行能力,在多个 TPU v5e-4 实例上约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3s。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 发布 Ethics and Society Newsletter #5,回顾其今夏向欧盟、英国和美国立法者提供 AI 价值观与监管建议的工作,包括 CEO Clem 在美国国会作证及在美国参议院 AI Insight Forum 发言。团队还就 EU AI Act、NTIA AI 问责、开源 AI 益处等议题公开发声,并将偏见与危害测试应用于新多模态模型 IDEFICS。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。流程分三步:用 Spaces 部署 AutoTrain 和 ChatUI 模板,在 AutoTrain 中选用 Meta Llama 2 7b 基础模型、A10G Large GPU 和 Alpaca 指令数据集完成微调,再通过 ChatUI 部署成可分享的聊天应用。
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地部署。官方称该模型在所有基准上超过 Llama 2 13B,在多项基准上超过 Llama 1 34B,代码能力接近 CodeLlama 7B。
推荐理由:官方给出 Mistral 7B 与 Llama 2 系列的逐项对比和滑动窗口注意力设计,可据此判断小参数模型的性价比边界。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模,在 g5.2xlarge、g5.12xlarge、g5.48xlarge 和 p4d.24xlarge 实例上测试了 1、5、10、20 并发请求,并对比了 GPTQ 4-bit 量化与未量化性能。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct。
Rocket Money 将每月超 1 亿笔交易的商户识别从正则系统迁移到基于 BERT 家族模型的文本分类方案,该模型覆盖 4000+ 类别。经过三个月评估和逐步放量压测后,团队选择 Hugging Face Inference API 托管模型,因其接入快、可动态扩展并保持低延迟。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标排名,并详解 IoU、Average Precision(AP)与 Average Recall(AR)等评测指标的计算方式。文章还分析了不同报告中模型结果出现分歧的原因,帮助开发者按应用需求挑选开源检测模型。