用 Hugging Face Transformers 上手 BLIP-2 零样本图像到文本生成
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可在冻结图像编码器与大语言模型之间加入轻量 Q-Former 完成视觉语言预训练。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示续写与视觉问答,可据此快速上手多模态推理。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可在冻结图像编码器与大语言模型之间加入轻量 Q-Former 完成视觉语言预训练。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示续写与视觉问答,可据此快速上手多模态推理。
团队将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移到 Hugging Face Inference Endpoints,部署流程从六步简化为三步。基于 RoBERTa 文本分类模型的测试显示,large 实例延迟约 80ms,比此前 ECS 方案快一倍以上,但成本高出 24% 至 50%,large CPU 实例每月约多花 60 美元。
Hugging Face 博客"AI for Game Development"系列第 5 篇演示了如何用 ChatGPT 为农场游戏生成故事,包括故事梗概、游戏内文本和商店物品描述。
Hugging Face 发布博客第二部分,测试在 Intel Sapphire Rapids 服务器上运行 PyTorch Transformers 推理的性能。
Hugging Face 发布博客深入解析视觉-语言模型的训练策略,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练等五类预训练目标。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 实验这些最新进展。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏资产,并以 farming game 的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。
推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、模型规模、训练数据和评测标准上的差异。
Hugging Face 博客"AI for Game Development"系列第 3 天聚焦 3D 资产生成,结论是 text-to-3D 目前还无法实际用于游戏开发。文章梳理了 DreamFusion、Point-E、CLIP-NeRF 等近期方案,指出它们多基于 NeRF 视图合成,生成的 mesh 需大量人工后处理才能达到游戏可用标准。作者因此在本作中改用不同颜色的立方体代表农作物。
Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一套架构解决实例、语义和全景分割,但每个任务仍需单独训练;OneFormer 加入文本编码器,仅在全景数据集上训练一次即可在三个任务上达到 SOTA,精度更高但延迟更大。
Hugging Face 发布教程,演示如何用 Transformers 和 Datasets 库构建图像相似度系统,实现反向图像搜索等信息检索场景。
Hugging Face 博客系列教程第二部分展示如何用 ChatGPT 辅助农场游戏设计,作者让其以专业游戏设计师身份给出作物多样性、进阶系统、动态环境、社交多人、沉浸式剧情等建议,并因 5 天工期只先灰盒实现了前两项。文章同时解释语言模型与 Transformer 原理,并提醒 ChatGPT 常言之凿凿却出错,宜作头脑风暴工具而非开发流程的替代品。
Hugging Face 发布图机器学习入门博客,梳理图的基本概念、表示方法及学习范式,涵盖从预神经网络方法到图神经网络(GNN),并延伸至面向图的 Transformer。文章还介绍了图在社交网络、分子、知识图谱等场景的应用,以及图级、节点级、边级和子图级四类任务,并区分了直推式与归纳式两种设定。
Hugging Face 博客推出"AI for Game Development"系列,演示如何在 5 天内用 AI 工具做出一个完整农场游戏。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)CPU 集群上加速 PyTorch 训练,借助 Intel oneAPI CCL 做分布式通信、Intel Extension for PyTorch(IPEX)自动启用 AMX 指令,无需改动任何 transformers 代码。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。CLIPSeg 在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持以文本或示例图像作为提示词的"视觉提示"。
Hugging Face 发布音频数据集使用指南,介绍如何用 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。文中以 GigaSpeech 为例,其 xs 配置含 10 小时数据,加载后自动划分 train、validation、test 三个 split。Hub 上现有 77 个语音识别数据集和 28 个音频分类数据集,并支持在线试听样本预览。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Hugging Face 博客图解 RLHF 的完整训练流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文中说明奖励模型输出标量奖励,训练时用 KL 散度惩罚策略偏离初始模型,并给出 OpenAI、Anthropic、DeepMind 在模型与奖励模型规模上的不同选择。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并列出 TRL、TRLX、RL4LMs 等开源工具与数据成本。
Hugging Face 发布《Deep Learning with Proteins》教程,面向想入门机器学习的生物学家和想入门生物学的机器学习者,并附上蛋白质语言模型微调(PyTorch、TensorFlow)与 ESMFold 蛋白质折叠(仅 PyTorch)的示例 notebook。
借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以通过 Core ML 在 Apple Silicon 上运行,Hugging Face 已将 v1.4、v1.5、v2 base 和 v2.1 base 的官方权重转换并上传到 Hub。
推荐理由:Hugging Face 与 Apple 合作把 Stable Diffusion 转成 Core ML 权重,读者可据此在 Apple Silicon 上本地跑图并了解不同变体的取舍。
Hugging Face 博客介绍如何用 🤗 Transformers 库中的 Time Series Transformer 完成单变量概率时间序列预测。该模型基于 Encoder-Decoder 的 vanilla Transformer,通过 Ancestral Sampling 自回归生成预测,并借助掩码处理缺失值,无需插补即可训练。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,免费讲解扩散模型理论与应用。配合课程上线,11 月 30 日将举办社区直播活动,Stable Diffusion 创作者及 Stability AI、Meta 等机构的研究者将带来演讲,聚焦扩散模型概览及构建应用的工具。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。
Hugging Face 梳理了其推理方案:模型页上的免费 Inference Widget 与免费 Inference API 可零代码或单次 HTTP 请求调用 Hub 模型,但受速率限制,不建议用于生产。
Hugging Face 博客发布教程,演示如何借助 Concrete-ML 库在全同态加密(FHE)环境下对加密数据做情感分析,数据科学家无需密码学背景即可上手。方案用 BERT 提取文本隐藏表示(hidden size 768),再交给 XGBoost 分类,并通过客户端/服务器协议部署到云端,最后在 Hugging Face Spaces 提供完整 demo。
Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,给出推荐设置:低学习率配合逐步增加训练步数,人脸需要 800-1200 步、batch size 2、LR 1e-6,并建议使用 prior preservation 避免过拟合。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可直接用于复现和调参。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 在任意多语种 ASR 数据集上微调 Whisper。教程以 Common Voice 11.0 的印地语为例,用约 8 小时训练数据微调 Whisper small,在测试集上把 WER 从预训练模型的 63.5% 降到 32.0%。
推荐理由:以印地语为例给出 Whisper 多语种 ASR 微调全流程,8 小时数据即可把 WER 从 63.5% 降到 32.0%。
Hugging Face 为 🤗 Evaluate 库新增偏见指标与测量方法,用于评估 GPT-2、BLOOM 等因果语言模型的偏见。该工作流先用 🤗 Datasets 中的预设提示词引导模型生成文本,再用 🤗 Evaluate 的指标打分,示例覆盖 Toxicity、Polarity 和 Hurtfulness 三类任务,其中 toxicity 指标基于 R4 Target 仇恨检测模型。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 轻量封装,以及 🤗 Transformer 的 Trainer API。Accelerate 无需修改代码即可在单 GPU 和 TPU 上运行,Trainer 则抽象掉所有样板代码并支持多种设备和分布式场景。
Hugging Face 推出 Inference Endpoints,可将 Hub 上的模型一键部署到云端托管基础设施。该服务支持 Public、Protected、Private 三种访问级别,Private 模式通过 AWS PrivateLink 的 VPC Endpoint 接入,仅限指定 AWS 账户访问。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud Platform 的 TPU 上实现快速推理。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整流程,含并行与编译耗时数据。
Hugging Face 团队复盘了为 BLOOM(176B 参数,bf16 下 352GB)构建推理服务器的优化过程,最终实现延迟降低 5 倍、吞吐提升 50 倍。
推荐理由:Hugging Face 团队复盘 BLOOM 推理优化全过程,从 PP 到 TP、自定义 kernel 的取舍细节对部署大模型有参考价值。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 的 meta device、自动 device map 和分片 checkpoint,在显存和内存有限的设备上加载并推理超大模型。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,方法可直接迁移。
Hugging Face 发布教程,展示如何用 DeepSpeed 和 Accelerate 加速 176B 参数的 BLOOM 模型推理。
推荐理由:文章给出 BLOOM 176B 在多种并行与量化方案下的实测吞吐和显存占用,可作为大模型推理部署的选型参考。
Hugging Face 发布教程,教你用 transformers 库的 Trainer 和自定义 Data Collator,在 Google Colab 上从零训练一个离线 Decision Transformer,让 HalfCheetah 学会奔跑。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。
Hugging Face Spaces 可通过 3Dmol.js 与 Gradio 的 HTML 组件在浏览器中可视化蛋白质结构,用户输入 4 位 PDB 代码或上传 PDB 文件即可查看。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion 文生图模型。文中给出安装 diffusers==0.10.2 与加载 StableDiffusionPipeline 的代码,并说明 guidance_scale、num_inference_steps 等参数对生成结果的影响。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 Diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库完成掩码语言建模任务。