Hugging Face 与 IBM 合作打造 watsonx.ai 企业级 AI 工作室
Hugging Face 宣布与 IBM 合作,共同推进新一代企业级 AI 工作室 watsonx.ai,用于训练、验证、微调和部署传统机器学习与生成式 AI 能力。
Hugging Face 宣布与 IBM 合作,共同推进新一代企业级 AI 工作室 watsonx.ai,用于训练、验证、微调和部署传统机器学习与生成式 AI 能力。
Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH(参数 256, 0.7, 5)进行文档级近重复数据删除,并确认去重同样能提升代码模型性能且所需数据集更小。文章还对比了 The Stack、CodeParrot、InCoder 等代码数据集所用的精确匹配、Levenshtein 距离等去重方法,指出去重可减少训练步数、防止基准污染与数据泄露。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 发文介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优势,并已被集成进 transformers 库。RWKV 由 Bo Peng 主导,训练 GPU 由 Stability AI 捐赠,现有模型参数从约 170M 到 14B,训练上下文长度达 8192 且速度与 ctx1024 模型相当。
推荐理由:结合 RWKV 架构原理与 transformers 集成示例,读者可了解 RNN 与 Transformer 优势如何被合并。
Hugging Face 被法国数据保护机构 CNIL 选中,入选其强化支持计划。该计划从 40 多个候选企业中选出三家"具有强劲经济发展潜力"的公司,为其提供数据保护职责理解与落实方面的支持。Hugging Face 此前在 BigScience 和 BigCode 项目中已投入隐私风险治理与假名化工具开发。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley、CMU、斯坦福和 UCSD 团队基于 LLaMA 微调,训练成本约 300 美元,以 GPT-4 为参考的初步评估中质量达到 ChatGPT 的 90% 以上。
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则转向扩散模型。文章还分析了算力成本高、高质量数据集稀缺、视频描述模糊等核心挑战。
Databricks 向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。
Hugging Face 上线中文博客 hf.co/blog/zh,由志愿者翻译 transformers、diffusion 和强化学习等博客与课程内容。
Hugging Face Space 除了托管机器学习 demo,也能托管可玩的 Unity 游戏。教程给出 11 步流程:用 Static HTML 模板创建 Space、将 Unity 项目构建目标切换为 WebGL、把压缩格式设为 Disabled,再通过 Git-LFS 推送构建文件即可运行。官方还提供可选的 Hugging Face Unity WebGL 模板。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,通过 optimum neuron 只需一行代码即可编译模型。
Hugging Face 博客发布教程,演示如何用 Transformers 库(版本 >= 4.27.2)进行图分类,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多数据源训练的模型在验证数据上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等复杂安全环境中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子数据集。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务接入 Snorkel Flow 平台,让企业用户可直接调用其 150,000 多个开源模型来适配和微调基础模型。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,客户按需激活、闲置休眠,从而在控制成本的同时扩展可用模型数量。
Hugging Face 发布 Ethics and Society Newsletter #3,阐述其在开放 ML 中兼顾伦理的思路。平台推出 6 个伦理标签(Rigorous、Consentful、Socially Conscious、Sustainable、Inclusive、Inquisitive),并上线举报功能,供社区标记违规的模型、数据集、Space 或讨论。
Hugging Face 展示用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ 并做推理,8 卡 16-bit 下延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。
Hugging Face 发布教程,演示如何用 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。教程涵盖数据加载、PyTorch 训练测试循环、Flower 客户端类编写,并提供 Google Colab 模拟版本。
Hugging Face 发布教程,介绍如何用 diffusers 训练自定义 ControlNet,并以人脸姿态为例完整走通流程。训练分三步:规划条件、构建数据集、训练模型,数据集需包含原图、条件图和提示词三列。
推荐理由:完整复现了从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 宣布为 Hub 上托管的 Jupyter Notebook 增加渲染支持,ipynb 文件将以人类可读格式显示。Hub 目前托管超过 7,000 个 notebook,并支持一键在 Google Colab 中打开。
Informer 模型已在 🤗 Transformers 中可用,用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层内存占用从 O(NT²) 降至 O(N·T log T)。
Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。该方案用 8-bit 加载、低秩适配器和共享参考模型三层手段压缩显存,在 24GB NVIDIA 4090 上完成了 20B 参数 gpt-neox 的 RLHF 微调,完整训练则在单张 A100 上跑完。
推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到显存受限的训练场景。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。
Hugging Face 在 Diffusers 中推出 StableDiffusionControlNetPipeline,把 ControlNet 的空间条件控制接入扩散模型生成流程,支持 canny 边缘、深度图、分割图、scribble、关键点等 8 种条件模型。
推荐理由:Diffusers 集成 ControlNet 并给出多种条件控制的完整代码示例,读者可据此复现并评估显存与速度开销。
Hugging Face 为 Diffusers 库发布了一套伦理框架,用于指导维护者处理社区贡献时的技术决策。该准则包含透明度、一致性、简洁性、可访问性、可复现性和责任六项价值观,并列出 Community tab、Tag 功能、偏见探索与评估等安全机制,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全措施。
Hugging Face 专家加速计划帮助 Witty Works 将其包容性写作助手的非包容性词汇分类器从 vanilla transformers 转向 Sentence Transformers 架构,结合 SetFit 库实现少样本微调,每个词仅需 15-20 条标注句子。
Hugging Face 在 Mac App Store 上线 Diffusers for Mac 1.1,基于 Core ML 转换的 Stable Diffusion 等文生图模型,官方称出图速度最高可达此前两倍。
Hugging Face 与 AWS 宣布扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,社区开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调与部署模型。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可在冻结图像编码器与大语言模型之间加入轻量 Q-Former 完成视觉语言预训练。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示续写与视觉问答,可据此快速上手多模态推理。
Hugging Face 宣布 SpeechT5 已集成进 Transformers,论文作者发布的官方 checkpoint 可在 Hugging Face Hub 获取,并提供语音合成、音色转换和自动语音识别三个 Spaces 演示。
推荐理由:SpeechT5 以同一套编码器解码器架构覆盖 TTS、语音转换与 ASR,读者可据此了解多任务语音模型在 Transformers 中的接入方式。
Hugging Face 博客"AI for Game Development"系列第 5 篇演示了如何用 ChatGPT 为农场游戏生成故事,包括故事梗概、游戏内文本和商店物品描述。
Hugging Face 发布博客深入解析视觉-语言模型的训练策略,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练等五类预训练目标。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 实验这些最新进展。
Hugging Face 公布其计算机视觉生态现状:Hub 上已支持 8 项核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖 ViT、Swin、DETR 等 Transformer 架构以及 ConvNeXt、ResNet、RegNet 等卷积架构。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏资产,并以 farming game 的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。
推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、模型规模、训练数据和评测标准上的差异。
Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一套架构解决实例、语义和全景分割,但每个任务仍需单独训练;OneFormer 加入文本编码器,仅在全景数据集上训练一次即可在三个任务上达到 SOTA,精度更高但延迟更大。
Hugging Face 与百度 PaddlePaddle 达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub,目前已有超 75 个模型上线,包括 UIE、ERNIE 3.0、Ernie-Layout 等。
Hugging Face 博客推出"AI for Game Development"系列,演示如何在 5 天内用 AI 工具做出一个完整农场游戏。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。CLIPSeg 在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持以文本或示例图像作为提示词的"视觉提示"。
Hugging Face 推出 Model Card Creator Tool 和 Model Card Guide Book,前者提供图形界面,无需编程或写 markdown 即可创建模型卡。同步更新了 huggingface_hub 库中的模型卡模板,并发布注释版模板、用户研究和文献综述。