用 BentoML 部署 Hugging Face 模型:DeepFloyd IF 实战
Hugging Face 博客演示了如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结的文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 基础图逐步放大至 1024x1024 px。
Hugging Face 博客演示了如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结的文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 基础图逐步放大至 1024x1024 px。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库优化 Suno AI 的文本转语音模型 Bark。教程基于 suno/bark-small 检查点,通过三项简单优化降低显存占用并提升推理速度,并给出未优化基线的 benchmark 对比:5 次迭代平均执行时间 9.38 秒、最大显存占用 1.91 GB。
Hugging Face 博客介绍 TRL 库新增的 DPO 训练支持,并演示如何用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B。
推荐理由:TRL 官方给出 DPO 微调 Llama 2 的完整代码与数据格式,读者可据此在自己的偏好数据上复现。
Hugging Face 发布 swift-transformers,一个用 Swift 实现类 transformers API 的包,专注文本生成,并同时放出 swift-chat 演示应用、更新版 exporters 与 transformers-to-coreml 转换工具,以及 Llama 2 7B、Falcon 7B 等已转换好的 Core ML 模型。
推荐理由:官方给出在 Apple 设备上跑 Llama 2 等模型的完整工具链与转换路径,可据此评估端侧部署的可行步骤。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。
Zama 展示了用全同态加密(FHE)在加密数据上运行大语言模型推理的方案,基于 Hugging Face transformers 库改造 GPT2,将首个多头注意力头用 Concrete-Python 转为 FHE 等价实现。实验显示 4-bit 量化可保留原模型 96% 的精度,客户端本地推理至首层后加密中间结果交由服务器计算,兼顾用户数据隐私与模型 IP 保护。
Hugging Face 用 facebook/fasttext-language-identification 模型为 Hub 上缺少语言标注的数据集预测语言,该模型可识别 217 种语言,通过 dataset viewer API 取每个数据集 20 行文本进行预测,再由 librarian-bots 提交 PR 补充元数据。
Segmind 开源了压缩扩散模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型减少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,读者可了解压缩扩散模型在参数与推理速度上的取舍。
这篇教程演示了如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 的 Decimate 修改器减面、用 Dream Textures 插件生成无缝贴图,最终导出 FBX 并导入 Unity。流程面向 PS1 低多边形风格,以规避当前 text-to-3D 模型精度不足的问题,需具备 Blender 与 UV 映射基础。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上本地运行。
推荐理由:原文给出混合位宽调色板量化的完整方法与实测数据,读者可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 联合 Creative Commons、Eleuther AI、GitHub、LAION 和 Open Future 发布立场文件,就 EU AI Act 提出五项建议。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例和自定义工具接口,读者可据此判断如何在 JS 项目中接入工具调用。
Hugging Face 公布首届开源 AI Game Jam 结果,活动吸引超 1300 人报名、收到 88 款游戏,冠军由 ohmlet 的 Snip It 获得,该游戏用 Stable Diffusion 生成素材。
Hugging Face 的 Diffusers 库迎来一周年,已从文本生成图像扩展到视频、3D 和图像编辑等扩散模型能力。新增支持 DeepFloyd IF、Stability AI SDXL、OpenAI Shap-E 与 Consistency Models,后者在 CPU 上生成一张 256x256 图像仅需 3/4 秒。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用宽松社区许可并允许商用。相比 Llama 1,预训练 token 增加 40%,上下文长度提升至 4k,70B 模型使用 grouped-query attention。
推荐理由:Meta 发布 Llama 2 并开放商用,Hugging Face 同步给出推理、部署与微调入口,可据此判断开源模型的可落地程度。
Hugging Face 发布 AI WebTV 实验性演示,用开源文生视频模型 Zeroscope V2 和音乐生成模型 MusicGen 自动合成视频与配乐并直播。视频先由 zeroscope_v2_576 生成 576x320 片段,可选经 zeroscope_v2_XL 放大至 1024x576,再经 FILM 插帧和 MusicGen 配乐,通过 FFmpeg 推流至 RTMP 服务器。
Hugging Face 梳理其开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型、许可协议、LLM 服务工具及 PEFT 微调。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face 博客介绍如何用 Transformers.js 制作完全在浏览器本地运行的实时 ML 网页游戏 Doodle Dash。作者基于 Google Quick, Draw!
推荐理由:完整演示了从微调 MobileViT 到用 Transformers.js 在浏览器内实时推理的端到端流程,可迁移到其他端侧 ML 项目。
Hugging Face Inference Endpoints 可将 Falcon 40B instruct 等开源 LLM 部署为生产级 API,无需管理基础设施,支持自动扩缩容与 scale-to-zero。
Hugging Face 发布教程,用 Node.js 调用 Inference Endpoints 上的 WizardCoder-15B,把提示词流式生成并直接渲染为 HTML 网页。
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速、相比 H100 实现 1.4 倍加速。
Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见来源与检测方法。文章列举了训练数据、预训练数据过滤、推理阶段 CLIP 模型、模型潜在空间及事后过滤等五类偏见来源,并指出 Stable Diffusion 安全过滤器主要识别色情内容,难以标记暴力等类型。
Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。
推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。
Hugging Face 于 6 月 12 日向美国商务部 NTIA 提交了关于 AI 问责政策的回应意见,强调文档规范与透明度在推动 AI 问责中的作用。其建议问责机制应覆盖 ML 开发全流程、结合内部要求与外部访问透明,并吸纳开发者、多学科研究社区、倡导组织、政策制定者和记者等最广泛参与者。
Hugging Face 发布教程,介绍如何为 Meta AI 的 MMS 模型微调 Adapter 层以适配低资源语言的 ASR 任务。MMS 预训练 checkpoint 覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错率。对低资源语言,Adapter 训练比全模型微调更省内存、更鲁棒且性能更好。
Hugging Face 用 Autoformer 与 DLinear 在 Traffic、Exchange-Rate、Electricity 三个数据集上对比。
Hugging Face 更新了平台内容政策,以应对机器学习内容审核带来的新挑战,并强调“同意”为核心价值。新政策关注用户对所见内容及自身身份与表达被呈现方式的同意权,同时禁止针对用户和 Hugging Face 员工的攻击性或骚扰性语言。平台鼓励通过 Community Tab 公开讨论并协作解决冲突,用户可通过 feedback@huggingface.co 反馈意见。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。该应用支持多人协作,可并发提供机器学习模型推理服务,并集成了 Hugging Face Models。Livebook 还作为 Space Docker 模板之一,可直接在 Hugging Face Spaces 中免费运行。
Hugging Face 博客介绍如何借助 Core ML 的新压缩与优化能力,在 iPhone、iPad 和 Mac 上更快运行 Stable Diffusion。
推荐理由:文章给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 部署到 iPhone 和 Mac 本地运行。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face Hub 目前托管超 190,000 个机器学习模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频及多模态任务。这篇博客面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何在 Hub 上按任务和语言筛选模型、用 model widget 测试效果,并以 CSV 格式上传 GLAM 数据集。
Hugging Face 在 Open LLM Leaderboard 评估套件中新增 GPT-4 评测,与 Scale AI 的人类标注对比,检验 LLM 能否替代人工标注偏好数据。
Hugging Face Hub 新增 DuckDB 集成,用户可直接用 SQL 查询 Hub 上任意公开数据集。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,通过 /parquet 端点获取 URL 后,配合 DuckDB 的 httpfs 扩展即可查询远程文件,大型数据集被分片为 500MB 块。
Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成还支持文本分类与特征提取 widget,模型页面提供语言识别和词向量最近邻查询的在线试用。
阿布扎比技术创新研究院发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:介绍 Falcon 系列的开源许可、训练数据与多查询注意力设计,并给出在 Hugging Face 生态中推理和微调的具体路径。
Hugging Face 发布教程,讲解如何用 Hugging Face Unity API 在 Unity 游戏中实现语音识别,将语音转为文本,可用于下达指令、与 NPC 对话或提升无障碍体验。
Hugging Face 宣布举办首届 Open Source AI Game Jam,活动时间为 7 月 7 日至 9 日,参与者需在周末内用 AI 工具做出一款游戏。
Hugging Face 发布面向 Amazon SageMaker 的 LLM Inference Container(DLC),基于 Text Generation Inference(TGI),可部署 BLOOM、StarCoder、Llama、T5 等开源大模型。