如何在 Hugging Face Spaces 上用 Gradio 免费运行 ComfyUI 工作流
Hugging Face 官方博客给出教程,把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整给出从 ComfyUI 工作流导出 Python、包成 Gradio 应用并部署到 ZeroGPU 的步骤,可照着复现。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
Hugging Face 官方博客给出教程,把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整给出从 ComfyUI 工作流导出 Python、包成 Gradio 应用并部署到 ZeroGPU 的步骤,可照着复现。
Hugging Face 发布 aMUSEd,这是对 Google MUSE 的开源复现,采用 Masked Image Model(MIM)而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
推荐理由:Hugging Face 开源复现 Google MUSE 的非扩散文生图模型,读者可了解 MIM 路线在推理步数与体积上的取舍。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:汇总社区 SDXL Dreambooth LoRA 微调的 SOTA 实践,并给出可直接运行的 diffusers 训练脚本与参数。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文并下调价格,同时推出 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等多项更新,可据此了解其模型与开发者产品的整体走向。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化时显存占用 28GB、延迟 72.2 秒,使用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 各项推理优化的实测数据,读者可据此按显存和延迟取舍配置。
OpenAI 宣布 DALL·E 3 已在 ChatGPT Plus 和 Enterprise 中可用。为准备更大范围发布,OpenAI 开发了一套安全缓解方案,并同步分享了其在内容来源溯源方面的研究进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 面向 ChatGPT Plus 和 Enterprise 开放,并同步说明安全缓解措施与来源溯源研究。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。
Segmind 开源了压缩扩散模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型减少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,读者可了解压缩扩散模型在参数与推理速度上的取舍。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上本地运行。
推荐理由:原文给出混合位宽调色板量化的完整方法与实测数据,读者可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 博客介绍如何借助 Core ML 的新压缩与优化能力,在 iPhone、iPad 和 Mac 上更快运行 Stable Diffusion。
推荐理由:文章给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 部署到 iPhone 和 Mac 本地运行。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 各组件、8bit 量化 T5 并逐段释放显存的具体做法,可迁移到其他大模型推理。
Hugging Face 发布教程,介绍如何用 diffusers 训练自定义 ControlNet,并以人脸姿态为例完整走通流程。训练分三步:规划条件、构建数据集、训练模型,数据集需包含原图、条件图和提示词三列。
推荐理由:完整复现了从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 在 Diffusers 中推出 StableDiffusionControlNetPipeline,把 ControlNet 的空间条件控制接入扩散模型生成流程,支持 canny 边缘、深度图、分割图、scribble、关键点等 8 种条件模型。
推荐理由:Diffusers 集成 ControlNet 并给出多种条件控制的完整代码示例,读者可据此复现并评估显存与速度开销。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。
推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。
OpenAI 宣布 DALL·E API 进入公开测试,开发者从即日起可以基于该 API 构建应用。
推荐理由:OpenAI 官方开放 DALL·E API 公测,开发者可据此判断图像生成能力接入自家应用的门槛变化。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud Platform 的 TPU 上实现快速推理。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整流程,含并行与编译耗时数据。
OpenAI 宣布 DALL·E 不再需要等待名单,新用户可以直接开始创作。官方表示,部署中积累的经验以及安全系统的改进使更广泛的开放成为可能。
推荐理由:OpenAI 官方说明 DALL·E 取消等待名单,并给出安全系统改进这一放开依据。
OpenAI 为 DALL·E 推出 outpainting 功能,可生成任意尺寸的图像,用于延展创作并讲述更大的故事。
推荐理由:OpenAI 为 DALL·E 加入 outpainting,读者可了解图像生成从单张出图扩展到任意尺寸延展的能力变化。
OpenAI 宣布 DALL·E 进入测试版,将在未来数周从候补名单中邀请 100 万人使用。用户可用每月重置的免费积分生成图像,也可按 115 次生成 15 美元的价格购买额外积分。
推荐理由:OpenAI 公布 DALL·E 测试版开放节奏与积分定价,读者可据此了解早期图像生成产品的使用门槛。