跳到正文

#图像生成

今日 1 条
10月23日周三
10月22日周二
7月30日周二
6月20日周四
6月12日周三
6月6日周四
5月16日周四
  1. OpenAI News20

    Canva 打造 AI 驱动的 Magic Studio

    Canva 为月活超 1.75 亿的视觉传播平台打造 AI 驱动的 Magic Studio,帮助缺乏设计训练的知识工作者快速创作演示文稿、视频、文档、网站和社交媒体图片等内容。该平台结合易用界面、庞大素材库与省时工具,让任何人都能制作出视觉出色的作品。

2月26日周一
2月3日周六
  1. Hugging Face Blog60

    Hugging Face 发布 SegMoE:从零构建混合专家扩散模型

    Hugging Face 发布 SegMoE 框架,可从零创建混合专家(MoE)扩散模型,并已集成 diffusers。同时发布 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。

    推荐理由:原文给出从零构建 MoE 扩散模型的完整流程与配置示例,读者可据此判断能否把已有模型合并成新模型。

1月15日周一
1月14日周日
1月4日周四
1月2日周二
12月5日周二
11月9日周四
  1. Hugging Face Blog80

    Hugging Face 发布 LCM LoRA,SDXL 4 步出图

    Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。

    推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。

11月6日周一
10月24日周二
10月19日周四
  1. OpenAI News67

    DALL·E 3 在 ChatGPT Plus 和 Enterprise 上线

    OpenAI 宣布 DALL·E 3 已在 ChatGPT Plus 和 Enterprise 中可用。为准备更大范围发布,OpenAI 开发了一套安全缓解方案,并同步分享了其在内容来源溯源方面的研究进展。

    推荐理由:OpenAI 官方宣布 DALL·E 3 面向 ChatGPT Plus 和 Enterprise 开放,并同步说明安全缓解措施与来源溯源研究。

10月3日周二
10月2日周一
9月29日周五
9月13日周三
  1. Hugging Face Blog62

    Würstchen 发布:面向图像生成的高效扩散模型

    Würstchen 是一个文本条件扩散模型,其文本条件部分在高度压缩的潜空间中工作,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 组成 Decoder,实现 42x 空间压缩,Stage C 作为 Prior 在该潜空间中训练。

    推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断高效扩散模型在成本上的取舍。

9月8日周五
8月9日周三
8月1日周二
  1. Hugging Face Blog38

    用 Shap-E 与 Dream Textures 生成 PS1 风格 3D 资产的完整教程

    这篇教程演示了如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 的 Decimate 修改器减面、用 Dream Textures 插件生成无缝贴图,最终导出 FBX 并导入 Unity。流程面向 PS1 低多边形风格,以规避当前 text-to-3D 模型精度不足的问题,需具备 Blender 与 UV 映射基础。

7月27日周四
7月20日周四
7月14日周五
6月26日周一
6月15日周四
5月25日周四
5月23日周二
5月8日周一
  1. Hugging Face Blog42

    Hugging Face 解读文本到视频模型:从 GAN 到扩散模型的发展与挑战

    Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则转向扩散模型。文章还分析了算力成本高、高质量数据集稀缺、视频描述模糊等核心挑战。

4月26日周三
3月28日周二
3月24日周五
  1. Hugging Face Blog62

    用 diffusers 训练你自己的 ControlNet

    Hugging Face 发布教程,介绍如何用 diffusers 训练自定义 ControlNet,并以人脸姿态为例完整走通流程。训练分三步:规划条件、构建数据集、训练模型,数据集需包含原图、条件图和提示词三列。

    推荐理由:完整复现了从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。

3月3日周五
  1. Hugging Face Blog78

    Diffusers 集成 ControlNet,支持多种空间条件控制生成

    Hugging Face 在 Diffusers 中推出 StableDiffusionControlNetPipeline,把 ControlNet 的空间条件控制接入扩散模型生成流程,支持 canny 边缘、深度图、分割图、scribble、关键点等 8 种条件模型。

    推荐理由:Diffusers 集成 ControlNet 并给出多种条件控制的完整代码示例,读者可据此复现并评估显存与速度开销。