Ideogram 发布 Ideogram 4.5,称可局部编辑图像而不影响其余部分
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,其余画面保持不变,用于解决多次编辑后出现伪影的问题。该模型提供四档质量档位,单张价格从 0.8 美分到 22 美分,均为原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,其余画面保持不变,用于解决多次编辑后出现伪影的问题。该模型提供四档质量档位,单张价格从 0.8 美分到 22 美分,均为原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价和可用入口,读者可据此判断图像与视频生成链路的成本与选型。
Google 开源的 SpeciesNet 可对相机陷阱图像分类 2,498 个动物类别,基于 6,500 万张标注图像训练,在留出测试集上能找出 99.4% 含动物的图像,83% 的情况下可识别到物种且其中 94.5% 预测正确。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的先进世界知识、质量与推理能力带到 Flash 级速度。
推荐理由:官方给出 Nano Banana 2 与 Pro 的能力分工和上线渠道,读者可据此判断该选哪个模型做图像任务。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),一个基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式通过 Gemini API 逐步开放。
推荐理由:官方给出 Gemini 3 Pro Image 的分辨率、文本渲染与搜索接地等能力细节,可据此判断图像生成与编辑的可用边界。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打图像生成与编辑。
推荐理由:官方给出 Nano Banana Pro 的文本渲染、多图融合与分辨率等能力变化,以及各产品线的开放节奏。
OpenAI 发布 GPT-4o 系统卡增补,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级写实输出,也能接收图像作为输入并对其进行变换。
推荐理由:GPT-4o 图像生成系统卡增补说明,交代了它相对 DALL·E 3 的能力变化与图像输入输出方式。
Stability AI 发布 Stable Diffusion 3.5,包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,已在 Hugging Face Hub 上线并可通过 Diffusers 使用。
推荐理由:Diffusers 官方给出 SD3.5 Large 的量化推理与 LoRA 训练路径,可据此判断消费级显卡的可用性。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布并接入 Diffusers。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 发布 SegMoE 框架,可从零创建混合专家(MoE)扩散模型,并已集成 diffusers。同时发布 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出从零构建 MoE 扩散模型的完整流程与配置示例,读者可据此判断能否把已有模型合并成新模型。
Hugging Face 发布 aMUSEd,这是对 Google MUSE 的开源复现,采用 Masked Image Model(MIM)而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
推荐理由:Hugging Face 开源复现 Google MUSE 的非扩散文生图模型,读者可了解 MIM 路线在推理步数与体积上的取舍。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文并下调价格,同时推出 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等多项更新,可据此了解其模型与开发者产品的整体走向。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。
Würstchen 是一个文本条件扩散模型,其文本条件部分在高度压缩的潜空间中工作,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 组成 Decoder,实现 42x 空间压缩,Stage C 作为 Prior 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断高效扩散模型在成本上的取舍。
Segmind 开源了压缩扩散模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型减少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,读者可了解压缩扩散模型在参数与推理速度上的取舍。
中国科学技术大学与微软提出的 VQ-Diffusion 是一种在量化隐空间上做加噪与去噪的条件隐扩散模型,其隐空间由离散向量集合构成。Hugging Face 现已支持通过 Diffusers 用几行代码运行该模型,加载 microsoft/vq-diffusion-ithq,并可选 FP16 权重。
rinna 通过对 Stable Diffusion 进行微调,开发出日文文生图模型 Japanese Stable Diffusion,可理解日语特有词汇、拟声词与专有名词并生成日式风格图像。
OpenAI 为向大众开放 DALL·E 2,在预训练阶段采取了一系列缓解措施,以降低强大图像生成模型带来的风险。为此,OpenAI 设置了多种防护机制,防止生成图像违反其内容政策。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 公布 DALL·E 这一从文本生成图像的神经网络,可据此了解文生图方向的早期形态。