Google Research 提出 Diffusion Controller,统一并简化 AI 图像生成控制
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,主模型保持冻结,仅用轻量"转向阻尼器"网络动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的黑盒、灰盒模型上做定制。
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,主模型保持冻结,仅用轻量"转向阻尼器"网络动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的黑盒、灰盒模型上做定制。
AWS 发布教程,演示在 SageMaker AI 上用同一个 vLLM-Omni DLC 镜像部署两个端点:实时端点跑 FLUX.2-klein-4B 生成图像,异步端点跑 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词送入视频端点,生成的 MP4 存入 Amazon S3,示例提供 CLI 与 Streamlit 界面。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
推荐理由:Hugging Face 用 73 个节点复刻 A1111 全部功能,并给出与 ComfyUI 的路线对比,可看节点式工作流的新形态。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与输出定位,可据此判断图像生成能力的迭代方向。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 4-bit 量化 checkpoint,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式与实测延迟、显存数据,可据此判断消费级 GPU 跑扩散模型的实际门槛。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使模型学到平滑的 score function,让去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。研究通过一维实验验证,权重衰减越强,插值区域越明显,即使无显式正则化,梯度训练的隐式正则化也能产生类似效果。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价和可用入口,读者可据此判断图像与视频生成链路的成本与选型。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,用机器学习理解场景的空间布局,再用生成式 AI 想象出新视角下的画面。
推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后调整视角的技术路径。
OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。
推荐理由:官方给出图像生成在文字渲染、多语言与视觉推理上的改进方向,可据此判断图像能力升级重点。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解人机协作的实际收益与仲裁环节的失误。
Google 开源的 SpeciesNet 可对相机陷阱图像分类 2,498 个动物类别,基于 6,500 万张标注图像训练,在留出测试集上能找出 99.4% 含动物的图像,83% 的情况下可识别到物种且其中 94.5% 预测正确。
Hugging Face 发布 Modular Diffusers,用可复用的块组合扩散流水线,作为现有 DiffusionPipeline 类的更灵活替代方案。每个块自带输入输出,可独立运行或增删替换,并支持自定义块发布到 Hub 供他人以 trust_remote_code=True 加载。该功能还与节点式可视化界面 Mellon 集成,可从块定义自动生成节点 UI。
推荐理由:Hugging Face 官方介绍 Modular Diffusers 的可组合块机制,读者可据此判断扩散流水线搭建方式的改动。
Photoroom 在 Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元预算在 24 小时内训练出一个文生图扩散模型。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的先进世界知识、质量与推理能力带到 Flash 级速度。
推荐理由:官方给出 Nano Banana 2 与 Pro 的能力分工和上线渠道,读者可据此判断该选哪个模型做图像任务。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,基于 1.2B 参数的 PRX-1.2B 在 Flux VAE latent 空间训练,基线配置为 100k 步、256×256 分辨率、全局 batch size 256。
伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化信息含量,无需重建算法或任务专用解码器。该框架在彩色摄影、射电天文、无镜头成像和显微成像四个领域预测了解码器性能,优化后的设计达到端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
OpenAI 发布 ChatGPT Images 与 GPT-Image-1.5,前者提供更快的图像生成体验,后者通过 API 提供。原文还提到可查看最新的 ChatGPT Images 2.5。
推荐理由:OpenAI 发布 GPT-Image-1.5 并更新 ChatGPT 图像体验,可据此了解其图像生成能力与 API 接入变化。
Hugging Face Diffusers 官方博客宣布支持 FLUX.2,提供 Flux2Pipeline 与 Flux2Transformer2DModel 的调用示例,文本编码器使用 Mistral3ForConditionalGeneration。
推荐理由:Diffusers 集成 FLUX.2 并给出可直接运行的代码示例,读者可据此了解该模型的调用方式与显存门槛。
Google 在 Gemini 应用中上线 AI 图片验证功能,用户上传图片并提问即可检查其中是否含有 SynthID 水印,从而判断图片是否由 Google AI 生成或编辑。
推荐理由:原文说明了 Gemini 应用内验证 AI 图片的具体操作方式,以及 SynthID 与 C2PA 后续扩展方向。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),一个基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式通过 Gemini API 逐步开放。
推荐理由:官方给出 Gemini 3 Pro Image 的分辨率、文本渲染与搜索接地等能力细节,可据此判断图像生成与编辑的可用边界。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打图像生成与编辑。
推荐理由:官方给出 Nano Banana Pro 的文本渲染、多图融合与分辨率等能力变化,以及各产品线的开放节奏。
Hugging Face 在 Gradio 中推出可见水印功能,只需一条命令即可为 AI 生成的图像、视频和文本添加水印。图像和视频通过 watermark 参数指定水印文件,文本则在 Chatbot 组件中设置 watermark,用户复制 AI 回复时会自动附带署名。水印支持文件名、图像或 numpy 数组,还可使用 QR 水印。
Hugging Face 为 ZeroGPU Spaces 引入 PyTorch 提前(AoT)编译,让模型只需优化一次即可即时重载,在 Flux、Wan、LTX 等模型上取得 1.3×–1.8× 加速。
通过 Hugging Face MCP Server 将 Claude 连接至 Hugging Face Spaces,即可调用 FLUX.1 Krea [dev] 和 Qwen-Image 等模型生成图像。
Arm 面向图形与游戏开发者发布 AI 超采样方案 Neural Super Sampling(NSS),基于 Arm Neural Technology 面向未来移动设备实时运行。
Hugging Face 发布教程,介绍如何用 Diffusers 和 PEFT 优化 Flux.1-Dev 的 LoRA 推理速度。方案组合 Flash Attention 3、torch.compile 和 FP8 量化,并通过 hotswap 机制避免切换 LoRA 时触发重新编译,在 H100 上相比基线取得 2.23 倍加速。
推荐理由:原文给出 Flux LoRA 推理的完整优化配方与实测数据,读者可据此在 H100 或 4090 上复现加速效果。
Hugging Face 博客介绍如何通过 Gradio MCP 服务器为 LLM 增加新能力。Gradio 5.28.0 起支持 MCP 协议,Hugging Face Spaces 上数千个 AI 应用因此可作为 MCP 服务器接入 Cursor、Claude Code、Cline 等客户端。
Hugging Face 发布教程,介绍用 QLoRA 和 diffusers 库在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以内。在 RTX 4090 上,QLoRA 微调峰值显存约 9GB,而 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
ChatGPT for Business 迎来 2025 年 4 月更新,新增 o3、图像生成、增强记忆和内部知识四项能力。官方同步放出这些功能的上手演示。
OpenAI 将最新图像生成模型以 gpt-image-1 的名称开放到 API,开发者和企业可将其集成到自有工具和平台中,生成专业级、可定制的视觉内容。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有产品的图像生成集成路径。
OpenAI 在 GPT-4o 中引入原生图像生成能力,并提升了文本渲染和指令跟随表现。该发布同时指向 ChatGPT Images 2.5。
推荐理由:GPT-4o 原生图像生成上线,文本渲染与指令跟随能力提升,可据此判断多模态生成的新基线。
OpenAI 发布 GPT-4o 系统卡增补,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级写实输出,也能接收图像作为输入并对其进行变换。
推荐理由:GPT-4o 图像生成系统卡增补说明,交代了它相对 DALL·E 3 的能力变化与图像输入输出方式。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以缓解高分辨率图像和视频合成中解码器的显存占用问题。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与 Flash Answers 等能力清单,可据此判断其与现有助手的差异。
Hugging Face 发布首期《AI 艺术工具通讯》,回顾 2024 年创意 AI 关键进展并预告将推出月度汇总。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具可用约 5 行代码通过 BitsAndBytesConfig 完成 8bit 量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后的模型还能回到 timm 使用。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
OpenAI 对连续时间一致性模型做了简化、稳定化和规模化,仅需两步采样即可达到与领先扩散模型相当的样本质量。
Stability AI 发布 Stable Diffusion 3.5,包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,已在 Hugging Face Hub 上线并可通过 Diffusers 使用。
推荐理由:Diffusers 官方给出 SD3.5 Large 的量化推理与 LoRA 训练路径,可据此判断消费级显卡的可用性。