Google Research 提出 Diffusion Controller,统一并简化 AI 图像生成控制
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,主模型保持冻结,仅用轻量"转向阻尼器"网络动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的黑盒、灰盒模型上做定制。
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,主模型保持冻结,仅用轻量"转向阻尼器"网络动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的黑盒、灰盒模型上做定制。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使模型学到平滑的 score function,让去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。研究通过一维实验验证,权重衰减越强,插值区域越明显,即使无显式正则化,梯度训练的隐式正则化也能产生类似效果。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解人机协作的实际收益与仲裁环节的失误。
伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化信息含量,无需重建算法或任务专用解码器。该框架在彩色摄影、射电天文、无镜头成像和显微成像四个领域预测了解码器性能,优化后的设计达到端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
OpenAI 对连续时间一致性模型做了简化、稳定化和规模化,仅需两步采样即可达到与领先扩散模型相当的样本质量。
OpenAI 提出 Consistency Models,可在不依赖迭代采样过程的情况下实现快速生成。扩散模型虽推动了图像、音频和视频生成的发展,但其迭代采样过程导致生成速度缓慢。
OpenAI 提出改进的一致性模型(Consistency Models)训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 发现,正如在语言上训练的大型 Transformer 能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。研究还建立了样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所含特征可与顶级卷积网络竞争。
推荐理由:原文给出用同一 Transformer 处理像素序列生成图像并做无监督分类的早期思路,可了解生成与表征学习的关联。
OpenAI 发布可逆生成模型 Glow,采用可逆 1x1 卷积,在简化此前可逆生成模型架构的同时支持生成高分辨率图像和高效采样,并能发现可用于操控数据属性的特征。OpenAI 同时开放该模型的代码和一个在线可视化工具,供人们探索并在此基础上继续开发。
推荐理由:OpenAI 介绍可逆生成模型 Glow 的架构简化思路,并开放代码与可视化工具供复现探索。