Gemini 应用上线 Lyria 3 音乐生成,支持文本与图片生成 30 秒曲目
Google DeepMind 的最新音乐生成模型 Lyria 3 以 beta 形式在 Gemini 应用中上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯音乐的曲目,并附由 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、语言覆盖与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind 的最新音乐生成模型 Lyria 3 以 beta 形式在 Gemini 应用中上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯音乐的曲目,并附由 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、语言覆盖与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:官方披露了原型的三项核心能力与已知限制,读者可据此判断世界模型当前能做什么、还差什么。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。
推荐理由:D4RT 把 4D 重建统一进单一查询式框架,效率提升幅度和实时应用场景是主要看点。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。官方称其在 CT 病变分类上绝对准确率较 MedGemma 1 提升 3%(61% vs. 58%),MRI 提升 14%(65% vs. 51%),MedQA 提升 5%(69% vs. 64%)。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在简单提示词下更富表现力,并提升角色身份、背景与物体的一致性。
推荐理由:原文列出 Veo 3.1 Ingredients to Video 在角色一致性、竖屏输出和 1080p/4K 上的具体变化,可据此判断视频生成工作流能怎么调整。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,面向物理 AI,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:NVIDIA 开源视觉语言模型 Cosmos Reason 2 的升级细节,读者可据此判断物理 AI 场景的可用能力。
Mistral 发布文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出 Mistral OCR 3 相对上一代的胜率、定价与自托管选项,便于判断文档解析的落地成本。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Mistral 发布 Mistral 3 系列,包含 Mistral Large 3 与 Ministral 3(3B、8B、14B),全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 同时给出 675B 稀疏 MoE 大模型与 3B 到 14B 端侧系列,并公开 Apache 2.0 权重与部署格式,读者可据此判断开源前沿模型与端侧路线的分工。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),一个基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式通过 Gemini API 逐步开放。
推荐理由:官方给出 Gemini 3 Pro Image 的分辨率、文本渲染与搜索接地等能力细节,可据此判断图像生成与编辑的可用边界。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并给出自我改进循环与在 Genie 3 生成世界中的泛化表现。
Google 发布 Earth AI 新进展,包括新的影像与人口基础模型,以及由 Gemini 驱动的地理空间推理智能体,并给出技术细节与评测。影像模型支持自然语言查询和开放词汇目标检测,在文本图像搜索任务上平均提升超过 16%,零样本新目标检测准确率翻倍以上。
推荐理由:Google 公布 Earth AI 新基础模型与地理空间推理智能体的评测数据,可了解多模型协同在灾害预测中的实际增益。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉支持,可在表格中查看、分析图像并提取信息,也能从文本生成图像和编辑图像,全部由 Inference Providers 上的开放模型驱动。
推荐理由:官方给出视觉能力在表格工作流中的具体用法与模型对比,可据此判断图像数据整理是否值得迁移。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐方法支持,包括 Mixed Preference Optimization(MPO)、Group Relative Policy Optimization(GRPO)和 Group Sequence Policy Optimization(GSPO),并扩展 RLOO 与 Online DPO 到多模态场景。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线走向。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 think/no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:Hugging Face 公开了 SmolLM3 的完整训练配方与数据配比,读者可据此复现或改进 3B 级小模型的训练流程。
NVIDIA 发布 Llama Nemotron Nano VL,一个 8B 视觉语言模型,面向智能文档处理,已在 Hugging Face 上架。
推荐理由:8B 视觉语言模型面向文档处理,给出了架构、训练数据与 OCRBench v2 表现,便于评估企业文档自动化选型。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库中可用,并发布 gemma-3n-E2B 与 gemma-3n-E4B 两个尺寸(各含 base 与 instruct 变体)。
推荐理由:原文给出 Gemma 3n 的端侧内存占用、多模态输入与各开源库接入方式,便于判断本地部署可行性。
Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。
推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖范围与纯视觉评测设定。
H Company 发布 Holo1 系列动作视觉语言模型(含 Holo1-3B 与 Holo1-7B)以及 WebClick 多模态定位基准,模型已在 Hugging Face 开源。
推荐理由:Holo1 开源了面向 GUI 自动化的动作 VLM 家族,并给出 WebClick 基准与 Surfer-H 智能体的组合方式,读者可据此评估网页自动化方案的成本与精度取舍。