NeuralGCM 用 AI 改进全球长期降水模拟
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟上均优于传统模型,读者可了解混合建模路线的具体收益。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟上均优于传统模型,读者可了解混合建模路线的具体收益。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Google Research 在 STOC 2026 试验了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool(PAT),在投稿后 24 小时内为作者提供自动预审反馈,包括论文贡献摘要、潜在错误与改进建议以及笔误清单。
推荐理由:Google 在 STOC 2026 试用的论文预审工具给出了真实采纳率与作者反馈,可据此判断 AI 辅助数学证明审阅的边界。
Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,提升了复杂工作流处理、指令遵循和多轮对话能力。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,便于判断语音智能体的可用性变化。
Google Research 发布 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。Titans 用深度神经网络作为长期记忆模块,通过 surprise 指标、动量和自适应权重衰减选择性存储信息;MIRAS 则统一了序列建模的四个设计选择,并衍生出 YAAD、MONETA、MEMORA 三个无注意力模型。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,在超长上下文任务上超过 GPT-4。
密苏里大学的研究者借助 AlphaFold 与冷冻电镜,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。研究者先用冷冻电镜拍摄 LDL 颗粒图像,但清晰度不足以达到原子级精度,随后用 AlphaFold 生成原子级结构预测,再与电镜数据比对修正。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,展示了 AI 预测在结构生物学中的具体用法。
Google DeepMind 宣布支持美国白宫 Genesis Mission,并与美国能源部合作,向全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作,给出了 AI for Science 从模型到落地路径的具体样本。
Google 在 Gemini 应用中上线 AI 图片验证功能,用户上传图片并提问即可检查其中是否含有 SynthID 水印,从而判断图片是否由 Google AI 生成或编辑。
推荐理由:原文说明了 Gemini 应用内验证 AI 图片的具体操作方式,以及 SynthID 与 C2PA 后续扩展方向。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),一个基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式通过 Gemini API 逐步开放。
推荐理由:官方给出 Gemini 3 Pro Image 的分辨率、文本渲染与搜索接地等能力细节,可据此判断图像生成与编辑的可用边界。
Google Research 介绍一种端到端语音到语音翻译(S2ST)模型,可在保留原说话人音色的同时实现实时翻译,延迟仅 2 秒,而现有系统通常有 4–5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,读者可了解其数据管线与流式架构。
Google 发布智能体开发平台 Antigravity,即日起公开预览且免费,支持 macOS、Linux 和 Windows。它保留 AI 驱动的 IDE 编辑器视图,同时新增面向智能体的 Manager 界面,可并行编排多个工作区中的智能体,并通过任务列表、实现方案、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
Google DeepMind 与 Google Research 发布 WeatherNext 2,称其生成预报速度提升 8 倍,分辨率最高可达 1 小时。
推荐理由:原文给出生成速度、分辨率与可用入口,读者可据此判断该模型在天气预报工作流中的位置。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并给出自我改进循环与在 Genie 3 生成世界中的泛化表现。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星星座搭载 TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。配套预印本论文《Towards a future space-based, highly scalable AI infrastructure system design》讨论了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的早期实测数据。
Google 基于 Gemini 模型构建个人健康教练,明日起面向美国 Fitbit Premium Android 用户推出可选公开预览,随后扩展至 iOS。
推荐理由:Google 公开了健康教练的技术路径与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Google 发布 Earth AI 新进展,包括新的影像与人口基础模型,以及由 Gemini 驱动的地理空间推理智能体,并给出技术细节与评测。影像模型支持自然语言查询和开放词汇目标检测,在文本图像搜索任务上平均提升超过 16%,零样本新目标检测准确率翻倍以上。
推荐理由:Google 公布 Earth AI 新基础模型与地理空间推理智能体的评测数据,可了解多模型协同在灾害预测中的实际增益。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库中可用,并发布 gemma-3n-E2B 与 gemma-3n-E4B 两个尺寸(各含 base 与 instruct 变体)。
推荐理由:原文给出 Gemma 3n 的端侧内存占用、多模态输入与各开源库接入方式,便于判断本地部署可行性。
Google 发布 Gemma 家族新成员 Gemma 3,提供 1B、4B、12B、27B 四种参数规模,含预训练和指令微调版本。4B、12B、27B 支持图像与文本输入、140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。
推荐理由:梳理了 Gemma 3 的四种参数规模、多模态与 128k 上下文变化,并给出 transformers 与端侧推理的可用入口。
Google 发布 SigLIP 2 系列多语言视觉语言编码器,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local loss 与 Masked Prediction loss 等训练目标,在零样本分类、图文检索及为 VLM 提取视觉表征等核心能力上全面优于旧版 SigLIP。
推荐理由:梳理 SigLIP 2 相比前代新增的训练目标与 naflex 动态分辨率变体,便于理解视觉编码器的演进方向。