Google DeepMind 将 computer use 内置到 Gemini 3.5 Flash
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它仅作为独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全护栏,读者可据此判断智能体跨平台自动化的可用边界。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它仅作为独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全护栏,读者可据此判断智能体跨平台自动化的可用边界。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为智能体提供跨注册表的自然语言能力搜索。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,读者可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发一款基于 Gemini 的 AI 规划原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。
推荐理由:原文给出英国规划审批原型的目标、试点范围与上线时间,读者可据此判断 AI 介入公共服务的落地路径。
Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。
推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理提速。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,读者可据此判断本地低并发场景的取舍。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方披露了连续生成式语音翻译的取舍思路,以及它在 Google 各产品线的开放节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB VRAM 或统一内存的消费级笔记本上本地运行,并首次在中等规模模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体的硬件门槛。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,试验为期八周。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与师生互动数据,可了解 AI 辅助教学的实际效果与局限。
Google 在 Gemini Enterprise Agent Platform 上以公开预览形式推出基于 Agentic RAG 的跨语料检索功能。
推荐理由:原文给出多智能体 RAG 的完整架构与跨语料评测数据,可据此判断复杂多跳查询的落地方式。
Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可据此判断本地洪水预报如何接入自有数据。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文当天发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地边界。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 接地能力,可基于美国真实地点影像生成可交互世界,并支持沙漠、海洋世界、黑白电影等风格。
推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。
Google DeepMind 发布 Gemini Omni 模型家族,首款模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入生成高质量视频,并支持通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可了解其能力边界与首发渠道。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成科研工具集,读者可据此判断通用智能体在科研流程中的落地边界。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
斯坦福大学医学院 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药物。
推荐理由:通过人类专家与 Co-Scientist 候选药物的对照实验,展示 AI 在药物重定位中的实际命中率差异。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风 Melissa 中的提前预警细节,读者可了解 AI 天气模型在路径与强度双预测上的实际表现。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 多模态理解 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放入口,可据此判断其速度与成本取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段架构与辩论式排序机制,并给出多个实验室的落地案例,可据此判断 AI 参与科学假设生成的实际边界。