Google DeepMind 为 AI 时代重新设计鼠标指针
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可通过指向和语音在 Google AI Studio 中编辑图片或查找地点。该指针已开始集成到 Chrome,用户可用指针选中网页内容让 Gemini 处理,Googlebook 也将推出 Magic Pointer。研究团队称这些原则旨在把传达上下文和意图的工作从用户转移到计算机。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可通过指向和语音在 Google AI Studio 中编辑图片或查找地点。该指针已开始集成到 Chrome,用户可用指针选中网页内容让 Gemini 处理,Googlebook 也将推出 Magic Pointer。研究团队称这些原则旨在把传达上下文和意图的工作从用户转移到计算机。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者与普通用户的使用入口。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。
Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并更好理解音乐结构,支持用提示词指定前奏、主歌、副歌和桥段等元素。
推荐理由:Lyria 3 Pro 把单次生成时长提升到 3 分钟并支持段落级提示,读者可据此判断音乐生成在哪些产品里已经可用。
Google 发布 Vibe Coding XR 工作流,将 Gemini 的长上下文推理与开源 WebXR 框架 XR Blocks 结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 和 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的压缩思路与基准结果。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,把建筑、道路等建成环境特征转成多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在人口密度、收入等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单模型,与图像嵌入做多模态融合后效果普遍优于单一模态;但在树木覆盖、海拔等环境任务上仍需改进。
Google Research 在 The Check Up 活动上展示了医疗 AI 的多项进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解人机协作的实际收益与仲裁环节的失误。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,中国模型下载占比与机器人数据集增长是两条主线。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用认知科学衡量 AGI 进展的框架,涵盖感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力,并配套三阶段评测协议。
Google 与康奈尔大学在《PNAS》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Google 宣布在 Flood Hub 上线城市山洪(Urban Flash Flood)预报,可提前最多 24 小时预测城市山洪风险。由于山洪常发生在远离水文站的地方、缺乏地面真值数据,Google 用名为 Groundsource 的方法,借助 Gemini 分析公开新闻报道确认洪水事件的地点与时间,构建历史山洪数据集来训练和评估新模型。
推荐理由:Google 用 Gemini 从新闻中提取历史洪水事件训练模型,把城市山洪预警提前到 24 小时,并给出与 NWS 的对比数据。
Google Research 推出 Groundsource,一种利用 Gemini 从非结构化全球新闻中提取历史灾害数据的方法,并发布首个开放数据集,包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 首次在真实门诊流程中部署对话式诊断 AI,读者可了解其安全监督机制与医患反馈。
十年前的 AlphaGo 成为首个击败围棋世界冠军的 AI 系统,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。此后 DeepMind 将这一搜索与强化学习思路延伸至 AlphaFold 2(已折叠 2 亿个蛋白质结构,超 300 万研究者使用)、AlphaProof、AlphaEvolve 及 Gemini Deep Think 等系统,并因此获得 2024 年诺贝尔化学奖。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲学术与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。该资源旨在支持非洲语言语音识别与合成系统的开发,并计划持续扩充语言种类。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
Google 开源的 SpeciesNet 可对相机陷阱图像分类 2,498 个动物类别,基于 6,500 万张标注图像训练,在留出测试集上能找出 99.4% 含动物的图像,83% 的情况下可识别到物种且其中 94.5% 预测正确。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,已在 Google AI Studio 和 Vertex AI 以预览形式向开发者开放。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的先进世界知识、质量与推理能力带到 Flash 级速度。
推荐理由:官方给出 Nano Banana 2 与 Pro 的能力分工和上线渠道,读者可据此判断该选哪个模型做图像任务。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证分数,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 上 77.1% 的验证分数,读者可据此判断 Gemini 3.1 Pro 在核心推理上的提升幅度。
Google DeepMind 的最新音乐生成模型 Lyria 3 以 beta 形式在 Gemini 应用中上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯音乐的曲目,并附由 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、语言覆盖与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。
Google Research 提出 MapTrace,一套面向多模态大模型的地图路径追踪任务、数据集与合成数据生成流程,并开源了用 Gemini 2.5 Pro 和 Imagen-4 生成的 200 万条问答对。
Google DeepMind 宣布与印度政府机构及本地机构建立 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist、Earth AI 等前沿科学模型,并宣布 3000 万美元的 Google.org Impact Challenge: AI for Science。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。官方称其在 Humanity's Last Exam 上取得 48.4%(无工具)、ARC-AGI-2 上 84.6%、Codeforces 上 Elo 3455,并在 2025 国际数学奥林匹克达到金牌水平。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并说明 API 早期访问入口,便于判断其科研与工程定位。
Google 在 ACM UIST 2025 上发布开源原型框架 DialogLab,用于编排、模拟和测试动态的人机多方群组对话。该框架将对话的社交设定与时间推进解耦,通过"编排-测试-验证"三阶段工作流支持拖拽式场景搭建、human control 实时干预和对话动态可视化分析。
Google Research 与 Google DeepMind 发现,主要用鸟类数据训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型迁移用于鲸类发声分类。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式求解专业研究问题。团队构建了由 Deep Think 驱动的数学研究智能体 Aletheia,具备自然语言验证器、可迭代生成与修正,并能承认无法求解,在 IMO-ProofBench Advanced 上得分最高达 90%。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学上的研究级成果,并给出人机协作的分类框架。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具让 UI 设计从一刀切转向情境感知,以动态的智能体驱动模块取代静态导航。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练内顺序、自适应地挑选最佳组件(层、块或特征),无需反复重训即可完成特征选择。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,兼顾效率、准确率、可解释性与大规模可扩展性。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。
推荐理由:Google 与 Included Health 将开展全国随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:官方披露了原型的三项核心能力与已知限制,读者可据此判断世界模型当前能做什么、还差什么。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族,挑战了“智能体越多越好”的假设。
推荐理由:通过 180 种智能体配置的对照评测,给出多智能体架构在并行与顺序任务上的量化差异,可作为架构选型参考。
Google Research 提出 ATLAS(自适应迁移缩放定律),用于指导多语言模型的模型规模、数据量与语言配比选择,覆盖 774 次训练、10M–8B 参数模型、400+ 种语言和 48 种语言评测。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在图像分类等任务上超越现有基准,并首次为该多样性-效用权衡提供可证明的近似保证——所选子集价值至少达到最优解的一半。GIST 通过将多样性-效用问题拆解为一系列最大独立集问题,用双准则贪心算法在多个距离阈值上逼近求解。
Google Research 在 EMNLP 2025 发表的论文提出分解式意图提取方法:先用小型多模态 LLM 逐屏总结用户交互,再从摘要序列中提取意图,在移动端和网页轨迹上均优于 CoT 与端到端微调。该方法用 Gemini 1.5 Flash 8B 即可达到 Gemini 1.5 Pro 相当的效果,成本与速度更优,适用于端侧部署。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。
推荐理由:D4RT 把 4D 重建统一进单一查询式框架,效率提升幅度和实时应用场景是主要看点。
Google 提出基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 50 Hz IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。在 246 名参与者、约 7 万个步行片段的大规模验证中,多数指标达到 Pearson r >0.80、ICC >0.80,与 Pixel 6 手机估算结果无显著差异(p >0.05)。
Google Research 利用 Android Auto 的匿名聚合急刹车事件(HBE,前向减速度超过 -3m/s²)数据,结合弗吉尼亚州和加州 10 年公开碰撞数据,通过负二项回归模型证实 HBE 频率与路段碰撞率呈显著正相关。