Calico 用 Google Co-Scientist 推进衰老生物学研究
Google DeepMind 的 Co-Scientist 正被 Calico Life Sciences 用于衰老生物学研究,帮助整合分散发现并生成可验证假设。在整合应激反应(ISR)研究中,Calico 团队借助 Co-Scientist 提出 ISR 受代谢调控的新假设,并优化实验设计、随结果迭代输入信息,实验已产生对 ISR 在健康与疾病中作用有重要意义的新发现,团队计划发表结果。
Google DeepMind 的 Co-Scientist 正被 Calico Life Sciences 用于衰老生物学研究,帮助整合分散发现并生成可验证假设。在整合应激反应(ISR)研究中,Calico 团队借助 Co-Scientist 提出 ISR 受代谢调控的新假设,并优化实验设计、随结果迭代输入信息,实验已产生对 ISR 在健康与疾病中作用有重要意义的新发现,团队计划发表结果。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假说随后经实验验证。团队还借此筛选出可供测试的候选组合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将各自的活体神经肌肉组织模型与细胞表面 RNA 图谱工具结合,用于 ALS 研究。
斯坦福大学医学院 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药物。
推荐理由:通过人类专家与 Co-Scientist 候选药物的对照实验,展示 AI 在药物重定位中的实际命中率差异。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风 Melissa 中的提前预警细节,读者可了解 AI 天气模型在路径与强度双预测上的实际表现。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 多模态理解 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放入口,可据此判断其速度与成本取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段架构与辩论式排序机制,并给出多个实验室的落地案例,可据此判断 AI 参与科学假设生成的实际边界。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,覆盖数学、量子物理、电网优化和 AI 基础设施等领域。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。
Google Research 公布其开放科学成果:十余年积累的开源工具与数据集已服务全球超 25 万名研究者和开发者。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
Google Research 介绍其 Empirical Research Assistance(ERA)在四个真实科研场景中的应用:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方梳理 ERA 在流行病预测、宇宙学、碳监测与神经科学四类真实科研任务中的落地方式,可看到 AI 辅助科研的具体边界。
Google DeepMind 与韩国科学技术信息通信部(MSIT)达成合作,将在首尔办公室设立 AI Campus,向韩国科研机构开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并以官方发布的 Gemma 4 浏览器助手扩展为参照。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本分工的架构取舍。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,用机器学习理解场景的空间布局,再用生成式 AI 想象出新视角下的画面。
推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后调整视角的技术路径。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 五家咨询公司合作,推动前沿 AI 在企业规模化落地。
Google 提出推理优先的合成数据框架 Simula,无需种子数据,将生成过程拆解为全局多样化、局部多样化、复杂化和质量检查四个可控步骤。该框架用 Gemini 2.5 Flash 作教师模型、Gemma-3 4B 作学生模型,在网络安全、法律推理、GSM8k 和 Global MMLU 五个领域各生成最多 512K 数据点,完整系统在所有领域均优于简单基线。
Google Research 提出神经元形态生成模型 MoGen,通过 PointInfinity 点云流匹配生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对工作。MoGen 已开源,相关论文将在 ICLR 2026 展示。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表现力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1211 与音频标签等具体能力,读者可据此判断语音生成的可控性进展。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,目前提供英文版并可注册。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力如何落地机器人巡检。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文文本生成出版级图表,ScholarPeer 则自动完成文献检索与论文评审。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖端侧到工作站,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调路径。
Google DeepMind 的 Gemma 4 多模态模型家族已在 Hugging Face 上线,采用 Apache 2 许可,支持图像、文本和音频输入并生成文本。
推荐理由:Gemma 4 以 Apache 2 许可开放五个尺寸并覆盖音频与端侧部署,读者可据此判断开源多模态模型的可用边界。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,并将模拟器在 GitHub 开源。
Google Quantum AI 发布白皮书,估算未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子资源比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并用零知识证明披露漏洞,读者可了解量子威胁与后量子迁移的紧迫性。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可通过指向和语音在 Google AI Studio 中编辑图片或查找地点。该指针已开始集成到 Chrome,用户可用指针选中网页内容让 Gemini 处理,Googlebook 也将推出 Magic Pointer。研究团队称这些原则旨在把传达上下文和意图的工作从用户转移到计算机。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者与普通用户的使用入口。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。
Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并更好理解音乐结构,支持用提示词指定前奏、主歌、副歌和桥段等元素。
推荐理由:Lyria 3 Pro 把单次生成时长提升到 3 分钟并支持段落级提示,读者可据此判断音乐生成在哪些产品里已经可用。
Google 发布 Vibe Coding XR 工作流,将 Gemini 的长上下文推理与开源 WebXR 框架 XR Blocks 结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 和 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的压缩思路与基准结果。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,把建筑、道路等建成环境特征转成多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在人口密度、收入等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单模型,与图像嵌入做多模态融合后效果普遍优于单一模态;但在树木覆盖、海拔等环境任务上仍需改进。
Google Research 在 The Check Up 活动上展示了医疗 AI 的多项进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解人机协作的实际收益与仲裁环节的失误。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,中国模型下载占比与机器人数据集增长是两条主线。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用认知科学衡量 AGI 进展的框架,涵盖感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力,并配套三阶段评测协议。