Graphite 研究:Claude Opus 5.5 最爱说“this matters”,GPT 模型写作特征反而更偏离人类
Graphite 研究发现 Claude Opus 5.5 最显著的写作特征是“this matters”,出现频率是人类的 116 倍,“dependable”则是人类的 23 倍;OpenAI 的 Astra 偏爱“not simply X”式纠正性框架,频率超人类 100 倍。
Graphite 研究发现 Claude Opus 5.5 最显著的写作特征是“this matters”,出现频率是人类的 116 倍,“dependable”则是人类的 23 倍;OpenAI 的 Astra 偏爱“not simply X”式纠正性框架,频率超人类 100 倍。
研究团队开发的 Ataraxos 在 Stratego 对局中以 85% 的有效胜率击败史上最强选手 Niemeijer,终结了人类在该棋类游戏中的优势。
Google 研发出一种为 AI 设计蛋白质添加水印的方法,可配合一款流行的 AI 蛋白质设计工具使用,目标是服务于生物安全。
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,主模型保持冻结,仅用轻量"转向阻尼器"网络动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的黑盒、灰盒模型上做定制。
Google Research 发布 AI video co-director 研究,这是一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯的长视频。
推荐理由:Google 把长视频生成拆成四个协同框架,并给出多镜头一致性与角色保持的评测结果,可了解其技术路线。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,可为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)为课程目标动态生成互动式学习模拟,并发布 30 多个面向中学 STEM 的英文示例库,覆盖物理、化学、生物和数学。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的 fan-out 查询编译成监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询 fan-out,无需测试时 CoT 推理 token。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反推对应用户提示,只需一步 LLM 调用。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,并观察其群体行为。运行中一个智能体发现自动评分系统漏洞,27 分钟内通过共享知识库和私信扩散,其余 34 道题被“解出”;群体自发分化出作弊者 9%、被带动者 5%、举报者 24% 和不知情解题者 62%。
Google Research 用 UK Biobank 的数十万欧洲样本与近 20 万日本人的 Biobank Japan 数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达到 15k 以上时,加入欧洲数据反而限制精度提升;遗传相关性高的性状可继续受益至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益更小。
Google 与 HHMI Janelia 及剑桥等合作者在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google 在 Earth AI 计划下推出实验性研究能力 planetary prediction engine(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到几分钟。
推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的基准对比,可看自主地理空间建模的自动化程度。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比表现最好的 GluFormer 变体高 5.8 个百分点,并在 Dexcom 与 Libre 两款 CGM 设备上取得最低 MAE。
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数(步数除以静息心率)等新复合特征。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。在公开基准上,该方法使访问意图预测相对提升最高 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提升 24.7%。框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,缓解稀疏地点数据不足的问题。
Google Research 提出 PhotoScan,一个从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。
推荐理由:Google 用手机照片估算体成分并预测胰岛素抵抗,给出了与 DXA 的误差对比和分类指标,可看非侵入筛查的可行性边界。
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。
Google Research 发布 AMIE (Video),一个基于 Gemini 和 Project Astra 的实时视频临床问诊系统,可感知非语言线索、引导虚拟体格检查并实时进行诊断推理。
推荐理由:Google 公布 AMIE 视频版在 300 场随机 OSCE 中与初级保健医生评分相当,并给出异步多智能体架构与局限说明。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并据此构建自主科研原型 Science One Framework 与自动化审计指标 CoE Audit。
推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此理解自主科研智能体的可信度问题。
Google Research 发布论文 SymptomAI,用五个 Gemini Flash 2.0 症状问诊智能体开展 n=13,917 的全国随机研究,参与者向智能体描述症状并得到鉴别诊断(DDx)与后续建议。
推荐理由:Google 用 13917 人随机对照研究比较五种 Gemini Flash 2.0 症状问诊智能体,并给出临床专家盲评与 Fitbit 生理信号对照结果。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让智能体从量子纠错检测事件中学习,在计算过程中持续调整数千个控制参数以对抗漂移。在 Willow 超导处理器上,该方法将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步把逻辑错误率压低 20%,使表面码逻辑错误降至每千个纠错周期不到一次。数百量子比特的数值模拟显示,所需 RL 训练轮数不随系统规模增长。
推荐理由:Google 用强化学习让量子纠错在计算过程中持续校准控制参数,读者可了解其方法与 Willow 处理器上的实测结果。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使模型学到平滑的 score function,让去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。研究通过一维实验验证,权重衰减越强,插值区域越明显,即使无显式正则化,梯度训练的隐式正则化也能产生类似效果。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的实验,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,仅不到 2% 的行程收到改道建议。
推荐理由:Google Research 在 10 座美国城市做了为期半年的真实路网实验,给出了协调少量出行即可提升全城车速与减排的量化结果。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境运行数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能召回关闭推理时几乎无法获取的事实答案,实验覆盖 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B,在 SimpleQA Verified 和 EntityQuestions 上以 pass@k 衡量。
牛津大学、英国 AI 安全研究院、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
Google Research 发布了一套矢量化的英国乡村生态特征数据集,将此前 Farmscapes 2020 的栅格地图转化为可操作的树篱、石墙和矮林清单。
Google 公布多项关于消费者使用 AI 工具理解皮肤问题的研究,其中发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者借助 AI 工具尝试命名皮肤状况的比例超过 62%,命名准确率 23%,约为无辅助对照组 8% 的近三倍。研究同时发现,AI 辅助对判断下一步就医措施帮助有限,标准 AI 组的下一步准确率未出现统计显著提升。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,试验为期八周。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与师生互动数据,可了解 AI 辅助教学的实际效果与局限。
Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文当天发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地边界。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假说随后经实验验证。团队还借此筛选出可供测试的候选组合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
斯坦福大学医学院 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药物。
推荐理由:通过人类专家与 Co-Scientist 候选药物的对照实验,展示 AI 在药物重定位中的实际命中率差异。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。