Microsoft Research 推出 CARE-X:面向临床可用的放射学 VLM,结合辅助监督、奖励对齐学习与工具增强测量
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光 VLM,同时支持报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光 VLM,同时支持报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需更新权重的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报的领先幅度和开源范围,读者可据此判断气象预报的可用性变化。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并据此构建自主科研原型 Science One Framework 与自动化审计指标 CoE Audit。
推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此理解自主科研智能体的可信度问题。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。文章以航空业为类比,称即便集群 GPU 满载也可能浪费大部分潜力,因为 GPU 全天运行而需求并非如此,基础设施必须按峰值配置。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云 credits,支持 Genesis Mission 的研究人员。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使模型学到平滑的 score function,让去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。研究通过一维实验验证,权重衰减越强,插值区域越明显,即使无显式正则化,梯度训练的隐式正则化也能产生类似效果。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。
伯克利 AI 研究提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体设计(Data Systems For Agents)、由智能体运行(Of Agents)、由智能体构建(By Agents)。
Hugging Face 发布 PRX 系列第四篇,详解其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像描述,并转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,改用 Qwen3-VL 后在训练中实时计算文本 latent,7B 规模下吞吐仅损失约 3–4%(30 天训练多约 1 天)。图像统一编码为 quality 92 的 JPEG。
Google Research 将建筑级屋顶反射率(albedo)数据集从 2024 年试点的 14 座城市扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。
Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比结果。
OpenAI 推出 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研中表现的新基准。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),单次前向传播即可从一组数据点同时估计分布的密度与 score,无需针对新分布重新训练。
NVIDIA 发布开源库 NeMo AutoModel,构建在 HuggingFace Transformers v5 之上,为 MoE 模型微调带来 3.4-3.7 倍训练吞吐提升和 29-32% 的 GPU 显存下降。
推荐理由:原文给出 NeMo AutoModel 在 MoE 微调上的吞吐与显存对比数据,读者可据此判断是否值得替换现有训练栈。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。
Hugging Face 在 PEFT 库中新增图像生成基准,与已有的 LLM 数学基准一起,在相同基座模型、数据集、训练与评估代码和硬件下对比多种参数高效微调技术。
推荐理由:Hugging Face 用统一基准对比多种 PEFT 技术,给出 LoRA 之外在精度与显存上的具体取舍数据。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,改进了药物制造中的一项关键反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可看 AI 在实验科学中的落地方式。
Google Research 发布了一套矢量化的英国乡村生态特征数据集,将此前 Farmscapes 2020 的栅格地图转化为可操作的树篱、石墙和矮林清单。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 换成 nn.Linear,并堆叠三层加激活函数构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可据此判断本地洪水预报如何接入自有数据。
DharmaOCR 团队把 Direct Preference Optimization(DPO)用于结构化 OCR 而非聊天对齐,用模型自身失败输出构建偏好对,在全部测试的模型家族中都将文本退化率降低,平均降幅 59.4%,最高 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。
Mistral 收购 Emmi AI,并加倍投入面向航空航天、汽车、半导体和能源等行业的物理 AI 基础模型研究。其已发布成果包括 AB-UPT,可在单张 GPU 上处理 9M 表面和 140M 体积网格的原始几何数据,无需重新划分网格;以及首个大规模多物理场端到端深度学习代理模型 NeuralDEM。
Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注 Physics AI 与大型工程模型,可实时仿真替代多日计算并构建数字孪生,其 30 多名研究人员与工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其 Science 路线与工业 AI 布局。
Hugging Face 发布 OlmoEarth v1.1 地球观测模型系列,在保持 v1 性能的同时将计算成本最高降低 3 倍。该系列通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,并修改预训练方案以避免性能下降,提供 Base、Tiny、Nano 三种规模权重及训练代码。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文当天发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地边界。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 使用 Co-Scientist 辅助衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,其推荐因子成功让细胞进入更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短到几天。
剑桥大学教授 Clare Bryant 使用 Google Co-Scientist 研究流感等病原体跨物种传播时引发败血症的分子开关,该工具生成并排序了一批假说,其中优先关注到一个她此前未留意的蛋白质。随着她持续补充未发表数据,假说从候选蛋白质逐步收敛到具体氨基酸,团队正据此构建含氨基酸突变的细胞系进行验证。Bryant 称,原本需要两到三年的精确氨基酸识别工作,如今有望在六个月内完成。
Google DeepMind 的 Co-Scientist 正被 Calico Life Sciences 用于衰老生物学研究,帮助整合分散发现并生成可验证假设。在整合应激反应(ISR)研究中,Calico 团队借助 Co-Scientist 提出 ISR 受代谢调控的新假设,并优化实验设计、随结果迭代输入信息,实验已产生对 ISR 在健康与疾病中作用有重要意义的新发现,团队计划发表结果。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假说随后经实验验证。团队还借此筛选出可供测试的候选组合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将各自的活体神经肌肉组织模型与细胞表面 RNA 图谱工具结合,用于 ALS 研究。
Hugging Face 发布两款基于 ModernBERT 的 Apache 2.0 多语言嵌入模型:97M 参数的 granite-embedding-97m-multilingual-r2 在 MTEB Multilingual Retrieval 上得分 60.3。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段架构与辩论式排序机制,并给出多个实验室的落地案例,可据此判断 AI 参与科学假设生成的实际边界。
OpenAI 的 Parameter Golf 活动吸引 1,000+ 名参与者、收到 2,000+ 份提交,探索严格约束下的 AI 辅助机器学习研究、编码智能体、量化与新型模型设计。
Hugging Face 发文解析 AWS 上基础模型训练与推理的开源软件栈分层架构,涵盖 Slurm、Kubernetes、PyTorch、JAX 及 Prometheus、Grafana 等工具。
Google Research 公布其开放科学成果:十余年积累的开源工具与数据集已服务全球超 25 万名研究者和开发者。
Google Research 介绍其 Empirical Research Assistance(ERA)在四个真实科研场景中的应用:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方梳理 ERA 在流行病预测、宇宙学、碳监测与神经科学四类真实科研任务中的落地方式,可看到 AI 辅助科研的具体边界。
IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。
推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。