伯克利提出信息驱动成像系统设计框架,可跨四类成像任务预测性能
伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化信息含量,无需重建算法或任务专用解码器。该框架在彩色摄影、射电天文、无镜头成像和显微成像四个领域预测了解码器性能,优化后的设计达到端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化信息含量,无需重建算法或任务专用解码器。该框架在彩色摄影、射电天文、无镜头成像和显微成像四个领域预测了解码器性能,优化后的设计达到端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
OpenAI 推出针对思维链可监控性的新框架与评估套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 在湿实验室中加速生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的前景与风险。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且不依赖 LLM 自行脱敏。该框架用隐私预算 ε 提供端到端数学保证,LLM 仅基于匿名关键词生成摘要,不接触原始对话。对比非隐私基线 Simple-CLIO,DP 摘要最高有 70% 的概率被 LLM 评估者偏好。
Google Research 发布 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。Titans 用深度神经网络作为长期记忆模块,通过 surprise 指标、动量和自适应权重衰减选择性存储信息;MIRAS 则统一了序列建模的四个设计选择,并衍生出 YAAD、MONETA、MEMORA 三个无注意力模型。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,在超长上下文任务上超过 GPT-4。
密歇根州立大学团队借助 AlphaFold 预测植物与嗜热藻类中甘油酸激酶(GLYK)的 3D 结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。研究人员用藻类 GLYK 中更刚性的环替换这些不稳定片段,构建的杂合酶中有一个在高达 65 °C 时仍保持稳定,为培育耐热作物提供了路径。
Intel AI Software Group 发布 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的轻量级数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱执行,将输出长度最多缩短 66%,同时在 MATH500、AIME、HMMT、HLE 等基准上提升准确率。
Google Research 在 NeurIPS 2025 发布大规模声音嵌入基准 MSEB,用统一框架评测检索、推理、分类、转录、分割、聚类、重排与重建八项听觉能力。
密苏里大学的研究者借助 AlphaFold 与冷冻电镜,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。研究者先用冷冻电镜拍摄 LDL 颗粒图像,但清晰度不足以达到原子级精度,随后用 AlphaFold 生成原子级结构预测,再与电镜数据比对修正。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,展示了 AI 预测在结构生物学中的具体用法。
UCLA 教授 Ernest Ryu 与 GPT-5 解决了优化理论中的一个关键问题,展示了 AI 在加速数学发现中的作用。
Google Research 介绍一种端到端语音到语音翻译(S2ST)模型,可在保留原说话人音色的同时实现实时翻译,延迟仅 2 秒,而现有系统通常有 4–5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,读者可了解其数据管线与流式架构。
ServiceNow 将 15B 推理模型改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1x 吞吐,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降,总训练 76.8B token。
Google Research 与 Google DeepMind 联合发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率、区分天然林与其他树冠的地图与数据集,论文发表于 Nature Scientific Data。
Google Quantum AI 与 Stanford、MIT、Caltech 合作者在 Nature 论文中提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉把优化问题转化为解码问题。
推荐理由:Google Quantum AI 提出把优化问题转成解码问题的量子算法,并给出 OPI 上量子与经典运算量的对比。
Google DeepMind 在 Nature 发表新研究,提出三步对齐方法,用 THINGS 数据集训练 SigLIP-SO400M 上的适配器生成百万级图像的 AligNet 数据集,再微调其他视觉模型,使其内部表征按人类概念层级重新组织。该方法改善了模型在“odd-one-out”任务上与人类判断的一致性,并提升了鲁棒性与泛化能力。
Google Research 在 NeurIPS 2025 论文中提出 Nested Learning,将模型架构与优化算法统一为多层嵌套的优化问题,并给出概念验证架构 Hope。Hope 是 Titans 架构的变体,在语言建模上表现更优,长上下文记忆管理优于现有 SOTA 模型。该范式还衍生出深度优化器和连续记忆系统(CMS)等改进方向。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划三项创新,在 DABStep、KramaBench、DA-Code 上均超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 至 44.7%、37.0% 至 38.5%,并登顶 DABStep 公开榜单。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作开发森林流失驱动因素模型,以 1km² 分辨率覆盖 2000-2024 年,并开放 30 米尺度砍伐风险预测基准数据集。
Google 发布 ForestCast,基于纯卫星数据与 vision transformers 预测森林砍伐风险,并公开首个面向该任务的基准数据集。模型仅用 Landsat 和 Sentinel 2 卫星数据及"变化历史"输入,精度可匹配或超过依赖道路、人口密度等专用地图的传统方法,且可在全球任意区域一致应用。团队同时公开全部输入、训练与评估数据,供社区复现并改进模型。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星星座搭载 TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。配套预印本论文《Towards a future space-based, highly scalable AI infrastructure system design》讨论了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的早期实测数据。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),对非结构化 GenAI 数据做分析,保证个体数据不可被查看、聚合结果匿名。
Google Research 在 UIST'25 发布 StreetReaderAI,一款面向盲人和低视力用户的可访问街景原型,基于 Gemini 提供 AI Describer 实时场景描述与 AI Chat 对话问答,支持键盘和语音导航。
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
NVIDIA 发布首个开放合成印度人物画像数据集 Nemotron-Personas-India,基于 NeMo Data Designer 构建,含 2100 万人物画像、77 亿 token,覆盖英语与印地语(天城文及拉丁文),涵盖印度全部 36 个邦和 640 个地区,采用 CC BY 4.0 许可。
OpenAI 分享了评估 ChatGPT 政治偏见的新方法,通过更贴近真实世界的测试提升客观性并减少偏见。该方法聚焦于对 LLM 政治偏见的定义与评测。
Meta 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可自定义场景并导出完整 trace,便于复现与调试。
Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测方法,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还公开了具体案例,以及对一种早期减少 scheming 方法的压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法与初步缓解手段,可了解前沿模型欺骗行为的检测思路。
OpenAI 基于迄今规模最大的 ChatGPT 使用研究,展示了该工具如何在个人与职业场景中创造经济价值。研究显示,ChatGPT 的采用正从早期用户向更广泛人群扩展,逐步缩小使用差距,并成为日常生活的一部分。
Hugging Face 发布 Jupyter Agent 项目,通过清洗约 2TB Kaggle notebook 构建 51k 合成 notebook、近 0.2B token 的数据集,并用 TRL 全参数微调 Qwen3-4B。
推荐理由:完整披露了从 Kaggle notebook 清洗到 SFT 的数据管线与消融结果,可迁移到其他小模型智能体训练。
OpenAI 新研究解释了语言模型产生幻觉的原因,并指出改进评估方法可以提升 AI 的可靠性、诚实性与安全性。
SandboxAQ 将其 Structurally Augmented IC50 Repository(SAIR)数据集上线 Hugging Face,以 CC BY 4.0 许可免费开放,包含 5.24 million 个 AI 生成的蛋白质-配体 3D 复合物结构,每个结构均配 ChEMBL 或 BindingDB 的实验 IC₅₀ 数据。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在实际训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从小初始化训练时,word2vec 按离散步骤依次学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。
Kimina Prover 团队开源了 kimina-prover-rl 训练流水线,用于在 Lean 4 中训练形式化定理证明模型,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容开源 Verl 框架。
Hugging Face 推出 FilBench 评测套件,覆盖文化知识、经典 NLP、阅读理解与生成四大类共 12 项任务,用于评估 LLM 在 Tagalog、Filipino 和 Cebuano 上的表现,并已评测 20+ 个 SOTA 模型。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏,评测 LLM 作为自主智能体的长上下文推理与探索学习能力。
OpenAI 发布研究,评估开源权重模型 gpt-oss 在发布后可能带来的最坏情况前沿风险。研究提出"恶意微调"(MFT)方法,通过微调让 gpt-oss 在生物学和网络安全两个领域尽可能发挥最大能力。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成 STEM 选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码任务。
TimeScope 是一个开源长视频理解基准,通过在 1 分钟到 8 小时的基础视频中插入 5-10 秒的短片段作为“针”,评测模型的局部检索、信息综合和细粒度时序感知三项能力。
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默基因对(部分)未见细胞类型的影响,即"上下文泛化"。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型将研究、浏览器自动化和代码工具整合在一起。系统卡还说明该模型在 Preparedness Framework 下配备了相应防护措施。
推荐理由:OpenAI 官方系统卡披露 ChatGPT agent 的能力组合与 Preparedness Framework 下的防护安排。