NeuralGCM 用 AI 改进全球长期降水模拟
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟上均优于传统模型,读者可了解混合建模路线的具体收益。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟上均优于传统模型,读者可了解混合建模路线的具体收益。
Google Research 发布 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。Titans 用深度神经网络作为长期记忆模块,通过 surprise 指标、动量和自适应权重衰减选择性存储信息;MIRAS 则统一了序列建模的四个设计选择,并衍生出 YAAD、MONETA、MEMORA 三个无注意力模型。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,在超长上下文任务上超过 GPT-4。
密苏里大学的研究者借助 AlphaFold 与冷冻电镜,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。研究者先用冷冻电镜拍摄 LDL 颗粒图像,但清晰度不足以达到原子级精度,随后用 AlphaFold 生成原子级结构预测,再与电镜数据比对修正。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,展示了 AI 预测在结构生物学中的具体用法。
Google Research 介绍一种端到端语音到语音翻译(S2ST)模型,可在保留原说话人音色的同时实现实时翻译,延迟仅 2 秒,而现有系统通常有 4–5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,读者可了解其数据管线与流式架构。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星星座搭载 TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。配套预印本论文《Towards a future space-based, highly scalable AI infrastructure system design》讨论了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的早期实测数据。
Meta 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可自定义场景并导出完整 trace,便于复现与调试。
Hugging Face 发布 Jupyter Agent 项目,通过清洗约 2TB Kaggle notebook 构建 51k 合成 notebook、近 0.2B token 的数据集,并用 TRL 全参数微调 Qwen3-4B。
推荐理由:完整披露了从 Kaggle notebook 清洗到 SFT 的数据管线与消融结果,可迁移到其他小模型智能体训练。
Hugging Face 分享研究,将 CodeAgent 的思考与代码强制以结构化 JSON 生成,在 GAIA、MATH、SimpleQA、Frames 等基准上比普通 CodeAgent 平均高出 2-7 个百分点。
推荐理由:通过 15724 条 agent trace 量化解析错误对成功率的影响,并给出结构化 CodeAgent 的适用模型门槛。
ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。
推荐理由:ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。
推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。
Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。
OpenAI 发布 Operator 系统卡,说明其基于既有安全框架采用多层防护方案。文档涵盖针对提示词工程与越狱的模型和产品缓解措施、隐私与安全保护,并披露外部红队测试、安全评估以及持续完善这些防护的后续工作。
推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示词攻击、隐私与红队测试上的多层防护设计。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。
推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词设计到去污染、训练评估的完整合成数据流水线,可迁移到自建预训练数据。
OpenAI 发布研究,探索在视频数据上大规模训练生成模型,联合在可变时长、分辨率和宽高比的视频与图像上训练文本条件扩散模型,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果表明扩展视频生成模型是构建通用物理世界模拟器的一条有前景的路径。
推荐理由:OpenAI 首次公开 Sora 的技术路线,说明视频生成模型可扩展为物理世界模拟器。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。除性能提升外,过程监督还带来对齐收益:直接训练模型产出人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并给出对对齐的额外收益,可了解训练方法差异。
OpenAI 用 GPT-4 自动为大型语言模型的神经元行为撰写解释,并对这些解释打分。团队同时发布了覆盖 GPT-2 全部神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为,并公开全部神经元的解释与评分数据集。