Google DeepMind 宣布与韩国科学技术信息通信部达成 AI 合作
Google DeepMind 与韩国科学技术信息通信部(MSIT)达成合作,将在首尔办公室设立 AI Campus,向韩国科研机构开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
Google DeepMind 与韩国科学技术信息通信部(MSIT)达成合作,将在首尔办公室设立 AI Campus,向韩国科研机构开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
Hugging Face 发布 QIMMA قِمّة,一个在评测模型前先验证基准质量的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
Google 提出推理优先的合成数据框架 Simula,无需种子数据,将生成过程拆解为全局多样化、局部多样化、复杂化和质量检查四个可控步骤。该框架用 Gemini 2.5 Flash 作教师模型、Gemma-3 4B 作学生模型,在网络安全、法律推理、GSM8k 和 Global MMLU 五个领域各生成最多 512K 数据点,完整系统在所有领域均优于简单基线。
Google Research 提出神经元形态生成模型 MoGen,通过 PointInfinity 点云流匹配生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对工作。MoGen 已开源,相关论文将在 ICLR 2026 展示。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,并将模拟器在 GitHub 开源。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为带明确稳定性契约的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。
推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,把建筑、道路等建成环境特征转成多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在人口密度、收入等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单模型,与图像嵌入做多模态融合后效果普遍优于单一模态;但在树木覆盖、海拔等环境任务上仍需改进。
NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。
推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,中国模型下载占比与机器人数据集增长是两条主线。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用认知科学衡量 AGI 进展的框架,涵盖感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力,并配套三阶段评测协议。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。该平台以 Agent 优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,用户只需用自然语言即可定制模型。
推荐理由:Forge 把预训练、后训练与强化学习打包成企业自建模型的入口,读者可据此判断企业级定制模型的落地路径。
Mistral AI 宣布以创始成员身份加入 NVIDIA Nemotron Coalition,并与 NVIDIA 计划联合开发前沿开源 AI 模型,结合 Mistral 的模型架构与全栈平台和 NVIDIA 的算力、模型开发工具及合成数据生成管线。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件归因中识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google 宣布在 Flood Hub 上线城市山洪(Urban Flash Flood)预报,可提前最多 24 小时预测城市山洪风险。由于山洪常发生在远离水文站的地方、缺乏地面真值数据,Google 用名为 Groundsource 的方法,借助 Gemini 分析公开新闻报道确认洪水事件的地点与时间,构建历史山洪数据集来训练和评估新模型。
推荐理由:Google 用 Gemini 从新闻中提取历史洪水事件训练模型,把城市山洪预警提前到 24 小时,并给出与 NWS 的对比数据。
Google Research 推出 Groundsource,一种利用 Gemini 从非结构化全球新闻中提取历史灾害数据的方法,并发布首个开放数据集,包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Hugging Face 发布对 16 个开源异步 RL 训练库的调研,按编排原语、rollout 缓冲设计、权重同步协议、陈旧度管理、部分 rollout 处理、LoRA 支持和分布式训练后端七个维度进行对比。
十年前的 AlphaGo 成为首个击败围棋世界冠军的 AI 系统,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。此后 DeepMind 将这一搜索与强化学习思路延伸至 AlphaFold 2(已折叠 2 亿个蛋白质结构,超 300 万研究者使用)、AlphaProof、AlphaEvolve 及 Gemini Deep Think 等系统,并因此获得 2024 年诺贝尔化学奖。
Hugging Face 博客介绍 Ulysses 序列并行(来自 Snowflake AI Research 的 ALST 协议),通过按注意力头切分并配合 all-to-all 通信,把长序列注意力计算分散到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲学术与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。该资源旨在支持非洲语言语音识别与合成系统的开发,并计划持续扩充语言种类。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。
Photoroom 在 Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元预算在 24 小时内训练出一个文生图扩散模型。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Hugging Face 发文介绍 transformers 库为 Mixture of Experts 模型所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 做的加载、后端与并行改造,并给出 v4 与 v5 的加载耗时对比。
Google Research 提出 MapTrace,一套面向多模态大模型的地图路径追踪任务、数据集与合成数据生成流程,并开源了用 Gemini 2.5 Pro 和 Imagen-4 生成的 200 万条问答对。
Google DeepMind 宣布与印度政府机构及本地机构建立 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist、Earth AI 等前沿科学模型,并宣布 3000 万美元的 Google.org Impact Challenge: AI for Science。
Google Research 与 Google DeepMind 发现,主要用鸟类数据训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型迁移用于鲸类发声分类。
Hugging Face 发布 SyGra 2.0.0 的 Studio,将合成数据生成搬到画布上,可视化编排流程并自动生成 SyGra 兼容的图配置与任务执行脚本。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,基于 1.2B 参数的 PRX-1.2B 在 Flux VAE latent 空间训练,基线配置为 100k 步、256×256 分辨率、全局 batch size 256。
OpenAI 披露其内部数据智能体,结合 GPT-5、Codex 与记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。该智能体为 OpenAI 自研自用,用于加速内部数据分析流程。
Google Research 提出 ATLAS(自适应迁移缩放定律),用于指导多语言模型的模型规模、数据量与语言配比选择,覆盖 774 次训练、10M–8B 参数模型、400+ 种语言和 48 种语言评测。
中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。
Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。
OpenAI 推出 Prism,一个内置 GPT-5.2 的免费 LaTeX 原生工作空间,帮助研究人员在同一处完成写作、协作与推理。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在图像分类等任务上超越现有基准,并首次为该多样性-效用权衡提供可证明的近似保证——所选子集价值至少达到最优解的一半。GIST 通过将多样性-效用问题拆解为一系列最大独立集问题,用双准则贪心算法在多个距离阈值上逼近求解。
微软团队发布 Differential Transformer V2,通过为每个 token 和每个 head 投影 λ 并只增加 query head 数量、保持 KV head 不变,使解码速度与标准 Transformer 持平且无需自定义注意力 kernel。
推荐理由:微软团队给出 Differential Transformer V2 的注意力实现与消融对比,读者可了解差分注意力在解码速度与训练稳定性上的取舍。
Google Research 利用 Android Auto 的匿名聚合急刹车事件(HBE,前向减速度超过 -3m/s²)数据,结合弗吉尼亚州和加州 10 年公开碰撞数据,通过负二项回归模型证实 HBE 频率与路段碰撞率呈显著正相关。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟上均优于传统模型,读者可了解混合建模路线的具体收益。