Google 与 NHS 合作研究:AI 用于乳腺癌筛查的独立表现与双读流程评估
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解人机协作的实际收益与仲裁环节的失误。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解人机协作的实际收益与仲裁环节的失误。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,中国模型下载占比与机器人数据集增长是两条主线。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用认知科学衡量 AGI 进展的框架,涵盖感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力,并配套三阶段评测协议。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。该平台以 Agent 优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,用户只需用自然语言即可定制模型。
推荐理由:Forge 把预训练、后训练与强化学习打包成企业自建模型的入口,读者可据此判断企业级定制模型的落地路径。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态 computer-use 模型,现已上线 Hugging Face,采用 NVIDIA Open Model License。
推荐理由:原文给出模型架构、吞吐对比与基准提升,读者可据此判断它在高并发 computer-use 场景的可用性。
OpenAI 发布 GPT-5.4 mini 和 nano,作为 GPT-5.4 的更小、更快版本。两者针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 在 GPT-5.4 之下补出 mini 与 nano 两档,读者可据此判断高并发与子智能体场景的选型空间。
OpenAI Japan 发布日本青少年安全蓝图,为使用生成式 AI 的青少年引入更强的年龄保护、家长控制和身心健康保障措施。
OpenAI 新研究显示,美国用户每天向 ChatGPT 发送近 300 万条询问薪酬与收入的消息,用于弥补薪资信息差。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。
推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。
Mistral AI 宣布以创始成员身份加入 NVIDIA Nemotron Coalition,并与 NVIDIA 计划联合开发前沿开源 AI 模型,结合 Mistral 的模型架构与全栈平台和 NVIDIA 的算力、模型开发工具及合成数据生成管线。
Google 与康奈尔大学在《PNAS》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Mistral AI 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。
OpenAI 详解 Codex Security 为何不依赖传统 SAST,而是用 AI 驱动的约束推理与验证来发现真实漏洞,并减少误报。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件归因中识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google 宣布在 Flood Hub 上线城市山洪(Urban Flash Flood)预报,可提前最多 24 小时预测城市山洪风险。由于山洪常发生在远离水文站的地方、缺乏地面真值数据,Google 用名为 Groundsource 的方法,借助 Gemini 分析公开新闻报道确认洪水事件的地点与时间,构建历史山洪数据集来训练和评估新模型。
推荐理由:Google 用 Gemini 从新闻中提取历史洪水事件训练模型,把城市山洪预警提前到 24 小时,并给出与 NWS 的对比数据。
Google Research 推出 Groundsource,一种利用 Gemini 从非结构化全球新闻中提取历史灾害数据的方法,并发布首个开放数据集,包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 首次在真实门诊流程中部署对话式诊断 AI,读者可了解其安全监督机制与医患反馈。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源码文件、生成或改进 RSpec 测试,并在 CI/CD 流水线中无需人工干预地运行。该智能体通过仓库级 AGENTS.md 执行计划、按文件类型划分的 skills 文件以及 Rubocop、SimpleCov 校验工具运作,仅靠一份 markdown 指令文件就将质量分从 0.68 提升至 0.74。
OpenAI 介绍了 ChatGPT 在智能体工作流中抵御提示词注入与社会工程攻击的设计思路:通过限制高风险操作、保护敏感数据来降低风险。
OpenAI 介绍如何用 Responses API、shell 工具和托管容器构建智能体运行时,让智能体在安全、可扩展的环境中处理文件、工具和状态。
推荐理由:OpenAI 官方说明如何用 Responses API、shell 工具和托管容器搭建智能体运行时,可了解其安全与扩展思路。
Wayfair 借助 OpenAI 模型自动化工单分类,并大规模优化数百万条商品属性,以提升电商客服效率与商品目录准确率。
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性以及对提示词注入攻击的抵抗能力。
ChatGPT 推出面向数学和科学的交互式可视化讲解功能,帮助学生实时探索公式、变量和概念。
Hugging Face 发布对 16 个开源异步 RL 训练库的调研,按编排原语、rollout 缓冲设计、权重同步协议、陈旧度管理、部分 rollout 处理、LoRA 支持和分布式训练后端七个维度进行对比。
Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 风格对象存储,用于存放 checkpoint、优化器状态、处理后的数据分片和 Agent traces 等频繁变动的中间产物。
推荐理由:Hugging Face 官方发布可变对象存储 Buckets,读者可据此判断训练中间产物该放在哪一层。
十年前的 AlphaGo 成为首个击败围棋世界冠军的 AI 系统,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。此后 DeepMind 将这一搜索与强化学习思路延伸至 AlphaFold 2(已折叠 2 亿个蛋白质结构,超 300 万研究者使用)、AlphaProof、AlphaEvolve 及 Gemini Deep Think 等系统,并因此获得 2024 年诺贝尔化学奖。
OpenAI 宣布收购 AI 安全平台 Promptfoo。Promptfoo 帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可了解其在 AI 系统开发期漏洞检测上的布局。
Hugging Face 博客介绍 Ulysses 序列并行(来自 Snowflake AI Research 的 ALST 协议),通过按注意力头切分并配合 all-to-all 通信,把长序列注意力计算分散到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
Hugging Face 发布 LeRobot v0.5.0,这是该项目迄今最大的一次更新,自 v0.4.0 以来合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:LeRobot v0.5.0 一次性补齐人形机器人、VLA 策略与仿真环境加载,可据此判断开源机器人栈的当前边界。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲学术与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。该资源旨在支持非洲语言语音识别与合成系统的开发,并计划持续扩充语言种类。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
Google 开源的 SpeciesNet 可对相机陷阱图像分类 2,498 个动物类别,基于 6,500 万张标注图像训练,在留出测试集上能找出 99.4% 含动物的图像,83% 的情况下可识别到物种且其中 94.5% 预测正确。
OpenAI 发布 AI 应用安全智能体 Codex Security,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修补复杂漏洞,官方称其置信度更高、噪声更少。
推荐理由:OpenAI 官方给出 Codex Security 的定位与三项核心能力,可据此判断它在安全审计流程中的切入点。
Balyasny Asset Management 通过严格的模型评估、全平台使用 OpenAI 以及智能体工作流,重构了投资研究流程。该机构将模型评估、OpenAI 全平台能力与 agent 工作流结合,用于改造投资研究工作方式。
Descript 借助 OpenAI 推理模型实现大型内容库的自动本地化,在不丢失时间轴与语义的前提下完成多语言视频配音。该方案面向大规模视频内容库,支持自动化的多语言配音流程。
Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这反而强化了可监控性作为 AI 安全防护手段的价值。
推荐理由:OpenAI 提出 CoT-Control 并观察到推理模型难以控制自身思维链,为可监控性作为安全手段提供了依据。
OpenAI 发布 GPT-5.4,称其为面向专业工作能力最强且高效的前沿模型,具备 SOTA 编码、计算机操作、工具搜索和 1M token 上下文。
推荐理由:OpenAI 官方发布 GPT-5.4,给出编码、计算机操作与 1M token 上下文等能力定位,便于判断其面向专业工作的边界。
OpenAI 发布面向学校的 AI 新工具、认证与评估资源,帮助中小学和高校缩小 AI 能力差距、扩大机会。这些资源旨在推动教育领域的 AI 应用真正转化为发展机遇。
Hugging Face 发布 Modular Diffusers,用可复用的块组合扩散流水线,作为现有 DiffusionPipeline 类的更灵活替代方案。每个块自带输入输出,可独立运行或增删替换,并支持自定义块发布到 Hub 供他人以 trust_remote_code=True 加载。该功能还与节点式可视化界面 Mellon 集成,可从块定义自动生成节点 UI。
推荐理由:Hugging Face 官方介绍 Modular Diffusers 的可组合块机制,读者可据此判断扩散流水线搭建方式的改动。
德甲俱乐部 VfL Wolfsburg 将 ChatGPT 推广为全俱乐部层面的能力,重点放在人而非试点项目上。该俱乐部借此提升效率、创造力与知识共享,同时保留自身的足球身份。