Google DeepMind 发布 SIMA 2:接入 Gemini 的 3D 世界游戏智能体
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并给出自我改进循环与在 Genie 3 生成世界中的泛化表现。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并给出自我改进循环与在 Genie 3 生成世界中的泛化表现。
OpenAI 将 GPT-5 系列升级为 GPT-5.1,模型更温暖、能力更强,并新增定制 ChatGPT 语气和风格的方式。GPT-5.1 当天起向付费用户逐步推送。
推荐理由:GPT-5 系列升级到 GPT-5.1,付费用户当天开始推送,可据此了解对话体验与语气定制的变化。
OpenAI 发布 GPT-5 系统卡增补,给出 GPT-5.1 Instant 和 GPT-5.1 Thinking 的更新安全指标,并新增心理健康与情感依赖方面的评估。
推荐理由:OpenAI 公布 GPT-5.1 两个版本的安全指标更新,并新增心理健康与情感依赖评估。
IBM 发布 Granite 4.0 家族中最小的 Granite 4.0 Nano,含 4 个 instruct 模型及对应 base 版本:Granite 4.0 H 1B(约 15 亿参数)与 H 350M(约 3.5 亿参数)采用 hybrid-SSM 架构,另有传统 Transformer 版 Granite 4.0 1B 和 350M。
OpenAI 发布新一代视频与音频生成模型 Sora 2,并公开其系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升,官方称这些能力此前的视频模型较难实现。
推荐理由:官方系统卡披露 Sora 2 在物理准确性、音画同步与可控性上的能力变化,可据此判断视频生成模型的当前边界。
OpenAI 发布 Sora 2 视频生成模型,支持同步对话与音效。该帖子同时说明 Sora 产品已不再可用。
NVIDIA 发布首个面向日本的主权 AI 开源合成数据集 Nemotron-Personas-Japan,含 600 万条日语 persona(100 万条记录、每条 6 个 persona),总 token 约 14 亿,采用 CC BY 4.0 许可。
OpenAI 发布 GPT-5 系统卡增补,公开新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两个推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在超 3T token、1800 多种语言上训练,是首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用三阶段训练与逆掩码率调度(30%→15%→5%),在 GLUE 和 XTREME 基准上显著领先 XLM-R 与 mGTE。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并同步更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入以及 SIP 电话呼叫支持。
推荐理由:OpenAI 发布新一代语音到语音模型并扩展 Realtime API,读者可了解语音智能体接入工具与电话通道的能力边界。
OpenAI 与 Retro Bio 借助专用 AI 模型 GPT-4b micro,设计出用于干细胞疗法和长寿研究的更有效蛋白质。该模型专为生命科学研究打造,目标是加速蛋白质工程等科研环节。
OpenAI 发布 GPT-5,称其为该公司最先进的模型,面向企业 AI、自动化和劳动力生产力。原文仅给出这一句概述,未披露具体能力、参数或可用性细节。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布 GPT-5 首次上手视频,展示一群领先开发者第一次使用 GPT-5 的过程。
OpenAI 发布 GPT-5 系统卡,说明其通过统一模型路由系统实现快速与智能的响应。该系统使用 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本,针对不同任务和开发者用途进行优化。
推荐理由:系统卡披露 GPT-5 用统一路由在 gpt-5-main、gpt-5-thinking 与轻量版本间分配任务。
OpenAI 在 GPT-5 中引入 safe-completions 方法,用更细致的输出导向安全训练取代此前的硬拒绝策略,以同时提升模型的安全性与有用性。该方案针对双重用途提示词的处理,让模型在敏感请求下给出有分寸的回应而非直接拒答。
OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。
推荐理由:OpenAI 官方公布 GPT-5 的定位与能力覆盖范围,读者可据此了解其相对前代模型的升级方向。
OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、灵活和可及的重要一步。官方表示,其使命是让尽可能多的人用上 AI,此次发布旨在推动 AI 在全球范围内的普及。
推荐理由:OpenAI 官方宣布发布其能力最强的开放权重模型,读者可据此了解其开放与可及性主张。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型,给出参数量、许可与部署定位,便于判断本地推理的可用边界。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两个开放权重推理模型,采用 Apache 2.0 许可证,并适用 gpt-oss 使用政策。
推荐理由:OpenAI 以 Apache 2.0 开放两个推理模型权重,读者可据此了解其开放范围与使用条件。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
Hugging Face 发布 Ettin Suite,这是首个用完全相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 到 1B。
Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。
推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此判断语音能力的部署与成本选择。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Numina 与 Kimi 团队发布 Kimina-Prover-72B 形式化定理证明模型,基于 Qwen2.5-72B 并用 Kimi k1.5 的 RL 流程训练,同时开源 8B 和 1.7B 蒸馏版本。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 think/no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:Hugging Face 公开了 SmolLM3 的完整训练配方与数据配比,读者可据此复现或改进 3B 级小模型的训练流程。
NVIDIA 发布 Llama Nemotron Nano VL,一个 8B 视觉语言模型,面向智能文档处理,已在 Hugging Face 上架。
推荐理由:8B 视觉语言模型面向文档处理,给出了架构、训练数据与 OCRBench v2 表现,便于评估企业文档自动化选型。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库中可用,并发布 gemma-3n-E2B 与 gemma-3n-E4B 两个尺寸(各含 base 与 instruct 变体)。
推荐理由:原文给出 Gemma 3n 的端侧内存占用、多模态输入与各开源库接入方式,便于判断本地部署可行性。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩和训练论文,便于对比其推理能力定位。
H Company 发布 Holo1 系列动作视觉语言模型(含 Holo1-3B 与 Holo1-7B)以及 WebClick 多模态定位基准,模型已在 Hugging Face 开源。
推荐理由:Holo1 开源了面向 GUI 自动化的动作 VLM 家族,并给出 WebClick 基准与 Surfer-H 智能体的组合方式,读者可据此评估网页自动化方案的成本与精度取舍。
Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。
推荐理由:450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索场景中明显优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。
推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度可调的取舍方式,便于评估检索成本。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Mistral 与 All Hands AI 联合发布开源编码智能体模型,给出 SWE-Bench Verified 分数与本地部署门槛,便于判断其可用性。
Falcon-LLM 团队发布 Falcon-H1 系列六个开源模型,参数规模从 0.5B 到 34B,每个都提供 base 和 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用混合注意力与 SSM 架构覆盖 0.5B 到 34B,读者可据此判断小模型在长上下文与端侧场景的取舍。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及最多 4 倍大的阿拉伯语 LLM,覆盖阿拉伯语 MMLU、Exams、MadinahQA 等任务。
Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上水平,成本为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,读者可据此判断企业选型的成本与落地条件。
Meta 发布 Llama Guard 4,一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,可检测图像与文本输入输出中的不当内容,单张 24GB 显存 GPU 即可运行。
推荐理由:Meta 发布 12B 多模态安全模型与两款提示注入分类器,并给出可直接运行的 transformers 示例。