Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放方式,可据此判断前沿模型的能力边界与落地节奏。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放方式,可据此判断前沿模型的能力边界与落地节奏。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参或特征工程,同时支持分类与回归。
推荐理由:原文给出表格基础模型的架构设计、训练数据生成方式与四个基准排名,可据此判断免训练表格预测的可行边界。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作上接近 Astra 的智能水平,标准 API 输入与输出 token 价格仅为 Astra 的五分之一。
推荐理由:官方给出 GPT-6.1 Sol 的定位与定价对比,读者可据此判断它在编码和电脑操作任务上的成本取舍。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它与 Opus 5.5 的分工。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。
推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级虚拟形象的应用边界。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型给出语音克隆、逐行表演控制与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,二者在能力与成本上各有侧重。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款语音对话模型同时发布,给出语音智能体基准成绩与开发者接入路径,可据此判断实时语音 Agent 的当前水位。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话(telephony)支持。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,读者可据此判断语音应用的接入门槛变化。
OpenAI 发布 GPT-6 Astra,称其为面向商业场景能力最强的模型,具备高级推理、计算机使用以及更强的写作与设计判断力。目前官方仅给出简要介绍,未披露具体参数、可用时间或定价信息。
推荐理由:OpenAI 官方发布 GPT-6 Astra,读者可据此了解其面向商业场景的推理与计算机使用能力定位。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,可直接学习实时观测数据,每小时生成一次预报,最高分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:官方给出分辨率、更新频率与降水精度等具体指标,可据此判断 AI 天气预报在 Google 产品中的落地程度。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型。
Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,称其为目前推理与编码能力最强的模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两个变体的基准表现与定价,读者可据此判断长时程编码与网络安全任务的成本取舍。
OpenAI 发布 Astra,称其是首个在 Preparedness Framework 下达到关键网络安全能力阈值的 OpenAI 模型。OpenAI 表示将为该模型的发布配备更强的安全防护措施。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可了解其发布前的安全门槛。
Google 发布 TimesFM-3,一个原生预训练支持多变量预测的零样本时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向即可输出整个预测区间及 9 个分位数。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自原 GigaPath ViT-g 的 22M 参数 ViT-S 编码器替换原有骨干,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力,通过 Google AI Studio 的 Gemini API 与 Agent Platform API 提供。
推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体能力与定价入口,可据此判断生成视频工作流的变化。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文本模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言等可核验指标,并说明开发者与消费端入口,便于判断语音转写能力边界。
IBM 发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,均以 Apache 2.0 许可开源。
推荐理由:IBM 公开了 Granite 4.2 从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的升级幅度。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方披露了 SL2T 的训练规模、隐私设计与基准成绩,可据此判断手语翻译进入消费级产品的可行边界。
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于授权的漏洞研究、漏洞利用验证和安全测试。
推荐理由:OpenAI 推出网络安全专用模型并限定授权用途,读者可据此了解其能力边界与开放方式。
Meta 发布开源多模态模型 Muse Glimmer,从 Muse 蒸馏至 30B 参数,采用 Apache 2.0 许可,面向本地智能体场景,可用于编码、文档分析和个人助手。
推荐理由:Meta 开源 30B 多模态模型并给出本地智能体部署路径,读者可据此判断本地化方案是否可行。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报的领先幅度和开源范围,读者可据此判断气象预报的可用性变化。
OpenAI 在 ChatGPT 中推出改进版 GPT-5.6 Sol,准确性和一致性有所提升。同时,免费用户获得 GPT-5.6 Luna 的更大访问权限,可进行不限量的日常对话。
推荐理由:OpenAI 在 ChatGPT 中改进 GPT-5.6 Sol 并扩大 GPT-5.6 Luna 的免费用户访问,读者可据此了解可用范围变化。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言策略提问并输出校准后的安全分数,无需重新训练即可适配新策略,统一处理文本与图像。
推荐理由:3B 开源安全分类器把内容审核变成可推理时替换策略的问答任务,读者可据此判断小模型在审核场景的可用边界。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断机器人大脑的落地边界。
OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的价格,并说明更高效的模型如何帮助企业规模化部署 AI 工作流。
推荐理由:OpenAI 下调 GPT-5.6 在 Luna 与 Terra 上的价格,读者可据此评估企业级 AI 工作流的部署成本变化。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词和人声质量上均有提升:可生成更丰富复杂的旋律结构,歌词的提示词遵循度和结构感知更好,人声更具表现力与情感细节、发音也更准确。用户还能更便捷地控制输出的节奏和时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:官方给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与多机协作的落地路径。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 系列的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比数据与受限开放方式,可据此判断专用小模型在代码安全场景的定位。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:原文给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的能力边界。
OpenAI 发布新一代语音模型 GPT-Live,用于更自然的人机交互,目前已接入 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型并接入 ChatGPT Voice,读者可据此了解语音交互能力的代际更新。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的形式化验证模型,119B 总参数、6B 激活参数,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。
推荐理由:原文给出模型规模、基准成绩与每道题成本对比,读者可据此判断形式化验证的实用门槛。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价和可用入口,读者可据此判断图像与视频生成链路的成本与选型。