Google DeepMind 发布 Gemini 3 Flash
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
OpenAI 宣布开发者可向 ChatGPT 提交应用,经审核通过后会在产品内新设的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,帮助开发者构建把真实操作带入 ChatGPT 的聊天原生体验。
推荐理由:OpenAI 开放 ChatGPT 应用提交与目录入口,开发者可据此判断接入路径和审核门槛。
CUGA(Configurable Generalist Agent)在 Hugging Face Spaces 上线演示,这是一个 Apache 2.0 开源的可配置通用 AI 智能体,支持跨 Web 与 API 的多步任务。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和可配置推理模式,为评估通用智能体框架提供了具体参照。
Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,提升了复杂工作流处理、指令遵循和多轮对话能力。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,便于判断语音智能体的可用性变化。
BNY 利用 OpenAI 在全企业范围扩大 AI 应用,通过 Eliza 平台让 20,000 多名员工构建 AI 智能体,以提升效率和客户成果。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端机器学习实验,包括数据集校验、硬件选择、提交训练任务、监控进度、评测与导出 GGUF。
推荐理由:原文给出 Codex 结合 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。
Intel AI Software Group 发布 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的轻量级数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱执行,将输出长度最多缩短 66%,同时在 MATH500、AIME、HMMT、HLE 等基准上提升准确率。
Hugging Face 推出 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交微调任务到云端 GPU、监控进度并把模型推送到 Hub。
推荐理由:Hugging Face 把微调流程封装成 Claude Code 可调用的 Skill,读者可据此了解对话式训练的实际操作与成本。
Tavily 分享了其构建 SOTA 深度研究智能体的经验,曾因第一版架构假设过时被迫推倒重建。其核心思路是简化编排逻辑、拥抱模型自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终结果时引入原始信息,以模拟人类研究方式。
Google DeepMind 宣布支持美国白宫 Genesis Mission,并与美国能源部合作,向全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作,给出了 AI for Science 从模型到落地路径的具体样本。
Google 发布智能体开发平台 Antigravity,即日起公开预览且免费,支持 macOS、Linux 和 Windows。它保留 AI 驱动的 IDE 编辑器视图,同时新增面向智能体的 Manager 界面,可并行编排多个工作区中的智能体,并通过任务列表、实现方案、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并给出自我改进循环与在 Genie 3 生成世界中的泛化表现。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划三项创新,在 DABStep、KramaBench、DA-Code 上均超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 至 44.7%、37.0% 至 38.5%,并登顶 DABStep 公开榜单。
MiniMax M2 在智能体后训练中提出"交错思考"(Interleaved Thinking),让模型在任务任意阶段都能思考,以应对工具输出带来的外部扰动。团队发现单纯扩展工具数量无法带来真正泛化,转而构建覆盖工具信息、系统提示词、用户提示词、环境与工具响应全轨迹的数据管线。内部测试中,M2 在陌生"冷启动"框架下工具调用与指令遵循表现均超出预期。
Google Research 在 UIST'25 发布 StreetReaderAI,一款面向盲人和低视力用户的可访问街景原型,基于 Gemini 提供 AI Describer 实时场景描述与 AI Chat 对话问答,支持键盘和语音导航。
Google 基于 Gemini 模型构建个人健康教练,明日起面向美国 Fitbit Premium Android 用户推出可选公开预览,随后扩展至 iOS。
推荐理由:Google 公开了健康教练的技术路径与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,读者可据此判断生产级 AI 基础设施的构成。
Google 发布 Earth AI 新进展,包括新的影像与人口基础模型,以及由 Gemini 驱动的地理空间推理智能体,并给出技术细节与评测。影像模型支持自然语言查询和开放词汇目标检测,在文本图像搜索任务上平均提升超过 16%,零样本新目标检测准确率翻倍以上。
推荐理由:Google 公布 Earth AI 新基础模型与地理空间推理智能体的评测数据,可了解多模型协同在灾害预测中的实际增益。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区 Hub,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并公开 0.1 规范草案,读者可了解开放智能体生态的协作方式。
OpenAI Codex 现已正式可用(generally available),面向开发者新增多项功能:Slack 集成、Codex SDK,以及用量看板和工作区管理等管理工具。官方称这些更新让 Codex 更易使用,也更容易在规模化场景下管理。
推荐理由:Codex 从预览转为正式可用,并给出 Slack 集成、SDK 与管理工具,读者可据此判断团队规模化使用的门槛变化。
OpenAI 在 ChatGPT 内推出新一代可直接对话的应用,开发者即日起可用预览版 Apps SDK 开始构建。
推荐理由:OpenAI 在 ChatGPT 内引入可对话应用并开放 Apps SDK 预览,读者可据此了解其应用生态的开放入口。
OpenAI 发布 AgentKit、扩展后的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这三项工具面向智能体开发流程,但未在摘要中给出具体功能细节。
推荐理由:OpenAI 面向智能体开发一次性放出三件套,读者可据此判断从原型到生产的工具链补齐了哪些环节。
OpenAI 构建了一套合同数据提取系统,用于加快处理速度、缩短周转时间,并让团队更便捷地获取所需细节。该系统将合同转化为可搜索的数据。
OpenAI 使用内部 AI 销售助手对入站线索进行资格筛选、个性化回复,并帮助销售团队转化客户兴趣。该助手用于将客户兴趣转化为实际客户。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 为草稿模型做投机解码,生成速度提升约 1.3 倍。
OpenAI 在 ChatGPT 中推出 Instant Checkout 和 Agentic Commerce Protocol,让用户、AI 智能体和商家可以在 ChatGPT 内一起完成购物。OpenAI 称这是其在 ChatGPT 中推进智能体商务的第一步。
推荐理由:OpenAI 在 ChatGPT 内推出即时结账与智能体商务协议,读者可了解对话式购物的入口形态。
针对 vibe coding 游戏随项目增长而失控的问题,作者推出 VibeGame——一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
OpenAI 发布 ChatGPT Pulse 预览版,面向移动端 Pro 用户开放。Pulse 是一种新体验,ChatGPT 会主动做研究,基于用户的聊天、反馈以及日历等已连接应用,推送个性化更新。
推荐理由:ChatGPT 主动做研究并推送个性化更新,读者可据此判断助手从被动应答转向主动服务的形态变化。
Hugging Face 发布 Smol2Operator,用两阶段训练把无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 变成能理解并操作图形界面的智能体。
Meta 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可自定义场景并导出完整 trace,便于复现与调试。
OpenAI 宣布升级 Codex,使其更快、更可靠,并增强实时协作与独立处理任务的能力。升级后的 Codex 可在终端、IDE、网页乃至手机上使用。
推荐理由:官方给出 Codex 在速度、可靠性与实时协作上的升级方向,读者可据此判断多端编码工作流的变化。
OpenAI 发布 GPT-5 系统卡增补,公开新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。
Hugging Face 发布 Jupyter Agent 项目,通过清洗约 2TB Kaggle notebook 构建 51k 合成 notebook、近 0.2B token 的数据集,并用 TRL 全参数微调 Qwen3-4B。
推荐理由:完整披露了从 Kaggle notebook 清洗到 SFT 的数据管线与消融结果,可迁移到其他小模型智能体训练。
Mistral AI 为 Le Chat 上线 Memories(beta),可自动保存有用信息,但回忆过程始终可见并附来源链接。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入。同步推出 Memory Insights,用轻量提示帮用户查看 Le Chat 记住了什么。
Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与支付等类别,可连接 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并支持添加自定义 MCP 连接器。
推荐理由:官方给出连接器目录、自定义 MCP 接入与 Memories 的边界,可据此判断企业工作流能落到哪些工具上。
Basis 基于 OpenAI o3、o3-Pro、GPT-4.1 和 GPT-5 构建的 AI 智能体,可帮助会计事务所节省最多 30% 的时间,并扩展咨询与增长业务的产能。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏,评测 LLM 作为自主智能体的长上下文推理与探索学习能力。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
NVIDIA 的 AI-Q Blueprint 在 DeepResearch Bench 的 Hugging Face "LLM with Search" 榜单上以 40.52 分登顶,成为排名最高的全开源许可方案。