CUGA 上线 Hugging Face Spaces:可配置通用 AI 智能体开源发布
CUGA(Configurable Generalist Agent)在 Hugging Face Spaces 上线演示,这是一个 Apache 2.0 开源的可配置通用 AI 智能体,支持跨 Web 与 API 的多步任务。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和可配置推理模式,为评估通用智能体框架提供了具体参照。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
CUGA(Configurable Generalist Agent)在 Hugging Face Spaces 上线演示,这是一个 Apache 2.0 开源的可配置通用 AI 智能体,支持跨 Web 与 API 的多步任务。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和可配置推理模式,为评估通用智能体框架提供了具体参照。
Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,提升了复杂工作流处理、指令遵循和多轮对话能力。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,便于判断语音智能体的可用性变化。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端机器学习实验,包括数据集校验、硬件选择、提交训练任务、监控进度、评测与导出 GGUF。
推荐理由:原文给出 Codex 结合 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。
Hugging Face 推出 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交微调任务到云端 GPU、监控进度并把模型推送到 Hub。
推荐理由:Hugging Face 把微调流程封装成 Claude Code 可调用的 Skill,读者可据此了解对话式训练的实际操作与成本。
Google DeepMind 宣布支持美国白宫 Genesis Mission,并与美国能源部合作,向全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作,给出了 AI for Science 从模型到落地路径的具体样本。
Google 发布智能体开发平台 Antigravity,即日起公开预览且免费,支持 macOS、Linux 和 Windows。它保留 AI 驱动的 IDE 编辑器视图,同时新增面向智能体的 Manager 界面,可并行编排多个工作区中的智能体,并通过任务列表、实现方案、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并给出自我改进循环与在 Genie 3 生成世界中的泛化表现。
Google 基于 Gemini 模型构建个人健康教练,明日起面向美国 Fitbit Premium Android 用户推出可选公开预览,随后扩展至 iOS。
推荐理由:Google 公开了健康教练的技术路径与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,读者可据此判断生产级 AI 基础设施的构成。
Google 发布 Earth AI 新进展,包括新的影像与人口基础模型,以及由 Gemini 驱动的地理空间推理智能体,并给出技术细节与评测。影像模型支持自然语言查询和开放词汇目标检测,在文本图像搜索任务上平均提升超过 16%,零样本新目标检测准确率翻倍以上。
推荐理由:Google 公布 Earth AI 新基础模型与地理空间推理智能体的评测数据,可了解多模型协同在灾害预测中的实际增益。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区 Hub,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并公开 0.1 规范草案,读者可了解开放智能体生态的协作方式。
Meta 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可自定义场景并导出完整 trace,便于复现与调试。
Hugging Face 发布 Jupyter Agent 项目,通过清洗约 2TB Kaggle notebook 构建 51k 合成 notebook、近 0.2B token 的数据集,并用 TRL 全参数微调 Qwen3-4B。
推荐理由:完整披露了从 Kaggle notebook 清洗到 SFT 的数据管线与消融结果,可迁移到其他小模型智能体训练。
Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与支付等类别,可连接 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并支持添加自定义 MCP 连接器。
推荐理由:官方给出连接器目录、自定义 MCP 接入与 Memories 的边界,可据此判断企业工作流能落到哪些工具上。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比此前版本补全采纳率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线走向。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Hugging Face 发布 Python 库 ScreenEnv,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 智能体(Computer Use 智能体)。
推荐理由:Hugging Face 开源 ScreenEnv,给出 Docker 沙箱与 MCP 两种接入方式,可据此判断桌面智能体的部署路径。