跳到正文

#Agent

今日 3 条
1月27日周二
1月23日周五
1月22日周四
1月21日周三
1月20日周二
  1. Hugging Face Blog74

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布 Waypoint-1,一个可通过文本、鼠标和键盘实时控制的交互式视频扩散模型,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。

    推荐理由:Waypoint-1 把实时交互视频扩散模型与配套推理库一并开源,读者可据此了解世界模型从预训练到低延迟部署的完整路径。

1月15日周四
  1. Hugging Face Blog62

    Open Responses 开放推理标准发布:基于 Responses API 面向智能体

    OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API,面向智能体场景设计。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 试用早期访问版本。

    推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解 Responses API 开源化后的关键变化与迁移路径。

1月8日周四
1月5日周一
12月24日周三
12月23日周二
12月22日周一
  1. OpenAI News60

    OpenAI 持续加固 ChatGPT Atlas 抵御提示词注入

    OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环能更早识别新型攻击手法,在 AI 智能体能力增强的同时强化浏览器智能体的防御。

    推荐理由:OpenAI 披露用强化学习训练的自动化红队持续发现并修补 Atlas 的提示词注入漏洞,可了解浏览器智能体的安全加固思路。

12月17日周三
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Flash

    Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。

    推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。

  2. OpenAI News62

    OpenAI 开放开发者向 ChatGPT 提交应用

    OpenAI 宣布开发者可向 ChatGPT 提交应用,经审核通过后会在产品内新设的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,帮助开发者构建把真实操作带入 ChatGPT 的聊天原生体验。

    推荐理由:OpenAI 开放 ChatGPT 应用提交与目录入口,开发者可据此判断接入路径和审核门槛。

12月16日周二
12月13日周六
12月12日周五
12月11日周四
  1. Hugging Face Blog62

    Hugging Face 教程:用 Codex 与 HF Skills 端到端微调开源模型

    Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端机器学习实验,包括数据集校验、硬件选择、提交训练任务、监控进度、评测与导出 GGUF。

    推荐理由:原文给出 Codex 结合 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。

  2. OpenAI News82

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型可在 ChatGPT 和 OpenAI API 中使用,用于支撑更快、更可靠的智能体工作流。

    推荐理由:OpenAI 官方发布 GPT-5.2,给出推理、长上下文、编码与视觉的能力定位及 ChatGPT 和 API 两个入口。

12月9日周二
  1. Mistral AI82

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。

12月4日周四
11月25日周二
  1. Hugging Face Blog40

    Tavily 如何打造达到 SOTA 的深度研究智能体

    Tavily 分享了其构建 SOTA 深度研究智能体的经验,曾因第一版架构假设过时被迫推倒重建。其核心思路是简化编排逻辑、拥抱模型自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终结果时引入原始信息,以模拟人类研究方式。

11月24日周一
  1. Google DeepMind62

    Google DeepMind 支持美国能源部 Genesis 计划,向 17 个国家实验室开放 AI 科研工具

    Google DeepMind 宣布支持美国白宫 Genesis Mission,并与美国能源部合作,向全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。

    推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作,给出了 AI for Science 从模型到落地路径的具体样本。

11月19日周三
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Pro 并推出 Antigravity 开发平台

    Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在编码、智能体工作流和复杂零样本任务上超过 2.5 Pro,已在 Google AI Studio 和 Vertex AI 以预览形式开放,200k token 以内输入每百万 token 收费 2 美元、输出 12 美元。

    推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,便于判断它在智能体编码工作流中的位置。

  2. Google DeepMind82

    Google 发布智能体开发平台 Antigravity

    Google 发布智能体开发平台 Antigravity,即日起公开预览且免费,支持 macOS、Linux 和 Windows。它保留 AI 驱动的 IDE 编辑器视图,同时新增面向智能体的 Manager 界面,可并行编排多个工作区中的智能体,并通过任务列表、实现方案、截图和浏览器录制等 Artifacts 呈现工作过程。

    推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。

11月13日周四
11月7日周五
10月30日周四
  1. Hugging Face Blog38

    MiniMax M2 如何重新思考智能体泛化:对齐基准还是对齐用户?

    MiniMax M2 在智能体后训练中提出"交错思考"(Interleaved Thinking),让模型在任务任意阶段都能思考,以应对工具输出带来的外部扰动。团队发现单纯扩展工具数量无法带来真正泛化,转而构建覆盖工具信息、系统提示词、用户提示词、环境与工具响应全轨迹的数据管线。内部测试中,M2 在陌生"冷启动"框架下工具调用与指令遵循表现均超出预期。

10月28日周二
10月24日周五
  1. Mistral AI62

    Mistral AI 发布 AI Studio 生产平台

    Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

    推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,读者可据此判断生产级 AI 基础设施的构成。

10月23日周四
  1. OpenAI News62

    OpenAI 收购 Sky 开发商 Software Applications Incorporated

    OpenAI 宣布收购 Software Applications Incorporated,该公司是 Mac 自然语言界面 Sky 的开发者。OpenAI 表示将把 Sky 的 macOS 深度能力整合进 ChatGPT,让 AI 更直观、更具上下文感知并能执行操作。

    推荐理由:OpenAI 收购 Sky 团队,读者可了解其把 macOS 深度能力并入 ChatGPT 的桌面入口布局。

  2. Google Research62

    Google Earth AI 发布新影像与人口基础模型及地理空间推理智能体

    Google 发布 Earth AI 新进展,包括新的影像与人口基础模型,以及由 Gemini 驱动的地理空间推理智能体,并给出技术细节与评测。影像模型支持自然语言查询和开放词汇目标检测,在文本图像搜索任务上平均提升超过 16%,零样本新目标检测准确率翻倍以上。

    推荐理由:Google 公布 Earth AI 新基础模型与地理空间推理智能体的评测数据,可了解多模型协同在灾害预测中的实际增益。

  3. Hugging Face Blog65

    Meta 与 Hugging Face 联合推出 OpenEnv Hub,并发布 OpenEnv 0.1 规范草案

    Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区 Hub,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。

    推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并公开 0.1 规范草案,读者可了解开放智能体生态的协作方式。