跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 161–180 条 · 共 196 条
5月23日周五
5月21日周三
  1. Mistral AI76

    Mistral AI 发布编码智能体模型 Devstral,Apache 2.0 开源

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Mistral 与 All Hands AI 联合发布开源编码智能体模型,给出 SWE-Bench Verified 分数与本地部署门槛,便于判断其可用性。

5月16日周五
  1. OpenAI News62

    OpenAI 发布 o3 与 o4-mini 系统卡补充说明:Codex

    OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。

    推荐理由:系统卡补充说明披露了 Codex 背后的 codex-1 训练方式,可了解编码智能体的工程取向。

4月25日周五
4月16日周三
  1. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 和 o4-mini 系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。

    推荐理由:官方系统卡披露 o3 与 o4-mini 的推理与工具调用组合,可据此了解新模型的能力边界。

  2. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 推理模型

    OpenAI 发布 o3 和 o4-mini 两款模型,称其为目前最智能、能力最强的模型,并具备完整的工具调用能力。

    推荐理由:OpenAI 发布 o3 与 o4-mini 两款推理模型,并首次给出完整工具调用能力,读者可据此了解其推理产品线的最新分层。

2月25日周二
  1. OpenAI News60

    OpenAI 发布 deep research 系统卡

    OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、依据 Preparedness Framework 进行的前沿风险评测,以及针对关键风险领域构建的缓解措施概览。

    推荐理由:OpenAI 公开 deep research 发布前的安全评估流程,可了解其外部红队与 Preparedness Framework 风险评测的做法。

2月7日周五
2月4日周二
2月3日周一
  1. OpenAI News75

    OpenAI 发布 deep research 智能体

    OpenAI 发布 deep research 智能体,可利用推理综合大量在线信息并完成多步研究任务。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:OpenAI 官方发布 deep research 智能体,读者可了解其多步研究能力与分阶段开放节奏。

1月24日周五
  1. Hugging Face Blog62

    smolagents 新增视觉语言模型支持

    Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图片既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 在每步把截图写入 ActionStep 的 observation_images。

    推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,读者可据此判断浏览器类智能体的实现方式。

1月23日周四
  1. OpenAI News62

    OpenAI 发布 Operator 系统卡

    OpenAI 发布 Operator 系统卡,说明其基于既有安全框架采用多层防护方案。文档涵盖针对提示词工程与越狱的模型和产品缓解措施、隐私与安全保护,并披露外部红队测试、安全评估以及持续完善这些防护的后续工作。

    推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示词攻击、隐私与红队测试上的多层防护设计。

12月31日周二
11月18日周一
  1. Mistral AI72

    Mistral AI 为 le Chat 加入联网搜索、Canvas 与图像生成等测试功能

    Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 功能:带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词并分享给同事的智能体。

    推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与智能体,并给出与主流助手的逐项对比。

7月23日周二
  1. Hugging Face Blog88

    Llama 3.1 发布:405B、70B 与 8B,支持多语言和长上下文

    Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。

    推荐理由:Hugging Face 官方给出 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,便于评估部署成本。

7月1日周一
  1. Hugging Face Blog62

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用基于 transformers.agents 构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:Hugging Face 公开了用 Code Agent 登顶 GAIA 的完整实现细节,包括工具设计、安全解释器与规划策略,可迁移到自建智能体系统。

2月26日周一
  1. Mistral AI80

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 使用,并首次通过 Azure 分发。官方称其在常用基准上表现强劲,是继 GPT-4 之后第二个可通过 API 获得的顶级模型,具备 32K token 上下文窗口、原生函数调用与 JSON 格式输出,原生支持英语、法语、西班牙语、德语和意大利语。

    推荐理由:官方给出 Mistral Large 的基准对比、32K 上下文与函数调用能力,可据此判断其与 GPT-4 的定位差异。

  2. Mistral AI62

    Mistral AI 发布对话助手 Le Chat 及企业版

    Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 Le Chat Enterprise,支持自部署和细粒度审核机制。Le Chat 目前无法访问互联网,可能给出不准确或过时的信息,现以 beta 形式开放注册。

    推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,读者可了解其模型接入方式与自部署能力。

2月13日周二