跳到正文

#Agent

今日 12 条
2月7日周五
2月4日周二
  1. Hugging Face Blog38

    Adyen 与 Hugging Face 发布 DABstep:多步推理数据智能体基准

    Adyen 与 Hugging Face 联合发布 DABstep,一个面向多步推理的数据智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。最强推理型智能体在该基准上仅取得 16% 准确率,凸显当前模型在复杂数据分析上的差距。任务结合结构化与非结构化数据,采用二元事实性评测,仅需代码执行环境即可运行并提交排行榜。

2月3日周一
  1. OpenAI News75

    OpenAI 发布 deep research 智能体

    OpenAI 发布 deep research 智能体,可利用推理综合大量在线信息并完成多步研究任务。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:OpenAI 官方发布 deep research 智能体,读者可了解其多步研究能力与分阶段开放节奏。

1月24日周五
  1. Hugging Face Blog62

    smolagents 新增视觉语言模型支持

    Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图片既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 在每步把截图写入 ActionStep 的 observation_images。

    推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,读者可据此判断浏览器类智能体的实现方式。

1月23日周四
  1. OpenAI News62

    OpenAI 发布 Operator 系统卡

    OpenAI 发布 Operator 系统卡,说明其基于既有安全框架采用多层防护方案。文档涵盖针对提示词工程与越狱的模型和产品缓解措施、隐私与安全保护,并披露外部红队测试、安全评估以及持续完善这些防护的后续工作。

    推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示词攻击、隐私与红队测试上的多层防护设计。

1月13日周一
  1. Hugging Face Blog22

    Hugging Face 发文《AI Agents Are Here. What Now?》:建议不要开发完全自主的 AI 智能体

    Hugging Face 发布文章《AI Agents Are Here. What Now?》,指出 AI 智能体基于 LLM 构建,能自主拆解目标并执行子任务,其自主性可按从"模型不影响程序流程"到"模型自行编写并执行代码"分为多个等级。文章认为系统自主性越高、用户让渡的控制权越多,安全、隐私等风险越大,因此建议不要开发完全自主的 AI 智能体,而半自主智能体在风险与收益之间可能更可取。

12月31日周二
12月5日周四
  1. Hugging Face Blog22

    LLM 修复自身错误的能力如何?基于 Keras 和 TPU 的聊天机器人竞技场实验

    Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。

11月19日周二
11月18日周一
  1. Mistral AI72

    Mistral AI 为 le Chat 加入联网搜索、Canvas 与图像生成等测试功能

    Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 功能:带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词并分享给同事的智能体。

    推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与智能体,并给出与主流助手的逐项对比。

10月10日周四
10月1日周二
8月7日周三
7月23日周二
  1. Hugging Face Blog88

    Llama 3.1 发布:405B、70B 与 8B,支持多语言和长上下文

    Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。

    推荐理由:Hugging Face 官方给出 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,便于评估部署成本。

7月1日周一
  1. Hugging Face Blog62

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用基于 transformers.agents 构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:Hugging Face 公开了用 Code Agent 登顶 GAIA 的完整实现细节,包括工具设计、安全解释器与规划策略,可迁移到自建智能体系统。

6月5日周三
5月29日周三
4月22日周一
4月5日周五
3月21日周四
2月26日周一
  1. Mistral AI80

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 使用,并首次通过 Azure 分发。官方称其在常用基准上表现强劲,是继 GPT-4 之后第二个可通过 API 获得的顶级模型,具备 32K token 上下文窗口、原生函数调用与 JSON 格式输出,原生支持英语、法语、西班牙语、德语和意大利语。

    推荐理由:官方给出 Mistral Large 的基准对比、32K 上下文与函数调用能力,可据此判断其与 GPT-4 的定位差异。

  2. Mistral AI62

    Mistral AI 发布对话助手 Le Chat 及企业版

    Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 Le Chat Enterprise,支持自部署和细粒度审核机制。Le Chat 目前无法访问互联网,可能给出不准确或过时的信息,现以 beta 形式开放注册。

    推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,读者可了解其模型接入方式与自部署能力。

2月13日周二
2月8日周四
1月24日周三
12月11日周一
11月6日周一
  1. OpenAI News85

    OpenAI 发布 GPTs,可创建自定义版 ChatGPT

    OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。该功能由 OpenAI 官方推出,具体开放范围与使用细节原文未进一步说明。

    推荐理由:OpenAI 官方发布 GPTs,读者可了解自定义 ChatGPT 的构成方式与开放范围。

7月24日周一
5月9日周二
  1. Hugging Face Blog62

    用 StarCoder 打造编码助手 StarChat

    Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder 模型,用 OpenAssistant 对话数据集微调出编码助手 StarChat,并公开了代码、数据集与模型。

    推荐理由:原文完整给出了用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。

3月23日周四
  1. OpenAI News82

    OpenAI 为 ChatGPT 推出插件支持

    OpenAI 宣布为 ChatGPT 实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。

    推荐理由:OpenAI 官方给出 ChatGPT 插件的最初支持范围,读者可据此了解模型接入外部工具与实时信息的早期形态。

2月7日周二
1月24日周二
6月23日周四
  1. OpenAI News74

    OpenAI 用视频预训练让神经网络学会玩 Minecraft

    OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型直接使用键盘按键和鼠标移动这类原生人类交互接口,具有较强通用性,是迈向通用计算机使用智能体的一步。

    推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练在通用计算机智能体上的早期尝试。

3月28日周一
12月2日周四
12月13日周五
11月21日周四