跳到正文

#Agent

今日 3 条
5月6日周三
5月5日周二
4月30日周四
4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni:面向文档、音频与视频智能体的长上下文全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款覆盖文本、图像、视频与音频的全模态理解模型,基于 Nemotron 3 Nano 30B-A3B 骨干,搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月27日周一
  1. Mistral AI75

    Mistral AI 发布 Workflows 公开预览版

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,基于 Temporal 持久执行引擎,提供持久化执行、可观测性和人工介入审批能力。

    推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。

4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

4月23日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.5

    OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等跨工具复杂任务打造的模型。

    推荐理由:OpenAI 官方发布 GPT-5.5,面向编码、研究与数据分析等跨工具复杂任务,可据此了解其定位。

  2. Hugging Face Blog62

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并以官方发布的 Gemma 4 浏览器助手扩展为参照。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本分工的架构取舍。

4月22日周三
  1. OpenAI News62

    OpenAI 在 ChatGPT 中推出工作区智能体

    OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行。官方称其能帮助团队跨工具安全地扩展工作。

    推荐理由:官方给出 ChatGPT 工作区智能体的定位与云端运行方式,可据此判断团队自动化流程的形态。

4月21日周二
4月16日周四
  1. Hugging Face Blog33

    Ecom-RLVE:面向电商对话智能体的自适应可验证环境

    Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。

4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准

    Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。

  2. Hugging Face Blog62

    HCompany 发布 HoloTab:浏览器里的 AI 操作助手

    HCompany 发布 Chrome 扩展 HoloTab,把其 3 月 31 日推出的计算机操作模型 Holo3 直接接入浏览器,用户描述需求后由智能体在网页内导航界面、填写字段并做决策,无需配置或技术背景。HoloTab 支持例程功能:开始录制后实时捕捉用户在标签页中的点击与口述,录制结束即生成可重复运行或定时调度的例程。该扩展目前免费开放使用。

    推荐理由:HCompany 把自家 Holo3 计算机操作模型封装成浏览器扩展,读者可了解录制即生成例程的交互方式。

4月14日周二
4月13日周一
4月9日周四
4月8日周三
4月3日周五
4月1日周三
3月31日周二
  1. Mistral AI40

    Mistral AI 推出 Spaces:一款为人类和 AI 智能体打造的 CLI

    Mistral AI 发布 Spaces CLI,同时面向人类开发者和编码智能体。该工具通过 `spaces init`、`spaces dev` 等命令,三条命令即可从零搭建带热重载、数据库和 Dockerfile 的多服务项目。每个交互式提示都有对应的 flag 等价物,并在每次 init 时生成 context.json 和 AGENTS.md,让智能体无需人工干预即可自主完成配置与部署。

3月29日周日
  1. Google DeepMind52

    Google DeepMind 为 AI 时代重新设计鼠标指针

    Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可通过指向和语音在 Google AI Studio 中编辑图片或查找地点。该指针已开始集成到 Chrome,用户可用指针选中网页内容让 Gemini 处理,Googlebook 也将推出 Magic Pointer。研究团队称这些原则旨在把传达上下文和意图的工作从用户转移到计算机。

3月26日周四
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。

    推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者与普通用户的使用入口。

  2. Google DeepMind60

    Google DeepMind 发布 AI 有害操纵测量工具包与万人实验结果

    Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。

3月25日周三
3月24日周二
3月18日周三