跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 61–80 条 · 共 174 条
6月18日周四
  1. Hugging Face Blog62

    Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在 bare、clone、skill 三种层级下测量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。

    推荐理由:Hugging Face 用自建 harness 实测 transformers 的 CLI 与 Skill 改动,发现同一改动对大模型提速、对小模型反而拖慢甚至破坏正确率。

6月17日周三
  1. Hugging Face Blog88

    GLM-5.2 发布:面向长周期任务,支持 1M token 上下文

    智谱发布旗舰模型 GLM-5.2,主打长周期任务能力,首次在 1M token 上下文上稳定支撑长程工作,并采用 MIT 开源许可。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,MTP 层改进使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文落到长周期编码任务上,并给出与闭源前沿模型的逐项对比,可据此判断开源模型在长程工程任务中的位置。

  2. Google DeepMind60

    Google DeepMind 与英国政府共建 AI 规划原型,目标将审批时间减半

    Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发一款基于 Gemini 的 AI 规划原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。

    推荐理由:原文给出英国规划审批原型的目标、试点范围与上线时间,读者可据此判断 AI 介入公共服务的落地路径。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 与智能体安全技术框架

    Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。

    推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。

6月11日周四
6月9日周二
6月8日周一
  1. Hugging Face Blog66

    OpenEnv 转为委员会共管,成为智能体 RL 的开源环境协议层

    Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。

    推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此判断开源智能体 RL 环境标准化的走向。

6月5日周五
6月4日周四
  1. Hugging Face Blog62

    Hugging Face 将 hf CLI 重构为面向智能体优化的 Hub 操作方式

    Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和 Claude Code、Codex、Cursor 等编码智能体。CLI 通过环境变量自动识别智能体并切换输出格式,在复杂多步任务上,用 curl 或 Python SDK 的基线消耗的 token 最多是 hf CLI 的 6 倍。官方还提供可安装的 hf-cli skill,让智能体减少约 30% 的工具调用。

    推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断智能体操作 Hub 的 token 成本差异。

6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。

    推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。

6月1日周一
  1. Hugging Face Blog62

    JetBrains 发布 Mellum2:12B 参数 MoE 模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。

    推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。

5月28日周四
  1. Mistral AI72

    Mistral 发布工业工程 AI 栈,Vibe 升级为长任务智能体

    Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。其智能体工具 Vibe 升级为统一智能体,可处理收件箱与日历、深度研究、交付物撰写,并完成从需求到合并变更的编码工作。位于法国 Les Ulis 的 10 MW 推理数据中心计划于 2026 年 Q3 开放。

    推荐理由:Mistral 一次性公布工业 AI 栈、Vibe 智能体与自建数据中心,可据此观察其企业级全栈布局。

5月22日周五
5月20日周三
5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 接地能力,可基于美国真实地点影像生成可交互世界,并支持沙漠、海洋世界、黑白电影等风格。

    推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。