Hugging Face Blog·· 2026-06-18精选AI 评分62
Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力
Is it agentic enough? Benchmarking open models on your own tooling
AI 导读
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在 bare、clone、skill 三种层级下测量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。
推荐理由
Hugging Face 用自建 harness 实测 transformers 的 CLI 与 Skill 改动,发现同一改动对大模型提速、对小模型反而拖慢甚至破坏正确率。
来源:Hugging Face Blog · huggingface.co